Confoundle · a reasoning trap

El sesgo de espectro

La fiabilidad de un test suena a dato sobre el test, como la velocidad máxima de un coche. No lo es. Un test que detecta el 92 % de las infecciones en personas que están claramente enfermas puede detectar apenas la mitad en personas que solo están un poco enfermas, porque hay menos que encontrar. Siempre que te digan que un test es fiable al 95 %, la pregunta de verdad es en quién se midió eso y si esas personas se parecen en algo a ti.

The rule

La fiabilidad de un test no es fija. Cambia con lo avanzada, lo típica y lo evidente que sea la enfermedad en los pacientes a los que se les hace la prueba.

What it looks like

Este test de orina detecta el 92 % de las infecciones. Los síntomas de tu paciente son vagos. ¿Cómo de bueno es ahora?Una tira reactiva para la infección urinaria, comprobada frente a urocultivos en un servicio de urgencias y en un centro de atención sin cita. Entre los pacientes cuyo médico ya creía probable una infección, detectó 49 de las 53 que había realmente. La sensibilidad se suele citar como un único número, como si fuera una propiedad fija del test.
Apenas la mitad. Y la otra columna se mueve en sentido contrario.Los pacientes de los que su médico ya sospechaba tenían infecciones floridas, del tipo que una tira reactiva detecta con facilidad. Los pacientes en los que se creía improbable la infección tenían infecciones leves o incipientes, y al test se le escaparon la mayoría. Fíjate ahora en el segundo panel, el de los pacientes que no tenían ninguna infección: ahí el test acertó el 42 % de las veces en el primer grupo y el 78 % en el segundo. La sensibilidad y la especificidad no son propiedades de un test. Son propiedades de un test que se encuentra con una mezcla concreta de personas:

Why it works

La sensibilidad es la proporción de personas realmente enfermas que un test detecta, y la especificidad es la proporción de personas sanas a las que descarta correctamente. Las dos se citan como si pertenecieran al test, igual que su precio. No es así. Un test capta una señal, y la señal es más fuerte en la enfermedad avanzada que en la incipiente, así que cuanto más graves estén los enfermos a los que haces la prueba, a más de ellos los encontrarás. La misma lógica funciona al revés con las personas que no tienen la enfermedad: cuanto más claramente sanas están, más fácilmente las descarta el test. Por eso un test evaluado con casos evidentes frente a no casos evidentes puede parecer magnífico y luego decepcionar en una consulta real, donde casi todo el mundo está en algún punto intermedio. De ahí salen dos hábitos prácticos. Lee la descripción de a quién se reclutó antes de leer las cifras de fiabilidad. Y desconfía sobre todo de un estudio cuyos grupos de enfermos y de sanos se eligieron por separado en lugar de ser pacientes consecutivos con el mismo motivo de consulta.

Fuente

Lachs MS, Nachamkin I, Edelstein PH, Goldman J, Feinstein AR, Schwartz JS. Spectrum bias in the evaluation of diagnostic tests: lessons from the rapid dipstick test for urinary tract infection. Ann Intern Med. 1992;117(2):135-140. See also the published correction, Ann Intern Med. 1992;117(11):975.

See if it fools you

This page gives the answer away. The puzzle version shows you the same figures first and asks you to commit before the reveal.

Play this one