Confoundle · a reasoning trap

Le biais de spectre

La fiabilité d'un test sonne comme un fait à propos du test, comme une voiture a une vitesse de pointe. Ce n'en est pas un. Un test qui détecte 92 % des infections chez des gens manifestement malades peut n'en détecter qu'à peine la moitié chez des gens à peine souffrants, parce qu'il y a moins à trouver. Chaque fois qu'on vous dit qu'un test est fiable à 95 %, la vraie question est de savoir sur qui on l'a mesuré, et si ces personnes vous ressemblent un tant soit peu.

The rule

La fiabilité d'un test n'est pas une valeur fixe. Elle varie avec le stade de la maladie, son caractère typique et son évidence chez les patients testés.

What it looks like

Ce test urinaire détecte 92 % des infections. Les symptômes de votre patient sont flous. Que vaut-il maintenant ?Une bandelette urinaire pour repérer une infection, confrontée aux cultures d'urine dans un service d'urgences et dans un centre de consultation sans rendez-vous. Chez les patients dont le médecin jugeait déjà une infection probable, elle a détecté 49 des 53 patients qui en avaient réellement une. La sensibilité est d'ordinaire annoncée sous la forme d'un seul chiffre, comme s'il s'agissait d'une propriété fixe du test.
À peine la moitié. Et l'autre colonne bascule dans l'autre sens.Les patients que leur médecin suspectait déjà avaient des infections franches, celles qu'une bandelette repère facilement. Les patients jugés peu susceptibles d'être infectés en avaient de discrètes ou de débutantes, et le test en a manqué la plupart. Regardez maintenant le second panneau, celui des patients qui n'avaient aucune infection : là, le test a vu juste 42 % du temps dans le premier groupe et 78 % dans le second. La sensibilité et la spécificité ne sont pas des propriétés d'un test. Ce sont les propriétés d'un test confronté à un mélange particulier de personnes :

Why it works

La sensibilité, c'est la part des personnes réellement malades qu'un test détecte, et la spécificité, la part des personnes saines qu'il déclare à juste titre indemnes. Les deux sont annoncées comme si elles appartenaient au test, comme son prix. Ce n'est pas le cas. Un test capte un signal, et ce signal est plus fort dans une maladie avancée que dans une maladie débutante : plus les malades que vous testez sont atteints, plus le test en trouve. La logique inverse vaut pour les personnes indemnes : plus elles sont manifestement en bonne santé, plus le test les déclare facilement indemnes. Voilà pourquoi un test évalué sur des cas évidents face à des non-cas évidents peut paraître superbe, puis décevoir dans une vraie consultation, où presque tout le monde se situe entre les deux. Deux habitudes pratiques en découlent. Lisez la description des personnes recrutées avant de lire les chiffres de fiabilité. Et méfiez-vous surtout d'une étude dont les groupes malades et sains ont été choisis séparément, plutôt que constitués de patients consécutifs venus pour le même motif.

Source

Lachs MS, Nachamkin I, Edelstein PH, Goldman J, Feinstein AR, Schwartz JS. Spectrum bias in the evaluation of diagnostic tests: lessons from the rapid dipstick test for urinary tract infection. Ann Intern Med. 1992;117(2):135-140. See also the published correction, Ann Intern Med. 1992;117(11):975.

See if it fools you

This page gives the answer away. The puzzle version shows you the same figures first and asks you to commit before the reveal.

Play this one