Confoundle · a reasoning trap

疾病谱偏倚

检测的准确性听上去像是关于这项检测本身的事实,就像一辆车有它的最高时速。其实不是。一项在明显病重的人身上能查出 92% 感染的检测,在只是轻微不适的人身上可能勉强查出一半,因为可供发现的东西更少了。每当有人告诉你某项检测有 95% 的准确率,真正该问的是:这是在谁身上测出来的,那些人和你像不像。

The rule

一项检测的准确性并不是固定的。它会随着受检患者病情的进展程度、典型程度和明显程度而变化。

What it looks like

这项尿液检测能查出 92% 的感染。你的患者症状含糊不清。现在它还有多准?一种用于尿路感染的尿试纸,在一家急诊科和一家免预约门诊里与尿培养结果作了对照。在医生本来就认为很可能有感染的患者中,真正有感染的 53 人里它查出了 49 人。敏感度通常被引用为一个单一的数字,仿佛它是这项检测固定不变的属性。
勉强过半。而另一栏则朝相反的方向翻转。医生本来就怀疑有感染的患者,得的是症状明显的感染,正是尿试纸容易查出的那一类。被认为不太可能有感染的患者,得的是轻微或早期的感染,检测漏掉了其中大部分。再看第二组图,那些完全没有感染的患者:检测在第一组中判断正确的比例是 42%,在第二组中是 78%。敏感度和特异度并不是检测的属性,而是一项检测遇上某一特定人群构成时才呈现出来的属性:

Why it works

敏感度是一项检测能查出的真正患病者的比例,特异度是它能正确排除的健康人的比例。两者常常被说得好像属于这项检测本身,就像它的价格一样。其实并非如此。检测捕捉的是一个信号,而晚期病变的信号比早期病变更强,所以你检测的病人病得越重,被查出来的就越多。对于没有病的人,同样的逻辑反过来成立:他们越是明显健康,检测就越容易把他们排除掉。这就是为什么一项在典型病例与典型非病例之间做评价的检测可以看起来出色至极,到了真实门诊里却令人失望,因为那里几乎每个人都处在两者之间。由此可以养成两个实用习惯。在看准确性数字之前,先读一读研究究竟招募了哪些人。以及,对那种把患病组和健康组分别挑选、而不是连续纳入同一主诉患者的研究,要格外警惕。

来源

Lachs MS, Nachamkin I, Edelstein PH, Goldman J, Feinstein AR, Schwartz JS. Spectrum bias in the evaluation of diagnostic tests: lessons from the rapid dipstick test for urinary tract infection. Ann Intern Med. 1992;117(2):135-140. See also the published correction, Ann Intern Med. 1992;117(11):975.

See if it fools you

This page gives the answer away. The puzzle version shows you the same figures first and asks you to commit before the reveal.

Play this one