Confoundle · a reasoning trap

适应证混杂

没有人会随机地把药发出去。医生开药,是因为患者身上的某些情况,而这些情况通常本来就会影响患者的结局。于是,服药的人可以比不服药的人死得更多,而药其实什么也没做:它被给了那些本来就更糟的人。对差异做校正是有帮助的,但只限于有人写下来的差异,而开处方的理由很少是其中之一。这正是抛一次硬币如此值钱的原因。

The rule

当由医生来决定谁接受治疗时,接受治疗的人与没接受的人,在数据从未记录下来的方面本来就已经不同,于是治疗替它被开出的理由背了黑锅,或者领了功劳。

What it looks like

服用这种心脏药的患者,比不服用的患者死得更多。是这种药在害死他们吗?6,800 名心力衰竭患者。入组这项试验时,有些人已经在服用地高辛,因为此前有医生决定给他们开这种药;另一些人没有。在随后的几年里,本来就在服药的人有 40% 死亡,其他人是 31%。
同样这 6,800 名患者,按抛硬币分组。没有差别。两组图里是同一批人,只是分组方式不同。按医生此前的决定来分,地高辛看上去是致命的。按试验的随机分配来分,而随机分配不受任何临床判断影响,两组的死亡率完全一样。医生正是在那些本来就更糟的患者身上伸手去用地高辛,所以处方携带了关于患者的信息,而数据集里没有任何东西记录下这些信息:

对 27 项记录在案的基线特征做校正,几乎没有撼动它:多出来的死亡风险只从 36% 降到 22%。而且同样多出来的死亡也出现在被试验随机分到安慰剂的患者身上,这些人在试验期间根本没有服用过地高辛。一种药不可能伤害从未用过它的人,所以这份多出来的死亡从来都不是药造成的。

Why it works

治疗不是随机发放的。医生开药,是因为患者身上的某些情况:病得更重,或者更虚弱,或者症状更糟。而这些情况本来也会影响他们的结局。于是接受治疗的那一组从一开始就与众不同,任何与未治疗组的比较,测到的都是药物和选择用药的理由,两者纠缠在一起。它朝两个方向都会起作用。给病得最重的人用的药看上去有害;给身体最好的人用的药,或者只有健康到能来门诊的患者才拿得到的药,看上去神效非凡。标准的应对办法是对这些差异做校正,这确实有帮助,但只对那些有人想到要记录下来的差异有效。临床医生觉得这个患者正在走下坡路,这是真实的信息,正是它促成了那张处方,而它几乎从不出现在数据集里。这就是随机对照试验值得花那么多钱的全部理由:抛硬币不可能知道患者的任何情况,所以它无法把用药的理由偷偷带进比较之中。当一项试验和一项观察性研究对同一种药得出相反的结论时,原因通常就在这里。

来源

Aguirre Davila L, Weber K, Bavendiek U, et al. Digoxin-mortality: randomized vs. observational comparison in the DIG trial. Eur Heart J. 2019;40(40):3336-3341, and its Supplementary Appendix. Randomised arm sizes and deaths: The Digitalis Investigation Group. The effect of digoxin on mortality and morbidity in patients with heart failure. N Engl J Med. 1997;336(8):525-533, Table 2.

See if it fools you

This page gives the answer away. The puzzle version shows you the same figures first and asks you to commit before the reveal.

Play this one