一条科学标题通常丢给你一个数字和一种情绪。“AI 减少了 23% 的错误。”"疫苗试验失败。"这个数字感觉像一个定论,因此你要么相信它,要么不信。

但一个真实的临床结果从来不是一个单一数字。它是一小捆数字,每一个回答一个不同的问题。学会每个数字在问什么,这一捆就不再是一堵术语墙——它就变成了一句你可以自己读出的简短诚实的句子。

我们将使用一个真实例子,取自我们自己报道的一项在肯尼亚诊所的 AI 工具试验:

调整后比值比为 0.77(95% 置信区间 0.55 到 1.08,P = 0.13)

那一行里隐藏了五样东西。我们将一次拿出一样——然后,同样重要地,把它们放回去。在我们开始前的一个承诺:这里没有单一数字是定论。意义在于它们如何配合。

终点

在任何数字有意义之前,先问:一个关于什么的数字?

一项研究测量和计数的东西就是其终点。其他一切——比值、范围、p 值——都围绕着那个选定的结局。改变终点,每个数字也随之改变。

在 AI 试验中,主要终点是14 天内的治疗失败——在试验开始前决定,由一组不知道哪些患者使用了 AI 的临床医生判定。最后那个细节很重要:一个预先固定并盲法打分的结局,远比一个在结果出来后才挑选的结局更难欺骗自己。

注意当一个研究有超过一个终点时会发生什么。在我们报道的一项诺如病毒疫苗试验中,疫苗同时以两种方式接受测试:它是否阻止了实际疾病(胃肠炎),以及它是否阻止了实验室可检测到的感染?它错过了第一个,击中了第二个。两个结果都是真实的;它们只是回答不同的问题。试验预先选定的主要终点是疾病那一项——因此,诚实地报告,该试验未达到其主要终点,尽管它显然做了些事情。

  • 它意味着什么: 终点是记分板。先读它。
  • 它不意味着什么: 在次要的或事后指标上的一个好结果,不等同于达到预先注册的主要终点。
  • 陷阱: 标题可以引用听起来最好的那个终点。永远问实际测量了什么,以及它是否就是研究人员预先承诺的那个结局。

比值比

比值比 0.77。 比值比是比较两组的一个单一数字。经验法则:

  • 1.0 意味着组间无差异。
  • 低于 1.0 意味着该事件在治疗组中较少发生。
  • 高于 1.0 意味着它更多发生。

因此 0.77 表示 AI 组出现不良结局的比值大约是对照组的四分之三——如果数字是真实的。(把握住那个"如果";接下来的部分就是我们要如何检查它。)

“调整后”——即 aOR 里的a——意味着研究者使用了统计学来解释组间的其他差异,这里是有些诊所从一开始就与其他诊所不同。你会遇到比值比的近亲:风险比 (RR)风险比率 (HR)。它们的计算方式不同,但解读方式相同:1.0 是"无差异"线。

  • 它意味着什么: 两组之间一个紧凑的"多了多少,或少了多少"。
  • 它不意味着什么: 它不告诉你事件有多常见,或多少真实的人受到了影响。比值隐藏了其基线。
  • 陷阱: "比值降低 25%"听起来很戏剧化。它是否重要完全取决于结局一开始有多常见——这正是下一个数字。

绝对 vs 相对

这是几乎骗倒所有人的一个,因此值得放慢速度。

以诺如病毒的数字为例。疾病发生在安慰剂组的 56.9% 和疫苗组的 44.7%。你可以用两种诚实的方式描述同一个差距:

  • 绝对: 低 12.2 个百分点(56.9 减去 44.7)。
  • 相对: 低约 21%(12.2 大约是 56.9 的五分之一)。

两者都是真实的。它们描述的是同一个结果。而它们感觉完全不同——这正是听起来更大的那个,相对数字,成为新闻稿宠儿的原因。

"百分点"和"百分比"不是同一个词。利率从 5% 降到 4% 是下降一个百分点,但你所支付的利息是削减了 20%。把它们搞混是一个微小变化被吹成巨大变化的方式。

最清晰的警告来自罕见事件。"减少 50%"听起来巨大。但如果该事件在 1000 人中发生 2 例,现在变为 1000 人中 1 例,那个 50% 是一千人中少了一个人。回到 AI 试验,比值比 (0.77) 听起来像提高了 23%——然而在绝对意义上,不良结局发生在对照组的 2.0% 和 AI 组的 2.2% 之间,差距不到一个百分点。(原始百分比和调整后估计在组间不同时可能指向不同方向;这就是为什么两者都必须仔细阅读——此处调整后的 0.77 偏向一个方向而原始比率偏向另一个。)

  • 它意味着什么: 永远找到绝对数字——每组的实际比率。
  • 它不意味着什么: 一个大的相对数字不承诺一个大的真实世界变化。
  • 陷阱: 没有基线的相对数字。如果有人只给你一个百分比缩减,问"在多少人当中,且原来有多常见?"

置信区间

95% CI 0.55 到 1.08。 单一数字 (0.77) 是研究的最佳单一猜测。置信区间是与数据仍合理相容的值的范围。狭窄区间意味着研究锁定了答案;宽阔区间意味着"我们诚实地说不确定。"

一个问题在这里做大部分工作:区间是否包含"无效应"? 对于一个比值来说,"无效应"是 1.0。我们的区间从 0.55 到 1.08——它跨越了 1.0。因此数据与一个真实益处 (0.55)、与毫无效应 (1.0),甚至与一个轻微伤害 (1.08) 都相容。当区间包含无效应时,你不能声称一个效应——句号。研究就是没有锁定结果。

比较来自同一试验的两个诺如病毒终点:

  • 疾病: 差异 12.2 个百分点,95% CI −4.24 到 28.61。该范围跨越了零(无差异),因此结果是不确定的。
  • 感染: 差异 23.6 个百分点,95% CI 7.4 到 38.0。该范围完全在零以上,因此这一个是一个真实信号。

同一项研究,同一种疫苗,两个区间,两个不同的定论。区间是诚实所在的地方。

  • 它意味着什么: 我们有多确定,表示为一个范围。
  • 它不意味着什么: 点估计不是"答案",两个端点也不是同等可能——靠近中间的值更可信。
  • 陷阱: 读单一数字而忽略范围。范围就是要点。

P 值

P = 0.13。 p 值回答一个狭窄的、滑溜的问题:如果事实上不存在任何效应,纯粹的偶然性多久会产生一个至少这么大的差距? P = 0.13 意味着大约 13% 的情况下——足够常见以至于我们无法排除巧合。

按照长久以来的惯例,研究者通常在 P 低于 0.05 时称一个结果为"统计显著"。知道 0.05 是一个约定——一条由习惯画下的线,而非自然定律——会有所帮助。我们的 P = 0.13 位于其上,因此 AI 结果是"不显著的"。

两个陷阱住在这里,两者都很大:

  • “显著"不意味着"大"或"重要”。 在一项足够大的研究中,一个太小以至于无关紧要的差异仍然可能过线。
  • “不显著"不意味着"被证明为零”。 很多时候它意味着"这项研究无法判断。"证据的缺失不是缺失的证据。

这就是为什么,在可以的时候,置信区间比 p 值告诉你更多:区间显示了仍在桌上的全部范围,而不是将其压成一个单一的通过/不通过印章。

样本量

研究中包含多少人,且这足以看到他们正在寻找的效应吗?那种能力——一项研究在真实效应存在时检测到它的能力——被称为其统计功效

AI 试验招募了约 9,700 名患者,听起来足够多了。但不良结局是罕见的——约 2%——而罕见结局需要巨大的数字才能可靠比较。作者令人耳目一新地坦诚:要确认他们看到的那种大小的效应,你将需要大约10 万名患者之类的东西。因此"不显著"在这里主要意味着"这项试验规模太小无法判断",而非"肯定什么都不存在。"

想想在一个嘈杂的房间里听一声低语。一次快速聆听几乎不告诉你什么;你可能需要许多次仔细重复才能诚实地判断低语是否真实。一项低功效的研究就是一次快速聆听。

  • 它意味着什么: 规模更大的研究能看见更小的效应;罕见结局要求大规模研究。
  • 它不意味着什么: 一项小型研究的无效结果不是什么都没发生的证明。
  • 陷阱: 将"我们无法检测到它"当作"它不存在"。

综合起来

现在我们有全部五个。一旦你看到它们如何配合,一句翻译就浮现出来:

aOR 0.77, 95% CI 0.55–1.08, P = 0.13 → “在试验的约 9,700 名患者中,该 AI 工具在总计上略微偏向于将不良结局减少约四分之一,但分析显示该效应可能在零到接近一半之间变化,且该数据与纯偶然性的解释并无明显区别——我们不确定。”

这就是整件该死的事情。不是"它有效。"不是"它失败了。"只是我们还不确定——诚实而完整。

临床结果阅读清单

  • 终点: 我们测量了什么,能相信那个测量吗?
  • 比值比 / 风险比 / 风险比率: 效应的方向和大致大小是什么?
  • 绝对数字: 实际比率是多少,受影响的真实人数是多少?
  • 置信区间: 与数据相容的效应范围是什么?它是否包括无效应?
  • P 值: 如果实际上什么都不存在,纯偶然性有多容易产生这个结果?
  • 样本量 / 功效: 该研究规模是否足以检测一个合理大小的影响?

按顺序阅读,任何临床结果都会自行翻译成一句你不需要 MBA 就能评判的诚实句子。

关于本指南

这是一篇常青解读,而非针对单篇论文的报道。它在 AI 辅助下撰写,经人工编辑审阅,并随时间修订;上方日期为最近核查时间。它教你如何解读数字——并非医学或统计学建议。