一條科學標題通常丟給你一個數字和一種情緒。「AI 減少了 23% 的錯誤。」「疫苗試驗失敗。」這個數字感覺像一個定論,因此你要麼相信它,要麼不信。
但一個真實的臨床結果從來不是一個單一數字。它是一小捆數字,每一個回答一個不同的問題。學會每個數字在問什麼,這一捆就不再是一堵術語牆——它就變成了一句你可以自己讀出的簡短誠實的句子。
我們將使用一個真實例子,取自我們自己報導的一項在肯亞診所的 AI 工具試驗:
調整後比值比為 0.77(95% 信賴區間 0.55 到 1.08,P = 0.13)
那一行裡隱藏了五樣東西。我們將一次拿出一樣——然後,同樣重要地,把它們放回去。在我們開始前的一個承諾:這裡沒有單一數字是定論。意義在於它們如何配合。
終點
在任何數字有意義之前,先問:一個關於什麼的數字?
一項研究測量和計數的東西就是其終點。其他一切——比值、範圍、p 值——都圍繞著那個選定的結局。改變終點,每個數字也隨之改變。
在 AI 試驗中,主要終點是14 天內的治療失敗——在試驗開始前決定,由一組不知道哪些患者使用了 AI 的臨床醫生判定。最後那個細節很重要:一個預先固定並盲法打分的結局,遠比一個在結果出來後才挑選的結局更難欺騙自己。
注意當一個研究有超過一個終點時會發生什麼。在我們報導的一項諾羅病毒疫苗試驗中,疫苗同時以兩種方式接受測試:它是否阻止了實際疾病(胃腸炎),以及它是否阻止了實驗室可檢測到的感染?它錯過了第一個,擊中了第二個。兩個結果都是真實的;它們只是回答不同的問題。試驗預先選定的主要終點是疾病那一項——因此,誠實地報告,該試驗未達到其主要終點,儘管它顯然做了些事情。
- 它意味著什麼: 終點是計分板。先讀它。
- 它不意味著什麼: 在次要的或事後指標上的一個好結果,不等同於達到預先註冊的主要終點。
- 陷阱: 標題可以引用聽起來最好的那個終點。永遠問實際測量了什麼,以及它是否就是研究人員預先承諾的那個結局。
比值比
比值比 0.77。 比值比是比較兩組的一個單一數字。經驗法則:
- 1.0 意味著組間無差異。
- 低於 1.0 意味著該事件在治療組中較少發生。
- 高於 1.0 意味著它更多發生。
因此 0.77 表示 AI 組出現不良結局的比值大約是對照組的四分之三——如果數字是真實的。(把握住那個「如果」;接下來的部分就是我們要如何檢查它。)
「調整後」——即 aOR 裡的a——意味著研究者使用了統計學來解釋組間的其他差異,這裡是有些診所從一開始就與其他診所不同。你會遇到比值比的近親:風險比 (RR) 和風險比率 (HR)。它們的計算方式不同,但解讀方式相同:1.0 是「無差異」線。
- 它意味著什麼: 兩組之間一個緊湊的「多了多少,或少了多少」。
- 它不意味著什麼: 它不告訴你事件有多常見,或多少真實的人受到了影響。比值隱藏了其基線。
- 陷阱: 「比值降低 25%」聽起來很戲劇化。它是否重要完全取決於結局一開始有多常見——這正是下一個數字。
絕對 vs 相對
這是幾乎騙倒所有人的一個,因此值得放慢速度。
以諾羅病毒的數字為例。疾病發生在安慰劑組的 56.9% 和疫苗組的 44.7%。你可以用兩種誠實的方式描述同一個差距:
- 絕對: 低 12.2 個百分點(56.9 減去 44.7)。
- 相對: 低約 21%(12.2 大約是 56.9 的五分之一)。
兩者都是真實的。它們描述的是同一個結果。而它們感覺完全不同——這正是聽起來更大的那個,相對數字,成為新聞稿寵兒的原因。
「百分點」和「百分比」不是同一個詞。利率從 5% 降到 4% 是下降一個百分點,但你所支付的利息是削減了 20%。把它們搞混是一個微小變化被吹成巨大變化的方式。
最清晰的警告來自罕見事件。「減少 50%」聽起來巨大。但如果該事件在 1000 人中發生 2 例,現在變為 1000 人中 1 例,那個 50% 是一千人中少了一個人。回到 AI 試驗,比值比 (0.77) 聽起來像提高了 23%——然而在絕對意義上,不良結局發生在對照組的 2.0% 和 AI 組的 2.2% 之間,差距不到一個百分點。(原始百分比和調整後估計在組間不同時可能指向不同方向;這就是為什麼兩者都必須仔細閱讀——此處調整後的 0.77 偏向一個方向而原始比率偏向另一個。)
- 它意味著什麼: 永遠找到絕對數字——每組的實際比率。
- 它不意味著什麼: 一個大的相對數字不承諾一個大的真實世界變化。
- 陷阱: 沒有基線的相對數字。如果有人只給你一個百分比縮減,問「在多少人當中,且原來有多常見?」
信賴區間
95% CI 0.55 到 1.08。 單一數字 (0.77) 是研究的最佳單一猜測。信賴區間是與資料仍合理相容的值的範圍。狹窄區間意味著研究鎖定了答案;寬闊區間意味著「我們誠實地說不確定。」
一個問題在這裡做大部分工作:區間是否包含「無效應」? 對於一個比值來說,「無效應」是 1.0。我們的區間從 0.55 到 1.08——它跨越了 1.0。因此資料與一個真實益處 (0.55)、與毫無效應 (1.0),甚至與一個輕微傷害 (1.08) 都相容。當區間包含無效應時,你不能聲稱一個效應——句號。研究就是沒有鎖定結果。
比較來自同一試驗的兩個諾羅病毒終點:
- 疾病: 差異 12.2 個百分點,95% CI −4.24 到 28.61。該範圍跨越了零(無差異),因此結果是不確定的。
- 感染: 差異 23.6 個百分點,95% CI 7.4 到 38.0。該範圍完全在零以上,因此這一個是一個真實信號。
同一項研究,同一種疫苗,兩個區間,兩個不同的定論。區間是誠實所在的地方。
- 它意味著什麼: 我們有多確定,表示為一個範圍。
- 它不意味著什麼: 點估計不是「答案」,兩個端點也不是同等可能——靠近中間的值更可信。
- 陷阱: 讀單一數字而忽略範圍。範圍就是要點。
P 值
P = 0.13。 p 值回答一個狹窄的、滑溜的問題:如果事實上不存在任何效應,純粹的偶然性多久會產生一個至少這麼大的差距? P = 0.13 意味著大約 13% 的情況下——足夠常見以至於我們無法排除巧合。
按照長久以來的慣例,研究者通常在 P 低於 0.05 時稱一個結果為「統計顯著」。知道 0.05 是一個約定——一條由習慣畫下的線,而非自然定律——會有所幫助。我們的 P = 0.13 位於其上,因此 AI 結果是「不顯著的」。
兩個陷阱住在這裡,兩者都很大:
- 「顯著」不意味著「大」或「重要」。 在一項足夠大的研究中,一個太小以至於無關緊要的差異仍然可能過線。
- 「不顯著」不意味著「被證明為零」。 很多時候它意味著「這項研究無法判斷。」證據的缺失不是缺失的證據。
這就是為什麼,在可以的時候,信賴區間比 p 值告訴你更多:區間顯示了仍在桌上的全部範圍,而不是將其壓成一個單一的通過/不通過印章。
樣本量
研究中包含多少人,且這足以看到他們正在尋找的效應嗎?那種能力——一項研究在真實效應存在時檢測到它的能力——被稱為其統計檢定力。
AI 試驗招募了約 9,700 名患者,聽起來足夠多了。但不良結局是罕見的——約 2%——而罕見結局需要巨大的數字才能可靠比較。作者令人耳目一新地坦誠:要確認他們看到的那種大小的效應,你將需要大約10 萬名患者之類的東西。因此「不顯著」在這裡主要意味著「這項試驗規模太小無法判斷」,而非「肯定什麼都不存在。」
想想在一個嘈雜的房間裡聽一聲低語。一次快速聆聽幾乎不告訴你什麼;你可能需要許多次仔細重複才能誠實地判斷低語是否真實。一項低檢定力的研究就是一次快速聆聽。
- 它意味著什麼: 規模更大的研究能看見更小的效應;罕見結局要求大規模研究。
- 它不意味著什麼: 一項小型研究的無效結果不是什麼都沒發生的證明。
- 陷阱: 將「我們無法檢測到它」當作「它不存在」。
綜合起來
現在我們有全部五個。一旦你看到它們如何配合,一句翻譯就浮現出來:
aOR 0.77, 95% CI 0.55–1.08, P = 0.13 → 「在試驗的約 9,700 名患者中,該 AI 工具在總計上略微偏向於將不良結局減少約四分之一,但分析顯示該效應可能在零到接近一半之間變化,且該資料與純偶然性的解釋並無明顯區別——我們不確定。」
這就是整件該死的事情。不是「它有效。」不是「它失敗了。」只是我們還不確定——誠實而完整。
臨床結果閱讀清單
- 終點: 我們測量了什麼,能相信那個測量嗎?
- 比值比 / 風險比 / 風險比率: 效應的方向和大致大小是什麼?
- 絕對數字: 實際比率是多少,受影響的真實人數是多少?
- 信賴區間: 與資料相容的效應範圍是什麼?它是否包括無效應?
- P 值: 如果實際上什麼都不存在,純偶然性有多容易產生這個結果?
- 樣本量 / 檢定力: 該研究規模是否足以檢測一個合理大小的影響?
按順序閱讀,任何臨床結果都會自行翻譯成一句你不需要 MBA 就能評判的誠實句子。
關於本指南
這是一篇常青解讀,而非針對單篇論文的報導。它在 AI 輔助下撰寫,經人工編輯審閱,並隨時間修訂;上方日期為最近核查時間。它教你如何解讀數字——並非醫學或統計學建議。