과학 표제는 대개 당신에게 하나의 숫자와 하나의 분위기를 건넨다. “AI가 오류를 23% 줄이다.” “백신, 임상시험 실패.” 그 숫자는 평결처럼 느껴지기에, 당신은 그것을 믿거나 믿지 않거나 둘 중 하나다.
하지만 진짜 임상 결과는 결코 하나의 숫자가 아니다. 그것은 숫자들의 작은 꾸러미이며, 각각은 서로 다른 질문에 답한다. 각각이 무엇을 묻고 있는지를 익히면 그 꾸러미는 전문용어의 벽이기를 그친다 — 그것은 당신이 스스로 읽어 낼 수 있는 짧고 정직한 한 문장이 된다.
우리는 하나의 실제 사례를 쓸 것이다. 케냐의 진료소에서 어떤 AI 도구를 시험한 임상시험에 대한 우리 자신의 보도에서 가져온 것이다.
the adjusted odds ratio was 0.77 (95% confidence interval 0.55 to 1.08, P = 0.13)
그 한 줄에는 다섯 가지가 숨어 있다. 우리는 그것들을 하나씩 꺼낼 것이고 — 그런 다음, 그에 못지않게 중요하게, 다시 맞춰 넣을 것이다. 시작하기 전에 한 가지 약속. 여기 어떤 하나의 숫자도 평결이 아니다. 의미는 그것들이 어떻게 맞물리는지에 있다.
평가변수
어떤 숫자가 무언가를 의미하기 전에, 물어보라. 무엇에 관한 숫자인가?
어떤 연구가 측정하고 세는 대상이 그 연구의 평가변수다. 나머지 모든 것 — 비, 범위, p 값 — 은 그 선택된 하나의 결과에 관한 것이다. 평가변수를 바꾸면 모든 숫자가 그것과 함께 바뀐다.
그 AI 임상시험에서 주요 평가변수는 14일 이내의 치료 실패였다 — 임상시험이 시작되기 전에 정해졌고, 어느 환자가 AI를 썼는지 모르는 임상의 패널이 판정했다. 그 마지막 세부가 중요하다. 미리 고정되고 눈가림으로 채점된 결과는 결과가 나온 뒤에 골라낸 결과보다 스스로를 속이기가 훨씬 더 어렵다.
어떤 연구에 평가변수가 하나 이상일 때 무슨 일이 벌어지는지 지켜보라. 우리가 보도한 노로바이러스 백신 임상시험에서, 백신은 한꺼번에 두 가지 방식으로 검증되었다. 실제 질병(위장염)을 막았는가, 그리고 실험실 검사로 검출되는 감염을 막았는가? 그것은 첫 번째는 놓치고 두 번째는 맞혔다. 두 결과 모두 실재한다. 그것들은 단지 서로 다른 질문에 답할 뿐이다. 그 임상시험이 미리 고른 주요 평가변수는 질병 쪽이었다 — 그러므로 정직하게 보고하면, 그 임상시험은 분명히 무언가를 해내기는 했어도 1차 평가변수를 놓쳤다.
- 그 뜻: 평가변수는 점수판이다. 그것을 먼저 읽어라.
- 그 뜻이 아닌 것: 2차 지표나 사후 지표에서의 좋은 결과는 미리 등록된 주요 지표를 맞히는 것과 같지 않다.
- 함정: 표제는 가장 좋게 들리는 아무 평가변수나 인용할 수 있다. 실제로 무엇이 측정되었는지, 그리고 그것이 연구자들이 미리 약속한 결과였는지를 늘 물어라.
오즈비
오즈비 0.77. 오즈비는 두 집단을 비교하는 하나의 숫자다. 어림 규칙은 이렇다.
- 1.0은 두 집단 사이에 차이가 없음을 뜻한다.
- 1.0 미만은 그 사건이 치료군에서 덜 흔했음을 뜻한다.
- 1.0 초과는 그것이 더 흔했음을 뜻한다.
그래서 0.77은 AI군이 대조군에 비해 나쁜 결과의 오즈가 대략 4분의 3이었음을 말한다 — 그 숫자가 진짜라면. (그 "라면"을 붙들어 두라. 다음 조각들이 우리가 그것을 확인하는 방법이다.)
그 작은 “보정된” — aOR의 a — 은 연구자들이 집단 간의 다른 차이들, 여기서는 일부 진료소가 처음부터 다른 곳과 달랐다는 사실을 감안하기 위해 통계를 썼음을 뜻한다. 당신은 오즈비의 가까운 친척들을 만나게 될 것이다. **위험비(RR)**와 **위험도비(HR)**다. 그것들은 다르게 계산되지만, 읽는 방법은 같다. 1.0이 “차이 없음” 선이다.
- 그 뜻: 두 집단 사이의 "얼마나 더, 또는 덜"을 간명하게 나타낸 것.
- 그 뜻이 아닌 것: 그것은 그 사건이 얼마나 흔했는지, 또는 실제로 몇 사람이 영향을 받는지는 말해 주지 않는다. 비는 그 기준선을 숨긴다.
- 함정: "오즈 25% 감소"는 극적으로 들린다. 그것이 조금이라도 중요한지는 애초에 그 결과가 얼마나 흔했는지에 달려 있다 — 그것이 바로 다음 숫자다.
절대 대 상대
이것은 거의 모든 사람을 속이는 것이므로, 천천히 갈 만하다.
노로바이러스 숫자를 보자. 질병은 위약군의 **56.9%**와 백신군의 **44.7%**에서 일어났다. 당신은 그 똑같은 격차를 두 가지 정직한 방식으로 서술할 수 있다.
- 절대: 12.2 퍼센트포인트 더 낮다(56.9 빼기 44.7).
- 상대: 약 21% 더 낮다(12.2는 대략 56.9의 5분의 1이다).
둘 다 참이다. 그것들은 동일한 결과를 서술한다. 그리고 완전히 다르게 느껴진다 — 바로 그 때문에 더 크게 들리는 쪽, 곧 상대 숫자가 보도자료의 총아다.
"퍼센트포인트"와 "퍼센트"는 같은 말이 아니다. 5% 이자율에서 4%로 가는 것은 1 퍼센트포인트의 하락이지만, 당신이 내는 이자로 치면 20% 삭감이다. 이 둘을 뒤섞는 것이 바로 작은 변화가 거대한 변화로 팔리는 방식이다.
가장 분명한 경고는 드문 사건에서 온다. "50% 감소"는 엄청나게 들린다. 하지만 그 사건이 1,000명 중 2명에게 일어났다가 이제 1,000명 중 1명에게 일어난다면, 그 50%는 천 명당 한 명이다. 다시 AI 임상시험으로 돌아가면, 오즈비(0.77)는 23% 개선처럼 들렸다 — 그러나 절대적으로 보면 나쁜 결과는 대조군의 2.0%와 AI군의 2.2%에게 일어났고, 이는 1퍼센트의 한 조각만 한 격차다. (원 백분율과 보정된 추정치는 집단이 다를 때 서로 다른 방향을 가리킬 수 있다. 그래서 둘 다 주의 깊게 읽어야 한다 — 여기서 보정된 0.77은 한쪽으로 기울고 원 비율은 다른 쪽으로 기운다.)
- 그 뜻: 언제나 절대 숫자 — 각 집단의 실제 비율 — 를 찾아라.
- 그 뜻이 아닌 것: 큰 상대 숫자가 큰 실제 변화를 약속하지는 않는다.
- 함정: 기준선 없는 상대 수치. 누군가가 당신에게 퍼센트 감소만 준다면, "몇 명 중에서, 그리고 그것이 이미 얼마나 흔했는가?"라고 물어라.
신뢰구간
95% CI 0.55에서 1.08. 그 하나의 숫자(0.77)는 그 연구의 최선의 단일 추측이다. 신뢰구간은 데이터와도 합리적으로 양립하는 값들의 범위다. 좁은 구간은 그 연구가 답을 못박았음을 뜻하고, 넓은 구간은 "우리는 정직히 말해 확신하지 못한다"를 뜻한다.
여기서는 하나의 질문이 대부분의 일을 한다. 그 구간이 "효과 없음"을 포함하는가? 비의 경우, "효과 없음"은 1.0이다. 우리의 구간은 0.55에서 1.08까지 이어진다 — 그것은 1.0을 걸치고 있다. 그래서 데이터는 실제 이득(0.55), 아무것도 아님(1.0), 심지어 약간의 해(1.08)와도 양립한다. 구간이 효과 없음을 포함할 때, 당신은 효과를 주장할 수 없다 — 그것으로 끝이다. 그 연구는 단지 결과를 못박지 못한 것이다.
같은 임상시험에서 나온 두 노로바이러스 평가변수를 비교해 보자.
- 질병: 차이 12.2 퍼센트포인트, 95% CI −4.24에서 28.61. 그 범위는 0을 가로지른다(차이 없음), 그래서 결과는 불확실하다.
- 감염: 차이 23.6 퍼센트포인트, 95% CI 7.4에서 38.0. 그 범위는 전부 0보다 위에 있다, 그래서 이것은 실제 신호다.
같은 연구, 같은 백신, 두 구간, 두 개의 서로 다른 평결. 정직함이 사는 곳은 바로 그 구간이다.
- 그 뜻: 우리가 얼마나 확신하는지를 범위로 나타낸 것.
- 그 뜻이 아닌 것: 점 추정치는 "그 답"이 아니며, 양 끝이 똑같이 그럴듯한 것도 아니다 — 가운데에 가까운 값들이 더 그럴법하다.
- 함정: 하나의 숫자만 읽고 범위를 무시하는 것. 그 범위가 바로 핵심이다.
p 값
P = 0.13. p 값은 좁고 미끄러운 질문에 답한다. 정말로 효과가 없다면, 순전한 우연만으로 적어도 이만큼 큰 격차를 얼마나 자주 만들어 낼까? P = 0.13은 약 13%의 경우를 뜻한다 — 요행을 배제할 수 없을 만큼 흔하다.
오랜 관습에 따라, 연구자들은 흔히 P가 0.05 미만일 때 결과를 "통계적으로 유의하다"고 부른다. 0.05가 하나의 관례 — 자연의 법칙이 아니라 습관으로 그어진 선 — 임을 아는 것이 도움이 된다. 우리의 P = 0.13은 그 위에 있으므로, 그 AI 결과는 “유의하지 않다”.
여기에는 두 개의 함정이 살고 있고, 둘 다 크다.
- "유의하다"는 "크다"거나 "중요하다"는 뜻이 아니다. 충분히 큰 연구에서는, 중요하기에는 너무 작은 차이도 여전히 그 기준을 넘을 수 있다.
- "유의하지 않다"는 "0임이 증명되었다"는 뜻이 아니다. 아주 흔히 그것은 "이 연구는 분간할 수 없었다"를 뜻한다. 증거의 부재는 부재의 증거가 아니다.
이 때문에, 가능할 때는, 신뢰구간이 p 값보다 더 많은 것을 말해 준다. 구간은 그것을 하나의 합격/불합격 도장으로 무너뜨리는 대신, 여전히 논의 대상인 것의 전체 범위를 보여 준다.
표본 크기
그 연구에 몇 사람이 있었는가, 그리고 그것이 그들이 찾던 효과를 보기에 충분했는가? 그 역량 — 실제 효과가 존재할 때 그것을 검출하는 연구의 능력 — 을 그 연구의 검정력이라고 부른다.
그 AI 임상시험은 약 9,700명의 환자를 등록했는데, 이는 넉넉하게 들린다. 하지만 나쁜 결과는 드물었고 — 약 2% — 드문 결과는 신뢰할 수 있게 비교하려면 어마어마한 숫자가 필요하다. 저자들은 그것에 대해 상쾌할 만큼 솔직하다. 그들이 본 크기의 효과를 확증하려면 대략 10만 명의 환자가 필요할 것이다. 그래서 여기서 "유의하지 않다"는 대체로 "이 임상시험은 분간하기에는 너무 작았다"를 뜻하지, "거기에는 분명히 아무것도 없다"를 뜻하지 않는다.
시끄러운 방에서 속삭임을 들으려 애쓴다고 생각해 보라. 한 번 얼른 들어서는 별로 알 수 없다. 그 속삭임이 진짜인지 정직하게 말할 수 있으려면 주의 깊은 반복이 여러 번 필요할지도 모른다. 검정력이 부족한 연구는 한 번 얼른 듣는 것이다.
- 그 뜻: 더 큰 연구는 더 작은 효과를 볼 수 있다. 드문 결과는 큰 연구를 요구한다.
- 그 뜻이 아닌 것: 작은 연구에서 나온 영(零) 결과는 아무 일도 일어나지 않았다는 증명이 아니다.
- 함정: "우리는 그것을 검출할 수 없었다"를 "그것은 거기에 없다"로 취급하는 것.
함께 읽기
이제 그 전체 줄을 다시, 천천히 읽어 보라.
the adjusted odds ratio was 0.77 (95% confidence interval 0.55 to 1.08, P = 0.13)
평가변수는 무엇이 측정되었는지를 말해 준다(심각한 치료 실패, 눈가림 판정, 14일 이내). 오즈비와 절대 비율은 효과가 얼마나 커 보이는지를 말해 준다 — 그리고 절대 비율은 그 비를 정직하게 지킨다(2.0% 대 2.2%는 아주 작다). 신뢰구간은 우리가 얼마나 확신하는지를 말해 준다(별로 그렇지 않다 — 그것은 "효과 없음"을 포함한다). p 값은 우연에 맞서 걸지 말라고 경고한다(0.13은 운이 만들어 내기 쉽다). 그리고 표본 크기는 이것이 어떤 종류의 "아니다"인지를 말해 준다(분간하기에 너무 작다는 것이지, 아무것도 없음이 증명된 것이 아니다).
한데 모으면, 그 위압적인 줄은 상당히 정확하고 상당히 겸손한 무언가를 말한다. 이 한 번의 임상시험에서, 그 도구는 조금 도움이 될 수도, 아무것도 하지 않을 수도 있으며, 우리는 어느 쪽인지 아직 분간할 수 없다 — 그리고 분간하려면 훨씬 더 큰 연구가 필요할 것이다.
그것은 실패가 아니다. 그것은 정직하게 보고된 정직한 결과다. 그 꾸러미 속의 어떤 하나의 숫자도 당신에게 그것을 말해 줄 수 없었을 것이다. 당신은 그 전부가, 함께 읽히는 것이 필요했다 — 그것이 바로 핵심이며, 우리가 그 숫자를 옆에 놓인 쉬운 말 해석 없이는 결코 싣지 않는 이유다.
공식이 아니라 여섯 가지 질문
결과를 평결로 바꿔 주는 채점 공식 같은 것은 없다 — 당신에게 그런 것을 내미는 사람은 무언가를 팔고 있는 것이다. 당신이 지니고 다닐 수 있는 것은 짧은 질문 목록이다. 그것들은 답을 내놓지 않는다. 그것들은 당신을 정직하게 지켜 준다.
- 실제로 무엇이 측정되었고, 그것이 미리 정해졌는가? (평가변수)
- 효과는 얼마나 큰가 — 그리고 각 집단의 실제 숫자는 무엇인가? (오즈비; 절대 대 상대)
- 신뢰구간이 "효과 없음"을 포함하는가?
- p 값이 정말로 말하는 것은 무엇인가 — 그리고 "유의하다"가 "중요하다"와 혼동되고 있지는 않은가?
- 그 연구는 사냥하던 효과를 보기에 충분히 컸는가? (검정력)
- 그리고 나머지 모든 질문 뒤에 있는 질문. 이 연구가 보여 주지 않는 것은 무엇인가?
그런 질문들을, 그런 정신으로 던지면, 당신은 더 이상 어떤 연구가 무엇을 뜻하는지 말해 줄 표제가 필요 없다. 당신은 그것을 스스로 읽어 낼 수 있다.
이 가이드에 대하여
이것은 단일 논문에 대한 보도가 아니라 상시 설명 자료입니다. AI의 도움과 사람의 편집 검토를 거쳐 작성되며 시간이 지나면서 개정됩니다. 위의 날짜는 마지막으로 확인한 날짜입니다. 이 자료는 숫자를 읽는 방법을 알려줄 뿐, 의학적 또는 통계적 조언이 아닙니다.