Науковий заголовок зазвичай вручає вам одне число й настрій. «ШІ знижує кількість помилок на 23%». «Вакцина провалила випробування». Число відчувається як вирок, тому ви або вірите йому, або ні.
Але справжній клінічний результат — це ніколи не одне число. Це невелика зв’язка чисел, і кожне відповідає на своє запитання. Розберіться, про що запитує кожне, — і зв’язка перестає бути стіною жаргону, перетворюючись на коротку чесну фразу, яку ви можете прочитати самі.
Ми візьмемо один реальний приклад — із нашого ж матеріалу про випробування ШІ-інструмента в клініках Кенії:
скориговане відношення шансів становило 0,77 (95% довірчий інтервал від 0,55 до 1,08, P = 0,13)
У цьому рядку ховаються п’ять речей. Ми витягнемо їх по одній, а потім — що не менш важливо — зберемо назад. Одна обіцянка перед початком: жодне число тут окремо не вирок. Сенс — у тому, як вони складаються разом.
Кінцева точка
Перш ніж будь-яке число набуде сенсу, запитайте: число про що?
Те, що дослідження вимірює й підраховує, — це його кінцева точка. Усе інше — відношення, діапазон, p-значення — стосується цього одного вибраного результату. Змініть кінцеву точку — і кожне число зміниться разом із нею.
У випробуванні ШІ головною кінцевою точкою була неефективність лікування протягом 14 днів — визначена до початку випробування й оцінена групою лікарів, які не знали, хто з пацієнтів використовував ШІ. Ця остання деталь важлива: результат, зафіксований заздалегідь і оцінений наосліп, обманути себе значно важче, ніж результат, вибраний уже після того, як дані отримано.
Подивіться, що відбувається, коли в дослідження більше однієї кінцевої точки. У випробуванні вакцини проти норовірусу, про яке ми писали, вакцину перевіряли одразу двома способами: чи зупиняє вона саму хворобу (гастроентерит) і чи зупиняє інфекцію, яку виявляє лабораторний тест? Перше вона не виконала, а друге — так. Обидва результати реальні; просто вони відповідають на різні запитання. Заздалегідь вибраною головною кінцевою точкою була хвороба, тому, якщо повідомляти чесно, випробування не досягло своєї первинної кінцевої точки, хоча явно щось зробило.
- Що це означає: кінцева точка — це табло. Читайте її першою.
- Чого це не означає: добрий результат за вторинним чи вибраним заднім числом показником — не те саме, що влучання в головний, заздалегідь зареєстрований.
- Пастка: заголовок може процитувати ту кінцеву точку, яка звучить найкраще. Завжди запитуйте, що саме вимірювали й чи був це той результат, до якого дослідники зобов’язалися заздалегідь.
Відношення шансів
Відношення шансів 0,77. Відношення шансів (ВШ) — це одне число, що порівнює дві групи. Практичне правило:
- 1,0 означає відсутність різниці між групами.
- менше 1,0 означає, що подія була рідшою у групі лікування.
- більше 1,0 означає, що вона була частішою.
Отже, 0,77 каже, що в групи ШІ шанси поганого результату були приблизно три чверті від шансів контрольної групи — якщо це число справжнє. (Тримайте це «якщо»; наступні частини — те, як ми його перевіряємо.)
Маленьке «скориговане» — літера «с» у сВШ — означає, що дослідники за допомогою статистики врахували інші відмінності між групами, тут — те, що деякі клініки початково були несхожі на інші. Вам трапляться близькі родичі відношення шансів: відносний ризик (RR) і відношення ризиків (HR). Їх обчислюють по-різному, але читають однаково: 1,0 — це лінія «немає різниці».
- Що це означає: компактне «наскільки більше або менше» між двома групами.
- Чого це не означає: воно не каже, наскільки частою була подія чи скількох реальних людей це стосується. Відношення приховує свою вихідну частоту.
- Пастка: «на 25% менше шансів» звучить драматично. Чи має це взагалі значення, залежить від того, наскільки частим результат був початково, — а це якраз наступне число.
Абсолютне проти відносного
Саме це збиває з пантелику майже кожного, тому варто збавити темп.
Візьмемо числа з норовірусу. Хвороба виникла у 56,9% групи плацебо і в 44,7% щепленої групи. Один і той самий розрив можна чесно описати двома способами:
- Абсолютний: на 12,2 відсоткового пункта нижче (56,9 мінус 44,7).
- Відносний: приблизно на 21% нижче (12,2 — це приблизно п’ята частина від 56,9).
Обидва правильні. Вони описують один і той самий результат. І відчуваються зовсім по-різному — ось чому те число, що звучить більшим, відносне, — улюбленець пресрелізів.
«Відсоткові пункти» і «відсотки» — не одне й те саме. Зниження відсоткової ставки з 5% до 4% — це падіння на один відсотковий пункт, але скорочення на 20% тих відсотків, що ви платите. Їхня плутанина — те, як крихітну зміну продають як величезну.
Найясніше попередження — від рідкісних подій. «Зниження на 50%» звучить колосально. Але якщо подія траплялася у 2 людей із 1000, а тепер трапляється в 1 із 1000, ці 50% — одна людина на тисячу. Повернімося до випробування ШІ: відношення шансів (0,77) звучало як покращення на 23% — але в абсолютних величинах поганий результат стався у 2,0% контрольної групи і у 2,2% групи ШІ, розрив — частка одного відсотка. (Сирі відсотки й скориговані оцінки можуть указувати в різні боки, коли групи різняться; тому і ті, і інші треба читати уважно — тут скориговане 0,77 хилиться в один бік, а сирі частоти — в інший.)
- Що це означає: завжди знаходьте абсолютні числа — фактичні частоти в кожній групі.
- Чого це не означає: велике відносне число не обіцяє великої зміни в реальному житті.
- Пастка: відносні цифри без вихідної бази. Якщо вам дають лише відсоток зниження, запитайте: «з-поміж скількох, і наскільки частим це було вже?»
Довірчий інтервал
95% ДІ від 0,55 до 1,08. Одне число (0,77) — це найкращий єдиний здогад дослідження. Довірчий інтервал — це діапазон значень, які також розумно сумісні з даними. Вузький інтервал означає, що дослідження пришпилило відповідь; широкий — що «ми чесно не впевнені».
Більшу частину роботи тут робить одне запитання: чи включає інтервал «відсутність ефекту»? Для відношення «відсутність ефекту» — це 1,0. Наш інтервал іде від 0,55 до 1,08 — він охоплює 1,0. Отже, дані сумісні і зі справжньою користю (0,55), і з повною відсутністю ефекту (1,0), і навіть із легкою шкодою (1,08). Коли інтервал включає відсутність ефекту, стверджувати наявність ефекту не можна — і крапка. Дослідження просто не пришпилило результат.
Порівняйте дві кінцеві точки з норовірусу з того самого випробування:
- Хвороба: різниця 12,2 відсоткового пункта, 95% ДІ від −4,24 до 28,61. Цей діапазон перетинає нуль (немає різниці), тому результат невизначений.
- Інфекція: різниця 23,6 відсоткового пункта, 95% ДІ від 7,4 до 38,0. Цей діапазон цілком вище нуля, тому тут — справжній сигнал.
Одне дослідження, одна вакцина, два інтервали, два різні вироки. Саме в інтервалі живе чесність.
- Що це означає: наскільки ми впевнені, виражене діапазоном.
- Чого це не означає: точкова оцінка — не «відповідь», і два кінці не рівноймовірні: значення ближче до середини правдоподібніші.
- Пастка: читати одне число й ігнорувати діапазон. Діапазон і є суть.
P-значення
P = 0,13. P-значення відповідає на вузьке, слизьке запитання: якби ефекту насправді не було, як часто сама лише випадковість давала б розрив щонайменше такої величини? P = 0,13 означає приблизно в 13% випадків — досить часто, щоб ми не могли виключити випадковість.
За давнім звичаєм дослідники часто називають результат «статистично значущим», коли P менше 0,05. Корисно знати, що 0,05 — це домовленість, риса, проведена за звичкою, а не закон природи. Наше P = 0,13 вище неї, тому результат ШІ «незначущий».
Тут живуть дві пастки, і обидві великі:
- «Значущий» не означає «великий» чи «важливий». За досить великого дослідження різниця, надто мала, щоб мати значення, усе одно може подолати планку.
- «Незначущий» не означає «доведено, що нуль». Дуже часто це означає «це дослідження не змогло визначити». Відсутність доказів — не доказ відсутності.
Ось чому, коли можете, довірчий інтервал каже вам більше, ніж p-значення: інтервал показує весь діапазон того, що ще лишається на столі, замість того щоб згорнути його в єдиний штамп «пройшов / не пройшов».
Розмір вибірки
Скільки людей було в дослідженні й чи достатньо цього, щоб побачити шуканий ефект? Цю здатність — здатність дослідження виявити справжній ефект, коли він є, — називають його потужністю.
У випробування ШІ залучили близько 9700 пацієнтів, що звучить як безліч. Але поганий результат був рідкісним — близько 2%, — а рідкісні результати потребують величезних чисел, щоб надійно їх порівнювати. Автори освіжаюче прямі щодо цього: щоб підтвердити ефект того розміру, що вони побачили, знадобилося б щось на кшталт 100 000 пацієнтів. Тож «незначущий» тут здебільшого означає «це випробування було замале, щоб визначити», а не «там точно нічого немає».
Уявіть, що ви вслухаєтеся в шепіт у гамірній кімнаті. Одне швидке прислухання каже мало; може знадобитися багато уважних повторів, перш ніж ви чесно скажете, чи реальний шепіт. Дослідження з недостатньою потужністю — це одне швидке прислухання.
- Що це означає: більші дослідження бачать менші ефекти; рідкісні результати вимагають великих досліджень.
- Чого це не означає: нульовий результат малого дослідження — не доказ того, що нічого не сталося.
- Пастка: приймати «ми не змогли це виявити» за «цього немає».
Читаємо разом
Тепер прочитайте весь рядок ще раз, повільно:
скориговане відношення шансів становило 0,77 (95% довірчий інтервал від 0,55 до 1,08, P = 0,13)
Кінцева точка каже, що вимірювали (серйозна неефективність лікування, оцінена наосліп, протягом 14 днів). Відношення шансів і абсолютні частоти кажуть, наскільки великим виглядає ефект, — і абсолютні частоти тримають відношення чесним (2,0% проти 2,2% — крихітна різниця). Довірчий інтервал каже, наскільки ми впевнені (не дуже — він включає «відсутність ефекту»). P-значення попереджає не ставити проти випадковості (0,13 легко отримати за удачі). А розмір вибірки каже, якого роду це «ні» (замале, щоб визначити, а не доведено, що нічого).
Зібраний докупи, цей лячний рядок каже щось цілком точне й цілком скромне: у цьому одному випробуванні інструмент може трохи допомагати, може не робити нічого, і ми поки не можемо сказати, що саме, — а щоб сказати, знадобилося б значно більше дослідження.
Це не провал. Це чесний результат, повідомлений чесно. Жодне число у зв’язці окремо не сказало б вам цього. Знадобилися всі вони, прочитані разом, — у чому й уся суть, і причина, чому ми ніколи не друкуємо число без прочитання простою мовою поряд із ним.
Шість запитань, а не формула
Немає рецепта підрахунку, який перетворює результат на вирок, — кожен, хто пропонує вам такий, щось продає. Що ви можете носити із собою — це короткий список запитань. Вони не видають відповідь; вони тримають вас чесним.
- Що саме вимірювали й чи було це вирішено заздалегідь? (кінцева точка)
- Наскільки великий ефект — і які реальні числа в кожній групі? (відношення шансів; абсолютне проти відносного)
- Чи включає довірчий інтервал «відсутність ефекту»?
- Що насправді каже p-значення — і чи не плутають «значущий» із «важливим»?
- Чи було дослідження досить великим, щоб побачити ефект, на який полювало? (потужність)
- І запитання за всіма іншими: чого це дослідження не показує?
Ставте їх — у цьому дусі — і вам більше не потрібен заголовок, щоб сказати, що означає дослідження. Ви можете прочитати його самі.
Про цей посібник
Це постійно актуальне пояснення, а не розбір однієї статті. Воно підготовлене за допомогою ШІ та редакторської перевірки людиною й з часом оновлюється; дата вище — коли його востаннє перевіряли. Воно вчить читати числа — це не медична і не статистична порада.