Научный заголовок обычно вручает вам одно число и настроение. «ИИ снижает число ошибок на 23%». «Вакцина провалила испытание». Число ощущается как приговор, поэтому вы либо верите ему, либо нет.
Но настоящий клинический результат — это никогда не одно число. Это небольшая связка чисел, и каждое отвечает на свой вопрос. Разберитесь, о чём спрашивает каждое, — и связка перестаёт быть стеной жаргона, превращаясь в короткую честную фразу, которую вы можете прочитать сами.
Мы возьмём один реальный пример — из нашего же материала об испытании ИИ-инструмента в клиниках Кении:
скорректированное отношение шансов составило 0,77 (95% доверительный интервал от 0,55 до 1,08, P = 0,13)
В этой строке прячутся пять вещей. Мы вытащим их по одной, а затем — что не менее важно — соберём обратно. Одно обещание перед началом: ни одно число здесь по отдельности не приговор. Смысл — в том, как они складываются вместе.
Конечная точка
Прежде чем любое число обретёт смысл, спросите: число о чём?
То, что исследование измеряет и подсчитывает, — это его конечная точка. Всё остальное — отношение, диапазон, p-значение — относится к этому одному выбранному исходу. Измените конечную точку — и каждое число изменится вместе с ней.
В испытании ИИ главной конечной точкой была неэффективность лечения в течение 14 дней — определённая до начала испытания и оценённая группой врачей, которые не знали, кто из пациентов использовал ИИ. Эта последняя деталь важна: исход, зафиксированный заранее и оценённый вслепую, обмануть себя гораздо труднее, чем исход, выбранный уже после того, как результаты получены.
Посмотрите, что происходит, когда у исследования больше одной конечной точки. В испытании вакцины против норовируса, о котором мы писали, вакцину проверяли сразу двумя способами: останавливает ли она саму болезнь (гастроэнтерит) и останавливает ли инфекцию, выявляемую лабораторным тестом? Первое она не выполнила, а второе — да. Оба результата реальны; просто они отвечают на разные вопросы. Заранее выбранной главной конечной точкой была болезнь, поэтому, если сообщать честно, испытание не достигло своей первичной конечной точки, хотя явно что-то сделало.
- Что это значит: конечная точка — это табло. Читайте её первой.
- Чего это не значит: хороший результат по вторичному или выбранному задним числом показателю — не то же самое, что попадание в главный, заранее зарегистрированный.
- Ловушка: заголовок может процитировать ту конечную точку, которая звучит лучше всего. Всегда спрашивайте, что именно измеряли и был ли это тот исход, к которому исследователи обязались заранее.
Отношение шансов
Отношение шансов 0,77. Отношение шансов (ОШ) — это одно число, сравнивающее две группы. Практическое правило:
- 1,0 означает отсутствие разницы между группами.
- меньше 1,0 означает, что событие было реже в группе лечения.
- больше 1,0 означает, что оно было чаще.
Итак, 0,77 говорит, что у группы ИИ шансы плохого исхода были примерно три четверти от шансов контрольной группы — если это число настоящее. (Держите это «если»; следующие части — то, как мы его проверяем.)
Маленькое «скорректированное» — буква «с» в сОШ — означает, что исследователи с помощью статистики учли другие различия между группами, здесь — то, что некоторые клиники изначально были непохожи на другие. Вам встретятся близкие родственники отношения шансов: относительный риск (RR) и отношение рисков (HR). Их вычисляют по-разному, но читают одинаково: 1,0 — это линия «нет разницы».
- Что это значит: компактное «насколько больше или меньше» между двумя группами.
- Чего это не значит: оно не говорит, насколько частым было событие или скольких реальных людей это затрагивает. Отношение скрывает свою исходную частоту.
- Ловушка: «на 25% меньше шансов» звучит драматично. Имеет ли это вообще значение, зависит от того, насколько частым исход был изначально, — а это как раз следующее число.
Абсолютное против относительного
Именно это сбивает с толку почти каждого, поэтому стоит сбавить темп.
Возьмём числа по норовирусу. Болезнь возникла у 56,9% группы плацебо и у 44,7% привитой группы. Один и тот же разрыв можно честно описать двумя способами:
- Абсолютный: на 12,2 процентного пункта ниже (56,9 минус 44,7).
- Относительный: примерно на 21% ниже (12,2 — это примерно пятая часть от 56,9).
Оба верны. Они описывают один и тот же результат. И ощущаются совершенно по-разному — вот почему то число, что звучит крупнее, относительное, — любимец пресс-релизов.
«Процентные пункты» и «проценты» — не одно и то же. Снижение процентной ставки с 5% до 4% — это падение на один процентный пункт, но сокращение на 20% тех процентов, что вы платите. Их путаница — то, как крошечное изменение продают как огромное.
Самое ясное предупреждение — от редких событий. «Снижение на 50%» звучит колоссально. Но если событие случалось у 2 человек из 1000, а теперь случается у 1 из 1000, эти 50% — один человек на тысячу. Вернёмся к испытанию ИИ: отношение шансов (0,77) звучало как улучшение на 23% — но в абсолютных величинах плохой исход случился у 2,0% контрольной группы и у 2,2% группы ИИ, разрыв — доля одного процента. (Сырые проценты и скорректированные оценки могут указывать в разные стороны, когда группы различаются; поэтому и те и другие нужно читать внимательно — здесь скорректированное 0,77 склоняется в одну сторону, а сырые частоты — в другую.)
- Что это значит: всегда находите абсолютные числа — фактические частоты в каждой группе.
- Чего это не значит: большое относительное число не обещает большого изменения в реальной жизни.
- Ловушка: относительные цифры без исходной базы. Если вам дают только процент снижения, спросите: «из скольких, и насколько частым это было изначально?»
Доверительный интервал
95% ДИ от 0,55 до 1,08. Одно число (0,77) — это лучшая единичная догадка исследования. Доверительный интервал — это диапазон значений, которые также разумно совместимы с данными. Узкий интервал означает, что исследование пригвоздило ответ; широкий — что «мы честно не уверены».
Большую часть работы здесь делает один вопрос: включает ли интервал «отсутствие эффекта»? Для отношения «отсутствие эффекта» — это 1,0. Наш интервал идёт от 0,55 до 1,08 — он охватывает 1,0. Значит, данные совместимы и с настоящей пользой (0,55), и с полным отсутствием эффекта (1,0), и даже с лёгким вредом (1,08). Когда интервал включает отсутствие эффекта, утверждать наличие эффекта нельзя — и точка. Исследование просто не пригвоздило результат.
Сравните две конечные точки по норовирусу из того же испытания:
- Болезнь: разница 12,2 процентного пункта, 95% ДИ от −4,24 до 28,61. Этот диапазон пересекает ноль (нет разницы), поэтому результат неопределён.
- Инфекция: разница 23,6 процентного пункта, 95% ДИ от 7,4 до 38,0. Этот диапазон целиком выше нуля, поэтому здесь — настоящий сигнал.
Одно исследование, одна вакцина, два интервала, два разных вердикта. Именно в интервале живёт честность.
- Что это значит: насколько мы уверены, выраженное диапазоном.
- Чего это не значит: точечная оценка — не «ответ», и два конца не равновероятны: значения ближе к середине правдоподобнее.
- Ловушка: читать одно число и игнорировать диапазон. Диапазон и есть суть.
P-значение
P = 0,13. P-значение отвечает на узкий, скользкий вопрос: если бы эффекта на самом деле не было, как часто одна лишь случайность давала бы разрыв как минимум такой величины? P = 0,13 означает примерно в 13% случаев — достаточно часто, чтобы мы не могли исключить случайность.
По давнему обычаю исследователи часто называют результат «статистически значимым», когда P меньше 0,05. Полезно знать, что 0,05 — это соглашение, черта, проведённая по привычке, а не закон природы. Наше P = 0,13 выше неё, поэтому результат ИИ «незначим».
Здесь живут две ловушки, и обе большие:
- «Значимый» не значит «большой» или «важный». При достаточно большом исследовании разница, слишком маленькая, чтобы иметь значение, всё равно может преодолеть планку.
- «Незначимый» не значит «доказано, что ноль». Очень часто это значит «это исследование не смогло определить». Отсутствие доказательств — не доказательство отсутствия.
Вот почему, когда можете, доверительный интервал говорит вам больше, чем p-значение: интервал показывает весь диапазон того, что ещё остаётся на столе, вместо того чтобы схлопнуть его в единственный штамп «прошёл / не прошёл».
Размер выборки
Сколько людей было в исследовании и достаточно ли этого, чтобы увидеть искомый эффект? Эту способность — способность исследования обнаружить настоящий эффект, когда он есть, — называют его мощностью.
В испытание ИИ включили около 9700 пациентов, что звучит как множество. Но плохой исход был редким — около 2%, — а редкие исходы требуют огромных чисел, чтобы надёжно их сравнивать. Авторы освежающе прямы на этот счёт: чтобы подтвердить эффект того размера, что они увидели, понадобилось бы около 100 000 пациентов. Так что «незначим» здесь по большей части означает «это испытание было слишком мало, чтобы определить», а не «там точно ничего нет».
Представьте, что вы вслушиваетесь в шёпот в шумной комнате. Одно быстрое прислушивание говорит мало; может понадобиться много внимательных повторов, прежде чем вы честно скажете, реален ли шёпот. Исследование с недостаточной мощностью — это одно быстрое прислушивание.
- Что это значит: более крупные исследования видят более мелкие эффекты; редкие исходы требуют больших исследований.
- Чего это не значит: нулевой результат маленького исследования — не доказательство того, что ничего не произошло.
- Ловушка: принимать «мы не смогли это обнаружить» за «этого нет».
Читаем вместе
Теперь прочитайте всю строку ещё раз, медленно:
скорректированное отношение шансов составило 0,77 (95% доверительный интервал от 0,55 до 1,08, P = 0,13)
Конечная точка говорит, что измеряли (серьёзная неэффективность лечения, оценённая вслепую, в течение 14 дней). Отношение шансов и абсолютные частоты говорят, насколько крупным выглядит эффект, — и абсолютные частоты держат отношение честным (2,0% против 2,2% — крошечная разница). Доверительный интервал говорит, насколько мы уверены (не очень — он включает «отсутствие эффекта»). P-значение предупреждает не ставить против случайности (0,13 легко получить по удаче). А размер выборки говорит, какого рода это «нет» (слишком мало, чтобы определить, а не доказано, что ничего).
Собранная воедино, эта пугающая строка говорит нечто вполне точное и вполне скромное: в этом одном испытании инструмент может немного помогать, может не делать ничего, и мы пока не можем сказать, что именно, — а чтобы сказать, понадобилось бы куда более крупное исследование.
Это не провал. Это честный результат, сообщённый честно. Ни одно число в связке по отдельности не сказало бы вам этого. Понадобились все они, прочитанные вместе, — в чём и вся суть, и причина, почему мы никогда не печатаем число без прочтения простым языком рядом с ним.
Шесть вопросов, а не формула
Нет рецепта подсчёта, который превращает результат в приговор, — всякий, кто предлагает вам такой, что-то продаёт. Что вы можете носить с собой — это короткий список вопросов. Они не выдают ответ; они держат вас честным.
- Что именно измеряли и было ли это решено заранее? (конечная точка)
- Насколько велик эффект — и каковы реальные числа в каждой группе? (отношение шансов; абсолютное против относительного)
- Включает ли доверительный интервал «отсутствие эффекта»?
- Что на самом деле говорит p-значение — и не путают ли «значимый» с «важным»?
- Было ли исследование достаточно большим, чтобы увидеть искомый эффект? (мощность)
- И вопрос за всеми остальными: чего это исследование не показывает?
Задавайте их — в этом духе — и вам больше не нужен заголовок, чтобы сказать, что значит исследование. Вы можете прочитать его сами.
Об этом руководстве
Это постоянно актуальное пояснение, а не разбор одной статьи. Оно подготовлено с помощью ИИ и редакторской проверки человеком и со временем обновляется; дата выше — когда его в последний раз проверяли. Оно учит читать числа — это не медицинский и не статистический совет.