Сто экспериментов над ольховыми шишками: как доверять доверительному интервалу

Александр Сойнов & Александр Кулябин

В предыдущей статье про P-value мы выяснили, как можно доказать своему другу, что прием отвара ольховых шишек с высокой вероятностью влияет на длительность заболевания.

Наша цель достигнута, душа ликует, а рука снова тянется за шампанским. Что же может пойти не так? Ну разве что снова придет наш обожаемый друг:

На этот раз он утверждает, что проведет свое исследование об отваре ольховых шишек с блэкджеком и крошечным p-value. А еще попросит 98 своих друзей провести такие же исследования на других выборках. И, разумеется, обещает опровергнуть наши результаты. Или наоборот получит настолько значимый результат, что о нашем исследовании никто и не вспомнит.

Конечно, нам нечего бояться, ведь наша выборка репрезентативна [об этом в другой раз], объем выборки достаточен, а результаты достоверны.

Или нет?

Кажется, пришло время снова обратиться к статистике.

Сто экспериментов над ольховыми шишками: как доверять доверительному интервалу, image #1

Итак, будут ли отличаться результаты других исследований от нашего (мы подразумеваем, что все исследования качественные и проведены по одинаковой методике)?

А если будут, то как сильно, и сможет ли эта новая информация сказаться на доверии к нашим результатам?

В предыдущей статье мы пытались найти различия в продолжительности заболевания между группой контроля (не получавшей лечения отваром шишек) и экспериментальной группой (лечившейся отваром шишек). Что составило 15 и 12 дней соответственно.

Мы формулировали нулевую гипотезу (отсутствие эффекта от приема отвара ольховых шишек), затем мы оценивали вероятность получить наблюдаемые различия при условии, что нулевая гипотеза верна. Если эта вероятность была меньше уровня α, мы отвергали нулевую гипотезу и делали вывод, что различия статистически значимы.

При таком подходе мы всегда получаем только качественный результат: либо отклоняем нулевую гипотезу, либо не отклоняем; либо признаем различия статистически значимыми, либо не признаем. Количественно оценить различия при таком подходе мы не можем.

Стоит отметить, что вероятность выявления различий меняется не только от их абсолютной величины, но и от размера выборки. Даже самые неуловимые на практике различия при достаточно большой численности групп могут оказаться статистически значимыми или, как это принято называть у нас — ученых, «высоко достоверными». При этом речь может идти о разнице в несколько часов заболевания, миллиметрах ртутного столба, днях продолжительности жизни.

Для устранения такой полярности в оценке исследования и отражения всей совокупности возможностей изменений нам и понадобится доверительный интервал.

Что такое доверительный интервал?

Доверительный интервал (ДИ) он же Confidence interval (CI)диапазон значений, в котором с определенной вероятностью будут находиться результаты нашего исследования при многократном повторении эксперимента.

Данная вероятность, как правило, равна одному минус ошибка первого рода (1-α) [подробнее про ошибку первого рода вы можете узнать из нашей предыдущей статьи или в глоссарии].

То есть при принятой альфа-ошибке в 0,05, доверительный интервал будет 1-0,05 = 0,95 или 95%. Это значит, что в 95% исследований результат будет сопоставим с нашим.

ДИ не обязательно равен 95%, он может быть как меньше, так и больше, отличие лишь в том, на какую вероятность ошибки готовы пойти исследователи и какова величина разброса полученных данных их интересует.

Откуда взять границы?

Если дальше вам будет непонятно, откуда мы взяли те или иные цифры и понятия – не переживайте, для понимания доверительного интервала это не критично и обо всем мы расскажем в других статьях.

Для этого нам нужно ввести понятия стандартной и предельной ошибок.

  • Стандартная ошибка (standart error) она же ошибка репрезентативности (обозначается как SE, SEM, m) – она показывает, насколько может отличаться какой-то параметр нашей выборки от аналогичного параметра генеральной совокупности.
Для тех, кто совсем не понимает о чем речь: под генеральной совокупностью понимают все объекты, подходящие под критерии включения нашего исследования, то есть в нашем случае вообще всех людей в мире, кто мог бы лечиться или не лечиться отваром шишек. Выборочная же совокупность – это непосредственно те, кто вошел в наше исследование.

Высчитывается как среднее квадратичное отклонение (δ или sd) деленное на корень из размера выборки (n).

Сто экспериментов над ольховыми шишками: как доверять доверительному интервалу, image #2
  • Предельная ошибка (обозначается как Δ) – она же показывает, с определенной степенью вероятности, максимальное значение, на которое какой-то параметр нашей выборки от аналогичного параметра генеральной совокупности.

То есть в отличие от стандартной, предельная ошибка показывает не только выраженность возможного отклонения нашего параметра от настоящего, но и вероятность этого отклонения.

Вычисляется путем умножения SE на критерий Стьюдента.

Критерий Стьюдента – это сложное понятие, являющееся по сути еще одним методом для проверки гипотез, об этом обязательно будет отдельная статья, но пока нам хватит знать того, что с точки зрения статистического описания критерий Стьюдента равный 2 соответствуют доверительному интервалу в 95%.

Итак, при ДИ в 95% критерий Стьюдента принимают за 2. Для ДИ 99% - 3. Для ДИ 90% - 1.

Сто экспериментов над ольховыми шишками: как доверять доверительному интервалу, image #3
Учитывая, что предельная ошибка показывает лишь изменение в одну сторону, границы доверительного интервала составляют +/- предельная ошибка.

Допустим для нашего примера, мы получили стандартную ошибку в 0,63. Тогда предельная ошибка будет 2*0,63=1,26. Таким образом, при нашем результате в 12 дней, доверительный интервал с 95% вероятностью включает значения от 10,74 до 13,26.

Сто экспериментов над ольховыми шишками: как доверять доверительному интервалу, image #4
Примеры записи в исследованиях: 95% ДИ, 10,74 – 13,26 или 95% ДИ, 12±1,26.

Это значит, если наш друг и его 98 друзей проведут свое исследование, то c вероятностью в 95% они получат результаты в диапазоне от 10,74 до 13,26.

Если же даже такой вероятности нам покажется мало и мы захотим 99%, то, просто умножим 0,63 на 3. В таком случае ДИ будет включать значения от 10,11 до 13,89. Как видно ради большей уверенности нам придется несколько пожертвовать точностью результата.

Также напомним, что в группе контроля продолжительность болезни составляла 15 дней, а значит, нашей нулевой гипотезой было то, что прием отвара ольховых шишек не уменьшает это число. Как видно из получившегося у нас ДИ, ни одно из значений не соответствует показателю нулевой гипотезы, а значит, мы снова опровергли нулевую гипотезу и убедились в эффекте отвара.

Таким образом, мы снова достаем шампанское, потому что подтвердили нашу гипотезу, но теперь еще и понимаем, что с вероятностью в 95% результаты нашего друга попадут в указанный интервал. Да, есть еще 5%, но нам придется с ними смириться, так уж заведено.

Итоги:

  • Доверительный интервал сообщает о том диапазоне значений, в котором должен находиться истинный результат с определенной вероятностью.
  • Если интервал содержит показатель соответствующий нулевой гипотезе, то мы не имеем права ее отвергнуть, или даже можем подтвердить.
  • Если наберем 100 исследований с ДИ 95%, то 5 из них могут не содержать наши показатели или включать показатели нулевой гипотезы.
  • Напротив, 95% доверительный интервал может и не содержать истинного значения, однако, как правило, он его содержит — а именно, в 95% случаев.
  • Чем шире интервал, тем больше к нему доверия, но тем менее конкретные результаты он показывает.
  • Если статистическая значимость обнаружена благодаря большому объему выборки, а не величине эффекта, доверительный интервал укажет на это.
  • Не все авторы публикаций балуют читателя доверительными интервалами, но обычно все же указывают численность групп, средние величины и их стандартные ошибки. Для таких случаев держите небольшой лайфхак: воспользуйтесь формулами, приведенными выше и постройте доверительный интервал сами. Этого часто достаточно, чтобы понять, имеет исследование сугубо академическую или еще и практическую ценность.
1376 views·47 shares