Бесконечность и предел: центральная предельная теорема
Александр Кулябин & Александр Сойнов
По традиции перед началом чтения этой статьи рекомендуем ознакомиться с предыдущими из нашего статистического цикла:
- Для чего придумали P-value
- Зачем нужен Hazard Ratio
- Как доверять доверительному интервалу
- Что такое генеральная совокупность
- Как понять, какие данные мы используем
- Что измеряют меры центральной тенденции
- Меры изменчивости
- Квартили распределения
- Нормальное распределение
Введение
Разобравшись с нормальным распределением (можешь пройти по ссылке, но знай, что возможно придется углубиться еще дальше), мы можем определить вероятность того, что отклонения от среднего превысят определенную величину, интересную нам.
И сегодня, держа в уме свойства нормального распределения, мы познакомимся с базовой идеей, лежащей в основе статистической проверки гипотез, а именно с центральной предельной теоремой.
Суть теоремы
Центральная предельная теорема (ЦПТ) — теорема, утверждающая, что сумма достаточно большого количества слабо зависимых случайных величин, имеющих примерно одинаковые масштабы (ни одно из слагаемых не доминирует, не вносит в сумму определяющего вклада), имеет распределение, близкое к нормальному.
Что это значит для нас? Давайте для примера возьмем график из предыдущей статьи, на котором отмечено распределение некоего признака (употребления огненной воды в одной небезызвестной стране). В данном случае средним значением является 40 (литров в год), а стандартное отклонение равно 8. Допустим, что данный график отражает генеральную совокупность и содержит абсолютно все значения искомого признака.
А теперь представим, что какой-то аспирант в данной неназванной стране решает написать работу про потребление огненной воды в своей области. Разумеется, ничьих средств и возможностей (а уж тем более аспирантской стипендии) не хватит для того, чтобы изучить все население даже одного своего города, не говоря уж о чем-то большем. И, следовательно, аспирант набирает себе выборочную совокупность из доступных ему испытуемых. Ну и раз уж мы начали фантазировать, давайте придумаем еще трех аспирантов, которые решили заняться тем же самым. А далее мы посмотрим на результаты работы наших выдуманных деятелей науки.
Как видим, в целом их результаты схожи, но различаются по среднему арифметическому, а также они могут отличаться и по величине стандартного отклонения. Кажется, вот тут-то старушка статистика и проиграла, но все, кто читал наши предыдущие статьи, понимают, что это не так, а далее мы лишь объясним, на основании чего это работает.
Да, в каждом индивидуальном случае показатели отличаются от значений генеральной совокупности. Но давайте вынесем на график уже не индивидуальные значения, а сами выборочные. Так вот, сопоставив наши выборочные средние и найдя среднее значение по получившейся совокупности, мы найдем, что оно уже не так уж сильно отличается от среднего для генеральной совокупности.
А именно: (41+39+42+39,8) /4 = 40,45.
Оно до сих пор не идеально соответствует истинному среднему значению генеральной совокупности, но поверьте, это лишь из-за нашей скудной фантазии (надо было придумать больше аспирантов). Таким образом, увеличивая размеры выборок и их количество, мы будем все ближе приближаться к значениям генеральной совокупности.
Также посмотрев на получившиеся графики, мы видим, что некоторые значения отклоняются от истинного в большую сторону, а какие-то в меньшую. В данном случае стандартное отклонение этих выборочных средних от истинного среднего значения будет называться стандартной ошибкой среднего, о которой чуть позже. Как и обычное стандартное отклонение, оно показывает, насколько в среднем выборочные значения отклоняются от истинного среднего генеральной совокупности.
Практическое применение ЦПТ
К сожалению (или к счастью) не так часто находится набор аспирантов, изучающих одну и ту же тему в одно и то же время, поэтому все исследователи обычно работают лишь с одной своей выборкой. А это значит, что мы никак не можем на основании своего выборочного среднего выяснить истинное среднее генеральной совокупности. Или можем?
В теории, при условии того, что исследуемый нами признак в генеральной совокупности имеет нормальное распределение с некоторым значением стандартного отклонения, мы в теории можем извлекать из совокупности выборки определенного объема (n), и в каждой выборке рассчитывать среднее арифметическое, после чего строить распределение этих выборочных средних.
И самое удивительное, что такое распределение выборочных средних тоже (что на самом деле абсолютно логично) будет являться нормальным. А его среднее будет совпадать или очень близко приближаться к среднему генеральной совокупности.
Стандартное отклонение этого распределения (которое теперь называется стандартной ошибкой среднего) будет рассчитываться по формуле:
В случае если размер выборки больше 30 и наша выборка репрезентативна, то мы можем заменить сигму на обычное стандартное отклонение (sd). Почему именно 30 мы постараемся рассказать в другой раз, но пока нам хватит знания, что это число считается пределом, меньше которого шанс получить слишком отличающиеся средние выборок от истинной средней кажется нам недопустимо большим.
Формула совсем не страшная для постоянных читателей наших статей, а главное, по ней понятно, что увеличивая n (объем выборки), мы уменьшаем ошибку среднего. Ну и разумеется сама изменчивость признака в генеральной совокупности (δ или sd) тоже оказывает влияние на размер стандартной ошибки среднего.
А теперь главное следствие из ЦПТ
Представим, что мы извлекли лишь одну выборку. Число наблюдений возьмем за 100 (для красоты), а стандартное отклонение было равно 8.
Тогда стандартная ошибка равна 8/√100 = 8/10=0,8
Ну в общем-то и все. Что это нам дает? А дает это нам то, что мы можем имея лишь ОДНУ выборку сказать о том, как вели бы себя другие выборки.
А именно, средние других выборок располагались бы вокруг нашей средней со стандартным отклонением равным 0,8. Мы до сих пор не можем сказать, какая именно из выборочных средних соответствует истинной средней для генеральной совокупности, но полученного нами интервала тоже вполне достаточно.
Ну и последний момент. Тот, кто дочитал статью до конца и даже понял о чем идет речь, наверно, задается вопросом: а почему все время говорится о нормальном распределении? А если признак распределен ненормально? Наш ответ прост, центральная предельная теорема работает и в таком случае. И магия тут заключается в том, что несмотря на ненормальность самого распределения генеральной совокупности, распределение его выборочных средних будет нормальным и их среднее точно также будет приближаться в истинному среднему генеральной совокупности.
Итоги
- Центральная предельная теорема показывает нам, почему на примере выборки мы можем строить выводы о генеральной совокупности.
- Центральная предельная теорема работает как при нормальном, так и при ненормальном распределении в генеральной совокупности.
- Степень соответствия среднего выборки растет при увеличении объема выборки.
- Стандартная ошибка среднего показывает, насколько в среднем выборочные средние отклоняются от истинного среднего генеральной совокупности.
P.S.: Это была наша последняя статья по базовым понятиям статистики в этом учебном году. Надеемся, хотя бы кому-то хотя бы чуть-чуть был полезен этот цикл. Но даже если нет, мы постараемся вновь вернуться к теме статистики, чтобы углубиться в ее бездонные глубины снова. Всем спасибо, все свободны.
