Что естественно — то не сверхъестественно: нормальное распределение

Александр Сойнов & Александр Кулябин

Дисклеймер: некоторые понятия, упоминаемые далее, были описаны в наших предыдущих статьях. Вот они, кстати:

Без этого можешь даже не пытаться читать эту статью, заходить на наш паблик в принципе, и вообще, наверно, тебе стоило бы уйти из медицины. Шутка.

Прочитали все статьи? Нет? Ну хотя бы в глоссарий загляните.

Введение

Ну что ж. В прошлых статьях мы попытались разобраться с основными понятиями описательной статистики (скажу еще раз - повторите понятия мер центральной тенденции и мер изменчивости) и теперь можем описать имеющиеся данные как с точки зрения выраженности, так и с точки зрения изменчивости переменных. В этот раз мы посмотрим как наши данные распределяются в популяции.

Спойлер: в основном, нормально.

В этот раз мы опять отойдем от лирики к физике. Да, тут будут формулы (на самом деле одна) и непонятные символы. Готовьтесь.

Что естественно — то не сверхъестественно: нормальное распределение, image #1

Сегодня мы познакомимся с таким понятием как нормальное распределение. Данный термин описывает частоту встречаемости проявлений признака в популяции.

Почему распределение нормальное? Что такое норма? Что мы можем считать нормальным? На самом деле, данные понятия не нуждаются в сложных трактовках.

С точки зрения статистики, да и вообще науки в целом, нормальность - это соответствие, как ни странно, общепринятой норме, то есть показателям подавляющего большинства измерений. Однозначных критериев нормы не существует и в каждом отдельном случае критерии нормы могут варьировать в широком диапазоне. Но для подавляющего большинства популяций, количественные переменные какого бы то ни было признака укладываются в следующий график:

Что естественно — то не сверхъестественно: нормальное распределение, image #2

На нем мы видим, что большинство признаков будет располагаться на расстоянии 2 сигм от среднего (для тех, кто так и не прочитал предыдущие статьи и не знает, что такое сигма - то это квадратный корень из дисперсии. Надеюсь, вам стало понятнее, лентяи).

Так что такое нормальное распределение?

Нормальное распределение - это унимодальное, симметричное распределение, в котором отклонения от среднего подчиняются определенному вероятностному закону.

Закон этот зовется правило “двух” и “трех” сигм и говорится в нем что:

  1. 68% наблюдений находится в диапазоне плюс/минус одна сигма;
  2. 95% наблюдений находится в диапазоне плюс/минус две сигмы;
  3. почти 100% наблюдений находится в диапазоне плюс/минус три сигмы.

Почему нам важно понимать этот закон? Потому что, к счастью, мы живем в скучном и предсказуемом мире, где все протекает по подобным этому правилам, что позволяет нам быть уверенными в познаваемости мира в принципе (или хотя бы тщетно убеждать себя в этом).

Любые количественные параметры в совокупности, такие как рост, вес, количество потребляемой еды и прочие характеристики распределены в основном нормально, что позволяет нам предполагать выраженность изменчивости в описываемой популяции, и не видя ее всю, судить о репрезентативности выборки. А еще мы можем, увидев график распределения, даже судить о таких казалось бы философских понятиях, как норма (даже если Елена Малышева уже все сделала за нас).

Что естественно — то не сверхъестественно: нормальное распределение, image #3

Все это здорово, но пока была лишь лирика, скажете вы, где обещанные формулы (которая одна)?

Давайте познакомимся еще с одной штукой и после этого вы поймете насколько могущественную силу вы обрели.

Мы поговорим о Z-стандартизации.

Что за Z-стандартизация?

Z-стандартизация - это такое преобразование данных, которое позволяет перевести любую нашу шкалу в следующий тип, где среднее значение будет равняться 0, а стандартное отклонение 1.

Какой бы мы признак не измеряли, мы всегда можем представить наши данные таким образом. Для чего это нужно - будет понятно позднее.

Зачем это нужно, расскажем позднее, а пока для того, чтобы преобразовать наши данные в Z шкалу нам поможет вот такая формула:

Что естественно — то не сверхъестественно: нормальное распределение, image #4
Xi - значение показания конкретного исследуемого;
X - среднее значение по выборке;
S - стандартное отклонение по выборке.

Выглядит не сложно, правда? Но для чего она нам?

Чтобы лучше понять, давайте разберемся на конкретном примере:

Представим ситуацию, у нас есть некоторое общество веселых людей (разумеется, живущих в Петербурге), в котором средний объем потребления огненной воды равен 40 литрам в год.

Что естественно — то не сверхъестественно: нормальное распределение, image #5

Допустим, нам стало интересно, какой процент людей из нашей выборки употребляет более 44 литров в год, потому что по данным некоторых исследований при данном объеме значимо увеличивается вероятность развития цирроза печени (или алкогольного делирия).

Что естественно — то не сверхъестественно: нормальное распределение, image #6

Пользуясь знаниями из предыдущих статей, мы вычислили, что стандартное отклонение (sd, или σ) равно для нашей выборки 8.

Что естественно — то не сверхъестественно: нормальное распределение, image #7

А теперь, исходя из определения Z-преобразования, сделаем график таким, чтобы среднее значение было равно нулю, а стандартное отклонение — единице.

Что естественно — то не сверхъестественно: нормальное распределение, image #8
Далее подставим значения в нашу формулу:
Z = (44-40)/8= 0,5.

Отлично, считаем мы очень профессионально. А что нам это дает?

А это дает самое прекрасное, что есть в статистике. Это дает нам универсальный ответ на вопрос, в каком проценте выборки лежат интересующие нас значения. Ведь таким образом мы подводим абсолютно любые возможные числовые выражения какого-либо признака под единый стандарт, для которого великие и занудные ученые умы уже давно сделали таблички расчета.

Они легко гуглятся, одну можно найти вот тут. На примере ниже вы можете посмотреть, как ими пользоваться. В первой колонке выбираем получившееся значения до десятых. А в первой графе указываем сотые (на тот случай, если у нас получилось бы не 0,5, а 0,51 или 0,59).

Что естественно — то не сверхъестественно: нормальное распределение, image #9

Нам подходит число 0,3085.

Это говорит нам о том, что вероятность встретить значение, которое больше 0,5 сигм в Z шкале составляет приблизительно 0,3085.

А если перейти с языка статистики на русский, это значит, что в процент людей, потребляющих более 44 литров огненной воды в неназванной, но отчего-то родной сердцу стране составляет 30,85% процентов.

Что естественно — то не сверхъестественно: нормальное распределение, image #10

Ну, а что делать дальше с полученными данными, как с ними жить и как использовать в науке - решать уже непосредственно вам.

Выводы

  1. Нормальное распределение - это закон, которому подчиняются большинство количественно измеряемых признаков.
  2. Нормальное распределение прямо соответствует правилу “двух” и “трех” сигм,
  3. Z стандартизация представляет собой шкалу, в которой для любых данных среднее значение принимается за 0, а стандартное отклонение за 1.
  4. Z стандартизация позволяет нам ответить на вопрос, какой процент наблюдений в абсолютно любой выборке находится в интересующем нас диапазоне.

Глоссарий:

  1. Нормальное распределение - это закон, которому подчиняются большинство количественно измеряемых признаков. Нормальное распределение подчиняется правилу “двух” и “трех” сигм, то есть 68% наблюдений находится в диапазоне плюс/минус одна сигма; 95% наблюдений находится в диапазоне плюс/минус две сигмы; почти 100% наблюдений находится в диапазоне плюс/минус три сигмы.
  2. Z стандартизация представляет собой шкалу, в которой для любых данных при нормальном распределении среднее значение принимается за 0, а стандартное отклонение за 1. Z стандартизация позволяет нам ответить на вопрос, какой процент наблюдений в абсолютно любой выборке находится в интересующем нас диапазоне.
1255 views·31 shares