16. Показатели центра распределения. Статистическое изучение вариации: показатели вариации и методы их расчета

Для определения средних или наиболее типичных значений совокупности используются показатели центра распределения. Основные из них – математическое ожидание, среднее арифметическое, среднее геометрическое, среднее гармоническое, степенные средние, взвешенные средние, центр сгиба, медиана, мода.
Расчёт средних величин производится разными способами, и, соответственно, применение их тоже зависит от исследуемой совокупности.
У симметричного одномерного унимодального распределения математическое ожидание, медиана и мода одинаковы.
Математическое ожидание
 .
В статистике применяется выборочное среднее:
 .
Преимущества: если эксперимент повторяется многократно, а результаты суммируются (например, в страховании, азартных играх), математическое ожидание — естественный выбор.
Недостатки: не соответствует интуитивному пониманию «среднего»; меньшинство с аномальными значениями (долгожители, миллиардеры, бракованные изделия и т. д.) серьёзно смещают матожидание. В статистических расчётах рекомендуется отбрасывать такой «хвост».
Медиана. У одномерного распределения медиана — квантиль уровня 0,5. То есть, такое число  , что  . (Или  .)
Преимущества: Медиана согласуется с интуитивным пониманием «среднего». К тому же, даже очень «дикие» выбросы изменяют медиану незначительно. Например, если к сотне бедняков (доходы равномерно распределены от 0 до 1 $) добавить одного миллиардера (1 млрд $), среднее сместится от 0,5 $ до 10 млн $, в то время как медиана — от 0,5 $ до 0,505. Монотонная функция не изменяет медиану — для любой монотонной  будет выполняться  .
Недостатки: плохо работает для многомерных распределений со сложной взаимосвязью компонентов. Сложна в расчёте.
Мода — точка, в которой плотность распределения имеет локальный максимум. Распределение может иметь несколько мод.
Преимущества: позволяет работать с данными нечисловой природы.
Недостаток: не учитывает поведение распределения в других точках.

Вариацию можно определить как количественное различие значений одного и того же признака у отдельных единиц совокупности. Термин "вариация" имеет латинское происхождение - variatio, что означает различие, изменение, колеблемость. Изучение вариации в статистической практике позволяет установить зависимость между изменением, которое происходит в исследуемом признаке, и теми факторами, которые вызывают данное изменение.
Для измерения вариации признака используют как абсолютные, так и относительные показатели.
К абсолютным показателям вариации относят: размах вариации, среднее линейное отклонение, среднее квадратическое отклонение, дисперсию.
К относительным показателям вариации относят: коэффициент осцилляции, линейный коэффициент вариации, относительное линейное отклонение и др.
Размах вариации R. Это самый доступный по простоте расчета абсолютный показатель, который определяется как разность между самым большим и самым малым значениями признака у единиц данной совокупности:

 

Размах вариации (размах колебаний) - важный показатель колеблемости признака, но он дает возможность увидеть только крайние отклонения, что ограничивает область его применения. Для более точной характеристики вариации признака на основе учета его колеблемости используются другие показатели.
Среднее линейное отклонение d, которое вычисляют для того, чтобы учесть различия всех единиц исследуемой совокупности. Эта величина определяется как средняя арифметическая из абсолютных значений отклонений от средней. Так как сумма отклонений значений признака от средней величины равна нулю, то все отклонения берутся по модулю.
Формула среднего линейного отклонения (простая)

 

Формула среднего линейного отклонения (взвешенная)

 

При использовании показателя среднего линейного отклонения возникают определенные неудобства, связанные с тем, что приходится иметь дело не только с положительными, но и с отрицательными величинами, что побудило искать другие способы оценки вариации, чтобы иметь дело только с положительными величинами. Таким способом стало возведение всех отклонений во вторую степень. Обобщающие показатели, найденные с использованием вторых степеней отклонений, получили очень широкое распространение. К таким показателям относятся среднее квадратическое отклонение   и среднее квадратическое отклонение в квадрате  , которое называют дисперсией.
Средняя квадратическая простая

 
Средняя квадратическая взвешенная

 

Дисперсия есть не что иное, как средний квадрат отклонений индивидуальных значений признака от его средней величины.
Формулы дисперсии взвешенной и простой:

 

Расчет дисперсии можно упростить. Для этого используется способ отсчета от условного нуля (способ моментов), если имеют место равные интервалы в вариационном ряду.
Кроме показателей вариации, выраженных в абсолютных величинах, в статистическом исследовании используются показатели вариации (V), выраженные в относительных величинах, особенно для целей сравнения колеблемости различных признаков одной и той же совокупности или для сравнения колеблемости одного и того же признака в нескольких совокупностях.
Данные показатели рассчитываются как отношение размаха вариации к средней величине признака (коэффициент осцилляции), отношение среднего линейного отклонения к средней величине признака (линейный коэффициент вариации), отношение среднего квадратического отклонения к средней величине признака (коэффициент вариации) и, как правило, выражаются в процентах.
Формулы расчета относительных показателей вариации:
 
вариация себестоимость производство дисперсия
где Vr - коэффициент осцилляции; Va - линейный коэффициент вариации;  - коэффициент вариации.
Из приведенных формул видно, что чем больше коэффициент V приближен к нулю, тем меньше вариация значений признака.
В статистической практике наиболее часто применяется коэффициент вариации. Он используется не только для сравнительной оценки вариации, но и для характеристики однородности совокупности. Совокупность считается однородной, если коэффициент вариации не превышает 33% (для распределений, близких к нормальному).
Виды (показатели) дисперсий и правило их сложения
В статистическом исследовании очень часто бывает необходимо не только изучить вариации признака по всей совокупности, но и проследить количественные изменения признака по однородным группам совокупности, а также и между группами. Следовательно, помимо общей средней для всей совокупности необходимо просчитывать и частные средние величины по отдельным группам.
Различают три вида дисперсий:
•    общая;
•    средняя внутригрупповая;
•    межгрупповая.
Общая дисперсия характеризует вариацию признака всей совокупности под влиянием всех тех факторов, которые обусловили данную вариацию. Эта величина определяется по формуле

 
где  - общая средняя арифметическая всей исследуемой совокупности.
Средняя внутригрупповая дисперсия свидетельствует о случайной вариации, которая может возникнуть под влиянием каких-либо неучтенных факторов и которая не зависит от признака-фактора, положенного в основу группировки. Данная дисперсия рассчитывается следующим образом: сначала рассчитываются дисперсии по отдельным группам, затем рассчитывается средняя внутригрупповая дисперсия:

 

где ni - число единиц в группе
Межгрупповая дисперсия (дисперсия групповых средних) характеризует систематическую вариацию, т.е. различия в величине исследуемого признака, возникающие под влиянием признака-фактора, который положен в основу группировки. Эта дисперсия рассчитывается по формуле

 

где  - средняя величина по отдельной группе.
Все три вида дисперсии связаны между собой: общая дисперсия равна сумме средней внутригрупповой дисперсии и межгрупповой дисперсии:

 

Данное соотношение отражает закон, который называют правилом сложения дисперсий. Согласно этому закону (правилу), общая дисперсия, которая возникает под влиянием всех факторов, равна сумме дисперсий, которые появляются как под влиянием признака-фактора, положенного в основу группировки, так и под влиянием других факторов. Благодаря правилу сложения дисперсий можно определить, какая часть общей дисперсии находится под влиянием признака-фактора, положенного в основу группировки.