Идентификация закона распределения по выборке случайной величины
6.1. Введение.
В данной главе будет рассмотрен вопрос о том, как по эмпирической выборке идентифицировать закон распределения случайной величины.
Подробно рассмотрена проблема группировки данных, то есть расчет оптимального количества интервалов группировки и оптимальной ширины интервала, а также построения по сгруппированным данным гистограммы распределения.
Полученное эмпирическое распределение будет аппроксимировано непрерывной аналитической функцией, то есть будет идентифицирован закон распределения случайной величины. Также рассмотрено использование критериев согласия при идентификации закона распределения.
В качестве выборки случайной величины использована выборка, состоящая из логарифмов относительного изменения величины индекса Российской торговой системы (индекса РТС) за период с 1 сентября 1995 года по 31 декабря 2002 года.
6.2. Группировка данных. Оптимальное число интервалов группировки.
Для расчета оценок математического ожидания, дисперсии, среднеквадратичного отклонения, коэффициента асимметрии и эксцесса (на основе моментов распределения) не требуется предварительного упорядочивания и группировки данных. Эти величины могут быть найдены непосредственно по исходной выборке.
Для определения медианы, квантилей распределения, для удаления промахов из выборки данные необходимо расположить в порядке возрастания, то есть упорядочить выборку.
Группировка данных необходима для того, чтобы найти форму распределения, то есть, в конечном итоге идентифицировать закон распределения.
В результате группировки выборка представляется в виде гистограммы, состоящей из L столбцов (интервалов
группировки), каждый из которых имеет ширину d. После нормирования гистограмма представляет собой эмпирическую плотность распределения случайной величины.
Из качественных соображений следует, что должно существовать оптимальное число интервалов группировки.
Действительно, при большом количестве столбцов и поэтому малой ширине столбца, из-за случайности выборки гистограмма будет заполнена очень неравномерно, иметь сильно изрезанный вид, состоять из большого количества всплесков и провалов.
При другой крайности, то есть очень малом числе столбцов большой ширины, гистограмма будет излишне сглаживать распределение, уничтожать его характерные особенности. Например, если выбрать только один интервал группировки с шириной, равной размаху выборки, то любое распределение сведется к прямоугольному. Два столбца выбирать нельзя, так как любое симметричное распределение, как и в предыдущем случае, сведется к прямоугольному. Три столбца также дают мало информации о форме распределения.
Эти сугубо качественные рассуждения показывают, что должно существовать некоторое оптимальное количество интервалов группировки.
Если исходить из предположения, что генеральная совокупность, из которой получена данная конкретная выборка, имеет гладкую кривую плотности вероятности (это справедливо в большинстве случаев), то неравномерности гистограммы являются случайным шумом, обусловленным случайностью выборки. Увеличение ширины столбца и уменьшение количества столбцов фильтруют этот шум. Однако, дальнейшее увеличение ширины столбца начинает сглаживать уже само распределение.
Следовательно, определение оптимального числа интервалов группировки при построении гистограммы является задачей оптимальной фильтрации. При этом оптимальное количество столбцов гистограммы - это такое количество, при котором максимально возможное сглаживание случайного шума сочетается с минимальным искажением от сглаживания самого распределения.
80
Оптимальное число столбцов должно зависеть не только от объема выборки, как это указано в большинстве пособий по статистике. Очевидно, что это число зависит еще и от формы распределения. Действительно, если плосковершинные распределения можно приблизить достаточно малым количеством столбцов, то для островершинных распределений с их длинными, пологими спадами это количество естественно должно быть больше.
Количество интервалов группировки должно быть нечетным числом. При четном числе столбцов область вблизи центра распределения будет описываться двумя симметрично расположенными относительно центра столбцами гистограммы, тем самым пик распределения будет неоправданно сглаживаться. Это особенно критично для островершинных распределений. Как уже говорилось выше, три столбца дают очень мало информации о форме распределения. Поэтому будем считать, что количество столбцов гистограммы должно быть нечетным числом не менее пяти.
Эмпирическая формула для оценки оптимального количества столбцов гистограммы как функции от объема выборки N и эксцесса S, пригодная к применению для широкого класса распределений следующая:
L = ?±1:1 N
0-
4 6
Вычисленное по этой формуле значение должно быть округлено вниз до ближайшего большего или равного пяти нечетного целого.
Используя значение L, ширину столбца гистограммы
„ , , 2max(| x
k - X |)
можно найти по формуле: d =-l-
6.3. Построение гистограммы распределения.
Изложим алгоритм построения гистограммы по выборке случайных величин {x
k}, k = 1,...,N :
1) Упорядочить исходную выборку по возрастанию.
2) Вычислить оценки центра распределения:
81
^-медиана? У*-центр_сгибов?
ХМ<
у у х
У*- 3 У*- 50% 5 У*-центр_размаха-
Упорядочить эти оценки по возрастанию и выбрать из них в качестве центра распределения серединное, то есть третье по счету, значение, которое обозначить как Хц
ЕНТР.
3) Вычислить оценку среднеквадратичного отклонения
1У
(Хк -
1 к=1
)
2
ЦЕНТР
N-1 к
4) Вычислить оценку эксцесса N
2 - 2 N + 3
N
?(Хк - Х
)
4 -
L ЦЕНТР
- 3(2N - 3)(N -1)
N(N - 2)(N - 3)
5) Вычислить коэффициент цензурирования G = 1.55 + 0.8 • lg( N/10) -VS-1
6) Исключить из выборки все значения (промахи), лежащие за пределом интервала
XЦЕНТР
- G •
а —
—
ЦЕНТР +
G •
а
Если в выборке присутствовали промахи, то ее объем уменьшился. Обозначим как {х
к}, к = 1,...,M очищенную от промахов выборку (M — N) . Все дальнейшие операции будут проводиться с очищенной выборкой.
7) Заново вычислить параметры распределения
1У
(Хк
-
1 к=1
у)
2
M-
(Хк - X)
3
(M - 1)(M - 2)
82
M - 2M + 3
Z (- X )
4 -
a (M - 1)(M - 2)(M - 3) k-l
3(2M - 3)(M -1)
M(M - 2)(M - 3)
8) Рассчитать оптимальное количество столбцов гистограммы
L =
е±
15 M“
6
Полученное число округлить вниз до ближайшего большего или равного пяти нечетного целого.
9) Рассчитать левую и правую границы гистограммы
Xmin =
X - max(l
Xk
- X l
)
Xmax =
X +
max(| Xk
- X |)
10) Рассчитать ширину столбца гистограммы
d =
Xmax
- Xmin =
2max(| X
k - X [)
LL
11) Рассчитать массив узлов разбиения на оси х X
t = Xmin + (/ - 1) • d
i = 1,..., L +1
Интервалы между соседними узлами являются интервалами разбиения.
12) Рассчитать количество случайных величин из выборки {x
k }, k = 1,...,M, которое попадает в каждый из интервалов
разбиения. В результате получится ненормированная гистограмма распределения или гистограмма частот. Она задана в виде массива, который обозначим как
{St}, i = 1,..., L .
13) В случае, если есть основания полагать, что плотность вероятности должна быть симметричной, и в подтверждение этого, вычисленный на шаге 7 коэффициент асимметрии незначительно отличается от нуля, то можно провести расчетное симметрирование гистограммы. Центральный столбец остается без изменения, а в симметричных
83
относительно него парах столбцов количество отсчетов усредняется.
14) Вычислить площадь S ненормированной гистограммы. Она должна быть равна произведению ширины столбца d на объем выборки M.
15) Нормировать гистограмму путем деления количества отсчетов в каждом столбце на S. Таким образом на этом шаге получена гистограмма плотности вероятности:
p
t = s / S = s /(d • M) i = 1,-,
L
16) Рассчитать значения интегральной функции распределения в узлах разбиения
F1 = 0
Fr =
F, -1 + Pi-1 •
d
i = 2,..., L +1
Фактически, на этом шаге мы получили функцию распределения в табличном виде, то есть мы имеем массив значений случайной величины {X
i} и соответствующий
ему массив значений {F
i}, i = 1,..., L +1.
6.4. Гистограмма логарифмов относительных изменений индекса РТС.
Рассмотрим временной ряд, состоящий из
последовательных значений цены некоторого актива {P
t},t = 0,...,T. Тогда цену в момент времени Т можно представить, как
P P P P
р = р l_Ll2 t
1 t
T 0 P P " P " P
'0
J1
1 t-1
1 T-1
Движение цены актива - это случайный процесс, вызванный действиями большого количества участников рынка. Предположим, что отношения цен активов в любой момент времени являются случайными величинами с одинаковым законом распределения.
84
Тогда по выборке этих случайных величин, которая может быть получена из ценового ряда, можно определить их закон распределения.
Но исследовать непосредственно отношение цен представляется не совсем удобным. Дело в том, что так как цена не может упасть ниже нуля, то отношение цен также не может быть меньше нуля. С другой стороны, цена может сколь угодно сильно вырасти, то есть отношение цен может быть неограниченно большим. Этих качественных рассуждений достаточно, чтобы понять, что плотность вероятности отношения цен будет иметь положительную асимметрию. Однако, если мы перейдем к логарифмам отношения цен, ситуация изменится.
P P P P
ln( Pt ) - ln(Po) = ln(
P) + ln(P) +... + lnP-) +... + ln(
PPL-)
P0
P Pt-1
PT-1
Распределение логарифмов уже может быть симметрично и возможна его аппроксимация одним из аналитических законов распределения, которые были рассмотрены во второй главе.
В качестве примера ценового ряда рассмотрим индекс Российской торговой системы (индекс РТС) за период с 1 сентября 1995 года по 31 декабря 2002 года. График этого ряда изображен на рисунке:
Индекс РТС
|

|
Исследуемой выборкой случайных величин будут натуральные логарифмы отношения цен закрытия индекса РТС.
85
Подробный алгоритм вычисления параметров распределения, построения графиков плотности распределения и функции распределения рассмотрен в предыдущем параграфе, поэтому здесь приведем только результаты.
Наименование оценки
|
Величина
|
Центр распределения (математическое
|
0.0007
|
ожидание)
|
|
Среднеквадратичное отклонение
|
0.0324
|
Коэффициент асимметрии
|
-0.3064
|
Эксцесс
|
7.4301
|
Плотность вероятности
|

|
Функция распределения
|

|
86
Отметим, что с.к.о. превышает математическое ожидание более чем в 46 раз, то есть исследуемая случайная величина является высоковолатильной. Распределение имеет очень небольшую отрицательную асимметрию, которая вероятно носит случайный характер, поэтому гистограмма плотности вероятности была центрирована.
Эксцесс распределения существенно превышает эксцесс нормального распределения, то есть данное распределение является островершинным.
Гистограмма распределения имеет 27 столбцов. Для большей наглядности плотность вероятности приведена не в виде гистограммы, а как плавная линия, проходящая через середины интервалов разбиения.
6.5. Использование критериев согласия при идентификации закона распределения случайной величины.
После построения гистограммы распределения можно выдвинуть гипотезу о том, что данная гистограмма может быть аппроксимирована одним из изученных ранее законов распределения. При этом степень близости гистограммы и принятой аналитической модели может быть проверена с использованием критериев согласия. Здесь будет рассмотрен один из этих критериев - критерий X Пирсона.
При использовании критерия согласия Пирсона необходимо вычислить величину:
(Ti - S)
Ti
х
2 =І
І=1
где
L - количество столбцов гистограммы,
s
i - фактическая частота попадания в i-й столбец,
T
i - теоретическая частота попадания в i-й столбец.
Для идеально подобранной модели все разности (T
i — s
i) равны
нулю и, следовательно, величина X также равна нулю. Таким образом, ненулевое значение X является мерой суммарного расхождения между фактическим распределением и моделью.
87
Насколько велико это расхождение можно проверить, сравнив фактическое значение X с теоретической величиной X
-q ?,
которая определяет максимально возможное расхождение между фактическими данными и моделью, соответствующее принятому уровню значимости q.
Уровень значимости q определяет вероятность ошибки 1-го рода, то есть вероятность того, что будет отвергнута не противоречащая эмпирическим данным модель.
Величина ? - это число степеней свободы X -распределения. Число степеней свободы зависит от количества столбцов гистограммы эмпирических данных L и количества параметров г, описывающих теоретическую модель: ? = L -1 - r.
Величина X
-q ? - это такая квантиль X-распределения, что 100(1 — q) процентов всех значений случайной величины X лежат слева от X\
-q ?, а 100q процентов всех значений случайной величины X лежат справа от X
2-q ? .
Если X
2 — X\
-q ?, то считают, что модель не противоречит фактическим данным при заданном уровне значимости.
Если X
2 > X
12-q ?, то считают, что при заданном уровне
значимости модель не описывает удовлетворительным образом фактические данные и должна быть отвергнута.
Следует особо подчеркнуть, что при проверке модели по критерию согласия определенным является лишь отрицательный ответ, то есть отклонение модели.
Положительный ответ означает лишь то, что модель не противоречит эмпирическим данным. Это вовсе не означает, что именно этой моделью данные описываются на самом деле, что это наилучшая модель, что нельзя подобрать другую модель для описания данных и т.д. Фактически, положительный ответ при проверке по критерию согласия следует понимать как "возможно эти данные описываются такой-то моделью", и не более того.
88
Вернемся к полученной в предыдущем параграфе гистограмме натуральных логарифмов относительного изменения цены закрытия индекса РТС.
Гистограмма имеет ярко выраженный пик и достаточно пологие спады. Островершинность подтверждается еще и значением эксцесса, существенно превышающим эксцесс нормального распределения. Как нам уже известно, распределения с подобными характеристиками могут быть описаны обобщенным экспоненциальным распределением с показателем степени меньше двух.
Выдвинем гипотезу о том, что фактическое распределение описывается моделью
a
2 Г (1 /а)Ло
Р
( х)
- да < x < +да
где
математическое ожидание ц = 0.0007 среднеквадратичное отклонение о = 0.0324 показатель степени a = 0.87
Показатель степени был найден из значения оценки эксцесса распределения, так как для обобщенного экспоненциального распределения показатель степени и эксцесс имеют взаимно однозначное соответствие:
? = Г (1/ а) Г (5 / а) /[ Г (3 / а)]
2
Исследуемое эмпирическое распределение имеет 27 столбцов. Аналитическая модель имеет 3 параметра. Следовательно, число степеней свободы для критерия Пирсона равно v = L -1 - r = 27 -1 - 3 = 23.
Фактические и теоретические частоты попадания в столбцы гистограммы дадим для наглядности в графическом виде.
89
Распределение фактических и теоретических частот
|
¦ Фактическая
|
600 -|
500 -
|
|
частота
|
*
|
.......Теоретическая
|
400/-
|
|
частота
|
30#-
|
V
|
|
2Р0 -
|
'¦
|
*
|
О
О
|
t
|
4-4
1-—1—
|
0
|
|
|
-0.20 -0.15 -0.10 -0.05 0.00 0.05 0.10 0.15 0.20
|
Фактическое значение %
2 = 35.635. Проверим гипотезу о
том,
что X
2 -X1-q,v
H0
: X
2 — X1-q, V
H1 ¦
X >
X 1-q, V
Пусть уровень значимости q = 0.01. Тогда граница критической области вычисляется как: xl
qV = ХИ2ОБР(0.01, 23) = 41.638
Так как х
2 — X\
-q V, то исследуемое распределение при
заданном уровне значимости можно аппроксимировать обобщенным экспоненциальным распределением.
В заключении следует сказать, что для ликвидных российских акций, торгующихся в РТС, таких как РАО ЕЭС, Лукойл, Сургутнефтегаз, Ростелеком, Мосэнерго,
распределения логарифмов относительного изменения цены закрытия также можно описать обобщенным экспоненциальным распределением с соответствующим математическим ожиданием, среднеквадратичным отклонением и показателем степени.