Теория вероятностей и математическая статистика
4.1. Задачи теории вероятностей
Задача 4.1. Задача о лотерейных билетах.
В партии из 19 лотерейных билетов 9 выигрышных. Куплено 12 билетов. Какова вероятность, что среди них 7 выигрышных?
Решение. Здесь используется гипергеометрическое распределение.
s~<d —d
ld
ln-d
Вероятность того, что при покупке n билетов из партии объемом N, в которой имеется D выигрышных, мы получим d выигрышных, равна р
CN
n
m _
^ I)
биномиальный коэффициент, а
Здесь
m\{n - m)\
n\=1 • 2 •... • (n -1) • n, причем 0!= 1!= 1.
Для расчетов воспользуемся программой Maxima.
Биномиальный коэффициент вычисляется при помощи функции birnmial(n,m), где n, m имеют тот же смысл, что и выше.
Вводим команду:
(% і 5 ) ' b іг.опіа 1 (5 г 7 ) * b іпот іа 1 (1G, 5) / b іг.ота 1 (19,12 ) ;
“56
-
4199
Приводим к десятичному виду:
(%І6) float(%);
(%o6J 0.1? 004286734 937
Ответ:. р = 0.18
Задача 4.2. Задача о днях рождения.
Сколько человек должно быть в группе, чтобы вероятность совпадения дней рождения хотя бы у двух человек превышала 0,5?
Решение. Найдем дополнительную вероятность, т.е. вероятность того, что ни у какой пары студентов нет совпадающих дней рождения.
Пусть в группе n студентов. Всего количество размещений к
дней рождения по 365 дням года равно г = 365
й.
Первый человек в группе может иметь т
л = 365 вариантов дня рождения. 2-ой, для того, чтобы его день рождения не совпал с днем рождения первого, может иметь т
2 = 365 -1 = 364 варианта дня рождения, ..., і-й человек может иметь //?, =365- < -1 варианта дня рождения.
Всего вариантов выбора разных дней рождения у n человек имеется
т = \\ <65- i-1
i=1
Вероятность равна p = — или
г
'1-i-О
n С
p = fl
i=1V
365- i-1
|
n |
 |
|
i=1V |
365
365
Нам нужно решить следующее неравенство относительно п:
365
/=Н
При этом нас будет интересовать наибольшее приближение к числу У.
Для решения этого неравенства снова используем программу Maxima.
К сожалению, напрямую решить это неравенство нам не удастся (необходимо составлять хоть и небольшую, но программу, что выходит за рамки данной книги).
Тем не менее, можно применить универсальный метод последовательного приближения.
Определим функцию:

Эта функция считает необходимую нам вероятность. Вычислим эту вероятность при нескольких значениях параметра n - количестве студентов в группе.
(%І2) а(50) г float;
(%о2) 0.029626420422012
Очень мало.
(%ІЗ) а(10),float;
(%оЗ) 0.86305162228692
Наоборот, очень много. Делим, далее, интервалы пополам.
(%І4) а(30), float;
(%о4) 0.29566375726073
(%І5) а (2 0), float;
(%о5) 0.58856161641542
(%іб) а (2 5) , float;
(%о6) 0.43130029603054
(%І7) а(23), float;
(%о7) 0.45270276567601
Похоже, ближе уже не подобраться. Попробуем число 22:
(%І9) а (22 ) г float;
(%о9) 0.52430469233745
Перебор.
Итак, мы получили, что при 23 студентах в группе вероятность того, что хотя бы у двух из них совпадут дни рождения, превысит 0,5.
Ответ: 23 человека
Задача 4.3. Задача об отказах. Распределение Пуассона.
В цехе имеется n=100 станков. Количество отказов к за смену подчиняется закону Пуассона с параметром Л=0.34. Найти вероятность того, что количество станков, находящихся в ремонте удовлетворяет неравенству 3<к<5.
Решение. Закон Пуассона: вероятность к отказов равна
л к
А- -X Р
к е
к к!
Вероятность того, что т
х <k<rri2, равна
m2 .
т2 І
к
Р( щ<
к<Ш2
) Рк=е
|
к тх к тх ! |
 |
|
Вычисляем при заданных нам значениях: |
Зададим функцию:
 |
|
Ответ:. р = 0.005 |
Задача 4.4. Нормальное распределение.
Известно, что средняя выручка торговой точки имеет нормальное распределение с математическим ожиданием MX=125000 руб. и дисперсией DX=(25000 руб.)
2. Найти вероятность того, что выручка в некоторый день превзойдет 140000 руб.
Решение. Для решения используем нормальную функцию распределения, которая имеет вид:
f 9 \
(x-MX )
2
1
x
F(x0 ) = Р^< х
0 ) = J exp
?27Ш-О0
dx.
2ст
_ х- MX xr, - MX
Если сделать замену t =-и = —-, то получим:
dt = <D(t о) - интеграл Лапласа.
Y
t о
F (хо
) = J
exP
V 271
—со
В данном случае, нам необходимо найти вероятность того, что случайная величина больше некоторой границы:
f 9 Л
(x-MX )
2
I
хо
Р =
1 - f
exP
^-оо
dx
2а
Найдем эту вероятность с помощью программы Maxima и электронных таблиц Gnumeric.
1). Maxima
Вычислим вспомогательный параметр t, как показано выше:
(%і30) t: (14 0000-12 5000)/2 5000;
3
(%о30) -5
Используя функцию integrate, вычислим вероятность того, что случайная величина будет ограничена сверху:
 |
(%i32) float (%);
(%о32) 0.72574688224SS3 |
Последний шаг - вычисление искомой вероятности:
(%^33) {%оЗЗ)
2). Gnumeric
1-%;
0.27425311775007 |
 |
Рис. 4.1. Подготовка к решению в таблицах Gnumeric
Для вычисления функции нормального распределения используется встроенная функция normdist (рис. 4.2). |
 |
Рис. 4.2. Функция NORMDIST
После нажатия кнопки «Вставка» появляется окно ввода параметров (рис. 4.3). По очереди мышкой указываем ячейки, в которых находятся нужные значения: x - верхний предел интеграла; mean -математическое ожидание; stddev - среднее квадратическое отклонение; cumulative - 0, если требуется вычислить только функцию плотности вероятностей (подынтегральная функция); 1 - если требуется вычислить функцию распределения (именно это нам и нужно). |
 |
Рис. 4.3. Окно ввода параметров
После ввода параметров функции получаем результат (рис. 4.4). Для окончательного решения вычитаем полученное значение из |
единицы.
Е *KHHra1.gnumencTGnumenc
|
Файл Правка Вид Вставка Фермат Сервис Данные Справка |
 |
|
|
|
|
А |
В |
С |
D |
Е |
|
|
1 |
Ма-ема-ическое ожидание т = |
125000 |
|
|
2 |
Среднее квадра-ич. отконение 5 = |
25000 |
|
|
3 |
Граничное значение Х0 = |
|
140000 |
|
|
4 |
Вероятнос-ь “ого, ч-о Х<Х0 |
0,72574 5SS224 993 |
|
|
5 |
|
|
|
|
|
|
|
6 |
Выч-ем полученное число из 1 |
0,27425311775007 |
|
|
7 |
|
|
|
|
|
|
|
Рис. 4.4. Результаты расчетов |
Ответ: искомая вероятность равна 0.274.
106
4.2. Задачи математической статистики Задача 4.5. Расчет доверительных интервалов.
Дана выборка объемом n=48 значений недельного оборота отделения банка (в млн.руб.). Вычислить среднее значение Х
Ср, среднее квадратическое отклонение S. Оценить математическое ожидание MX и дисперсию DX генеральной совокупности. Доверительная вероятность равна 0.95.
Исходные данные:
18,587 20,653 16,264 16,997 16,046 18,804 22,564 20,557 16,279 21,706 18,074 19,637 20,640 18,668 16,481 18,930 22,414 21,574 22,536 18,754 22,741 18,507 21,135 22,347 19,507 23,115 22,447 21,590 18,738 16,642 22,545 19,112 16,163 21,955 17,981 18,589 17,923 16,986 22,610 18,926 19,907 22,603 22,828 17,414 19,131 22,328 16,406 16,974 Решение.
Введем исходные данные в электронные таблицы Gnumeric в первый столбец. В качестве десятичного разделителя эта программа, по умолчанию использует запятую.
После ввода всех чисел найдем основные статистические характеристики выборки. Для этого последовательно выбираем пункты меню: «Сервис»==>«Статистический анализ»==> «Описательные статистики» (см. рис. 4.5).
Появляется панель ввода данных (рис. 4.6). При нажатии на кнопку слева в строке ввода происходит выход в текущий лист рабочей книги и манипулятором «Мышь» следует выделить ячейки с исходными данными (рис. 4.7). Можно также явно указать диапазон ячеек.
После ввода диапазона ячеек с данными следует указать место для вывода таблицы с результатами расчета. Автор рекомендует выбирать тот же рабочий лист, следует указывать ячейку, правее и ниже которой нет никаких нужных данных (рис. 4.8).
 |
Рис. 4.5. Выбор функции статистического анализа
После нажатия кнопки «ОК» появится таблица с рассчитанными значениями статистических характеристик выборки (рис. 4.9).
Для оценки интервала, в котором может находиться математическое ожидание, используется распределение Стьюдента.
Число степеней свободы к = п -1 = 47; доверительная вероятность а = 0.95.
Квантиль распределения Стьюдента найдем при помощи функции TINV (рис. 4.10). Ввод параметров в функцию представлен на рис. 4.11.
Результаты расчета представлены на рис. 4.12.
Доверительный интервал определяется по формуле
108 |
|
x tк,a j— — MX — X + a , что показано на рис. 4.13. |
 |
|
Рис. 4.6. Панель ввода данных функции описательных статистик |
 |
|
Рис. 4.7. Выделение ячеек, в которых находятся данные |
 |
|
Рис. 4.8. Выбор места вывода расчетных данных |
 |
Рис. 4.9. Таблица с результатами расчета.
110 |
|
Рис. 4.10. Обратное двустороннее распределение Стьюдента |
 |
Рис. 4.11. Ввод параметров в функцию
|
11 |
21,955 |
|
Минимум |
16,046 |
|
|
12 |
22,603 |
|
Максимум |
23,115 |
|
|
13 |
16,264 |
|
Сумма |
943,315 |
|
|
14 |
18,074 |
|
Количество |
48 |
|
|
15 |
22,536 |
|
|
|
|
|
16 |
22,447 |
|
t{47;0,95)= |
2,01174051373005 |
! |
Рис. 4.12. Результаты расчета
|
Е1& Ж Ф = =D2+D16*D6/sqrt(D14) |
|
|
С |
D |
Е |
|
1 |
|
Столбец 1 |
|
|
2 |
Среднее |
19,6523953333333 |
|
|
3 |
Стандартная ошибка |
0,33086930919796 |
|
|
4 |
Медиана |
19,1215 |
|
|
5 |
Мода |
#І\І/А |
|
|
6 |
Стандартное отклонение |
2,29232981678432 |
|
|
7 |
Выборочная дисперсия |
5,25477593891844 |
|
|
3 |
Эксцесс |
-1,37629651370615 |
|
|
9 |
Асимметрия |
0,00043037950718 |
|
|
10 |
Диапазон |
7,069 |
|
|
11 |
Минимум |
16,046 |
|
|
12 |
Максимум |
23,115 |
|
|
13 |
Сумма |
943,315 |
|
|
14 |
Количество |
43 |
|
|
15 |
|
|
|
|
16 |
t(47;0,95)= |
2,01174051373005 |
|
|
17 |
|
|
|
10 |
18,9867726392699 |
<=мх<= |
20,3130190273967 |
Рис. 4.13. Доверительный интервал для математического ожидания Для оценки доверительного интервала дисперсии следует использовать распределение Пирсона.
Число степеней свободы к = п - 2 = 46; вспомогательные веро-
1 + (X _ 1 — ОС _ _
ятности: оц = = 0,975; а 2 = = 0,025.
Найдем квантили распределения Пирсона:
Хі
2: Дх
2<Хі
2) =
аі; Х2
: Р(і
2<І2) =
а2
Для этого используем функцию R.QCHISQ (рис. 4.14).
Ввод ее параметров показан на рис. 4.15. Т.к. необходимо вычислить значения для двух вероятностей, то и процедуру следует повторить два раза. Полученные числа находятся в ячейках D20, D21 (рис. 4.16).
п • S 2~
Х2
<DX<
Далее, по формуле
вычислим доверитель-
Хі
|
ный интервал для дисперсии (рис. 4.16, ячейки C23:E23). |
 |
|
Рис. 4.14. Функция распределения Пирсона |
 |
|
Рис. 4.15. Ввод параметров функции распределения Пирсона |
|
Е23 М ф = =D14*D7/D20 |
|
|
с |
D |
E |
|
|
1 |
|
Столбец 1 |
|
|
|
2 |
Среднее |
19,6523953333333 |
|
|
|
3 |
Стандартная ошибка |
0,33036930919796 |
|
|
|
4 |
Медиана |
19,1215 |
|
|
|
5 |
Мода |
#N/A |
|
|
|
6 |
Стандартное отклонение |
2,29232931673432 |
|
|
|
7 |
Выборочная дисперсия |
5,25477593391344 |
|
|
|
3 |
Эксцесс |
-1,37629651370615 |
|
|
|
9 |
Асимметрия |
0,00043037950713 |
|
|
|
10 |
Диапазон |
7,069 |
|
|
|
11 |
Минимум |
16,046 |
|
|
|
12 |
Максимум |
23,115 |
|
|
|
13 |
Сумма |
943,315 |
|
|
|
14 |
Количество |
43 |
|
|
|
15 |
|
|
|
|
|
16 |
t(47;0,95)= |
2,01174051373005 |
|
|
|
17 |
|
|
|
|
|
13 |
13,9367726392699 |
<=мх<= |
20,3130190273967 |
|
|
19 |
|
|
|
|
|
20 |
ХИ ¦m'2(46;0,025)= |
29,1600540740394 |
|
|
|
21 |
ХИ "-2(46:0,975)= |
66,6165237742505 |
|
|
|
22 |
|
|
|
|
|
23 |
3,73623625321735 |
<=DX< = |
3,64932097363143 |
l |
|
¦~>л |
|
|
|
Рис. 4.16. Результаты расчета доверительного интервала дисперсии
Ответ: х -19,652; S = 2,292; S
2 - 5,255; 18,987 <МХ < 20,318;
3,786 < DX < 8,650
Задача 4.6. Проверка гипотезы о равенстве средних
Рассмотрим два набора данных об индексе Нью-Йоркской биржи (NYSE), взятые за два несмежных интервала времени (эти данные имеются в базе данных примеров программы Gretl (см. раздел 6). Они представлены на рис. 4.17.
|
1 1 ™ * 1 |
|
|
А |
В |
С |
D |
|
1 |
Ns 1 |
|
Иг 2 |
|
|
2 |
531,12 |
|
613,7 |
|
|
3 |
533,34 |
|
634,11 |
|
|
4 |
537,67 |
|
626,49 |
|
|
5 |
537,57 |
|
608,31 |
|
|
6 |
531,44 |
|
607,57 |
|
|
7 |
539,89 |
|
619,2 |
|
|
S |
535,35 |
|
596,78 |
|
|
9 |
525,94 |
|
580,39 |
|
|
10 |
512,83 |
|
591,6 |
|
|
11 |
511,13 |
|
580,6 |
|
|
12 |
504,26 |
|
599,21 |
|
|
13 |
511,98 |
|
581,13 |
|
|
14 |
508,6 |
|
576,06 |
|
|
15 |
524,88 |
|
566,65 |
|
|
16 |
524,35 |
|
590,65 |
|
|
17 |
527,42 |
|
598,05 |
|
|
1S |
524,35 |
|
618,03 |
|
|
19 |
511,98 |
|
601,65 |
|
|
20 |
498,55 |
|
595,2 |
|
|
21 |
485,55 |
|
580,39 |
|
|
22 |
|
|
|
|
Рис. 4.17. Две выборки значений индекса NYSE.
Необходимо проверить гипотезу о равенстве математических ожиданий этих выборок.
Для проверки гипотезы последовательно выбираем пункты меню «Сервис» ==>«Статистический анализ» ==>«Два средних» ==>«Равные выборки: Т-тест» (если выборки имеют разные объемы, то выбираем другие пункты, как показано на рис. 4.18).
Равные выборки: Т-тесг...
Неравные выборки, равные дисперсии: Т-гесг... Неравные выборки, неравные дисперсии: Т-тесг... Известные дисперсии: Z-тесг...
Два средних
I
)/.и г.;
и оі:
19 пі :
Две дисперсии: Freer...
Рис. 4.18. Варианты сравнения средних.
После выбора варианта расчетов появляется панель «Проверка различия двух средних» (рис. 4.19). |
 |
Рис. 4.19. Ввод исходных данных в панель В первой строке ввода указываем диапазон адресов ячеек, в которых находятся значения первой выборки, а во второй - второй выборки. Если выборки имеют заголовки (метки), и мы их включаем в диапазоны адресов, то следует поставить галочку в окошко «Метки».
По умолчанию, доверительный уровень равен 0,05, а результаты расчета выводятся на новый рабочий лист. Это вполне устраивает большинство пользователей, поэтому нажимаем кнопку «ОК».
|
На рис. 4.20 представлены результаты расчета. |
|
|
|
1_1 1 |
|
|
А |
В |
С |
|
|
1 |
|
№ 1 |
№ 2 |
|
2 |
Среднее |
520,91 |
598,2005 |
|
3 |
Известная дисперсия |
215,969926 |
326,30667 |
|
4 |
Наблюдения |
20 |
20 |
|
5 |
Корреляция Пирсона |
0,56504529 |
|
|
|
6 |
Гипотетическое среднее отклонение |
0 |
|
|
|
7 |
Наблюдаемое среднее отклонение |
— 77,3705 |
|
|
|
S |
Дисперсия отклонений |
242,2754-77 |
|
|
|
9 |
df |
19 |
|
|
|
10 |
t Stat |
-22,23210 |
|
|
|
11 |
Р (T<=t) одностороннее |
2,31Е—015 |
|
|
|
12 |
t критическое одностороннее |
1,72913201 |
|
|
|
13 |
Р (Т<=0 двухстороннее |
4.61Е—015 |
|
|
|
14 |
t критическое двухстороннее |
2,09302405 |
|
|
|
15 |
|
|
|
|
16 |
|
|
|
|
|
17 ” |
|
|
Рис. 4.20. Результаты расчета
В строке 6 приведено рассчитанное значение критерия Стью-дента, а в строке 14 - критическое двустороннее значение. Т.к. модуль рассчитанного значения превосходит критическое, то нулевую гипотезу о равенстве средних (математических ожиданий) следует отвергнуть.
Задача 4.7. Проверка гипотезы о равенстве дисперсий
По данным задачи 4.6 проверить гипотезу о равенстве дисперсий двух выборок.
Выбираем пункты меню «Сервис» ==>«Статистический анализ» ==>«Две дисперсии» ==>«Е-тест».
Появляется панель «Сравнение равенства двух переме...» (рис. 4.21). Здесь мы наблюдаем опечатку или ошибку переводчика.
Вводим адреса переменных каждой выборки, помечаем окошко «Метки» и нажимаем кнопку «ОК». На новом рабочем листе появляются результаты сравнения двух дисперсий (рис. 4.22).
|
1_ |
_1 1_
А |
В |
С |
|
|
1 |
F-Тест |
№ I |
№ 2 |
|
|
2 |
Среднее |
520,91 |
598,2335 |
|
|
3 |
Дисперсия |
215,96993 |
326,30667 |
|
|
4 |
Наблюдения |
20 |
20 |
|
|
5 |
df |
19 |
19 |
|
|
6 |
F |
0,6613613 |
|
|
|
7 |
Р (F<=f) правостороннее |
0,8113207 |
|
|
|
3 |
F критическое прэ восторон нее |
2,1632516 |
|
|
|
9 |
Р (f<=F) левостороннее |
0,1831793 |
|
|
|
10 |
F критическое ле востороннее |
0,4612011 |
|
|
|
11 |
Р двухстороннее |
0,3763537 |
|
|
|
12 |
Fкритическое д зухстороннее |
0,3953122 |
2,5264509 |
|
|
13 |
|
|
|
|
Рис. 4.22. Сравнение двух дисперсий.
Т.к. рассчитанное значение критерия Фишера равно F=0.662 (ячейка А6), а границы двустороннего критерия Фишера равны 0.396 и 2.526 соответственно (ячейки В12 и С12), т.е. Fe[0.396;2.526], то нулевую гипотезу о равенстве дисперсий отвергнуть нет оснований, следовательно, принимаем ее.
Задача 4.8. Проверка гипотезы о виде закона распределения.
По результатам наблюдения в течение 50 рабочих дней было установлено, что менеджер операционного зала банка обслуживал следующее количество клиентов в день:
По исходным данным установить:
1) основные статистические характеристики работы менеджера;
2) выяснить, подчиняется ли случайное число «количество клиентов за день» нормальному распределению.
Решение. Первый шаг: расчет основных статистик при помощи функции «Описательные статистики», как показано в предыдущем примере. Результаты расчета представлены на рис. 4.23.
Второй шаг: расчет гистограмм. Под гистограммой понимается численное или графическое представление частот попадания значений случайной величины в заданные интервалы. Обычно предполагается, что ширина всех интервалов одинакова. Относительно количества интервалов, и соответственно, их ширины, существует большое количество допущений. Автор, в свое время, при работе над кандидатской, а затем и докторской, диссертацией, исследовал эту проблему и выяснил, что ни одна из приводимых в руководствах эмпирических формул ничем не обоснована [4]. Анализ с точки зрения теории информации дает основание утверждать, что оптимальное
значение ширины интервала разбиения - среднее квадратическое от
|
клонение. |
 |
|
Рис. 4.23. Основные статистики исследуемой случайной величины |
Учитывая, что малое количество данных, их целочисленность,
выберем в качестве ширины интервала разбиения A=5~S=5.49
Для построения гистограммы используем команду «Сер-вис»==> «Статистический анализ» ==> «Гистограмма» (рис. 4.24).
В строке ввода панели «Гистограмма» указываем диапазон
ячеек, в которых находятся исходные данные.
Затем выбираем вкладку «Двоичные» (рис. 4.25). ВНИМАНИЕ! Здесь, как это, к сожалению, часто бывает в свободно распространяемых программах, имеет место ошибка переводчика. В оригинале стоит слово «Bins» - «Карманы». Это тоже не самое удачное название, но, по крайней мере, близко к смыслу.
 |
|
Рис. 4.24. Ввод исходных данных |
 |
Рис. 4.25. Ввод интервалов
На этой вкладке указываются границы интервалов, в которых необходимо искать частоты.
Если границы рассчитаны вручную, то эти значения следует поместить в ячейки рабочего листа и указать их расположение в окне ввода.
Пометим пункт «Вычисленные двоичные» - это означает, что мы дадим программе исходные данные, а далее она сама вычислит все, что нужно.
Пункт «Мин.» - указываем минимальное значение случайной величины - 5 (см. рис. 4.23). Пункт «Макс.» - 30.
N - количество интервалов. Оно рассчитывается по формуле
Макс.-Мин. 30-5 N =-=-= 5.
А 5 |
Во вкладке «Параметры» указываем тип гистограммы (рис.
4.26).
 |
Рис. 4.26. Выбор типа гистограммы
На рис. 4.27 представлены результаты расчета. |
|
|
|
|
|
Р? *Книга1 .gnumeric |
FGnumeric |
|
1 Файл Правка Вид Вставка Формат Сервис |
|
Ij П В H fl й вйаОО |
ф т < |
|
Sans т 10 т А |Л_| |
|
А10 Ц ф = |
|
|
А |
В |
с |
D |
|
1 |
Двоичное |
Частота |
% |
|
|
2 |
<5 |
0 |
0,00% |
|
|
3 |
10 |
16 |
32,00% |
|
|
4 |
15 |
16 |
32,00% |
|
|
5 |
20 |
13 |
26,00% |
|
|
6 |
25 |
3 |
6,00% |
|
|
7 |
.30 |
2 |
4,00% |
|
|
S |
>30 |
0 |
0,00% |
|
|
9 |
|
|
|
|
|
Рис. 4.27. Результаты расчета гистограммы |
Третий шаг. Расчет критерия Пирсона и проверка распределения на нормальность.
Методика расчета критерия Пирсона требует, чтобы в каждом интервале было не менее 5 попаданий. В нашей гистограмме (рис. 4.27) в 4-м и 5-м интервалах 3 и 2 попадания соответственно. Поэтому их требуется объединить.
Составим новую таблицу на новом рабочем листе (рис. 4.28). Новые границы интервалов представлены в ячейках A2:A7, а частоты - в ячейках В2:В7. Как можно отметить, заголовок «Двоичное» был заменен заголовком «Границы».
Для каждого интервала вычислим теоретическую вероятность по формуле:
f _ о Л
( х-х X)
х,-
Рі = і— f exp -
хі-1 V
dx.
2S
Здесь 5=5,4923 - среднее квадратическое отклонение (ячейка
D11); х = 13,72 - среднее значение (ячейка D10).
Составим таблицу соответствия интервалов и их границ.
|
Номер |
Нижняя |
Ячейка |
Верхняя |
Ячейка |
|
интервала |
граница |
|
граница |
|
|
1 |
-ОО |
- |
10 |
А3 |
|
2 |
10 |
А3 |
15 |
А4 |
|
3 |
15 |
А4 |
20 |
А5 |
|
4 |
20 |
А5 |
30 |
А6 |
Для расчета вероятностей используем функцию normdist (описание см. задачу 4.4). Ввод аргументов показан на рис. 4.29.
Для расчета первой вероятности необходимо одно действие. Для других же, придется по очереди вычислять функцию нормального распределения от каждой границы, а затем вычитать их друг из друга, например:
=normdist(Лист2!A5 ;Лист2! $D$ 10;Лист2 !$D$ 11;1)-normdist(Лист2 !А4;Лист2! $D$ 10 ;Лист2 !$D$ 11;1)
Вычисленные вероятности представлены в ячейках D3:D6 (рис.
4.28).
Далее, вычисляем теоретические частоты по формуле: fj=50pj. Эти значения представлены в ячейках F3:F6 (рис. 4.28).
(gi ~ fi)
Вычисляем слагаемые формулы Пирсона:
где
fi
gi - эмпирические частоты (значения гистограммы, см. рис. 4.28, ячейки В3:В6). Результаты помещаем в ячейки А15:А18).
Далее складываем полученные значения функцией SUM(A15:A18). Результат находится в ячейке В19.
Итак, х =1,4163.
Последнее действие - вычисление критического значения критерия Пирсона.
Число степеней свободы k=m-2-1=4-2-1=1.
 |
|
Рис. 4.28. Расчет критерия Пирсона |

Рис. 4.29. Аргументы функции нормального распределения
Вызываем функцию, обратную функции распределения Пирсона «=r.qchisq(0,95;1;)» и получаем результат, помещенный в ячейку D19: 3,8415.
Т.к. рассчитанное значение критерия Пирсона меньше критического, то принимаем гипотезу о нормальности распределения исследуемой случайной величины.
Замечание. На самом деле, при проверке статистических гипотез нельзя говорить, что мы принимаем гипотезу. Следует говорить, что у нас нет оснований ее отвергнуть.
Дело в том, что часто, при проверке нескольких гипотез, возможно по какому-то критерию принять не одну, а две-три гипотезы. Между ними невозможно сделать выбор. Нужно либо применить какой-то другой критерий, либо исходить из соображений, выходящих за рамки математической статистики (а именно, из Ваших профессиональных знаний).
В то же время, если гипотеза отвергается, то она отвергается
почти достоверно.
Задача 4.9. Оценка связи между факторами, уравнение регрессии.
На машиностроительных предприятиях было проведено исследование зависимости выработки на одного рабочего в год (в млн. руб.) от условной энерговооруженности (в десятках киловатт на человека).
Оценить степень связи, построить уравнение регрессии. Исходные данные приведены в таблице:
|
X |
Y |
X |
Y |
X |
Y |
X |
Y |
X |
Y |
|
0.120 |
2.115 |
0.013 |
2.399 |
0.588 |
2.826 |
0.076 |
2.322 |
0.106 |
2.432 |
|
0.442 |
2.597 |
0.915 |
3.053 |
0.528 |
2.547 |
0.892 |
2.941 |
0.776 |
3.119 |
|
0.888 |
2.993 |
0.947 |
3.203 |
0.855 |
3.081 |
0.254 |
2.223 |
0.195 |
2.561 |
|
0.901 |
3.114 |
0.992 |
2.996 |
0.808 |
2.920 |
0.059 |
2.249 |
0.577 |
2.864 |
|
0.959 |
3.250 |
0.995 |
2.999 |
0.438 |
2.708 |
0.618 |
2.717 |
0.925 |
3.007 |
|
0.236 |
2.327 |
0.032 |
2.242 |
0.268 |
2.399 |
0.227 |
2.571 |
0.372 |
2.553 |
|
0.093 |
2.170 |
0.835 |
3.220 |
0.851 |
3.035 |
0.523 |
2.842 |
0.066 |
2.125 |
|
0.455 |
2.480 |
0.715 |
2.732 |
0.272 |
2.562 |
0.026 |
2.269 |
0.183 |
2.470 |
|
0.771 |
3.105 |
0.151 |
2.439 |
0.934 |
3.149 |
0.387 |
2.803 |
0.916 |
2.938 |
|
0.445 |
2.520 |
0.709 |
2.987 |
0.456 |
2.460 |
0.714 |
2.834 |
0.309 |
2.713 |
|
0.106 |
2.449 |
0.822 |
3.110 |
|
|
|
|
|
|
Решение. Введем исходные данные в электронные таблицы Gnumeric по столбцам, соблюдая порядок по строкам (т.е. значение X на любой строке должно соответствовать значению Y на той же строке) (рис. 4.30).
Далее вызовем статистическую функцию «Регрессия» последовательностью команд меню: «Сервис»==> «Статистический анализ» ==> «Регрессия». Появится панель ввода данных (рис. 4.31).
В окне ввода «Переменные Х» следует выбрать весь столбец А (установить курсор в это окно, нажать мышкой на кнопку «А» над столбцом). Аналогично, в окне ввода «Переменная Y» нужно выбрать столбец В. Затем галочкой отметить пункт «Метки» (это нужно сделать, т.к. у нас в первой строке стоят имена переменных, а не числа) и нажать «ОК». В новом листе «Регрессия (1)» появятся результаты расчета (рис. 4.32 и табл. 4.1).
|
|
|
1 1 w - 1 |
|
|
А |
В |
С |
D |
Е |
|
|
1 |
X |
У |
|
|
|
|
|
2 |
0,384 |
2,43 |
|
|
|
|
|
3 |
0,609 |
2,641 |
|
|
|
|
|
4 |
0,161 |
2,506 |
|
|
|
|
|
5 |
0,348 |
2,35 |
|
|
|
|
|
6 |
0,361 |
2,449 |
|
|
|
|
|
7 |
0,277 |
2,609 |
|
|
|
|
|
S |
0,772 |
2,77 |
|
|
|
|
|
9 |
0,224 |
2.254 |
|
|
|
|
|
10 |
0,908 |
3,205 |
|
|
|
|
|
11 |
0,286 |
2,584 |
|
|
|
|
|
12 |
0,194 |
2,474 |
|
|
|
|
|
13 |
0,358 |
2,557 |
|
|
|
|
|
14 |
0 4 63 |
2.586 |
|
|
|
|
|
Рис. 4.30. Исходные данные |
 |
|
Рис. 4.31. Панель функции «Регрессия». |
 |
|
Рис. 4.32. Результаты расчета |
В таблице «Итоговый вывод» приведены очень важные характеристики:
1. Множественная регрессия R=0,9041;
2. Коэффициент определенности R
2=0,8173.
Второй коэффициент имеет смысл коэффициента определенности процесса. Он говорит о том, какая доля изменения признака Y определяется изменением фактора X. Как видно, изменение Y на 81,7% определяется фактором X. Это очень много.
В таблице «Дисперсионный анализ» для нас важен пункт «Значимость F». Величина в этом пункте равна 2,5811E-25 или 2,58-10"
25, что меньше любого разумного уровня значимости. Обычно задают уровень значимости, равный 0.01, 0.05, 0.10, что соответствует доверительной вероятности 0.99, 0.95, 0.9.
Т.к. «Значимость F» меньше уровня значимости, следовательно, уравнение регрессии ЗНА ЧИМО.
Таблица 4.1.
Сводка результатов расчета
|
Итоговый вывод |
|
Регрессионные
статистики |
|
Множественная
регрессия |
0,9041 |
Коэффициент
определенности |
0,8173 |
Подобранный
коэффициент
определенности |
0,8145 |
|
Стандартная ошибка |
0,1159 |
|
Наблюдения |
66 |
Дисперсионный анализ
|
|
степень |
сумма |
Квадрат |
F |
Значи- |
|
|
|
свободы |
квадратов |
среднего |
|
мость F |
|
|
Регрессия |
1 |
3,8484 |
3,8484 |
286,3848 |
2,58E-25 |
|
|
Остатки |
64 |
0,86 |
0,0134 |
|
|
|
|
Всего |
65 |
4,7085 |
|
|
|
|
|
|
Коэффи- |
Стандартная |
t Stat |
Значение P |
Ниже |
Выше 95% |
|
|
циенты |
ошибка |
|
|
95% |
|
|
Пересечение |
2,2273 |
0,0312 |
71,2752 |
1,09E-62 |
2,1649 |
2,2898 |
|
x |
0,872 |
0,0515 |
16,9229 |
2,58E-25 |
0,769 |
0,9749 |
Коэффициенты уравнения регрессии находятся в столбце «Коэффициенты». Уравнение имеет вид: y=a+bx, где а= «Пересечение» = 2,2273; Ь=«х»=0,8720.
Итак: у = 2,2273 + 0,872 • х.