18c0693f

Теория вероятностей и математическая статистика

4.1. Задачи теории вероятностей

Задача 4.1. Задача о лотерейных билетах.

В партии из 19 лотерейных билетов 9 выигрышных. Куплено 12 билетов. Какова вероятность, что среди них 7 выигрышных?

Решение. Здесь используется гипергеометрическое распределение.

s~<d —d

ldln-d

Вероятность того, что при покупке n билетов из партии объемом N, в которой имеется D выигрышных, мы получим d выигрышных, равна р

CN

nm _

^ I)

биномиальный коэффициент, а

Здесь

m\{n - m)\

n\=1 • 2 •... • (n -1) • n, причем 0!= 1!= 1.

Для расчетов воспользуемся программой Maxima.

Биномиальный коэффициент вычисляется при помощи функции birnmial(n,m), где n, m имеют тот же смысл, что и выше.

Вводим команду:

(% і 5 ) ' b іг.опіа 1 (5 г 7 ) * b іпот іа 1 (1G, 5) / b іг.ота 1 (19,12 ) ;

“56

-

4199

Приводим к десятичному виду:

(%І6) float(%);

(%o6J 0.1? 004286734 937

Ответ:. р = 0.18

Задача 4.2. Задача о днях рождения.

Сколько человек должно быть в группе, чтобы вероятность совпадения дней рождения хотя бы у двух человек превышала 0,5?

Решение. Найдем дополнительную вероятность, т.е. вероятность того, что ни у какой пары студентов нет совпадающих дней рождения.

Пусть в группе n студентов. Всего количество размещений к

дней рождения по 365 дням года равно г = 365й.

Первый человек в группе может иметь тл = 365 вариантов дня рождения. 2-ой, для того, чтобы его день рождения не совпал с днем рождения первого, может иметь т2 = 365 -1 = 364 варианта дня рождения, ..., і-й человек может иметь //?, =365- < -1 варианта дня рождения.

Всего вариантов выбора разных дней рождения у n человек имеется

т = \\ <65- i-1

i=1

Вероятность равна p = — или

г

'1-i-О

n С

p = fl

i=1V

365- i-1

n i=1V 365

365

Нам нужно решить следующее неравенство относительно п:

365

/=Н

При этом нас будет интересовать наибольшее приближение к числу У.

Для решения этого неравенства снова используем программу Maxima.

К сожалению, напрямую решить это неравенство нам не удастся (необходимо составлять хоть и небольшую, но программу, что выходит за рамки данной книги).

Тем не менее, можно применить универсальный метод последовательного приближения.

Определим функцию:



Эта функция считает необходимую нам вероятность. Вычислим эту вероятность при нескольких значениях параметра n - количестве студентов в группе.

(%І2) а(50) г float;

(%о2) 0.029626420422012

Очень мало.

(%ІЗ) а(10),float;

(%оЗ) 0.86305162228692

Наоборот, очень много. Делим, далее, интервалы пополам.

(%І4) а(30), float;

(%о4) 0.29566375726073

(%І5) а (2 0), float;

(%о5) 0.58856161641542

(%іб) а (2 5) , float;

(%о6) 0.43130029603054

(%І7) а(23), float;

(%о7) 0.45270276567601

Похоже, ближе уже не подобраться. Попробуем число 22:

(%І9) а (22 ) г float;

(%о9) 0.52430469233745

Перебор.

Итак, мы получили, что при 23 студентах в группе вероятность того, что хотя бы у двух из них совпадут дни рождения, превысит 0,5.

Ответ: 23 человека

Задача 4.3. Задача об отказах. Распределение Пуассона.

В цехе имеется n=100 станков. Количество отказов к за смену подчиняется закону Пуассона с параметром Л=0.34. Найти вероятность того, что количество станков, находящихся в ремонте удовлетворяет неравенству 3<к<5.

Решение. Закон Пуассона: вероятность к отказов равна

л к

А- -X Рк е

к к!

Вероятность того, что тх <k<rri2, равна

m2 . т2 Ік

Р( щ< к<Ш2 ) Рк=е

к тх к тх ! Вычисляем при заданных нам значениях: Зададим функцию:

Ответ:. р = 0.005 Задача 4.4. Нормальное распределение.

Известно, что средняя выручка торговой точки имеет нормальное распределение с математическим ожиданием MX=125000 руб. и дисперсией DX=(25000 руб.)2. Найти вероятность того, что выручка в некоторый день превзойдет 140000 руб.

Решение. Для решения используем нормальную функцию распределения, которая имеет вид:

f 9 \

(x-MX )2

1 x

F(x0 ) = Р^< х0 ) = J exp

?27Ш-О0

dx.

2ст

_ х- MX xr, - MX

Если сделать замену t =-и = —-, то получим:

dt = <D(t о) - интеграл Лапласа.

Y t о

F (хо) = J exP

V 271

—со

В данном случае, нам необходимо найти вероятность того, что случайная величина больше некоторой границы:

f 9 Л

(x-MX )2

I хо

Р =1 - f exP

^-оо

dx



Найдем эту вероятность с помощью программы Maxima и электронных таблиц Gnumeric.

1). Maxima

Вычислим вспомогательный параметр t, как показано выше:

(%і30) t: (14 0000-12 5000)/2 5000;

3

(%о30) -5

Используя функцию integrate, вычислим вероятность того, что случайная величина будет ограничена сверху:

(%i32) float (%);

(%о32) 0.72574688224SS3 Последний шаг - вычисление искомой вероятности:

(%^33) {%оЗЗ)

2). Gnumeric

1-%;

0.27425311775007 Рис. 4.1. Подготовка к решению в таблицах Gnumeric

Для вычисления функции нормального распределения используется встроенная функция normdist (рис. 4.2). Рис. 4.2. Функция NORMDIST

После нажатия кнопки «Вставка» появляется окно ввода параметров (рис. 4.3). По очереди мышкой указываем ячейки, в которых находятся нужные значения: x - верхний предел интеграла; mean -математическое ожидание; stddev - среднее квадратическое отклонение; cumulative - 0, если требуется вычислить только функцию плотности вероятностей (подынтегральная функция); 1 - если требуется вычислить функцию распределения (именно это нам и нужно). Рис. 4.3. Окно ввода параметров

После ввода параметров функции получаем результат (рис. 4.4). Для окончательного решения вычитаем полученное значение из единицы.

Е *KHHra1.gnumencTGnumenc

Файл Правка Вид Вставка Фермат Сервис Данные Справка А В С D Е 1 Ма-ема-ическое ожидание т = 125000 2 Среднее квадра-ич. отконение 5 = 25000 3 Граничное значение Х0 = 140000 4 Вероятнос-ь “ого, ч-о Х<Х0 0,72574 5SS224 993 5 6 Выч-ем полученное число из 1 0,27425311775007 7 Рис. 4.4. Результаты расчетов Ответ: искомая вероятность равна 0.274.

106

4.2. Задачи математической статистики Задача 4.5. Расчет доверительных интервалов.

Дана выборка объемом n=48 значений недельного оборота отделения банка (в млн.руб.). Вычислить среднее значение ХСр, среднее квадратическое отклонение S. Оценить математическое ожидание MX и дисперсию DX генеральной совокупности. Доверительная вероятность равна 0.95.

Исходные данные:

18,587 20,653 16,264 16,997 16,046 18,804 22,564 20,557 16,279 21,706 18,074 19,637 20,640 18,668 16,481 18,930 22,414 21,574 22,536 18,754 22,741 18,507 21,135 22,347 19,507 23,115 22,447 21,590 18,738 16,642 22,545 19,112 16,163 21,955 17,981 18,589 17,923 16,986 22,610 18,926 19,907 22,603 22,828 17,414 19,131 22,328 16,406 16,974 Решение.

Введем исходные данные в электронные таблицы Gnumeric в первый столбец. В качестве десятичного разделителя эта программа, по умолчанию использует запятую.

После ввода всех чисел найдем основные статистические характеристики выборки. Для этого последовательно выбираем пункты меню: «Сервис»==>«Статистический анализ»==> «Описательные статистики» (см. рис. 4.5).

Появляется панель ввода данных (рис. 4.6). При нажатии на кнопку слева в строке ввода происходит выход в текущий лист рабочей книги и манипулятором «Мышь» следует выделить ячейки с исходными данными (рис. 4.7). Можно также явно указать диапазон ячеек.

После ввода диапазона ячеек с данными следует указать место для вывода таблицы с результатами расчета. Автор рекомендует выбирать тот же рабочий лист, следует указывать ячейку, правее и ниже которой нет никаких нужных данных (рис. 4.8).

Рис. 4.5. Выбор функции статистического анализа

После нажатия кнопки «ОК» появится таблица с рассчитанными значениями статистических характеристик выборки (рис. 4.9).

Для оценки интервала, в котором может находиться математическое ожидание, используется распределение Стьюдента.

Число степеней свободы к = п -1 = 47; доверительная вероятность а = 0.95.

Квантиль распределения Стьюдента найдем при помощи функции TINV (рис. 4.10). Ввод параметров в функцию представлен на рис. 4.11.

Результаты расчета представлены на рис. 4.12.

Доверительный интервал определяется по формуле

108 x tк,a j— — MX — X + a , что показано на рис. 4.13. Рис. 4.6. Панель ввода данных функции описательных статистик Рис. 4.7. Выделение ячеек, в которых находятся данные Рис. 4.8. Выбор места вывода расчетных данных Рис. 4.9. Таблица с результатами расчета.

110

Рис. 4.10. Обратное двустороннее распределение Стьюдента Рис. 4.11. Ввод параметров в функцию

11 21,955 Минимум 16,046 12 22,603 Максимум 23,115 13 16,264 Сумма 943,315 14 18,074 Количество 48 15 22,536 16 22,447 t{47;0,95)= 2,01174051373005 ! Рис. 4.12. Результаты расчета

Е1& Ж Ф = =D2+D16*D6/sqrt(D14) С D Е 1 Столбец 1 2 Среднее 19,6523953333333 3 Стандартная ошибка 0,33086930919796 4 Медиана 19,1215 5 Мода #І\І/А 6 Стандартное отклонение 2,29232981678432 7 Выборочная дисперсия 5,25477593891844 3 Эксцесс -1,37629651370615 9 Асимметрия 0,00043037950718 10 Диапазон 7,069 11 Минимум 16,046 12 Максимум 23,115 13 Сумма 943,315 14 Количество 43 15 16 t(47;0,95)= 2,01174051373005 17 10 18,9867726392699 <=мх<= 20,3130190273967 Рис. 4.13. Доверительный интервал для математического ожидания Для оценки доверительного интервала дисперсии следует использовать распределение Пирсона.

Число степеней свободы к = п - 2 = 46; вспомогательные веро-

1 + (X _ 1 — ОС _ _

ятности: оц = = 0,975; а 2 = = 0,025.

Найдем квантили распределения Пирсона:

Хі2: Дх2<Хі2) = аі; Х2: Р(і2<І2) = а2

Для этого используем функцию R.QCHISQ (рис. 4.14).

Ввод ее параметров показан на рис. 4.15. Т.к. необходимо вычислить значения для двух вероятностей, то и процедуру следует повторить два раза. Полученные числа находятся в ячейках D20, D21 (рис. 4.16).

п • S 2~

Х2

<DX<

Далее, по формуле

вычислим доверитель-

Хі

ный интервал для дисперсии (рис. 4.16, ячейки C23:E23). Рис. 4.14. Функция распределения Пирсона Рис. 4.15. Ввод параметров функции распределения Пирсона Е23 М ф = =D14*D7/D20 с D E 1 Столбец 1 2 Среднее 19,6523953333333 3 Стандартная ошибка 0,33036930919796 4 Медиана 19,1215 5 Мода #N/A 6 Стандартное отклонение 2,29232931673432 7 Выборочная дисперсия 5,25477593391344 3 Эксцесс -1,37629651370615 9 Асимметрия 0,00043037950713 10 Диапазон 7,069 11 Минимум 16,046 12 Максимум 23,115 13 Сумма 943,315 14 Количество 43 15 16 t(47;0,95)= 2,01174051373005 17 13 13,9367726392699 <=мх<= 20,3130190273967 19 20 ХИ ¦m'2(46;0,025)= 29,1600540740394 21 ХИ "-2(46:0,975)= 66,6165237742505 22 23 3,73623625321735 <=DX< = 3,64932097363143 l ¦~>л Рис. 4.16. Результаты расчета доверительного интервала дисперсии

Ответ: х -19,652; S = 2,292; S2 - 5,255; 18,987 <МХ < 20,318;

3,786 < DX < 8,650

Задача 4.6. Проверка гипотезы о равенстве средних

Рассмотрим два набора данных об индексе Нью-Йоркской биржи (NYSE), взятые за два несмежных интервала времени (эти данные имеются в базе данных примеров программы Gretl (см. раздел 6). Они представлены на рис. 4.17.

1 1 ™ * 1 А В С D 1 Ns 1 Иг 2 2 531,12 613,7 3 533,34 634,11 4 537,67 626,49 5 537,57 608,31 6 531,44 607,57 7 539,89 619,2 S 535,35 596,78 9 525,94 580,39 10 512,83 591,6 11 511,13 580,6 12 504,26 599,21 13 511,98 581,13 14 508,6 576,06 15 524,88 566,65 16 524,35 590,65 17 527,42 598,05 1S 524,35 618,03 19 511,98 601,65 20 498,55 595,2 21 485,55 580,39 22 Рис. 4.17. Две выборки значений индекса NYSE.

Необходимо проверить гипотезу о равенстве математических ожиданий этих выборок.

Для проверки гипотезы последовательно выбираем пункты меню «Сервис» ==>«Статистический анализ» ==>«Два средних» ==>«Равные выборки: Т-тест» (если выборки имеют разные объемы, то выбираем другие пункты, как показано на рис. 4.18).

Равные выборки: Т-тесг...

Неравные выборки, равные дисперсии: Т-гесг... Неравные выборки, неравные дисперсии: Т-тесг... Известные дисперсии: Z-тесг...

Два средних

I

)/.и г.;

и оі:

19 пі :

Две дисперсии: Freer...

Рис. 4.18. Варианты сравнения средних.

После выбора варианта расчетов появляется панель «Проверка различия двух средних» (рис. 4.19). Рис. 4.19. Ввод исходных данных в панель В первой строке ввода указываем диапазон адресов ячеек, в которых находятся значения первой выборки, а во второй - второй выборки. Если выборки имеют заголовки (метки), и мы их включаем в диапазоны адресов, то следует поставить галочку в окошко «Метки».

По умолчанию, доверительный уровень равен 0,05, а результаты расчета выводятся на новый рабочий лист. Это вполне устраивает большинство пользователей, поэтому нажимаем кнопку «ОК».

На рис. 4.20 представлены результаты расчета. 1_1 1 А В С 1 № 1 № 2 2 Среднее 520,91 598,2005 3 Известная дисперсия 215,969926 326,30667 4 Наблюдения 20 20 5 Корреляция Пирсона 0,56504529 6 Гипотетическое среднее отклонение 0 7 Наблюдаемое среднее отклонение — 77,3705 S Дисперсия отклонений 242,2754-77 9 df 19 10 t Stat -22,23210 11 Р (T<=t) одностороннее 2,31Е—015 12 t критическое одностороннее 1,72913201 13 Р (Т<=0 двухстороннее 4.61Е—015 14 t критическое двухстороннее 2,09302405 15 16 17 ” Рис. 4.20. Результаты расчета

В строке 6 приведено рассчитанное значение критерия Стью-дента, а в строке 14 - критическое двустороннее значение. Т.к. модуль рассчитанного значения превосходит критическое, то нулевую гипотезу о равенстве средних (математических ожиданий) следует отвергнуть.

Задача 4.7. Проверка гипотезы о равенстве дисперсий

По данным задачи 4.6 проверить гипотезу о равенстве дисперсий двух выборок.

Выбираем пункты меню «Сервис» ==>«Статистический анализ» ==>«Две дисперсии» ==>«Е-тест».

Появляется панель «Сравнение равенства двух переме...» (рис. 4.21). Здесь мы наблюдаем опечатку или ошибку переводчика.

Вводим адреса переменных каждой выборки, помечаем окошко «Метки» и нажимаем кнопку «ОК». На новом рабочем листе появляются результаты сравнения двух дисперсий (рис. 4.22).

1_ _1 1_

А В С 1 F-Тест № I № 2 2 Среднее 520,91 598,2335 3 Дисперсия 215,96993 326,30667 4 Наблюдения 20 20 5 df 19 19 6 F 0,6613613 7 Р (F<=f) правостороннее 0,8113207 3 F критическое прэ восторон нее 2,1632516 9 Р (f<=F) левостороннее 0,1831793 10 F критическое ле востороннее 0,4612011 11 Р двухстороннее 0,3763537 12 Fкритическое д зухстороннее 0,3953122 2,5264509 13 Рис. 4.22. Сравнение двух дисперсий.

Т.к. рассчитанное значение критерия Фишера равно F=0.662 (ячейка А6), а границы двустороннего критерия Фишера равны 0.396 и 2.526 соответственно (ячейки В12 и С12), т.е. Fe[0.396;2.526], то нулевую гипотезу о равенстве дисперсий отвергнуть нет оснований, следовательно, принимаем ее.

Задача 4.8. Проверка гипотезы о виде закона распределения.

По результатам наблюдения в течение 50 рабочих дней было установлено, что менеджер операционного зала банка обслуживал следующее количество клиентов в день:











По исходным данным установить:

1) основные статистические характеристики работы менеджера;

2) выяснить, подчиняется ли случайное число «количество клиентов за день» нормальному распределению.

Решение. Первый шаг: расчет основных статистик при помощи функции «Описательные статистики», как показано в предыдущем примере. Результаты расчета представлены на рис. 4.23.

Второй шаг: расчет гистограмм. Под гистограммой понимается численное или графическое представление частот попадания значений случайной величины в заданные интервалы. Обычно предполагается, что ширина всех интервалов одинакова. Относительно количества интервалов, и соответственно, их ширины, существует большое количество допущений. Автор, в свое время, при работе над кандидатской, а затем и докторской, диссертацией, исследовал эту проблему и выяснил, что ни одна из приводимых в руководствах эмпирических формул ничем не обоснована [4]. Анализ с точки зрения теории информации дает основание утверждать, что оптимальное

значение ширины интервала разбиения - среднее квадратическое от

клонение. Рис. 4.23. Основные статистики исследуемой случайной величины Учитывая, что малое количество данных, их целочисленность,

выберем в качестве ширины интервала разбиения A=5~S=5.49

Для построения гистограммы используем команду «Сер-вис»==> «Статистический анализ» ==> «Гистограмма» (рис. 4.24).

В строке ввода панели «Гистограмма» указываем диапазон

ячеек, в которых находятся исходные данные.

Затем выбираем вкладку «Двоичные» (рис. 4.25). ВНИМАНИЕ! Здесь, как это, к сожалению, часто бывает в свободно распространяемых программах, имеет место ошибка переводчика. В оригинале стоит слово «Bins» - «Карманы». Это тоже не самое удачное название, но, по крайней мере, близко к смыслу.

Рис. 4.24. Ввод исходных данных Рис. 4.25. Ввод интервалов

На этой вкладке указываются границы интервалов, в которых необходимо искать частоты.

Если границы рассчитаны вручную, то эти значения следует поместить в ячейки рабочего листа и указать их расположение в окне ввода.

Пометим пункт «Вычисленные двоичные» - это означает, что мы дадим программе исходные данные, а далее она сама вычислит все, что нужно.

Пункт «Мин.» - указываем минимальное значение случайной величины - 5 (см. рис. 4.23). Пункт «Макс.» - 30.

N - количество интервалов. Оно рассчитывается по формуле

Макс.-Мин. 30-5 N =-=-= 5.

А 5 Во вкладке «Параметры» указываем тип гистограммы (рис.

4.26).

Рис. 4.26. Выбор типа гистограммы

На рис. 4.27 представлены результаты расчета. Р? *Книга1 .gnumeric FGnumeric 1 Файл Правка Вид Вставка Формат Сервис Ij П В H fl й вйаОО ф т < Sans т 10 т А |Л_| А10 Ц ф = А В с D 1 Двоичное Частота % 2 <5 0 0,00% 3 10 16 32,00% 4 15 16 32,00% 5 20 13 26,00% 6 25 3 6,00% 7 .30 2 4,00% S >30 0 0,00% 9 Рис. 4.27. Результаты расчета гистограммы Третий шаг. Расчет критерия Пирсона и проверка распределения на нормальность.

Методика расчета критерия Пирсона требует, чтобы в каждом интервале было не менее 5 попаданий. В нашей гистограмме (рис. 4.27) в 4-м и 5-м интервалах 3 и 2 попадания соответственно. Поэтому их требуется объединить.

Составим новую таблицу на новом рабочем листе (рис. 4.28). Новые границы интервалов представлены в ячейках A2:A7, а частоты - в ячейках В2:В7. Как можно отметить, заголовок «Двоичное» был заменен заголовком «Границы».

Для каждого интервала вычислим теоретическую вероятность по формуле:

f _ о Л

( х-х X)

х,-

Рі = і— f exp -

хі-1 V

dx.

2S

Здесь 5=5,4923 - среднее квадратическое отклонение (ячейка

D11); х = 13,72 - среднее значение (ячейка D10).

Составим таблицу соответствия интервалов и их границ.

Номер Нижняя Ячейка Верхняя Ячейка интервала граница граница 1 -ОО - 10 А3 2 10 А3 15 А4 3 15 А4 20 А5 4 20 А5 30 А6 Для расчета вероятностей используем функцию normdist (описание см. задачу 4.4). Ввод аргументов показан на рис. 4.29.

Для расчета первой вероятности необходимо одно действие. Для других же, придется по очереди вычислять функцию нормального распределения от каждой границы, а затем вычитать их друг из друга, например:

=normdist(Лист2!A5 ;Лист2! $D$ 10;Лист2 !$D$ 11;1)-normdist(Лист2 !А4;Лист2! $D$ 10 ;Лист2 !$D$ 11;1)

Вычисленные вероятности представлены в ячейках D3:D6 (рис.

4.28).

Далее, вычисляем теоретические частоты по формуле: fj=50pj. Эти значения представлены в ячейках F3:F6 (рис. 4.28).

(gi ~ fi)

Вычисляем слагаемые формулы Пирсона:

где

fi

gi - эмпирические частоты (значения гистограммы, см. рис. 4.28, ячейки В3:В6). Результаты помещаем в ячейки А15:А18).

Далее складываем полученные значения функцией SUM(A15:A18). Результат находится в ячейке В19.

Итак, х =1,4163.

Последнее действие - вычисление критического значения критерия Пирсона.

Число степеней свободы k=m-2-1=4-2-1=1.

Рис. 4.28. Расчет критерия Пирсона

Рис. 4.29. Аргументы функции нормального распределения

Вызываем функцию, обратную функции распределения Пирсона «=r.qchisq(0,95;1;)» и получаем результат, помещенный в ячейку D19: 3,8415.

Т.к. рассчитанное значение критерия Пирсона меньше критического, то принимаем гипотезу о нормальности распределения исследуемой случайной величины.

Замечание. На самом деле, при проверке статистических гипотез нельзя говорить, что мы принимаем гипотезу. Следует говорить, что у нас нет оснований ее отвергнуть.

Дело в том, что часто, при проверке нескольких гипотез, возможно по какому-то критерию принять не одну, а две-три гипотезы. Между ними невозможно сделать выбор. Нужно либо применить какой-то другой критерий, либо исходить из соображений, выходящих за рамки математической статистики (а именно, из Ваших профессиональных знаний).

В то же время, если гипотеза отвергается, то она отвергается

почти достоверно.

Задача 4.9. Оценка связи между факторами, уравнение регрессии.

На машиностроительных предприятиях было проведено исследование зависимости выработки на одного рабочего в год (в млн. руб.) от условной энерговооруженности (в десятках киловатт на человека).

Оценить степень связи, построить уравнение регрессии. Исходные данные приведены в таблице:

X Y X Y X Y X Y X Y 0.120 2.115 0.013 2.399 0.588 2.826 0.076 2.322 0.106 2.432 0.442 2.597 0.915 3.053 0.528 2.547 0.892 2.941 0.776 3.119 0.888 2.993 0.947 3.203 0.855 3.081 0.254 2.223 0.195 2.561 0.901 3.114 0.992 2.996 0.808 2.920 0.059 2.249 0.577 2.864 0.959 3.250 0.995 2.999 0.438 2.708 0.618 2.717 0.925 3.007 0.236 2.327 0.032 2.242 0.268 2.399 0.227 2.571 0.372 2.553 0.093 2.170 0.835 3.220 0.851 3.035 0.523 2.842 0.066 2.125 0.455 2.480 0.715 2.732 0.272 2.562 0.026 2.269 0.183 2.470 0.771 3.105 0.151 2.439 0.934 3.149 0.387 2.803 0.916 2.938 0.445 2.520 0.709 2.987 0.456 2.460 0.714 2.834 0.309 2.713 0.106 2.449 0.822 3.110 Решение. Введем исходные данные в электронные таблицы Gnumeric по столбцам, соблюдая порядок по строкам (т.е. значение X на любой строке должно соответствовать значению Y на той же строке) (рис. 4.30).

Далее вызовем статистическую функцию «Регрессия» последовательностью команд меню: «Сервис»==> «Статистический анализ» ==> «Регрессия». Появится панель ввода данных (рис. 4.31).

В окне ввода «Переменные Х» следует выбрать весь столбец А (установить курсор в это окно, нажать мышкой на кнопку «А» над столбцом). Аналогично, в окне ввода «Переменная Y» нужно выбрать столбец В. Затем галочкой отметить пункт «Метки» (это нужно сделать, т.к. у нас в первой строке стоят имена переменных, а не числа) и нажать «ОК». В новом листе «Регрессия (1)» появятся результаты расчета (рис. 4.32 и табл. 4.1).

1 1 w - 1 А В С D Е 1 X У 2 0,384 2,43 3 0,609 2,641 4 0,161 2,506 5 0,348 2,35 6 0,361 2,449 7 0,277 2,609 S 0,772 2,77 9 0,224 2.254 10 0,908 3,205 11 0,286 2,584 12 0,194 2,474 13 0,358 2,557 14 0 4 63 2.586 Рис. 4.30. Исходные данные Рис. 4.31. Панель функции «Регрессия». Рис. 4.32. Результаты расчета В таблице «Итоговый вывод» приведены очень важные характеристики:

1. Множественная регрессия R=0,9041;

2. Коэффициент определенности R2=0,8173.

Второй коэффициент имеет смысл коэффициента определенности процесса. Он говорит о том, какая доля изменения признака Y определяется изменением фактора X. Как видно, изменение Y на 81,7% определяется фактором X. Это очень много.

В таблице «Дисперсионный анализ» для нас важен пункт «Значимость F». Величина в этом пункте равна 2,5811E-25 или 2,58-10"25, что меньше любого разумного уровня значимости. Обычно задают уровень значимости, равный 0.01, 0.05, 0.10, что соответствует доверительной вероятности 0.99, 0.95, 0.9.

Т.к. «Значимость F» меньше уровня значимости, следовательно, уравнение регрессии ЗНА ЧИМО.

Таблица 4.1.

Сводка результатов расчета

Итоговый вывод Регрессионные

статистики Множественная

регрессия 0,9041 Коэффициент

определенности 0,8173 Подобранный

коэффициент

определенности 0,8145 Стандартная ошибка 0,1159 Наблюдения 66 Дисперсионный анализ

степень сумма Квадрат F Значи- свободы квадратов среднего мость F Регрессия 1 3,8484 3,8484 286,3848 2,58E-25 Остатки 64 0,86 0,0134 Всего 65 4,7085 Коэффи- Стандартная t Stat Значение P Ниже Выше 95% циенты ошибка 95% Пересечение 2,2273 0,0312 71,2752 1,09E-62 2,1649 2,2898 x 0,872 0,0515 16,9229 2,58E-25 0,769 0,9749 Коэффициенты уравнения регрессии находятся в столбце «Коэффициенты». Уравнение имеет вид: y=a+bx, где а= «Пересечение» = 2,2273; Ь=«х»=0,8720.

Итак: у = 2,2273 + 0,872 • х.