Калькулятор p-значения для теста Краскела-Уоллиса: руководство
H-тест Краскела-Уоллиса (Kruskal-Wallis) — это мощный непараметрический статистический метод, который используется для сравнения трех и более независимых выборок. Он является прямой альтернативой классическому однофакторному ANOVA, но в отличие от него, не требует строгого соблюдения правил о нормальности распределения данных.
Наш бесплатный онлайн-калькулятор выполняет сложную процедуру ранжирования данных (с учетом связанных рангов) и рассчитывает точное p-значение, используя аппроксимацию $\chi^2$-распределения через неполную гамма-функцию.
Когда следует использовать тест Краскела-Уоллиса?
Тест идеально подходит в тех случаях, когда данные нарушают строгие параметрические предположения:
- Данные не распределены нормально. Если гистограмма вашей выборки сильно скошена или имеет длинные «хвосты», дисперсионный анализ (ANOVA) даст ошибочный результат.
- Данные имеют порядковый (ординальный) тип. Например: оценки в анкете от 1 до 5, стадии развития заболевания (I, II, III, IV), уровни дохода (низкий, средний, высокий).
- Неоднородность дисперсий. Разброс данных в разных группах сильно отличается.
- Наличие явных выбросов. Краскел-Уоллис работает не с самими значениями, а с их рангами (порядковыми номерами), поэтому аномально высокие или низкие числа не искажают результат.
- Малые выборки.
Как работает алгоритм? (Формула H-статистики)
Процесс вычисления скрыт «под капотом» калькулятора, но математически он выглядит так:
- Все значения из всех групп сливаются в один большой массив.
- Значения сортируются по возрастанию, и каждому присваивается ранг (порядковый номер). Если встречаются одинаковые числа (связи), им присваивается средний ранг.
- Рассчитывается сумма рангов ($R_i$) для каждой отдельной группы.
- Вычисляется $H$-статистика по формуле:
$$H = \frac{12}{N(N+1)} \sum_{i=1}^{k} \frac{R_i^2}{n_i} — 3(N+1)$$
Где $N$ — общее число наблюдений, $n_i$ — размер группы, $k$ — количество групп.
Важно: Если в данных много одинаковых значений, наш калькулятор автоматически применяет математическую поправку на связи (Tie correction), чтобы H-статистика оставалась достоверной.
Как интерпретировать результаты?
Результатом работы калькулятора является p-значение (p-value). Оно показывает вероятность получить такие же различия между группами случайно, если на самом деле группы одинаковы.
Стандартный порог значимости: $\alpha = 0.05$.
| p-значение | Интерпретация результата |
|---|---|
| $p < 0.05$ | Различия статистически значимы. Нулевая гипотеза отвергается. Как минимум одна группа значимо отличается от остальных (медианы не равны). |
| $p \ge 0.05$ | Различия не значимы. У нас нет оснований отвергать нулевую гипотезу. Распределения в группах считаются схожими. |
Что делать, если результат значим ($p < 0.05$)?
Сам по себе тест Краскела-Уоллиса (как и ANOVA) отвечает только на вопрос «Есть ли разница вообще?». Если калькулятор показал значимость, он не скажет вам, какие именно группы отличаются (первая от второй, или вторая от третьей).
Чтобы это выяснить, вам необходимо провести пост-хок тесты (Post-hoc analysis). В непараметрической статистике для этого чаще всего используют попарные U-тесты Манна-Уитни с применением поправки Бонферрони.
Пример применения в бизнесе
Допустим, ресторан тестирует три новых дизайна меню. Для оценки собираются отзывы посетителей по 10-балльной шкале (порядковые данные, ненормальное распределение).
- Дизайн А: 5, 6, 7, 5, 8
- Дизайн Б: 8, 9, 7, 10, 9
- Дизайн В: 4, 5, 6, 4, 5
Вводим эти числа в калькулятор через запятую:
- H-статистика составит $\approx 10.97$.
- Степени свободы ($df$) = 2 (так как 3 группы).
- P-значение $\approx 0.004$.
Вывод: Поскольку $p < 0.01$, различия высоко значимы. Дизайн меню действительно влияет на оценки клиентов.