Непараметричні статистичні критерії в психології: коли вони потрібні і як обрати тест
Непараметричні статистичні критерії — це група методів статистичного висновку, які не вимагають задавати даним конкретну параметричну форму розподілу так, як це роблять класичні моделі на кшталт нормальної. Багато найвідоміших непараметричних процедур працюють із порядком спостережень — рангами — або зі знаками різниць. Вони особливо корисні для порядкових даних, невеликих вибірок, виражено асиметричних розподілів, даних із важкими хвостами та ситуацій, коли саме порядкова або розподільна відмінність відповідає дослідницькому запитанню.
Головне правило вибору просте: непараметричний критерій обирають за дизайном дослідження, типом даних і тим, яку статистичну гіпотезу потрібно перевірити. Схема «тест нормальності дав p < .05 — автоматично беремо непараметричний тест» є занадто грубою. Один і той самий ранговий критерій може мати різні інтерпретації за різних припущень, а перехід від t-критерію до рангового тесту часто змінює саме питання, на яке відповідає аналіз. Це докладно показують Фей і Прошан у методологічному огляді тестів Вілкоксона—Манна—Уїтні та t-критерію.
Якщо потрібно порівняти дві незалежні групи, типовим ранговим варіантом є U-критерій Манна—Уїтні. Для двох пов’язаних вимірювань застосовують критерій знакових рангів Вілкоксона, коли виконуються його припущення. Для трьох і більше незалежних груп використовують критерій Краскела—Волліса, а для трьох і більше повторних або блокованих вимірювань — критерій Фрідмана. Для порядкового або монотонного зв’язку між двома змінними окремим власником є коефіцієнт кореляції Спірмена.
Ця сторінка є канонічним оглядом сімейства непараметричних критеріїв у психології. Вона пояснює, коли вони справді потрібні, які припущення залишаються, як не переплутати різні дизайни та як тлумачити результат без помилкового висновку «непараметричний = без припущень».
Що означає «непараметричний критерій»
Термін «непараметричний» охоплює ширший клас методів, ніж просто «тести для ненормальних даних». У строгому статистичному сенсі непараметричний метод не задає скінченновимірну параметричну сім’ю розподілів як повну модель даних. У прикладній психологічній статистиці цим словом найчастіше називають рангові, знакові та інші процедури, для яких не потрібно припускати нормальний розподіл вихідної змінної.
Це не означає відсутності умов застосування. Рангові тести потребують правильної структури залежності, змістовного порядку значень, коректного формування пар або незалежних груп, а окремі інтерпретації потребують додаткових умов щодо форми розподілів. Наприклад, критерій знакових рангів Вілкоксона для класичної інтерпретації зсуву спирається на симетрію розподілу парних різниць; це прямо розбирають Гатсон і Ю.
Тому «непараметричний» краще читати як назву класу статистичних процедур, а не як обіцянку універсального тесту, який можна застосувати до будь-яких даних без перевірки припущень.
Коли непараметричні критерії справді доречні
Порядкові дані, де порядок важливіший за числову відстань
Якщо змінна має природний порядок, але відстань між сусідніми категоріями не має гарантовано однакового змісту, ранговий аналіз часто відповідає інформації, яку реально містять дані. Прикладом можуть бути впорядковані категорії вираженості або окремі порядкові відповіді. Це не перетворює кожну суму балів психологічної шкали на «суто порядкову» величину: властивості конкретного вимірювання належать до психометричного аналізу й мають оцінюватися окремо.
Невеликі вибірки та точні процедури
За малої вибірки асимптотичні наближення можуть бути неточними, а перевірити форму розподілу надійно складно. Для деяких рангових і знакових критеріїв можна обчислити точний розподіл тестової статистики або точне умовне p-значення. Це є реальною перевагою, але не скасовує вимоги до незалежності спостережень, коректного парування та змістовності самого тесту.
Сильна асиметрія, важкі хвости або вплив екстремальних значень
Ранги зменшують роль абсолютної відстані між дуже великими й звичайними значеннями, тому окремі рангові процедури можуть бути стійкішими до екстремальних спостережень. Проте вони не «лікують» помилки даних, залежність спостережень або систематичне зміщення. Якщо наукове запитання стосується саме середнього значення, іноді доречніше використати робастну або бутстреп-оцінку середнього, модель із відповідним розподілом чи великий вибірковий t-аналіз, а не змінювати ціль аналізу на рангову.
Запитання стосується порядку або стохастичного домінування
Іноді дослідника цікавить не різниця середніх, а ймовірність того, що випадково обране спостереження з однієї групи буде більшим за випадково обране спостереження з іншої. Для такого запитання рангові методи можуть бути природнішими. У дослідженні Фагерланда показано, що критерій Вілкоксона—Манна—Уїтні може бути дуже чутливим до відмінностей форми та розкиду навіть тоді, коли середні й медіани збігаються; саме тому важливо заздалегідь визначити, яку відмінність потрібно оцінювати. Дослідження Фагерланда ілюструє цю проблему на симуляціях.
Як обрати критерій: почніть із дизайну, а не з тесту нормальності
Перший крок — визначити, чи спостереження незалежні або пов’язані. Другий — порахувати кількість груп чи умов. Третій — сформулювати, що саме означатиме ефект: різницю середніх, загальний зсув розподілів, порядкову перевагу, зміну всередині учасника чи монотонний зв’язок. Лише після цього має сенс обирати статистичну процедуру.
Дві незалежні групи: Манна—Уїтні
Коли є дві незалежні групи й дані можна змістовно впорядкувати, U-критерій Манна—Уїтні є типовим ранговим варіантом. Він не є механічною «непараметричною версією t-критерію». t-критерій відповідає на запитання про середні, тоді як Манна—Уїтні працює з відносним порядком спостережень і за загальною нульовою гіпотезою стосується розподілів. Медіанна інтерпретація потребує додаткових умов, зокрема достатньо подібної форми розподілів.
Два пов’язані вимірювання: Вілкоксона
Коли ті самі учасники вимірюються двічі або спостереження утворюють змістовні пари, незалежний критерій Манна—Уїтні вже не відповідає дизайну. Критерій знакових рангів Вілкоксона аналізує парні різниці: їхні знаки та ранги абсолютної величини. Для класичної інтерпретації зсуву важлива симетричність розподілу різниць. Якщо це припущення неприйнятне, можливим простішим варіантом є критерій знаків, який використовує лише напрямок різниці й втрачає частину інформації про її величину.
Три й більше незалежних груп: Краскела—Волліса
Критерій Краскела—Волліса узагальнює рангове порівняння на три й більше незалежних груп. Він є глобальним, або омнібусним, тестом: мале p-значення вказує на несумісність даних із нульовою моделлю однакових розподілів/рангової структури, але саме по собі не показує, які пари груп відрізняються. Після значущого омнібусного результату потрібні заздалегідь обґрунтовані або післятестові парні порівняння з контролем множинності.
Три й більше пов’язаних умов: Фрідмана
Критерій Фрідмана призначений для блокованих або повторних даних, коли кожен учасник має вимірювання в трьох чи більше умовах. Ранги обчислюються всередині блоку або учасника, а блоки мають бути незалежними один від одного. Офіційний довідник NIST описує його як непараметричний тест для повного рандомізованого блокового дизайну та окремо зазначає незалежність блоків і можливість змістовного ранжування даних як базові умови. Опис NIST.
Порядковий або монотонний зв’язок: Спірмена
Якщо запитання стосується зв’язку двох змінних, а не різниці між групами, потрібен уже не тест групових відмінностей. Для монотонного порядкового зв’язку використовують коефіцієнт кореляції Спірмена. Він також працює з рангами, але відповідає на інше запитання. Кореляція, незалежно від того, параметрична вона чи рангово-непараметрична, не встановлює причинність.
Категоріальні частоти — інша гілка
Для таблиць частот, номінальних категорій і запитань про незалежність категоріальних змінних застосовують інший клас процедур, зокрема критерій хі-квадрат або точний критерій Фішера. Їх не варто змішувати з ранговими порівняннями лише тому, що в широкому сенсі їх теж можуть називати непараметричними.
U-критерій Манна—Уїтні: що саме він перевіряє
U-критерій Манна—Уїтні об’єднує спостереження двох незалежних груп, ранжує їх і оцінює, наскільки ранги однієї групи систематично вищі або нижчі за ранги іншої. Один зі змістовних способів подати ефект — через ймовірність переваги: наскільки часто випадкове спостереження з однієї групи перевищує випадкове спостереження з іншої, з відповідним урахуванням однакових значень.
Найпоширеніша помилка — писати, що Манна—Уїтні «перевіряє різницю медіан» у будь-якій ситуації. За простішої нульової моделі критерій стосується рівності розподілів. Якщо групи мають однакову форму й відрізняються переважно зсувом, результат можна інтерпретувати як свідчення відмінності положення розподілів; тоді мова про медіану стає змістовнішою. Якщо ж одночасно змінюються асиметрія або розкид, мала величина p може відображати ці відмінності, а не «медіанний зсув». Саме множинність можливих інтерпретацій є центральним висновком огляду Фея і Прошана.
Базові умови для стандартного двовибіркового застосування: групи незалежні; спостереження всередині груп не створюють прихованих повторів; змінну можна змістовно впорядкувати; спосіб обчислення p-значення коректно враховує обсяг вибірки та однакові ранги. Якщо висновок формулюється як різниця в центральному положенні, потрібно окремо обґрунтувати відповідну модель зсуву.
Критерій знакових рангів Вілкоксона: аналізуйте різниці, а не дві колонки окремо
Для парних даних одиницею аналізу є різниця всередині кожної пари. Критерій Вілкоксона спочатку відкидає знак, ранжує абсолютні ненульові різниці, а потім повертає знак і порівнює суму позитивних та негативних рангів. Тому його логіка принципово відрізняється від Манна—Уїтні, який працює з двома незалежними групами.
Класична нульова гіпотеза критерію знакових рангів пов’язана із симетрією розподілу різниць навколо заданого центру. Гатсон і Ю наголошують, що симетрія потрібна для обмінності знаків у стандартній перестановочній логіці критерію. Отже, фраза «Вілкоксон не потребує нормальності» правильна лише частково: нормальність не потрібна, але структура парних різниць усе одно має значення.
Однакові значення та нульові різниці потребують явного алгоритму обробки. Різні статистичні програми можуть використовувати відмінні правила для нулів, точних p-значень і поправок на однакові ранги. У звіті варто вказувати програму, версію або принаймні спосіб обчислення, якщо ці деталі можуть вплинути на результат.
Критерій Краскела—Волліса: омнібусний тест не називає пару, яка відрізняється
Краскела—Волліса порівнює рангову структуру трьох або більше незалежних груп. Усі значення спільно ранжуються, після чого оцінюється, наскільки суми або середні ранги груп відхиляються від очікуваних за нульової моделі. Як і Манна—Уїтні, цей тест не слід автоматично описувати як «дисперсійний аналіз для медіан». Медіанна мова передбачає додаткове припущення, що групові розподіли мають подібну форму й відрізняються переважно положенням.
Якщо глобальний тест дає мале p-значення, наступне запитання — де саме розташовані відмінності. Парні порівняння без поправки збільшують ризик хибнопозитивних висновків. Тому потрібен запланований метод післятестових порівнянь і корекція множинності, наприклад рангові порівняння Данна з відповідною процедурою корекції. Вибір корекції має бути частиною плану аналізу, а не пошуком найменшого p після перегляду результатів.
Критерій Фрідмана: повторні вимірювання й блоки
Фрідман працює там, де Краскела—Волліса не підходить через залежність вимірювань. Якщо одна людина проходить три експериментальні умови, її три значення утворюють блок і ранжуються всередині цього блоку. Завдяки цьому тест використовує відносний порядок умов у кожного учасника, а не вдає, ніби всі вимірювання незалежні.
Результат Фрідмана також є омнібусним. Він відповідає на запитання, чи сумісні дані з однаковими ефектами умов у ранговому сенсі, але не визначає автоматично, яка саме пара умов відрізняється. Для локалізації відмінностей потрібні заплановані або післятестові парні процедури з контролем множинності. NIST окремо підкреслює, що блоки мають бути незалежними, а дані — такими, що їх можна змістовно ранжувати.
Чому перевіряти нормальність і лише потім обирати тест — слабка стратегія
Популярний навчальний алгоритм виглядає так: спочатку тест Шапіро—Вілка; якщо p > .05 — параметричний тест, якщо p < .05 — непараметричний. Він привабливий простотою, але статистично змішує різні питання.
По-перше, тест нормальності має власну потужність. За малої вибірки він може не виявити помітного відхилення від нормальності, а за великої — виявляти дуже малі відхилення, які практично не руйнують роботу параметричної процедури. Тому p-значення тесту нормальності не є універсальним перемикачем між сімействами методів.
По-друге, для параметричних моделей часто важлива не «нормальність сирих балів у кожній колонці», а форма помилок або розподіл оцінювача за конкретною моделлю. Робастність залежить від дизайну, розміру й балансу груп, неоднорідності дисперсій, ступеня асиметрії та наявності екстремальних значень.
По-третє, заміна тесту може змінити цільову величину. Якщо дослідницьке запитання було про середню різницю, перехід до Манна—Уїтні через «ненормальність» не просто робить той самий тест безпечнішим: він може перевести висновок до іншої властивості розподілів. Фагерланд показав на симуляціях, що за великих вибірок критерій Манна—Уїтні може дуже впевнено виявляти невелику різницю розкиду навіть за однакових середніх і медіан.
Для дисперсійного аналізу ситуація також не зводиться до механічного правила «ненормально — заборонено». У симуляційному дослідженні Бланки та співавторів F-критерій зберігав контроль помилки I роду в широкому наборі досліджених ненормальних умов. Це конкретний симуляційний результат, а не універсальний дозвіл ігнорувати припущення: за сильного дисбалансу, неоднорідності дисперсій, залежності чи важких хвостів потрібен аналіз саме цих ризиків.
Які припущення залишаються в непараметричних тестах
Непараметричний аналіз переносить увагу з припущення про конкретну форму розподілу на інші умови. Найважливіші з них такі.
• Незалежність там, де тест передбачає незалежні спостереження. Два вимірювання однієї людини не можна перетворити на «дві незалежні групи» лише тому, що застосовується ранговий тест.
• Коректне парування в парних процедурах. Пара має виникати з дизайну — наприклад, «до/після» в тієї самої людини або змістовно зіставлені одиниці.
• Змістовний порядок значень. Якщо категорії номінальні й не мають природного порядку, присвоєння чисел 1, 2, 3 не створює підстав для рангового тесту.
• Відповідність форми розподілів тій інтерпретації, яку дослідник хоче зробити. Зокрема, «різниця медіан» для Манна—Уїтні або Краскела—Волліса потребує сильніших умов, ніж загальна рангово-розподільна інтерпретація.
• Симетрія парних різниць для класичної інтерпретації зсуву критерію знакових рангів Вілкоксона.
• Коректне поводження з однаковими рангами й нульовими різницями. Вони змінюють точний розподіл статистики та можуть впливати на алгоритм обчислення.
• Належний дизайн вибірки й відсутність систематичного зміщення. Ранжування не виправляє селекційне зміщення, невипадкові втрати даних, псевдореплікацію або некоректну процедуру збору даних.
Точне, перестановочне чи асимптотичне p-значення
Назва тесту ще не визначає, як саме обчислено p-значення. Для малих вибірок часто можливий точний розрахунок за всіма допустимими перестановками або знаковими конфігураціями. Для більших вибірок програми використовують асимптотичні наближення, зазвичай через нормальний або хі-квадрат розподіл. За наявності великої кількості однакових значень точний алгоритм може ставати складнішим, а різні пакети реалізують його по-різному.
Практичне правило: у методах аналізу варто вказувати, чи було p-значення точним, перестановочним або асимптотичним, якщо вибір режиму неочевидний. Для дуже малих вибірок сам факт p > .05 не є доказом відсутності ефекту: тест може мати низьку статистичну потужність і широкий діапазон сумісних із даними ефектів.
p-значення не замінює величину ефекту
Непараметричний тест так само легко звести до помилки «p < .05 — ефект є, p > .05 — ефекту немає», як і будь-який інший тест. Заява Американської статистичної асоціації прямо наголошує: p-значення не є ймовірністю істинності нульової гіпотези, не вимірює величину ефекту й не повинно бути єдиною підставою наукового висновку.
Для рангових порівнянь бажано повідомляти міру ефекту, яка відповідає саме цільовому запитанню. Для Манна—Уїтні природними можуть бути ймовірність переваги або рангово-бісеріальна кореляція. Для парних рангових процедур існують відповідні парні міри. Вибір міри потрібно визначати за змістом, а не за тим, яку кнопку першою показує програма.
Поруч із точковою оцінкою потрібна невизначеність — наприклад, довірчий інтервал або інший коректний інтервальний опис. Інтервал слід будувати для тієї величини, яку реально інтерпретують. Не варто подавати лише медіани з міжквартильними діапазонами й вважати, що вони автоматично є «ефектом Манна—Уїтні».
Так само статистична значущість не дорівнює практичній або клінічній важливості. Малий p може супроводжувати дуже малу різницю, а велике p — недостатню точність. Оцінка розміру ефекту допомагає відокремити силу статистичного сигналу від величини спостереженої різниці.
Множинні порівняння: що робити після омнібусного тесту
Краскела—Волліса й Фрідмана відповідають на глобальне запитання. Якщо глобальна нульова модель відхиляється, це ще не дає права писати «група A відрізняється від B» або «умова 2 краща за 3». Для цього потрібні окремі контрасти.
Коли порівнянь кілька, зростає ймовірність отримати хоча б одне мале p випадково. Тому план аналізу має вказувати, які порівняння є основними, які дослідницькими та яким способом контролюється множинність. Якщо після перегляду даних перебрати багато комбінацій і повідомити лише найменше p, номінальний рівень помилки вже не описує фактичну процедуру.
Покроковий алгоритм вибору непараметричного тесту
1. Сформулюйте наукове запитання. Визначте, чи цікавить середня різниця, порядкова перевага, загальний розподільний зсув, зміна всередині учасника або монотонний зв’язок.
2. Визначте структуру залежності. Незалежні групи, парні вимірювання, повторні умови й вкладені дані потребують різних моделей.
3. Порахуйте кількість груп або умов. Дві незалежні групи ведуть до одного набору процедур, три й більше — до іншого; те саме окремо для пов’язаних вимірювань.
4. Оцініть шкалу й інформацію, яку можна захищено використовувати. Якщо змістовним є лише порядок, ранговий аналіз часто природний. Якщо важлива числова величина різниці, ранжування відкидає частину інформації.
5. Перевірте припущення конкретного тесту, а не абстрактну «непараметричність»: незалежність, симетрію різниць, подібність форм розподілів для інтерпретації зсуву, однакові ранги, нулі та пропуски.
6. Визначте спосіб обчислення p-значення — точний, перестановочний або асимптотичний — і двобічність чи однобічність гіпотези до перегляду результатів.
7. Заплануйте оцінку ефекту та невизначеності. p-значення має доповнювати оцінювання, а не замінювати його.
8. Якщо є кілька груп або багато контрастів, заздалегідь визначте післятестові порівняння та контроль множинності. Після аналізу повідомте всі заплановані результати, а дослідницькі відокремте від основних.
Чотири практичні приклади
Приклад 1. Дві незалежні групи й порядкова відповідь
Дві незалежні групи учасників оцінюють стан за однією порядковою категорією з п’яти рівнів. Якщо головне запитання — чи відповіді однієї групи загалом мають вищий порядок, Манна—Уїтні може бути природним вибором. У висновку краще говорити про рангову або стохастичну відмінність, а не автоматично про «різницю медіан».
Приклад 2. Вимірювання до й після в тих самих учасників
Є два числові вимірювання в кожного учасника. Спочатку аналізують парні різниці. Якщо дослідницьке запитання відповідає симетричному зсуву й різниці можна змістовно ранжувати, критерій Вілкоксона може бути доречним. Якщо розподіл різниць різко асиметричний, потрібно розглянути критерій знаків або іншу модель, а не називати Вілкоксона «безпечним за будь-якої ненормальності».
Приклад 3. Чотири незалежні групи
Є чотири незалежні групи з порядковим результатом. Краскела—Волліса дає глобальну перевірку. Якщо результат несумісний із нульовою моделлю, далі виконують обґрунтовані парні рангові порівняння з поправкою на множинність. Сам глобальний p не вказує, що всі чотири групи відрізняються одна від одної.
Приклад 4. Велика вибірка, сильна асиметрія, але запитання про середнє
Якщо науковий параметр — середня різниця, а вибірки великі, автоматичний перехід до рангового тесту лише через асиметрію може змінити запитання. У такій ситуації доречно оцінити робастність аналізу середнього, можливість t-критерію Велча, бутстреп-інтервалу або моделі з відповідним розподілом. Симуляційні результати Фагерланда і Бланки та співавторів показують, чому ненормальність сама по собі не визначає правильний тест.
Як звітувати непараметричний аналіз у психології
Статистичний звіт має дозволити читачеві зрозуміти, яке запитання було поставлено й як отримано висновок. APA JARS-Quant задає загальний стандарт прозорого опису кількісних досліджень у психології, включно з розмежуванням основних, вторинних і дослідницьких аналізів.
Для непараметричного тесту доцільно повідомити: назву критерію; дизайн і розміри груп; однобічну або двобічну альтернативу; тестову статистику; спосіб обчислення p-значення, якщо це важливо; саме p-значення без заміни його лише зірочками; описові статистики, що відповідають даним; міру ефекту та її невизначеність; спосіб роботи з однаковими рангами, нульовими різницями, пропусками й множинними порівняннями, якщо вони впливають на аналіз.
Формулювання висновку має відповідати тесту. Якщо Манна—Уїтні застосовано без моделі однакової форми розподілів, безпечніше говорити про відмінність рангової/розподільної структури або стохастичну перевагу, а не про доведену різницю медіан. Якщо Фрідман значущий, це глобальний результат, доки не виконані коректні парні порівняння.
Типові помилки
• Вважати непараметричні критерії «тестами без припущень». Умови є завжди; змінюється їхній тип.
• Обирати тест лише за p-значенням тесту нормальності.
• Називати Манна—Уїтні універсальним тестом різниці медіан.
• Застосовувати Манна—Уїтні до повторних вимірювань одних і тих самих людей.
• Застосовувати Вілкоксона й ігнорувати структуру та симетрію парних різниць.
• Після Краскела—Волліса або Фрідмана робити багато парних тестів без контролю множинності.
• Повідомляти лише p-значення без оцінки величини ефекту й невизначеності.
• Тлумачити p > .05 як доказ рівності або відсутності ефекту.
• Вважати рангову кореляцію доказом причинного зв’язку.
• Перетворювати числові дані на ранги автоматично, навіть коли дослідницьке запитання стосується середнього або іншої величини, для якої важливі абсолютні відстані.
Коротка карта вибору
• 2 незалежні групи → Манна—Уїтні, якщо цільове запитання є ранговим/розподільним і виконуються умови.
• 2 пов’язані вимірювання → Вілкоксона, якщо парні різниці відповідають його моделі; критерій знаків — простіша альтернатива для напрямку/медіани різниць.
• 3+ незалежні групи → Краскела—Волліса, далі обґрунтовані парні порівняння з контролем множинності.
• 3+ пов’язані умови → Фрідмана, далі парні порівняння з контролем множинності.
• 2 змінні, монотонний порядковий зв’язок → Спірмена.
• Категоріальні частоти → окрема сім’я критеріїв, зокрема хі-квадрат/точні процедури, а не рангове порівняння.
Запитання й відповіді
Чи непараметричні критерії потрібні щоразу, коли дані ненормальні?
Ні. Вибір залежить від дослідницького запитання, дизайну, розміру вибірки, типу ефекту, неоднорідності дисперсій, асиметрії та інших припущень. Ненормальність вихідних значень сама по собі не визначає сімейство тесту.
Чи непараметричний тест завжди надійніший за параметричний?
Ні. Він може бути стійкішим до певних відхилень, але часто відповідає на інше статистичне запитання та може втрачати інформацію про абсолютні відстані між значеннями. Якість вибору визначається відповідністю методу цільовій величині й дизайну.
Чи Манна—Уїтні перевіряє медіани?
Лише за додаткових умов його можна інтерпретувати як тест зсуву центрального положення. У загальнішому випадку він чутливий до відмінностей розподілів і порядку значень; зміна розкиду або форми також може дати мале p.
Чим Вілкоксона відрізняється від Манна—Уїтні?
Манна—Уїтні призначений для двох незалежних груп. Критерій знакових рангів Вілкоксона — для парних або повторних вимірювань. Вони мають різні одиниці аналізу й не є взаємозамінними.
Що робити після значущого Краскела—Волліса?
Виконати заздалегідь обґрунтовані або післятестові парні порівняння та скоригувати множинність. Глобальний тест сам не показує, яка пара груп створила відмінність.
Чи можна використовувати непараметричні тести для дуже малих вибірок?
Можна, якщо тест відповідає дизайну й доступний коректний точний або перестановочний розрахунок. Але мала вибірка все одно обмежує точність і потужність. «Непараметричний» не означає, що кількість спостережень перестає мати значення.
Чи p < .05 означає, що різниця важлива?
Ні. p-значення описує сумісність даних із нульовою моделлю за її припущень. Практична важливість залежить від величини ефекту, невизначеності, контексту й наслідків.
Чи p > .05 доводить, що групи однакові?
Ні. Незначущий результат може виникнути через малий ефект, низьку точність, малу вибірку або інші властивості даних. Для твердження про еквівалентність потрібен окремий дизайн і критерій еквівалентності, а не просто велике p у звичайному тесті.
Пов’язані статті
Джерела
Appelbaum, M., Cooper, H., Kline, R. B., Mayo-Wilson, E., Nezu, A. M., & Rao, S. M. (2018). Journal article reporting standards for quantitative research in psychology: The APA Publications and Communications Board task force report. American Psychologist, 73(1), 3–25. https://doi.org/10.1037/amp0000191
Blanca, M. J., Alarcón, R., Arnau, J., Bono, R., & Bendayan, R. (2017). Non-normal data: Is ANOVA still a valid option? Psicothema, 29(4), 552–557. https://doi.org/10.7334/psicothema2016.383
Fagerland, M. W. (2012). t-tests, non-parametric tests, and large studies—a paradox of statistical practice? BMC Medical Research Methodology, 12, 78. https://doi.org/10.1186/1471-2288-12-78
Fay, M. P., & Proschan, M. A. (2010). Wilcoxon-Mann-Whitney or t-test? On assumptions for hypothesis tests and multiple interpretations of decision rules. Statistical Surveys, 4, 1–39. https://doi.org/10.1214/09-SS051
Hutson, A. D., & Yu, H. (2023). The Sign Test, Paired Data, and Asymmetric Dependence: A Cautionary Tale. The American Statistician, 77(1), 35–40. https://doi.org/10.1080/00031305.2022.2110938
National Institute of Standards and Technology. Friedman Test. NIST/SEMATECH e-Handbook / Dataplot Reference Manual.
Wasserstein, R. L., & Lazar, N. A. (2016). The ASA’s Statement on p-Values: Context, Process, and Purpose. The American Statistician, 70(2), 129–133. https://doi.org/10.1080/00031305.2016.1154108
