Дисперсійний аналіз ANOVA: порівняння груп, F-критерій і подальші тести
Український психологічний ХАБ · Опубліковано: 7 жовтня 2026 року · Редакційна політика
Дисперсійний аналіз, або ANOVA (analysis of variance), — це родина статистичних методів для перевірки того, чи узгоджуються відмінності між середніми значеннями груп або умов із випадковою мінливістю, яку передбачає статистична модель. У найпростішому однофакторному варіанті ANOVA перевіряє спільну нульову гіпотезу про рівність усіх середніх. Він не повідомляє автоматично, які саме групи відрізняються, наскільки великі ці відмінності і чи мають вони практичне значення.
Логіка ANOVA полягає у порівнянні двох джерел варіації: мінливості, пов’язаної з фактором або моделлю, та залишкової мінливості всередині груп. Їх співвідношення утворює F-статистику. Саме тому метод називається «аналізом дисперсії», хоча центральне питання класичного ANOVA часто стосується середніх. Такий підхід формально описаний у Engineering Statistics Handbook NIST.
Що саме перевіряє ANOVA
Уявімо психологічне дослідження з трьома незалежними групами, у яких після певної процедури вимірюють один кількісний показник. Середні в групах можуть відрізнятися просто через вибіркову мінливість. ANOVA ставить ширше питання: наскільки велика варіація між груповими середніми порівняно з варіацією спостережень усередині груп?
Для однофакторного ANOVA нульова гіпотеза має вигляд H₀: μ₁ = μ₂ = … = μₖ. Альтернативна гіпотеза означає, що не всі популяційні середні однакові. Відхилення H₀ дає підстави стверджувати, що принаймні одне середнє відрізняється від іншого, але не локалізує цю відмінність. Для відповіді «між якими саме групами?» потрібні заплановані контрасти або подальші порівняння з належним контролем множинності.
ANOVA належить до інференційної статистики: його результат залежить від моделі, вибіркової мінливості, розміру вибірки та припущень аналізу. Статистично значущий F-тест не є автоматичним доказом великого, важливого або причинного ефекту.
Чому порівняння середніх називається аналізом дисперсії
Класичний однофакторний ANOVA розкладає загальну суму квадратів відхилень на частину, пов’язану з відмінностями між рівнями фактора, і залишкову частину. У збалансованому простому випадку це можна записати як SS(total) = SS(factor) + SS(error). Кожну суму квадратів ділять на відповідні ступені свободи, отримуючи середні квадрати MS.
Ключова статистика має форму F = MS(factor) / MS(error). Якщо нульова модель добре описує дані, обидві величини оцінюють споріднений масштаб випадкової мінливості, тому їх співвідношення не має систематично бути великим. Якщо відмінності між рівнями фактора значні порівняно із залишковою варіацією, F зростає. Формули та структуру ANOVA-таблиці наводить NIST для однофакторного дизайну.
F-статистика завжди інтерпретується разом зі ступенями свободи. Для стандартного однофакторного ANOVA з k незалежними групами та загальним розміром вибірки N чисельник має k − 1 ступенів свободи, а знаменник — N − k. Тому звіт «F = 5,2» неповний: потрібен запис на кшталт F(2, 87) = 5,20 разом із p-значенням та оцінкою величини ефекту.
Навчальний приклад: що означає значущий F-тест
Припустімо, дослідник порівнює три формати психологічного тренінгу, а результатом є бал за кількісною шкалою після завершення програми. Середні становлять 18,2; 15,1 і 13,9 бала. Якщо ANOVA дає, наприклад, F(2, 87) = 6,40, p = .003, це означає, що за прийнятою моделлю дані погано узгоджуються з нульовою гіпотезою рівності всіх трьох середніх.
Цей результат не означає, що кожна пара груп відрізняється. Він також не означає, що ймовірність H₀ дорівнює 0,3%, і не показує величину ефекту. Заява Американської статистичної асоціації про p-значення прямо наголошує: p-значення не є ймовірністю істинності нульової гіпотези та не вимірює важливість результату.
Якщо групи були сформовані спостережно, той самий значущий результат не перетворює асоціацію на причинний ефект. Причинна інтерпретація потребує дизайну та припущень, які контролюють альтернативні пояснення: систематичні відмінності між групами, змішані чинники, відбір, часовий порядок і похибки вимірювання.
Однофакторний ANOVA для незалежних груп
Однофакторний ANOVA має один фактор — категоріальну змінну, рівні якої визначають групи або умови. Залежна змінна зазвичай кількісна. Метод відповідає на одне омнібусне питання про сукупність середніх, а не виконує окремий незалежний тест для кожної пари.
Якщо фактор має лише два рівні, стандартний однофакторний ANOVA і двобічний t-тест для незалежних вибірок у класичній моделі дають еквівалентний тест нульової гіпотези: F дорівнює t². Коли рівнів більше, ANOVA особливо зручний тим, що спочатку оцінює спільну структуру відмінностей, а потім дозволяє перейти до конкретних контрастів або парних порівнянь.
Фактор у класичному ANOVA може бути фіксованим, коли дослідника цікавлять саме обрані рівні, або випадковим, коли рівні розглядають як вибірку з ширшої сукупності можливих рівнів. Це змінює модель та інтерпретацію компонентів варіації. NIST розрізняє моделі фіксованих і випадкових ефектів; у психологічних дослідженнях вибір між ними визначається логікою дизайну.
Двофакторний і багатофакторний ANOVA
Коли модель містить два фактори, ANOVA може окремо оцінювати головний ефект фактора A, головний ефект фактора B та їх взаємодію A × B. У повному факторіальному дизайні кожен рівень одного фактора поєднується з кожним рівнем іншого. NIST описує двофакторну модель як суму загального середнього, ефектів двох факторів, їх взаємодії та залишку.
Взаємодія означає, що відмінність, пов’язана з одним фактором, змінюється залежно від рівня іншого фактора. Наприклад, ефект формату навчання може бути різним за двох способів подання матеріалу. Це окреме статистичне твердження. Значуща взаємодія потребує аналізу умовних або простих ефектів і уважного розгляду профілю середніх; самі головні ефекти можуть приховувати суттєво різні закономірності в окремих комбінаціях умов.
Багатофакторні моделі швидко породжують багато потенційних тестів. Тому дослідницькі питання, основні ефекти, взаємодії та заплановані порівняння варто визначати до перегляду результатів, а дослідницькі аналізи чітко позначати як дослідницькі. Це узгоджується з APA Journal Article Reporting Standards для кількісних досліджень, які вимагають прозоро розрізняти первинні, вторинні та дослідницькі аналізи.
ANOVA з повторними вимірюваннями
Коли ті самі учасники вимірюються в кількох умовах або в кілька моментів часу, спостереження всередині людини залежні. Звичайний ANOVA для незалежних груп тут непридатний, бо порушується структура незалежності. Для класичного дизайну повторних вимірювань використовують ANOVA з повторними вимірюваннями, який моделює внутрішньоіндивідуальну залежність у спеціальній формі.
Для фактора з більш ніж двома рівнями важливим стає припущення сферичності — обмеження на структуру дисперсій різниць між рівнями. Якщо сферичність порушена, некоригований F-тест може мати неправильний рівень помилки першого роду. Класичні корекції ступенів свободи, зокрема Greenhouse–Geisser, походять із роботи Greenhouse і Geisser.
Змішаний ANOVA поєднує міжгрупові та внутрішньогрупові фактори. Для складних ієрархічних даних, пропущених вимірювань, неоднакової кількості спостережень або гнучкішої структури кореляцій часто доречніші лінійні змішані моделі. Вибір методу має випливати зі структури даних та дослідницького питання.
Основні припущення класичного ANOVA
Незалежність спостережень
Незалежність визначається передусім дизайном. Якщо учасники вкладені в класи, сім’ї, терапевтичні групи або організації, їхні результати можуть бути корельованими. Таку залежність не можна «виправити» звичайною перевіркою нормальності. Потрібна модель, що відповідає кластерній або повторній структурі даних.
Нормальність залишків
У класичній моделі припущення стосується випадкових помилок або залишків, а не вимоги, щоб кожна сира змінна в психологічному дослідженні мала ідеально нормальний розподіл. NIST формулює модель через нормально й незалежно розподілені похибки. Діагностика має враховувати форму залишків, викиди, розміри груп і баланс дизайну.
Класичний F-тест часто є стійкішим до помірної ненормальності, ніж припускає спрощене правило «ненормально — ANOVA заборонено». У симуляційному дослідженні Blanca та співавторів F-тест добре контролював помилку першого роду в широкому наборі змодельованих умов. Це не універсальна гарантія: екстремальна асиметрія, важкі хвости, викиди, дуже малі або різко нерівні групи можуть змінити поведінку методу.
Однорідність дисперсій
Стандартний однофакторний ANOVA передбачає спільну залишкову дисперсію в групах. Особливо проблемним є поєднання неоднакових дисперсій з неоднаковими розмірами груп. Формальний тест однорідності дисперсій може бути частиною діагностики, але рішення не варто зводити до ще одного порогу p < .05: важливі фактичні дисперсії, графіки, баланс вибірки й чутливість висновків.
Коли припущення рівних дисперсій явно недоречне для незалежних груп, одним зі стандартних варіантів є Welch ANOVA. Метод Welch був розроблений саме для порівняння кількох середніх за неоднакових дисперсій і використовує іншу апроксимацію ступенів свободи.
Коректна модель та шкала результату
ANOVA є окремим випадком лінійної моделі. Якщо результат бінарний, лічильний, сильно обмежений або має іншу структуру, відповідні узагальнені моделі можуть краще відповідати процесу генерації даних. Важливі також пропущені дані, нелінійність, межові ефекти та спосіб кодування факторів. Статистична процедура не компенсує невдалий дизайн або систематичну похибку вимірювання.
Що робити, якщо загальний F-тест значущий
Значущий омнібусний F-тест відповідає лише на питання, чи сумісна сукупність середніх із моделлю їх рівності. Далі вибір аналізу залежить від того, які порівняння були заплановані й яке сімейство висновків дослідник хоче контролювати.
Заплановані контрасти формулюють до перегляду результатів і прив’язують до конкретних гіпотез. Наприклад, можна порівнювати контрольну групу із середнім двох активних втручань або одну теоретично ключову умову з іншою. NIST рекомендує визначати такі контрасти наперед, оскільки вибір порівнянь після перегляду даних змінює статистичні властивості процедури.
Подальші, або post hoc, тести застосовують, коли потрібно систематично дослідити відмінності після загального аналізу. Для всіх пар середніх у класичній моделі з однорідною дисперсією широко використовують процедуру Tukey; NIST описує її як одночасний аналіз усіх парних відмінностей. За неоднакових дисперсій і розмірів груп часто використовують Games–Howell; його властивості для таких умов досліджували Games і Howell.
Головна ідея полягає в контролі множинності. Якщо без корекції багато разів перевіряти пари груп на одному рівні α, імовірність отримати хоча б один випадковий «значущий» результат у сімействі тестів зростає. Саме цю проблему окремо розкриває стаття «Множинні порівняння». Tukey, Bonferroni, Holm, Scheffé та інші процедури відповідають різним типам сімейств гіпотез і мають різний баланс між контролем помилки та потужністю.
Немає універсального правила «значущий ANOVA — завжди Tukey». Якщо гіпотези були конкретно заплановані, доречні контрасти. Якщо мета — всі парні порівняння за класичних припущень, доречна процедура Tukey. Якщо дисперсії неоднакові, вибір має враховувати цю неоднорідність. Якщо досліджується складна взаємодія, часто потрібні прості ефекти або контрасти всередині рівнів іншого фактора.
Розмір ефекту в ANOVA
p-значення та F-тест не повідомляють, наскільки великі відмінності. Тому разом із тестом потрібна оцінка величини ефекту та, де це можливо, її невизначеності. Для ANOVA часто використовують η² (ета-квадрат), partial η² і ω² (омега-квадрат), але ці показники мають різні знаменники й різні властивості.
Для простого однофакторного дизайну η² можна подати як частку SS(factor) / SS(total). Partial η² порівнює суму квадратів конкретного ефекту із сумою квадратів цього ефекту та відповідної помилки; через це його значення залежить від структури дизайну і не завжди прямо порівнюване між дослідженнями. ω² вводить поправку, що зменшує вибіркове завищення оцінки. Практичні відмінності між показниками та їх використання в ANOVA систематизує Lakens.
Фіксовані ярлики «малий», «середній» і «великий» не замінюють предметної інтерпретації. Величину ефекту потрібно співвідносити зі шкалою, наслідками, точністю оцінки, попередніми даними та мінімально важливими відмінностями. Окремий канонічний матеріал ХАБу пояснює, що таке розмір ефекту і чому він не дорівнює статистичній значущості.
Як правильно інтерпретувати p-значення ANOVA
p-значення — це характеристика даних відносно конкретної нульової моделі та тестової процедури. Воно не є ймовірністю того, що «групи насправді однакові», не є імовірністю випадковості результату і не є мірою сили ефекту. Ці межі тлумачення детально сформульовані в ASA Statement on p-Values.
Тому висновок «p = .03, отже ефект важливий» некоректний. Так само p = .20 не доводить відсутності змістовної різниці. Незначущий результат може виникнути за малого ефекту, великої невизначеності, недостатньої інформації або невідповідної моделі. Для тлумачення потрібні оцінки середніх або контрастів, довірчі інтервали, розмір ефекту, характеристики дизайну й контекст.
Окремо дивіться статті «p-значення» та «Статистична значущість».
ANOVA і причинність
ANOVA — це спосіб статистичного порівняння в межах моделі, а не самостійна процедура встановлення причинності. У рандомізованому експерименті різницю між умовами можна інтерпретувати причинно за виконання відповідних припущень дизайну, дотримання протоколу та відсутності інших загроз валідності. У спостережному дослідженні той самий F-тест зазвичай описує асоціацію між груповою належністю та результатом.
Особливо небезпечно надавати причинний зміст групам, що сформувалися самі: наприклад, порівнювати людей з різним рівнем поведінкової ознаки й писати, що ця ознака «спричинила» різницю в іншому показнику. Змішані чинники, систематичний відбір, часовий порядок і вимірювальні похибки залишаються альтернативними поясненнями незалежно від величини F або малості p.
ANOVA і багато окремих t-тестів
Якщо є три, чотири або більше груп, серія некоригованих t-тестів створює проблему множинних порівнянь. Наприклад, для чотирьох груп існує шість пар. Кожен окремий тест може мати α = .05, але сімейна ймовірність хоча б однієї помилки першого роду вже не дорівнює .05. ANOVA дає омнібусний тест спільної гіпотези, а конкретні відмінності можна досліджувати процедурами, що враховують сімейство порівнянь.
Це не означає, що ANOVA «кращий за t-тест» у будь-якій ситуації. Для двох груп t-тест часто є прямішим способом відповісти на питання. Для кількох заздалегідь визначених контрастів лінійна модель може дати саме ті оцінки, які відповідають гіпотезам. Метод обирають за структурою питання, дизайну й даних.
Що слід повідомляти в результатах ANOVA
Добрий звіт дозволяє читачеві зрозуміти не лише факт перетину порогу значущості. APA JARS-Quant орієнтує на прозорий опис дизайну, змінних, процедур, аналізів, оцінок та невизначеності. Для ANOVA це зазвичай означає назвати тип дизайну, фактори та їх рівні, розмір вибірки в кожній групі або комірці, спосіб роботи з пропущеними даними, припущення та діагностику моделі.
Основний статистичний результат варто подавати як F(df₁, df₂) = значення, p = значення, разом із відповідним розміром ефекту та інтервальною оцінкою, якщо вона доступна. Потрібно також показати групові середні й стандартні відхилення або модельні середні та їх невизначеність — залежно від моделі.
Для post hoc аналізу слід назвати процедуру, вказати, які порівняння виконано, як контролювалася множинність, і подати оцінки різниць з інтервалами та скоригованими p-значеннями. Для ANOVA з повторними вимірюваннями потрібно повідомити, як оцінювали сферичність і яку корекцію ступенів свободи застосували, якщо вона була потрібна. Для факторіального ANOVA взаємодії слід показати й інтерпретувати окремо від головних ефектів.
Коли класичний ANOVA може бути невдалим вибором
Класичний ANOVA для незалежних груп погано відповідає даним, якщо спостереження залежні через повторні вимірювання або кластеризацію; якщо дисперсії різко неоднакові в незбалансованому дизайні й це не враховано; якщо результат має розподіл, для якого нормальна лінійна модель є явно невідповідною; або якщо кількість і структура пропусків вимагають іншої моделі.
За неоднорідності дисперсій для незалежних груп можна розглянути Welch ANOVA; за складною повторною або ієрархічною структурою — змішані моделі; за бінарним чи лічильним результатом — узагальнені лінійні моделі. Непараметричні критерії можуть бути доречними для окремих дослідницьких питань, але вони не є механічною заміною ANOVA щоразу, коли тест нормальності дає p < .05.
Вибір альтернативи має відповідати тому, який параметр або контраст цікавить дослідника. Перехід до іншого тесту може змінити саме питання, на яке відповідає аналіз.
Типові помилки під час використання ANOVA
Перша помилка — писати «ANOVA показав, що всі групи різні», коли значущий омнібусний тест говорить лише, що не всі середні однакові. Друга — виконувати всі парні тести без контролю множинності. Третя — вважати p-значення величиною ефекту або практичною важливістю.
Четверта помилка — перевіряти «нормальність змінної» механічним тестом і на цій підставі дозволяти або забороняти ANOVA. Припущення стосується моделі та залишків, а його наслідки залежать від розміру груп, балансу, викидів і неоднорідності дисперсій. П’ята — ігнорувати значущу взаємодію та обговорювати лише головні ефекти.
Шоста помилка — трактувати незначущий результат як доказ рівності. Сьома — робити причинний висновок із нерандомізованого групового порівняння. Восьма — повідомляти тільки F і p, не показуючи середніх, невизначеності, розміру ефекту та процедури подальших порівнянь.
Як обрати варіант ANOVA
Якщо є один міжгруповий фактор і незалежні учасники в кожній групі, базовою моделлю є однофакторний ANOVA. Якщо є два або більше факторів і цікавлять їх головні ефекти та взаємодії, потрібна факторіальна модель. Якщо ті самі учасники проходять кілька умов, потрібна модель повторних вимірювань; якщо поєднані міжгрупові та внутрішньогрупові фактори — змішаний дизайн.
Якщо дисперсії істотно неоднакові між незалежними групами, Welch ANOVA часто є кращою відправною точкою, ніж класичний F-тест із припущенням спільної дисперсії. Якщо структура даних складніша — кластери, повтори з пропусками, різна кількість вимірювань, випадкові ефекти — варто переходити до моделі, яка безпосередньо представляє цю структуру.
У кожному випадку алгоритм вибору починається з питання: який ефект або контраст потрібно оцінити, як були отримані дані, які спостереження залежні, який тип результату виміряно і які припущення потрібні для інтерпретації.
Короткий алгоритм аналізу
Спочатку формулюють дослідницьке питання, визначають фактори, результат і заплановані контрасти. Далі перевіряють структуру даних, пропуски, викиди, баланс груп і відповідність моделі. Після цього оцінюють ANOVA-модель та F-тести, але інтерпретують їх разом із середніми або модельними оцінками, довірчими інтервалами та розмірами ефекту.
Якщо потрібні конкретні групові порівняння, застосовують заздалегідь визначені контрасти або відповідну post hoc процедуру з контролем множинності. За порушення важливих припущень проводять обґрунтований альтернативний аналіз або аналіз чутливості. Нарешті, висновок формулюють у межах дизайну: статистична різниця, асоціація чи причинний ефект — це різні рівні тверджень.
Поширені запитання
Що таке ANOVA простими словами?
ANOVA — це спосіб перевірити, чи відмінності між середніми кількох груп або умов достатньо великі порівняно з внутрішньогруповою випадковою мінливістю, щоб відхилити спільну гіпотезу рівності середніх у межах обраної моделі.
Чому ANOVA використовує F-критерій?
F-статистика є співвідношенням двох оцінок варіації: тієї, що пов’язана з модельованим ефектом, і залишкової. За нульової моделі вони мають бути сумісними за масштабом; велике співвідношення є свідченням проти нульової гіпотези.
Чи значущий ANOVA показує, які групи відрізняються?
Ні. Омнібусний тест показує, що не всі середні однакові. Для локалізації відмінностей потрібні заплановані контрасти або подальші порівняння з відповідним контролем множинності.
Який post hoc тест обрати після ANOVA?
Вибір залежить від гіпотез і припущень. Для всіх пар за класичної моделі з однорідною дисперсією часто застосовують Tukey. За неоднакових дисперсій і розмірів груп часто застосовують Games–Howell. Для заздалегідь визначених контрастів можуть бути доречні інші корекції.
Що робити, якщо дисперсії груп неоднакові?
Потрібно оцінити масштаб проблеми, баланс груп та чутливість результату. Для незалежних груп стандартною альтернативою класичному однофакторному ANOVA є Welch ANOVA; подальші порівняння також мають враховувати неоднорідність дисперсій.
Чи потрібно, щоб дані в кожній групі були ідеально нормальними?
Ні. Класичне припущення формулюється щодо помилок моделі, а F-тест у багатьох умовах демонструє певну стійкість до ненормальності. Однак викиди, сильна асиметрія, малі й нерівні групи та неоднорідність дисперсій можуть бути важливими, тому потрібна діагностика конкретної моделі.
Чим ANOVA відрізняється від серії t-тестів?
ANOVA перевіряє спільну гіпотезу щодо всіх середніх у моделі. Серія некоригованих t-тестів для багатьох пар збільшує сімейний ризик випадкових значущих результатів. Для двох груп класичний однофакторний ANOVA і двобічний t-тест перевіряють еквівалентну гіпотезу.
Чи доводить ANOVA причинність?
Ні. ANOVA оцінює статистичні відмінності в межах моделі. Причинний висновок визначається дизайном, рандомізацією або іншою ідентифікаційною стратегією та відповідними припущеннями.
Що важливіше: F, p чи розмір ефекту?
Вони відповідають на різні питання. F і p характеризують тест нульової моделі; розмір ефекту описує величину відмінності у вибраному масштабі. Для змістовного висновку потрібні також оцінки груп, інтервали невизначеності, дизайн і предметний контекст.
Пов’язані статті
Джерела
Appelbaum, M., Cooper, H., Kline, R. B., Mayo-Wilson, E., Nezu, A. M., & Rao, S. M. (2018). Journal article reporting standards for quantitative research in psychology: The APA Publications and Communications Board task force report. American Psychologist, 73(1), 3–25. https://doi.org/10.1037/amp0000191
Blanca, M. J., Alarcón, R., Arnau, J., Bono, R., & Bendayan, R. (2017). Non-normal data: Is ANOVA still a valid option? Psicothema, 29(4), 552–557. https://doi.org/10.7334/psicothema2016.383
Games, P. A., & Howell, J. F. (1976). Pairwise multiple comparison procedures with unequal N’s and/or variances: A Monte Carlo study. Journal of Educational Statistics, 1(2), 113–125. https://doi.org/10.3102/10769986001002113
Greenhouse, S. W., & Geisser, S. (1959). On methods in the analysis of profile data. Psychometrika, 24(2), 95–112. https://doi.org/10.1007/BF02289823
Lakens, D. (2013). Calculating and reporting effect sizes to facilitate cumulative science: A practical primer for t-tests and ANOVAs. Frontiers in Psychology, 4, 863. https://doi.org/10.3389/fpsyg.2013.00863
National Institute of Standards and Technology. Engineering Statistics Handbook: One-Way ANOVA; The one-way ANOVA model and assumptions; The two-way ANOVA; Multiple comparisons; Tukey’s method. One-way model; Two-way ANOVA; Multiple comparisons; Tukey’s method.
Wasserstein, R. L., & Lazar, N. A. (2016). The ASA Statement on p-Values: Context, Process, and Purpose. The American Statistician, 70(2), 129–133. https://doi.org/10.1080/00031305.2016.1154108
Welch, B. L. (1951). On the comparison of several mean values: An alternative approach. Biometrika, 38(3–4), 330–336. https://doi.org/10.1093/biomet/38.3-4.330
