Помилка другого роду: що означає Type II error і як вона пов’язана зі статистичною потужністю
Автор: Український психологічний ХАБ · Опубліковано: 23 вересня 2026 · Редакційна політика
Помилка другого роду, або Type II error, — це ситуація в статистичній перевірці гіпотез, коли дослідник не відхиляє нульову гіпотезу H₀, хоча за умов відповідної моделі вона є хибною. Імовірність такої помилки позначають β. Для наперед заданої альтернативи статистична потужність тесту дорівнює 1 − β: що вища потужність, то нижчий ризик пропустити ефект того розміру, для якого цю потужність обчислено. Це класичне й усталене поняття частотної статистики, але його легко інтерпретувати надто грубо. Greenland та співавтори наголошують, що β і потужність є довгостроковими частотними характеристиками процедури за конкретних припущень, а не ймовірностями істинності гіпотези в одному завершеному дослідженні.
Коротко: якщо для певного ефекту дизайн має потужність 80%, то за повторення такого самого дослідження за тих самих модельних умов приблизно у 80% випадків тест відхилятиме H₀, а приблизно у 20% — ні. Саме ці 20% і є β = 0,20 для заданого ефекту. З цього не випливає, що конкретний незначущий результат має «20% імовірності бути помилкою», а значущий результат має «80% імовірності бути правдою».
Що таке помилка другого роду
У класичній схемі перевірки статистичної гіпотези дослідник задає H₀, статистичну модель, правило тестування та рівень α. Після отримання даних він або відхиляє H₀, або не відхиляє її. Формулювання «не відхиляє» тут принципове: звичайний тест нульової гіпотези не доводить H₀ і не перетворює відсутність статистичної значущості на доказ відсутності ефекту. Заява American Statistical Association про p-значення прямо застерігає від висновку, що велике p-значення саме по собі підтверджує нульову гіпотезу.
Помилка другого роду виникає тоді, коли реальний стан, який задає альтернативна гіпотеза, сумісний із певним ненульовим ефектом, але статистична процедура не перетинає встановлений поріг відхилення H₀. У простій навчальній мові це часто описують як «пропустити реальний ефект». Така фраза корисна, якщо пам’ятати, що йдеться про ефект, визначений моделлю та конкретним значенням параметра, а не про будь-яку невловиму «реальність».
У сучасній українській науковій мові вживаються форми «помилка другого роду», «помилка II роду», «помилка другого типу» та β-помилка. Для психологічних досліджень українські автори також пов’язують β безпосередньо зі статистичною потужністю та плануванням обсягу вибірки; це видно, зокрема, у роботі Валерія Олефіра та Валерія Боснюка про обґрунтування вибірки в доказовій психології.
Чотири можливі результати статистичного рішення
Щоб побачити місце Type II error, корисно розділити реальний стан моделі та рішення тесту. Якщо H₀ істинна і тест її не відхиляє, рішення узгоджується з H₀. Якщо H₀ істинна, але тест її відхиляє, це помилка першого роду з імовірністю α. Якщо H₀ хибна і тест її відхиляє, тест виявляє відхилення від H₀; імовірність такого результату за заданою альтернативою є статистичною потужністю. Якщо H₀ хибна, але тест її не відхиляє, виникає помилка другого роду з імовірністю β.
Отже, α і β описують різні умовні події. α визначається за умови, що H₀ істинна; β — за умови, що справджується конкретна альтернатива. Через це їх не можна трактувати як дві частини однієї й тієї самої ймовірності для конкретного отриманого результату. Детальний розбір цієї плутанини дає методологічний огляд Greenland та співавторів.
Як β пов’язана зі статистичною потужністю
Для конкретно визначеного тесту й конкретної альтернативи зв’язок простий: статистична потужність = 1 − β. Cohen у класичній статті A Power Primer систематизував аналіз потужності для поведінкових наук і зробив цю мову стандартною для планування психологічних досліджень.
Якщо β = 0,20, потужність дорівнює 0,80. Якщо β = 0,10, потужність дорівнює 0,90. Але це число має сенс лише разом із тим ефектом, тестом, α, обсягом вибірки, дисперсією та іншими припущеннями, за яких воно було обчислене. Дослідження не має однієї «потужності взагалі»: для більшого справжнього ефекту потужність зазвичай вища, для меншого — нижча.
Саме тому сучасні рекомендації щодо планування вибірки радять починати не з магічної кількості учасників, а з дослідницької мети та ефектів, про які дані мають бути інформативними. Огляд Lakens про обґрунтування розміру вибірки описує апріорний power analysis як один із кількох допустимих способів планування і підкреслює роль найменшого ефекту, який має наукове або практичне значення.
Чому незначущий результат не дорівнює помилці другого роду
У реальному дослідженні ми бачимо дані та результат тесту, але не маємо прямого доступу до «істинності» H₀. Тому результат p > α не можна автоматично підписати як Type II error. Він може виникнути тому, що ефект справді дуже малий або дорівнює нулю, тому що даних недостатньо для розрізнення гіпотез, тому що варіативність висока, тому що вимірювання неточне, тому що модель неадекватна або тому що спостережуваний ефект випадково виявився близьким до H₀.
Правильніше сказати: дослідження має певний ризик помилки другого роду за конкретних альтернатив. Після незначущого результату запитання звучить не «це β-помилка чи ні?», а «які розміри ефекту залишаються сумісними з даними і наскільки дизайн був здатний їх виявити?». Саме тому Greenland та співавтори рекомендують дивитися на оцінку ефекту та інтервал невизначеності, а не робити висновок про відсутність ефекту лише з того, що p перевищило поріг.
Чому p > 0,05 не означає «ефекту немає»
Статистично незначущий результат означає, що за використаною процедурою дані не дали підстав відхилити H₀ на встановленому рівні α. Він не означає, що H₀ доведена. У заяві ASA підкреслено: p-значення не вимірює ймовірність істинності гіпотези, а науковий висновок не повинен залежати лише від проходження порога на кшталт p < 0,05.
Приклад: два дослідження можуть обидва дати p = 0,12, але мати зовсім різну інформативність. Перше може мати широчезний довірчий інтервал, сумісний і з важливим позитивним ефектом, і з нульовим, і навіть з негативним. Друге може мати вузький інтервал, який відсікає всі практично важливі ефекти. Формально обидва «незначущі», але зміст висновку різний. Саме для читання такої невизначеності потрібен довірчий інтервал.
Від чого залежить ризик помилки другого роду
Розмір ефекту
За інших однакових умов великий ефект легше відрізнити від H₀, тому β для нього нижча, а потужність вища. Малий ефект важче відокремити від випадкової варіативності. Це одна з причин, чому power analysis не має сенсу без явного припущення про ефект, який дослідник прагне виявити.
Обсяг вибірки
Зі збільшенням інформативної вибірки стандартна невизначеність оцінки зазвичай зменшується, і тест отримує більше шансів виявити заданий ефект. Звідси практичний зв’язок між β та плануванням n. Lakens радить обґрунтовувати вибірку через конкретну інференційну мету, а не через універсальні правила на кшталт «по 30 осіб у групі».
Рівень α
За фіксованих n, ефекту та моделі суворіший поріг α ускладнює відхилення H₀. Тому зменшення α зазвичай збільшує β і знижує потужність, якщо інші компоненти дизайну не змінюються. Це не аргумент на користь механічного підвищення α: ціна помилки першого роду теж має значення. Кращий дизайн може збільшити вибірку або точність, а не просто переносити ризик з одного типу помилки на інший.
Варіативність і якість вимірювання
Коли дані шумні, а психологічний показник вимірюється з великою похибкою, відношення сигналу до шуму зменшується. Це ускладнює виявлення ефекту заданого масштабу. У психометричному контексті важливо не змішувати статистичну β-помилку з похибкою вимірювання: перша стосується рішення статистичного тесту, друга — точності самого вимірювання. Проте неточне вимірювання може опосередковано погіршувати інформативність аналізу.
Дизайн і статистична модель
Парний чи незалежний дизайн, баланс груп, кореляція повторних вимірювань, розподіл предикторів, структура кластеризації, вибір одно- чи двостороннього тесту, спосіб поводження з пропущеними даними та відповідність модельних припущень впливають на розподіл статистики тесту і, відповідно, на β. Потужність є характеристикою повної процедури, а не одного числа n.
Множинність
Якщо дослідження має багато підтверджувальних гіпотез і контролює family-wise error або іншу міру multiplicity, корекція змінює пороги окремих тестів і може зменшувати їхню потужність. Це нормальна частина дизайну, а не вада корекції. Окрема стаття ХАБу пояснює, як множинні порівняння змінюють ризик випадкових «значущих» результатів.
Співвідношення α і β: чому не можна мінімізувати лише одну помилку
У фіксованому дизайні α і β пов’язані через правило рішення. Якщо зробити критерій надзвичайно консервативним, він рідше хибно відхилятиме H₀, але частіше пропускатиме альтернативу. Якщо зробити його занадто ліберальним, зросте ризик помилки першого роду. Наукове планування полягає у визначенні прийнятних ризиків з огляду на наслідки кожного типу помилки та у доборі достатньо інформативного дизайну.
Збільшення якісної вибірки часто дає можливість зменшити β, не підвищуючи α. Поліпшення точності вимірювання, ефективніший дизайн або використання релевантної коваріати за належного планування також можуть підвищити точність. Тому протиставлення «або α, або β» є надто вузьким: дослідник може змінювати саму інформаційну спроможність дослідження.
Чи повинна статистична потужність завжди бути 80%
Ні. Потужність 0,80 стала поширеним орієнтиром у поведінкових науках значною мірою завдяки роботам Cohen, зокрема A Power Primer. Це корисна історична конвенція, а не природний закон і не сертифікат якості дослідження.
Для одних задач 80% може бути замало, особливо якщо пропуск важливого ефекту дорого коштує або дослідження важко повторити. Для інших задач ресурси можуть не дозволяти досягти 80% для дуже малого ефекту, і тоді чесніше прямо описати, які ефекти вибірка здатна інформативно перевіряти. Lakens пропонує узгоджувати розмір вибірки з метою дослідження, потрібною точністю та найменшим ефектом, який має значення.
Помилка другого роду і «хибнонегативний результат»: схожість та межа аналогії
Type II error часто називають statistical false negative: ефект, що відповідає альтернативі, існує, але тест не дає рішення про відхилення H₀. Така аналогія корисна для інтуїції, але її не слід ототожнювати з хибнонегативним результатом діагностичного або скринінгового тесту.
У діагностичній точності false negative — це конкретна класифікаційна помилка: людина має цільовий стан за референсним стандартом, але індексний тест показує його відсутність. Cochrane Handbook for Systematic Reviews of Diagnostic Test Accuracy розглядає ці помилки через чутливість, специфічність та інші показники тестової точності. β у перевірці статистичної гіпотези — інша величина: це ймовірність певного рішення процедури за заданою альтернативою. Тому Type II error ≠ 1 − diagnostic sensitivity у загальному випадку.
Помилка другого роду ≠ похибка вимірювання
У психології слово «помилка» вживається для різних рівнів аналізу. Похибка вимірювання описує різницю між спостережуваним результатом і тим, що модель вимірювання розглядає як цільове значення або систематичну складову. Type II error описує рішення статистичного тесту. Людина може мати дуже надійний інструмент, але дослідження з малою вибіркою все одно матиме високу β; і навпаки, велика вибірка не робить неякісний тест валідним.
Це розрізнення особливо важливе в психометрії: reliability і validity відповідають на питання про якість вимірювання, тоді як α, β та power — про властивості інференційної процедури за певного дизайну. Один клас показників не замінює інший.
Апріорна потужність, sensitivity analysis і «observed power»
Апріорний аналіз потужності (a priori power analysis)
До збору даних дослідник може вказати тест, α, бажану потужність, ефект або діапазон ефектів, який має значення, та інші параметри дизайну. Результатом є потрібний обсяг вибірки або перевірка того, чи реалістичний запланований дизайн. Це нормальне використання потужності як інструмента планування.
Аналіз чутливості за фіксованої вибірки (sensitivity power analysis)
Якщо розмір вибірки вже заданий ресурсами, можна запитати, який мінімальний ефект дизайн здатний виявляти з певною наперед заданою потужністю. Lakens описує такий sensitivity analysis як спосіб прозоро показати інформаційну межу дослідження, не вигадуючи постфактум виправдання для n.
Post hoc observed power
Інша практика — після отримання результату підставити спостережуваний ефект у формулу power і оголосити «observed power». Для пояснення вже отриманого p-значення це майже не додає інформації: observed power тісно і механічно пов’язана з самим результатом тесту. Hoenig і Heisey показали логічні проблеми ретроспективних power calculations і рекомендували не використовувати їх як доказ того, що конкретний незначущий результат є надійним або ненадійним.
Після збору даних набагато інформативніше показати оцінку ефекту, довірчий інтервал, модельні припущення, наперед визначений SESOI, а за потреби — провести коректний equivalence test.
Низька потужність: що саме вона псує
Низька потужність прямо означає високий ризик не відхилити H₀ для ефектів, під які дизайн недостатньо інформативний. У відомому огляді нейронаукових досліджень Button та співавтори показали, що систематично низька потужність робить дослідницьку літературу менш надійною та зменшує шанс виявлення реальних ефектів.
Проте наслідок не зводиться до більшої кількості «негативних» результатів. Коли слабко потужні дослідження відбирають для уваги саме за статистичною значущістю, значущі оцінки можуть бути непропорційно великими або навіть мати неправильний знак. Gelman і Carlin запропонували додатково оцінювати Type S errors — ризик помилки знака — та Type M errors — перебільшення величини ефекту. Це доповнює, а не скасовує традиційну β.
Водночас α не перестає бути α лише тому, що дослідження мале. Твердження «низька потужність автоматично збільшує номінальну помилку першого роду з 5% до іншого числа» було б некоректним. Проблеми виникають через поєднання низької інформаційності, відбору результатів, невизначеності ефектів, множинності та інших компонентів дослідницького процесу.
Як інтерпретувати незначущий результат без пастки Type II error
Перше запитання — який ефект оцінено і наскільки точна оцінка. Подивіться на точкову оцінку та довірчий інтервал. Широкий інтервал означає, що дані залишають сумісними багато різних ефектів; вузький інтервал може виключати частину науково важливих альтернатив.
Друге запитання — який ефект був важливим до перегляду результатів. Якщо дослідник визначив smallest effect size of interest, можна перевірити, чи дані достатньо точні, щоб виключити ефекти, більші за цю межу. Без такої змістової межі «немає значущості» легко перетворюється на невизначене «ефекту немає».
Третє запитання — чи потрібен equivalence test. Lakens у практичному primer 2017 року та Lakens, Scheel і Isager у методологічному tutorial пояснюють two one-sided tests (TOST) як частотний спосіб перевірити, чи можна відкинути ефекти, які перевищують наперед визначені межі практичної або теоретичної важливості.
Четверте запитання — чи була процедура перевірки гіпотези саме тією, яку планували. Незадекларовані аналітичні варіанти, множинні перевірки, зміна outcome після перегляду даних, припинення набору за проміжним p та інші data-dependent рішення змінюють реальну помилкову поведінку аналізу. Power calculation не виправляє проблему непрозорого дизайну.
П’яте запитання — чи має статистичний висновок змістову вагу. Редакційна стаття Wasserstein, Schirm і Lazar про статистичну практику після культу p < 0,05 закликає не перетворювати поріг значущості на механічний перемикач між «ефект є» і «ефекту немає». Розмір ефекту, невизначеність, дизайн, якість вимірювання, попередні дані та практичні наслідки мають інтерпретуватися разом.
Приклад: що насправді означає 80% power
Уявімо двогрупове психологічне дослідження, яке заздалегідь сплановане так, щоб мати 80% потужності для виявлення певної різниці Δ за α = 0,05. Якщо справжня різниця саме дорівнює Δ, модель і всі інші припущення виконуються, а процедуру без змін повторювати дуже багато разів, приблизно 80% таких досліджень відхилять H₀ і приблизно 20% не відхилять її. Для цієї альтернативи β = 0,20.
Якщо справжній ефект вдвічі менший, потужність уже не обов’язково дорівнює 80% — вона може бути суттєво нижчою. Якщо справжній ефект більший, потужність може бути вищою. Тому фраза «дослідження мало power = 0,80» без уточнення ефекту, тесту, α і дизайну приховує ключову інформацію.
І ще раз: коли конкретне дослідження дало p > 0,05, його не можна перерахувати в «20% шанс, що ми пропустили реальний ефект». Частотна потужність описує поведінку процедури в гіпотетичній серії повторень за наперед заданою альтернативою, а не апостеріорна ймовірність для одного результату.
Типові помилки інтерпретації
Перша помилка — називати будь-який p > 0,05 доказом відсутності ефекту. Незначущість може бути сумісна з широким набором ефектів.
Друга помилка — називати кожен незначущий результат «помилкою другого роду». Для цього потрібно знати, що релевантна альтернатива справді є істинною; у звичайному емпіричному дослідженні це саме те, що невідомо.
Третя помилка — думати, що β є сталою властивістю тесту. β змінюється залежно від істинного параметра, n, α, дисперсії, дизайну та інших припущень.
Четверта помилка — тлумачити power = 0,80 як 80% імовірності, що H₁ істинна. Power не є ймовірністю гіпотези.
П’ята помилка — робити post hoc observed power головним аргументом після незначущого результату. Для інтерпретації отриманих даних корисніші ефект, інтервал, equivalence test і прозоре зіставлення з наперед визначеною змістовою межею.
Шоста помилка — вважати, що збільшення вибірки автоматично робить висновок науково важливим. Велике n може дати високу потужність для виявлення тривіального ефекту; статистична виявлюваність не дорівнює практичній, теоретичній або клінічній важливості.
Сьома помилка — плутати Type II error із хибнонегативним результатом психодіагностичного скринінгу. У першому випадку йдеться про помилку статистичного рішення щодо гіпотези, у другому — про помилку класифікації конкретного випадку відносно цільового стану.
Практичні наслідки для психологічного дослідження
Планування β починається до збору даних. Дослідник формулює основний аналіз, визначає ефект або діапазон ефектів, які мають зміст, задає допустимі ризики помилок і обирає дизайн, що може дати інформативну відповідь. Якщо ресурсів для такої вибірки немає, це не треба маскувати: коректніше змінити дослідницьку мету, планувати на точність, провести пілот із відповідними обмеженнями або прямо описати, які ефекти залишатимуться практично невидимими.
Під час аналізу не варто перетворювати p < 0,05 на головний критерій доказовості. Результат потрібно читати разом з оцінкою ефекту, інтервалом невизначеності, якістю вимірювання, моделлю, multiplicity та тим, чи відповідає проведений аналіз запланованому.
Під час написання висновків фраза «ефекту не виявлено» має бути точнішою за фразу «ефекту немає». Якщо дані дійсно достатньо точні для висновку про відсутність змістовно важливого ефекту, це слід показати відповідною процедурою — наприклад equivalence testing — і визначити, який саме діапазон ефектів було виключено.
Науковий статус: що в цій темі встановлено, а що залежить від моделі
Усталено: Type II error і β є стандартними поняттями частотної теорії статистичного тестування; power = 1 − β для конкретної альтернативи; незначущий p сам по собі не доводить нульову гіпотезу; потужність залежить від дизайну та ефекту, під який її визначають.
Залежить від моделі й дослідницької мети: який ефект вважати достатньо важливим для power analysis; яку потужність обрати як ціль; який рівень α прийнятний; як балансувати помилки в конкретній прикладній ситуації. Це не універсальні константи, а рішення, які мають бути обґрунтовані наслідками помилок, теорією, попередніми даними та ресурсами.
Методологічно дискусійним залишається не саме існування β, а те, яку роль дихотомічне NHST має відігравати в науковому висновку. Сучасна статистична література дедалі сильніше наголошує на оцінюванні ефектів, невизначеності, дизайні, прозорості та змістовій інтерпретації поруч із тестами значущості.
FAQ
Що таке помилка другого роду простими словами?
Це ризик не отримати рішення про відхилення H₀, хоча релевантний ефект, заданий альтернативою, насправді існує. У побутовій аналогії — «пропустити сигнал», але статистично β завжди прив’язана до конкретного тесту й альтернативи.
Якою літерою позначають помилку другого роду?
Імовірність Type II error позначають грецькою літерою β, бета. Для заданої альтернативи статистична потужність дорівнює 1 − β.
Чи означає β = 0,20, що незначущий результат має 20% шанс бути помилковим?
Ні. β = 0,20 означає довгострокову частоту невідхилення H₀ у повтореннях процедури за конкретної істинної альтернативи та виконання модельних припущень. Це не апостеріорна ймовірність помилки для одного вже отриманого результату.
Чи є p > 0,05 доказом, що ефекту немає?
Ні. Такий результат означає лише, що H₀ не була відхилена за використаною процедурою. Щоб оцінити, які ефекти залишаються сумісними з даними, потрібні оцінка ефекту та інтервал невизначеності; для висновку про практичну відсутність ефекту може бути потрібен equivalence test.
Що збільшує статистичну потужність?
За інших однакових умов потужність зростає зі збільшенням інформативної вибірки, більшим істинним ефектом, нижчою невизначеністю вимірювання та більш ефективним дизайном. Зміна α також впливає на power, але це одночасно змінює ризик помилки першого роду.
Чи достатньо завжди планувати 80% power?
Ні. 80% — поширена історична конвенція, а не універсальний стандарт. Цільова потужність має відповідати наслідкам пропуску ефекту, можливості повторення дослідження, ефекту, який має значення, та ресурсам.
Чи варто рахувати observed power після p > 0,05?
Як головний інструмент інтерпретації — ні. Потужність, обчислена з уже спостережуваного ефекту, значною мірою повторює інформацію тесту. Після збору даних корисніше показувати оцінку ефекту, довірчий інтервал та аналіз того, які змістовно важливі ефекти дані дозволяють або не дозволяють виключити.
Чи однакові Type II error і false negative у діагностиці?
Ні. Вони подібні як інтуїтивні «пропуски», але мають різні статистичні об’єкти. Type II error стосується рішення тесту гіпотези, а diagnostic false negative — неправильної класифікації випадку, коли цільовий стан насправді присутній.
Чи може велика вибірка повністю прибрати помилку другого роду?
Велике n може зробити β дуже малою для ефектів певного масштабу, але «нульовий ризик» у реальному дослідженні не є практичною гарантією. Крім випадкової варіативності залишаються якість вимірювання, модельні припущення, bias, multiplicity, missing data та інші джерела невизначеності.
Пов’язані статті
Статистична потужність: що це, як залежить від розміру ефекту, вибірки й рівня значущості — повний розбір power = 1 − β, планування вибірки, ефекту, α та помилок інтерпретації.
Довірчий інтервал: що означає 95% CI і як він показує невизначеність оцінки — як читати діапазон ефектів, сумісних із даними, замість висновку лише за p-порогом.
Множинні порівняння: чому багато статистичних тестів підвищують ризик випадкових «значущих» результатів — як multiplicity змінює контроль помилки першого роду та впливає на планування потужності.
Похибка вимірювання в психології: випадкова, систематична і чому один бал не є абсолютно точним — інший рівень «помилки», який стосується якості вимірювання, а не рішення тесту гіпотези.
Психометрія: що це, що вона вимірює і як оцінюють якість психологічних тестів — ширша рамка надійності, валідності, вимірювання та інтерпретації психологічних показників.
Кореляція і причинність: чому зв’язок між змінними не доводить, що одна спричиняє іншу — ще одне ключове розрізнення статистичного результату й змістового висновку.
