top of page

Психологічна енкциклопедія

Статистична потужність: що це, як залежить від розміру ефекту, вибірки й рівня значущості

23 вер.
Читати 17 хв

Автор: Український психологічний ХАБ · Опубліковано: 23 вересня 2026 · Редакційна політика


Статистична потужність (statistical power) — це ймовірність того, що за конкретно заданого дизайну, статистичної моделі, рівня значущості та певної альтернативи процедура відхилить нульову гіпотезу, коли ця альтернатива справді діє. У класичному позначенні потужність дорівнює 1 − β, де β — імовірність помилки другого роду. Важливо додати те, що часто губиться в коротких визначеннях: потужність не є одним незмінним числом «для дослідження взагалі». Вона залежить від того, який ефект ми припускаємо, скільки спостережень збираємо, який рівень α задаємо, яким є шум і яким саме тестом аналізуємо дані. Огляд Daniël Lakens про обґрунтування розміру вибірки розглядає a priori аналіз статистичної потужності (power analysis) саме як один зі способів пов’язати майбутній обсяг даних з конкретною інференційною метою.


Найкорисніше мислити статистичну потужність не як «сертифікат якості», а як характеристику поведінки статистичної процедури за повторення дослідження за визначених припущень. Потужність 0,80 означає: якщо обрана альтернативна модель і всі задані параметри правильні, то в довгій серії аналогічних досліджень приблизно 80% процедур дали б результат, що перетинає встановлений поріг відхилення H₀. Це не означає 80% імовірності, що конкретна гіпотеза істинна, і не означає, що 20% окремих учасників або вимірювань «помилкові». Таке розрізнення узгоджується з ширшими застереженнями щодо p-value і порогового мислення в заяві American Statistical Association.


Для психології тема потужності особливо важлива, бо розмір вибірки взаємодіє з величиною ефекту, варіативністю, якістю вимірювання та структурою дизайну. Водночас велика вибірка не виправляє систематичне зміщення, слабку операціоналізацію конструкта, конфаундинг або невалідний інструмент. Статистична потужність відповідає на вузьке питання про здатність статистичної процедури виявляти задану альтернативу; якість психологічного висновку визначається значно ширшим набором умов, які розглядає психометрія та методологія психологічного дослідження.


Коротка відповідь: що означає статистична потужність


Якщо дослідник планує двобічний тест із α = 0,05 і потужністю 0,80 для певного ефекту, він задає два різні довгострокові ризики. α контролює помилку першого роду — відхилення H₀ за умов, коли H₀ правильна в сенсі заданої моделі. β контролює помилку другого роду — невідхилення H₀ за конкретної альтернативи, яку ми хочемо мати достатню здатність виявити. Потужність становить 1 − β. За β = 0,20 потужність дорівнює 0,80.


Ця формула проста, але її правильна інтерпретація потребує умовного формулювання: «потужність для якого ефекту, за якого тесту, за якого n, α, розподілу, дисперсії, кореляційної структури та інших припущень?». Саме тому сучасне планування вибірки не зводиться до механічного введення «80%» у програму. Maxwell, Kelley і Rausch показують, що планування обсягу даних варто пов’язувати не лише з потужністю тестування гіпотез, а й із точністю оцінювання параметрів.


Потужність і помилка другого роду: зв’язок 1 − β


Помилка другого роду (Type II error) виникає, коли статистична процедура не відхиляє H₀ за умов, де задана альтернатива є правильною. Її ймовірність позначають β. Якщо β = 0,20, то статистична потужність дорівнює 0,80. Якщо β = 0,10 — потужність 0,90. У цьому сенсі висока потужність означає менший ризик пропустити той ефект, на який було налаштоване планування.


Слово «пропустити» тут треба читати статистично, а не клінічно. Type II error у перевірці гіпотези не тотожний хибнонегативному результату скринінгового чи діагностичного тесту для конкретної людини. Діагностична чутливість описує іншу задачу й іншу одиницю аналізу. Так само статистична потужність не є psychometric reliability, responsiveness або predictive value. Це окремі поняття, хоча в реальному дослідженні вони можуть впливати на інформаційність даних.


Не менш важливо: невідхилення H₀ не є автоматичним доказом «ефекту немає». За низької потужності навіть науково важливий ефект може часто не досягати обраного порога. І навпаки, достатня потужність для одного заданого ефекту не означає, що дослідження здатне надійно виявляти будь-які менші ефекти.


Від чого залежить статистична потужність


Для конкретної статистичної моделі power є функцією кількох взаємопов’язаних компонентів. У найпростішому навчальному випадку ключовими є розмір ефекту, розмір вибірки та рівень значущості α. У реальних психологічних дизайнах до них додаються дисперсія і похибка вимірювання, баланс груп, повторні вимірювання, кореляції між спостереженнями, кількість параметрів, множинні перевірки, пропуски даних, вибір однобічного чи двобічного тесту та інші властивості аналізу. Gelman і Carlin окремо наголошують, що power залежить від величини ефекту, розміру вибірки, варіативності вимірювання та структури порогового рішення.


1. Розмір ефекту


За інших однакових умов більший істинний ефект легше відрізнити від нульової моделі, тому потужність зростає. Малий ефект потребує більше інформації — часто більшої вибірки або точнішого дизайну — щоб досягти тієї самої цільової power. Це одна з причин, чому розрахунок вибірки неможливо виконати коректно без припущення про ефект, для якого ми хочемо мати задану здатність виявлення.


Слабке місце багатьох power analyses — вибір завищеного ефекту лише тому, що він робить потрібний n зручнішим. Якщо очікуваний ефект беруть із одного невеликого позитивного дослідження або з опублікованої літератури, де діє селекція за статистично значущими результатами, оцінка може бути оптимістичною. Lakens рекомендує обґрунтовувати ефект через інференційну мету, попередні дані, метааналітичні оцінки, теоретично виправданий діапазон або найменший ефект, який справді має науковий чи практичний інтерес.


Тут принципове розрізнення: «очікуваний ефект» і «найменший ефект, який варто виявляти» — не одне й те саме. Перший описує правдоподібне припущення про реальність, другий — межу предметної важливості. Обидва можуть бути корисними для дизайну, але відповідь на питання про необхідну вибірку залежатиме від того, яку саме задачу ставить дослідник.


2. Розмір вибірки


За фіксованих ефекту, α та моделі збільшення кількості незалежної інформації зазвичай підвищує потужність. Причина не магічна: стандартні похибки оцінок, як правило, зменшуються зі зростанням ефективного обсягу даних, і розподіли, що відповідають H₀ та альтернативі, стають краще розділеними. Саме тому power analysis часто використовують для планування n до збору даних.


Однак «n» не завжди дорівнює простій кількості людей. У кластерному дизайні 300 учасників із десяти класів можуть містити менше незалежної інформації, ніж 300 учасників із багатьох незалежних одиниць. У повторних вимірюваннях одна людина дає кілька корельованих спостережень. У лонгітюдному дослідженні частина учасників може вибути. У складних моделях ефективний обсяг інформації визначається структурою дизайну, а не лише числом рядків у таблиці.


Велика вибірка також не робить слабкий дизайн валідним. Систематичне зміщення, помилкова модель, нерепрезентативний добір, невдале вимірювання або конфаундинг можуть зберігатися при будь-якому n. Power стосується випадкової невизначеності та заданої процедури; вона не є універсальним індикатором якості дослідження.


3. Рівень значущості α


За інших однакових умов менш суворий поріг, наприклад α = 0,05 замість α = 0,01, полегшує відхилення H₀ і тому підвищує power. Але це не безкоштовний спосіб «покращити дослідження»: разом із цим зростає допустимий довгостроковий ризик помилки першого роду. Навпаки, суворіше α зменшує Type I error, але за того самого n і ефекту знижує power.


Тому α слід задавати до аналізу відповідно до наслідків помилок, дизайну та множинності перевірок, а не пересувати після перегляду даних. American Statistical Association підкреслює, що наукові висновки не мають будуватися лише на проходженні фіксованого порога p-value, а статистична значущість не вимірює розмір або важливість ефекту.


4. Варіативність, шум і якість вимірювання


За однакового предметного ефекту більша випадкова варіативність у даних ускладнює відокремлення сигналу від шуму. Тому точніші вимірювання, ефективніший дизайн, обґрунтоване використання повторних вимірювань або сильних прогностичних коваріат можуть підвищувати статистичну ефективність. Але ефект конкретної техніки залежить від моделі та припущень; немає універсального правила «додайте коваріату — і power зросте».


У психологічному вимірюванні важливо розрізняти статистичну невизначеність оцінки та похибку вимірювання. Низька надійність або значний випадковий вимірювальний шум можуть послаблювати спостережувані зв’язки й збільшувати невизначеність, але збільшення вибірки не перетворює погано визначений конструкт на валідний. Психометрична SEM також не є standard error of the mean: це інша величина з іншою інтерпретацією.


5. Дизайн, напрям тесту та множинні перевірки


Парний дизайн, повторні вимірювання, рівний або нерівний розподіл між групами, кількість предикторів, кореляція між спостереженнями й форма тестової статистики змінюють power. За фіксованого загального n сильно нерівні групи часто втрачають ефективність порівняно з рівним розподілом, хоча нерівність може бути виправданою різною вартістю набору, дисперсіями, етичними причинами або структурою дослідження.


Однобічний тест може мати більшу потужність у наперед визначеному напрямі, бо вся α розміщується в одному хвості розподілу. Це виправдано лише тоді, коли протилежний напрям не потребував би такого самого статистичного рішення і напрям було визначено до даних. Перетворювати двобічну задачу на однобічну після того, як побачено знак ефекту, означає змінювати правила після спостереження.


За багатьох перевірок корекція помилки першого роду або інші процедури контролю множинності можуть зробити поріг окремого рішення суворішим, що за незмінного n зменшує power для окремих ефектів. Саме тому планування має відтворювати реальний аналіз, який буде виконано, а не спрощений тест, що не відповідає фінальному дизайну.


Ілюстрація: той самий α, але різний ефект — зовсім різна потрібна вибірка


Розглянемо лише навчальну ілюстрацію: незалежний двовибірковий t-тест, двобічна перевірка, α = 0,05, однакові за розміром групи, цільова power = 0,80, без вибуття й без поправок на множинні перевірки. За стандартними формулами, які реалізують програми на кшталт G*Power, приблизний потрібний розмір кожної групи різко змінюється разом зі стандартизованим ефектом.


Якщо Cohen’s d = 0,20, потрібно приблизно 394 учасники на групу, тобто близько 788 загалом. Для d = 0,50 — приблизно 64 на групу, близько 128 загалом. Для d = 0,80 — приблизно 26 на групу, близько 52 загалом. Ці числа не є «правильними розмірами вибірки для психології»; вони показують лише математику конкретної моделі. Зміна α, цільової power, тесту, співвідношення груп або припущень змінить результат.


Навіть для d = 0,50 той самий дизайн потребує приблизно 64 учасники на групу при α = 0,05 і power = 0,80, але близько 96 на групу при α = 0,01. Підвищення цільової power з 0,80 до 0,90 також збільшує потрібний n. Отже, жодне число учасників не можна оцінити як «достатнє» без контексту ефекту, рівня помилок і моделі.


Чи є 80% універсальним стандартом


Ні. 80% — поширена конвенція, але не природна межа між «якісним» і «неякісним» дослідженням. Вона означає β = 0,20 для конкретно заданої альтернативи. В одних задачах ризик пропустити ефект настільки важливий, що потрібна power 0,90, 0,95 або інша ціль. В інших ресурсні обмеження можуть робити високу power недосяжною, і тоді потрібна чесна оцінка того, яку інформацію реально здатен дати дизайн.


У сучасній методологічній літературі немає підстав трактувати 0,80 як магічний універсальний поріг. Lakens прямо розглядає вибір цільової потужності як рішення, яке має бути пов’язане з інференційною метою та обґрунтованими помилковими рішеннями, а не лише з традицією.


Корисніше запитувати: який ефект має бути виявлений; наскільки серйозно буде його пропустити; наскільки серйозним є хибне позитивне рішення; якої точності оцінки ми потребуємо; які ресурси доступні; чи зможе дослідження змінити знання або рішення. Таке формулювання переводить power analysis із ритуалу в інструмент планування.


Як проводять a priori power analysis


A priori power analysis виконують до збору основних даних, щоб визначити потрібний обсяг інформації за наперед заданих припущень. Типова логіка складається з кількох кроків, але кожен крок має бути змістовно обґрунтований.


Крок 1. Визначити основне інференційне питання


Потрібно назвати первинний ефект або параметр, який реально відповідає дослідницькому питанню: різниця середніх, кореляція, коефіцієнт регресії, взаємодія, частка, odds ratio, ефект у багаторівневій моделі тощо. Розрахунок power для зручного t-тесту не обґрунтовує складну модель, якщо саме складна модель є первинним аналізом.


Крок 2. Обрати ефект для планування


Потрібно обґрунтувати величину ефекту, для якої потрібна цільова power. Джерелами можуть бути якісний метааналіз, попередні великі дослідження, пілотні дані з урахуванням їхньої невизначеності, теоретично правдоподібний діапазон або найменший ефект, що має практичне чи теоретичне значення. Вибір «середнього ефекту за Cohen» без предметного обґрунтування — лише евристика, а не знання про конкретну тему.


Крок 3. Наперед задати α і бажану power


Рівень α та цільова power мають відображати допустимі ризики Type I і Type II error у цій задачі. Якщо є множинні первинні перевірки або ієрархічна процедура, це треба включити в планування. Після збору даних змінювати α, напрям тесту або первинний outcome, щоб отримати потрібне рішення, методологічно неприйнятно.


Крок 4. Відтворити реальний дизайн і модель


Розрахунок має враховувати кількість груп, співвідношення їхніх розмірів, кореляцію повторних вимірювань, кластеризацію, передбачувані дисперсії, кількість предикторів, взаємодії, часові точки, структуру missing data та інші параметри, які впливають на розподіл тестової статистики. Для простих тестів існують аналітичні формули; для складних моделей часто корисні симуляційні power analyses.


Крок 5. Додати реалістичні втрати та перевірити сценарії


Якщо очікується вибуття, непридатні записи або технічні втрати, набирати треба більше, ніж фінальний аналізований n. Крім одного «точкового» сценарію варто показати, як потрібна вибірка змінюється за кількох правдоподібних ефектів, дисперсій або рівнів вибуття. Такий sensitivity analysis показує, наскільки план залежить від невідомих припущень.


Крок 6. Задокументувати припущення


Читач має мати змогу зрозуміти, звідки взявся n. APA Journal Article Reporting Standards підкреслюють прозорість опису дизайну, вибірки та статистичного аналізу. Добра практика — повідомити тест або модель, effect size для планування та його джерело, α, цільову power, sidedness, структуру груп, поправки, очікуване вибуття, програму та версію або код симуляції.


Power analysis не є єдиним способом обґрунтувати розмір вибірки


Якщо головна мета дослідження — оцінити величину ефекту з достатньою точністю, планувати n лише під поріг статистичної значущості може бути невдалим. Maxwell, Kelley і Rausch розвивають підхід accuracy in parameter estimation: вибірку планують так, щоб інтервальна оцінка мала потрібну точність. Це особливо доречно, коли наукове питання звучить «наскільки великий ефект?», а не лише «чи можна відхилити нуль?».


Тому power і точність взаємодоповнюють одна одну. Дослідження може мати достатню power для відхилення H₀ щодо великого ефекту, але давати надто широкий довірчий інтервал для практичного рішення. І навпаки, вузький інтервал навколо ефекту, близького до нуля, може бути науково дуже інформативним, навіть якщо традиційне «p < 0,05» не є центральним результатом.


Огляд Lakens описує кілька легітимних способів обґрунтувати sample size: повне охоплення скінченної популяції, ресурсні обмеження, a priori power analysis, планування точності, евристики з прозорим обґрунтуванням або чесне визнання відсутності сильного обґрунтування. Вибір способу має слідувати за інференційною метою.


Чому observed або post hoc power після отримання результатів вводить в оману


Поширена помилка — після завершення дослідження підставити спостережуваний ефект у калькулятор і повідомити «досягнуту потужність». Така observed power майже повністю є перетворенням уже отриманої тестової статистики або p-value і не додає незалежної інформації про те, наскільки переконливий конкретний результат. Heinsberg і Weeks демонструють на симуляціях, чому post hoc power, обчислена з отриманого ефекту, може бути оманливою й неінформативною для інтерпретації даних.


Після збору даних питання змінюється. Замість «яка ймовірність була отримати значущий результат, якби заданий ефект був істинним?» нас цікавить «що ці дані говорять про величину ефекту і її невизначеність?». Для цього корисні точкова оцінка, довірчий інтервал, правдоподібний діапазон предметно важливих ефектів, аналіз чутливості та, за відповідної задачі, тести еквівалентності або інші методи, що прямо відповідають на дослідницьке питання.


Інша річ — design analysis або sensitivity analysis, який після завершення дослідження не підставляє observed effect як «істину», а запитує, які правдоподібні ефекти цей дизайн узагалі міг розрізняти або які Type S/Type M ризики мав би за зовнішньо заданих ефектів. Gelman і Carlin пропонують саме такий ширший погляд на поведінку дизайну.


Що означає низька статистична потужність


Найпростіший наслідок низької power: якщо ефект заданої величини справді існує, дослідження часто не перетне поріг статистичної значущості. Це підвищує ймовірність помилки другого роду для цієї альтернативи й робить окремий нульовий результат слабким аргументом проти ефекту.


Проблема ширша за «можемо щось не знайти». Коли малий або шумний дизайн виробляє статистично значущий результат, відбір лише значущих оцінок може сприяти перебільшенню їхньої величини. Button та співавтори на матеріалі нейронаук показали зв’язок низької power з перебільшенням ефектів і проблемами відтворюваності; їхня конкретна оцінка історичної median power стосується вибраної нейронаукової літератури й не повинна переноситися як сучасна універсальна цифра на всю психологію.


Ще точніше цю проблему формулюють Gelman і Carlin: за шумних малих досліджень варто оцінювати не лише Type II error, а й ризик Type S — отримати значущий ефект неправильного знака — та Type M — суттєво перебільшити його величину серед значущих результатів. Це не замінює power, але показує, чому «результат значущий» не дорівнює «результат точний».


Як читати незначущий результат з урахуванням power


Фраза «p > 0,05, отже ефекту немає» логічно некоректна. Незначущий результат може виникнути через дуже малий або нульовий ефект, через велику невизначеність, низьку power, порушення припущень, невдале вимірювання або комбінацію причин. Greenland та співавтори детально розбирають цю та інші хибні інтерпретації p-values, confidence intervals і power.


Якщо мета — показати, що ефект настільки малий, що практично неважливий, краще заздалегідь визначити межі практичної еквівалентності або найменший ефект інтересу й використовувати метод, що може прямо виключати важливі величини. Широкий інтервал, який охоплює і нуль, і помітно важливі ефекти, означає невизначеність; вузький інтервал, що виключає предметно значущі величини, дає іншу, сильнішу інформацію.


Тому згадка «дослідження мало 80% power» не повинна використовуватися як автоматичне виправдання висновку «ефекту немає». Power була розрахована для певного ефекту й певних припущень, тоді як інтерпретація конкретних даних потребує оцінки ефекту та невизначеності.


Статистична потужність у психометричних і клінічних дослідженнях


У психометрії power може стосуватися тестування кореляцій, факторних навантажень, різниць між групами, параметрів моделей, інваріантності, DIF, асоціацій із зовнішніми критеріями або інших статистичних гіпотез. Але достатня power для окремого тесту не доводить валідність психологічного інструменту. Валідність потребує системи доказів, релевантних конкретній інтерпретації та використанню балів.


Так само power не замінює reliability. Якщо показник сильно зашумлений, це може зменшити інформаційність дослідження та змінити спостережувані ефекти, але висока внутрішня узгодженість сама по собі не гарантує потрібної power і не робить конструкт валідним. У кластері «Психометрія» ці властивості розглядаються як різні частини якості вимірювання.


У клінічних або діагностичних дослідженнях треба додатково розрізняти power для статистичної гіпотези, sensitivity/specificity діагностичного тесту, PPV/NPV, мінімально важливу зміну, responsiveness та клінічну значущість. Вони відповідають на різні питання. Статистично потужне дослідження не перетворює screening score на діагноз і не робить cutoff універсальною межею «розлад є / розладу немає».


Power, надійність вимірювання і похибка: де саме зв’язок


У простих моделях випадкова похибка вимірювання може послаблювати спостережувані асоціації або збільшувати залишкову варіативність, через що для того самого наукового сигналу потрібно більше даних. Тому покращення точності вимірювання іноді дає не менший виграш, ніж механічне збільшення n. Але конкретний вплив reliability на power залежить від того, яка змінна вимірюється з помилкою, якою є модель і як обчислюється тестова статистика.


Тут важливо не змішувати дві SEM. Стандартна похибка вимірювання в психометрії описує невизначеність індивідуального тестового бала в межах певної моделі вимірювання. Standard error статистичної оцінки описує вибіркову невизначеність оціненого параметра. Обидві можуть бути пов’язані з невизначеністю, але це різні величини й різні задачі.


G*Power та інші калькулятори: що вони можуть і чого не вирішують


G*Power — відомий інструмент для розрахунків power і sample size для багатьох стандартних t-, F-, χ²-, z- та точних тестів. Його можливості описали Faul та співавтори. Сьогодні power analysis також виконують у R, Python, спеціалізованих пакетах і за допомогою Monte Carlo simulations для складних моделей.


Калькулятор не вирішує найважчі методологічні питання за дослідника. Він не знає, чи реалістичний effect size, чи правильний тест, чи достатня валідність показника, чи коректно змодельована кластеризація, чи потрібно контролювати multiplicity, чи буде attrition і чи відповідає статистичний outcome науковому питанню. Програма точно обчислює наслідки введених припущень; якість цих припущень залишається відповідальністю дослідника.


Саме тому добрий звіт не обмежується фразою «G*Power визначив n = 128». Потрібно вказати тип аналізу, очікуваний або мінімально важливий ефект, його джерело, α, цільову power, sidedness, allocation ratio та інші параметри. Це робить розрахунок відтворюваним і критикованим, а не магічним числом.


Типові помилки в інтерпретації статистичної потужності


Перша помилка — трактувати power як імовірність істинності H₁. Power є умовною властивістю процедури за припущеної альтернативи; вона не дає posterior probability гіпотези.


Друга — називати дослідження «80% потужним» без уточнення ефекту. Одне й те саме дослідження може мати високу power для великого ефекту й дуже низьку для малого. Коректне формулювання завжди містить альтернативу або криву power.


Третя — підбирати очікуваний effect size так, щоб отримати зручне n. Розрахунок тоді лише формалізує бажаний бюджет, але не гарантує інформативність дизайну.


Четверта — вважати 0,80 універсально достатньою power. Це конвенція, а не природний поріг.


П’ята — після незначущого результату обчислювати observed power із observed effect і використовувати її як новий доказ. Heinsberg і Weeks пояснюють, чому така практика не додає потрібної інформації.


Шоста — вважати, що більший n автоматично робить висновок важливим. За достатньо великої вибірки навіть дуже малий ефект може дати мале p-value. ASA прямо відокремлює statistical significance від effect size та importance.


Сьома — переносити power з одного тесту на інший. Розрахунок для primary two-sample comparison не обґрунтовує взаємодію, mediation, subgroup analysis або рідкісний adverse outcome, якщо їхні статистичні властивості відрізняються.


Восьма — говорити, що «power 80% означає 20% шансів помилитися в цьому результаті». β є частотою конкретного рішення в повторних вибірках за альтернативи; це не персональна ймовірність помилки вже отриманого висновку.


Як зробити power analysis сильнішим


Сильний power analysis починається не з програми, а з дизайну. Спочатку визначають основне питання й estimand, далі — мінімально важливий або правдоподібний ефект, статистичну модель і наслідки помилок. Після цього розраховують n або power у кількох сценаріях, а не в одному оптимістичному.


Корисно будувати power curve: показувати power для діапазону effect sizes або n. Така крива одразу робить видимим те, що «потужність дослідження» не є однією абсолютною характеристикою. Якщо висновок про достатність n різко змінюється при невеликій зміні припущеного ефекту, це важлива властивість дизайну, яку варто прозоро повідомити.


Для складних моделей варто перевіряти аналіз симуляцією з кодом, що відтворює planned data-generating process, missingness, clustering, estimation procedure та decision rule. Це часто надійніше, ніж підставляти складну задачу в формулу простого t-тесту.


Нарешті, power analysis варто поєднувати з плануванням точності та інтерпретацією довірчих інтервалів. Дизайн, здатний не лише «дати p < 0,05», а й достатньо точно оцінити предметно важливі ефекти, зазвичай краще відповідає цілям накопичувальної науки.


Практичний чекліст перед збором даних


Перед запуском дослідження сформулюйте одне речення: «Наш первинний аналіз має щонайменше X% power виявити ефект Y або більший за α = Z за таких припущень…». Якщо ви не можете заповнити Y і пояснити, звідки він узявся, розрахунок ще не завершено.


Перевірте, чи відповідає тест реальному primary analysis; чи враховані repeated measures, clusters, covariates, allocation ratio і multiplicity; чи realistic variance та correlation; чи додано очікуваний attrition; чи n стосується recruited, randomized або analyzed sample; чи описано software/code; чи є sensitivity scenarios.


Окремо запитайте, чи потрібна вам саме потужність для hypothesis test. Якщо наукова ціль — оцінити параметр із заданою точністю, центральним критерієм може бути ширина довірчого інтервалу або інша міра невизначеності. Якщо ціль — довести практичну еквівалентність, потрібне планування під equivalence framework. Якщо ціль — діагностичну точність, потрібні розрахунки для sensitivity/specificity та precision цих оцінок, а не механічне перенесення power із t-тесту.


FAQ


Чи завжди потрібно прагнути power = 0,80


Ні. 0,80 — поширена, але умовна конвенція. Цільову power потрібно обґрунтовувати через ефект інтересу, наслідки Type II error, ресурси та інференційну мету. Високоризикові рішення можуть вимагати вищої power; інколи головною метою взагалі є точність оцінювання, а не бінарне тестування.


Чи збільшення вибірки завжди підвищує потужність


За незмінної моделі та додавання справді незалежної інформації — зазвичай так. Але кількість учасників не завжди дорівнює ефективному n через кластери, залежні вимірювання, пропуски або дизайн. І більший n не усуває систематичне зміщення чи невалідне вимірювання.


Чи можна розрахувати статистичну потужність після дослідження


Можна виконувати design або sensitivity analyses для зовнішньо заданих ефектів, щоб зрозуміти властивості дизайну. Але observed/post hoc power, де в калькулятор підставляють саме observed effect і використовують результат для пояснення p-value, не є корисною новою інформацією. Після даних центральними стають effect estimate та його невизначеність.


Що означає power = 0,90


За конкретно заданої альтернативи, дизайну, моделі та α це означає, що процедура мала б приблизно 90% довгострокову ймовірність відхилити H₀. Це відповідає β = 0,10. Воно не означає 90% імовірності істинності H₁ у вже проведеному дослідженні.


Чи можна підвищити α, щоб отримати більшу power


Математично за інших однакових умов більша α підвищує power, але водночас збільшує допустимий ризик Type I error. Це trade-off, а не безкоштовне покращення. Рівень α слід задавати до аналізу з урахуванням наслідків обох типів помилок.


Чи є статистична потужність тим самим, що чутливість тесту


Ні. Статистична power стосується ймовірності відхилення H₀ за заданої альтернативи в inferential procedure. Diagnostic sensitivity — частка людей із цільовим станом, яких конкретний тест правильно класифікує позитивно. Це різні ймовірності, різні дизайни й різні джерела помилок.


Як інтерпретувати p > 0,05 у добре спланованому дослідженні


Не як автоматичне «ефекту немає». Подивіться на оцінку ефекту, довірчий інтервал, межі предметно важливих ефектів і припущення моделі. Добре спланований дизайн може зробити нульовий результат набагато інформативнішим, але висновок залежить від точності й того, які ефекти дані реально виключають.


Підсумок


Статистична потужність — це 1 − β: здатність конкретної статистичної процедури за визначеної альтернативи виявити ефект через відхилення H₀. Вона зростає зі збільшенням ефективного обсягу інформації та, за інших однакових умов, із більшим ефектом або менш суворим α; вона також залежить від варіативності, якості вимірювання, структури дизайну та моделі аналізу.


Сильний power analysis завжди називає ефект, для якого розраховується power, обґрунтовує α і цільову β, відтворює реальний дизайн та показує чутливість висновку до невідомих припущень. 80% є конвенцією, observed power після даних не замінює оцінку ефекту, а достатня power не доводить валідність вимірювання або практичну важливість результату.


Для читання вже отриманих результатів power слід поєднувати з effect size, довірчим інтервалом і предметною інтерпретацією. Для планування майбутнього дослідження — з реалістичним effect size, точністю, якістю вимірювання та повною моделлю дизайну. Саме так статистична потужність стає частиною доказового планування, а не ритуальним числом перед словом «достатньо».


Пов’язані статті



Довірчий інтервал: що означає 95% CI і як він показує невизначеність оцінки — як читати точність статистичної оцінки після збору даних і чому CI дає іншу інформацію, ніж post hoc power.


Психологічне дослідження: що це, методи, дизайн і як читати результати — ширший контекст дизайну, вибірки, ефектів, невизначеності та причинних обмежень психологічного дослідження.


Психометрія: що це, що вона вимірює і як оцінюють якість психологічних тестів — про надійність, валідність, норми та інтерпретацію психологічних вимірювань, які не можна замінити самим power analysis.


Похибка вимірювання в психології: випадкова, систематична і чому один бал не є абсолютно точним — про вимірювальний шум і систематичне зміщення, які потрібно відрізняти від статистичної помилки другого роду.


Джерела



Appelbaum, M., Cooper, H., Kline, R. B., Mayo-Wilson, E., Nezu, A. M., & Rao, S. M. (2018). Journal Article Reporting Standards for Quantitative Research in Psychology: The APA Publications and Communications Board Task Force Report. American Psychologist, 73(1), 3–25.


Button, K. S., Ioannidis, J. P. A., Mokrysz, C., Nosek, B. A., Flint, J., Robinson, E. S. J., & Munafò, M. R. (2013). Power failure: why small sample size undermines the reliability of neuroscience. Nature Reviews Neuroscience, 14, 365–376.


Faul, F., Erdfelder, E., Lang, A.-G., & Buchner, A. (2007). G*Power 3: A flexible statistical power analysis program for the social, behavioral, and biomedical sciences. Behavior Research Methods, 39, 175–191.


Gelman, A., & Carlin, J. (2014). Beyond Power Calculations: Assessing Type S (Sign) and Type M (Magnitude) Errors. Perspectives on Psychological Science, 9(6), 641–651.


Greenland, S., Senn, S. J., Rothman, K. J., Carlin, J. B., Poole, C., Goodman, S. N., & Altman, D. G. (2016). Statistical tests, P values, confidence intervals, and power: a guide to misinterpretations. European Journal of Epidemiology, 31, 337–350.


Heinsberg, L. W., & Weeks, D. E. (2022). Post hoc power is not informative. Genetic Epidemiology, 46(7), 390–394.


Lakens, D. (2022). Sample Size Justification. Collabra: Psychology, 8(1), 33267.


Maxwell, S. E., Kelley, K., & Rausch, J. R. (2008). Sample Size Planning for Statistical Power and Accuracy in Parameter Estimation. Annual Review of Psychology, 59, 537–563.

 
 
bottom of page