top of page

Психологічна енкциклопедія

Розмір ефекту: що він показує і чому потрібен поруч зі статистичною значущістю

23 вер.
Читати 15 хв

Автор: Український психологічний ХАБ · Опубліковано: 23 вересня 2026 · Редакційна політика


Розмір ефекту — це кількісний спосіб описати величину відмінності, зв’язку, асоціації або іншого досліджуваного ефекту. Це не один універсальний коефіцієнт, а родина показників, вибір яких залежить від дослідницького запитання, типу даних і дизайну. У психології до них належать, зокрема, різниця середніх у вихідних одиницях, Cohen’s d і Hedges’ g, кореляція r, η² та ω², а для бінарних результатів — різниця ризиків, відношення ризиків і відношення шансів. Kelley і Preacher пропонують розрізняти сам ефект, міру або індекс ефекту та конкретне числове значення, бо словосполучення «розмір ефекту» часто вживають надто широко.


Головна причина дивитися на розмір ефекту поруч зі статистичною значущістю проста: p-значення відповідає на інше запитання. Воно не показує, наскільки великим є ефект і наскільки він важливий. Американська статистична асоціація прямо зазначає, що p-значення або факт статистичної значущості не вимірює величину ефекту чи важливість результату. Саме тому повноцінна інтерпретація потребує щонайменше оцінки величини, її невизначеності та предметного контексту.


Сучасні стандарти звітування в психології підтримують цю логіку. APA Journal Article Reporting Standards орієнтують авторів на прозоре подання оцінок, розмірів ефекту, точності та інших статистичних характеристик, а не на саму дихотомію «p < .05 / p ≥ .05». У статті нижче розмір ефекту розглядається саме як інструмент оцінювання величини, а не як заміна дизайну, валідності вимірювання, причинного висновку чи клінічного судження.


Коротка відповідь: що показує розмір ефекту


Розмір ефекту показує, якою є величина спостережуваної відмінності або зв’язку в обраній метриці. Якщо дві групи відрізняються в середньому на 4 бали за шкалою, то 4 бали — нестандартизована оцінка ефекту. Якщо ту саму різницю поділити на відповідне стандартне відхилення, можна отримати стандартизовану середню різницю, наприклад Cohen’s d. Якщо запитання стосується лінійного зв’язку двох змінних, ефект може бути виражений кореляцією r.


Число завжди має читатися разом із назвою показника. Значення 0,40 для Cohen’s d, r, відношення шансів (odds ratio) або η² означає різні речі. У різних метрик різний нульовий рівень, діапазон, знаменник і предметна інтерпретація. Тому фраза «розмір ефекту дорівнює 0,40» без назви індексу, дизайну й контексту є неповною.


Корисно мислити не одним числом, а зв’язкою: оцінка ефекту → довірчий інтервал → контекст важливості. Точкова оцінка говорить, що саме спостерігалося у вибірці; довірчий інтервал показує невизначеність навколо оцінки; предметні критерії допомагають вирішити, чи має така величина практичне, теоретичне або клінічне значення.


Розмір ефекту і статистична значущість відповідають на різні запитання


Що питає тест статистичної значущості


У класичному NHST-підході p-значення оцінює, наскільки несумісними є дані з конкретною статистичною моделлю, зазвичай моделлю з нульовим ефектом, якщо виконуються її припущення. p-значення не є ймовірністю того, що нульова гіпотеза істинна, і не є ймовірністю того, що результат «виник випадково». Це одне з центральних розрізнень ASA Statement on Statistical Significance and P-Values.


Що питає розмір ефекту


Розмір ефекту питає про величину: наскільки відрізняються групи, наскільки сильний зв’язок, наскільки змінюється ризик або яка частка варіації пов’язана з певним фактором у конкретній моделі. Він переводить висновок із категорії «є сигнал / немає сигналу за порогом» у кількісну площину.


Чому одна й та сама величина може мати різні p-значення


Статистична значущість залежить не лише від величини ефекту, а й від точності його оцінки. Точність, своєю чергою, пов’язана з обсягом вибірки, варіативністю даних, дизайном і моделлю. Тому невеликий ефект у дуже великій вибірці може дати дуже мале p-значення, а ефект тієї самої величини в невеликій вибірці — широке поле невизначеності та p > .05. Cochrane Handbook окремо застерігає від ототожнення малого p з важливим ефектом.


Зворотна помилка теж поширена: p ≥ .05 не доводить відсутність важливого ефекту. Якщо вибірка мала або оцінка неточна, довірчий інтервал може охоплювати як ефекти, близькі до нуля, так і величини, що були б предметно значущими. Саме тому відповідь «не значуще» без оцінки ефекту та інтервалу часто залишає головне запитання відкритим.


Розмір ефекту — не одне число, а вибір метрики


Правильна метрика визначається тим, що саме порівнюють і що читач має зрозуміти. Cochrane Handbook, Chapter 6 показує, що для неперервних результатів природними можуть бути різниця середніх або стандартизована різниця середніх, а для дихотомічних результатів — відношення ризиків, відношення шансів чи різниця ризиків. Ці показники не слід механічно зводити до одного універсального «розміру ефекту».


Нестандартизований ефект: часто найзрозуміліша перша відповідь


Якщо шкала має зрозумілі одиниці, різниця у вихідних одиницях часто інформативніша за стандартизоване число. Різниця у 15 хвилин сну, 3 помилки в завданні, 8 мс часу реакції або 6 балів на добре відомій шкалі безпосередньо відповідає на запитання «наскільки». Baguley і пізніше Pek та Flora аргументують, що нестандартизовані ефекти нерідко краще зберігають предметний зміст і мають інтерпретуватися поряд зі стандартизованими показниками або навіть перед ними.


Перевага вихідних одиниць зникає, коли різні дослідження вимірюють той самий конструкт різними інструментами або коли одиниця сама по собі мало що говорить читачеві. Тоді стандартизація може створити спільну шкалу. Але вона змінює зміст числа: ефект починає виражатися відносно певної міри варіативності, а не в початкових одиницях.


Cohen’s d: стандартизована різниця між середніми


Cohen’s d — один із найвідоміших показників стандартизованої різниці середніх. У простому дизайні з двома незалежними групами його можна уявити як різницю середніх, поділену на об’єднане стандартне відхилення: d = (M₁ − M₂) / SDpooled. APA Dictionary of Psychology описує d як різницю між двома середніми в одиницях стандартного відхилення.


d = 0 означає відсутність стандартизованої різниці середніх у вибірці. Знак показує напрямок відповідно до того, яку групу від якої віднімають. Абсолютна величина показує, скільки стандартних відхилень становить різниця. Наприклад, d = 0,50 означає різницю приблизно в половину обраного стандартного відхилення; це не означає «50% покращення» і не означає, що 50% людей обов’язково отримають користь.


Чому для d важливий знаменник


Стандартизована різниця залежить не тільки від різниці середніх, а й від стандартного відхилення. Та сама різниця в 5 балів дасть більший d у більш однорідній вибірці та менший d у більш варіативній. Cochrane прямо застерігає: якщо відмінності SD між дослідженнями відображають реальні відмінності варіативності популяцій, стандартизовані середні різниці можуть змінюватися навіть за однакової різниці середніх.


Саме тому d не є магічною «чистою величиною ефекту», незалежною від популяції. Стандартизація прибирає одиниці шкали, але вводить залежність від дисперсії. Нове дослідження практик інтерпретації в психології, Schäfer (2026), показує, що дослідники часто приписують стандартизованим величинам більше предметного змісту, ніж вони реально несуть.


Cohen’s d для незалежних і повторних вимірювань


Назва «Cohen’s d» приховує кілька варіантів. Для незалежних груп і для парних або повторних вимірювань можливі різні знаменники: стандартне відхилення різниць, середнє стандартне відхилення умов, скоригований варіант із урахуванням кореляції тощо. Lakens наголошує, що вибір індексу має відповідати дизайну й дослідницькому запитанню, а автор повинен прямо вказувати, який саме d обчислено.


Через це два числа d з різних дизайнів не завжди можна порівнювати так, ніби вони отримані однаково. Для метааналізу або міждослідницького порівняння потрібно переконатися, що метрики приведені до зіставної форми.


Hedges’ g: навіщо потрібна поправка для малих вибірок


Вибірковий Cohen’s d має невелике зміщення в бік завищення абсолютної величини, особливо за малих вибірок. Hedges’ g застосовує коригувальний множник до d і тому часто використовується як менш зміщена оцінка стандартизованої різниці. На великих вибірках d і g зазвичай дуже близькі. Формулу поправки на зміщення та зв’язок між d і g узагальнює Hedges (2026).


Практичне правило тут не в тому, що g «кращий за d» завжди. Важливіше знати, який параметр оцінюється, який стандартний відхил використано, який дизайн лежить під розрахунком і чи потрібна корекція малого зразка. У метааналізах g часто зручний саме через властивості оцінювання.


Кореляція r як розмір зв’язку


Коефіцієнт кореляції Pearson r одночасно описує напрямок і силу лінійної асоціації двох кількісних змінних. Він лежить між −1 та +1: знак задає напрямок, а абсолютне значення — ступінь лінійного співзмінювання. r = 0 означає відсутність лінійної кореляції, але не відсутність будь-якого зв’язку.


r є безрозмірним і тому зручним для порівнянь, але його значення залежить від діапазону варіації змінних, надійності вимірювання, нелінійності й структури вибірки. Baguley описує, як обмеження діапазону та ненадійність можуть спотворювати стандартизовані величини. У психологічних даних це особливо важливо, бо багато конструктів вимірюються з ненульовою похибкою.


Чи означає r² «відсоток поясненого ефекту»


У простій біваріатній лінійній ситуації r² можна інтерпретувати як частку дисперсії однієї змінної, лінійно пов’язану з іншою в цій моделі. Але перетворювати r² на універсальну міру «важливості» небезпечно. Funder і Ozer окремо критикують механічне квадратування r як спосіб оцінювати змістовну важливість: невеликі кореляції можуть мати суттєві накопичувальні наслідки, а частка дисперсії не дорівнює причинній частці.


І головне: сильна кореляція сама по собі не встановлює причинності. Питання про те, чи одна змінна спричиняє іншу, належить до дизайну й каузальної ідентифікації; окремо це розібрано у статті «Кореляція і причинність».


η², часткове η² та ω²: ефекти в моделях ANOVA


У дисперсійному аналізі часто повідомляють η² (eta squared), часткове η² та ω² (omega squared). Вони пов’язані з часткою варіативності, яку приписує ефекту конкретна модель, але це різні показники. Partial η² виключає з знаменника частину варіації, пов’язану з іншими ефектами, тому зазвичай є більшим за η² і особливо залежить від структури дизайну.


ω² намагається скоригувати вибіркове завищення і часто розглядається як менш зміщена оцінка відповідного популяційного внеску. Lakens показує, що для ANOVA немає одного автоматично правильного індексу: узагальнене η² (generalized η²), часткове η², ω² та інші варіанти відповідають різним цілям узагальнення. Тому порівнювати часткове η² з η² або переносити пороги між ними без пояснення не слід.


Бінарні результати: відношення ризиків, відношення шансів і різниця ризиків


Коли результат має два стани — наприклад, подія сталася або ні — величину ефекту часто описують не d, а відношенням ризиків (risk ratio, RR), відношенням шансів (odds ratio, OR) або різницею ризиків (risk difference, RD). Cochrane Handbook підкреслює, що це різні міри ефекту з різною інтерпретацією.


Для RR та OR значення 1 означає відсутність відносної різниці, тоді як для RD нульовий ефект дорівнює 0. OR = 2 не означає «ризик у два рази більший», якщо подія не є рідкісною: шанси й імовірність — різні величини. Вибір метрики має враховувати те, що буде зрозуміло читачеві та релевантно для рішення.


Чи можна назвати ефект «малим», «середнім» або «великим»


Класичні орієнтири Cohen для d — приблизно 0,20, 0,50 і 0,80 — широко відомі як «малий», «середній» і «великий» ефект; ці пороги наводить і APA Dictionary. Їхня правильна роль — груба евристика за відсутності кращої предметної опори, а не універсальний закон природи.


Сам Cohen радив дивитися на ефекти в конкретній галузі, а сучасна методологічна література ще сильніше відходить від механічного ярлика. Schäfer і Schwarz показали, що типові величини ефектів відрізняються між підгалузями психології. Funder і Ozer пропонують оцінювати наслідки в контексті й порівнювати їх із добре зрозумілими орієнтирами.


У 2026 році Schäfer додатково показав, що стандартизовані ефекти часто інтерпретують надмірно і що контекстно або дисциплінарно специфічні орієнтири кращі за автоматичне застосування загальних порогів. Отже, d = 0,30 може бути важливим у одному контексті й майже неважливим в іншому.


Практична і клінічна важливість — окреме питання


Статистична величина не перетворюється автоматично на практичну важливість. Ефект може бути малим у стандартизованих одиницях, але мати великі наслідки, якщо впливає на мільйони людей, повторюється багато разів або стосується критично важливого результату. І навпаки, великий d може описувати різницю за шкалою, яка не має суттєвого практичного значення.


У клінічній та дослідженнях клінічних результатів важливість іноді задають через мінімально важливою різницею (MID) або мінімально важливою зміною (MIC). Це предметний поріг зміни, а не синонім Cohen’s d. Cochrane окремо розглядає інтерпретацію неперервних результатів через MID і застерігає, що стандартизована різниця сама по собі може бути важкою для клінічного тлумачення.


Так само ефект на рівні групи не говорить, що відбулося з конкретною людиною. Середня різниця між групами не є індивідуальним прогнозом, а статистично значущий груповий ефект не є підставою ставити діагноз або робити висновок про конкретного пацієнта.


SESOI: найменший розмір ефекту, що становить інтерес


Більш змістовна альтернатива універсальним порогам — заздалегідь визначити найменший розмір ефекту, який має теоретичне або практичне значення, SESOI (smallest effect size of interest). Lakens, Scheel і Isager описують, як SESOI можна обґрунтувати через теорію, попередні дані, поріг помітності, витрати й користь або предметні вимоги.


SESOI дозволяє поставити точніше запитання: чи сумісні дані з ефектом, достатньо великим, щоб нас цікавити? У тестуванні еквівалентності можна перевіряти, чи дані дають підстави відкинути ефекти, більші за заздалегідь визначену межу. Це важливо, бо звичайне p > .05 не доводить практичної еквівалентності.


Довірчий інтервал навколо розміру ефекту


Точкова оцінка завжди містить вибіркову невизначеність. d = 0,45 без інтервалу може виглядати точним, хоча реальні дані можуть бути сумісними з широким діапазоном популяційних величин. Саме тому Pek і Flora та Cumming наголошують на звітуванні ефектів разом із довірчими інтервалами.


Вузький інтервал означає вищу статистичну точність, широкий — нижчу. Інтервал може показати, що дані сумісні одночасно з дуже малим і предметно важливим ефектом. Він також допомагає уникнути помилки, коли дві майже однакові оцінки називають принципово різними лише тому, що одна перетнула поріг p = .05, а інша ні.


Довірчий інтервал не виправляє поганий дизайн, систематичне зміщення, невдале вимірювання чи порушені припущення моделі. Він відображає невизначеність за заданою процедурою та моделлю. Детальна інтерпретація 95% CI викладена на сторінці «Довірчий інтервал».


Як розмір вибірки впливає на інтерпретацію


Обсяг вибірки насамперед впливає на точність оцінки. У невеликій вибірці точковий ефект може сильно коливатися від повторення до повторення. У великій вибірці та сама популяційна величина зазвичай оцінюється точніше. Це одна з причин, чому «статистично значущий» результат не слід читати без розміру ефекту: дуже великий N робить статистичний тест чутливим навіть до дрібних відхилень від нульової моделі.


У малих вибірках є ще одна проблема: деякі стандартизовані оцінки мають вибіркове зміщення. Саме тому для стандартизованої різниці середніх часто застосовують Hedges’ g. Але жодна корекція не робить малу вибірку такою ж інформативною, як добре сплановане дослідження з достатньою точністю.


Розмір ефекту і статистична потужність


Статистична потужність — імовірність відхилити нульову гіпотезу за визначеного справжнього ефекту, рівня α, дизайну та обсягу вибірки. Очікувана величина ефекту є одним із ключових параметрів планування: що менший ефект дослідження має бути здатним виявити, то зазвичай більша потрібна вибірка.


Але підставляти в планування один нестабільний ефект із маленького пілотного дослідження небезпечно. Краще спиратися на предметно обґрунтований SESOI, надійні попередні синтези або консервативний діапазон значень. Lakens підкреслює зв’язок між вибором ефект-метрики, плануванням потужності та кумулятивністю науки.


Розмір ефекту в метааналізі


Метааналіз об’єднує кількісні оцінки з кількох досліджень, тому потребує сумісної ефект-метрики. Для неперервних результатів на одній шкалі це може бути різниця середніх; для різних шкал одного конструкта — стандартизована середня різниця; для бінарних результатів — RR, OR або RD. Cochrane рекомендує називати конкретну ефект-міру, а не покладатися на двозначний загальний термін.


Середній ефект метааналізу не означає, що ефект однаковий у кожній популяції й кожному дизайні. Потрібно дивитися на гетерогенність, інтервал навколо середнього ефекту, ризик упередження, якість вимірювання й відмінності між дослідженнями. Сам факт метааналізу не перетворює слабкі первинні дані на високу певність.


Вимірювання впливає на розмір ефекту


У психології ефект часто обчислюють із балів тестів і шкал, а отже його зміст залежить від якості вимірювання. Ненадійність може послаблювати кореляції, обмеження діапазону — змінювати їхню величину, а різна дисперсія популяцій — змінювати стандартизовані різниці. Тому розмір ефекту не існує окремо від психометрії та від властивостей інструмента.


Висока надійність тесту не гарантує валідності інтерпретації, а великий ефект не доводить, що виміряно саме потрібний конструкт. Якщо систематична похибка зміщує бали, точний статистичний ефект може бути точним описом зміщених даних. Загальну логіку випадкової та систематичної похибки вимірювання потрібно враховувати окремо.


Не слід плутати стандартне відхилення, що входить у знаменник Cohen’s d, зі стандартною похибкою вимірювання (SEM). SD описує варіативність спостережуваних значень у певній вибірці, тоді як психометрична SEM оцінює невизначеність індивідуального бала, пов’язану з ненадійністю вимірювання.


Кроскультурні та групові порівняння


Якщо розмір ефекту описує різницю між мовними, культурними або демографічними групами за психологічною шкалою, спершу потрібно запитати, чи мають бали зіставний зміст. International Test Commission рекомендує порівнювати бали між популяціями лише за наявності достатніх доказів інваріантності на шкалі, на якій проводиться порівняння.


Отже, великий d між двома групами може відображати реальну різницю конструкту, різні властивості вимірювання, відмінності варіативності, мовну адаптацію або поєднання цих факторів. Розмір ефекту кількісно описує різницю в даних; він не встановлює самостійно її психологічне походження чи справедливість тесту.


Типові помилки інтерпретації


«p < .05 означає великий ефект»


Ні. Статистична значущість не вимірює величину. За великої вибірки дуже малий ефект може бути статистично значущим. ASA прямо фіксує це розрізнення.


«p > .05 означає, що ефект дорівнює нулю»


Ні. Такий результат може бути сумісним із нулем, але також із цілим діапазоном ненульових ефектів. Потрібні точкова оцінка, довірчий інтервал і, якщо питання саме про практичну відсутність ефекту, методи на кшталт тестування еквівалентності.


«d = 0,80 завжди великий і важливий»


Ні. 0,80 — класичний орієнтир, а предметне значення залежить від шкали, популяції, дизайну, базової варіативності, наслідків і того, з чим результат порівнюють. Schäfer (2026) показує, чому стандартизовані конвенції легко переінтерпретувати.


«Стандартизований ефект завжди кращий за різницю в балах»


Ні. Якщо вихідні одиниці зрозумілі, вони часто краще відповідають на предметне запитання. Стандартизація особливо корисна для порівняння різних шкал або синтезу, але може приховати абсолютний зміст. Baguley рекомендує серйозно розглядати прості нестандартизовані ефекти.


«Більший розмір ефекту означає краще дослідження»


Ні. Якість дослідження визначається дизайном, вимірюванням, контролем упереджень, прозорістю аналізу, точністю й відповідністю висновків даним. Велика оцінка може бути реальною, випадково завищеною або зміщеною. Сам її масштаб не є рейтингом методологічної якості.


«Великий r доводить причинність»


Ні. Навіть r, близький до 1 або −1, описує асоціацію. Причинний висновок потребує окремої ідентифікаційної логіки, контролю альтернативних пояснень і відповідного дизайну. Див. «Кореляція і причинність».


«Ефект розповідає, що станеться з конкретною людиною»


Не обов’язково. Більшість класичних показників розміру ефекту описують групові або популяційні параметри. Вони не є персональним діагнозом, прогнозом відповіді на лікування чи індивідуальною ймовірністю без додаткової моделі й відповідної валідації.


Як читати розмір ефекту в науковій статті


Спершу визначте метрику й нульову точку: d, g, r, η², OR, RR, RD або інший показник. Потім подивіться на вихідні одиниці, якщо вони доступні: середні, стандартні відхилення, частоти, ризики або регресійні коефіцієнти. Далі оцініть довірчий інтервал і те, які предметно важливі величини він охоплює.


Після цього перевірте дизайн. Для експерименту важливі рандомізація, дотримання протоколу, втрати й вимірювання; для спостережного дослідження — конфаундинг, селекція й модель; для кореляції — діапазон і надійність змінних; для тестів — валідність, надійність, популяція норм і культурна адаптація. Тільки тоді має сенс переходити від числа до змістовного висновку.


Нарешті, порівняйте величину не з автоматичним словом «малий/великий», а з тим, що має значення у цій галузі: попередніми високоякісними дослідженнями, метааналітичним розподілом ефектів, SESOI, MID або конкретними наслідками. Такий підхід узгоджується з логікою Funder і Ozer, Pek і Flora та Schäfer.


Як правильно звітувати розмір ефекту


Хороше звітування називає конкретну ефект-метрику, дає точкову оцінку, 95% довірчий інтервал, пояснює напрямок і одиниці, а для стандартизованих величин — спосіб стандартизації. Для парного дизайну треба уточнити варіант d; для ANOVA — чи це η², часткове η², узагальнене η² (generalized η²) або ω²; для бінарного результату — чи це OR, RR або RD.


Також корисно подавати описові статистики, щоб читач бачив дані за стандартизованим числом. У практично значущих контекстах варто додати вихідний абсолютний ефект. Такий принцип — оцінка плюс невизначеність плюс предметний зміст — відповідає сучасному руху від порогового мислення до мислення оцінками (estimation thinking), описаного Cumming.


Науковий статус поняття


Розмір ефекту — усталений статистичний і методологічний інструмент у психології, медицині, освіті, соціальних і поведінкових науках. Дискусія стосується не того, чи потрібні оцінки величини, а того, як саме їх обирати, стандартизувати та інтерпретувати. Сучасний консенсус методологічної літератури тяжіє до повнішого звітування: ефект у змістовних одиницях, стандартизована міра за потреби, інтервал невизначеності й контекст.


Спірним залишається автоматичне застосування універсальних порогів, надмірна довіра до стандартизованих індексів і редукція наукового висновку до одного числа. Тут evidence дедалі сильніше підтримує контекстне тлумачення, а не ритуальне наклеювання ярликів «малий / середній / великий».


FAQ


Що таке розмір ефекту простими словами?


Це число, яке показує, наскільки великою є відмінність або наскільки сильним є зв’язок у конкретній статистичній метриці. Воно відповідає на «наскільки», тоді як p-значення саме по собі цього не показує.


Чим розмір ефекту відрізняється від p-значення?


Розмір ефекту оцінює величину. p-значення описує сумісність даних із заданою статистичною моделлю за її припущень. Малий p не гарантує великого або важливого ефекту, а великий p не доводить нульовий ефект.


Що означає Cohen’s d = 0,5?


У простому випадку це означає, що середні двох груп відрізняються приблизно на половину використаного стандартного відхилення. Це не означає 50% зміни, 50% користі або 50% імовірності успіху.


Чи завжди d = 0,2 малий, 0,5 середній, а 0,8 великий?


Це історичні орієнтири Cohen, корисні як груба евристика. Для змістовного висновку кращі галузеві порівняння, попередні високоякісні дані, SESOI та практичні наслідки.


Що краще: Cohen’s d чи Hedges’ g?


Обидва описують стандартизовану різницю середніх, але Hedges’ g коригує зміщення d у малих вибірках. Вибір залежить від дизайну, розміру вибірки й того, з якими дослідженнями результат потрібно порівнювати.


Чи можна порівнювати d і r напряму?


Вони вимірюють різні аспекти й мають різні шкали. Існують математичні перетворення за певних припущень, але механічно порівнювати числа d = 0,4 і r = 0,4 як однакову величину не можна.


Чи потрібен довірчий інтервал для розміру ефекту?


Так. Точкова оцінка без інтервалу приховує невизначеність. 95% CI допомагає зрозуміти, наскільки точно оцінено величину і чи сумісні дані з ефектами, що мають різне предметне значення.


Чи означає статистично незначущий результат відсутність ефекту?


Ні. Він може означати недостатню точність для відхилення конкретної нульової моделі. Щоб аргументувати практичну відсутність важливого ефекту, потрібні інтервальні оцінки й, за відповідного запитання, equivalence testing відносно заздалегідь обґрунтованого SESOI.


Чи показує розмір ефекту причинність?


Сам по собі — ні. Навіть великий ефект асоціації може виникати через конфаундинг, селекцію, зворотну причинність або інші механізми. Причинність визначається дизайном та каузальною аргументацією.


Чи можна за розміром ефекту оцінити користь психотерапії або лікування для конкретної людини?


Груповий розмір ефекту не є індивідуальним прогнозом. Для клінічних рішень потрібні абсолютні наслідки, невизначеність, побічні ефекти, базовий ризик, індивідуальні характеристики та валідні клінічні дані. Один d або OR не замінює клінічної оцінки.


Висновок


Розмір ефекту повертає статистичному результату його головний зміст: величину. Він показує, наскільки відрізняються групи або наскільки сильним є зв’язок у конкретній метриці. Статистична значущість потрібна для іншої частини інференції й не вимірює важливість. Тому сучасне читання результату має будуватися навколо оцінки ефекту, довірчого інтервалу, якості дизайну, якості вимірювання та предметного контексту.


Для психології особливо важливо не зводити розмір ефекту до універсального рейтингу. Cohen’s d, Hedges’ g, r, η², OR, RR та інші показники мають різні властивості. Нестандартизована різниця часто є найзрозумілішою, стандартизація корисна для порівняння й синтезу, а значущість ефекту визначається тим, що це число означає в реальному дослідницькому або клінічному контексті.


Пов’язані статті







Статистична значущість — що означає p < .05 і чому статистично значущий результат не дорівнює великому або практично важливому ефекту.


Джерела

















 
 
bottom of page