Причинність у психологічних дослідженнях: як обґрунтовують причинний ефект
Український психологічний ХАБ · Опубліковано: 7 жовтня 2026 · Редакційна політика
Причинність у психологічних дослідженнях — це питання про те, чи змінюється психологічний результат саме внаслідок зміни певного чинника, а не лише про те, чи спостерігаються ці дві величини разом. Причинний висновок потребує чіткого причинного питання, визначеного причинного ефекту, дизайну, який робить релевантне порівняння можливим, контролю систематичних упереджень і явних припущень. Саме тому причинність не встановлюється одним коефіцієнтом, p-значенням або регресійною моделлю.
У психології це особливо важливо: поведінка, емоції, когнітивні процеси й соціальні явища мають багато взаємопов’язаних причин, частина яких змінюється з часом і вимірюється з похибкою. Сучасний огляд причинного висновку щодо людської поведінки наголошує, що дослідник має спочатку точно визначити каузальне питання, а вже потім обирати дизайн і аналіз; різні методи розв’язують різні проблеми і не створюють причинності автоматично. Bailey та співавтори (2024) пропонують також використовувати триангуляцію — зіставляти висновки з експериментальних, квазіекспериментальних і спостережних підходів, розуміючи припущення кожного.
Коротка відповідь: причинний ефект описує, що змінилося б у результаті через зміну причини
Найкоротше визначення таке: причинний ефект X на Y — це різниця між результатом Y за однієї визначеної умови або втручання щодо X і результатом Y за альтернативної умови, за інших релевантних умов. У сучасній контрфактичній традиції це формулюють через потенційні результати. Для однієї людини можна позначити Y(1) як результат за умови впливу, а Y(0) — результат за умови його відсутності. Індивідуальний ефект тоді концептуально дорівнює Y(1) − Y(0).
Ключова складність полягає в тому, що для тієї самої людини в той самий момент неможливо одночасно спостерігати обидва потенційні результати. Ми бачимо лише один фактичний стан, а другий є контрфактичним. Тому причинний висновок завжди потребує способу побудувати переконливе порівняння: за допомогою рандомізації, природної або квазіекспериментальної варіації, продуманого спостережного дизайну чи інших методів з чіткими припущеннями. Цю логіку систематично викладають Hernán і Robins у Causal Inference: What If.
На рівні групи часто цікавить середній причинний ефект: ATE = E[Y(1) − Y(0)]. Це середня різниця потенційних результатів у певній цільовій популяції. В інших дослідженнях цільовим параметром може бути ефект серед тих, хто фактично отримав вплив, ефект за певного режиму втручання, прямий або непрямий ефект, ефект у конкретній підгрупі. Перш ніж рахувати статистику, треба визначити, який саме ефект є предметом питання. Окремий випадок — непрямий ефект через посередника; його визначення, статистичне оцінювання та межі причинного тлумачення розглянуто у статті «Медіаційний аналіз у психології».
Причинне питання починається не зі статистичної моделі, а з контрасту
Фраза «стрес впливає на пам’ять» звучить каузально, але ще не визначає дослідницьке питання. Який стрес? Якої інтенсивності й тривалості? Порівняно з чим? Яка саме пам’ять, коли її вимірюють і в якій популяції? Чи йдеться про короткочасну лабораторну маніпуляцію, хронічний життєвий стрес або клінічний стан? Різні відповіді задають різні причинні ефекти.
Добре сформульоване причинне питання визначає щонайменше п’ять речей: популяцію; вплив або втручання; альтернативу для порівняння; результат; часовий горизонт. Для складних психологічних явищ потрібне також уточнення режиму впливу: «зменшити стрес» не є однозначною інтервенцією, якщо це може означати психотерапію, зміну навантаження, сон, медикаменти або соціальну підтримку.
Тому слова «причина» і «ефект» мають операційний зміст лише відносно конкретного контрасту. Grosz, Rohrer і Thoemmes (2020) показали, що в неекспериментальній психології уникання явної причинної мови часто лише приховує каузальну мету. Методологічно сильніше назвати причинне питання прямо й описати припущення, ніж поставити каузальне питання, а потім замаскувати його словом «асоціація».
Асоціація, прогноз і причинний ефект відповідають на різні питання
Асоціація питає, чи змінюються X і Y разом. Прогноз питає, наскільки добре X та інші змінні допомагають передбачити Y у нових даних. Причинний аналіз питає, що сталося б із Y, якби ми змінили X певним способом. Одна й та сама змінна може бути чудовим предиктором і водночас поганою мішенню для втручання.
Саме це є межею між цією статтею та окремим матеріалом «Кореляція і причинність»: сторінка про кореляцію пояснює, чому спостережуваний зв’язок сам по собі не доводить причини; тут центральне питання інше — як дослідник позитивно будує аргумент на користь причинного ефекту.
Навіть дуже висока кореляція, дуже мале p-значення або точний прогноз не є достатньою умовою причинності. Вони можуть співіснувати зі зворотним причинним напрямом, спільною причиною, селекційним упередженням або похибкою вимірювання. Так само слабка проста кореляція не виключає складного причинного ефекту, якщо гетерогенність, нелінійність або протилежні ефекти в підгрупах взаємно компенсуються.
Контрфактична логіка: з чим порівнюється фактичний результат
Причинний висновок завжди містить контрфактичне порівняння. Якщо після втручання середній показник тривоги дорівнює 40 балів, саме число 40 не є причинним ефектом. Потрібно знати, яким був би середній показник у порівнюваній ситуації без цього втручання або за іншого втручання. Причинний ефект — різниця між цими можливими результатами, а не результат сам по собі.
Наприклад, у програмі зниження стресу середній бал тривоги після втручання становить 40, а в порівнюваній умові — 47. Різниця −7 балів може оцінювати причинний ефект лише тоді, коли порівнювані групи справді відтворюють релевантні контрфактичні стани або коли аналітичні припущення дозволяють так їх інтерпретувати. Без цього −7 є груповою різницею, що може включати причинний ефект разом із конфаундингом, відбором, різним вимірюванням та іншими джерелами зміщення.
Що потрібно для ідентифікації причинного ефекту
Умови причинної ідентифікації залежать від дизайну та конкретного методу. Для поширених контрфактичних підходів ключовими є обмінюваність, позитивність і узгодженість; до них додаються правильне визначення часу, достатньо якісне вимірювання, коректна модель відбору та інші припущення. Hernán і Robins докладно показують, що статистична формула отримує причинну інтерпретацію лише тоді, коли відповідні умови виконуються.
1. Часовий порядок
Причина має передувати тому наслідку, який їй приписують. Поперечне дослідження, де X і Y виміряні одночасно, часто не дозволяє визначити напрям: безсоння може посилювати тривогу, тривога може погіршувати сон, а обидва процеси можуть взаємно підтримуватися. Поздовжнє вимірювання допомагає встановити часову послідовність, але саме по собі ще не усуває конфаундинг, селекцію чи похибку вимірювання.
2. Обмінюваність і відсутність неконтрольованого конфаундингу
Інтуїтивно обмінюваність означає, що після врахування потрібних чинників групи, які порівнюють, достатньо схожі щодо потенційних результатів. У рандомізованому експерименті випадковий розподіл створює цю властивість у середньому за процедурою рандомізації. У спостережних даних її зазвичай доводиться припускати умовно — після коректного врахування причин спільного впливу.
Конфаундинг виникає, коли спільна причина впливу й результату створює або спотворює їхній зв’язок. Cochrane визначає конфаундинг як одну з центральних проблем нерандомізованих досліджень втручань і рекомендує наперед визначати важливі конфаундингові домени. Cochrane Handbook, chapter 25 оцінює також селекційні, інформаційні та інші види систематичної похибки.
3. Позитивність
Позитивність означає, що для релевантних комбінацій характеристик існує ненульова ймовірність кожної умови, яку ми хочемо порівнювати. Якщо в певній підгрупі ніхто ніколи не отримує альтернативне втручання, дані не містять реального порівняння для цієї підгрупи. Сильні або структурні порушення позитивності змушують екстраполювати поза підтримку даних.
4. Узгодженість і добре визначений вплив
Узгодженість пов’язує спостережуваний результат із потенційним результатом за тієї умови, яку людина фактично отримала. Це вимагає достатньо чітко визначеного впливу. Якщо «висока соціальна підтримка» може виникати через десятки суттєво різних процесів, причинний ефект абстрактної категорії може бути неоднозначним. Дослідник має вказати, який стан або інтервенцію означає X.
5. Відсутність критичного втручання між одиницями та інші припущення
У багатьох стандартних моделях припускають, що результат однієї людини не змінюється через те, яку умову отримала інша. У психології та соціальній науці це часто сумнівно: поведінка одного учасника може впливати на партнера, клас, команду або онлайн-мережу. Таке взаємне втручання не робить причинний аналіз неможливим, але вимагає дизайну й оцінюваного параметра, які його враховують. Bailey та співавтори включають interference, гетерогенність ефектів і часові масштаби до ключових сучасних викликів причинного висновку щодо поведінки.
Чому рандомізація є сильною основою причинного висновку
У добре спроєктованому рандомізованому експерименті учасників випадково розподіляють між умовами. Рандомізація розриває систематичний зв’язок між призначенням умови та вихідними прогностичними характеристиками в межах ймовірнісної процедури. Саме тому вона дає сильну основу для оцінки причинного ефекту призначення втручання.
Випадковий розподіл між умовами не тотожний випадковому формуванню вибірки. Перше стосується внутрішнього причинного порівняння, друге — того, як люди потрапили до дослідження і наскільки вибірка представляє ширшу популяцію. Експеримент може мати сильну внутрішню валідність і водночас обмежену переносимість результату на інші групи, ситуації або часові періоди.
Рандомізація також не виправляє все. Причинний висновок можуть послаблювати великі втрати учасників, недотримання призначеної умови, помилки реалізації втручання, неякісне або диференційне вимірювання результату, розкриття умови, селективне звітування й аналітичні рішення після перегляду даних. CONSORT 2025 є стандартом прозорого звітування рандомізованих випробувань; це стандарт звітування, а не сертифікат відсутності упереджень.
Докладніше логіку маніпуляції, контролю, випадкового розподілу й валідності дизайну розкрито в окремій статті «Експериментальний метод у психології».
Чи можна обґрунтовувати причинність без рандомізованого експерименту
Так. Відсутність рандомізації не перетворює дослідження автоматично на суто описове, але підвищує вимоги до причинної моделі, дизайну, припущень і перевірок. Grosz, Rohrer і Thoemmes аргументують, що психологія має робити такі припущення явними. Сучасна причинна інференція розглядає нерандомізоване дослідження не як спробу «статистично довести причинність», а як дизайн, який за певних умов дозволяє ідентифікувати конкретний причинний параметр.
Важливо оцінювати конкретні ознаки дизайну, а не лише назву. Поздовжня когорта може бути кращою за поперечне дослідження для часової послідовності, але все одно мати неконтрольований конфаундинг. Природний експеримент може створювати сильний зовнішній контраст, але тільки якщо механізм розподілу справді дає порівнювані групи. Інструментальна змінна, регресійний розрив або різниця-різниць можуть мати переконливу причинну інтерпретацію, якщо виконуються специфічні для них припущення.
Тому «спостережне» і «причинне» не є взаємовиключними категоріями. Причинний висновок зі спостережних даних є умовним: він залежить від того, чи правдоподібні припущення про конфаундинг, відбір, часовий порядок, вимірювання, функціональну форму й механізм, який створив варіацію впливу.
Конфаундинг: чому «врахувати більше змінних» не означає краще
Поширена помилка — включити в регресійну модель якомога більше коваріатів і вважати, що після цього коефіцієнт X став причинним. Насправді вибір змінних для контролю має випливати з причинної структури. Контроль справжнього спільного причинного чинника може зменшити конфаундинг; контроль посередника може заблокувати частину ефекту, який нас цікавить; контроль колайдера може створити асоціацію, якої без такого умовлення не було.
Rohrer (2018) на психологічних прикладах показує, чому графічні причинні моделі корисні саме для вибору змінних, а Tennant та співавтори (2021) у методологічному огляді підкреслюють, що DAG допомагають явно представити припущення про структуру даних і визначати достатні набори для контролю конфаундингу.
Окрема канонічна стаття «Конфаундинг у психологічних дослідженнях» розбирає, як спільні причини змішують спостережувану асоціацію з причинним ефектом, які змінні слід контролювати та чому механічне додавання коваріатів може створювати нове зміщення.
Селекція і колайдер: як аналіз може створити хибний зв’язок
Селекційне упередження виникає, коли потрапляння до вибірки, збереження в дослідженні або включення до аналізу залежить від змінних, пов’язаних із впливом і результатом. Особливо небезпечно умовлюватися на спільному наслідку двох змінних — колайдері. Це може відкрити статистичний шлях між ними й створити або змінити асоціацію.
Наприклад, якщо участь у спеціалізованій програмі залежить і від тяжкості симптомів, і від мотивації, аналіз лише тих, хто потрапив у програму, може створити незвичайний зв’язок між симптомами й мотивацією. Додати змінну «участь» як контроль не виправляє проблему автоматично. Її роль треба розглядати в причинній схемі.
Зворотна причинність і часові петлі
У психологічних даних напрям ефекту часто двосторонній. Соціальна ізоляція може посилювати депресивні симптоми, а депресивні симптоми можуть сприяти подальшому відходу від соціальних контактів. Сам факт, що X виміряли раніше за Y, допомагає, але не гарантує, що ранні рівні Y або спільні причини не визначили X.
Причинний аналіз динамічних процесів має визначати часовий масштаб: ефект через годину, тиждень і рік може відрізнятися за величиною або знаком. Агрегування вимірювань може приховувати швидкі взаємні петлі. Саме тому формула «X передує Y» є необхідною частиною причинного аргументу, але не достатньою.
Вимірювання: причинний дизайн залежить від того, що саме виміряно
Психологічні конструкції часто не спостерігаються безпосередньо: дослідник використовує шкали, поведінкові індикатори, завдання, цифрові сліди або експертні оцінки. Помилка вимірювання експозиції, результату чи конфаундера може послабити, посилити або змінити причинну оцінку. Якщо конфаундер виміряно грубо, «статистичний контроль» може залишити резидуальний конфаундинг.
При цьому внутрішня валідність причинного дизайну не тотожна психометричній валідності тесту. Перша стосується того, наскільки дизайн підтримує причинну інтерпретацію; друга — аргументації щодо інтерпретації та використання показників вимірювального інструмента. Психометричні питання належать до окремого кластера психологічного вимірювання.
Каузальні діаграми DAG: мова для явних причинних припущень
Спрямований ациклічний граф, або DAG, зображує змінні як вузли, а передбачувані причинні відношення — як стрілки. Він не доводить, що стрілки правильні; його сила в іншому: припущення стають видимими й перевірюваними методологічно. Дослідник може побачити, які шляхи створюють конфаундинг, де є колайдер, які змінні є посередниками і які набори коваріатів достатні для блокування некаузальних шляхів.
DAG треба будувати з предметного знання, теорії, дизайну й часової логіки до перегляду бажаного результату аналізу. Tennant та співавтори звертають увагу, що практика використання DAG у прикладних дослідженнях буває неповною: граф, логіка включення змінних і вибраний набір контролю мають бути прозоро описані.
Окрема сторінка «Каузальні діаграми DAG» уже зарезервована як дочірній вузол цього causal-inference hub. Після її публікації тут буде додано поглиблене посилання; ця стаття зберігає DAG на рівні загальної логіки причинного висновку.
Природні й квазіекспериментальні дизайни
Іноді втручання дослідник не призначає, але політика, правило, поріг, календарна подія, інституційна зміна або інший зовнішній процес створює варіацію, близьку до експериментальної. Такі ситуації можуть дати сильний причинний контраст, якщо механізм розподілу достатньо зрозумілий.
Регресійний розрив спирається на припущення про порівнюваність одиниць поблизу порога; різниця-різниць — на припущення про відповідну контрфактичну тенденцію; інструментальні змінні — на низку сильних умов щодо зв’язку інструмента з впливом і результатом; природний експеримент — на механізм зовнішньої варіації. Назва методу не гарантує виконання цих припущень.
Ці спеціальні дизайни не треба перетворювати на каталог технік усередині однієї статті: кожен має власний estimand і власні умови ідентифікації. У A01 «Природний експеримент» і пов’язані методи займають окремі вузли, тоді як ця сторінка задає спільну логіку.
Емуляція цільового випробування: спочатку опишіть експеримент, який хотіли б провести
Один із найвпливовіших сучасних способів дисциплінувати спостережний причинний аналіз — сформулювати цільове випробування: гіпотетичний рандомізований експеримент, який відповів би на питання, якби його можна було провести. Потім дослідник намагається відтворити ключові елементи його протоколу в спостережних даних.
Hernán і Robins (2016) пропонують явно визначати критерії включення, порівнювані стратегії, момент призначення, початок спостереження, результат, період спостереження, причинний контраст і план аналізу. Така структура допомагає уникати помилок часу та нечітких порівнянь.
Емуляція цільового випробування не перетворює спостережні дані на рандомізовані. Конфаундинг і вимірювальні обмеження залишаються. Її перевага — у точнішій постановці питання й узгодженні дизайну. У 2025 році консенсусний TARGET Statement запропонував спеціальні рекомендації для прозорого звітування спостережних досліджень, що явно емулюють цільове випробування.
Статистична модель не створює причинності
Регресія, matching, propensity score, inverse-probability weighting, структурне моделювання, машинне навчання або байєсівська модель можуть бути частиною причинного аналізу. Їхня причинна інтерпретація походить не з назви алгоритму, а з дизайну, estimand і припущень. Та сама регресійна формула може використовуватися для опису асоціації, прогнозу або причинної оцінки.
Особливо важливо не плутати статистичну значущість із причинністю. Малий p-value не є ймовірністю того, що причинна гіпотеза істинна, не показує розмір ефекту й не усуває конфаундинг. Wasserstein, Schirm і Lazar (2019) закликають відходити від автоматичного поділу результатів на «значущі» та «незначущі» за порогом p < .05. У ХАБі окремо розведені сторінки «Статистична значущість» та «Розмір ефекту».
Довірчий інтервал також не виправляє причинний дизайн. Він характеризує статистичну невизначеність оцінки за припущеннями конкретної процедури. Якщо оцінка зміщена через конфаундинг або відбір, вузький інтервал може лише дуже точно описувати зміщений параметр.
Медіація і механізм: «через що діє» складніше, ніж «чи є ефект»
Після питання «чи має X ефект на Y?» часто постає питання «через який механізм?». Медіаційний аналіз розкладає причинні шляхи за додаткових припущень. Просте додавання медіатора до регресії й спостереження, що коефіцієнт X зменшився, не є універсальним доказом механізму.
Причинна медіація потребує чіткого визначення прямого й непрямого ефектів, часової послідовності та контролю відповідних конфаундерів. Для звітування таких аналізів існує спеціальний стандарт AGReMA. У межах цього hub важливий принцип: механістичний висновок є окремим каузальним завданням і часто вимагає сильніших припущень, ніж оцінка загального ефекту.
Гетерогенність: середній ефект може не описувати окрему людину
Середній причинний ефект не означає, що кожна людина реагує однаково. Психологічні втручання можуть мати різну величину ефекту залежно від віку, вихідного стану, контексту, супутніх факторів або способу реалізації. Середній ефект у вибірці є властивістю визначеної популяції та контрасту, а не універсальною константою.
Пошук модераторів теж потребує дисципліни. Післяфактум знайдена підгрупа з великим ефектом може бути випадковою. Попередня специфікація, достатня інформація в підгрупах, корекція множинності й реплікація допомагають відрізняти стійку гетерогенність від шуму.
Внутрішня валідність і переносимість — різні завдання
Причинний ефект може бути добре ідентифікований у конкретному дослідженні, але погано переноситися на іншу популяцію. Вік, культурне середовище, базовий ризик, доступність допомоги, мотивація, спосіб рекрутингу та умови проведення можуть змінювати ефект. Це питання зовнішньої валідності, transportability або generalizability.
Механічний рейтинг «RCT завжди вище за все» тому недостатній. Дизайн треба оцінювати щодо конкретного причинного питання, ризику упередження, прямоти даних і переносимості. Цю ширшу логіку розкрито в статті «Ієрархія доказів у психології».
Перевірка стійкості причинного висновку
Сильний причинний аналіз не завершується однією основною моделлю. Дослідник перевіряє, наскільки висновок залежить від правдоподібних альтернатив: іншого набору припущень, іншого операційного визначення, пропущених даних, вибору часових вікон, невиміряного конфаундингу, форми моделі або впливових спостережень.
Аналіз чутливості до невиміряного конфаундингу може показати, наскільки сильним мав би бути пропущений фактор, щоб пояснити спостережуваний ефект. Наприклад, VanderWeele і Ding (2017) запропонували E-value для певних класів ефектів як один зі способів кількісно описувати таку стійкість. E-value не доводить відсутності конфаундингу і не замінює предметного аналізу можливих пропущених причин.
До інших стратегій належать негативні контрольні експозиції або результати, placebo-тести, аналіз різних специфікацій, перевірка балансу й перекриття, альтернативні допустимі adjustment sets, реплікація на незалежних даних та зіставлення різних дизайнів. Якщо методи з різними структурами упередження сходяться до подібного висновку, причинний аргумент стає сильнішим; якщо розходяться — саме розбіжність підказує, які припущення треба перевірити.
Ризик упередження треба оцінювати для конкретного результату
Ярлик дизайну не замінює критичної оцінки. Для нерандомізованого дослідження втручання Cochrane ROBINS-I розглядає упередження через конфаундинг, відбір учасників, класифікацію втручань, відхилення від запланованих втручань, пропущені дані, вимірювання результатів і вибір повідомленого результату. Cochrane Handbook прямо рекомендує починати з опису гіпотетичного target trial.
Для читача корисна окрема сторінка «Ризик упередження в дослідженнях», де розведено систематичну похибку, статистичну випадковість і стандарти оцінювання.
Прозоре звітування підтримує причинну оцінку, але не замінює її
Звіт має дозволяти читачеві реконструювати причинне питання, дизайн, вибір змінних і аналітичні рішення. APA Journal Article Reporting Standards задають стандарти для кількісних, якісних і змішаних досліджень у психології, включно з модулями для експериментів, поздовжніх і спостережних досліджень. STROBE описує, що слід прозоро повідомляти в основних типах спостережних досліджень.
Reporting guideline не є інструментом, який сам по собі доводить якість або причинність. STROBE прямо зазначає, що його checklist призначений для повноти звітування, а не для оцінки якості дослідження. CONSORT, JARS і TARGET так само підвищують прозорість, але не перетворюють слабкий дизайн на сильний.
Якісні дослідження і причинне пояснення
Контрфактична оцінка причинного ефекту — переважно кількісне завдання. Якісні дослідження можуть давати інший тип причинно релевантного знання: уточнювати механізми, послідовності подій, значення контексту, межі інтервенції, альтернативні пояснення й те, як учасники переживають зміни. Якість такого дослідження оцінюють за стандартами відповідної якісної методології, а не автоматично за критеріями рандомізованого експерименту.
Тому evidence triangulation може включати різні методи, але їхні висновки не взаємозамінні. Інтерв’ю може переконливо описати механізм або досвід, але саме по собі не оцінює середній причинний ефект у популяції; RCT може оцінити ефект призначення, але не обов’язково пояснить, як люди переживали втручання або чому воно спрацювало в конкретному контексті.
Як узгоджувати силу формулювання з дизайном
Наукова мова має відображати те, що дизайн реально підтримує. Для описових або поперечних даних коректні формули «пов’язане з», «асоційоване з», «спостерігалася різниця». Для причинно орієнтованого спостережного аналізу доречно: «оцінений причинний ефект за припущень…», «результати сумісні з причинним ефектом за умови відсутності невиміряного конфаундингу…». Для добре проведеного рандомізованого експерименту можна говорити про ефект призначення або втручання, уточнюючи популяцію, протокол і невизначеність.
Фрази «доведено, що X спричиняє Y» у поведінкових науках часто надто грубі. Сильніший текст не той, що використовує категоричніший дієслово, а той, що точно називає estimand, дизайн, припущення й межі переносимості.
Практичний алгоритм оцінювання причинного висновку
1. Яке точне причинне питання? Визначені популяція, вплив, альтернатива, результат і час?
2. Який причинний ефект оцінюють: середній, у певній підгрупі, прямий, непрямий, ефект призначення чи інший контраст?
3. Чи передує передбачувана причина результату, і чи правильно вирівняно початок спостереження?
4. Як створено порівнювані групи: рандомізацією, природною варіацією, квазіекспериментом, matching/weighting чи моделлю?
5. Які конфаундери, джерела селекції та можливі колайдери передбачені причинною моделлю?
6. Чи є достатнє перекриття умов у релевантних підгрупах, тобто позитивність?
7. Наскільки добре визначені й виміряні вплив, результат і ключові коваріати?
8. Чи відповідає статистичний аналіз визначеному estimand, а не просто наявному програмному методу?
9. Які аналізи чутливості, негативні контроли або альтернативні специфікації проведено?
10. Чи збігається сила каузальної мови з дизайном, припущеннями, невизначеністю та ризиком упередження?
11. Чи відтворюється висновок у дослідженнях з іншими дизайнами й іншими структурами можливого bias?
12. На яку популяцію, ситуацію і часовий горизонт справді можна переносити оцінений ефект?
Типові помилки інтерпретації
• «X статистично значуще передбачає Y, отже X спричиняє Y». Статистична значущість не ідентифікує причинний ефект.
• «Ми контролювали всі доступні змінні, тому конфаундингу немає». Контроль має визначатися причинною роллю змінних; надмірний контроль може створити нове зміщення.
• «Дані поздовжні, тому причинність встановлена». Часовий порядок важливий, але залишаються конфаундинг, селекція й вимірювання.
• «Метод називається causal, тому результат причинний». Будь-який метод потребує специфічних припущень.
• «RCT автоматично доводить універсальний причинний ефект». Рандомізація підтримує внутрішній контраст, але не гарантує якість реалізації, вимірювання або переносимість.
• «Незначущий результат доводить відсутність ефекту». Він може відображати широкий діапазон сумісних ефектів, недостатню інформацію або інші проблеми.
• «Медіатор у регресії пояснює механізм». Причинна медіація має власні припущення й estimands.
• «Сильна кореляція — майже причинність». Сила асоціації не усуває альтернативні причинні структури.
Часті запитання
Чи означає рандомізований експеримент, що причинність доведена?
Добре проведена рандомізація дає сильну основу для причинної оцінки визначеного контрасту. Висновок усе одно залежить від реалізації втручання, втрат учасників, вимірювання, аналізу, звітування та того, на яку популяцію переноситься результат.
Чи можна робити причинні висновки зі спостережних даних?
Так, якщо причинне питання, estimand, дизайн і припущення сформульовані явно, а ключові джерела bias належно адресовані. Такий висновок зазвичай сильніше залежить від неперевірюваних припущень, особливо щодо невиміряного конфаундингу.
Чи достатньо контролювати вік, стать та інші коваріати в регресії?
Ні. Потрібно контролювати змінні з правильною причинною роллю. Додавання медіатора або колайдера може погіршити оцінку. Вибір коваріатів має спиратися на причинну модель, а не лише на автоматичний відбір за p-значеннями.
Чи p < .05 підтверджує причинний ефект?
Ні. P-значення не оцінює ймовірність причинної гіпотези й не усуває систематичні зміщення. Причинна інтерпретація визначається дизайном та припущеннями.
Чим причинний ефект відрізняється від розміру ефекту?
Розмір ефекту описує величину певної статистичної відмінності або зв’язку. Він стає оцінкою причинного ефекту лише тоді, коли дизайн і припущення дозволяють причинну інтерпретацію цього параметра.
Чи DAG доводить причинну структуру?
Ні. DAG формалізує припущення про причинну структуру. Він допомагає побачити наслідки цих припущень для контролю змінних і ідентифікації, але самі стрілки потребують теоретичного й емпіричного обґрунтування.
Чи пререєстрація робить дослідження причинним?
Ні. Пререєстрація підвищує прозорість щодо плану й розмежування підтверджувальних та дослідницьких аналізів, але не замінює причинний дизайн і не усуває конфаундинг.
Що найважливіше перевірити в новині «вчені довели, що X спричиняє Y»?
Відкрити оригінальне дослідження й перевірити дизайн: чи було випадкове призначення або інший причинно орієнтований механізм порівняння; який часовий порядок; які альтернативні пояснення враховано; що саме вимірювали; як автори самі формулюють висновок. Загальний цикл читання дослідження описаний на сторінці «Психологічне дослідження».
Підсумок
Причинність у психологічних дослідженнях обґрунтовують через узгоджений ланцюг: точне причинне питання → визначений контрфактичний контраст → дизайн → явні припущення → вимірювання → статистичний аналіз, що відповідає estimand → аналіз упереджень і чутливості → обережне перенесення висновку. Кожна ланка потрібна, бо причинний ефект є властивістю не самого числа, а того, як число пов’язане з альтернативними можливими результатами.
Найсильніша практична звичка — щоразу питати: «Яке порівняння мало б показати, що саме X змінило Y, і що робить це порівняння правдоподібним?» Це питання одразу переводить дискусію від кореляційної інтуїції до причинного дизайну.
Пов’язані статті
Квазіексперимент у психології: що це, дизайни та межі причинного висновку — як оцінювати причинні ефекти без повної рандомізації та перевіряти альтернативні пояснення.
