Квазіексперимент у психології: що це, дизайни та межі причинного висновку
Український психологічний ХАБ · Опубліковано: 7 жовтня 2026 · Редакційна політика
Квазіексперимент у психології — це дослідницький дизайн, у якому причинний ефект намагаються оцінити без повного випадкового розподілу учасників між умовами. Його сила виникає не з самої відсутності рандомізації, а з того, що структура призначення, час втручання, поріг, природна зміна правил або спеціально побудована група порівняння створюють правдоподібний контрфактичний сценарій: що сталося б із тими самими або максимально порівнюваними людьми за іншої умови.
Сучасні методологічні огляди описують квазіексперимент як сімейство дизайнів, призначених для причинного висновку тоді, коли рандомізований експеримент неможливий, неетичний або організаційно недоступний. Kim і Steiner (2016) та Cham, Lee і Migunov (2024) відносять до ключових підходів дизайн регресійного розриву, перервані часові ряди, різницю різниць, інструментальні змінні та методи побудови порівнюваних груп. Кожен із них має власні припущення, тому слово «квазіексперимент» не є автоматичною гарантією причинності.
Коротка відповідь: що таке квазіексперимент
Квазіексперимент — це дизайн для оцінювання наслідків втручання, події, правила або експозиції без повної рандомізації. Дослідник використовує структуру даних і механізм призначення до умов так, щоб відокремити зміну, пов’язану з імовірною причиною, від фонових відмінностей між людьми, групами або часовими періодами.
Найважливіше слово тут — дизайн. Просте порівняння двох уже сформованих груп, навіть якщо одну назвали «експериментальною», ще не створює сильного квазіексперименту. Потрібно пояснити, чому саме це порівняння дозволяє наблизитися до контрфактичного результату, які альтернативні пояснення залишаються можливими і за яких припущень оцінка може тлумачитися причинно.
У цьому сенсі квазіексперимент належить до тієї самої логіки причинного висновку, що й експериментальний метод: дослідник визначає причинне питання, результат, втручання або експозицію, порівняння та часовий порядок. Відмінність полягає в механізмі призначення. У справжньому рандомізованому експерименті випадковий розподіл створює очікувану порівнюваність груп; у квазіексперименті цю порівнюваність треба обґрунтовувати іншими властивостями дизайну.
Чим квазіексперимент відрізняється від рандомізованого експерименту
У рандомізованому експерименті дослідник випадково призначає одиниці дослідження до умов. За достатньо коректної реалізації така процедура розриває систематичний зв’язок між попередніми характеристиками учасників і отриманим втручанням у середньому, що значно посилює внутрішню валідність.
У квазіексперименті повної рандомізації немає. До умов можуть потрапляти вже сформовані класи, школи, клініки, регіони або часові періоди; втручання може запроваджуватися з певної дати; право на програму може визначатися пороговим балом; політика може змінитися лише в одній адміністративній одиниці. Причинний висновок тоді залежить від того, наскільки механізм цього призначення та додаткові дизайнерські ознаки нейтралізують альтернативні пояснення.
Відсутність випадкового розподілу не робить причинний висновок неможливим. Вона змінює його логіку: ключові припущення треба назвати, захистити предметними аргументами, дослідити діагностично і, де можливо, перевірити аналізами чутливості. Саме тому сильний квазіексперимент може бути переконливішим за слабко проведений рандомізований експеримент, але його переконливість завжди пов’язана з конкретним дизайном, а не з етикеткою.
Квазіексперимент, спостережне дослідження і кореляція — різні поняття
Квазіексперимент не слід ототожнювати з будь-яким дослідженням без рандомізації. Кореляційне дослідження може описувати зв’язок між змінними без маніпуляції та без спеціального механізму, який створює правдоподібне причинне порівняння. Квазіексперимент, навпаки, організовано навколо причинного питання і використовує певну зовнішню або дизайнерську структуру для ідентифікації ефекту.
Так само кореляція не означає причинність. Статистична асоціація може виникнути через причинний ефект, зворотну причинність, спільну причину, селекцію, похибку вимірювання або поєднання цих механізмів. Квазіексперимент намагається звузити множину правдоподібних альтернативних пояснень, використовуючи часовий розрив, поріг, порівняльну траєкторію чи інший структурний елемент.
Rohrer (2018) показує на прикладі психологічних спостережних даних, чому вибір змінних для статистичного контролю має спиратися на причинну структуру, а не на правило «контролювати все». Grosz, Rohrer і Thoemmes (2020) окремо наголошують, що причинне питання в неекспериментальній психології треба формулювати явно, разом із припущеннями, необхідними для причинної інтерпретації.
Основна логіка: контрфактичне порівняння
Причинний ефект визначається через порівняння потенційних результатів: що сталося б з тією самою одиницею за втручання і що сталося б без нього. Одночасно спостерігати обидва результати для тієї самої людини в той самий момент неможливо, тому дизайн має створити прийнятну заміну відсутньому контрфактичному результату.
У рандомізованому експерименті цією заміною слугує група, сформована випадковим призначенням. У квазіексперименті контрфактичний результат реконструюють за іншою логікою: за попередньою часовою траєкторією, за подібною групою без втручання, за спостереженнями безпосередньо по обидва боки порога, за зовнішнім правилом призначення або за комбінацією цих джерел.
Сучасна теорія причинного висновку формулює загальні умови ідентифікації через обмінюваність, позитивність і узгодженість. Детальний виклад цієї рамки дають Hernán і Robins у відкритій книзі Causal Inference: What If. Для конкретного квазіекспериментального дизайну ці загальні вимоги набувають спеціальної форми: наприклад, припущення про паралельні тенденції для різниці різниць або неперервність потенційних результатів біля порога для регресійного розриву.
Коли дослідження справді має квазіекспериментальну логіку
Корисна практична перевірка починається з п’яти запитань. Перше: яке саме втручання або експозиція розглядається як можлива причина? Друге: який результат і в який момент часу є наслідком, що нас цікавить? Третє: що визначило отримання втручання? Четверте: звідки береться контрфактичне порівняння? П’яте: які умови мають бути істинними, щоб різницю між спостережуваними результатами можна було приписати втручанню.
Якщо дослідження не має ясної відповіді на третє і четверте питання, воно часто є просто спостережним порівнянням. Якщо відповідь існує, але механізм призначення прямо пов’язаний із прогнозом результату і це не усунуто дизайном, конфаундинг залишається центральною загрозою.
Основні квазіекспериментальні дизайни
Нееквівалентні групи з вимірюванням до і після
Один із найпоширеніших варіантів у психології та освіті — вже сформована група отримує втручання, інша подібна група його не отримує, а результат вимірюють до і після. Наприклад, одна школа впроваджує програму розвитку емоційної саморегуляції, а інша продовжує звичайну практику.
Сам факт наявності претесту й посттесту не усуває селекцію. Групи могли відрізнятися ще до початку втручання за мотивацією, складом учасників, ресурсами, якістю викладання або іншими факторами. Претест допомагає побачити частину вихідних відмінностей і траєкторію змін, але не гарантує еквівалентності. Найсильніша версія такого дизайну використовує кілька вимірювань у часі, ретельно підібрану групу порівняння і заздалегідь визначену модель ефекту.
Перерваний часовий ряд
У дизайні перерваного часового ряду багаторазово вимірюють результат до й після чітко визначеного моменту втручання. Дослідника цікавить, чи змінилися рівень показника, його тренд або обидва параметри саме після втручання.
Bernal, Cummins і Gasparrini (2017) описують сегментовану регресію для таких даних і наголошують на особливостях часових рядів: автокореляції, сезонності, змінному в часі конфаундингу та потребі заздалегідь формулювати очікувану форму впливу. Одна точка «до» і одна «після» не є повноцінним перерваним часовим рядом.
Головна загроза — інші події, що сталися приблизно в той самий момент. Якщо разом із психологічною програмою змінилися навчальний режим, кадровий склад або система оцінювання, стрибок результату не можна автоматично приписати саме програмі. Контрольний часовий ряд у подібній популяції значно посилює дизайн.
Контрольований перерваний часовий ряд
Контрольований перерваний часовий ряд додає до траєкторії групи з втручанням ще одну траєкторію, яка не зазнала втручання. Якщо обидві групи до події змінювалися подібно, а після події розходяться у спосіб, передбачений причинною гіпотезою, альтернативне пояснення спільним історичним шоком стає менш правдоподібним.
Kim і Steiner (2016) відносять порівняльні перервані часові ряди до найсильніших квазіекспериментальних стратегій, коли рандомізація недоступна. Проте сила такого дизайну залежить від якості контрольного ряду, стабільності вимірювання та відсутності різних одночасних змін у групах.
Дизайн регресійного розриву
Дизайн регресійного розриву виникає, коли отримання втручання визначається порогом за кількісною змінною. Уявімо програму психологічної підтримки, доступну учням із балом ризику 20 і вище. Тоді учні з балами 19,9 і 20,1 можуть бути дуже схожими, але опиняються по різні боки правила призначення.
Класична логіка регресійного розриву описана в методологічному керівництві Imbens і Lemieux (2008). Причинна інтерпретація біля порога спирається, зокрема, на припущення про плавність потенційних результатів у районі порога та відсутність точного маніпулювання змінною призначення. Ефект, як правило, є локальним: він стосується одиниць поблизу порогового значення, а не автоматично всієї популяції.
Дизайн слабшає, якщо учасники або адміністратори можуть точно підлаштувати показник так, щоб потрапити до потрібної умови, якщо поріг змінюється заднім числом або якщо разом із перетином порога різко змінюються інші програми.
Різниця різниць
Дизайн різниці різниць порівнює зміну результату з часом у групі, яка зазнала втручання, зі зміною в групі, яка його не зазнала. Ідея проста: від загальної зміни в групі втручання віднімають фонову зміну, яку спостерігали в групі порівняння.
Wing, Simon і Bello-Gomez (2018) підкреслюють, що причинна інтерпретація різниці різниць потребує правдоподібного контрфактичного тренду. Центральне припущення полягає в тому, що без втручання групи мали б змінюватися паралельно. Схожі тренди до втручання можуть підтримати це припущення, але не доводять його для майбутнього.
Дизайн потрібно перевіряти на диференційні шоки, зміну складу груп, очікування майбутнього втручання, різні календарні події та інші процеси, які могли змінити лише одну групу. За кількох моментів запровадження втручання потрібні сучасні варіанти оцінювання, оскільки прості двофакторні моделі можуть давати складні для тлумачення суміші ефектів.
Природний експеримент
Природним експериментом часто називають ситуацію, у якій дослідник не створив втручання і не призначав учасників, але зовнішня подія або правило породили контраст експозиції, схожий на експериментальний. Це може бути зміна політики, адміністративного правила, межі доступу або іншої системи, що впливає на частину популяції.
Craig та співавтори (2017) наголошують, що вирішальним є розуміння процесу, який визначає експозицію, а також систематичне розглядання альтернативних пояснень. «Природність» події не робить розподіл випадковим. Селективна експозиція може залишатися серйозним джерелом зміщення.
У межах графа A01 природний експеримент має окремий канонічний власник, тому ця стаття пояснює лише його місце серед квазіекспериментальних підходів. Після публікації окремої української сторінки тут буде доречний прямий перехід до неї.
Інструментальні змінні
Метод інструментальних змінних використовує зовнішню змінну, що впливає на отримання втручання, але за визначених припущень не впливає на результат іншими шляхами. Така структура іноді виникає в природних або адміністративних процесах і може використовуватися для квазіекспериментального причинного оцінювання.
Критичними є сила зв’язку інструмента з експозицією, незалежність інструмента від причин результату та обмеження прямого шляху від інструмента до результату поза досліджуваним втручанням. Ці припущення часто частково або повністю не перевіряються лише статистично, тому предметне обґрунтування є обов’язковим.
Зіставлення і propensity score: методи, а не чарівна заміна рандомізації
Зіставлення учасників і методи propensity score можуть зробити групи схожішими за виміряними до втручання характеристиками. Їх часто використовують у квазіекспериментальній роботі, але самі по собі вони не усувають невиміряний конфаундинг і не створюють причинного дизайну з будь-якого набору даних.
Kim і Steiner (2016) розглядають matching і propensity score у ширшому наборі квазіекспериментальних стратегій, але причинна інтерпретація все одно залежить від припущень про відсутність релевантного невиміряного конфаундингу, достатнє перекриття груп та коректне визначення змінних. Контроль після факту не замінює продуманого дизайну.
Рандомізація учасників і випадкова вибірка — не те саме
У методології психології часто плутають дві різні процедури. Рандомізація учасників між умовами відповідає на питання внутрішньої причинної порівнюваності: хто отримає яке втручання. Випадкове формування вибірки відповідає на питання репрезентативності: як одиниці потрапили з популяції до дослідження.
Можна мати рандомізований експеримент із невипадковою зручною вибіркою. Такий дизайн може добре оцінювати причинний ефект усередині дослідженої групи, але мати обмежену переносимість на ширшу популяцію. І навпаки, випадкова репрезентативна вибірка без рандомізації втручання не створює автоматичної причинної ідентифікації.
Чому конфаундинг є центральною проблемою
Конфаундинг виникає, коли третя змінна або набір змінних впливає і на отримання експозиції, і на результат, створюючи або спотворюючи спостережувану асоціацію. У квазіексперименті без повної рандомізації потрібно пояснити, чому такий спільний вплив або не здатен породити спостережуваний ефект, або достатньо обмежений дизайном і аналізом.
Керівництво Cochrane щодо оцінювання ризику упередження в нерандомізованих дослідженнях рекомендує заздалегідь визначати важливі домени конфаундингу та співвтручання і розглядати дослідження відносно цільового рандомізованого випробування. Sterne та співавтори (2016) формалізували цю логіку в ROBINS-I для оцінювання ризику упередження в нерандомізованих дослідженнях втручань.
ROBINS-I не є універсальною шкалою «якості квазіексперименту» і не замінює аналіз припущень конкретного дизайну. Це інструмент ризику упередження для результатів нерандомізованих досліджень втручань. Для регресійного розриву, різниці різниць або перерваного часового ряду додатково потрібні спеціальні діагностики, властиві саме цим дизайнам.
Основні загрози причинному висновку
Селекція
Якщо учасники самі обирають програму або потрапляють до неї за рішенням фахівця, їхня початкова ймовірність отримати втручання може бути пов’язана з майбутнім результатом. Наприклад, більш мотивовані учасники частіше записуються на тренінг і водночас частіше покращують результат незалежно від тренінгу.
Історичні події
Зміна результату після втручання може бути наслідком іншої події, яка збіглася з ним у часі: зміни навчальної політики, соціальної кризи, кадрового рішення, інформаційної кампанії або нового способу вимірювання. Чим коротший і точніший часовий збіг, тим важливішим стає пошук альтернативних подій.
Дозрівання і природна динаміка
У дитячій, клінічній та освітній психології результати можуть змінюватися з часом без втручання через розвиток, адаптацію, спонтанне відновлення або повторне тестування. Контрольна траєкторія і кілька вимірювань допомагають відокремити таку фонову динаміку.
Регресія до середнього
Якщо програму призначають людям із дуже високим або дуже низьким початковим показником, наступне вимірювання часто буде ближчим до середнього навіть без причинного ефекту. Це особливо важливо для програм, де включення відбувається через екстремальний бал. Пороговий дизайн може використати цю ситуацію конструктивно лише за спеціальної логіки регресійного розриву; просте «стало краще після відбору найгірших» причинного висновку не дає.
Зміна вимірювання
Якщо до й після втручання змінюються тест, інструкція, спосіб адміністрування, оцінювачі або контекст вимірювання, частина ефекту може бути артефактом інструменту. Це питання дизайну дослідження. Психометрична надійність і валідність самого тесту належать окремому кластеру A02 і не повинні підміняти поняття внутрішньої валідності квазіексперименту.
Вибуття і зміна складу груп
Якщо після початку втручання з груп вибувають різні типи учасників, склад порівнюваних груп змінюється. Навіть однаковий відсоток вибуття не гарантує відсутності упередження: важливо, хто саме вибув і чи пов’язане вибуття з потенційними результатами.
Перенесення впливу між групами
У психологічних та освітніх втручаннях учасники різних умов можуть спілкуватися, передавати матеріали або змінювати поведінку один одного. Таке «перетікання» порушує просту модель незалежних умов і може зменшити або спотворити оцінюваний контраст.
Очікування втручання
Якщо учасники або організації знають, що політика скоро зміниться, вони можуть адаптувати поведінку ще до формальної дати початку. Для різниці різниць і часових дизайнів це означає, що момент причинного впливу не збігається з адміністративною датою.
Темпоральний порядок: причина має передувати результату
Для причинного висновку експозиція повинна передувати тому результату, який інтерпретується як її наслідок. Поперечне порівняння, де причина й результат виміряні одночасно, зазвичай не визначає напрямок впливу. Квазіекспериментальні дизайни використовують часову структуру саме для того, щоб зробити порядок подій явним.
Проте «після» не означає «через». Часовий порядок є необхідною частиною причинної аргументації, але сам по собі не усуває історичні події, тренди, селекцію та інші альтернативні пояснення.
Припущення треба писати для конкретного дизайну
Фраза «ми контролювали конфаундери» є надто загальною. Сильна квазіекспериментальна робота формулює припущення так, щоб читач міг зрозуміти, що саме має бути правдою. Для різниці різниць — чому без втручання тренди були б паралельними. Для регресійного розриву — чому поблизу порога інші детермінанти результату змінюються плавно і поріг не маніпулюється. Для перерваного часового ряду — чому саме в момент втручання не відбулося іншої релевантної зміни.
Частину припущень можна досліджувати емпірично: порівнювати претренди, перевіряти баланс ковариат біля порога, шукати стрибки в щільності змінної призначення, тестувати фальшиві дати втручання, будувати негативні контрольні результати. Інші припущення принципово залежать від предметного знання і не можуть бути «підтверджені» одним статистичним тестом.
Статистичний аналіз має відповідати дизайну
Статистична модель не рятує поганий дизайн. Спочатку визначають причинне питання, одиницю призначення, порівняння, часову структуру й припущення; потім обирають аналіз, який оцінює потрібний ефект за цієї структури.
Для перерваних часових рядів потрібно враховувати автокореляцію, сезонність і форму тренду. Для групових втручань — залежність спостережень усередині класів, клінік або шкіл. Для різниці різниць — структуру панельних або повторних даних і коректні стандартні похибки. Для регресійного розриву — вибір околу порога, форму локальної моделі й діагностику маніпуляції. Для зіставлення — якість перекриття та баланс виміряних характеристик після процедури.
P-значення не показує, чи виконані причинні припущення. Статистично значущий коефіцієнт може бути зміщеним через конфаундинг, селекцію або неправильну часову модель. Так само велике p-значення не доводить відсутності ефекту. Причинна і статистична невизначеність — різні виміри однієї оцінки.
Розмір ефекту і довірчий інтервал
Квазіекспериментальна стаття має повідомляти величину оціненого ефекту, а не лише факт статистичної значущості. Розмір ефекту відповідає на питання «наскільки змінився результат», тоді як p-значення описує сумісність даних із певною статистичною моделлю та нульовою гіпотезою. Одне не замінює інше.
Довірчий інтервал показує статистичну невизначеність оцінки в межах обраної моделі та процедури. У частотній інтерпретації 95% означає довгострокову властивість процедури побудови інтервалів: за повторення процедури приблизно 95% таких інтервалів охоплювали б істинний параметр за виконання умов методу. Це не означає, що після обчислення конкретного інтервалу істинний параметр має 95% частотну ймовірність лежати саме в ньому.
Навіть вузький довірчий інтервал не охоплює невизначеність через неправдиве причинне припущення. Якщо порушено паралельні тенденції або існує невиміряний конфаундинг, математично точна оцінка може бути точною оцінкою не того причинного ефекту, який дослідник хоче знати.
Аналіз чутливості і перевірки правдоподібності
Сильна квазіекспериментальна аргументація показує, наскільки висновок залежить від аналітичних рішень і припущень. Доцільні перевірки залежать від дизайну: альтернативні часові вікна, різні специфікації тренду, placebo-cutoff у регресійному розриві, фальшиві дати втручання, негативні контрольні результати, альтернативні групи порівняння, оцінки чутливості до невиміряного конфаундингу.
Робастність не означає механічне запускання десятків моделей до появи бажаного результату. Набір перевірок має випливати з причинної структури, а основний аналіз бажано визначити заздалегідь. Якщо різні розумні специфікації дають різні висновки, це є результатом про нестійкість оцінки, а не перешкодою, яку треба приховати.
Приклад: психологічна програма в школі
Уявімо, що міська система освіти з вересня запроваджує програму профілактики тривожності в частині шкіл, вибраних через адміністративний критерій, а в інших школах програму заплановано на наступний рік. Дослідники мають щомісячні показники тривожності за два роки до та рік після впровадження.
Просте порівняння середнього балу «до вересня» і «після вересня» в школах програми буде слабким: рівень тривожності може мати сезонність, а восени могли змінитися інші умови. Наявність шкіл порівняння дозволяє оцінити, чи відбулося специфічне відхилення траєкторії саме в школах програми.
Якщо школи обирали через пороговий індекс ризику, може виникнути можливість регресійного розриву біля порога. Якщо критерій був політичним і водночас пов’язаний із ресурсами школи, це створює додатковий конфаундинг. Якщо школи знали про майбутню програму й почали змінювати практику заздалегідь, формальна дата вересня вже не є чистою точкою початку впливу.
У такому прикладі причинний висновок народжується не з назви «квазіексперимент», а з послідовної аргументації: механізм призначення → контрфактичне порівняння → припущення → дизайн → аналіз → перевірки чутливості → обмежена формула висновку.
Що означає «межі причинного висновку»
Причинний висновок у квазіексперименті формулюється умовно: дані підтримують оцінку причинного ефекту за виконання визначених припущень. Це не ритуальна обережність, а зміст методу. Докладніше загальну логіку розглядає стаття «Причинність у психологічних дослідженнях».
Межа може стосуватися популяції: ефект оцінено для конкретних шкіл, клінік або людей біля порога. Вона може стосуватися часу: політика працювала в перший рік, але довгостроковий ефект невідомий. Вона може стосуватися варіанту втручання: причинний ефект належить саме тій реалізації програми, яка реально відбулася.
Сильне формулювання не розширює висновок далі, ніж дозволяє дизайн. Якщо ідентифікується локальний ефект біля порога, його не оголошують універсальним ефектом для всіх. Якщо ефект визначено для учасників, які змінили експозицію через інструмент, його не прирівнюють автоматично до середнього ефекту для всієї популяції.
Чи можна писати «спричинило» в квазіексперименті
Так, причинна мова може бути методологічно виправданою, коли дизайн справді спрямований на причинну ідентифікацію, припущення сформульовано і захищено, а основні альтернативні пояснення адресовано. Заборона будь-якої причинної мови для всіх нерандомізованих даних така сама неточна, як і автоматична причинна інтерпретація будь-якого квазіексперименту.
Grosz, Rohrer і Thoemmes (2020) аргументують, що психологія виграє від явного формулювання причинних питань і припущень, а не від приховування причинної мети за невиразною мовою «зв’язків». Водночас Rohrer (2018) показує, що статистичний контроль може як зменшити, так і збільшити зміщення залежно від причинної ролі змінної.
Як читати квазіекспериментальне дослідження
Почніть не з таблиці p-значень, а з механізму призначення. Хто і чому отримав втручання? Чи могла ця причина призначення сама впливати на результат? Чи відомо, що відбувалося до втручання? Чи є порівняльна група або траєкторія? Чи були інші події в той самий час?
Далі визначте оцінюваний ефект. Для кого він оцінюється, на якому часовому горизонті, для якого варіанта втручання і відносно якої альтернативи? Якщо стаття не дає зрозумілої відповіді, навіть технічно складний аналіз важко інтерпретувати.
Після цього перевірте спеціальні припущення дизайну та діагностики. Для різниці різниць — передвтручальні тренди й можливі диференційні шоки. Для регресійного розриву — маніпуляцію порогом, баланс поблизу порога, чутливість до ширини вікна. Для часового ряду — достатню кількість точок, сезонність, автокореляцію, інші одночасні події.
Нарешті оцініть, чи збігається мова висновків із тим, що реально ідентифікує дизайн. Методологічно сильна стаття прямо описує залишкові загрози, не видає відсутність статистичної значущості за доказ нульового ефекту і не переносить локальний результат на ширшу популяцію без окремого обґрунтування.
Оцінювання ризику упередження
Для нерандомізованих досліджень втручань Cochrane рекомендує доменний підхід ROBINS-I, який охоплює конфаундинг, селекцію учасників, класифікацію втручань, відхилення від запланованих втручань, пропущені дані, вимірювання результатів і вибір повідомленого результату. Cochrane Handbook, глава 25 підкреслює, що оцінювати потрібно конкретний результат, а не присвоювати дослідженню один абстрактний бал «якості».
У психології це важливо через різноманіття результатів і процедур. Те саме дослідження може мати різний ризик упередження для самооцінки симптомів і для незалежної поведінкової оцінки, або для короткострокового і довгострокового результату.
Звітність, прозорість і пререєстрація
APA Journal Article Reporting Standards для кількісних досліджень вимагають достатньої прозорості щодо дизайну, вибірки, процедур і аналізу, щоб читач міг зрозуміти логіку дослідження та оцінити його відтворюваність. Для нерандомізованих поведінкових і громадсько-здоровчих інтервенцій історично важливим спеціальним стандартом звітності є TREND Statement.
Стандарт звітності не є методом причинної ідентифікації. Добре заповнений чекліст не усуває конфаундинг і не робить дизайн сильнішим. Його функція — зробити структуру дослідження, рішення та обмеження достатньо видимими для перевірки.
Пререєстрація може зафіксувати основне причинне питання, критерії включення, первинні результати, дизайн, ключові припущення та основний аналіз до перегляду результатів. Це зменшує свободу постфактум підлаштовувати аналітичні рішення під бажаний висновок, але не замінює хорошого квазіекспериментального дизайну.
Що не слід називати сильним квазіекспериментом
Одна група, один вимір до і один після без зовнішнього порівняння дають дуже слабку основу для причинного висновку. Такий план іноді історично класифікують як квазіекспериментальний або преекспериментальний, але він надзвичайно вразливий до історії, дозрівання, регресії до середнього та повторного тестування.
Дві нерандомізовані групи, які істотно відрізняються на старті, не стають еквівалентними лише тому, що дослідник додав регресійний коефіцієнт або кілька ковариат. Матчинг не виправляє невиміряні причини селекції. Велика вибірка не усуває систематичне зміщення. Дуже мале p-значення не перетворює асоціацію на причинний ефект.
Слово «квазіексперимент» має описувати структуру причинного порівняння, а не бути престижнішою назвою для будь-якого аналізу нерандомізованих даних.
Квазіексперимент і природний експеримент
Ці терміни частково перекриваються, а їхня таксономія відрізняється між дисциплінами. Квазіексперимент — широка категорія дизайнів без повної рандомізації, які спеціально організують причинне порівняння. Природний експеримент підкреслює, що ключове розходження в експозиції створене зовнішнім процесом, а не самим дослідником.
Огляд Craig та співавторів (2017) показує, що природні експерименти можуть давати переконливі оцінки, якщо процес формування експозиції добре зрозумілий, альтернативні пояснення опрацьовані, а дизайн доповнений відповідними перевірками. Тому «природний» означає походження варіації, а не автоматичну випадковість.
Квазіексперимент і якісне дослідження
Квазіексперимент належить до дизайнів кількісного причинного оцінювання. Якісні методи можуть бути надзвичайно важливими поруч із ним: вони допомагають зрозуміти процес впровадження, механізми, контекст, небажані наслідки та причини порушення припущень. Якість якісного компонента потрібно оцінювати за критеріями відповідної якісної методології, а не за критеріями рандомізованого або квазіекспериментального дизайну.
У змішаному дослідженні кількісний квазіекспериментальний компонент може оцінювати ефект, а якісний компонент — пояснювати, як і чому реалізація відрізнялася між контекстами. Ці компоненти відповідають на різні питання і не повинні підміняти один одного.
Квазіексперимент у доказовій психології
У реальному світі важливі психологічні втручання часто запроваджуються на рівні шкіл, організацій, лікарень, громад або державної політики, де індивідуальна рандомізація неможлива. Квазіекспериментальні дизайни дозволяють використовувати такі зміни як джерело причинної інформації.
Їхня роль полягає не в тому, щоб бути «другосортним експериментом», а в тому, щоб максимально використати доступну структуру призначення. У деяких питаннях саме поріг, політична зміна або часовий розрив створюють найкраще доступне порівняння. В інших питаннях та сама структура буде недостатньою. Якість визначається конкретною ідентифікаційною логікою.
У сфері освіти What Works Clearinghouse має окремі стандарти для рандомізованих контрольованих випробувань, квазіекспериментальних дизайнів та регресійного розриву. Це ілюструє важливий принцип: різні дизайни потребують різних критеріїв перевірки, а не одного універсального чекліста.
Практичний алгоритм побудови квазіексперименту
1. Сформулюйте причинне питання до вибору статистичної моделі. Визначте втручання, альтернативу, результат, популяцію та часовий горизонт.
2. Опишіть механізм призначення. Потрібно знати, чому одні одиниці отримали втручання, а інші ні. Саме тут часто прихована головна загроза конфаундингу.
3. Оберіть контрфактичну стратегію. Це може бути група порівняння, попередня траєкторія, поріг, зовнішнє правило або інша структура.
4. Запишіть спеціальні припущення дизайну до перегляду результатів. Вони мають бути конкретними й прив’язаними до предметної ситуації.
5. Визначте вимірювання до втручання, якщо це можливо. Попередні дані допомагають вивчати тренди, баланс і динаміку, але не замінюють причинної логіки.
6. Плануйте основний аналіз і діагностики разом. Метод оцінювання, стандартні похибки, кластеризація, часові залежності та перевірки припущень мають відповідати дизайну.
7. Передбачте аналізи чутливості, які адресують конкретні альтернативні пояснення, а не просто створюють багато варіантів моделі.
8. Відокремлюйте підтверджувальний аналіз від дослідницького. Якщо після перегляду даних виникли нові гіпотези, їх можна повідомити як нові, не маскуючи під первинний план.
9. Формулюйте причинний висновок на рівні, який ідентифікує дизайн. Не поширюйте локальний ефект на іншу популяцію без окремого аргументу.
10. Забезпечте прозору звітність: джерела даних, критерії включення, усі релевантні часові точки, обґрунтування групи порівняння, специфікації, пропущені дані, зміни плану та матеріали для відтворення аналізу.
Поширені помилки інтерпретації
«Рандомізації немає, отже причинний висновок неможливий». Це занадто сильне твердження. Квазіекспериментальні дизайни створено саме для причинних питань без повної рандомізації, але їхня валідність залежить від конкретних припущень.
«Є контрольна група, отже дизайн причинний». Наявність контрольної групи сама по собі нічого не гарантує. Потрібно знати, чому вона є придатним контрфактичним порівнянням.
«Групи не відрізнялися статистично на старті, отже вони еквівалентні». Відсутність значущої різниці не доводить рівність, особливо за невеликої вибірки. Потрібно оцінювати змістовний баланс, механізм призначення і можливі невиміряні відмінності.
«Ми включили всі ковариати в регресію, отже конфаундингу немає». Деякі важливі конфаундери можуть не вимірюватися, а контроль медіаторів або колайдерів може створити нове зміщення.
«Результат значущий, отже ефект реальний і важливий». Статистична значущість не дорівнює причинній, практичній або клінічній значущості.
«Дизайн названо квазіекспериментальним, отже це сильний доказ». Назва має бути підтверджена механізмом призначення, контрфактичним порівнянням, спеціальними припущеннями і діагностикою.
Запитання і відповіді
Чи є квазіексперимент просто експериментом без рандомізації?
У найширшому навчальному визначенні — так, але цього недостатньо для оцінки якості. Сильний квазіексперимент використовує конкретну структуру призначення або часову структуру, яка робить причинне порівняння правдоподібним. Просте нерандомізоване порівняння двох груп може бути значно слабшим.
Чи може квазіексперимент довести причинність?
Він може підтримати причинний висновок, коли дизайн і припущення достатньо сильні. Слово «довести» невдале для емпіричної науки: висновок завжди залежить від дизайну, вимірювання, припущень і можливих джерел упередження. Рандомізовані експерименти також мають власні загрози реалізації та переносимості.
Чим квазіексперимент відрізняється від природного експерименту?
Квазіексперимент — ширше поняття. Природний експеримент підкреслює, що варіація експозиції виникла через зовнішній процес, а не через призначення дослідником. Багато природних експериментів аналізують квазіекспериментальними методами.
Чи є різниця різниць квазіекспериментом?
Так, це один із найпоширеніших квазіекспериментальних дизайнів. Причинна інтерпретація потребує правдоподібного контрфактичного тренду та відсутності диференційних змін, які збігаються з втручанням.
Чи є регресійний розрив квазіекспериментом?
Так. Він використовує правило призначення за порогом і порівнює одиниці поблизу цього порога. За виконання ключових припущень дизайн може давати сильну локальну причинну оцінку.
Чи робить propensity score дослідження квазіекспериментальним?
Ні автоматично. Propensity score — аналітичний інструмент для балансу за виміряними характеристиками. Причинна сила залежить від того, які змінні виміряні, чи є достатнє перекриття, як побудовано порівняння і чи правдоподібне припущення про відсутність важливого невиміряного конфаундингу.
Чи достатньо одного претесту і одного посттесту?
Для сильного причинного висновку зазвичай ні. Такий план особливо вразливий до історії, природної динаміки та регресії до середнього. Група порівняння і кілька часових точок значно посилюють можливість відрізнити ефект від фонових змін.
Які дані найцінніші до втручання?
Повторні вимірювання результату, ключові предиктори призначення, базові характеристики, інформація про механізм формування груп і дані про інші події або співвтручання. Для часових дизайнів особливо важлива достатня довжина попереднього ряду.
Чи можна використовувати квазіексперимент у клінічній психології?
Так, для оцінювання сервісних змін, політик, програм або реальних практик, коли рандомізація недоступна. Клінічна оцінка, скринінг, діагностика і диференційна діагностика мають окремі методологічні завдання й належать кластеру E02; квазіексперимент тут відповідає саме на питання ефекту втручання або експозиції.
Чи можна поєднувати кілька квазіекспериментальних стратегій?
Так. Наприклад, контрольований перерваний часовий ряд може поєднувати часовий розрив із групою порівняння; різницю різниць можна доповнювати подієвими оцінками та перевірками передтрендів. Поєднання посилює висновок тоді, коли додаткові елементи адресують різні загрози, а не просто додають статистичну складність.
Головний висновок
Квазіексперимент у психології — це причинний дизайн без повної рандомізації, сила якого визначається механізмом призначення, якістю контрфактичного порівняння і правдоподібністю спеціальних припущень. Його завдання полягає в тому, щоб використати реальну структуру подій — поріг, часову зміну, зовнішнє правило, порівняльну траєкторію — для оцінювання того, що змінилося саме через втручання.
Найкраще читати квазіексперимент не за ярликом і не за p-значенням. Починайте з причинного питання, простежуйте механізм призначення, шукайте контрфактичне порівняння, виписуйте припущення, перевіряйте альтернативні пояснення і лише після цього оцінюйте статистичну модель. Саме така послідовність перетворює нерандомізовані дані на аргумент про причинний ефект із чітко визначеними межами.
Пов’язані статті
Експериментальний метод у психології: як працює експеримент, змінні та валідність — базова логіка експериментального контролю, маніпуляції та причинного порівняння.
Причинність у психологічних дослідженнях: як обґрунтовують причинний ефект — контрфактична логіка, конфаундинг, причинні припущення та межі каузального висновку.
Кореляція і причинність: чому зв’язок між змінними не доводить, що одна спричиняє іншу — як відрізняти асоціацію від причинного ефекту.
Кореляційне дослідження в психології: що показує зв’язок між змінними і чого він не доводить — дизайн дослідження зв’язків без маніпуляції та його причинні обмеження.
Методи дослідження в психології: експеримент, спостереження, опитування, якісні та змішані методи — місце квазіексперименту в ширшій системі дослідницьких методів.
