Байєсівська статистика в психології: апріорні розподіли, правдоподібність і постеріорні висновки
Байєсівська статистика — це підхід до статистичного висновку, у якому невизначеність щодо параметрів, гіпотез і прогнозів описують за допомогою ймовірнісних розподілів, а нові дані оновлюють попередню інформацію. У найпростішій формі логіка така: дослідник задає апріорний розподіл, описує модель даних через функцію правдоподібності, а після спостереження даних отримує постеріорний розподіл. Саме постеріорний розподіл показує, які значення параметра стали більш або менш правдоподібними після врахування даних.
Для психології цей підхід важливий тому, що дозволяє відповідати на запитання, які дослідники часто інтуїтивно ставлять статистиці: яка ймовірність, що ефект додатний; наскільки великим він, імовірно, є; які значення параметра сумісні з даними й моделлю; наскільки дані підтримують одну модель порівняно з іншою. Водночас байєсівська статистика не скасовує вимог до дизайну дослідження, якості вимірювання, репрезентативності, контролю змішування причин і наслідків чи прозорості аналізу. Вона змінює спосіб формалізації невизначеності та статистичного висновку, а не перетворює слабкий дизайн на сильний.
Сучасні методологічні огляди для психології описують байєсівське оцінювання та байєсівське тестування гіпотез як повноцінну альтернативну рамку статистичного висновку, а не як допоміжну поправку до p-значення. Детальний вступ для психологів подано у Wagenmakers та співавт. і в оглядах Kruschke та Liddell.
Що таке байєсівський статистичний висновок
Нехай θ — параметр, який нас цікавить, а y — спостережені дані. Теорема Байєса для статистичної моделі записується так:
p(θ | y) = p(y | θ) · p(θ) / p(y).
У цій формулі p(θ) — апріорний розподіл параметра; p(y | θ) — функція правдоподібності, тобто модель того, наскільки сумісні спостережені дані з різними значеннями параметра; p(θ | y) — постеріорний розподіл після врахування даних; p(y) — маргінальна правдоподібність даних, яка нормує результат так, щоб постеріорний розподіл був коректним розподілом імовірності.
У практичному аналізі часто достатньо пам’ятати пропорційність:
постеріорний розподіл ∝ правдоподібність × апріорний розподіл.
Ця формула є механізмом оновлення. Апріорний розподіл фіксує інформацію та невизначеність до використання поточних даних. Правдоподібність показує, які значення параметра краще узгоджуються зі спостереженнями за заданої моделі даних. Постеріорний розподіл поєднує обидва джерела інформації.
Байєсівський висновок тому є не однією статистичною процедурою, а загальною логікою побудови моделей. Усередині неї можна оцінювати середні, різниці між групами, кореляції, коефіцієнти регресії, параметри ієрархічних моделей, латентні змінні, часові процеси та багато інших величин. Конкретні висновки залежать від конкретної моделі, її припущень і даних.
Апріорний розподіл: що відомо до поточних даних
Апріорний розподіл описує невизначеність щодо параметра до врахування даних, які аналізують у поточному дослідженні. Це не обов’язково «особиста віра» дослідника. Апріор може спиратися на попередні дослідження, метааналізи, теоретичні обмеження, фізично або психологічно можливий діапазон параметра, дані пілотних досліджень чи обережні регуляризувальні припущення.
Наприклад, якщо параметр δ означає стандартизовану різницю між двома умовами, апріорний розподіл може концентрувати більшу масу біля нуля й поступово надавати меншу ймовірність дуже великим ефектам. Такий вибір не стверджує, що ефект дорівнює нулю. Він формалізує те, що до нових даних малі та помірні ефекти вважаються правдоподібнішими за надзвичайно великі.
У сучасній практиці корисно розрізняти кілька типів апріорів.
• Інформативний апріор містить істотну попередню інформацію й помітно обмежує правдоподібні значення параметра.
• Слабко інформативний апріор задає реалістичний масштаб параметра, відсікає неправдоподібні крайнощі та водночас залишає даним значний простір для оновлення.
• Скептичний апріор концентрує більше маси поблизу нульового або малого ефекту й може бути доречним, коли великі ефекти до дослідження малоймовірні.
• Так званий стандартний або типовий апріор пропонується програмою чи методикою для певного класу моделей. Його не слід автоматично вважати нейтральним.
• Належний дуже широкий апріор може слабко впливати на оцінювання параметра за великої кількості інформації в даних, але «широкий» не означає «без припущень».
Важливий принцип полягає в тому, що апріор треба оцінювати разом із моделлю даних. Gelman, Simpson і Betancourt показують, що практичний зміст апріору часто можна зрозуміти лише в контексті правдоподібності та породжувальної моделі. Саме тому корисною є апріорна прогностична перевірка: ще до підгонки моделі дослідник генерує уявні дані з апріору й моделі та дивиться, чи породжує ця система реалістичні результати.
Апріорний розподіл не повинен бути прихованим
Вибір апріору є частиною моделі, тому його треба описувати й обґрунтовувати. Особливо важливо показати чутливість висновків до альтернативних розумних апріорів, коли вибір апріору істотно впливає на результат. Для байєсівських факторів така чутливість може бути особливо важливою, тому що маргінальна правдоподібність інтегрує передбачення моделі по всьому апріорному розподілу.
Рекомендації щодо звітування прямо вимагають прозоро описувати апріори, їхні параметри, обґрунтування та аналіз чутливості. Це підкреслюють Bayesian Analysis Reporting Guidelines.
Функція правдоподібності: що модель говорить про дані
Функція правдоподібності p(y | θ) описує, наскільки спостережені дані сумісні з різними значеннями параметра за заданої статистичної моделі. Вона будується з припущень про процес утворення даних.
Наприклад, якщо психолог вимірює час реакції, нормальний розподіл може бути поганим описом сильно асиметричних сирих значень, тоді як інша модель розподілу може краще відображати структуру даних. Якщо аналізують кількість подій, бінарні відповіді чи порядкові категорії, потрібні відповідні моделі. Байєсівська процедура не робить невідповідну функцію правдоподібності правильною.
Правдоподібність треба відрізняти від імовірності параметра. Вираз p(y | θ) читається як імовірність або щільність даних за фіксованого значення параметра. Це не p(θ | y). Теорема Байєса саме й перетворює інформацію у напрямку від p(y | θ) до постеріорного p(θ | y), поєднуючи правдоподібність з апріорним розподілом.
Постеріорний розподіл: оновлена невизначеність після даних
Постеріорний розподіл p(θ | y) є центральним результатом байєсівського оцінювання. Він описує невизначеність щодо параметра після того, як поточні дані поєднано з апріорним розподілом у межах заданої моделі.
Із постеріорного розподілу можна отримувати різні корисні підсумки:
• постеріорне середнє або медіану як точкову оцінку;
• кредибільний інтервал як діапазон значень, що містить задану частку постеріорної ймовірності;
• імовірність того, що параметр більший або менший за певне значення;
• імовірність того, що параметр перевищує наперед заданий поріг практичної важливості;
• постеріорні прогнози для нових спостережень;
• порівняння моделей або гіпотез за окремо визначених процедур.
Це робить байєсівський аналіз природним для запитань про величину й невизначеність ефекту. Однак постеріорна ймовірність завжди умовна: вона залежить від моделі, правдоподібності, апріору та спостережених даних. Формула «97% імовірності, що ефект додатний» означає 97% постеріорної ймовірності в межах конкретної моделі та конкретного апріору.
Умовний приклад байєсівського оновлення
Уявімо рандомізоване дослідження психологічної програми, у якому параметр δ означає стандартизовану середню різницю між умовами. Для ілюстрації візьмемо апріорний розподіл δ ~ Normal(0, 0.5²). Він концентрує більшу частину маси на малих і помірних ефектах, але допускає як додатні, так і від’ємні значення.
Припустімо, що дані дають оцінку δ = 0.35 зі стандартною похибкою 0.18 і для простоти правдоподібність щодо δ можна наближено описати нормальним розподілом. За такого поєднання нормального апріору й нормальної правдоподібності постеріорний розподіл також є нормальним. Його середнє становить приблизно 0.31, а постеріорне стандартне відхилення — приблизно 0.17.
Приблизний 95% центральний кредибільний інтервал у цьому суто навчальному прикладі становить від −0.02 до 0.64. Постеріорна ймовірність δ > 0 становить близько 96.6%, а ймовірність δ > 0.20 — близько 74.2%.
Ці числа дають кілька різних відповідей. Найправдоподібніша область міститься переважно на додатному боці, але залишається помітна невизначеність щодо величини ефекту. Імовірність просто додатного ефекту висока, а ймовірність ефекту, що перевищує умовний поріг 0.20, нижча. Одна й та сама постеріорна модель тому дозволяє окремо говорити про напрям, величину й практично визначений поріг.
Цей приклад не є результатом реального дослідження й не демонструє універсального «правильного» апріору. Його мета — показати механіку оновлення та різницю між точковою оцінкою, інтервалом і постеріорною ймовірністю.
Кредибільний інтервал і довірчий інтервал — різні поняття
У байєсівській статистиці 95% кредибільний інтервал задають так, щоб він містив 95% постеріорної ймовірності параметра за конкретної моделі, апріору та даних. Тому твердження «за цієї моделі й апріору постеріорна ймовірність, що θ лежить у цьому інтервалі, дорівнює 0.95» є змістовним байєсівським твердженням.
У частотній статистиці 95% довірчий інтервал має іншу логіку. Після того як конкретний інтервал уже обчислено, параметр у класичній постановці не є випадковою величиною з 95% імовірністю потрапити саме до цього інтервалу. 95% стосується довготривалої частоти покриття процедури за повторних вибірок і виконання її припущень. Докладно цю відмінність розбирає окрема стаття Українського психологічного ХАБу про довірчий інтервал.
Кредибільний інтервал також не є автоматично інтервалом практично важливих значень. Якщо 95% постеріорної маси лежить між 0.02 і 0.12, то інтервал може бути повністю додатним, але це ще не встановлює практичну чи клінічну значущість. Порогові значення важливості мають бути змістовно обґрунтовані окремо.
Байєсівський фактор: відносні докази для моделей
Байєсівський фактор (Bayes factor) використовується для порівняння того, наскільки добре дві моделі або гіпотези передбачають спостережені дані після усереднення за їхніми апріорними розподілами параметрів.
Для двох гіпотез H₁ і H₀:
BF₁₀ = p(y | H₁) / p(y | H₀).
Якщо BF₁₀ = 5, дані є у п’ять разів правдоподібнішими за передбаченнями H₁, ніж за передбаченнями H₀, у межах саме тих моделей та апріорів, які були задані. Якщо BF₁₀ = 0.2, то BF₀₁ = 5, тобто ті самі дані у п’ять разів краще підтримують H₀ відносно H₁.
Класичні роботи з байєсівських факторів у психологічних дослідженнях підкреслюють, що вони дозволяють кількісно порівнювати відносні докази на користь нульової та альтернативної моделей. Це обговорюють Rouder та співавт. і Morey, Romeijn та Rouder.
Байєсівський фактор не є постеріорною ймовірністю гіпотези
BF₁₀ = 10 не означає автоматично, що «ймовірність H₁ дорівнює 90.9%». Байєсівський фактор оновлює апріорні шанси між гіпотезами:
постеріорні шанси = байєсівський фактор × апріорні шанси.
Лише якщо дві гіпотези вичерпують розглянутий простір і мають однакові апріорні ймовірності, BF₁₀ = 10 перетворює апріорні шанси 1:1 на постеріорні 10:1, що відповідає постеріорній імовірності H₁ приблизно 10/11 ≈ 0.909. За інших апріорних шансів постеріорна ймовірність буде іншою.
Категорії «слабкі», «помірні» чи «сильні» докази є конвенціями
У літературі існують словесні шкали для інтерпретації величини байєсівського фактора. Їх зручно використовувати як орієнтир, але межі таких категорій є методологічними конвенціями, а не емпіричними законами природи. Корисніше показати саме значення BF, напрям порівняння, моделі, апріори й аналіз чутливості, ніж перетворювати умовні пороги на механічні рішення.
Байєсівський фактор і p-значення відповідають на різні запитання
p-значення у стандартному частотному тесті описує, наскільки екстремальними були б дані або статистика тесту за нульової моделі та визначеної процедури. Воно не є ймовірністю нульової гіпотези і не порівнює безпосередньо передбачення H₀ та H₁.
Байєсівський фактор натомість є відношенням маргінальних правдоподібностей двох моделей. Тому p = .03 і BF₁₀ = 5 не можна трактувати як два числа на одній шкалі. Вони виникають із різних логік статистичного висновку й залежать від різних компонентів моделі.
Так само статистична значущість не дорівнює байєсівському доказу, а жодне з цих понять не дорівнює величині або практичній важливості ефекту. Для величини слід окремо оцінювати параметр і розмір ефекту разом із його невизначеністю.
Байєсівське оцінювання і байєсівське тестування гіпотез
У байєсівському аналізі корисно розрізняти дві близькі, але окремі задачі.
Байєсівське оцінювання зосереджується на постеріорному розподілі параметра: які значення правдоподібні, наскільки велика невизначеність, яка ймовірність перевищення змістовного порога, що прогнозує модель для нових даних.
Байєсівське тестування або порівняння моделей зосереджується на відносних доказах для альтернативних моделей чи гіпотез. Байєсівський фактор є одним із підходів до такого порівняння.
Ці задачі не слід зводити одна до одної. Дослідник може мати дуже точну постеріорну оцінку малого ефекту, але питання «яка модель краще передбачила дані?» залишається окремим. І навпаки, модель може мати кращу відносну підтримку, але всередині неї окремі параметри все ще можуть бути оцінені з великою невизначеністю. Огляд Kruschke і Liddell саме розводить оцінювання, тестування гіпотез, метааналіз та планування досліджень у байєсівській рамці.
Що означає «ймовірність ефекту» в байєсівському аналізі
Для неперервного параметра можна безпосередньо обчислити, наприклад, P(θ > 0 | y), P(θ > δ* | y) або ймовірність, що θ лежить у певному інтервалі. Це одна з найзрозуміліших переваг постеріорного опису.
Проте слово «ефект» треба використовувати точно. Якщо θ — параметр асоціації в спостережуваному поперечному дослідженні, висока постеріорна ймовірність θ > 0 говорить про параметр асоціації в заданій моделі. Вона не перетворює асоціацію на причинний ефект. Причинний висновок потребує відповідного дизайну або окремо обґрунтованої причинної моделі, контролю альтернативних пояснень, часової впорядкованості та припущень щодо змішування, відбору й вимірювання.
Байєсівська арифметика може бути застосована і до причинних моделей, але сила причинного твердження визначається не словом «Bayesian», а структурою дослідження та припущеннями моделі.
Малі вибірки: байєсівський підхід не створює інформацію з нічого
Поширена помилка — вважати, що байєсівська статистика «вирішує проблему малої вибірки». Вона дозволяє коректно поєднувати дані з апріорною інформацією та повно описувати невизначеність, але невелика кількість даних залишається невеликою кількістю даних.
За слабко інформативного апріору мала вибірка зазвичай дає широкий постеріорний розподіл. За інформативного апріору постеріор може бути вужчим, але частина інформації тоді походить із апріору, а не з нової вибірки. Саме тому в малих вибірках особливо важливі обґрунтування апріору й аналіз чутливості.
Планування розміру вибірки також залишається необхідним. У байєсівському дослідженні n можна обирати з огляду на бажану точність постеріорної оцінки, імовірність досягнення певного рівня доказів, прогностичну якість або інші наперед сформульовані критерії. Це інше завдання, ніж класична статистична потужність, хоча обидва підходи стосуються інформаційної достатності дизайну.
Ієрархічні моделі й часткове об’єднання інформації
Психологічні дані часто мають багаторівневу структуру: повторні вимірювання вкладені в учасників, учасники — у групи, стимули — у набори, дослідження — у лабораторії. Байєсівські ієрархічні моделі природно описують таку структуру через рівні параметрів і спільні розподіли.
Ключова ідея часткового об’єднання полягає в тому, що оцінка для окремого учасника або групи може використовувати інформацію від ширшої сукупності, не примушуючи всі одиниці бути однаковими. Коли даних для окремої одиниці мало, її оцінка сильніше тяжіє до групового рівня; коли інформації багато, індивідуальні дані мають більшу вагу. Це може стабілізувати оцінки, але коректність висновку все одно залежить від того, наскільки добре ієрархічна структура відповідає реальному процесу даних.
Обчислення: чому потрібні чисельні методи
Для простих спряжених моделей постеріорний розподіл можна отримати аналітично. У реальних психологічних моделях це часто неможливо. Тоді використовують чисельні методи, зокрема марковські ланцюги Монте-Карло, варіаційні наближення та інші алгоритми.
Наявність великої кількості симульованих постеріорних вибірок ще не гарантує правильного результату. Потрібно перевіряти збіжність, ефективний розмір вибірки, проблеми геометрії моделі та інші діагностичні показники, залежно від алгоритму. Якщо ланцюги не дослідили цільовий постеріорний розподіл належним чином, підсумкові інтервали й імовірності можуть бути чисельно ненадійними.
Тому байєсівський аналіз має два рівні перевірки: статистичний — чи адекватна сама модель, і обчислювальний — чи алгоритм справді наблизив потрібний постеріорний розподіл.
Байєсівський робочий процес: від питання до перевірки моделі
Сильний байєсівський аналіз є процесом побудови й перевірки моделі, а не одноразовим натисканням кнопки. Огляд Bayesian Workflow описує цей процес як ітеративну роботу, що включає побудову, обчислення, перевірку, порівняння й розуміння моделей.
Практична послідовність може виглядати так.
1. Сформулювати наукове запитання й визначити параметри, які безпосередньо відповідають на нього.
2. Вибрати модель даних, що відповідає типу змінних, дизайну та структурі спостережень.
3. Задати апріорні розподіли в реальному масштабі параметрів і пояснити їхнє походження.
4. Провести апріорні прогностичні перевірки: чи породжує модель до спостереження даних правдоподібні значення.
5. Оцінити модель і перевірити чисельну збіжність та стабільність обчислень.
6. Дослідити постеріорний розподіл параметрів і постеріорні прогнози.
7. Провести постеріорні прогностичні перевірки: чи відтворює модель істотні риси фактичних даних.
8. Перевірити чутливість висновків до розумних альтернативних апріорів і, за потреби, специфікацій моделі.
9. Звітувати не лише підсумкові числа, а й модель, апріори, алгоритми, діагностику, перевірки та обмеження.
Цей робочий процес показує важливу річ: постеріорний розподіл може бути обчислений бездоганно для поганої моделі. Математична коректність умовного висновку не гарантує, що модель добре описує психологічний процес або структуру даних.
Апріорні й постеріорні прогностичні перевірки
Апріорна прогностична перевірка відповідає на запитання: які дані могла б породити наша модель ще до використання фактичної вибірки? Якщо модель регулярно генерує неможливі або абсурдні значення, це сигнал, що апріори, шкали або сама модель потребують перегляду.
Постеріорна прогностична перевірка ставить інше запитання: чи може модель, уже навчена на даних, відтворити ті характеристики спостережень, які важливі для наукового завдання? Дослідник може порівнювати розподіли, хвости, дисперсію, частки, кореляційні структури, патерни між групами або інші релевантні характеристики.
Жодна окрема прогностична перевірка не доводить істинність моделі. Її роль — виявляти невідповідності між моделлю та даними й робити припущення аналізу видимими.
Аналіз чутливості: чи змінюється висновок разом з апріором
Аналіз чутливості перевіряє, наскільки ключові висновки залежать від розумних альтернативних апріорів або модельних специфікацій. Він особливо важливий, коли даних небагато, апріор інформативний, модель складна або використовується байєсівський фактор.
Корисна практика — визначити кілька апріорів, кожен з яких можна змістовно захистити, і порівняти ключові постеріорні висновки. Якщо P(θ > 0 | y), кредибільний інтервал або BF різко змінюються за невеликої зміни апріору, це є частиною результату, яку треба повідомити читачеві.
BARG особливо наголошують на чутливості до апріорів і на тому, що байєсівські фактори можуть бути суттєво чутливими до апріорних розподілів усередині порівнюваних моделей.
Послідовне оновлення даних
Теорема Байєса природно підтримує послідовне оновлення: постеріорний розподіл після першої порції даних може стати апріорним розподілом для наступної порції, якщо моделі та умови такого оновлення узгоджені.
Це не означає, що будь-яке довільне зупинення збору даних або багаторазове переозначення моделі автоматично стає доброю практикою. Для досліджень із правилами прийняття рішень треба заздалегідь визначати критерії, а для байєсівських факторів — перевіряти, як властивості процедури залежать від апріорів, дизайну й правила зупинки. Перевага полягає в тому, що накопичені докази можна описувати у послідовній ймовірнісній системі; якість дослідницького процесу все одно потребує прозорого протоколу.
Що байєсівський аналіз не виправляє
Байєсівська статистика не є захистом від загальних методологічних помилок.
Вона не виправляє систематичну похибку відбору, якщо вибірка не представляє популяцію, про яку роблять висновок.
Вона не усуває змішування причин, коли спостережувана асоціація може пояснюватися третьою змінною.
Вона не відновлює часовий порядок у поперечному дизайні.
Вона не робить неточний психологічний інструмент точним і не замінює психометричну перевірку вимірювання.
Вона не гарантує причинності лише тому, що постеріорна ймовірність параметра висока.
Вона не усуває аналітичну гнучкість: дослідник усе ще може вибирати моделі, апріори, змінні, виключення або способи звітування після перегляду результатів.
Вона не робить одиничний результат автоматично реплікованим. Стійкість наукового твердження перевіряється новими даними, незалежними дослідженнями й реплікаціями.
Тому байєсівський аналіз найсильніший тоді, коли він поєднується з якісним дизайном, прозорою моделлю, перевіркою припущень, відкритими матеріалами й відтворюваним кодом.
Як звітувати байєсівський аналіз у психологічній статті
APA Journal Article Reporting Standards для кількісних досліджень містять окремий модуль для байєсівського аналізу. Appelbaum та співавт. підкреслюють необхідність достатнього опису специфічних аналітичних рішень, щоб читач міг оцінити метод і відтворити аналіз. Актуальні матеріали APA Style JARS розглядають прозорість звітування як основу для оцінювання строгості та відтворюваності психологічних досліджень.
Для байєсівської роботи слід, залежно від моделі, повідомляти:
• наукове запитання, параметри та їхній зміст;
• повну ймовірнісну модель і функцію правдоподібності;
• усі суттєві апріорні розподіли, їхні параметри та обґрунтування;
• спосіб вибору стандартних або інформативних апріорів;
• програмне забезпечення, пакети та версії;
• алгоритм оцінювання та його налаштування, якщо вони впливають на відтворюваність;
• діагностику збіжності та обчислювальної надійності;
• постеріорні підсумки, кредибільні інтервали й конкретні постеріорні ймовірності, що відповідають дослідницькому запитанню;
• метод обчислення байєсівського фактора та апріори моделей, якщо використовується BF;
• апріорні або постеріорні прогностичні перевірки, коли вони доречні;
• аналіз чутливості;
• критерії зупинки або послідовного аналізу, якщо вони були частиною дизайну;
• доступність даних, коду й матеріалів у межах етичних та правових обмежень.
Звіт «BF₁₀ = 8.4» без опису моделей та апріорів є неповним, так само як «95% кредибільний інтервал» без пояснення параметра, моделі та способу побудови інтервалу.
Типові помилки інтерпретації
«Апріор — це довільна суб’єктивна думка»
Апріор є формальною частиною моделі. Він може бути інформативним, слабко інформативним або стандартним і може спиратися на зовнішні дані, теорію чи обмеження шкали. Проблемою є не наявність апріору, а непрозорий, невиправданий або неперевірений вибір.
«Неінформативний апріор нічого не припускає»
Будь-який апріор задає розподіл і масштаби параметрів. Рівномірний розподіл на одній шкалі може перестати бути рівномірним після нелінійного перетворення, а дуже широкий апріор може мати сильні наслідки для маргінальної правдоподібності та байєсівських факторів. Термін «неінформативний» тому не слід читати буквально як «без припущень».
«95% кредибільний інтервал і 95% довірчий інтервал — те саме»
Вони можуть мати подібні числові межі в окремих задачах, але мають різну ймовірнісну інтерпретацію. Кредибільний інтервал є твердженням про постеріорний розподіл параметра; частотний довірчий інтервал — про процедуру побудови інтервалів у повторних вибірках.
«BF₁₀ = 10 означає, що H₁ істинна з імовірністю 90.9%»
Таке перетворення потребує додаткових умов про апріорні шанси та набір гіпотез. Байєсівський фактор сам по собі є відношенням маргінальних правдоподібностей.
«Великий байєсівський фактор доводить гіпотезу»
BF описує відносні докази між конкретними моделями. Обидві моделі можуть бути поганими, а значення BF залежить від їхніх припущень і апріорів. Байєсівський фактор не є логічним доказом істинності.
«Якщо 95% постеріорної маси вище нуля, ефект практично важливий»
Напрям параметра й практична важливість — різні питання. Для практичної інтерпретації потрібен змістовно визначений масштаб або поріг, а також контекст наслідків.
«Байєсівська модель автоматично встановлює причинність»
Статистична рамка не замінює дизайн. Постеріорна невизначеність щодо асоціації залишається невизначеністю щодо асоціації, якщо модель не ідентифікує причинний параметр за відповідних припущень.
«Байєсівський аналіз неможливо зламати аналітичною гнучкістю»
Можливо змінювати апріори, моделі, змінні й способи звітування після перегляду результатів. Прозорі аналітичні плани, пререєстрація там, де вона доречна, повне звітування й відтворюваний код залишаються важливими.
Коли байєсівський підхід особливо корисний
Байєсівський аналіз має особливу цінність, коли дослідницьке запитання природно формулюється через імовірність параметра або прогнозу; коли існує релевантна попередня інформація, яку потрібно формально інтегрувати; коли потрібні ієрархічні моделі; коли дослідник хоче оцінити ймовірність перевищення змістовного порога; коли потрібно порівнювати передбачення кількох моделей; коли дані надходять послідовно; або коли наукове рішення потребує повного розподілу невизначеності, а не лише точкової оцінки й порогового рішення.
Це не означає, що байєсівський підхід завжди кращий. Частотні й байєсівські методи мають різні інтерпретації та властивості. Метод слід обирати за дослідницьким запитанням, дизайном, доступною інформацією, вимогами до помилок рішень, прогностичною метою та прозорістю припущень.
Як читати байєсівський результат у психології
Коли в статті наведено байєсівський результат, корисно пройти коротку послідовність перевірок.
Спочатку визначте, що саме оцінюється: середня різниця, кореляція, коефіцієнт регресії, ймовірність події, латентний параметр чи порівняння моделей.
Потім знайдіть апріор. Який розподіл використано, який його масштаб і чому його обрали? Чи показано, що висновок стійкий до інших розумних апріорів?
Далі перевірте функцію правдоподібності та структуру моделі. Чи відповідають вони типу даних, повторним вимірюванням, вкладеності та іншим особливостям дизайну?
Після цього читайте постеріорний розподіл. Яка центральна оцінка, який кредибільний інтервал, яка ймовірність напрямку або перевищення змістовного порога?
Якщо наведено байєсівський фактор, запитайте, які саме моделі він порівнює, які апріори задано всередині кожної моделі та чи проведено аналіз чутливості.
Нарешті поверніться до дизайну. Навіть переконливий статистичний результат не виправляє упереджений відбір, погане вимірювання, невраховане змішування чи невідповідність популяції, на яку поширюють висновок.
Поширені запитання
Чим байєсівська статистика відрізняється від частотної?
У байєсівській рамці невизначені параметри описують розподілами ймовірності та оновлюють їх за даними. Частотна статистика визначає ймовірність через поведінку процедур у повторних вибірках і не приписує фіксованому параметру постеріорної ймовірності. Обидві рамки містять моделі та припущення, але відповідають на статистичні запитання різною мовою.
Що таке апріорний розподіл простими словами?
Це формалізований опис того, які значення параметра вважаються більш або менш правдоподібними до використання поточних даних. Його ширина показує ступінь невизначеності, а форма — те, як ця невизначеність розподілена.
Що таке постеріорний розподіл?
Це оновлений розподіл параметра після поєднання апріору з інформацією, яку дали спостережені дані через функцію правдоподібності. Саме з нього отримують постеріорні середні, медіани, кредибільні інтервали та ймовірності цікавих подій щодо параметра.
Що означає 95% кредибільний інтервал?
Для конкретного байєсівського аналізу це інтервал, якому призначено 95% постеріорної ймовірності параметра за заданих даних, апріору та моделі. Це інтерпретація в межах моделі, а не гарантія її істинності.
Що означає BF₁₀ = 6?
Це означає, що спостережені дані у шість разів правдоподібніші за маргінальними передбаченнями H₁, ніж за передбаченнями H₀, для конкретно заданих моделей і апріорів. Це не означає автоматично 6/7 імовірності істинності H₁.
Чи може байєсівський фактор підтримувати нульову гіпотезу?
Так. Якщо BF₀₁ суттєво перевищує 1, дані відносно краще передбачаються H₀, ніж H₁. Саме можливість кількісно виражати відносні докази в обох напрямках є важливою рисою байєсівського порівняння моделей. Водночас висновок залишається відносним до конкретних H₀, H₁ та їхніх апріорів.
Чи можна робити байєсівський аналіз без сильного апріорного знання?
Так. Можна використовувати слабко інформативні апріори, які задають реалістичний масштаб параметра без жорсткого концентрування на вузькій області. Але вибір такого апріору все одно треба пояснити, перевірити його прогностичні наслідки й, за потреби, провести аналіз чутливості.
Чи означає висока постеріорна ймовірність причинний ефект?
Лише тоді, коли параметр справді має причинну інтерпретацію і дизайн або причинна модель разом з припущеннями дозволяють ідентифікувати причинний ефект. Висока постеріорна ймовірність асоціації сама по собі причинності не встановлює.
Чи потрібні p-значення, якщо є байєсівський аналіз?
Байєсівський аналіз може бути повністю самодостатньою рамкою і не потребує p-значення для того, щоб постеріорні оцінки чи байєсівські фактори мали зміст. Якщо дослідник подає обидві рамки, треба чітко пояснити, яке запитання вирішує кожна з них, і не трактувати p-значення як постеріорну ймовірність.
Які програми використовують для байєсівської статистики?
Для психологічних досліджень використовують JASP, Stan і пакети на його основі, R-пакети brms та rstanarm, PyMC та інші системи. Вибір програми другорядний щодо якості моделі: дослідник має розуміти апріори, функцію правдоподібності, діагностику та інтерпретацію результату. Приклади застосування байєсівських тестів у JASP описані у Wagenmakers та співавт., Part II.
Головний принцип інтерпретації
Байєсівська статистика перетворює попередню інформацію й поточні дані на постеріорний опис невизначеності. Її головна сила полягає в явному формулюванні того, що саме припускає модель і як ці припущення оновлюються даними.
Сильний висновок тому має чотири рівні. Перший — дизайн дослідження визначає, які наукові твердження взагалі можна робити. Другий — модель і правдоподібність визначають, як дані пов’язані з параметрами. Третій — апріор визначає попередню структуру невизначеності. Четвертий — постеріор показує результат їхнього поєднання. Байєсівський фактор додає окремий рівень порівняння передбачень моделей.
Коли всі ці рівні описані прозоро, читач може бачити не лише підсумкове число, а весь шлях від припущень до висновку.
Пов’язані статті
Джерела
American Psychological Association. APA Style JARS: What are they? https://www.apa.org/pubs/journals/resources/publishing-tips/apa-style-jars
Appelbaum, M., Cooper, H., Kline, R. B., Mayo-Wilson, E., Nezu, A. M., & Rao, S. M. (2018). Journal article reporting standards for quantitative research in psychology: The APA Publications and Communications Board task force report. American Psychologist, 73(1), 3–25. https://doi.org/10.1037/amp0000191
Gelman, A., Simpson, D., & Betancourt, M. (2017). The prior can often only be understood in the context of the likelihood. Entropy, 19(10), 555. https://doi.org/10.3390/e19100555
Gelman, A., Vehtari, A., Simpson, D., Margossian, C. C., Carpenter, B., Yao, Y., Kennedy, L., Gabry, J., Bürkner, P.-C., & Modrák, M. (2020). Bayesian Workflow. arXiv. https://arxiv.org/abs/2011.01808
Kruschke, J. K., & Liddell, T. M. (2018). Bayesian data analysis for newcomers. Psychonomic Bulletin & Review, 25, 155–177. https://doi.org/10.3758/s13423-017-1272-1
Kruschke, J. K., & Liddell, T. M. (2018). The Bayesian New Statistics: Hypothesis testing, estimation, meta-analysis, and power analysis from a Bayesian perspective. Psychonomic Bulletin & Review, 25, 178–206. https://doi.org/10.3758/s13423-016-1221-4
Kruschke, J. K. (2021). Bayesian Analysis Reporting Guidelines. Nature Human Behaviour, 5, 1282–1291. https://doi.org/10.1038/s41562-021-01177-7
Morey, R. D., Romeijn, J.-W., & Rouder, J. N. (2016). The philosophy of Bayes factors and the quantification of statistical evidence. Journal of Mathematical Psychology, 72, 6–18. https://doi.org/10.1016/j.jmp.2015.11.001
Rouder, J. N., Speckman, P. L., Sun, D., Morey, R. D., & Iverson, G. (2009). Bayesian t tests for accepting and rejecting the null hypothesis. Psychonomic Bulletin & Review, 16(2), 225–237. https://doi.org/10.3758/PBR.16.2.225
Wagenmakers, E.-J., Marsman, M., Jamil, T., et al. (2018). Bayesian inference for psychology. Part I: Theoretical advantages and practical ramifications. Psychonomic Bulletin & Review, 25, 35–57. https://doi.org/10.3758/s13423-017-1343-3
Wagenmakers, E.-J., Love, J., Marsman, M., et al. (2018). Bayesian inference for psychology. Part II: Example applications with JASP. Psychonomic Bulletin & Review, 25, 58–76. https://doi.org/10.3758/s13423-017-1323-7
