top of page

Психологічна енкциклопедія

p-hacking: як гнучкість аналізу може створювати хибно переконливі статистичні результати

23 вер.
Читати 17 хв

Автор: Український психологічний ХАБ · Опубліковано: 23 вересня 2026 року · Редакційна політика.


p-hacking — це використання гнучкості у зборі, обробці, аналізі або звітуванні про дані так, що серед багатьох можливих аналітичних шляхів перевагу отримує той, який дає бажаний статистично «значущий» результат. Проблема виникає тоді, коли остаточний p-value подається так, ніби він був результатом одного наперед визначеного тесту, хоча насправді до нього вела серія рішень, залежних від уже побачених даних. Класична робота Simmons, Nelson & Simonsohn (2011) показала, що нерозкрита гнучкість у зборі й аналізі даних може різко підвищувати частоту хибнопозитивних висновків.


У сучасній українській професійній і популярно-науковій мові трапляються форми «p-hacking», «p-хакінг» і «пі-гакінґ». У цій статті використовується міжнародне написання p-hacking, бо саме воно найточніше прив’язує поняття до статистичної літератури й пошукової поведінки. Сам термін описує не один конкретний прийом, а сімейство практик: від необґрунтованого продовження набору учасників після перегляду p-value до вибору лише «успішного» outcome, підгрупи, способу очищення даних, коваріати чи моделі.


Що таке p-hacking


У вузькому статистичному сенсі p-hacking — це набір дій, які роблять отримання p < α, найчастіше p < .05, імовірнішим, ніж передбачає номінальна процедура перевірки гіпотези. У ширшому методологічному сенсі йдеться про залежність аналітичних рішень від результату: дослідник бачить дані, пробує кілька правдоподібних варіантів і зупиняється на тому, який виглядає переконливішим. Огляд Wicherts et al. (2016) описує десятки «ступенів свободи дослідника» на етапах формулювання гіпотез, дизайну, збору даних, аналізу та звітування.


Це визначення важливе з двох причин. По-перше, p-hacking не обмежується грубим «підкручуванням» числа p. Він може виникати через цілком звичні рішення: який із кількох показників вважати основним, кого виключити як outlier, чи включати коваріату, де зупинити набір, який варіант трансформації застосувати. По-друге, сам факт наявності аналітичної гнучкості ще не доводить p-hacking. Гнучкість стає проблемою для підтверджувального висновку тоді, коли вона прихована, залежить від даних і не врахована в статистичному висновку.


Сучасне моделювання показує, що різні стратегії p-hacking мають неоднакову силу. Stefan & Schönbrodt (2023) систематизували дванадцять стратегій і продемонстрували симуляційно, що їхній вплив на частоту хибнопозитивних результатів залежить від конкретної стратегії, правил зупинки, вибору аналізу та інших умов. Тому фраза «у дослідженні був p-hacking» без опису того, що саме робили з даними, є занадто грубою для серйозної оцінки доказів.


Чому p-value особливо вразливий до прихованої гнучкості


p-value не є ймовірністю того, що нульова гіпотеза істинна, і не показує ймовірність того, що результат «випадковий». Він характеризує сумісність спостережуваних даних із конкретною статистичною моделлю та нульовою гіпотезою за заданими умовами. Це один із центральних принципів заяви American Statistical Association про p-values. Коли умови аналізу фактично змінюються після перегляду даних, номінальне p=.05 вже не має тієї самої інтерпретації, яку мало б за одним наперед визначеним тестом.


Простий приклад показує механізм. Якщо виконати 20 незалежних тестів для істинних нульових гіпотез на рівні α=.05 і потім вибрати будь-який «значущий» результат, імовірність отримати принаймні один p<.05 дорівнює 1−0.95^20, тобто приблизно 64%. Це ідеалізований приклад незалежних тестів, а реальні аналітичні варіанти часто корельовані, тому число 64% не можна переносити на будь-яке дослідження. Але логіка залишається: що більше прихованих шансів «виграти», то менш інформативним є один вибраний виграш.


Саме тому множинні порівняння і p-hacking пов’язані, але не тотожні. Множинність — формальна статистична проблема, яка виникає, коли одночасно перевіряють багато гіпотез або endpoints. p-hacking — поведінкова й аналітична проблема селекції шляхів за результатом. Дослідник може коректно провести багато тестів, прозоро їх описати й застосувати належну корекцію без p-hacking. І навпаки, p-hacking може відбуватися навіть у тексті, де зовні показано лише один тест.


Ступені свободи дослідника: де саме виникає гнучкість


У реальному психологічному дослідженні статистичний аналіз майже ніколи не є одним натисканням кнопки. До фінальної моделі ведуть десятки рішень. Частина з них неминуча й методологічно виправдана. Ризик p-hacking виникає, коли рішення приймаються після перегляду результату і коли читач не бачить повного простору альтернатив. Wicherts et al. (2016) пропонують розглядати такі рішення як researcher degrees of freedom — ступені свободи дослідника.


Зупинка або продовження збору даних


Один із класичних сценаріїв — optional stopping: зібрати певну кількість учасників, перевірити p-value, а якщо результат не досяг .05, набрати ще людей і перевірити знову. Звичайний тест, розрахований так, ніби розмір вибірки був фіксований наперед, не враховує багаторазове підглядання в дані. У симуляціях Simmons, Nelson & Simonsohn (2011) така нерозкрита гнучкість була одним із механізмів зростання хибнопозитивних результатів.


Саме по собі послідовне накопичення даних не є помилкою: існують валідні sequential designs із заздалегідь визначеними правилами й відповідним контролем помилки. Методологічна проблема — імпровізоване повторне тестування до бажаного p-value з подальшим звітом так, ніби аналіз був одноразовим.


Вибір залежної змінної або способу її обчислення


Психологічне дослідження може мати кілька outcomes: загальний бал, субшкали, поведінкові показники, реакційний час, самооцінку, вторинні endpoints. Якщо після перегляду результатів автор показує лише той outcome, де p<.05, статистична історія читача стає набагато простішою за реальну історію аналізу. Аналогічна проблема виникає, коли один і той самий конструкт можна скорувати кількома способами, а вибір роблять за найкращим результатом.


Це не означає, що в дослідженні має бути лише один outcome. Багатовимірні дані нормальні для психології. Ключове питання — чи було зрозуміло, які outcomes первинні, які вторинні, які аналізи підтверджувальні, а які дослідницькі, і чи бачить читач невибіркову картину результатів.


Виключення учасників, outliers і правила очищення


Рішення про те, кого виключити, можуть суттєво змінити результат: мінімальний час виконання, пропущені відповіді, перевірки уваги, крайні значення, технічні збої, невиконання інструкції. Якщо критерії змінюються після того, як дослідник побачив, який варіант дає p<.05, аналіз стає результат-залежним. У переліку Wicherts et al. (2016) окремо фігурують ad hoc рішення щодо outliers, missing data, preprocessing та критеріїв включення.


Наявність outlier сама по собі не дає універсальної відповіді «видалити» або «залишити». Сильніший підхід — задати правило заздалегідь або показати sensitivity analysis: чи зберігається висновок за кількох обґрунтованих способів обробки даних. Така перевірка перетворює приховану гнучкість на видиму невизначеність.


Коваріати, моделі та специфікації


У регресійних і квазіекспериментальних аналізах результат може залежати від набору коваріат, функціональної форми, взаємодій, трансформацій, способу кодування категорій, робастних стандартних помилок та інших специфікацій. Якщо дослідник пробує багато моделей і показує лише ту, де ключовий коефіцієнт став «значущим», фінальний p-value не відображає весь процес вибору.


Особливо важливо не плутати статистичний підбір моделі з причинним обґрунтуванням. Додавання чи вилучення змінної може змінювати оцінку не лише через «кращу підгонку», а й через структуру причинних зв’язків. Окрема стаття ХАБу про кореляцію і причинність пояснює, чому асоціація, регресійний коефіцієнт і статистична значущість самі по собі не встановлюють причинного ефекту.


Підгрупи й альтернативні розбиття вибірки


Ще один шлях — перевірити ефект у чоловіків і жінок, молодших і старших, різних діагностичних групах, країнах, квартилях шкали, а потім висунути на перший план лише підгрупу зі значущим результатом. Якщо такі subgroup analyses не були наперед обґрунтовані й їх виконано багато, один p<.05 легко може бути випадковим. Особливо небезпечно робити висновок «ефект є в групі A, але немає в B» лише тому, що в A p<.05, а в B p>.05: для твердження про відмінність потрібен прямий тест взаємодії або іншої відповідної різниці.


Однобічний чи двобічний тест, трансформації та пороги


Вибір між one-sided і two-sided тестом, логарифмічною чи сирою шкалою, різними порогами очищення, способами стандартизації та іншими варіантами також може створити простір для селекції. Такі рішення не є «поганими» за визначенням. Вони стають джерелом p-hacking, коли вибір роблять тому, що один варіант дає бажаний результат, а альтернативи приховують.


Селективне звітування


p-hacking завершується не в статистичній програмі, а в рукописі. Можна провести двадцять аналізів і прозоро показати двадцять — тоді читач бачить multiplicity. Можна провести двадцять, але показати один «успішний» — і тоді створюється ілюзія одного чистого підтверджувального тесту. Саме селекція і нерозкритість перетворюють багато гнучких рішень на особливо небезпечний механізм переконання.


p-hacking і дослідницький аналіз — не одне й те саме


Exploratory data analysis потрібний науці. Нові закономірності часто помічають саме після перегляду даних. Проблема виникає не тоді, коли дослідник досліджує, а тоді, коли результат дослідження заднім числом оформлюється як строгий наперед запланований тест. Nosek et al. (2018) підкреслюють різницю між prediction і postdiction: дані можуть генерувати гіпотезу, але перевірка цієї гіпотези на тих самих даних не має тієї ж доказової сили, що незалежне передбачення.


Правильне маркування «цей аналіз був exploratory» не робить результат марним. Воно змінює тип твердження. Дослідницький результат може бути сильним генератором наступної гіпотези, підставою для реплікації, нової моделі або плану preregistration. Найгірша ситуація — коли читачеві не дають змоги відрізнити відкриття після даних від передбачення до даних.


Чи завжди p-hacking є навмисним порушенням


Ні. Канонічна робота Simmons, Nelson & Simonsohn (2011) прямо наголошувала, що такі практики можуть виникати без шахрайського наміру — через неоднозначність методологічних рішень, бажання отримати ясний результат і звичні когнітивні упередження. Дослідник може щиро вважати кожне окреме рішення розумним, не усвідомлюючи, що сукупність результат-залежних рішень радикально змінює статистичну процедуру.


Опитування John, Loewenstein & Prelec (2012) показало, що психологи визнавали різні questionable research practices з дуже різною частотою та оцінювали їхню прийнятність по-різному. Це джерело важливе для історії метанауки, але його цифри не слід перетворювати на універсальну «поширеність p-hacking у психології»: формулювання практик, вибірка, самооцінка й епоха дослідження обмежують таке узагальнення.


Методологічно корисно розділяти три рівні. Перший — невдале або недостатньо продумане рішення. Другий — questionable research practice, яка підвищує ризик упередженого висновку. Третій — навмисна фальсифікація, фабрикація чи інше misconduct. p-hacking часто обговорюють у другому рівні; конкретний випадок може мати інший етичний статус, але цей статус потребує доказів наміру й контексту, а не одного підозрілого p-value.


p-hacking, HARKing, множинні порівняння і publication bias


p-hacking і HARKing


HARKing — hypothesizing after the results are known — означає формулювання гіпотези після того, як результат уже відомий, із поданням її як передбаченої заздалегідь. p-hacking змінює шлях до статистичного результату; HARKing змінює історію про те, звідки взялася гіпотеза. Вони можуть співіснувати, але одне не доводить іншого. Якщо дослідник чесно пише, що гіпотеза виникла після аналізу, це вже не прихований HARKing.


p-hacking і множинні порівняння


Множинне тестування може бути повністю запланованим і прозорим. p-hacking часто використовує приховану множинність, але не зводиться до неї. Наприклад, вибір одного з кількох правил для outliers — це аналітична гнучкість, навіть якщо формально в статті показаний один тест. Детальний розбір статистичного контролю FWER, FDR, Bonferroni та Holm є в матеріалі «Множинні порівняння».


p-hacking і publication bias


Publication bias діє переважно між дослідженнями: позитивні, нові або статистично значущі результати можуть мати вищий шанс бути написаними, поданими чи опублікованими. p-hacking діє всередині дослідження через селекцію даних, аналізів або результатів. Обидва механізми можуть накопичуватися. У сучасній метанауці розрізняють селекцію всередині дослідження та селекцію між дослідженнями. Методи, що шукають p-hacking за розподілом p-values, мають власні припущення: Elliott, Kudrin & Wüthrich (2022) показують, що за одночасного publication bias деякі такі процедури фактично тестують спільний сигнал p-hacking і публікаційної селекції. Тому статистичний сигнал у розподілі p-values потребує обережної інтерпретації.


p-hacking і data dredging


Data dredging або «рибальство» в даних — ширший термін для пошуку закономірностей у великому просторі можливостей. Він може бути легітимним у discovery research, якщо мета — генерація гіпотез і є належна валідація на нових даних. p-hacking описує специфічнішу ситуацію, коли пошук і селекція орієнтовані на статистичну значущість або інший бажаний інференційний поріг, а фінальний результат подається переконливіше, ніж дозволяє процес його отримання.


p-hacking і шахрайство


Фабрикація даних, підроблення спостережень або свідома фальсифікація — окрема категорія наукового misconduct. p-hacking не слід автоматично прирівнювати до вигадування даних. Це важлива етична межа: оцінка методології може показати, що inference ненадійний, але не дає права приписувати авторові намір обманути без окремих доказів.


Які статистичні наслідки може мати p-hacking


Зростання ризику хибнопозитивного висновку


Коли багато аналітичних шляхів переглядають до отримання бажаного p-value, фактична частота помилки першого роду може стати вищою за номінальне α. Це центральний результат Simmons, Nelson & Simonsohn (2011) і наступної літератури про researcher degrees of freedom. Водночас величина інфляції не є сталою: вона залежить від конкретної стратегії, кореляції між тестами, розміру вибірки, ефекту та правил вибору.


Завищення оцінки ефекту


Селекція за «успішним» результатом може зміщувати не лише p-value, а й оцінений розмір ефекту. Якщо серед багатьох шумних оцінок обирають ту, яка перетнула поріг значущості, вона часто є екстремальнішою за типовий результат. Wicherts et al. (2016) прямо зазначають, що opportunistic use of researcher degrees of freedom може інфлювати false positives та оцінки effect size.


Тому statistically significant не означає practically important. Значення p залежить від ефекту, вибірки, варіабельності й моделі, а розмір ефекту та його невизначеність потребують окремої оцінки. Корисно дивитися на оцінки й довірчі інтервали, а не намагатися звести доказ до бінарного «p<.05 / p>.05». Wasserstein, Schirm & Lazar (2019) закликали відмовлятися від автоматичного мислення порогом p<.05 і розглядати повніший контекст доказів.


Нестійкість реплікації


Якщо первинна оцінка стала «значущою» завдяки селекції сприятливого аналітичного маршруту, точна або концептуальна реплікація, де простір рішень інший або правила зафіксовані наперед, може дати слабший ефект. Це не означає, що кожна невдала реплікація доводить p-hacking у першій роботі: розбіжності можуть виникати через sampling error, відмінності популяцій, measurement, implementation, context або справжню гетерогенність.


Спотворення подальших оглядів і метааналізів


Метааналіз не може магічно відновити всі неопубліковані або невибрані результати всередині первинних досліджень. Якщо первинні estimates уже відібрані за статистичною успішністю, pooled effect може успадковувати цей bias. Водночас емпіричні оцінки масштабу проблеми відрізняються. Head et al. (2015) знайшли ознаки p-hacking у великому корпусі літератури, але в їхніх аналізах його вплив на метааналітичні середні ефекти був слабшим, ніж інколи припускають. Це хороший приклад того, чому p-hacking не слід описувати апокаліптично.


Що наука знає про поширеність p-hacking


Є кілька типів evidence: опитування дослідників про questionable research practices, статистичний аналіз розподілів p-values, повторний аналіз опублікованих даних, порівняння preregistered і non-preregistered studies, симуляції та дослідження конкретних стратегій. Жоден із цих методів сам по собі не дає універсальної частки «скільки відсотків психологічних досліджень p-hacked».


Опитування John, Loewenstein & Prelec (2012) показало, що різні QRPs були відомими й реально використовувалися частиною психологів. Текст-майнінг Head et al. (2015) виявив патерни, сумісні з p-hacking, у багатьох наукових дисциплінах. Але інтерпретація p-value distributions залежить від true effects, power, publication selection, heterogeneity та самої структури тестів.


Сучасні методи detection стали формальнішими. Elliott, Kudrin & Wüthrich (2022) показали, які обмеження на форму розподілу p-values можна тестувати за певних моделей, і водночас підкреслили, що за наявності publication bias такі процедури можуть фактично тестувати спільний сигнал p-hacking і publication selection. Отже, підозрілий «горб» біля .05 є приводом до метанаукового аналізу, а не автоматичним доказом порушення конкретного автора.


Чому один p-value не дозволяє звинуватити дослідження в p-hacking


p=.049 і p=.051 майже не відрізняються за доказовою силою, хоча бінарна культура «значущості» часто ставила їх по різні боки символічної межі. Сам по собі p=.049 не є відбитком p-hacking. Він може бути чесним результатом заздалегідь визначеного аналізу. Аналогічно p=.20 не доводить методологічної чистоти.


Діагноз p-hacking потребує інформації про процес: preregistration або protocol, первинні й вторинні outcomes, stopping rule, exclusion rules, повний набір моделей, deviations, версії коду, timestamps, доступність даних і те, чи були альтернативні аналізи приховані. Саме тому transparency сильніша за «полювання на підозрілі p-values».


Як p-hacking пов’язаний із кризою відтворюваності


p-hacking став одним із центральних термінів дискусії про reproducibility у психології, але він є лише одним елементом ширшої системи. Низька статистична потужність, неточне вимірювання, publication bias, слабка теорія, недостатня специфікація моделей, помилки коду, неоптимальні стимули й вибіркове звітування можуть діяти одночасно. Munafò et al. (2017) запропонували комплексну програму reproducible science, яка охоплює дизайн, reporting, dissemination, incentives і методи, а не один «винний» механізм.


Тому пояснювати всі replication failures p-hacking — методологічно слабко. Реплікація може відрізнятися через справжню heterogeneity або іншу операціоналізацію. Навпаки, успішна реплікація не доводить, що в оригіналі не було аналітичної гнучкості. Правильне питання — наскільки процес отримання й звітування результату дозволяє оцінити його evidential value.


Як зменшувати ризик p-hacking


1. Пререєстрація гіпотез і плану аналізу


Пререєстрація дослідження фіксує ключові рішення до того, як результати стануть відомі: гіпотези, основні й вторинні показники, правило визначення розміру вибірки, критерії виключення, попередню обробку, статистичну модель, контрасти та правила прийняття рішень. У логіці Nosek et al. (2018) це допомагає відрізнити передбачення від постдикції та робить залежні від даних відхилення від плану видимими.


Пререєстрація не гарантує валідності дослідження. Нечіткий план може залишати стільки свободи, що майже не обмежує аналіз; навіть детальна пререєстрація не виправляє проблем вимірювання, упереджень вибірки чи неправильної моделі. Емпіричне порівняння van den Akker et al. (2024) не виявило надійних доказів того, що пререєстровані психологічні дослідження мали менше позитивних результатів, менші ефекти або менше статистичних помилок, хоча в них частіше проводили аналіз статистичної потужності й використовували більші вибірки. Це приклад змішаних доказів щодо реального ефекту пререєстрації, а не аргумент проти прозорості.


2. Registered Reports


Registered Report переносить ключову частину peer review до отримання основних результатів. Журнал оцінює питання й метод до того, як outcome відомий, і може дати in-principle acceptance незалежно від того, чи буде p<.05. Це структурно послаблює стимул «добувати значущість», бо публікаційне рішення менше залежить від напряму й статистичної успішності результату.


3. Чітке розділення confirmatory та exploratory analyses


Дослідник не втрачає право на цікаві post hoc analyses. Сильна стаття може прямо сказати: «цей аналіз був preregistered», «цей аналіз був доданий після перегляду даних», «ця гіпотеза exploratory». Такий disclosure зберігає інформацію, яку p-hacking стирає: які твердження були ризикованими передбаченнями, а які виникли з уже побаченого патерну.


4. Повне звітування про outcomes, exclusions і аналізи


Читачеві потрібна карта рішень. Які змінні вимірювали? Які були primary і secondary? Скільки учасників виключили й чому? Чи змінювався sample-size plan? Які моделі пробували? Які deviations від protocol сталися? Повне звітування не означає завантажувати в основний текст кожен експериментальний рядок коду, але критичні аналітичні гілки мають бути відновлюваними.


5. Multiverse та sensitivity analyses


Коли кілька аналітичних рішень однаково обґрунтовані, корисно не приховувати цю невизначеність за однією моделлю. Steegen et al. (2016) запропонували multiverse analysis: провести аналіз через множину розумних способів preprocessing та показати, як висновок змінюється у всьому просторі. Це не універсальна заміна основному аналізу, але сильний спосіб перевірити, чи результат тримається лише на одному вузькому маршруті.


6. Дані, код і computational reproducibility


Відкритий код дозволяє побачити preprocessing, exclusions, model specification та точний шлях від raw data до result. Відкриті дані, коли це сумісно з етикою, consent, privacy і правом, дозволяють незалежно перевірити аналіз. Але data sharing саме по собі не доводить відсутність p-hacking: код і дані можуть показувати лише опублікований маршрут, якщо інші випробувані маршрути не зафіксовані.


7. Реплікація на нових даних


Найсильніший спосіб перевірити exploratory finding — перетворити його на нове prediction і перевірити на незалежних даних. Так випадковий патерн, знайдений серед багатьох варіантів, отримує шанс пройти новий тест без використання тієї самої інформації, яка породила гіпотезу.


Як читачеві оцінити ризик p-hacking у статті


Немає одного чекбокса, який відрізняє «чисту» роботу від «p-hacked». Корисніше оцінювати прозорість і можливості для результат-залежної селекції. Нижче — практичні питання, які можна поставити до будь-якої кількісної психологічної статті.


Чи був план зафіксований до даних


Перевірте preregistration, protocol або registered report. Подивіться не лише на наявність посилання, а й на дату та деталізацію: чи можна з документа зрозуміти outcomes, sample size, exclusions і model? Якщо preregistration опублікований після data collection або залишає критичні рішення невизначеними, його захисна роль менша.


Чи збігається стаття з preregistration


Відхилення від плану допустимі. Нові дані можуть показати технічну проблему, помилку в коді або непридатність запланованої моделі. Важливо, щоб deviations були позначені й обґрунтовані. Проблема — не зміна плану як така, а непомітне переписування історії після того, як результат уже відомий.


Скільки було outcomes і аналізів


Якщо в Methods описано десять шкал, але Results обговорює дві, варто перевірити supplement або protocol. Якщо заявлено багато secondary outcomes, subgroup analyses чи interaction tests, треба врахувати multiplicity і селективність. Не кожен великий набір аналізів потребує однієї й тієї самої корекції, але читач має розуміти, скільки можливостей було для вибору.


Чи стабільний висновок до розумних альтернатив


Сильний результат не повинен залежати від одного довільного cutoff для outlier або однієї випадково вибраної коваріати. Sensitivity analyses, robustness checks, multiverse/specification-curve підходи допомагають побачити, чи змінюється substantive conclusion, коли аналітичне рішення змінити в межах розумного.


Чи подано оцінки та невизначеність, а не лише p-value


Один p-value стискає занадто багато інформації. Ефект, стандартна помилка, interval estimate, raw/adjusted means, distribution, sample size і assumptions допомагають читати результат без магії порогу .05. Матеріал ХАБу про 95% довірчий інтервал пояснює, як інтервал відображає статистичну невизначеність і чому його також не слід тлумачити як просту ймовірність істинності параметра.


Чи відповідає дизайн причинному твердженню


p-hacking може зробити асоціацію «значущою», але навіть ідеально preregistered p-value не перетворює кореляцію на причинність. Для причинного висновку потрібен дизайн і assumptions, які адресують confounding, selection, temporality та intervention contrast. Для експериментальних основ дивіться «Експериментальний метод у психології».


Що робити, якщо підозра на p-hacking уже виникла


Для читача правильна реакція — не переходити від підозри до звинувачення, а знизити впевненість до рівня, який підтримує доступна інформація. Попросіть або знайдіть protocol, preregistration, supplementary analyses, data/code, повний набір outcomes. Подивіться на independent replications і meta-analytic evidence. Якщо висновок критично важливий для практики, не покладайтеся на одну статтю.


Для дослідника сильна відповідь — показати process transparency: коли було прийняте кожне рішення, які альтернативи розглядалися, що було confirmatory, що exploratory, чи змінюється висновок за інших specification. Це корисніше, ніж захищати конкретний p-value як символ «правильності».


p-hacking у клінічній та прикладній психології


У клінічній, освітній чи організаційній психології наслідки можуть виходити за межі академічної дискусії. Вибірковий статистично «успішний» outcome може створити надмірно оптимістичне враження про ефективність втручання, зв’язок фактора з ризиком або корисність програми. Але окремий значущий результат ніколи не є достатньою підставою для діагнозу чи персонального рішення.


Для практичних висновків треба враховувати design, population, measurement quality, effect size, uncertainty, harms, baseline risk, external validity, replication і сукупність evidence. У screening і psychodiagnostics окремо діють правила sensitivity/specificity, predictive values, base rate та intended use; p-hacking є іншим шаром методологічного ризику й не замінює оцінку психометричної якості інструмента.


Науковий статус поняття


p-hacking — усталений метанауковий і статистико-методологічний термін, а не клінічний діагноз і не формальна категорія DSM чи ICD. Його механізми підтримані симуляціями, теоретичними моделями, опитуваннями та аналізами літератури. Водночас точну поширеність, силу впливу в конкретній дисципліні й атрибуцію окремому дослідженню часто оцінити складно.


Найкраще встановлений науковий висновок стосується самого механізму: нерозкрита результат-залежна гнучкість може підвищувати частоту статистичних помилок і спотворювати оцінки ефектів. Докази щодо того, наскільки часто конкретні стратегії використовують сьогодні та який їхній внесок у різних галузях, неоднорідні. Докази щодо окремих контрзаходів також змішані: прозорість, пререєстрація, registered reports і аналізи стійкості мають сильне методологічне обґрунтування, але реальна ефективність залежить від якості впровадження.


Короткий приклад


Уявімо дослідження впливу короткої психологічної інтервенції на стрес. Дослідник вимірює загальний стрес, дві субшкали, тривогу, настрій і сон. Спочатку загальний score незначущий. Потім аналізують лише учасників без пропусків — незначущий. Виключають двох outliers — p=.08. Додають вік як коваріату — p=.06. Аналізують лише молодших — p=.047. У статті залишається фраза: «інтервенція значуще знизила стрес у молодших учасників, p=.047», без опису попередніх рішень.


Проблема тут не в самому p=.047 і не в підгруповому аналізі як такому. Проблема — у тому, що читач бачить фінальний аналіз як ніби єдиний, хоча він був вибраний із багатьох data-contingent alternatives. Якби всі аналізи були показані як exploratory, а ефект у молодшій групі був preregistered і перевірений у новій вибірці, evidential status був би іншим.


FAQ


Чи означає p-hacking підробку даних


Ні. p-hacking описує результат-залежну гнучкість у зборі, аналізі або звітуванні. Фабрикація даних — окреме серйозне порушення. Конкретний випадок p-hacking може мати різний етичний статус залежно від наміру, прозорості та правил, але автоматично називати його фальсифікацією неправильно.


Чи є будь-який аналіз після перегляду даних p-hacking


Ні. Exploratory analysis є нормальною частиною науки. Критично важливо не подавати його як незалежне confirmatory test, якщо гіпотеза або аналіз були сформовані після перегляду тих самих даних. Найкраща практика — прозоро маркувати exploration і перевіряти нові гіпотези на нових даних.


Чи доводить p=.049, що був p-hacking


Ні. Одне число не відновлює історію аналітичних рішень. p=.049 може бути результатом чистого preregistered analysis, а p=.20 — результатом багатьох невдалих спроб знайти значущість. Для оцінки потрібні protocol, preregistration, повнота reporting і robustness.


Чи вирішує Bonferroni проблему p-hacking


Лише частину задачі. Bonferroni контролює family-wise error rate для визначеної сім’ї множинних тестів, але не виправляє приховану селекцію outcomes, ad hoc exclusions, optional stopping, вибір моделі чи нерозкриті альтернативні preprocessing decisions. p-hacking ширший за формальну multiplicity.


Чи гарантує preregistration відсутність p-hacking


Ні. Якість preregistration має значення. Нечіткий план може залишати багато свободи; deviations можуть бути нерозкриті; а валідність measurement і design preregistration не створює автоматично. Проте детальний timestamped plan робить ключові рішення видимими й допомагає відрізнити confirmatory від exploratory.


Чи можна статистично виявити p-hacking у наборі статей


Існують методи, які аналізують форму p-value distributions, excess significance, selection patterns та інші сигнали. Але вони мають assumptions і можуть плутати p-hacking з publication bias, heterogeneity чи іншими процесами. На рівні окремої статті статистична підозра не є доказом наміру.


Чому p-hacking може завищувати розмір ефекту


Коли з багатьох шумних estimates вибирають ту, що перетнула поріг значущості, вибрана оцінка часто є більш екстремальною. Це selection effect: не лише p-value, а й magnitude може виглядати сильнішим за типовий результат, особливо в невеликих вибірках.


Чи є p-hacking лише проблемою психології


Ні. Термін особливо відомий через дискусії в психології та соціальних науках, але механізм можливий у будь-якій галузі, де є гнучкий аналіз і стимули до певного статистичного результату. Head et al. (2015) аналізували p-hacking у широкому міждисциплінарному корпусі.


Що найкраще робити досліднику, якщо після preregistration потрібна інша модель


Змінити модель, якщо цього вимагають дані або assumptions, але прозоро описати deviation, причину й статус аналізу. Корисно подати preregistered result поруч із revised analysis або пояснити, чому первинний аналіз непридатний. Пререєстрація має робити зміни видимими, а не забороняти наукове мислення.


Чи можна довіряти дослідженню без preregistration


Таке дослідження не стає автоматично недостовірним. Потрібно оцінити design, transparency, completeness of reporting, robustness, data/code availability, plausibility of analytic choices, replication та ширший evidence base. Preregistration — один сильний інструмент provenance аналізу, але не єдина ознака якості.


Пов’язані статті




Кореляція і причинність: чому зв’язок між змінними не доводить причинний ефект — про межі причинної інтерпретації статистичних асоціацій.


Експериментальний метод у психології: як працює експеримент, змінні та валідність — про дизайн, контроль і логіку експериментального висновку.


Джерела













 
 
bottom of page