Сумнівні дослідницькі практики: p-hacking, HARKing, селективне звітування та свобода аналітичних рішень
Автор: Український психологічний ХАБ · Опубліковано: 7 жовтня 2026 · Редакційна політика
Сумнівні дослідницькі практики — це широкий клас рішень у плануванні, проведенні, аналізі, інтерпретації або звітуванні дослідження, які можуть систематично робити результат переконливішим, ніж дозволяють самі дані й дизайн. До цього поля належать p-hacking, HARKing, селективне звітування, прихована зміна результатів або критеріїв виключення, результат-залежний вибір моделей та інші способи використання дослідницької гнучкості без достатньої прозорості. Єдиного універсального переліку QRP немає: сучасна метанаука описує їх як різнорідне сімейство практик, межі якого залежать від дисципліни, етапу дослідження та нормативної рамки. Це добре видно у свіжій систематизації Fanelli та співавторів, 2026.
Ключова проблема полягає не в тому, що дослідник має робити вибір. Будь-яке реальне дослідження містить рішення щодо вибірки, кодування, виключень, змінних, моделей, трансформацій, множинних порівнянь і способу подання результатів. Проблема виникає тоді, коли ці рішення залежать від уже побаченого результату, вибірковим чином підсилюють бажаний висновок або приховуються так, що читач сприймає гнучкий пошук як наперед визначену перевірку. Саме тому окремі статті ХАБу розглядають p-hacking і HARKing як самостійні канонічні поняття, а ця сторінка пояснює їхнє місце в ширшій системі сумнівних дослідницьких практик.
Сумнівна практика також не є автоматичним синонімом фабрикації або фальсифікації. В українському Законі «Про академічну доброчесність» фабрикація та фальсифікація визначені як окремі види порушень академічної доброчесності, а європейський кодекс ALLEA розглядає дослідницьку доброчесність як ширшу систему належних практик і порушень. Тому оцінювати конкретний випадок слід за діями, прозорістю, правилами відповідної установи та доказами, а не за одним дивним p-значенням чи неочікуваним результатом. Див. Закон України № 4742-IX та European Code of Conduct for Research Integrity.
Коротка відповідь: що таке сумнівні дослідницькі практики
Термін questionable research practices, або QRP, використовують для позначення практик, які перебувають між належною прозорою дослідницькою роботою та найбільш очевидними формами серйозного порушення доброчесності. У психології центральною темою є те, як рішення дослідника можуть змінювати статистичний або інтерпретаційний результат: коли з багатьох можливих шляхів невидимо обирається саме той, що дає бажаний висновок, читач уже не бачить реальної кількості спроб і ступеня невизначеності.
Класичні роботи з психологічної метанауки показали, що гнучкість може з’являтися на багатьох етапах. У моделюванні Simmons, Nelson і Simonsohn продемонстрували, що нерозкриті рішення щодо збору й аналізу даних можуть різко збільшувати шанс статистично значущих висновків навіть за відсутності належної доказової підстави; Wicherts та співавтори пізніше систематизували десятки «ступенів свободи» від планування до звітування. Див. Simmons, Nelson & Simonsohn, 2011 і Wicherts et al., 2016.
Звідси випливає робоче правило: сама наявність кількох обґрунтованих способів аналізу не є QRP. Науково коректний дослідник може змінити модель, провести додатковий аналіз, перевірити інший спосіб кодування або сформулювати нову гіпотезу після знайомства з даними. Доказова проблема починається тоді, коли історія цих рішень стирається, а результат подається так, ніби він був єдиним запланованим шляхом і незалежною перевіркою наперед сформульованої гіпотези.
Де проходить межа між помилкою, гнучкістю, QRP і серйозним порушенням
У реальних дослідженнях немає однієї лінії, яка механічно класифікує кожне рішення. Корисніше розрізняти чотири рівні. Перший — звичайна методологічна невизначеність: існує кілька прийнятних способів вимірювання або аналізу. Другий — помилка або слабке рішення: наприклад, некоректно підібрана модель через недостатню компетентність. Третій — сумнівна практика, коли вибір чи звітування систематично підвищують ризик упередженого висновку. Четвертий — формально визначене порушення доброчесності, для якого конкретні правила встановлюють окремі критерії.
Ці рівні не слід ототожнювати з наміром. Частина визначень QRP підкреслює свідоме результат-залежне рішення, інші дослідницькі рамки охоплюють і практики, які можуть виникати через звичку, слабке навчання або інституційні стимули. Сучасна класифікація QRP прямо показує, що термін охоплює дуже різні дії й погано піддається єдиній демаркації. Тому методологічний аналіз має встановлювати, що саме було зроблено і як це змінює доказову силу, а етичне чи дисциплінарне звинувачення потребує окремих підстав. Див. Fanelli et al., 2026.
Це особливо важливо для читача наукової статті. За опублікованим p = .049 не можна встановити, чи був p-hacking. За незвичайною гіпотезою не можна автоматично довести HARKing. За відсутністю пререєстрації не можна оголосити дослідження недоброчесним. Оцінка ґрунтується на повноті протоколу, послідовності рішень, кількості доступних аналітичних шляхів, звітуванні відхилень, узгодженості первинних і опублікованих результатів та ширшому масиві доказів.
Свобода аналітичних рішень: нейтральна властивість дослідження, яка може створювати ризик
Ступені свободи дослідника (researcher degrees of freedom) — описують множину рішень, які потрібно прийняти в процесі дослідження. Це не окрема сумнівна практика й не синонім p-hacking. У психології дослідник може обирати, коли завершити набір, які спостереження виключити, як поводитися з пропусками, які шкали утворити з пунктів, чи трансформувати змінні, які коваріати включити, яку модель вважати основною, які підгрупи аналізувати та які результати винести в абстракт. Огляд Wicherts et al., 2016 показує, наскільки багато таких рішень виникає ще до написання результатів.
Аналітична гнучкість часто необхідна. Дані можуть порушувати припущення моделі; попередньо запланований код може містити помилку; нова інформація може вимагати іншої специфікації; якісне дослідження за своєю логікою може передбачати ітеративний рух між матеріалом та інтерпретацією. Методологічна якість полягає не в забороні змін, а в тому, щоб зміни були обґрунтованими, документованими та правильно позначеними за своїм статусом.
Ризик зростає, коли рішення приймаються після перегляду результатів, але подаються як незалежні від результату. Припустімо, дослідник має три можливі способи обчислити результат, два набори критеріїв виключення і чотири варіанти коваріат. Уже це створює 24 комбінації, хоча читач може побачити лише одну. Якщо обрана комбінація тому, що саме вона дала p < .05, а решта шляхів залишилися невидимими, фактична множинність аналізу значно більша, ніж здається з фінальної таблиці.
Інший підхід до тієї самої проблеми — показувати не одну «переможну» специфікацію, а набір обґрунтованих варіантів і перевіряти, наскільки висновок залежить від них. Steegen та співавтори запропонували багатоваріантний аналіз (multiverse analysis) як спосіб зробити видимою чутливість висновків до альтернативних рішень із підготовки даних. Це не універсальний обов’язок для кожного дослідження, а методологічна стратегія для ситуацій, де багато правдоподібних специфікацій можуть істотно змінити результат. Див. Steegen et al., 2016.
Основні види сумнівних дослідницьких практик
p-hacking: пошук статистично бажаного результату через гнучкість
p-hacking — це результат-залежне використання гнучкості збору, обробки, аналізу або звітування, яке підвищує шанс отримати бажаний статистично значущий результат. Це може включати багаторазове випробування моделей, зміну коваріат, альтернативні правила виключення, зупинку набору після досягнення порога або вибір лише тих результатів, які «спрацювали». Центральною є не кількість аналізів як така, а прихована залежність остаточного вибору від результату. Докладний механізм розглянуто в окремій статті p-hacking: як гнучкість аналізу може створювати хибно переконливі статистичні результати.
p-hacking тісно пов’язаний із множинністю, але не дорівнює звичайним множинним порівнянням. Десятки наперед запланованих тестів із прозорою корекцією можуть бути статистично коректною процедурою. Один-єдиний опублікований тест може бути результатом прихованого перебору десятків варіантів. Саме тому окрема сторінка Множинні порівняння пояснює проблему інфляції помилки I роду, а аналіз QRP додає питання про історію вибору й звітування.
HARKing: зміна історії гіпотези після того, як результат уже відомий
HARKing означає Hypothesizing After the Results are Known: гіпотезу формують або суттєво змінюють після знайомства з результатами, але в статті подають так, ніби вона існувала до аналізу. Норберт Керр увів цей термін у 1998 році й показав, що проблема стосується не самого виникнення post hoc ідей, а їхнього представлення як a priori передбачень. Див. Kerr, 1998 та окремий канонічний матеріал HARKing.
Пошукове формулювання гіпотез є нормальною функцією науки. Дані часто породжують нові теорії. Доказова помилка виникає тоді, коли ті самі дані одночасно використовуються для відкриття закономірності й подаються як незалежна сувора перевірка передбачення без відповідного маркування. Нову гіпотезу можна чесно сформулювати після результату, а її підтверджувальну силу перевірити на нових даних або в окремому реплікаційному дослідженні.
Селективне звітування: коли читач бачить лише частину дослідженого
Селективне звітування виникає, коли з проведених вимірювань, аналізів, умов, часових точок або результатів у публічний звіт потрапляє лише підмножина, причому ймовірність появи залежить від напряму, величини або статистичної «успішності» результату. Це може бути зміна первинного показника, замовчування невдалих вторинних результатів, вибір найпривабливішого часового вікна, публікація лише частини підгруп або опис лише моделі, яка підтримує основну історію.
Емпірична база для проблеми упередження через селективне звітування результатів особливо добре розроблена у клінічних дослідженнях. Систематичний огляд Dwan та співавторів показав прямі розбіжності між протоколами й публікаціями та більшу ймовірність повного звітування статистично значущих результатів. Cochrane Handbook розглядає відсутні докази і упередження через незвітування як окреме джерело систематичного зміщення в синтезі доказів. Див. Dwan et al., 2013 і Cochrane Handbook, Chapter 13.
Селективне звітування не тотожне публікаційному упередженню. Перше може відбуватися всередині одного дослідження: частина результати або аналізів зникає з публікації. Публікаційне упередження стосується видимості цілих досліджень або результатів у науковому корпусі й може виникати на рівні авторів, редакційних рішень або системи публікації. Обидва процеси можуть створювати відсутні докази, але це різні канонічні пошукові наміри.
Результат-залежна зупинка набору, виключення спостережень і вибір коваріат
Результат-залежна зупинка набору (optional stopping) стає проблемним, коли дослідник багаторазово перевіряє дані й завершує набір саме після появи бажаного результату, хоча аналіз інтерпретується так, ніби обсяг вибірки був визначений незалежно. Аналогічно, виключення спостережень може бути цілком виправданим через технічні помилки або заздалегідь визначені критерії; воно стає QRP-ризиком, коли правила змінюють після перегляду результатів і не розкривають.
Коваріати, трансформації та різні статистичні моделі теж не мають «правильної моральної кількості». Додаткова модель може краще відповідати дизайну, розподілу даних або теоретичному питанню. Методологічне питання звучить інакше: чи був вибір моделі обґрунтований незалежно від бажаного результату, чи показано альтернативні специфікації, чи узгоджується модель із припущеннями та чи бачить читач відхилення від початкового плану.
Вибіркове трактування: коли висновок стає сильнішим за дані
Сумнівна практика може виникати й після статистичного аналізу. Наприклад, автор може назвати слабку асоціацію «доказом причини», наголосити на підгрупі, для якої результат сприятливий, і майже не обговорити суперечливі оцінки; у висновку виділити статистично значущий ефект і замовчати його малу величину або широку невизначеність. Тут важливо розділяти помилку інтерпретації, риторичне перебільшення та навмисну селекцію: доказова оцінка стосується того, чи відповідає сила висновку дизайну й результатам.
p-hacking, HARKing, селективне звітування і публікаційне упередження: у чому різниця
p-hacking змінює шлях до статистичного результату: дослідник використовує аналітичну або збиральну гнучкість так, що зростає шанс отримати бажану статистичну картину. HARKing змінює історію гіпотези: post hoc пояснення подається як наперед сформульоване передбачення. Селективне звітування змінює те, що бачить читач: із проведеного дослідження оприлюднюється неповний набір результатів або аналізів. Публікаційне упередження змінює видимий науковий корпус: результати з певними властивостями частіше доходять до повної публікації або стають легше доступними.
Ці механізми можуть співіснувати. Один проєкт може містити гнучкий аналіз, після якого автор перепише гіпотезу під результат, а потім повідомить лише найпереконливіший результат. Проте наявність одного механізму не доводить інший. Саме тому p-hacking, HARKing і публікаційне упередження розглядаються на окремих сторінках, а цей матеріал описує ширше сімейство QRP.
Ступені свободи дослідника розташовані ще на іншому рівні. Вони описують простір можливих рішень. Відкритий, теоретично та статистично обґрунтований вибір із цього простору може бути належною практикою. Результат-залежне використання того самого простору з прихованою селекцією може перетворити гнучкість на QRP. Отже, ступені свободи дослідника описують простір можливих рішень, а не автоматичний недолік дослідження.
Чому сумнівні практики послаблюють доказову силу
Перша проблема — прихована множинність. Якщо дослідник фактично випробував багато шляхів, а в статті показав один, номінальний p-value відображає лише фінальну модель і не повідомляє читачеві, скільки можливостей було перебрано. У класичних симуляціях нерозкрита гнучкість могла створювати значущі результати за сценаріїв, де належний підтверджувальний аналіз їх не мав би підтримувати. Див. Simmons et al., 2011.
Друга проблема — завищення оцінки ефекту через селекцію. Якщо з багатьох шумних оцінок обирають ту, що найкраще проходить поріг, обрана оцінка часто буде більш екстремальною, ніж типовий результат повторного дослідження. Це одна з причин, чому QRP слід розглядати разом із точністю оцінки, довірчими інтервалами, потужністю та незалежною реплікацією, а не лише з питанням «значуще чи ні».
Третя проблема — руйнування межі між відкриттям і перевіркою. Коли гіпотеза народилася після перегляду даних, ці дані вже містять інформацію, яка спрямувала гіпотезу. Вони можуть бути чудовим джерелом ідеї, але їхня роль відрізняється від незалежного тесту. Пререєстраційний підхід формалізує цю відмінність, фіксуючи план до того, як релевантний результат стане відомим. Див. Nosek et al., 2018 і сторінку Пререєстрація дослідження.
Четверта проблема — спотворення синтезу доказів. Систематичний огляд або метааналіз може акуратно об’єднати лише ті результати, які доступні. Якщо нульові, несприятливі або просто менш «цікаві» результати систематично не потрапляють до публікацій, статистичний синтез успадковує цей дефіцит видимих даних. Тому ризик упередження через відсутні докази оцінюють окремо від самої моделі метааналізу. Цю логіку докладно викладає Cochrane Handbook.
П’ята проблема — крихкість висновку. Якщо ефект існує лише за одного з кількох рівною мірою обґрунтованих способів очищення даних або специфікації моделі, це важлива інформація про його стійкість. Аналіз чутливості, альтернативні специфікації та багатоваріантний аналіз можуть показати цю залежність замість прихованого вибору єдиного варіанта. Див. Steegen et al., 2016.
Усе це не означає, що кожна невдала реплікація є наслідком QRP. Різниця між дослідженнями може виникати через випадкову варіативність, неточність, інші популяції й контексти, проблеми вимірювання, специфічність маніпуляції, помилки коду або невірно визначені умови ефекту. QRP є одним із класів механізмів, які можуть послаблювати надійність літератури. Окремий матеріал Реплікаційна криза в психології розглядає ширший історичний і методологічний контекст.
Поріг p < .05 не створює QRP сам по собі, але може формувати стимули
Багато відомих QRP обговорювалися в контексті культури статистичної значущості, де результат по один бік порога сприймали як «успіх», а по інший — як «невдачу». Це створює сильний стимул пробувати додаткові рішення, якщо фінальна оцінка близька до .05. Проте p-value сам по собі не є проблемою і не є доказом QRP. Американська статистична асоціація наголосила, що наукові висновки не мають залежати лише від проходження конкретного порога, а p-value не вимірює імовірність істинності гіпотези.
Тому p = .049 і p = .051 не утворюють дві різні реальності. Обидва результати потребують контексту: дизайну, розміру ефекту, невизначеності, якості вимірювання, кількості аналізів, припущень моделі та зовнішніх доказів. Детальні межі інтерпретації розглядають сторінки p-значення і Статистична значущість.
Відмова від механічного порога також не вирішує проблему автоматично. Якщо дослідник замінить p-value іншою метрикою, але збереже результат-залежний перебір і селективне звітування, гнучкість просто переміститься в інше місце. Рішення стосується дизайну процесу: прозорості, попередньої специфікації там, де вона доречна, повного звітування й перевірки стійкості.
Пошуковий аналіз є легітимним: проблема починається з неправильного маркування
Наука потребує пошуку. Дослідник має право дивитися на дані, будувати графіки, тестувати несподівані взаємодії, пробувати альтернативні кодування, помічати нові закономірності й формулювати нові гіпотези. Без такого етапу значна частина наукових відкриттів була б неможливою. Сумнівною практикою стає не дослідницька цікавість, а стирання інформації про те, що аналіз був пошуковим.
Коректне звітування може бути дуже простим: «цей аналіз не був пререєстрований і виник після огляду даних»; «ми змінили модель через порушення припущення й показуємо первинну та альтернативну специфікації»; «ця взаємодія є пошуковою і потребує незалежної перевірки». Такі формулювання не «послаблюють статтю»; вони правильно визначають епістемічний статус результату.
Пререєстрація допомагає зробити часову послідовність рішень видимою, але не перетворює дослідження на жорсткий сценарій без права на зміни. Відхилення від плану можуть бути необхідними. Якісна практика — зберегти первинний план, пояснити відхилення, позначити їхній статус і не видавати новий шлях за той, що був визначений наперед. Це центральна логіка пререєстрації дослідження.
Пререєстрація і Registered Reports — різні механізми
Пререєстрація — це датована фіксація гіпотез, дизайну, результати і плану аналізу до того, як релевантні результати стануть відомими. Вона створює зовнішній запис, із яким можна порівняти фактичний аналіз. Registered Reports — це видавничий формат: журнал проводить рецензування питання й методу до отримання або перегляду основних результатів і може надати принципове попереднє рішення про прийняття, тобто принципову згоду на публікацію за умови належного виконання протоколу. Історично формат був запроваджений у Cortex; див. Chambers, 2013.
Отже, пререєстрація не дорівнює Registered Report. Дослідження може бути пререєстрованим і проходити звичайне рецензування після результатів. Registered Report зазвичай включає реєстрацію протоколу, але додає ранню експертну оцінку й змінює момент, коли журнал приймає основне рішення про публікацію. Обидва механізми зменшують простір для прихованої ретроспективної зміни історії дослідження, але не гарантують безпомилковість дизайну, аналізу чи виконання.
Як читати статтю і шукати ознаки результат-залежної селекції
1. Чи зрозуміло, які питання й гіпотези були первинними? Якщо автори використовують слова «передбачали», «очікували», «основна гіпотеза», корисно перевірити, чи існував протокол, пререєстрація або інший датований запис. Відсутність такого запису не доводить HARKing, але обмежує можливість незалежно перевірити хронологію.
2. Чи визначено первинні та вторинні результати? Велика кількість вимірювань сама по собі не є проблемою. Важливо, чи зрозуміло, які результати мали центральне значення, чи повідомлено всі заплановані показники та чи пояснено зміни.
3. Як визначили розмір вибірки і момент зупинки? Наперед сформульоване правило набору, аналіз статистичної потужності або послідовний дизайн із коректною статистичною процедурою роблять процес зрозумілим. Формула «ми збирали дані, поки результат не став значущим» потребує зовсім іншої інтерпретації.
4. Як обробляли виключення і пропущені дані? Читачеві потрібні критерії виключення, кількість виключених учасників, причини й аналіз чутливості, якщо різні розумні правила можуть змінити висновок.
5. Чи видно множинність моделей і порівнянь? Якщо стаття містить багато результати, підгруп, часових точок і взаємодій, варто шукати, як автори контролювали або принаймні прозоро описали множинність. Пояснення статистичної проблеми є в статті Множинні порівняння.
6. Чи обґрунтовані коваріати, трансформації й альтернативні моделі? Корисно бачити, чому конкретна специфікація відповідає питанню і дизайну, чи була вона запланована та наскільки висновок змінюється за інших правдоподібних рішень.
7. Чи розрізнені підтверджувальні й пошукові результати? Формальне слово «пошуковий» не робить аналіз слабким. Воно повідомляє, що висновок має інший статус і потребує подальшої перевірки, якщо з нього хочуть зробити підтверджувальне твердження.
8. Чи збігаються протокол, реєстрація й публікація? Для пререєстрованих робіт варто перевіряти не лише наявність значка або посилання, а й відповідність гіпотез, результати, критеріїв, вибірки та аналізу. Відхилення допустимі, коли вони видимі й пояснені.
9. Чи доступні матеріали, дані й код там, де це етично можливо? Вони не є сертифікатом істинності, але роблять більше рішень перевірюваними. Аналітичну відтворюваність як окреме поняття пояснює стаття Відтворюваність досліджень.
10. Чи тримається висновок у ширшому масиві доказів? Один результат, навіть пререєстрований і прозорий, залишається одним дослідженням. Незалежні реплікації, систематичні огляди й узгоджені результати з різних дизайнів часто важливіші за риторичну впевненість окремої статті.
Що реально знижує ризик сумнівних практик
Попередня специфікація там, де вона можлива
Протокол і пререєстрація звужують простір для ретроспективного переписування основної історії дослідження. Найкорисніша пререєстрація достатньо конкретна, щоб пізніше можна було зрозуміти, що саме було визначено до даних: вибірка, ключові змінні, критерії виключення, первинні результати, модель і правила прийняття рішень. Загальна фраза «проведемо регресію» залишає значну частину аналітичної свободи невизначеною.
Водночас пререєстрація є інструментом прозорості, а не магічним знаком якості. Поганий дизайн можна пререєструвати; дослідник може відхилитися від плану; деякі питання неможливо детально специфікувати до першого контакту з матеріалом. Її цінність полягає у видимості часової послідовності та рішень. Концептуальну основу цього підходу систематизували Nosek et al., 2018.
Повне звітування і стандарти публікації
Звітування має дозволяти відновити логіку дослідження: що планували, що зробили, що змінили, які дані втратили, які аналізи були первинними, які додатковими та які обмеження має висновок. Для кількісної психології APA Journal Article Reporting Standards визначають інформацію, необхідну для оцінювання дизайну, аналізу й результатів; див. Appelbaum et al., 2018.
Стандарти звітування не є доказом правильності. Вони не роблять слабку вибірку репрезентативною, не виправляють змішування (confounding) і не перетворюють кореляцію на причинний ефект. Їхня роль — зробити ключові елементи видимими, щоб читач, рецензент або інший дослідник могли оцінити якість і відтворити логіку висновку.
Аналіз чутливості замість прихованого вибору одного варіанта
Коли кілька специфікацій є науково правдоподібними, корисно показати, чи зберігається висновок за альтернативних рішень. Це можуть бути різні правила виключення, способи кодування, набори коваріат або моделі. Якщо результат стабільний, читач бачить його робастність. Якщо змінюється, це теж важливий результат: висновок слід формулювати умовно й вказувати, від яких рішень він залежить.
Багатоваріантний аналіз (багатоваріантний аналіз (multiverse analysis)) є одним із формалізованих підходів до такої прозорості. Він не означає, що треба бездумно запускати всі математично можливі моделі. Набір специфікацій має складатися з обґрунтованих альтернатив, а інтерпретація — пояснювати, які рішення найбільше впливають на результат. Див. Steegen et al., 2016.
Відкриті матеріали, дані й код — із дотриманням етики
Доступ до матеріалів і коду дозволяє перевірити, що саме було зроблено, знайти технічні помилки та повторно виконати аналіз. Дані можуть бути відкритими, контрольовано доступними або закритими через конфіденційність, згоду учасників, правові обмеження чи ризик повторної ідентифікації. Відкритість не вимагає порушувати етику заради формальної прозорості.
Ширшу систему таких практик описує сторінка Відкрита наука в психології. Її логіка важлива для QRP: що більше дослідницький процес документований, то менше прихованих рішень залишається невидимими. Водночас відкрита наука не гарантує правильності — прозоро проведене дослідження все одно може мати слабкий дизайн або хибну інтерпретацію.
Незалежна реплікація і накопичення доказів
Найкращий захист від надмірної ваги одного випадкового або селективного результату — не вимога безпомилковості від однієї статті, а система перевірки. Незалежна реплікація, повторний аналіз, систематичний огляд і накопичення доказів з різних вибірок та методів допомагають відрізняти стійкий сигнал від результату, який залежав від конкретних рішень. Загальну реформаторську рамку прозорості, методів, стимулів і реплікації узагальнюють Munafò et al., 2017.
Якісні дослідження: гнучкість не можна оцінювати правилами кількісної перевірки нульових гіпотез (NHST)
У якісній психології дослідницький процес часто є ітеративним: питання уточнюються під час роботи, вибірка може розвиватися відповідно до методології, а аналіз передбачає рефлексивне повернення до матеріалу. Така гнучкість сама по собі не є QRP. Некоректно вимагати від феноменологічного, дискурсивного, етнографічного або рефлексивно-тематичного дослідження тієї самої попередньої фіксації, яку застосовують до підтверджувального тесту кількісної гіпотези.
Критерій залишається методологічним: чи узгоджені рішення з заявленою традицією, чи прозоро описано позицію дослідника, формування матеріалу, кроки аналізу, зміни й межі інтерпретації. APA розробила окремі JARS-Qual і стандарти для змішаних методів саме тому, що якісне дослідження потребує відповідних критеріїв звітування, а не механічного перенесення кількісних вимог. Див. Levitt et al., 2018.
Селективність усе ж може бути проблемою і в якісній роботі — наприклад, коли суперечливі фрагменти систематично замовчують, методологічні зміни приховують або цитати добирають так, що вони створюють більш однорідну картину, ніж увесь матеріал. Але оцінювати такі ризики потрібно в межах конкретної якісної методології, її логіки достатності, рефлексивності та прозорості.
Наскільки поширені сумнівні дослідницькі практики
На це запитання немає одного надійного відсотка. QRP охоплюють різні дії, опитування використовують різні формулювання, часові рамки й вибірки, а самозвіти про чутливу поведінку залежать від способу запитання. Історичне дослідження John, Loewenstein і Prelec опитало понад 2000 психологів і стало важливою точкою для обговорення QRP, але його окремі частоти не слід переносити як універсальну сучасну «частку психологів, які використовують p-hacking». Див. John et al., 2012.
Систематичний огляд психологічної літератури Stricker і Günther знайшов суттєву варіативність оцінок через різницю методів і охоплення. Ширший метааналіз Xie, Wang і Kong оцінив самозвіт про принаймні одну невизначену QRP у різних дисциплінах приблизно у 12,5%, але показав, що оцінки залежать від частки відповідей, періоду пригадування, кар’єрного рівня, дисципліни та географії. Це не число для «психології взагалі», а приклад того, наскільки результат залежить від операціоналізації. Див. Stricker & Günther, 2019 і Xie, Wang & Kong, 2021.
У 2026 році Fanelli та співавтори систематизували QRP, які використовувалися в опитуваннях, і знову показали, що категорія дуже неоднорідна. Найчастіше в таких дослідженнях траплялися практики, пов’язані з вибірковим аналізом, цитуванням і коваріатами, але ранжування відображає саме корпус опитувань та їхні формулювання. Найбезпечніший висновок полягає в тому, що QRP є реальним об’єктом метанаукового дослідження, а точна «поширеність» залежить від того, яку практику, популяцію й метод вимірювання мають на увазі. Див. Fanelli et al., 2026.
QRP і реплікаційна криза: причинний зв’язок не можна спрощувати
Сумнівні практики є одним із правдоподібних механізмів, що можуть збільшувати кількість нестійких або завищених результатів у літературі. Якщо значущі результати відбираються з багатьох прихованих аналізів, а нульові результати не звітуються, наступне незалежне дослідження має менше шансів відтворити саме опубліковану величину ефекту. На цьому рівні причинний механізм добре зрозумілий із статистичних симуляцій та метанаукових моделей.
Проте «реплікаційна криза виникла через p-hacking» — надто сильне узагальнення. Реплікованість залежить також від потужності, точності оцінок, дизайну, контексту, якості вимірювання, теоретичної специфікації, гетерогенності ефектів, помилок і випадкової варіативності. Відкрита наука відповіла на проблему цілим набором реформ — пререєстрацією, Registered Reports, відкритими матеріалами, відкритим доступом до даних і коду, реплікаціями, змінами звітування й статистичної культури. Цю ширшу рамку описують Munafò et al., 2017 та сторінка Відкрита наука.
Тому коректний висновок звучить так: QRP можуть систематично послаблювати достовірність окремих результатів і видимого наукового корпусу, але масштаб їхнього внеску в конкретну літературу треба встановлювати емпірично, а невдала реплікація не дозволяє ретроспективно приписати первинним авторам конкретну сумнівну практику.
Що робити дослідникові, коли початковий план перестав бути придатним
Перший крок — змінити аналіз, якщо цього вимагає наука. Пререєстрація не повинна змушувати використовувати модель, яка очевидно порушує припущення, або зберігати помилковий код. Другий крок — зберегти слід рішення: що саме було заплановано, що змінилося, коли стало зрозуміло, що потрібна зміна, і чому новий підхід є кращим.
Третій крок — розділити статус результатів. Запланований основний аналіз можна показати разом із виправленим або альтернативним; новий аналіз назвати додатковим чи пошуковим; нову гіпотезу винести як основу для наступної перевірки. Якщо висновок однаковий у кількох розумних специфікаціях, це підсилює його стійкість. Якщо змінюється, саме ця залежність і є частиною наукового результату.
Четвертий крок — не приховувати «незручні» результати. Повнота не означає нескінченний додаток із кожною технічною спробою, але первинні результати, суттєві відхилення та аналізи, необхідні для розуміння основного висновку, мають бути доступними. APA JARS формалізують багато таких вимог для психологічних статей; див. Appelbaum et al., 2018.
Як читачеві не перетворити QRP на полювання на підозри
Метанаука потрібна для оцінювання процедур і доказів, а не для вгадування мотивів за фінальним числом. Розподіл p-values, нетипова зміна вибірки або розбіжність із пререєстрацією можуть бути сигналом для перевірки, але не автоматичним доказом недоброчесності конкретного автора. Статистичні методи виявлення p-hacking або publication bias мають власні припущення й помилки.
Найкраща позиція читача — конкретна: «у звіті не видно всіх результати», «критерій виключення з’явився після даних і змінив висновок», «первинний результат у реєстрації відрізняється від публікації без пояснення», «результат залежить від однієї специфікації». Такі твердження перевіряються. Фрази на кшталт «автори точно маніпулювали» потребують іншого рівня доказів.
Так само не варто вимагати пререєстрації від кожної форми дослідження або вважати пошуковий режим дослідження нижчим за підтверджувальний. Вони виконують різні функції. Якісна метанаука вибудовує інфраструктуру, у якій походження гіпотез, рішення, дані й обмеження стають достатньо видимими для правильної інтерпретації.
Питання і відповіді
Чи будь-яка зміна аналізу після перегляду даних є p-hacking?
Ні. Зміна може бути методологічно необхідною: наприклад, через помилку коду, порушення припущення або кращу модель. Ризик p-hacking виникає, коли результат впливає на вибір аналізу так, що зростає шанс бажаного висновку, а ця гнучкість не відображена прозоро. Коректна практика — пояснити зміну, показати її статус і, за можливості, перевірити стійкість.
Чи HARKing означає, що post hoc гіпотеза погана?
Ні. Post hoc гіпотеза може бути дуже цінною. HARKing стосується її подання як наперед сформульованої. Дані можуть породити нову ідею; для незалежного підтвердження цієї ідеї потрібні нові дані або інша незалежна перевірка. Саме це розрізнення лежить в основі терміна, введеного Kerr, 1998.
Чи p = .049 є доказом p-hacking?
Ні. Один p-value не містить історії аналітичних рішень. Він не показує, скільки моделей запускали, чи змінювали вибірку, які результати вимірювали та що було заплановано. Для оцінки потрібні протокол, дані, код, повнота звітування й ширший патерн. Так само p = .051 не є доказом відсутності ефекту.
Чи відсутність пререєстрації означає QRP?
Ні. Велика частина якісної науки створена без пререєстрації, а для деяких дизайнів вона має обмежену роль. Відсутність пререєстрації означає, що незалежному читачеві важче встановити, які рішення були прийняті до результатів. Якість тоді оцінюють за дизайном, прозорістю, повнотою звітування, робастністю й накопиченням доказів.
Чи пререєстрація гарантує відсутність p-hacking або HARKing?
Ні. Вона створює датований запис і зменшує неоднозначність, але може бути надто загальною, дослідник може відхилитися від неї, а слабкий план може бути пререєстрованим. Її ефект залежить від конкретності, доступності та чесного звітування відхилень.
Чи селективне звітування і публікаційне упередження — одне й те саме?
Ні. Селективне звітування часто означає, що всередині проведеного дослідження не всі результати або аналізи стають видимими. Публікаційне упередження стосується того, які дослідження або результати взагалі доходять до публічної літератури. Обидва механізми можуть створювати відсутні докази, але діють на різних рівнях.
Чи researcher degrees of freedom — це погано?
Ні. Ступені свободи дослідника є природним наслідком того, що реальні дані можна обробляти кількома обґрунтованими способами. Ризик виникає через приховану результат-залежну селекцію. Прозора специфікація, аналіз чутливості та пояснення альтернатив перетворюють гнучкість із джерела прихованого вибору на об’єкт наукової перевірки.
Чи QRP означає фабрикацію або фальсифікацію?
Ні. У цій статті QRP — ширша методологічна категорія сумнівних практик, тоді як фабрикація і фальсифікація мають окремий статус у системах академічної та дослідницької доброчесності. В Україні вони прямо визначені окремими видами порушень Законом «Про академічну доброчесність». Конкретна правова або дисциплінарна кваліфікація залежить від застосовної норми й фактичних обставин.
Чи сумнівні дослідницькі практики означають, що психології не можна довіряти?
Ні. Метанаукове дослідження QRP показало слабкі місця історичних практик і водночас спричинило розвиток інструментів самокорекції: пререєстрації, Registered Reports, стандартів звітування, відкритих матеріалів і коду, реплікацій та методів перевірки робастності. Правильний висновок полягає в оцінюванні конкретного дизайну й масиву доказів, а не в глобальному ярлику для всієї дисципліни.
Пов’язані статті
Пререєстрація дослідження: що фіксують до збору або аналізу даних і чого preregistration не гарантує
