Множинні порівняння: чому багато статистичних тестів підвищують ризик випадкових «значущих» результатів
Автор: Український психологічний ХАБ · Опубліковано: 23 вересня 2026 · Редакційна політика
Множинні порівняння — це ситуація, коли в одному дослідженні або в межах однієї логічно пов’язаної сім’ї перевіряють багато статистичних гіпотез. Кожен окремий тест може мати номінальний рівень помилки першого роду α = 0,05, але зі зростанням кількості шансів відхилити нульову гіпотезу зростає імовірність отримати хоча б один випадковий «значущий» результат. Саме тому multiplicity потрібно планувати на рівні дизайну та статистичного аналізу. FDA у настанові щодо множинних кінцевих точок прямо розглядає збільшення числа endpoint-ів як джерело ризику хибних висновків, якщо множинність належно не контролюється.
Коротка відповідь: якщо дослідник проводить багато тестів і готовий оголосити науково важливий результат, коли «спрацює» хоча б один із них, номінальні 5% для кожного тесту вже не означають 5% ризику хибнопозитивного висновку для всієї серії. Потрібно визначити, які гіпотези утворюють одну сім’ю, яку помилку потрібно контролювати, чи є аналіз підтверджувальним або дослідницьким, і заздалегідь обрати відповідну процедуру — наприклад Bonferroni, Holm, контроль FDR або спеціалізований метод для конкретного дизайну.
Що таке множинні порівняння
У широкому статистичному сенсі проблема множинних порівнянь, multiple comparisons або multiple testing, виникає тоді, коли одна дослідницька історія містить кілька можливостей отримати «позитивний» статистичний висновок. Це можуть бути десятки попарних порівнянь груп, кілька primary outcomes, багато підшкал одного опитувальника, повторні вимірювання в різні моменти часу, аналіз підгруп, серія кореляцій, різні моделі одного й того самого outcome або повторні проміжні аналізи.
Проблема полягає не в самій кількості чисел. Багато гіпотез можуть бути науково необхідними. Ризик виникає тоді, коли висновок роблять так, ніби кожна перевірка була єдиним шансом знайти ефект, хоча насправді таких шансів було багато.
У CONSORT-Outcomes 2022 multiplicity охоплює, зокрема, кілька primary або secondary outcomes, повторні часові точки, subgroup analyses та інші множинні аналізи. Cochrane Handbook окремо наголошує на множинності через кілька інструментів для одного outcome, кілька часових точок і кілька можливих аналізів та рекомендує визначати спосіб вибору наперед, незалежно від побачених результатів.
Науковий статус: усталений принцип, контекстне рішення
Інфляція помилки першого роду за множинного тестування є усталеним статистичним принципом. Дискусія стосується іншого: яку сукупність гіпотез вважати однією сім’єю, яку помилку контролювати, наскільки суворим має бути контроль і який метод найкраще відповідає науковій меті, залежності між тестами та наслідкам помилки.
Тому дві прості формули — «завжди діліть 0,05 на кількість усіх p-значень» і «корекції ніколи не потрібні» — однаково втрачають головне. Сучасний підхід починається з питання, яке рішення дослідник хоче обґрунтувати і скільки статистичних шляхів можуть привести до цього рішення.
Чому 5% перестає бути 5%
Уявімо, що всі нульові гіпотези істинні, тести незалежні, а кожен тест проводиться на рівні α = 0,05. Для одного тесту ймовірність не отримати хибнопозитивний результат дорівнює 0,95. Для m незалежних тестів імовірність не отримати жодного false positive дорівнює 0,95^m. Отже, імовірність хоча б одного випадкового «значущого» результату становить FWER = 1 − (1 − α)^m.
За цією ілюстративною моделлю при α = 0,05: 1 тест → 5,0%; 2 тести → 9,8%; 5 тестів → 22,6%; 10 тестів → 40,1%; 20 тестів → 64,2%; 50 тестів → 92,3% імовірності хоча б одного хибнопозитивного результату, якщо всі H0 істинні.
Ця формула є наочною ілюстрацією для незалежних тестів. У реальних психологічних даних outcomes, підшкали й часові точки часто корельовані, тому точне значення може бути іншим. Проте логіка зберігається: повторення можливостей для відхилення H0 змінює помилку всього процес статистичного висновку.
20 тестів не означають «один хибний результат обов’язково»
Іноді α = 0,05 пояснюють так: «з 20 тестів один буде значущим випадково». Це лише твердження про очікувану кількість помилок за спеціальних умов, а не обіцянка, що кожна серія з 20 тестів міститиме рівно один false positive. У конкретному наборі може не бути жодного, може бути один, а може бути кілька. Для контролю висновку часто важливіша ймовірність хоча б однієї помилки в сім’ї.
Що таке сім’я перевірок (family of tests)
Методи multiplicity control працюють не з абстрактною «кількістю тестів у статті», а з певною сім’єю гіпотез. Сім’я — це набір перевірок, об’єднаних одним підтверджувальним висновком або одним правилом прийняття рішення. Якщо дослідник має п’ять primary outcomes і вважає втручання успішним, коли значущим стане хоча б один із них, ці п’ять перевірок природно утворюють одну сім’ю.
Межу сім’ї варто визначати до перегляду результатів. Якщо після аналізу «незручні» тести виключити із сім’ї, а зручні залишити, заявлений error control вже не описує реальний процес відбору. Саме тому протокол, план статистичного аналізу і пререєстрація є частиною рішення, навіть якщо сама математична поправка проста.
Водночас не кожне p-значення в багаторічній програмі досліджень потрібно механічно включати в одну гігантську сім’ю. Окремі наукові питання можуть мати окремі families. Межа має випливати з наукового твердження і правила рішення, а не з бажаного результату.
Де multiplicity виникає в психології
У психологічних дослідженнях множинність часто розподілена по всій архітектурі аналізу, а не зібрана в одному блоці «post-hoc tests».
• Кілька outcomes: наприклад, тривога, депресивні симптоми, стрес, якість сну й функціонування аналізуються окремо.
• Кілька підшкал: загальний бал, когнітивна, емоційна й поведінкова підшкали створюють кілька можливостей для висновку.
• Кілька груп: чотири групи дають шість усіх можливих парних порівнянь; п’ять груп — десять.
• Кілька часових точок: результат перевіряють одразу після втручання, через місяць, три та шість місяців.
• Кілька підгруп: окремі аналізи за віком, статтю, початковою тяжкістю, типом лікування або іншими характеристиками.
• Кілька аналітичних специфікацій: моделі з різними коваріатами, правилами обробки пропусків, трансформаціями, порогами або виключеннями.
• Кілька кореляцій або предикторів: матриця з десятками змінних швидко створює сотні перевірок. Сам коефіцієнт кореляції Спірмена не «вирішує» multiplicity; якщо дослідник перевіряє багато кореляцій, потрібно окремо продумати family-wise inference.
• Проміжні аналізи та optional stopping: повторне тестування тієї самої гіпотези в міру накопичення даних також створює множинність і потребує спеціальних sequential methods, якщо рішення про зупинку залежить від результатів.
Множинні порівняння і p-hacking — не те саме
Заплановане множинне тестування саме по собі не є p-hacking і не є дослідницьким порушенням. Дослідження може мати багато outcomes із наукової причини, відкрито повідомляти їх усі й застосовувати заздалегідь визначений спосіб контролю помилки.
p-hacking стосується результат-залежної аналітичної гнучкості: спроб багатьох варіантів аналізу, зупинки, виключення учасників, трансформацій або outcomes із вибірковим акцентом на тих рішеннях, які дали бажане p. Класична робота Simmons, Nelson і Simonsohn показала, як нерозкрита гнучкість збору й аналізу даних може різко збільшувати частоту false-positive findings.
Отже, корекція на заздалегідь визначені 20 тестів не виправляє прихований процес, у якому дослідник фактично спробував 100 аналітичних маршрутів і повідомив лише найзручніші. Multiplicity correction і transparency вирішують пов’язані, але різні проблеми.
FWER: контроль хоча б однієї помилки в сім’ї
Family-wise error rate, FWER, — це ймовірність зробити принаймні одну помилку першого роду серед істинних нульових гіпотез у визначеній сім’ї. Такий критерій є суворим: навіть один false positive у сім’ї рахується помилкою family-wise inference.
FWER особливо логічний у підтверджувальному аналізі, де кожне окреме позитивне твердження може мати серйозні наслідки або де достатньо одного хибного відхилення, щоб загальний висновок став оманливим.
Bonferroni: простий і надійний базовий контроль
Поправка Bonferroni встановлює для кожного з m тестів поріг α/m або, еквівалентно, множить кожне необроблене p-значення на m з обмеженням максимум 1. Якщо загальний α = 0,05 і є 10 тестів, індивідуальний поріг стає 0,005.
Перевага Bonferroni — простота й сильний контроль FWER без необхідності припускати незалежність усіх тестів. Класична робота Dunn про множинні порівняння є одним із фундаментальних джерел для simultaneous inference у цій традиції.
Обмеження — втрата потужності. Коли тестів багато, поріг стає дуже суворим, тому зростає ризик не виявити реальні ефекти. Це не означає, що Bonferroni «поганий»; це означає, що його ціль — суворо захищати від хоча б одного false positive, а ціна такого захисту може бути високою.
Holm: послідовний контроль FWER
Процедура Holm — step-down метод. P-значення впорядковують від найменшого до найбільшого і послідовно порівнюють із порогами α/m, α/(m−1), α/(m−2) і так далі. Якщо на певному кроці умова не виконується, подальші відхилення зупиняються за правилом процедури.
Оригінальна стаття Sture Holm 1979 року показала послідовно відхиляючу multiple-test procedure із контролем помилки першого роду для будь-якої конфігурації істинних гіпотез. У багатьох загальних задачах Holm є природнішою заміною простому Bonferroni, тому що зберігає сильний FWER control і зазвичай не є більш консервативним за одночасне α/m для всіх тестів.
FDR: інша ціль для великої кількості відкриттів
Коли тестів дуже багато і наукова задача орієнтована на виявлення множини потенційних сигналів, контроль «жодного false positive» може бути надто жорстким. Інша ціль — false discovery rate, FDR: очікувана частка хибних відхилень серед усіх відхилених гіпотез за відповідним формальним визначенням.
Метод Benjamini–Hochberg був запропонований як практичний і потужніший підхід до multiple testing, який контролює FDR замість FWER. Це інший контракт із помилкою: дослідник допускає, що серед великої кількості «відкриттів» може бути певна частка хибних, але контролює її очікуваний рівень.
FDR не є «м’якшим Bonferroni» в сенсі тієї самої гарантії. Він контролює іншу величину. Вибір між FWER і FDR має випливати з мети: підтверджувальне твердження про кілька ключових ефектів і високовимірний скринінг — це різні режими статистичного висновку.
Залежність між тестами має значення
Оригінальна процедура Benjamini–Hochberg має умови щодо структури залежності; для довільної залежності існують інші варіанти й модифікації. Так само спеціалізовані multiple-comparison procedures можуть використовувати кореляції між оцінками ефектів і бути ефективнішими за грубий Bonferroni. Тому вибір методу не варто зводити до меню «Bonferroni або нічого».
Спеціалізовані процедури: Tukey, Dunnett, hierarchical testing
Якщо наукове питання має конкретну структуру, краще використовувати метод, створений саме для неї. Tukey HSD застосовують для family-wise контролю всіх попарних порівнянь середніх після відповідної ANOVA-моделі. Dunnett-процедури корисні, коли кілька груп порівнюють із одним контролем. Hierarchical або gatekeeping procedures дають змогу тестувати гіпотези в наперед визначеному порядку, передаючи α далі лише після виконання певних умов.
Такі методи не універсальні, але вони показують важливий принцип: краща multiplicity strategy використовує структуру наукового питання, а не лише кількість рядків у таблиці.
Чи достатньо спочатку зробити ANOVA
Omnibus ANOVA відповідає на запитання, чи сумісні дані з нульовою моделлю рівності всіх відповідних середніх у межах заданого дизайну. Вона не вказує автоматично, які саме пари різняться, і сама по собі не робить будь-яку подальшу довільну серію t-тестів безпечною.
Якщо після omnibus test плануються попарні порівняння, потрібна процедура, що відповідає конкретному набору contrasts і правилам висновку. У деяких designs попередній omnibus test є частиною ієрархічної стратегії; в інших спеціалізоване multiple-comparison procedure контролює потрібну помилку без обов’язкової вимоги «спочатку значущий ANOVA, потім усе інше».
Коли корекція потрібна, а коли питання складніше
Найчіткіша потреба у multiplicity control виникає в confirmatory analysis, коли кілька гіпотез можуть привести до одного позитивного висновку і дослідник хоче заявляти контрольовану частоту помилки першого роду. FDA guidance детально описує саме такі ситуації для multiple endpoints у клінічних випробуваннях.
Для exploratory analysis мета може бути іншою: побудувати карту можливих сигналів для подальшої перевірки. Тут іноді доречні FDR-процедури, descriptive emphasis або навіть необроблені оцінки за умови повного звітування й чіткого маркування як exploratory. Але «exploratory» не означає, що номінальні p < 0,05 можна подавати як підтверджені відкриття без урахування кількості пошуків.
Є також co-primary endpoints, де для успіху потрібно, щоб критерій виконали всі ключові outcomes. Така логіка відрізняється від сценарію «достатньо хоча б одного». Multiplicity strategy залежить від самого правила успіху, а не лише від числа endpoint-ів.
Для secondary outcomes іноді обирають ієрархічне тестування, іноді multiplicity adjustment, іноді descriptive/exploratory interpretation. Критично важливо заздалегідь пояснити, які claims confirmatory, які exploratory і яка error rate контролюється.
Множинність — це не тільки p-значення
Проблема multiplicity стосується всієї системи висновку. Якщо дослідник будує багато окремих 95% confidence intervals і потім читає їх як одночасну 95% гарантію для всього набору параметрів, це теж помилка. Для одночасного одночасне статистичне покриття існують simultaneous confidence intervals та інші методи.
Розмір ефекту також не скасовує множинність. Якщо з десятків ефектів показати лише найбільший, його величина буде схильна до selection bias і winner’s curse. Потрібні повне звітування, інтервали невизначеності та розрізнення confirmatory від exploratory selection.
ASA statement on p-values наголошує, що наукові висновки не повинні ґрунтуватися лише на проходженні порога p, а p-значення саме по собі не вимірює важливість ефекту й не дає ймовірність істинності гіпотези. Multiplicity робить цю вимогу ще важливішою.
Ціна корекції: статистична потужність
Суворіший контроль false positives зазвичай має ціну: складніше відхилити H0, тому за незмінних effect size і sample size може знижуватися power. Саме тому дизайн дослідження і планування вибірки мають враховувати multiplicity до збору даних.
Найгірша стратегія — створити десятки рівноправних confirmatory tests у невеликій вибірці, а потім сподіватися, що одна з корекцій «врятує» аналіз. Часто краще звузити primary questions, використати науково обґрунтовану ієрархію, спроєктувати відповідну модель і забезпечити вибірку для заявленої inferential strategy.
Приклад: 8 outcomes × 3 часові точки
Уявімо психологічне втручання, де вимірюють 8 outcomes у трьох часових точках після рандомізації. Просте окреме тестування кожної комбінації створює 24 можливості отримати p < 0,05. Якщо всі 24 null hypotheses істинні й тести умовно незалежні, імовірність хоча б одного false positive становила б приблизно 70,8%: 1 − 0,95^24.
Сильніший дизайн може мати один чітко визначений primary outcome в головній часовій точці, кілька заздалегідь визначених secondary confirmatory outcomes із Holm або іншою відповідною procedure, а решту результатів — як exploratory з повним звітуванням effect sizes та uncertainty. Це не єдино можливий дизайн, але він показує, як наукове питання скорочує кількість довільних шляхів до висновку.
Множинні outcomes у психічному здоров’ї: що показують сучасні дані
Проблема має безпосереднє значення для психології та mental health research. У методологічному систематичному огляді Stringer та співавторів 2024 року було проаналізовано 147 пізньофазових mental health trials. У 33 дослідженнях були multiple primary outcomes; у більшості з них multiplicity не була належно скоригована за описаними критеріями огляду. Автори підкреслили потребу або застосовувати multiplicity strategy, або чітко описувати інший спосіб роботи з множинністю.
Раніший огляд Vickerstaff та співавторів у neurology та psychiatry trials також показав, що multiple primary outcomes були поширеними, а корекції застосовувалися непослідовно. Це не доводить, що кожен некоригований secondary outcome є «неправильним», але показує реальну проблему нечіткої архітектури підтверджувальне твердженняs.
Як multiplicity пов’язана з вибірковим звітуванням
Коли дослідження містить багато outcomes, часових точок і моделей, а публікація показує лише частину з них, читач не бачить повну кількість шансів отримати привабливий результат. Через це навіть формально правильне p-значення окремого тесту може створювати оманливе враження сили доказу.
Cochrane Handbook рекомендує заздалегідь визначати, як обиратимуть outcome або measure серед кількох можливих варіантів, і робити вибір незалежно від результату. CONSORT-Outcomes також вимагає описувати способи роботи з multiplicity та відрізняти prespecified analyses від непередбачених.
Пререєстрація сама по собі не гарантує якісного дослідження, але вона робить family definition, primary outcomes, план аналізу і відхилення від плану видимішими. Це суттєво полегшує інтерпретацію множинних перевірок.
Як планувати множинні порівняння до збору даних
Практичний план складається з кількох послідовних рішень.
1. Сформулюйте primary scientific claims. Не починайте з переліку тестів; почніть із того, які твердження дослідження має право підтверджувати.
2. Визначте family або families. Поясніть, які гіпотези разом створюють один шанс заявити успіх.
3. Встановіть error criterion. FWER, FDR або інший підхід повинні відповідати наслідкам false positive і типу дослідження.
4. Виберіть procedure до перегляду результатів. Bonferroni, Holm, Tukey, Dunnett, hierarchical testing, FDR або інший метод має відповідати структурі гіпотез.
5. Врахуйте залежність і power. Корельовані outcomes, repeated measures та складні моделі можуть вимагати спеціалізованих методів і іншого планування розміру вибірки.
6. Зафіксуйте primary, secondary та exploratory analyses. Межі між ними мають бути видимими в протокол або план аналізу.
7. Звітуйте всі релевантні результати. Показуйте effect sizes, uncertainty, raw та/або скориговані p-значення відповідно до обраної процедури й правила інтерпретації.
Як читати дослідження з великою кількістю p-значень
Коли ви бачите таблицю з десятками p-значень, перше питання має бути не «де p < 0,05?», а «скільки можливостей було знайти значущий результат і які з них були primary?».
Перевірте: чи були гіпотези prespecified; скільки outcomes і часові точки аналізували; чи були subgroup analyses; чи вказано family; чи описано multiplicity adjustment; чи наведено скориговані p-значення або simultaneous intervals; чи всі заплановані outcomes повідомлено; чи exploratory results відокремлено від confirmatory; чи показано effect sizes і uncertainty.
Якщо автори пишуть «було проведено 30 тестів, три дали p < 0,05», але не пояснюють, чому саме ці три вважаються підтвердженням гіпотези і як працює family-wise error, висновок потребує суттєво більшої обережності.
Типові помилки інтерпретації
Помилка 1. «Кожен тест має α = 0,05, отже весь експеримент має 5% false-positive risk». Це справедливо лише для окремого тесту в його моделі, а не автоматично для сім’ї.
Помилка 2. «Bonferroni завжди обов’язковий». Ні. Він є одним із методів FWER control. Для деяких задач Holm, Tukey, Dunnett, hierarchical procedures, permutation approaches або FDR можуть бути доречнішими.
Помилка 3. «Значущий omnibus ANOVA дозволяє без корекції перевірити всі пари». Ні. Подальші contrasts мають власну структуру статистичного висновку.
Помилка 4. «Якщо outcomes корельовані, проблеми множинності немає». Кореляція змінює точну величину помилки і може бути використана спеціалізованими методами, але багато можливостей для позитивного висновку не зникають автоматично.
Помилка 5. «FDR = імовірність, що конкретна значуща знахідка хибна». Ні. FDR є властивістю процедури та множини відхилень у повторюваному або модельному сенсі, а не posterior probability для конкретної гіпотези.
Помилка 6. «Після корекції p > 0,05 означає відсутність ефекту». Ні. Невідхилення H0 не доводить нульовий ефект. Потрібні effect estimate, uncertainty, power/precision і контекст.
Помилка 7. «Корекція робить дослідження валідним». Ні. Вона не виправляє confounding, measurement error, biased sampling, слабку операціоналізацію, selective reporting або невдалий дизайн. Множинність — лише один компонент доказовості.
Множинні порівняння, психометрія і психологічне вимірювання
У психометрії multiplicity виникає, коли дослідник перевіряє багато item-level associations, підшкал, груп, DIF-порівнянь, факторних варіантів або зовнішніх критеріїв. Проте психометрична якість інструмента не зводиться до набору p-значень. Психометрія оцінює ширшу систему вимірювання: reliability, validity evidence, measurement error, fairness, structure та intended use.
Навіть бездоганна поправка на множинність не доводить construct validity і не перетворює випадкову кореляцію на причинний механізм. Так само один «значущий» скринінгова асоціація не є діагнозом і не встановлює clinical utility. Для психологічних і клінічних рішень потрібно розділяти statistical evidence, measurement quality та substantive interpretation.
Практичне правило для дослідника
Перед тим як натиснути «run» для десятка тестів, сформулюйте одне речення: «Який саме позитивний висновок я зроблю, якщо один або кілька з цих тестів стануть значущими?» Якщо кілька тестів можуть привести до того самого підтверджувальне твердження, це сильний сигнал, що їх потрібно розглядати разом і планувати multiplicity control.
Якщо ж аналіз є відкрито exploratory, мета інша: не оголосити доведений ефект, а знайти кандидати для подальшої перевірки. Тоді корисні повне звітування, FDR або інші discovery-oriented methods, effect sizes, uncertainty та незалежна реплікація.
FAQ
Що таке проблема множинних порівнянь простими словами?
Що більше статистичних «спроб» знайти значущий результат, то більше шансів, що принаймні одна спроба випадково дасть p нижче порога. Якщо потім показати лише цей результат як підтвердження гіпотези, ризик хибного висновку буде вищим за заявлений для одного тесту.
Скільки тестів уже вважається «багато»?
Універсального числа немає. Навіть два тести змінюють family-wise error. Практична важливість залежить від правила висновку, α, залежності між тестами, confirmatory або exploratory status і наслідків false positive.
Чи треба коригувати абсолютно всі p-значення в статті разом?
Ні. Корекція має стосуватися обґрунтованої family of hypotheses. Різні незалежні scientific claims можуть утворювати різні families. Але межі не варто визначати після перегляду результатів.
Що краще: Bonferroni чи Holm?
Для загального FWER control Holm часто є привабливішим, бо зберігає сильний контроль і зазвичай має не меншу потужність, ніж простий Bonferroni. Але вибір залежить від дизайну; для pairwise comparisons, одного контролю проти кількох груп або структурованих endpoints можуть бути кращі спеціалізовані procedures.
Коли використовують Benjamini–Hochberg?
Коли основна задача — працювати з великою кількістю потенційних відкриттів і контролювати false discovery rate, а не probability of any false positive. Це типовий пошуковій задачі, але метод має власні умови й не дає тієї самої гарантії, що FWER procedures.
Чи вирішує ANOVA проблему множинних порівнянь?
Omnibus ANOVA контролює помилку для свого глобального тесту, але не дає автоматичного дозволу на необмежену кількість некоригованих post-hoc comparisons. Подальші contrasts потребують відповідної процедури.
Чи можна просто повідомити всі необроблені p-значення?
Для прозорого exploratory analysis некориговані p-значення можуть бути корисними, якщо читач бачить повний набір аналізів і результати не подаються як confirmatory evidence із 5% family-wise error. Для підтверджувальних claims потрібна strategy, узгоджена з multiplicity.
Чи означає adjusted p > 0,05, що ефекту немає?
Ні. Це означає, що за обраною процедурою дані не дали підстав відхилити відповідну H0 на заданому рівні. Величина ефекту, confidence interval, precision, power і змістова важливість залишаються окремими питаннями.
Чи може корекція на множинність виправити p-hacking?
Не повністю. Якщо реальна кількість спроб, виключень, моделей або outcomes прихована, корекція лише видимого набору тестів не відтворює фактичний процес відбору. Потрібні transparency, prespecification і повне звітування.
