Помилка першого роду: що означає Type I error і як пов’язана з α та множинними тестами
Автор: Український психологічний ХАБ · Опубліковано: 23 вересня 2026 · Редакційна політика
Помилка першого роду (Type I error, α error) — це помилкове відхилення нульової гіпотези H₀ у ситуації, коли H₀ насправді істинна. У класичній частотній теорії перевірки гіпотез дослідник заздалегідь задає правило рішення так, щоб імовірність такого хибного відхилення за H₀ була обмежена обраним рівнем α. Саме ця логіка лежить у традиції Неймана—Пірсона: α описує властивість процедури перевірки в повторюваних застосуваннях, а не ймовірність того, що конкретна вже отримана «значуща» знахідка є помилковою.
Коротка відповідь: якщо α = 0,05 і тест коректно спроєктований та застосований за своїми припущеннями, то при повторенні тієї самої процедури в ситуаціях, де H₀ істинна, вона відхилятиметься помилково приблизно у 5% випадків або не частіше за 5% — залежно від конкретного тесту. Це не означає, що після p < 0,05 існує «5% імовірності, що H₀ істинна», і не означає, що «95% значущих результатів правдиві». ASA та сучасні методологічні огляди прямо застерігають від такого перевертання умовної ймовірності.
Що таке помилка першого роду
Перевірка статистичної гіпотези створює правило дії. Є нульова гіпотеза H₀, дані, тестова статистика, критична область або еквівалентне правило через p-значення, і наперед обраний рівень α. Після спостереження даних процедура або відхиляє H₀, або не відхиляє її. Якщо H₀ істинна і ми її відхилили, це помилка першого роду. Якщо H₀ істинна і ми її не відхилили, рішення щодо цього типу помилки правильне. Якщо H₀ хибна і ми її відхилили, відхилення не є помилкою першого роду. Якщо H₀ хибна, але процедура її не відхилила, виникає помилка другого роду за відповідно визначеної альтернативи.
Тому Type I error — це не синонім будь-якого «поганого результату» і не синонім невдалої реплікації. Це конкретна подія всередині формалізованої процедури статистичного рішення. NIST Engineering Statistics Handbook описує рівень значущості як ризик відхилити H₀, коли вона істинна. Ключове слово тут — «коли»: α є умовною імовірністю помилкового відхилення за припущення, що H₀ та інші умови моделі справджуються.
Чому часто кажуть «хибнопозитивний результат»
У прикладних текстах помилку першого роду часто називають false positive — хибнопозитивним висновком. Аналогія зручна: процедура сигналізує про ефект, різницю або асоціацію, хоча в межах сформульованої H₀ такого відхилення не повинно бути. Але слово «позитивний» тут означає статистичне рішення «відхилити H₀», а не медичний діагноз, не позитивний скринінговий тест і не автоматичне твердження, що «ефекту в реальності немає». Саме формулювання H₀ визначає, що вважатиметься помилкою першого роду.
Що означає α і чому її задають до аналізу
Рівень значущості α — це межа ризику помилки першого роду, яку закладають у процедуру до того, як результат стане відомим. Якщо для двобічного тесту обрано α = 0,05, критичну область визначають так, щоб за H₀ і за коректних припущень тесту частота потрапляння в область відхилення відповідала заданому рівню. У симетричному двобічному тесті 0,05 часто розподіляють як 0,025 у кожен хвіст. Для однобічного тесту весь допустимий рівень помилки спрямований в один наперед визначений бік.
Важливе технічне уточнення: «номінальна α = 0,05» і фактична частота помилки не завжди буквально однакові. У дискретних тестах реальна ймовірність відхилення за H₀ може бути нижчою за номінальну. В асимптотичних тестах вона може лише наближатися до номінальної. За порушення припущень, результат-залежного вибору аналізу, багаторазового підглядання в дані або прихованої множинності фактичний ризик може перевищити заявлений. Отже, α — гарантія лише тієї процедури, для якої її математично або симуляційно обґрунтовано.
Проста і складена нульова гіпотеза
Для простої H₀ можна говорити про ймовірність відхилення в одному конкретному стані параметра. Для складеної H₀ можливі багато значень параметра, сумісних із нульовою гіпотезою. Тоді «розмір тесту» формально пов’язують із найбільшою ймовірністю відхилення серед допустимих станів H₀. Через це коректніше казати, що процедура контролює Type I error на рівні α або нижче, а не механічно прирівнювати кожну реальну ситуацію до рівно 5,000%.
α і p-значення — різні речі
α задають до аналізу; p-значення обчислюють із даних. α є елементом правила рішення, p є результатом конкретної вибірки. У типовому NHST-рішенні H₀ відхиляють, коли p ≤ α. Greenland та співавтори наголошують, що ця різниця принципова: поріг α має бути частиною плану, тоді як p невідоме до аналізу і показує, наскільки спостережувані дані сумісні з тестовою моделлю в її умовному частотному сенсі.
P-значення — це не «ймовірність помилки першого роду в цьому дослідженні». Якщо отримано p = 0,032 при α = 0,05, не випливає, що шанс Type I error дорівнює 3,2%. P описує ймовірність отримати дані або тестову статистику щонайменше настільки несумісні з H₀, як спостережені, за умов H₀ та моделі. α описує частоту помилкового відхилення, яку дозволяє правило рішення в повторюваних застосуваннях.
Чому p ≤ 0,05 не означає «95% імовірності, що ефект справжній»
Це одна з найстійкіших статистичних помилок. Заява ASA про p-значення прямо зазначає: p не вимірює ймовірність того, що досліджувана гіпотеза істинна, і не вимірює ймовірність того, що дані виникли «лише випадково». Частотний тест обчислює ймовірність даних за моделлю; він не перетворює цю величину на ймовірність самої гіпотези без додаткової ймовірнісної моделі для гіпотез.
Через це з α = 0,05 не можна вивести частку хибних висновків серед усіх опублікованих «значущих» результатів. Для такого питання важливі частота правдивих і хибних гіпотез у досліджуваній області, потужність тестів, вибіркова публікація, множинність, дизайн, якість вимірювання, упередження та інші компоненти процесу. Type I error rate є властивістю процедури за H₀; positive predictive value наукової літератури — інше питання.
Чому α = 0,05 — конвенція, а не закон природи
Поріг 0,05 історично став поширеною конвенцією, але математична теорія не робить його універсально правильним для кожного дослідження. Ціна хибнопозитивного висновку може бути дуже різною: від тимчасової помилки в ранньому exploratory-аналізі до рішення з великими клінічними, фінансовими або регуляторними наслідками. Тому α має випливати з мети, допустимого ризику, структури рішення, планованої потужності та можливостей вибірки.
У статті «Justify your alpha» Lakens та співавтори пропонують не замінювати один універсальний поріг іншим, а обґрунтовувати вибір α прозоро. Це добре відбиває сучасний методологічний статус: поняття Type I error і контроль помилки є усталеними; універсальність конкретного порога 0,05 — конвенційна практика, а не доказана природна межа.
Однобічний і двобічний тест: куди «витрачається» α
У двобічному тесті дослідника цікавлять відхилення в обидва боки від H₀. У симетричному випадку α = 0,05 зазвичай означає по 0,025 у кожному хвості розподілу тестової статистики. В однобічному тесті всі 0,05 можуть бути зосереджені в одному наперед визначеному напрямку. Через це однобічний тест має більшу потужність для ефекту саме в обраному напрямку, але не дає права після перегляду даних вирішити, який напрямок було «передбачено».
Якщо дослідник спочатку допускає обидва напрямки, а потім після отримання результату вибирає вигідний однобічний тест, він змінює процедуру на основі даних. Номінальна α вже не описує весь процес вибору. Загальний принцип той самий, що й у множинному тестуванні: кожна нерозкрита додаткова можливість отримати бажане рішення повинна бути врахована в error control.
Помилка першого і другого роду: α, β та статистична потужність
Помилка першого роду і помилка другого роду є різними ризиками. Type I error: H₀ істинна, але її відхилили. Type II error: H₀ хибна щодо конкретної альтернативи, але її не відхилили. Імовірність помилки другого роду позначають β, а потужність тесту для заданої альтернативи дорівнює 1 − β. Потужність відповідає на питання, як часто процедура правильно відхилятиме H₀ за певного реального ефекту, розміру вибірки, варіативності й обраного α.
За незмінної вибірки та моделі зниження α зазвичай зменшує ризик помилки першого роду, але робить відхилення H₀ складнішим і може підвищити β, тобто знизити потужність. Саме тому «просто поставити α = 0,001» не є безкоштовним поліпшенням. Сильний дизайн узгоджує допустимі помилки, мінімально важливий ефект, потрібну точність і розмір вибірки до збору даних.
Множинні тести: як локальна α перетворюється на сімейний ризик
Номінальні 5% стосуються однієї визначеної процедури, а не будь-якої кількості шансів знайти p < 0,05. Якщо перевірити m незалежних гіпотез на рівні α і всі H₀ істинні, то ймовірність хоча б одного хибного відхилення дорівнює 1 − (1 − α)^m. За α = 0,05 для 10 незалежних тестів це приблизно 40,1%, а для 20 — приблизно 64,2%. За корельованих тестів точне число буде іншим, але множинність можливостей для позитивного висновку не зникає.
Регуляторна настанова FDA щодо множинних кінцевих точок описує цю проблему саме як ризик помилкових висновків, коли кілька endpoint-ів можуть привести до заяви про ефективність. У статистиці й психологічних дослідженнях аналогічна логіка виникає за кількох outcomes, підшкал, часових точок, груп, підгруп, кореляцій, моделей або повторних перевірок тих самих даних.
FWER, Bonferroni і Holm
Family-wise error rate (FWER) — імовірність хоча б однієї помилки першого роду в заданій сім’ї гіпотез. Найпростіший контроль — Bonferroni: якщо загальний сімейний рівень α = 0,05 і є 10 тестів, кожен порівнюють із 0,005. Це дає контроль FWER без вимоги незалежності тестів, але може бути консервативним. Послідовна процедура Holm також контролює FWER і зазвичай має не меншу потужність, ніж однаковий поріг Bonferroni для всіх тестів.
FDR — інша величина
False discovery rate не є іншою назвою α або FWER. У класичній процедурі Benjamini—Hochberg ціллю є контроль очікуваної частки хибних відхилень серед усіх відхилених гіпотез за відповідних умов. Це інший статистичний контракт: FWER захищає від самого факту хоча б одного false positive у сім’ї, FDR допускає множину відкриттів із контрольованою часткою хибних серед них. Повний розбір family definition, Bonferroni, Holm, FDR та спеціалізованих процедур є в статті «Множинні порівняння».
Коли номінальна α перестає контролювати реальний процес
Формально коректний поріг не захищає від процедур, яких не було враховано в плані. Якщо дослідник випробував багато outcomes, коваріат, критеріїв виключення, трансформацій, моментів зупинки або моделей, а потім повідомив лише варіант із найменшим p, фактична процедура включає весь цей простір пошуку. Номінальна α окремого фінального тесту не контролює помилку всього процесу відбору.
Класична робота Simmons, Nelson і Simonsohn показала на симуляціях і експериментах, що нерозкрита гнучкість у збиранні та аналізі даних може суттєво підвищувати частоту false-positive findings у психології. Це не означає, що кожне аналітичне рішення є p-hacking. Воно означає, що Type I error control стосується повного правила, за яким дослідник переходить від даних до заявленого висновку.
Optional stopping і повторне «підглядання»
Якщо після кожних кількох учасників запускати звичайний тест і зупиняти збір щойно p стане нижчим за 0,05, кількість шансів відхилити H₀ зростає. Стандартний фіксований тест не зберігає свою номінальну гарантію за довільного результат-залежного stopping rule. Для запланованих проміжних аналізів існують group-sequential designs, alpha-spending та інші процедури, які включають повторні погляди на дані в єдине правило контролю помилки.
Модельні припущення і фактична Type I error
Навіть без множинності тест може бути антиконсервативним, якщо його математичні умови не відповідають даним. Залежність спостережень, неправильно змодельована дисперсія, сильна невідповідність розподілу за малої вибірки, помилкова одиниця аналізу або data-dependent model selection можуть змінити розподіл тестової статистики під H₀. Тому «α = 0,05» є властивістю процедури разом із її припущеннями, а не магічною властивістю числа 0,05.
Type I error і хибнопозитивний скринінг — не те саме
У психодіагностиці й медицині «false positive» часто означає, що тест класифікував людину як позитивну щодо стану, якого за еталонним критерієм немає. Це задача класифікації й діагностичної точності, де працюють sensitivity, specificity, predictive values, likelihood ratios, prevalence та cutoff. Type I error у NHST — це помилкове відхилення статистичної H₀. Іноді обидві події інтуїтивно називають хибнопозитивними, але їхні знаменники, умовні ймовірності та практичні наслідки різні.
Тому α = 0,05 не означає, що психологічний скринер має 5% false-positive rate, а specificity 95%. Так само p < 0,05 у груповому дослідженні не є діагнозом для окремої людини. Скринінг, case-finding, клінічна оцінка, діагноз і статистичне тестування гіпотез належать до різних рівнів висновку. Один score або один cutoff не встановлює клінічний розлад.
Помилка першого роду в психології та психометрії
У психології Type I error виникає далеко не лише в простому t-тесті. В експерименті це може бути помилковий висновок про ефект маніпуляції. У регресії — хибне відхилення H₀ для коефіцієнта. У психометрії — хибний висновок щодо окремого item parameter, loading, DIF-ефекту, порушення invariance, зовнішньої асоціації або різниці груп. Коли таких перевірок багато, питання multiplicity стає частиною психометричного дизайну.
Проте коректний контроль α не доводить якість вимірювання. Статистично значущий loading не встановлює construct validity; відсутність значущого DIF не доводить повну fairness; p > 0,05 у тесті invariance не гарантує еквівалентність вимірювання; переклад інструмента не стає валідованою культурною адаптацією через набір незначущих тестів. Психометрія оцінює ширшу систему доказів — структуру, надійність, валідність, похибку вимірювання, invariance, fairness, норми й відповідність intended use.
α, довірчі інтервали та розмір ефекту
Для багатьох стандартних двобічних процедур тест H₀ на рівні α = 0,05 і відповідний 95% довірчий інтервал пов’язані: значення параметра, яке лежить за межами інтервалу, буде відхилене узгодженим тестом на 5% рівні. Але ця відповідність потребує того самого статистичного методу, тих самих припущень і того самого способу роботи з множинністю. За множинних порівнянь окремі 95% інтервали не перетворюються автоматично на 95% одночасне покриття всієї сім’ї.
Довірчий інтервал переносить увагу з бінарного «пройшло/не пройшло 0,05» на оцінку величини та невизначеності. Це особливо важливо, бо ASA підкреслює: статистична значущість не вимірює розмір ефекту або практичну важливість. Докладніше про частотне тлумачення 95% CI див. «Довірчий інтервал: що означає 95% CI».
Приклад: що реально означає α = 0,05
Уявімо ідеально спроєктований експеримент, у якому H₀ справді істинна, а процедура має точний рівень α = 0,05. Якщо незалежно повторити цей самий дизайн дуже багато разів і щоразу застосовувати те саме заздалегідь визначене правило, приблизно 5% серій дадуть відхилення H₀ лише через випадкову варіацію, передбачену моделлю. На 10 000 повторень очікуване число таких відхилень буде близько 500, але конкретна кількість випадково коливатиметься.
Тепер візьмемо один із цих експериментів, де отримано p = 0,03. Для вже здійсненого світу H₀ або істинна, або хибна. Якщо вона істинна, відхилення є Type I error; якщо хибна, це не Type I error. Частотна α не каже, з якою posterior probability ми перебуваємо в першому випадку. Саме тому вислів «p = 0,03 означає 3% шанс, що результат випадковий» статистично неправильний.
Як планувати α до збору даних
1. Сформулювати H₀ і науковий висновок
Спочатку потрібно визначити не «який тест запустити», а яке твердження дослідження має право зробити. H₀ повинна бути пов’язана з параметром або моделлю, а правило відхилення — з конкретним науковим рішенням. Розпливчасте «перевіримо, чи щось значуще» створює множину невидимих шансів знайти результат.
2. Обґрунтувати α
Рівень α обирають з урахуванням наслідків false positive, типу дослідження, регуляторного або наукового контексту, очікуваної кількості перевірок і доступної вибірки. 0,05 може бути обґрунтованим вибором, але сам факт традиції не є достатнім поясненням у дослідженні з високою ціною помилки.
3. Визначити одно- чи двобічне правило до даних
Напрямок альтернативи задають на етапі дизайну. Однобічний тест має сенс, коли протилежний напрямок не приведе до того самого позитивного claim і це рішення обґрунтоване змістовно. Вибір однобічності після перегляду ефекту руйнує заявлену помилкову частоту.
4. Визначити сім’ї гіпотез і multiplicity strategy
Якщо до одного підтверджувального висновку можуть привести кілька тестів, потрібно визначити їхню family та спосіб error control. Для одних задач потрібен FWER, для інших FDR, ієрархічне тестування, gatekeeping або спеціалізована процедура. Межу сім’ї формують наукова логіка й правило рішення, а не бажання зробити p меншим після аналізу.
5. Узгодити α з power і розміром вибірки
Жорсткіший поріг за незмінного n знижує шанси виявити реальний малий ефект. Тому α, мінімально важливий ефект, потужність, дисперсія, дизайн і sample size планують разом. Інакше дослідження може одночасно мати низький false-positive risk і дуже слабку здатність дати інформативний результат.
6. Заздалегідь описати stopping rule і аналітичну гнучкість
Проміжні аналізи, правила зупинки, виключення учасників, handling missing data, ковариати й альтернативні моделі мають бути або наперед визначені, або прозоро марковані як exploratory. Пререєстрація не робить дизайн автоматично хорошим, але робить реальне правило прийняття рішень видимішим.
7. Звітувати не лише «p < 0,05»
Для інтерпретації потрібні точне p, оцінка ефекту, інтервал невизначеності, опис усіх relevant analyses, multiplicity strategy, відхилення від плану та substantive context. Wasserstein, Schirm і Lazar радять рухатися від механічного порогового мислення до прозорого подання невизначеності та якості доказів.
Як читати дослідження, де є «статистично значущий» результат
Побачивши p < 0,05, перевірте, який α був заявлений до аналізу; чи була H₀ та напрямок тесту визначені наперед; скільки outcomes, підшкал, груп, часових точок і моделей перевіряли; чи були проміжні аналізи; чи визначено family; чи застосовано потрібний multiplicity control; чи повідомлено всі аналізи; чи є effect size та інтервал невизначеності; чи статистична модель відповідає дизайну й структурі даних. Окреме p без цієї архітектури не повідомляє реальну error rate усього дослідницького процесу.
Так само p > 0,05 не означає, що H₀ «доведена», ефект дорівнює нулю або дослідження показало еквівалентність. Невідхилення може бути сумісним із широким діапазоном ефектів, особливо за малої вибірки й широкого інтервалу. Greenland та співавтори докладно розбирають цю та інші помилки інтерпретації p, confidence intervals і power.
Типові помилки інтерпретації
«α = 0,05 означає 5% шанс, що H₀ істинна»
Ні. α — імовірність відхилення за умови істинної H₀ в заданій процедурі. Це P(відхилити H₀ | H₀), а не P(H₀ | відхилення H₀). Перестановка умови змінює саме питання.
«p = 0,04 означає 4% імовірності помилки першого роду»
Ні. P є статистикою, обчисленою з конкретних даних. Воно не є posterior probability помилки. Рівень Type I error задає повна процедура, а не числове значення p після експерименту.
«Якщо p < 0,05, ефект важливий»
Ні. Статистична значущість не визначає величину, клінічну, практичну або особисту важливість ефекту. За великої вибірки дуже малий ефект може мати мале p; за малої — важливий ефект може залишитися неточним і не пройти поріг.
«Якщо p > 0,05, ефекту немає»
Ні. Невідхилення H₀ не є її доказом. Для тверджень про еквівалентність або достатньо малий ефект потрібні відповідний дизайн, межі еквівалентності чи інші процедури, а не просте «не значуще» p.
«Після корекції на множинність усі проблеми вирішено»
Ні. Корекція може контролювати визначену error rate для визначеної family за своїх умов. Вона не виправляє selection bias, confounding, погане вимірювання, невідповідну модель, HARKing, selective reporting або низьку зовнішню валідність.
«Будь-які два p-значення треба Bonferroni-коригувати разом»
Ні. Multiplicity control потребує визначення сім’ї гіпотез відповідно до наукового claim і правила рішення. Механічне об’єднання всіх p у статті в одну сім’ю може бути так само необґрунтованим, як і повне ігнорування множинності.
«Type I error = помилковий діагноз»
Не автоматично. У статистичному тестуванні Type I error визначається H₀ і правилом її відхилення. У діагностичній класифікації false positive має інше визначення відносно референтного стану. Для screening result додатково мають значення prevalence, sensitivity, specificity, PPV і NPV.
Науковий статус поняття
Помилка першого роду, рівень α, потужність і зв’язок між Type I та Type II errors належать до усталеного апарату частотної статистики. Історично цей апарат систематизований у теорії Неймана—Пірсона і розвинений у сучасній теорії статистичних тестів. Так само усталеною є проблема multiplicity та існування процедур контролю FWER і FDR.
Контекстно залежними залишаються вибір конкретного α, визначення сім’ї гіпотез, компроміс між FWER і FDR, доречність однобічного тесту, метод корекції та те, наскільки бінарне рішення «значуще/незначуще» взагалі потрібне для наукового питання. Сучасні дискусії стосуються практики інтерпретації, а не самого математичного факту, що процедура має помилкові рішення з визначеними частотними властивостями.
FAQ
Що таке помилка першого роду простими словами?
Це ситуація, коли статистична процедура каже «відхиляємо H₀», хоча H₀ насправді істинна. У побутовій аналогії це схоже на хибну тривогу, але формально подія визначається саме нульовою гіпотезою та правилом тесту.
Чи дорівнює помилка першого роду α?
α — це наперед заданий рівень або верхня межа ймовірності Type I error для процедури за H₀. У точному тесті для певної простої H₀ фактична ймовірність може дорівнювати α; в інших процедурах вона може бути нижчою або наближеною. За порушення плану чи припущень фактична частота може бути вищою.
Чому найчастіше використовують α = 0,05?
Це історично поширена конвенція, зручна як стандартний робочий поріг. Вона не є універсальним законом. Вибір α варто обґрунтовувати наслідками помилки, дизайном, multiplicity, потрібною потужністю та контекстом.
Чи означає p < 0,05, що результат хибний лише у 5% випадків?
Ні. Це змішує P(дані | H₀) та P(H₀ | дані). Для оцінки частки хибних знахідок серед «позитивних» результатів потрібна інша модель і додаткова інформація.
Як множинні тести підвищують Type I error?
Кожен додатковий шанс відхилити істинну H₀ створює ще одну можливість false positive. Для m незалежних істинних H₀ при однаковому α імовірність хоча б однієї помилки дорівнює 1 − (1 − α)^m. Для залежних тестів формула змінюється, тому застосовують процедури, що відповідають потрібній error rate.
Чи завжди потрібна поправка Bonferroni?
Ні. Bonferroni — один із способів контролю FWER. Залежно від задачі можуть бути доречні Holm, Hochberg, Dunnett, Tukey, permutation/max-T, hierarchical testing, alpha-spending, FDR або інші методи. Спочатку визначають науковий claim та family, а вже потім procedure.
Чим Type I error відрізняється від Type II error?
Type I: істинну H₀ помилково відхилили. Type II: хибну H₀ не відхилили щодо заданої альтернативи. Імовірності позначають α і β, а power = 1 − β. Зміна порога впливає на баланс цих ризиків.
Чи можна дізнатися, що конкретний значущий результат є Type I error?
З одного p-значення — ні. Type I error є фактом лише якщо H₀ істинна, а її істинність у реальному науковому дослідженні зазвичай не відома безпосередньо. Ми можемо оцінювати властивості процедури, реплікації, сукупність доказів і альтернативні моделі, але α не дає posterior probability для конкретного результату.
Чи допомагає менше α зробити дослідження «надійнішим»?
Менше α знижує допустимий ризик false positive за коректної процедури, але за незмінної вибірки зазвичай зменшує power. Якість дослідження залежить також від дизайну, вимірювання, точності, sample size, прозорості, multiplicity, моделі та змістової інтерпретації.
Пов’язані статті
«Множинні порівняння: чому багато статистичних тестів підвищують ризик випадкових “значущих” результатів» — детальний розбір FWER, Bonferroni, Holm, FDR, families of tests та multiplicity planning.
«Довірчий інтервал: що означає 95% CI і як він показує невизначеність оцінки» — як інтервали пов’язані з тестуванням гіпотез і чому 95% confidence не є 95% posterior probability для параметра.
«Психометрія: що це, що вона вимірює і як оцінюють якість психологічних тестів» — де статистичне тестування є лише одним шаром ширшої оцінки reliability, validity, measurement error, invariance та fairness.
Статистична значущість — як p < .05, рівень α і правило статистичної значущості пов’язані з ризиком Type I error.
Джерела
Benjamini, Y., & Hochberg, Y. (1995). Controlling the False Discovery Rate: A Practical and Powerful Approach to Multiple Testing. Journal of the Royal Statistical Society: Series B, 57(1), 289–300. https://doi.org/10.1111/j.2517-6161.1995.tb02031.x
Dunn, O. J. (1961). Multiple Comparisons Among Means. Journal of the American Statistical Association, 56(293), 52–64. https://doi.org/10.1080/01621459.1961.10482090
Food and Drug Administration. (2022). Multiple Endpoints in Clinical Trials: Guidance for Industry. FDA
Greenland, S., Senn, S. J., Rothman, K. J., Carlin, J. B., Poole, C., Goodman, S. N., & Altman, D. G. (2016). Statistical tests, P values, confidence intervals, and power: a guide to misinterpretations. European Journal of Epidemiology, 31, 337–350. https://doi.org/10.1007/s10654-016-0149-3
Holm, S. (1979). A Simple Sequentially Rejective Multiple Test Procedure. Scandinavian Journal of Statistics, 6(2), 65–70. JSTOR 4615733
Lakens, D., Adolfi, F. G., Albers, C. J., et al. (2018). Justify your alpha. Nature Human Behaviour, 2, 168–171. https://doi.org/10.1038/s41562-018-0311-x
National Institute of Standards and Technology. Engineering Statistics Handbook: What are statistical tests? NIST
Neyman, J., & Pearson, E. S. (1933). On the Problem of the Most Efficient Tests of Statistical Hypotheses. Philosophical Transactions of the Royal Society of London. Series A, 231, 289–337. https://doi.org/10.1098/rsta.1933.0009
Simmons, J. P., Nelson, L. D., & Simonsohn, U. (2011). False-Positive Psychology: Undisclosed Flexibility in Data Collection and Analysis Allows Presenting Anything as Significant. Psychological Science, 22(11), 1359–1366. https://doi.org/10.1177/0956797611417632
Wasserstein, R. L., & Lazar, N. A. (2016). The ASA Statement on p-Values: Context, Process, and Purpose. The American Statistician, 70(2), 129–133. https://doi.org/10.1080/00031305.2016.1154108
Wasserstein, R. L., Schirm, A. L., & Lazar, N. A. (2019). Moving to a World Beyond “p < 0.05”. The American Statistician, 73(sup1), 1–19. https://doi.org/10.1080/00031305.2019.1583913
