p-значення: що воно насправді означає і чого не говорить про гіпотезу або важливість ефекту
Український психологічний ХАБ · Опубліковано: 23 вересня 2026 року · Редакційна політика
p-значення (p-value) — це ймовірність, обчислена за припущення, що задана нульова гіпотеза та статистична модель є коректними: ймовірність отримати значення тестової статистики, щонайменше настільки несумісне з цією нульовою моделлю, як спостережене. У цьому визначенні критично важлива умова «за нульової гіпотези та моделі». p-значення не є ймовірністю того, що сама нульова гіпотеза істинна, не показує частку «випадковості» в результаті й не вимірює величину або практичну важливість ефекту. Саме ці межі формулює заява American Statistical Association про p-values.
У психологічних дослідженнях p-value часто з’являється поруч із t, F, χ², z, коефіцієнтами регресії, кореляціями, факторними навантаженнями та іншими статистиками. Один і той самий запис p = .03 може стосуватися зовсім різних наукових питань, а його зміст залежить від того, яку саме нульову гіпотезу перевіряли, який тест застосували, які припущення зробили, як зібрали дані та чи був аналіз визначений наперед. Тому p-value слід читати як частину моделі й дизайну, а не як універсальний сертифікат істини.
Коротка відповідь: що означає p-значення
Якщо дослідження повідомляє p = .03, коректна коротка інтерпретація звучить приблизно так: за нульової гіпотези та інших припущень використаної статистичної моделі результат тестової статистики, щонайменше настільки екстремальний, як спостережений, мав би ймовірність близько 3%. Це твердження спрямоване від гіпотези й моделі до можливих даних. Воно не розвертається автоматично у зворотний бік.
Отже, p = .03 не означає «нульова гіпотеза має 3% шансів бути правдивою», «альтернативна гіпотеза правильна з імовірністю 97%», «результат на 97% невипадковий» або «ефект великий». Greenland та співавтори систематизували десятки поширених помилкових інтерпретацій статистичних тестів, p-values, довірчих інтервалів і потужності; центральна проблема багатьох із них — підміна умовної ймовірності P(дані | модель) твердженням про P(модель | дані).
Формальне визначення p-value
Нульова гіпотеза, тестова статистика і «щонайменше настільки екстремальний» результат
Перевірка статистичної гіпотези починається з чітко визначеної нульової гіпотези H₀ та тестової статистики T. Нульова гіпотеза може, наприклад, стверджувати, що різниця середніх дорівнює нулю, коефіцієнт регресії дорівнює нулю або певна модель описує дані без заданого відхилення. Тестова статистика стискає відповідну інформацію даних у число, для якого за H₀ відомий або апроксимований розподіл.
p-value відповідає на питання: якщо H₀ і статистична модель задані, наскільки незвичним у їхніх межах є спостережене значення T? Для двобічного тесту «екстремальність» зазвичай враховує відхилення в обидва боки, для однобічного — в наперед визначеному напрямку. Точна формула залежить від тесту, типу статистики та способу визначення хвоста розподілу. Тому p-value завжди належить конкретній процедурі, а не даним «самим по собі».
p-значення завжди умовне щодо моделі
Фраза «якби нульова гіпотеза була істинною» є скороченням. Реальна умова ширша: мають виконуватися припущення моделі й процедури — щодо вибірки, незалежності, розподілу, структури дисперсії, способу формування тестової статистики, правил зупинки збору даних, множинності перевірок та інших елементів. ASA підкреслює, що p-value може показувати несумісність даних із заданою статистичною моделлю, але джерелом цієї несумісності може бути не лише хибність конкретної H₀, а й порушення інших припущень.
Тому мале p не повідомляє, яка саме частина моделі «винна». Воно сигналізує, що спостереження є менш сумісним із заданою моделлю, ніж типові результати, які ця модель передбачає. Науковий висновок потребує окремого розгляду дизайну, вимірювання, якості даних, альтернативних моделей і предметного контексту.
Як правильно прочитати p = .03
Уявімо рандомізоване дослідження з двома групами, де H₀ стверджує, що середня різниця між умовами дорівнює нулю. Обрано двобічний тест, і отримано p = .03. Це означає: за H₀ та умов використаного тесту ймовірність отримати тестову статистику щонайменше настільки віддалену від нульового очікування, як спостережена, становить приблизно 0.03.
З цього не можна без додаткової моделі обчислити шанс, що H₀ правдива. Для такого питання потрібна інша інференційна рамка, наприклад байєсівська модель із явно заданими апріорними ймовірностями та правдоподібністю даних. Так само p = .03 нічого самостійно не говорить про те, чи є різниця психологічно відчутною, клінічно корисною або достатньо великою для практичного рішення.
Чого p-значення не показує
p-value не є ймовірністю того, що нульова гіпотеза істинна
Це базове розрізнення. p-value — величина, визначена за умови H₀; вона не є ймовірністю H₀ після спостереження даних. Перехід від P(дані | H₀) до P(H₀ | дані) є відомою помилкою оберненої умовності. ASA Statement прямо називає інтерпретацію p-value як імовірності істинності досліджуваної гіпотези некоректною.
p-value не є «ймовірністю, що результат виник випадково»
Статистичний тест не ділить результат на дві субстанції — «справжній ефект» і «випадок» — і не оцінює відсоток кожної. Випадкова варіативність уже входить у модель вибіркового розподілу. p-value описує поведінку тестової статистики за заданою моделлю; фраза «ймовірність, що результат випадковий» стирає умову, структуру моделі та різницю між даними й гіпотезою.
Менше p не означає більший або важливіший ефект
p-value залежить не лише від оціненої величини ефекту, а й від її стандартної похибки, розміру вибірки, варіабельності та статистичної моделі. За великої вибірки дуже мала різниця може дати дуже мале p; за малої вибірки навіть потенційно важливий ефект може мати велике p через низьку точність. ASA окремо наголошує: p-value і статистична значущість не вимірюють розмір ефекту або важливість результату. Для цього потрібен розмір ефекту та його контекст.
p-value не дає ймовірності успішної реплікації
Навіть коли справжній параметр не змінюється, p-values можуть істотно коливатися від вибірки до вибірки. Halsey та співавтори показали широку вибіркову мінливість p-value та її залежність від розміру вибірки. Тому p = .03 у першому дослідженні не означає, що наступне дослідження з великою ймовірністю знову дасть p < .05. Реплікація оцінює відтворюваність ефекту за нових даних, а не стабільність конкретного числа p.
p > .05 не доводить відсутності ефекту
Якщо p не перетнуло обраний α, це зазвичай означає, що процедура не відхилила H₀. Такий результат може виникнути тому, що ефект справді дуже малий, тому що дані неточні, вибірка недостатня, варіабельність висока або модель нечутлива до наявного ефекту. Cochrane Handbook прямо застерігає від підміни «відсутності доказу ефекту» «доказом відсутності ефекту».
Коли дослідницьке питання полягає саме в тому, чи є ефект достатньо малим, щоб вважатися практично неважливим, корисніші спеціальні процедури. Наприклад, еквівалентнісне тестування перевіряє, чи несумісні дані з ефектами, що перевищують наперед обґрунтовану найменшу величину інтересу. Це інше питання, ніж звичайне «чи відрізняється параметр від нуля».
p-значення і рівень значущості α — різні речі
p-value і α часто стоять в одному реченні, але виконують різні ролі. α — це правило процедури, яке задають до аналізу, якщо дослідження використовує порогове рішення. Наприклад, α = .05 означає допустимий довгостроковий рівень помилки першого роду для належно визначеної процедури за H₀ та її припущень. p-value обчислюють уже після отримання даних.
Якщо p = .032 і α = .05, можна сказати, що результат перетнув наперед визначений поріг цієї процедури. Не можна сказати, що «ризик помилки саме цього висновку дорівнює 3,2%» або 5%. Довгострокова частота помилки процедури й післядані ймовірності конкретної гіпотези — різні статистичні величини.
Порогове α також не має бути ритуальним числом. Lakens та співавтори аргументують, що вибір α слід робити прозоро й обґрунтовувати з огляду на дизайн, помилки та цілі дослідження. Число .05 є поширеною історичною конвенцією, а не природною межею істини.
Чому .05 не є межею між «є ефект» і «немає ефекту»
Результати p = .049 і p = .051 практично не утворюють двох різних світів. Різниця між ними мізерна, тоді як традиційна двійкова мова може назвати один «значущим», а другий «незначущим». Wasserstein, Schirm і Lazar рекомендували відмовлятися від механічного мислення «p < .05» як межі, що перетворює безперервну невизначеність на категоричний вердикт.
Особливо небезпечно порівнювати дві групи або два дослідження за схемою «тут p < .05, а тут p > .05, отже ефекти відрізняються». Gelman і Stern показали класичну помилку: різниця між «статистично значущим» і «статистично незначущим» сама по собі ще не є статистично значущою. Для твердження про різницю ефектів потрібен прямий тест цієї різниці або відповідна модель взаємодії.
Докладно порогову категоризацію розбирає окрема стаття «Статистична значущість». Канонічний поділ у ХАБі такий: ця сторінка пояснює, що таке p-value і як його інтерпретувати; сторінка про статистичну значущість пояснює, що відбувається, коли p порівнюють із α та чому ярлик «значуще» не дорівнює важливості.
Від чого залежить p-значення
Від величини оціненого ефекту
За інших рівних умов оцінка, що далі від нульового значення, зазвичай породжує більш екстремальну тестову статистику й менше p. Але «за інших рівних умов» тут принципово важливо: p залежить не від ефекту окремо, а від його співвідношення з невизначеністю.
Від розміру вибірки і точності
Більша вибірка часто зменшує стандартну похибку оцінки. Тоді навіть невелике відхилення від нуля може дати велику тестову статистику й мале p. Саме тому статистично переконливий результат у дуже великій вибірці може бути практично тривіальним. І навпаки, мала вибірка може залишити широкий діапазон правдоподібних ефектів і велике p. Планування цього аспекту розглядають статті «Розмір вибірки» та «Статистична потужність».
Від варіабельності та якості вимірювання
Шумні вимірювання збільшують невизначеність і можуть змінювати p. У психології це особливо важливо, тому що багато конструктів вимірюються опосередковано через шкали, завдання або поведінкові показники. Похибка вимірювання впливає на точність оцінок, а погана операціоналізація може зробити формально коректний статистичний тест слабким свідченням щодо самого психологічного конструкта.
Від статистичної моделі та її припущень
Інший тест, інша функціональна форма, інший спосіб моделювання залежності, інша оцінка дисперсії або робастна процедура можуть дати інше p на тих самих вихідних даних. Це не означає, що будь-який аналіз довільний. Це означає, що p-value належить моделі, а вибір моделі має бути методологічно обґрунтований і прозоро описаний.
Від однобічного чи двобічного тесту
Однобічний тест концентрує хвостову ймовірність у наперед визначеному напрямку, двобічний враховує екстремальні відхилення в обидва боки. Напрям тесту не слід вибирати після перегляду результатів заради меншого p. Якщо напрям дослідницької гіпотези справді виправдовує однобічну процедуру, це рішення має бути встановлене до аналізу.
p-значення і довірчий інтервал
p-value стискає інформацію про сумісність із конкретним нульовим значенням, тоді як довірчий інтервал показує діапазон оцінок, сумісних із даними та процедурою на обраному рівні. Для відповідних двобічного тесту й 95% довірчого інтервалу, побудованих узгодженим методом, p < .05 зазвичай відповідає тому, що 95% CI не містить нульового значення. Це співвідношення не є універсальним, якщо тест та інтервал побудовані різними методами.
Інтервал корисніший для питання про величину й точність: він показує, чи сумісні дані одночасно з малим, помірним або великим ефектом. Cochrane Handbook рекомендує зосереджувати інтерпретацію на оцінках ефекту та їхніх довірчих інтервалах і уникати двійкового поділу на «значущі» та «незначущі» результати.
p-значення і розмір ефекту
Розмір ефекту відповідає на інше питання: наскільки велика різниця, зв’язок або зміна в обраній метриці. p-value відповідає на питання про несумісність із конкретною нульовою моделлю. Тому один показник не замінює інший. У сучасній психологічній статистиці корисніше повідомляти оцінку ефекту, її невизначеність і контекст, а p-value — як один із елементів інференції.
Cumming у програмній статті про «new statistics» аргументував перехід від культури нульових тестів до оцінювання ефектів, довірчих інтервалів, метааналітичного накопичення та відкритої науки. Практичний висновок для читача простий: якщо в результаті є тільки p, але немає оцінки величини ефекту та її точності, значна частина науково важливої інформації втрачена.
p-значення, статистична потужність і розмір вибірки
Статистична потужність — це ймовірність відхилити H₀ за конкретного альтернативного сценарію, дизайну, α та інших припущень. p-value — результат, отриманий із конкретних даних. Потужність планують або аналізують для процедури; p-value обчислюють для спостереження. Це різні поняття.
Низька потужність означає, що навіть за наявності ефекту дослідження часто не відхилятиме H₀. Вона також створює нестійкі оцінки та широку невизначеність. Високе p у малопотужному дослідженні тому особливо слабко підтримує твердження «ефекту немає». Водночас великий розмір вибірки може зробити статистично помітними дуже малі ефекти, тож висока потужність не перетворює p-value на міру практичної важливості.
p-значення та помилки першого і другого роду
Помилка першого роду — це відхилення H₀, коли вона відповідає заданій моделі; її довгострокову частоту контролює α за коректно визначеної процедури. Отримане p не є індивідуальною ймовірністю Type I error для конкретного висновку. Порівняння p з α лише реалізує правило рішення.
Помилка другого роду стосується невідхилення H₀ за конкретної альтернативи, коли ефект існує в сенсі цієї моделі. p > .05 не повідомляє ймовірність Type II error після факту й не дозволяє сказати, що H₀ «прийнята». Для планування ризику пропуску ефекту потрібні припущення про альтернативу, розмір ефекту, вибірку та потужність.
Множинне тестування, p-hacking і селективне звітування
Одне p-value має визначену інтерпретацію лише в контексті процедури, яка його породила. Якщо дослідник перевірив десятки outcomes, підгруп, моделей або моментів зупинки, а показав тільки один «успішний» тест, номінальне p не відображає всі можливості отримати сприятливий результат. Це центральна проблема множинних порівнянь та прихованої аналітичної гнучкості.
Simmons, Nelson і Simonsohn продемонстрували, як нерозкрита гнучкість збору й аналізу даних може різко збільшити фактичну частоту хибнопозитивних висновків. У сучасній термінології близький комплекс практик описують як p-hacking. p-hacking не можна діагностувати за одним числом p = .049; для оцінки потрібна інформація про повний аналітичний шлях, правила збору даних, перевірені гіпотези та звітування.
Окрема проблема — HARKing, коли гіпотезу формулюють після перегляду результатів і подають як передбачену заздалегідь. p-value не містить у собі часової мітки походження гіпотези. Тому однаковий p може мати різну доказову вагу залежно від того, чи був аналіз підтверджувальним, дослідницьким або відібраним після перегляду даних.
Пререєстрація і прозорість аналізу
Пререєстрація дослідження дає змогу зафіксувати ключові гіпотези, outcomes, правила виключення, розмір вибірки та аналіз до перегляду результатів. Вона не гарантує валідності дослідження й не робить кожне p-value «правильним», але допомагає читачеві відрізнити наперед визначену перевірку від аналізу, сформованого після даних.
Принцип повного звітування є ширшим за preregistration. ASA наголошує на прозорості всіх проведених аналізів і p-values, а APA Journal Article Reporting Standards встановлюють стандарти прозорого повідомлення кількісних психологічних досліджень. Читач має бачити не лише фінальне p, а й те, як саме воно було отримане.
p-значення в психометрії
У психометрії p-values можуть з’являтися під час перевірки факторної структури, параметрів моделей, різниць між групами, кореляцій із зовнішніми критеріями, інваріантності та інших гіпотез. Статистично значущий коефіцієнт або тест не робить психологічний інструмент «валідним». Валідність стосується сукупності доказів на підтримку конкретної інтерпретації score та конкретного використання тесту.
Standards for Educational and Psychological Testing AERA, APA та NCME розглядають валідність, надійність/точність, справедливість і використання тестів як широку систему доказів та відповідальності. Окреме p-value може бути елементом аналізу, але не замінює змістових, структурних, конвергентних, критеріальних, кроскультурних та інших релевантних доказів.
Так само p-value не вимірює надійність тесту й не є оцінкою похибки вимірювання. У дуже великих психометричних вибірках навіть малі відхилення моделі або незначні міжгрупові різниці можуть стати статистично помітними. Тому значущість слід читати разом із величиною відхилення, індексами моделі, ефектами, інтервалами, інваріантністю та предметною значущістю.
p-значення в клінічному та діагностичному контексті
p-value з групового дослідження не є діагностичним показником для окремої людини. Воно не дорівнює чутливості, специфічності, позитивній чи негативній прогностичній цінності, likelihood ratio або клінічному cut-off. Статистично значуща середня різниця між клінічною й контрольною групами не перетворює шкалу на діагностичний тест і не визначає універсальної межі «розлад є / розладу немає».
Так само статистична значущість зміни після втручання не доводить, що зміна є клінічно або особисто важливою. Для такого висновку потрібні величина зміни, невизначеність, measurement error, критерії важливої зміни, функціонування людини та клінічний контекст. p-value відповідає на статистичне питання про модель; клінічне рішення потребує ширшої системи доказів.
p-value і причинність
Мале p для кореляції або регресійного коефіцієнта показує несумісність із певною нульовою моделлю асоціації. Воно не встановлює причинний напрямок і не усуває confounding, selection bias, reverse causation або помилки вимірювання. Стаття «Кореляція і причинність» пояснює, чому причинний висновок визначається дизайном та ідентифікаційними припущеннями, а не самим фактом p < .05.
Як повідомляти p-value у психологічному дослідженні
Сильне звітування починається не з прикметника «значуще», а з дослідницького питання, дизайну та оцінки. Коли p-value використовується, варто повідомляти точне p настільки, наскільки це змістовно, назву й параметри статистичної процедури, оцінку ефекту та довірчий інтервал, розмір вибірки, правила виключення, а також заздалегідь визначений α, якщо він був частиною рішення.
Якщо перевірок багато, читачеві потрібна інформація про множинність: скільки гіпотез перевірялося, яка сім’я тестів контролювалася, який метод корекції застосовано та чи наведено сирі й скориговані p-values. Якщо аналіз відхилився від preregistration або був exploratory, це слід назвати прямо. APA JARS-Quant орієнтує кількісну психологію на прозоре відтворюване повідомлення методів та результатів.
Не слід писати p = .000, бо ймовірність не стала буквально нульовою. Для дуже малих значень доречний запис на кшталт p < .001 або точніше число, якщо програмне забезпечення та стандарт журналу це підтримують. Також не варто перетворювати p на «% впевненості» в гіпотезі.
Як читати p-value у науковій статті: практичний алгоритм
Спочатку сформулюйте, яку саме H₀ перевіряли. Далі з’ясуйте, чи відповідає статистичний тест дизайну й структурі даних. Після цього подивіться на оцінку ефекту та довірчий інтервал: вони показують величину й точність того, про що p говорить лише відносно нульового значення. Якщо цієї інформації немає, інтерпретація вже обмежена.
Наступне питання — чи був аналіз один або існувало багато шляхів до результату. Перевірте множинні outcomes, підгрупи, часові точки, специфікації моделей, optional stopping, виключення та селективне звітування. Потім оцініть вимірювання: чи є показник достатньо надійним, чи валідна його інтерпретація, чи релевантні норми й культурна адаптація.
Лише після цього варто дивитися, чи p перетнуло певний α. Поріг є одним елементом процедури, а не фінальним судом. Сильний висновок інтегрує дизайн, ефект, невизначеність, якість вимірювання, прозорість, реплікації та ширший корпус досліджень.
p-value і байєсівська ймовірність — різні запитання
Frequentist p-value рухається від заданої моделі до розподілу можливих даних. Питання «яка ймовірність H₀ після цих даних?» є іншим. У байєсівській рамці воно потребує апріорного розподілу або prior odds та правдоподібності даних під конкуруючими моделями. Саме тому не можна просто відняти p від 1 і назвати результат імовірністю альтернативної гіпотези.
Навіть Bayes factor і posterior probability — різні величини: Bayes factor оновлює відношення шансів, а posterior odds залежать також від prior odds. Це корисне нагадування про загальний принцип: кожна статистична величина відповідає на своє питання. Помилки виникають, коли відповідь одного інструмента переносять на інше питання.
Поширені приклади правильної і неправильної інтерпретації
p = .001 у дуже великій вибірці
Мале p може бути сумісним із дуже малим ефектом. Якщо різниця становить, наприклад, частку стандартного відхилення, але вибірка величезна, тест може легко виявити її відмінність від нуля. Правильний наступний крок — оцінити величину ефекту, довірчий інтервал і предметну важливість, а не називати результат «сильним ефектом» через мале p.
p = .08 у невеликій вибірці
Такий результат не є доказом нульового ефекту. Якщо довірчий інтервал широкий і включає як практично важливі, так і малі ефекти, дані радше недостатньо точні. Питання «чи ефект практично відсутній?» потребує точнішого дизайну або тесту еквівалентності, а не автоматичного прийняття H₀.
p = .03 в одній підгрупі і p = .20 в іншій
Це не доводить, що групи відрізняються за ефектом. Потрібен прямий тест взаємодії або різниці коефіцієнтів. Порівнювати ярлики «значущий / незначущий» замість самих ефектів — статистична помилка.
p = .049 проти p = .051
Ці числа майже однакові як показники сумісності з нульовою моделлю. Перетворювати перше на «ефект існує», а друге на «ефекту немає» — наслідок порогової культури, а не властивість самих даних. Рекомендації 2019 року закликають приймати невизначеність серйозно й не робити .05 магічною межею.
Науковий статус p-value
p-value є усталеним інструментом частотної статистики, а не застарілим числом, яке наука «скасувала». Критика спрямована передусім проти механічної, бінарної та ізольованої інтерпретації. ASA Statement не забороняє p-values; вона встановлює межі того, що з них можна виводити. Wasserstein, Schirm і Lazar пропонують ширший підхід: приймати невизначеність, бути відкритими щодо аналітичних рішень, мислити продумано й не дозволяти одному порогу визначати науковий висновок.
Тому правильна позиція не полягає у виборі між «вірити p-value» і «відмовитися від p-value». Сильніша статистична практика ставить p на своє місце: поряд з оцінками ефекту, інтервалами, моделями, дизайном, якістю вимірювання, прозорістю та предметним знанням.
Поширені запитання
Що означає p < .05?
Це означає, що обчислене p-value нижче .05. За заданої нульової гіпотези, статистичної моделі й правил тесту спостережена тестова статистика або ще екстремальніша мала б хвостову ймовірність меншу за 5%. Якщо α = .05 був визначений наперед, результат перетнув цей поріг. Це не означає, що H₀ має менше 5% шансів бути правдивою.
Чи p = .01 означає 1% шанс, що нульова гіпотеза правдива?
Ні. p-value не є P(H₀ | дані). Воно обчислюється за умови H₀ та моделі й характеризує екстремальність тестової статистики в цьому умовному розподілі.
Чи менше p завжди означає більший ефект?
Ні. p залежить від ефекту, стандартної похибки, розміру вибірки, варіабельності та моделі. Два однакові ефекти можуть мати різні p через різну точність, а дуже малий ефект може дати дуже мале p у великій вибірці.
Чи p > .05 означає, що ефекту немає?
Ні. Це означає, що результат не перетнув відповідний поріг у конкретній процедурі. Для висновку про практичну відсутність ефекту потрібні достатня точність, інтервальна оцінка й, коли доречно, equivalence testing.
Чи p = .049 істотно відрізняється від p = .051?
Ні. Безперервна статистична інформація не має природного розриву в точці .05. Такі значення слід інтерпретувати разом з ефектом, інтервалом і дизайном, а не як протилежні факти.
Чи існує «хороше» p-value?
Універсального «хорошого» p немає. Значення p має сенс лише відносно конкретної гіпотези, моделі та наукового питання. Дуже мале p може бути малоінформативним за поганого дизайну, селективного аналізу або тривіального ефекту.
Чи можна порівнювати p-values двох досліджень як силу ефекту?
Ні. Вони можуть мати різні вибірки, точність, моделі, шкали й дизайни. Для порівняння величини ефектів потрібні зіставні effect-size metrics та їхня невизначеність.
Чи p-value потрібен у психометрії?
Він може бути корисним для окремих статистичних перевірок, але не є показником якості тесту сам по собі. Надійність, валідність, measurement error, fairness, інваріантність і придатність до intended use потребують окремих доказів.
Як писати дуже мале p-value?
Не варто писати p = .000. Зазвичай повідомляють p < .001 або точне мале значення, якщо воно надійно обчислене й формат видання це підтримує.
Пов’язані статті
Статистична значущість — що означає поріг p < .05 і чому «статистично значуще» не дорівнює важливому.
Розмір ефекту — як оцінювати величину різниці або зв’язку окремо від p-value.
Довірчий інтервал — як читати невизначеність оцінки і чому інтервал дає більше інформації про можливу величину ефекту.
Статистична потужність — імовірність виявлення ефекту за заданого дизайну й альтернативи та її зв’язок із β.
Розмір вибірки — чому кількість учасників впливає на точність, потужність і p-value.
Помилка першого роду — що означає Type I error і як вона пов’язана з α.
Помилка другого роду — що означає Type II error і чому незначущий результат не дорівнює доказу відсутності ефекту.
Множинні порівняння — чому багато тестів збільшують шанс випадкових «значущих» результатів і як це контролюють.
p-hacking — як результат-залежна аналітична гнучкість спотворює інтерпретацію p-values.
HARKing — чому гіпотеза, сформульована після результатів, має інший доказовий статус.
Пререєстрація дослідження — як наперед зафіксовані рішення допомагають відділяти confirmatory analysis від exploratory analysis.
Психометрія — як оцінюють надійність, валідність, похибку вимірювання та придатність психологічних тестів.
