top of page

Психологічна енкциклопедія

Статистична значущість: що означає p < .05 і чому «значуще» не дорівнює важливому

23 вер.
Читати 14 хв

Статистична значущість — це спосіб описати результат статистичного тесту відносно певної нульової гіпотези, моделі та заздалегідь установленого рівня значущості. Позначення p < .05 зазвичай означає, що отримане p-значення нижче порога α = .05. Воно не повідомляє, наскільки великий ефект, наскільки він важливий для людини, чи правдива дослідницька гіпотеза і чи повториться результат у наступному дослідженні. Американська статистична асоціація прямо наголошує: наукові висновки та рішення не повинні залежати лише від того, чи перетнуло p-значення певну межу.


У психології це розрізнення особливо важливе. Ми часто вимірюємо латентні конструкти, працюємо з вибірками різного розміру, порівнюємо багато показників і спираємося на моделі з власними припущеннями. Малий p може супроводжувати дуже малий ефект, а p трохи вище .05 — ефект, який усе ще сумісний із практично важливими значеннями. Тому коректне читання результату вимагає поєднувати p-значення з оцінкою ефекту, його невизначеністю, дизайном дослідження, якістю вимірювання та контекстом рішення.


Коротка відповідь: p < .05 не означає «важливо» або «доведено»


Коли результат називають статистично значущим за правилом α = .05, це означає лише те, що p-значення в обраному тесті опинилося нижче .05. Сам p-value — це умовна величина: за нульової гіпотези та інших припущень статистичної моделі він характеризує, наскільки екстремальним є спостережуваний результат тестової статистики порівняно з тим, що очікувалося б за цієї нульової моделі. Докладний розбір типових помилок дають Greenland та співавтори.


Отже, p < .05 не є оцінкою ймовірності того, що нульова гіпотеза хибна. Це не «95% упевненості», що дослідницька гіпотеза правильна. Це не відсоток випадковості. Це не міра величини ефекту. І це не автоматичний доказ причинності.


Практичне правило для читача просте: спочатку запитайте, що саме оцінювали і яким дизайном; потім — який розмір ефекту та довірчий інтервал; після цього — наскільки результат стійкий до альтернативних аналізів, множинного тестування, похибок вимірювання та упереджень. Лише тоді p-значення отримує зміст у конкретному дослідницькому контексті.


Що таке статистична значущість


Статистична значущість у класичній практиці перевірки нульових гіпотез — це категоризація результату відносно наперед обраного порога α. Якщо p ≤ α, результат часто називають «статистично значущим»; якщо p > α — «статистично незначущим» або «не значущим». Саме ця двійкова мова створює значну частину проблем, тому що безперервну міру несумісності даних із конкретною нульовою моделлю перетворює на різкий ярлик.


Сучасні методологічні рекомендації дедалі частіше радять уникати механічного поділу на «значуще / незначуще». Cochrane Handbook рекомендує зосереджувати інтерпретацію на оцінках ефекту та їхніх довірчих інтервалах і не покладатися надмірно на пороги p. У редакційному матеріалі 2019 року Wasserstein, Schirm і Lazar пішли ще далі й запропонували взагалі відмовитися від декларативної мітки «statistically significant» як центрального способу наукової інтерпретації.


Це не означає, що p-value перестав бути статистичним інструментом. Він може бути корисним, коли питання, модель, аналіз і правила рішення визначені прозоро, а результат розглядають разом з іншими показниками. Проблема виникає, коли одна межа .05 перетворюється на універсальний суд про істину, важливість або якість дослідження.


Що саме означає p < .05


p-value є умовним відносно нульової гіпотези та моделі


Коректне визначення p-value завжди містить умову. Якщо нульова гіпотеза і статистична модель, використана для тестування, задані, p-значення показує ймовірність отримати значення тестової статистики щонайменше настільки несумісне з цією нульовою моделлю, як те, що спостерігалося. ASA Statement підкреслює саме таку умовну природу p-value.


Тому p = .03 не означає «3% імовірності, що H0 правильна». У формулі p-value гіпотеза стоїть у частині умови, а не є випадковою величиною, ймовірність якої ми безпосередньо обчислили. Щоб оцінювати ймовірність гіпотези після даних, потрібна інша статистична постановка, зокрема байєсівська, де явно задаються апріорні розподіли та модель альтернатив.


α і p — різні речі


Рівень значущості α — це правило, яке зазвичай визначають до аналізу. У типовій процедурі перевірки гіпотез α задає довгостроковий контроль імовірності помилки першого роду для конкретної процедури за виконання її умов. p-value, навпаки, розраховують із конкретних даних. Порівнювати p з α можна, але ототожнювати їх не можна.


Якщо дослідник наперед установив α = .05, а отримав p = .032, результат перетнув цей заздалегідь визначений поріг. Це ще не дає права сказати, що ймовірність помилки саме цього висновку дорівнює 3,2% або 5%. Частота помилки процедури в повторних дослідженнях і ймовірність конкретної гіпотези після конкретних даних — різні статистичні об’єкти.


Чому саме .05


Поріг .05 є історично закріпленою конвенцією, а не природною межею між «реальністю» та «випадковістю». Cochrane прямо називає 0.05 довільним порогом, який став поширеним у медичних і психологічних дослідженнях. У різних задачах можуть бути виправдані інші рівні α або взагалі інші принципи прийняття рішень.


Якщо ціна хибнопозитивного висновку дуже висока, дослідник може вимагати значно суворішого порога або незалежного підтвердження. Якщо мета — попереднє дослідження чи оцінювання діапазону правдоподібних ефектів, жорстка двійкова межа може бути менш інформативною, ніж оцінка ефекту та невизначеності.


Чого p < .05 не означає


Це не 5% імовірності, що нульова гіпотеза правильна


Це одна з найпоширеніших помилок. p-value обчислюється під умовою H0; він не є P(H0 | дані). Greenland та співавтори докладно розбирають цю та інші хибні інтерпретації p-значень.


Це не 95% імовірності, що альтернативна гіпотеза правильна


Із p < .05 не випливає, що дослідницька гіпотеза має 95% шансів бути істинною. Такий висновок потребував би моделі, яка безпосередньо порівнює гіпотези та враховує попередню інформацію. Класичний p-value цього не робить.


Це не ймовірність того, що результат «виник випадково»


Фраза «ймовірність випадкового результату менша за 5%» звучить просто, але статистично змішує різні речі. p-value не оцінює частку «випадку» в даних і не розкладає результат на «справжній» та «випадковий» компоненти. Він описує поведінку тестової статистики під конкретною нульовою моделлю.


Це не величина ефекту


Дуже мале p може супроводжувати дуже малий ефект, особливо у великій вибірці. І навпаки, потенційно важливий ефект у невеликому дослідженні може мати широке коло невизначеності та не перетнути .05. Cochrane Handbook прямо застерігає, що малий p у великому дослідженні може відображати тривіальний за величиною ефект.


Це не доказ причинності


Навіть p = .000001 у кореляційному аналізі не встановлює причинного напрямку. Причинний висновок залежить від дизайну, часової структури, рандомізації або аргументованих каузальних припущень, контролю конфаундингу та інших джерел упередження. Докладніше це розібрано у статті «Кореляція і причинність».


Це не гарантія відтворюваності


Статистично значущий результат може не відтворитися через випадкову варіативність, завищену початкову оцінку ефекту, малу вибірку, аналітичну гнучкість, селективне звітування, відмінність популяцій або похибку вимірювання. Відтворюваність оцінюється повторними дослідженнями та сукупністю доказів, а не одним p-value.


p = .049 і p = .051 не створюють дві різні реальності


Якщо в одному дослідженні p = .049, а в іншому p = .051, між ними немає природного статистичного обриву. Різниця становить лише .002, хоча звична мова може назвати перший результат «значущим», а другий — «незначущим». Gelman і Stern показали ширшу проблему: різниця між «статистично значущим» і «статистично незначущим» сама по собі ще не є статистично значущою різницею між результатами.


Це має практичний наслідок. Не можна робити висновок «ефект є в групі А, але його немає в групі B» лише тому, що в А p = .04, а в B p = .08. Потрібно безпосередньо оцінити різницю між ефектами, наприклад через тест взаємодії або іншу відповідну модель, та подивитися на її оцінку і невизначеність.


Так само p = .049 не повинно автоматично перетворювати слабку теоретичну ідею на підтверджену, а p = .051 — відправляти змістовний результат у категорію «нічого не сталося». Чим ближче p до умовної межі, тим очевидніше, наскільки штучним є жорсткий двійковий ярлик.


Статистична значущість залежить від розміру вибірки


p-value залежить не лише від величини спостережуваного ефекту, а й від його стандартної похибки, а отже — від обсягу та структури даних. За інших рівних умов більша вибірка дає точнішу оцінку і часто робить тест чутливішим до малих відхилень від нульового значення.


Уявімо дві дуже великі групи, між якими середня різниця за шкалою становить лише 0,2 бала на шкалі від 0 до 100. За величезної вибірки така різниця може дати p < .001. Формально нульова гіпотеза точної рівності погано узгоджується з даними, але практичне значення різниці може залишатися мінімальним.


Інша ситуація: невелике дослідження оцінює різницю у 6 балів, яка потенційно важлива, але має широкий довірчий інтервал і p = .09. Це не доводить відсутність ефекту. Дані можуть бути просто надто неточними, щоб надійно відрізнити кілька змістовно різних сценаріїв.


Саме тому в сучасному звітуванні p-value варто читати поруч із довірчим інтервалом, а питання про величину ефекту відокремлювати від питання про його статистичну сумісність із нульовою моделлю.


Статистична значущість не дорівнює практичній або клінічній важливості


Практична значущість відповідає на інше питання: чи є величина ефекту достатньою, щоб мати реальне значення для поведінки, навчання, роботи, здоров’я, політики або рішення. Клінічна важливість ще конкретніша: чи пов’язана зміна з відчутним поліпшенням стану, функціонування, ризику або іншого клінічно релевантного результату.


Розмежування закріплене й у сучасних стандартах звітування. APA очікує для емпіричних статей точні p-values, розміри ефекту й 95% довірчі інтервали або пояснення, чому їх неможливо подати, а для інтервенцій — також показники клінічно значущої зміни, коли вони релевантні.


Наприклад, середнє зниження симптомного score на 0,4 бала у дуже великій вибірці може бути статистично переконливим, але клінічно майже непомітним. Навпаки, оцінка ефекту може бути клінічно перспективною, але настільки неточною, що дані ще не дозволяють визначити, наскільки вона стабільна. Обидві ситуації потребують ширшого контексту, ніж один p-value.


Важливість ефекту визначається предметною областю, шкалою вимірювання, ризиками й користю, витратами, альтернативами та тим, для кого приймається рішення. У психології одна й та сама числова різниця може мати різний зміст залежно від конструкта та інструмента.


Що читати поруч із p-value


Оцінку ефекту


Спочатку подивіться на саму оцінку: різницю середніх, коефіцієнт регресії, кореляцію, відношення шансів, ризик, стандартизовану різницю або інший показник, який відповідає питанню. Cumming у контексті психологічної науки аргументує перехід від залежності від NHST до мислення через оцінки ефекту, довірчі інтервали та накопичення доказів.


Довірчий інтервал


Точкова оцінка без невизначеності легко створює ілюзію точності. Довірчий інтервал показує діапазон оцінок, сумісних із даними та моделлю в межах обраної частотної процедури. Він допомагає побачити, чи дані одночасно сумісні з майже нульовим, помірним або великим ефектом.


Дизайн і якість даних


Малий p не виправляє систематичне упередження, поганий контроль змішаних чинників, селективну вибірку або слабкий інструмент вимірювання. Якість психологічного дослідження визначає, які висновки взагалі дозволено робити з отриманих чисел.


Наперед визначені правила аналізу


Важливо знати, чи були гіпотези, первинні outcomes, виключення, ковариати та основні аналізи визначені до перегляду результатів. Якщо аналітичні рішення змінювалися після того, як дослідник побачив p-values, номінальний поріг .05 уже не має того самого інтерпретаційного статусу, що в заздалегідь визначеному аналізі.


Повторення та сукупність доказів


Один результат є лише одним спостереженням у ширшій системі доказів. Відкриті дані й код, пререєстрація, незалежні реплікації та прозоре звітування допомагають зменшувати ризик помилкової впевненості. Munafò та співавтори розглядають ці практики як частину ширшої інфраструктури відтворюваної науки.


«Не значуще» не означає «ефекту немає»


Якщо p > .05, дослідник не отримав підстав відхилити конкретну нульову гіпотезу за цим правилом. З цього не випливає, що нульова гіпотеза доведена або що реальний ефект дорівнює нулю. Дані можуть бути сумісні з широким діапазоном значень через обмежену точність.


Cochrane формулює це як принципову помилку: відсутність доказів ефекту не є доказом відсутності ефекту. Саме довірчий інтервал допомагає побачити, які ефекти ще залишаються сумісними з даними.


Коли можна говорити про практичну відсутність ефекту


Якщо питання звучить не «чи відрізняється ефект від нуля?», а «чи можна виключити ефект, достатньо великий, щоб бути важливим?», потрібна інша процедура. Lakens, Scheel та Isager описують equivalence testing: дослідник наперед задає межі найменшого ефекту, що має змістовне значення, і перевіряє, чи дані дозволяють виключити ефекти за межами цього практично важливого діапазону.


Такий підхід показує, чому p = .30 у звичайному тесті не є доказом «ефекту немає». Велике p може виникнути і тоді, коли даних недостатньо. Щоб стверджувати практичну еквівалентність, потрібні належна точність і заздалегідь обґрунтовані межі.


Множинні тести, p-hacking і вибір аналізів


Якщо дослідник перевіряє багато гіпотез, outcomes, підгруп або моделей, шанс отримати принаймні один малий p лише через множинність зростає. Це окремий статистичний intent, докладно розібраний у статті «Множинні порівняння».


Множинність сама по собі не означає недоброчесність: у складному дослідженні багато тестів можуть бути необхідними. Але їхня структура має бути врахована в дизайні, аналізі та звітуванні. Залежно від мети використовують контроль сімейної ймовірності помилки, false discovery rate або інші процедури, а також розрізняють підтверджувальні та дослідницькі аналізи.


Інша проблема — p-hacking: вибір або зміна аналітичних рішень доти, доки не з’явиться бажане p. Класична робота Simmons, Nelson і Simonsohn показала, як нерозкрита гнучкість у збиранні та аналізі даних може різко збільшувати частоту хибнопозитивних результатів.


До таких практик можуть належати зупинка збору даних після появи p < .05, вибір лише «вдалих» outcomes, зміна правил виключення, випробування багатьох ковариат або моделей і звітування лише про ті, що дали потрібний результат. Окремий p-value не містить у собі інформації про те, скільки прихованих аналітичних шляхів було перевірено.


Статистична значущість у психометрії


У психометрії p-values можуть з’являтися в аналізі кореляцій, факторних моделей, інваріантності, DIF, порівнянні груп, перевірці параметрів та багатьох інших процедурах. Однак статистична значущість окремого коефіцієнта не є універсальним доказом якості психологічного тесту.


Значущий коефіцієнт не доводить надійність інструмента; значуща кореляція з іншим показником не створює автоматично конструктну валідність; значуща групова різниця не доводить bias або fairness-проблему; значущий параметр у моделі не гарантує, що модель достатньо описує дані чи що тест придатний для конкретного рішення.


Психометричний висновок потребує сукупності evidence: змісту конструкта, якості завдань, структури, надійності, похибки вимірювання, валідності інтерпретацій, інваріантності й DIF там, де вони релевантні, норм і репрезентативності, культурної та мовної адаптації, а також відповідності intended use.


Наприклад, у великій вибірці дуже слабка кореляція тесту з критерієм може бути p < .001. Це робить нульову кореляцію малоймовірною як точне пояснення в межах моделі, але не відповідає на практичне питання, чи достатньо ця кореляція велика для прогнозування, відбору або клінічного рішення.


Статистична значущість у клінічній та прикладній психології


У клінічному контексті статистична значущість результату дослідження й значущість зміни для конкретної людини належать до різних рівнів. Групове середнє може змінитися статистично переконливо, але величина зміни для частини учасників залишатися малою. А індивідуальна зміна score може перевищити випадкову похибку вимірювання, але все ще не бути достатньою для клінічно важливого поліпшення.


Тому p-value не використовується як індивідуальний діагностичний критерій. Діагноз не встановлюється за p < .05, одним score або одним скринінговим результатом. Скринінг, case-finding, повна психологічна оцінка, діагностика, моніторинг і outcome measurement мають різні цілі та потребують різної доказової бази.


Навіть у клінічному випробуванні p < .05 для середньої різниці між групами не означає автоматично, що втручання має сприятливе співвідношення користі й шкоди, що ефект відчутний для пацієнта або що він переноситься на іншу популяцію. Потрібні величина ефекту, абсолютні результати, невизначеність, небажані явища, клінічно важливі пороги, якість доказів та контекст застосування.


Статистична значущість, довірчий інтервал і практична межа


Один із найкорисніших способів читати результат — спочатку визначити практично важливу межу, а потім подивитися, де відносно неї лежать точкова оцінка та довірчий інтервал. Тоді виникають значно змістовніші сценарії, ніж просто p < .05 або p ≥ .05.


Інтервал може бути вузьким і цілком лежати в зоні практично важливого ефекту. Він може бути вузьким і цілком лежати в зоні тривіального ефекту. Він може бути широким і охоплювати як практично важливий ефект, так і майже нульовий. У кожному випадку p-value може бути однаковим за категорією, але наукова невизначеність і рішення — різними.


Саме тому APA і Cochrane орієнтують звітування на точні оцінки p, величину ефекту та довірчі інтервали, а не лише на декларацію проходження порога.


Як правильно читати статистично значущий результат


Питання 1. Який саме ефект оцінюють? Подивіться на параметр і його одиниці: різницю середніх, кореляцію, odds ratio, коефіцієнт регресії, risk ratio чи іншу величину. Без цього p-value майже позбавлений змістовного масштабу.


Питання 2. Наскільки великий ефект? Відокремте «відрізняється від точного нуля» від «має достатню величину, щоб бути важливим».


Питання 3. Наскільки точна оцінка? Перевірте довірчий інтервал і те, які змістовно різні значення він ще допускає.


Питання 4. Чи був аналіз визначений заздалегідь? Пререєстрація не робить дослідження автоматично правильним, але допомагає відрізнити підтверджувальну перевірку від пошуку результату після перегляду даних.


Питання 5. Скільки тестів провели? Якщо порівнянь було багато, перевірте, чи враховано множинність і чи не виділено один «вдалий» результат із великого набору.


Питання 6. Чи відповідає дизайн твердженню? Спостережуваний зв’язок не стає причинним через малий p. Рандомізація, часовий порядок, контроль упереджень і каузальні припущення визначають рівень причинного висновку.


Питання 7. Чи якісно виміряні змінні? Низька надійність, систематична похибка, невдала операціоналізація або культурно невалідна шкала можуть змінити оцінки та їхню інтерпретацію. Статистика не виправляє слабку вимірювальну модель.


Питання 8. Чи є незалежне підтвердження? Один p-value — локальний результат одного аналізу. Реплікації, метааналітичний синтез і узгоджені результати різних дизайнів формують сильніший evidence base.


Як коректно повідомляти результат


Сучасний звіт має показувати не лише зірочку біля p. APA standards вимагають точних p-values, ефектів і 95% confidence intervals для емпіричних досліджень, коли це можливо. Cochrane також радить подавати точний p разом із довірчим інтервалом і уникати надмірної залежності від дихотомії «значуще / незначуще».


Замість «ефект статистично значущий, p < .05» інформативніше повідомити саму оцінку, її 95% CI, точне p-value, розмір вибірки, модель аналізу та ключові припущення. Якщо існує заздалегідь визначена практично або клінічно важлива межа, її також варто вказати.


Коли p надзвичайно мале, формат може залежати від стандарту журналу або програмного забезпечення. Для інтерпретації важливіше не кількість нулів після коми, а те, чи прозоро читач бачить оцінку, невизначеність, дизайн і весь контекст аналізу.


Методологічний статус: що встановлено, а що залишається предметом дискусії


Добре встановлені принципи


Добре встановлено, що p-value не є ймовірністю істинності гіпотези; що статистична значущість не вимірює величину або практичну важливість ефекту; що точний p-value слід інтерпретувати разом із дизайном, оцінкою ефекту та невизначеністю; що множинність і прихована аналітична гнучкість можуть змінювати частоту хибнопозитивних результатів. Ці принципи узгоджуються між ASA, Greenland та співавторами, Cochrane та сучасними стандартами психологічного звітування.


Дискусійна частина — роль самого ярлика «статистично значущий»


Методологи розходяться не стільки щодо базових помилок інтерпретації, скільки щодо того, що робити з традиційним ярликом. Редактори спеціального випуску The American Statistician у 2019 році рекомендували відмовитися від терміна і не дихотомізувати результати за довільним порогом. Водночас у деяких задачах заздалегідь визначені правила рішення з контрольованими error rates залишаються потрібними — наприклад, у підтверджувальному тестуванні, регуляторних або інженерних рішеннях.


Тому коректна сучасна позиція полягає не в магічній заміні .05 на інше число, а в узгодженні статистичного методу з питанням і рішенням. Якщо потрібне безперервне наукове тлумачення, краще показувати повну картину оцінки та невизначеності. Якщо потрібне формальне рішення, поріг має бути обґрунтований заздалегідь разом із ціною помилок, планом аналізу та правилами множинності.


Типові помилки інтерпретації


«p = .03 означає 3% шансів, що нульова гіпотеза правдива». Ні. Це підміна P(дані | H0) на P(H0 | дані).


«p = .03 означає 97% шансів, що ефект існує». Ні. Класичний p-value не обчислює posterior probability ефекту.


«p < .05 означає великий ефект». Ні. Величина p залежить і від точності оцінки, зокрема розміру вибірки.


«p > .05 означає, що ефекту немає». Ні. Це може бути результат неточного дослідження; для твердження про практичну відсутність ефекту потрібні відповідний дизайн і межі еквівалентності.


«Якщо одна група має p < .05, а інша p > .05, групи відрізняються». Ні. Потрібний прямий тест різниці між ефектами.


«p < .05 доводить причинність». Ні. Причинність визначається дизайном і каузальними припущеннями, а p лише характеризує конкретний статистичний тест.


«Малий p компенсує слабкий дизайн». Ні. Bias, confounding, measurement error, selective reporting і помилки моделі можуть залишатися незалежно від розміру p.


FAQ


Що означає p < .05 простими словами?


За обраної нульової гіпотези, статистичної моделі та тесту дані дали тестову статистику, яка має p-value менше .05. Якщо α було наперед установлено на .05, результат перетнув цей поріг. Це не означає 95% імовірності істинності дослідницької гіпотези.


Чи означає p = .05, що шанс помилки становить 5%?


Ні. α = .05 може контролювати довгострокову частоту помилки першого роду для заздалегідь визначеної процедури за її припущень. p конкретного аналізу не є posterior probability того, що саме цей висновок помилковий.


Що краще: p = .049 чи p = .051?


Відмінність між ними мізерна. Обидва значення потрібно читати як безперервні результати в контексті оцінки ефекту, довірчого інтервалу, дизайну та всіх проведених аналізів. Двійкова межа .05 не створює якісної прірви між двома результатами.


Чи може дуже малий ефект бути статистично значущим?


Так. У великій вибірці навіть дуже мала різниця може бути оцінена достатньо точно, щоб дати малий p. Саме тому статистична значущість не є показником практичної важливості.


Чи може важливий ефект бути статистично незначущим?


Так. Невелика вибірка або висока варіативність можуть залишити оцінку неточною. У такому разі широкий довірчий інтервал може включати як практично важливі, так і майже нульові ефекти.


Чи треба взагалі використовувати p-value?


Він може бути корисною частиною статистичного аналізу, якщо правильно визначено питання, тест і припущення та якщо p не замінює оцінку ефекту, невизначеність і предметне судження. Деякі сучасні методологи радять відмовитися від ярлика «статистично значущий», але не обов’язково від самих безперервних p-values.


Чим статистична значущість відрізняється від клінічної?


Статистична значущість стосується результату статистичного тесту відносно нульової моделі та порога. Клінічна важливість стосується того, чи має величина зміни відчутний сенс для симптомів, функціонування, ризику, якості життя або іншого клінічно релевантного outcome.


Чи можна за p-value визначити, що психологічний тест валідний?


Ні. Валідність — це сукупність доказів на користь певної інтерпретації та використання score. Окремий статистично значущий зв’язок може бути частиною evidence, але не замінює конструктну, змістову, структурну, кроскультурну та іншу релевантну валідаційну роботу.


Пов’язані статті


Довірчий інтервал — як 95% CI показує невизначеність оцінки і чому його не можна тлумачити як 95% імовірності для вже обчисленого частотного інтервалу.


Множинні порівняння — чому багато тестів збільшують ризик випадкових «значущих» результатів і як працюють корекції.


Кореляція і причинність — чому статистично значущий зв’язок між змінними сам по собі не встановлює причинного ефекту.


Психометрія — як оцінюють надійність, валідність, похибку вимірювання та придатність психологічних тестів.


Психологічне дослідження — дизайн, змінні, вибірка, статистичний аналіз і логіка доказового висновку в психології.


Розмір ефекту — що показує величина ефекту і чому її потрібно читати поруч зі статистичною значущістю.


Помилка першого роду — як Type I error пов’язана з рівнем α, правилом p < .05 та множинним тестуванням.


Джерела












 
 
bottom of page