t-критерій Стьюдента: коли застосовувати t-тест і як інтерпретувати результат
Український психологічний ХАБ · Опубліковано: 7 жовтня 2026 року · Редакційна політика
t-критерій — це статистичний тест, у якому різницю між оціненим середнім і значенням, передбаченим нульовою гіпотезою, співвідносять зі стандартною похибкою цієї різниці. Якщо невідома популяційна дисперсія оцінюється за вибіркою, стандартизована різниця за відповідної моделі має t-розподіл, а його форма залежить від числа ступенів свободи. Історично цей підхід пов’язаний із роботою Вільяма Сілі Ґоссета, опублікованою під псевдонімом Student у 1908 році; оригінальна стаття «The Probable Error of a Mean» заклала основу t-розподілу та t-тестування.
У психологічних дослідженнях назва «t-критерій Стьюдента» часто використовується як загальна назва сімейства t-тестів. Практично потрібно розрізняти щонайменше одновибірковий t-тест, t-тест для двох незалежних груп і парний t-тест. Для двох незалежних груп окремо існують класичний тест Стьюдента з припущенням рівності дисперсій і тест Уелча, який не вимагає цього припущення. Для більшості звичайних порівнянь незалежних груп тест Уелча є надійнішим стандартним вибором; методологічне обґрунтування цього підходу для психології докладно подали Delacre, Lakens і Leys.
t-тест відповідає на вузьке статистичне запитання. Він не визначає, чи є різниця важливою, клінічно значущою або причинною. Значення t, ступені свободи й p-значення потрібно читати разом з оцінкою різниці, довірчим інтервалом, розміром ефекту, дизайном дослідження та якістю даних. Це узгоджується з Journal Article Reporting Standards Американської психологічної асоціації, де статистичні результати розглядаються як частина повного й прозорого звітування.
Коротка відповідь: який t-тест обрати
Одновибірковий t-тест застосовують, коли є одна вибірка і потрібно перевірити, чи відрізняється її середнє від заздалегідь заданого значення μ₀. Наприклад, чи відрізняється середній час реакції в досліджуваній групі від теоретичного або нормативного значення 500 мс.
t-тест для незалежних вибірок застосовують, коли порівнюють середні двох різних груп і кожне спостереження належить лише одній групі. Якщо дисперсії не потрібно вважати рівними, використовують тест Уелча. Класичний незалежний t-тест Стьюдента з об’єднаною оцінкою дисперсії доречний тоді, коли припущення про спільну дисперсію справді входить до моделі аналізу.
Парний t-тест застосовують, коли два значення утворюють природну пару: вимірювання тієї самої людини до і після втручання, дві умови для того самого учасника або ретельно сформовані пари. Він тестує середнє різниць усередині пар, а не різницю двох незалежних середніх.
Якщо груп більше двох, є кілька повторних вимірювань, ієрархічна структура, виражена залежність між спостереженнями або інша складна схема, окремі t-тести часто перестають бути адекватною моделлю всієї задачі. Тоді потрібні дисперсійний аналіз, регресійна, змішана або інша модель відповідно до дизайну.
Що саме вимірює t-статистика
У найзагальнішому вигляді t-статистика — це оцінена різниця, поділена на її стандартну похибку: t = оцінка різниці / стандартна похибка. Чисельник показує, наскільки дані відхилилися від нульового значення. Знаменник показує, наскільки нестабільною є така оцінка через вибіркову мінливість за прийнятої статистичної моделі.
Тому t = 0 означає, що оцінена різниця точно збігається з нульовим значенням у вибірці. Велике абсолютне |t| виникає, коли різниця велика відносно її стандартної похибки. Знак t показує напрямок лише відносно того, як дослідник записав різницю: якщо від середнього групи 1 відняти середнє групи 2, перестановка груп змінить знак t, але для двостороннього тесту не змінить силу статистичної невідповідності нульовій моделі.
Стандартна похибка не є стандартним відхиленням індивідуальних результатів. Стандартне відхилення описує розсіювання спостережень, а стандартна похибка — вибіркову невизначеність оцінки. Саме тому збільшення числа незалежних спостережень за інших рівних умов зменшує стандартну похибку і може збільшувати |t| навіть за тієї самої оціненої різниці.
Одновибірковий t-тест
Для однієї вибірки нульова гіпотеза зазвичай має вигляд H₀: μ = μ₀, де μ — популяційне середнє, а μ₀ — задане порівнюване значення. Статистика обчислюється як t = (x̄ − μ₀) / (s/√n), де x̄ — вибіркове середнє, s — вибіркове стандартне відхилення, n — число незалежних спостережень. Число ступенів свободи дорівнює df = n − 1.
Наприклад, якщо дослідника цікавить, чи відрізняється середній показник від 50, t-тест оцінює різницю x̄ − 50 відносно стандартної похибки середнього. Нульове значення 50 повинно мати зміст, заданий до аналізу: теоретичний еталон, норматив, технічну межу або інший обґрунтований референт. Порівнювати середнє з довільно вибраним числом лише тому, що це дає мале p-значення, не створює змістовної гіпотези.
Класична точна t-модель припускає, що незалежні спостереження походять із нормально розподіленої популяції. У реальних даних важливо перевіряти не символічне виконання «нормальності», а форму розподілу, викиди, механізм отримання даних і чутливість висновку до порушень моделі. Особливо обережним треба бути за малих n, сильної асиметрії або важких хвостів.
t-тест для двох незалежних груп
Незалежний t-тест порівнює два середні, коли спостереження в одній групі не утворюють пар зі спостереженнями в іншій. Типова нульова гіпотеза: H₀: μ₁ − μ₂ = 0. Важливе слово тут — незалежні. Якщо та сама людина дала два вимірювання, це вже не дві незалежні групи.
Класичний тест Стьюдента використовує об’єднану оцінку дисперсії. Спочатку обчислюють sₚ² = [(n₁ − 1)s₁² + (n₂ − 1)s₂²] / (n₁ + n₂ − 2), а потім t = (x̄₁ − x̄₂) / [sₚ√(1/n₁ + 1/n₂)]. Ступені свободи дорівнюють n₁ + n₂ − 2. Така конструкція спирається на модель спільної популяційної дисперсії для двох груп.
Якщо дисперсії різняться, об’єднання їх в одну оцінку може спотворювати стандартну похибку, особливо коли групи мають різні розміри. Саме тому в сучасній прикладній роботі часто доцільніше використовувати тест Уелча, а не спочатку проводити окремий тест рівності дисперсій і лише після цього вирішувати, який t-тест застосувати. Delacre та співавтори показують, що тест Уелча краще контролює помилку I роду за гетероскедастичності та мало втрачає, коли дисперсії насправді однакові.
Тест Уелча для незалежних вибірок
У тесті Уелча t = (x̄₁ − x̄₂) / √(s₁²/n₁ + s₂²/n₂). На відміну від класичного тесту Стьюдента, стандартна похибка враховує дисперсію кожної групи окремо. Ступені свободи оцінюють за наближенням Уелча—Саттертуейта: df = (s₁²/n₁ + s₂²/n₂)² / {[(s₁²/n₁)²/(n₁−1)] + [(s₂²/n₂)²/(n₂−1)]}.
Через цю формулу df у тесті Уелча часто не є цілим числом. Це нормальна властивість методу, а не помилка програми. Наприклад, результат t(58,35) = 2,91 цілком коректний. NIST Engineering Statistics Handbook окремо описує варіанти двовибіркового t-тесту з рівними й нерівними дисперсіями.
Поширене правило «спочатку тест Левена, а якщо він незначущий — Student, якщо значущий — Welch» створює зайву двоступеневу процедуру: рішення про основний тест стає залежним від іншого тесту з власною невизначеністю. Якщо наукова задача не потребує моделі спільної дисперсії, наперед обраний тест Уелча зазвичай дає простіший і стійкіший аналіз.
Парний t-тест: аналіз різниць усередині пар
Парний t-тест перетворює кожну пару на одну різницю dᵢ = Xᵢ,2 − Xᵢ,1, а потім фактично виконує одновибірковий t-тест для цих різниць. Формула: t = d̄ / (s_d/√n), де d̄ — середня різниця, s_d — стандартне відхилення різниць, n — число пар, df = n − 1.
Це означає, що припущення про форму розподілу стосується насамперед розподілу різниць, а не окремо значень «до» і «після». Два набори показників можуть бути сильно ненормальними самі по собі, але їхні різниці — достатньо регулярними для t-моделі, або навпаки.
Парність має походити з дизайну. Повторні вимірювання тієї самої людини є парними; випадково поставити в один ряд результати різних людей і назвати їх парами не можна. Якщо частина пар неповна через пропущені дані, звичайний парний t-тест аналізує лише повні пари, а механізм пропусків може впливати на валідність висновку.
Основні припущення t-тестів
Перше припущення стосується одиниці аналізу та незалежності. У незалежному t-тесті результати різних учасників або інших аналітичних одиниць не повинні містити неврахованої залежності. Дані учнів одного класу, пацієнтів одного терапевта, повторні спостереження однієї людини або багато реакцій на стимули часто мають кластерну структуру. Звичайний t-тест, який трактує всі рядки як незалежні, може суттєво занизити невизначеність.
Друге припущення стосується того, що середнє є змістовною характеристикою цільової змінної. t-тест створений для кількісних результатів, де різниця середніх має інтерпретацію. Для категорій, лічильників, пропорцій або дуже обмежених шкал інші моделі можуть краще відповідати природі даних. Питання психометричної валідності самої шкали належить до окремої задачі вимірювання і не вирішується t-тестом.
Третє припущення стосується форми розподілу помилок або різниць. За точної класичної моделі потрібна нормальність відповідної величини, але практичний аналіз не зводиться до механічного правила «Shapiro–Wilk p > .05 — t-тест дозволено». Формальний тест нормальності залежить від n: за великих вибірок він може знаходити незначні відхилення, а за малих — мати недостатню чутливість до важливих. Доцільно дивитися на розподіл, викиди, предметний механізм та за потреби виконувати аналіз чутливості.
Четверте припущення — рівність дисперсій — належить саме до класичного незалежного t-тесту Стьюдента з об’єднаною дисперсією. Воно не є вимогою тесту Уелча. Для одновибіркового й парного t-тестів питання «рівності дисперсій двох груп» взагалі не є відповідним припущенням.
П’яте припущення стосується плану відбору та узагальнення. t-формула може бути обчислена і для зручної вибірки, але статистична значущість не робить таку вибірку репрезентативною автоматично. Випадкове формування вибірки і рандомізація учасників між експериментальними умовами — різні механізми: перше пов’язане з узагальненням на популяцію, друге — з ідентифікацією причинного контрасту за належного дизайну.
Викиди, асиметрія та малі вибірки
Середнє й стандартне відхилення чутливі до крайніх значень, а отже, чутливим є і t-тест. Один помилково введений бал або рідкісне екстремальне спостереження в малій вибірці може суттєво змінити середню, дисперсію, t і p. Перед тестом потрібно перевірити якість даних, розподіл, можливі помилки введення та обґрунтованість екстремальних значень.
Правило «n ≥ 30, тому нормальність більше не важлива» не є універсальним законом. Робастність залежить від ступеня асиметрії, важких хвостів, балансу груп, різниці дисперсій та того, яку саме величину оцінюють. Вибір методу має виходити з властивостей даних і цільового параметра, а не з магічного порога розміру вибірки.
Якщо середнє залишається цільовою величиною, але дані мають серйозні проблеми з викидами або формою розподілу, можливі робастні методи або бутстреп-оцінювання невизначеності. Якщо наукове запитання стосується іншої характеристики розподілу, можуть бути доречними рангові чи інші непараметричні методи. Проте непараметричний тест не є автоматично «тим самим t-тестом без нормальності»: він може перевіряти іншу нульову гіпотезу і мати іншу інтерпретацію.
Односторонній чи двосторонній t-тест
Двосторонній тест перевіряє можливість відхилення в обидва боки: H₁: μ₁ − μ₂ ≠ 0. Односторонній тест задає напрям: наприклад, H₁: μ₁ − μ₂ > 0. Напрямок повинен випливати з дослідницького питання і бути визначений до перегляду результату.
Не можна спочатку побачити, у який бік змінилися середні, а потім вибрати відповідний односторонній тест, щоб зменшити p. Таке рішення змінює фактичну процедуру тестування і підвищує ризик хибнопозитивного висновку. Якщо ефект у протилежному напрямку також був би науково важливим, двостороння гіпотеза зазвичай точніше відповідає задачі.
Односторонній тест також не означає, що результат у протилежному напрямку можна оголосити доказом початкової гіпотези. Він лише по-іншому розподіляє область відхилення нульової гіпотези відповідно до заздалегідь сформульованого напрямку.
Як t перетворюється на p-значення
Після обчислення t статистична модель задає t-розподіл із певним df. Двостороннє p-значення — це ймовірність за нульової моделі отримати t-статистику з абсолютною величиною щонайменше такою, як спостережена. Чим далі t від нуля відносно відповідного t-розподілу, тим меншим стає p.
p-значення не є ймовірністю того, що нульова гіпотеза істинна. Воно також не є ймовірністю того, що «результат випадковий». Заява Американської статистичної асоціації щодо p-значень прямо підкреслює, що p-value описує дані відносно заданої статистичної моделі і не вимірює ймовірність істинності гіпотези.
Так само p = .03 не означає, що ефект має 97% шансів бути реальним. І p = .20 не означає, що з імовірністю 20% «ефект є». У частотному t-тесті гіпотеза і параметри не отримують таких постеріорних ймовірностей.
Статистична значущість не дорівнює величині або важливості ефекту
Якщо дослідник заздалегідь встановив α = .05 і отримав двостороннє p < .05, результат називають статистично значущим за цим правилом. Це конвенція прийняття рішення про несумісність даних із конкретною нульовою моделлю, а не оцінка практичної важливості.
Малий ефект у дуже великій вибірці може мати крихітне p. Великий, але неточно оцінений ефект у малій вибірці може не перетнути поріг .05. Тому p не є розміром ефекту і не повинен використовуватися як його заміна.
У психології важливість результату визначається предметним контекстом: шкалою показника, мінімально важливою різницею, наслідками для людей або рішень, витратами, ризиками та попередніми даними. Статистична значущість може входити до оцінки доказів, але сама по собі не відповідає на ці питання.
Чому p > .05 не доводить відсутності різниці
Нестатистично значущий t-тест означає, що за прийнятої процедури дані не дали підстав відхилити H₀ на обраному рівні α. Це не тотожне твердженню «ефекту немає». Причиною великого p може бути справді мала різниця, великий розкид, мала вибірка, слабка точність вимірювання або комбінація цих факторів.
Greenland та співавтори детально розбирають цю помилку: відсутність статистичної значущості не є доказом нульового ефекту, а після отримання даних так звана постфактум обчислену потужність не дає незалежного доказу «недостатньої потужності».
Якщо наукове питання справді звучить як «чи достатньо малий ефект, щоб вважати його практично еквівалентним нулю?», потрібна інша логіка. Один підхід — тестування еквівалентності з наперед визначеними межами найменшого ефекту, який має практичне значення. Lakens описує процедуру двох односторонніх тестів (TOST) для таких задач.
Довірчий інтервал: величина різниці й невизначеність
Разом із t-тестом варто подавати саму оцінену різницю середніх та її довірчий інтервал. Для двох груп це може бути, наприклад, ΔM = 3,60 бала, 95% CI [1,13; 6,07]. Інтервал показує, які значення різниці узгоджуються з даними та процедурою на відповідному рівні точності.
У класичній частотній інтерпретації не слід говорити, що після обчислення конкретного 95% інтервалу «істинне значення лежить у ньому з імовірністю 95%». 95% — властивість процедури побудови інтервалів у повторюваній системі вибірок: за виконання моделі така процедура покривала б істинний параметр приблизно у 95% повторень. Цю відмінність детально пояснюють Greenland та співавтори.
Для звичайного двостороннього t-тесту H₀: різниця = 0 і відповідного 95% довірчого інтервалу існує математичний зв’язок: за тієї самої моделі та процедури p < .05 відповідає інтервалу, який не містить нуль. Але інтервал дає більше інформації, бо показує не лише факт перетину порога, а й діапазон правдоподібних за процедурою величин ефекту.
Розмір ефекту поруч із t-тестом
Різниця середніх у природних одиницях часто є найпрозорішим описом ефекту: секунди, бали, мілісекунди, кількість правильних відповідей. Коли потрібно порівнювати результати між різними шкалами або дослідженнями, використовують стандартизовані показники, зокрема Cohen’s d або Hedges’ g. Lakens показує, як обчислювати й звітувати розміри ефекту для t-тестів і ANOVA.
Для незалежних груп Cohen’s d часто стандартизує різницю середніх через певну оцінку стандартного відхилення, а Hedges’ g додає поправку на маловибіркове зміщення. Водночас існують різні знаменники і різні цільові величини: pooled SD, SD контрольної групи, середнє SD тощо. Тому назва показника і формула повинні бути вказані, а не приховані за одним словом «ефект».
Для парних даних існують окремі стандартизації, наприклад d_z = d̄/s_d. Він використовує стандартне відхилення різниць і тому не тотожний незалежному d. Кореляція між повторними вимірюваннями впливає на знаменник, тож порівнювати різні версії d без уточнення формули некоректно.
Універсальні ярлики на кшталт «0,2 — малий, 0,5 — середній, 0,8 — великий» можуть бути лише грубими орієнтирами в окремому контексті. Практичний зміст ефекту потрібно визначати за предметною областю, шкалою, попередніми дослідженнями та наслідками рішення.
Приклад: як інтерпретувати тест Уелча
Уявімо дві незалежні групи. У групі 1: n₁ = 30, M₁ = 24,8, SD₁ = 5,1. У групі 2: n₂ = 32, M₂ = 21,2, SD₂ = 4,6. Різниця середніх становить 3,6 бала.
Для тесту Уелча стандартна похибка різниці дорівнює приблизно 1,24, t ≈ 2,91, df ≈ 58,35. Двостороннє p ≈ .005. 95% довірчий інтервал для різниці середніх — приблизно [1,13; 6,07]. За однією з поширених стандартизацій маловибірково скоригований Hedges’ g становить приблизно 0,73.
Коректне звітування може виглядати так: «Середнє у групі 1 було вищим на 3,60 бала; тест Уелча показав t(58,35) = 2,91, p = .005, 95% CI для різниці [1,13; 6,07], Hedges’ g ≈ 0,73». Такий запис повідомляє напрям і величину різниці, її невизначеність, тестову статистику та p.
Некоректний висновок звучав би так: «Імовірність, що групи однакові, становить 0,5%» або «з імовірністю 99,5% група 1 краща». p = .005 цього не означає. Так само з самого t-тесту не випливає, що належність до групи спричинила різницю.
t-тест і причинність
t-тест порівнює середні в межах статистичної моделі. Причинний висновок визначає не назва тесту, а дизайн і причинні припущення. У рандомізованому експерименті порівняння двох умов може оцінювати причинний контраст, якщо рандомізація збережена, втрати та порушення протоколу належно враховані, а вимірювання відповідає цільовому результату.
У спостережному дослідженні дві групи можуть відрізнятися за віком, вихідним станом, освітою, мотивацією, доступом до ресурсів або іншими чинниками. Значущий t-тест не усуває змішування через сторонні чинники, зміщення відбору, невизначеність часової послідовності чи систематичне зміщення вимірювання. Він показує статистичний контраст середніх, а не механізм його появи.
Тому формулювання висновку повинно відповідати дизайну. Для поперечного спостережного порівняння доречне «у вибірці групи відрізнялися за середнім показником», а не «фактор X спричинив зміну Y». Сила причинного твердження визначається ідентифікаційною стратегією, а не величиною |t|.
Розмір вибірки, точність і статистична потужність
Розмір вибірки впливає на стандартну похибку і, відповідно, на t, ширину довірчого інтервалу та статистичну потужність. За інших рівних умов більше незалежних інформативних спостережень дає точнішу оцінку. Проте велике n не виправляє систематичне зміщення, поганий дизайн або невдале вимірювання.
Планування розміру вибірки має бути пов’язане з первинною гіпотезою, мінімально важливою величиною ефекту або бажаною точністю, рівнем α, очікуваною варіативністю, дизайном і втратами. Універсального правила «для t-тесту достатньо 30 учасників» немає.
Після завершення дослідження не варто пояснювати p > .05 лише низькою постфактум обчислену потужність, обчисленою з того самого спостереженого ефекту. Корисніше показати оцінку різниці, довірчий інтервал, фактичний n і те, які ефекти сумісні з отриманою точністю. Greenland та співавтори розглядають типові помилки інтерпретації статистичної потужності після аналізу.
Помилки I і II роду в контексті t-тесту
Помилка I роду виникає, коли процедура відхиляє H₀, хоча в моделі нульова гіпотеза істинна. Рівень α задає довгострокову частоту таких помилок для визначеної процедури за виконання її припущень. α = .05 не означає, що кожен конкретний значущий результат має 5% шансів бути хибним.
Помилка II роду виникає, коли процедура не відхиляє H₀ за наявності конкретного ненульового ефекту, для якого визначена альтернатива. Її ймовірність β залежить від величини ефекту, n, варіабельності, α і тесту; потужність дорівнює 1 − β для заданого сценарію.
Ці помилки не є дзеркальними твердженнями про істинність гіпотези після отримання p. Вони описують поведінку процедури в системі можливих повторень за заданими моделями.
Множинні t-тести і ризик хибнопозитивних результатів
Якщо дослідник перевіряє багато результатів, підгруп, часових точок або варіантів аналізу і для кожного використовує α = .05 без урахування множинності, ймовірність принаймні одного випадкового «значущого» результату в сімействі тестів зростає. Це не проблема конкретно t-тесту, а властивість множинного тестування.
Рішення залежить від мети: наперед визначити первинний результат, контролювати сімейну помилку або частку хибних відкриттів, використовувати модель, яка одночасно представляє всі потрібні контрасти, або чітко маркувати дослідницькі аналізи. Механічно виконати десятки t-тестів і повідомити лише найменші p — методологічно слабка практика.
Зміна гіпотези після перегляду результатів і подання її як заздалегідь сформульованої є окремою проблемою від p-hacking. Обидві практики можуть створювати перебільшену переконливість результатів, але це різні механізми і їх не слід змішувати.
Коли t-тест застосовувати не варто
t-тест не є універсальним способом порівняння будь-яких двох колонок. Якщо результат бінарний, лічильний або має іншу спеціальну структуру, модель для середнього нормального результату може бути невідповідною. Якщо спостереження вкладені в людей, групи, терапевтів, школи або стимули, потрібна модель залежності.
Якщо є три або більше груп, серія попарних t-тестів без плану множинності не є повноцінною заміною моделі для всього фактору. Якщо є більше двох повторних часових точок, окремі парні t-тести втрачають структуру траєкторії й збільшують число перевірок.
Якщо наукова мета — перевірити медіану, розподільний зсув або рангову перевагу, потрібно обирати метод за цільовою величиною. Mann–Whitney або Wilcoxon не слід автоматично описувати як «t-тести для медіан»: їхня нульова гіпотеза й інтерпретація залежать від форми розподілів та додаткових припущень.
Якщо дослідник має багато предикторів, коверіат, взаємодії або потребу коригувати оцінку за базовими відмінностями, регресійна модель часто виражає задачу точніше. t-тест є спеціальним випадком ширшої лінійної моделі, але канонічний аналіз треба обирати за питанням, а не за звичністю кнопки в програмі.
t-тест і T-бал — різні поняття
У психології літера t використовується в різних контекстах. t-статистика в t-тесті — це відношення оціненої різниці до її стандартної похибки. T-бал у психологічних тестах — стандартизований психометричний бал, який часто має середнє 50 і стандартне відхилення 10. Схожість літери не означає спільності статистичної функції.
Так само «t-критерій Стьюдента» не є назвою будь-якої перевірки значущості коефіцієнта, хоча t-статистика виникає і в регресійних моделях. Тест коефіцієнта регресії має власний модельний контекст і не перетворює регресійний аналіз на двовибірковий t-тест.
Як правильно звітувати результат t-тесту
Повний результат повинен дозволяти читачеві відновити зміст порівняння. Мінімально корисно назвати варіант тесту; подати n, середні та стандартні відхилення або для парних даних опис різниць; указати t, df і точне p; подати оцінену різницю та довірчий інтервал; додати відповідний розмір ефекту й назвати його формулу; пояснити односторонність, множинність або аналіз чутливості, якщо вони були.
APA JARS для кількісних досліджень закликають звітувати статистичні результати так, щоб були видимі оцінки, невизначеність, вибірка, аналітичні рішення та контекст. Формула «t = …, p < .05» без опису порівнюваних величин і розміру ефекту дає лише фрагмент результату.
Приклад для незалежних груп: «Група A: M = 24,8, SD = 5,1, n = 30; група B: M = 21,2, SD = 4,6, n = 32. Тест Уелча: t(58,35) = 2,91, p = .005; різниця середніх = 3,60, 95% CI [1,13; 6,07]; Hedges’ g ≈ 0,73». Якщо g обчислено за конкретною формулою, її треба назвати в методах.
Для p бажано подавати точне значення, коли воно інформативне і надійно обчислене, а не тільки «p < .05». Запис p = .000 некоректний; якщо програма округлює дуже мале значення до нуля, зазвичай повідомляють p < .001 або точніше значення відповідно до стандарту звітування.
Як читати результат у статистичній програмі
Незалежно від програми спочатку знайдіть тип тесту: одновибірковий, парний, класичний незалежний тест Стьюдента або тест Уелча. Потім перевірте напрямок різниці й описові статистики. Після цього читайте t і df, p, оцінену різницю та її довірчий інтервал. Останнім кроком співвіднесіть статистичний результат із розміром ефекту, дизайном і дослідницькою гіпотезою.
У деяких пакетах для незалежних груп виводяться дві строки — рядок із припущенням рівності дисперсій і рядок без такого припущення. Друга відповідає корекції Уелча. Не варто автоматично вибирати строку лише за окремим тестом рівності дисперсій; краще визначити модель аналізу наперед.
Критичне значення t з таблиці залишається корисним для навчання логіки тесту, але сучасні програми обчислюють p безпосередньо. Рішення, засноване на порівнянні |t| із критичним t, і рішення за відповідним p є двома способами реалізувати ту саму тестову процедуру за однакових α, df і одно-/двосторонньої альтернативи.
Що t-тест не доводить
Статистично значущий t-тест не доводить, що ефект великий. Він не доводить практичну або клінічну важливість. Він не доводить правильність теорії, адже різні теоретичні механізми можуть передбачати той самий контраст. Він не доводить причинність без відповідного дизайну. Він не гарантує репрезентативність вибірки і не компенсує помилки вимірювання.
Нестатистично значущий t-тест не доводить, що середні однакові. Він не підтверджує H₀ як істину, не показує автоматично «низьку потужність» і не робить оцінену різницю нульовою. Щоб оцінювати практичну еквівалентність, потрібні наперед визначені межі й відповідна процедура.
Саме тому інференційна статистика розглядає t-тест як один інструмент у ширшій системі оцінювання невизначеності, а не як фінальний автоматичний вердикт про наукову гіпотезу.
Типові помилки інтерпретації
«p = .03 означає 3% імовірності, що H₀ істинна» — помилка. p обчислюється за умови нульової моделі і не є P(H₀ | дані). ASA та Greenland та співавтори прямо розбирають цю інверсію умовної ймовірності.
«p > .05 означає, що різниці немає» — помилка. Такий результат може бути сумісним і з нульовим, і з ненульовими ефектами. Дивитися потрібно на оцінку та інтервал невизначеності; для твердження про достатню близькість до нуля потрібне тестування еквівалентності або інша заздалегідь визначена процедура.
«Великий t означає великий ефект» — не обов’язково. t залежить і від ефекту, і від стандартної похибки, яка змінюється з n та варіабельністю. Для величини ефекту потрібна окрема оцінка.
«Якщо тест Левена незначущий, дисперсії доведено рівними» — помилка. Невідхилення нульової гіпотези не доводить рівність. Якщо рівність дисперсій не є суттєвою частиною моделі, тест Уелча часто дає кращу стандартну стратегію.
«Парний t-тест потрібен, коли дві групи мають однаковий n» — помилка. Парність визначається зв’язком між спостереженнями, а не однаковою кількістю людей.
«Вибірка випадково розподілена між умовами, отже вона репрезентативна для населення» — помилка. Рандомізація умов і випадковий відбір із популяції відповідають на різні методологічні питання.
Поширені запитання
Що таке t-критерій Стьюдента простими словами?
Це спосіб порівняти оцінену різницю середніх із тією невизначеністю, яку очікує статистична модель. t показує, на скільки стандартних похибок оцінка віддалена від нульового значення.
Коли застосовувати одновибірковий t-тест?
Коли є одна вибірка і змістовне референтне середнє μ₀, з яким потрібно порівняти вибіркове середнє. Спостереження мають відповідати моделі однієї кількісної змінної та бути незалежними на рівні аналізу.
Коли застосовувати незалежний t-тест?
Коли порівнюють середні двох незалежних груп. Для звичайної прикладної задачі без обґрунтованого припущення спільної дисперсії доцільно розглядати тест Уелча як стандартний варіант.
Коли застосовувати парний t-тест?
Коли кожне значення в одній умові має визначеного партнера в іншій: та сама людина до/після, дві умови в межах учасника або природно сформовані пари. Аналізуються різниці всередині пар.
Чи потрібна нормальність для t-тесту?
Точна класична t-модель спирається на нормальність відповідної випадкової величини: для парного тесту — насамперед різниць, для незалежного — помилок у групах. Практична надійність залежить від n, викидів, асиметрії, балансу та дисперсій; одного формального тесту нормальності недостатньо для змістовного рішення.
Чи обов’язково дисперсії двох груп мають бути однаковими?
Лише для класичного незалежного тесту Стьюдента з об’єднаною дисперсією. Тест Уелча не вимагає рівності дисперсій.
Чому в тесті Уелча df може бути дробовим?
Тому що ефективне число ступенів свободи оцінюється за формулою Уелча—Саттертуейта з урахуванням двох окремих дисперсій і розмірів груп. Дробове df є очікуваним результатом.
Що означає p < .05 у t-тесті?
За умови нульової гіпотези, статистичної моделі й процедури дані дали t-статистику, хвостова ймовірність якої менша за .05. Це не означає, що H₀ має менше 5% шансів бути істинною.
Що означає p > .05?
За обраним правилом нульову гіпотезу не відхилено. Це не є доказом нульового ефекту. Оцінка різниці й довірчий інтервал показують, які величини ще сумісні з даними.
Чи можна t-тестом порівнювати три групи?
Один двовибірковий t-тест порівнює два середні. Для трьох і більше груп потрібна модель усіх груп і запланованих контрастів, а множинні попарні тести потребують контролю помилки множинного тестування.
Чи можна t-тестом довести причинність?
Ні. t-тест є статистичною процедурою порівняння. Причинний висновок залежить від дизайну, часової структури, рандомізації або іншої ідентифікаційної стратегії та контролю альтернативних пояснень.
Чим t-статистика відрізняється від T-бала?
t-статистика є тестовою статистикою, побудованою з оцінки та стандартної похибки. T-бал — стандартизований психометричний бал. Це різні поняття, попри схожу назву.
Практичний алгоритм вибору
Спочатку сформулюйте цільову величину: яку саме середню або різницю середніх ви хочете оцінити. Далі визначте структуру даних: одна вибірка, дві незалежні групи чи пари. Для незалежних груп визначте, чи справді модель потребує спільної дисперсії; якщо ні, зазвичай обирайте Welch. Перевірте одиницю незалежності, викиди, форму розподілу й механізм отримання даних. Після тесту звітуйте не лише p, а оцінку різниці, довірчий інтервал та розмір ефекту.
Якщо структура задачі не вкладається в одну з цих трьох схем, не намагайтеся «втиснути» її в t-тест. Статистичний метод має представляти дизайн і цільове питання. Саме це відрізняє осмислений аналіз від механічного застосування критерію.
Пов’язані статті
Інференційна статистика в психології: оцінювання, перевірка гіпотез і невизначеність — батьківський вузол для статистичного оцінювання та перевірки гіпотез.
p-значення: що воно насправді означає і чого не говорить про гіпотезу або важливість ефекту — окрема канонічна сторінка про логіку та межі p-value.
Розмір ефекту: що він показує і чому потрібен поруч зі статистичною значущістю — як описувати величину відмінності окремо від статистичної значущості.
Довірчий інтервал: що означає 95% CI і як він показує невизначеність оцінки — точність оцінки та правильна частотна інтерпретація інтервалу.
Статистична потужність: що це, як залежить від розміру ефекту, вибірки й рівня значущості — планування здатності дослідження виявити заданий ефект.
