Тест-ретест надійність: як перевіряють стабільність результатів психологічного тесту в часі
Автор: Український психологічний ХАБ · Опубліковано: 23 вересня 2026 · Редакційна політика
Тест-ретест надійність, або ретестова надійність (test–retest reliability), показує, наскільки відтворюються результати одного й того самого психологічного вимірювання, коли ту саму процедуру повторюють у тих самих людей через певний проміжок часу. У термінології Standards for Educational and Psychological Testing це один зі способів оцінити reliability/precision щодо варіативності між окремими моментами вимірювання; NCME визначає test-retest reliability як коефіцієнт, отриманий повторним проведенням того самого тесту в тій самій групі після часового інтервалу.
У найпростішій схемі є два набори балів: T1 — перше тестування і T2 — повторне. Але сенс ретесту значно ширший за запитання «чи висока кореляція між T1 і T2?». Щоб результат справді говорив про стабільність вимірювання, потрібно обґрунтувати, що сам конструкт не мав істотно змінитися, інтервал не створює надмірного ефекту пам’яті або реальної зміни, умови вимірювання порівнювані, а статистичний показник відповідає типу даних та дослідницькому питанню. Саме ці вимоги підкреслює сучасний COSMIN.
Тому тест-ретест надійність не є «паспортною цифрою» тесту, що діє завжди. Вона характеризує конкретні бали в конкретній популяції, за конкретного інтервалу, процедури та способу аналізу. Висока ретестова стабільність також не доводить валідність: інструмент може стабільно відтворювати результат і водночас не підтримувати потрібну інтерпретацію.
Що саме перевіряє тест-ретест надійність
Ретестова надійність відповідає на запитання: якщо ми повторимо вимірювання за умов, у яких справжній рівень досліджуваної характеристики не повинен істотно змінитися, наскільки подібними будуть результати? APA Dictionary of Psychology описує retest reliability як міру узгодженості результатів інструмента в часі та оцінку стабільності вимірюваного конструкта.
Ключовим є словосполучення «не повинен істотно змінитися». У Standards повторення процедури трактують як незалежні адміністрації, між якими атрибут, що вимірюється, очікується відносно незмінним. Для відносно стабільної риси два вимірювання можуть бути реплікаціями процедури; для швидкоплинного стану на кшталт настрою або голоду ті самі два моменти можуть уже відображати реальну зміну стану, а не похибку.
Отже, низький тест-ретест коефіцієнт має щонайменше дві принципово різні інтерпретації: вимірювання справді нестабільне або сам конструкт змінився між T1 і T2. За двома точками часу ці джерела не завжди можна надійно розділити. Новіша методологічна робота Groh (2025) на симуляційних даних показує, що нестабільність істинного бала може знижувати звичайний test-retest coefficient, а залежність похибок між вимірюваннями — навпаки, штучно його підвищувати. Це не скасовує ретестові дослідження, але робить їхній дизайн та інтерпретацію критично важливими.
Коли тест-ретест справді доречний
Метод доречний тоді, коли дослідник має змістову підставу очікувати достатню стабільність конструкта протягом обраного інтервалу. Для рис особистості, деяких здібностей або відносно стійких характеристик це часто розумне питання. Для симптомів, емоційних станів, болю, стресу, втоми, мотивації або показників, які навмисно відстежують під час лікування, тренування чи життєвих змін, стабільність може бути не метою вимірювання, а лише одним із контекстних параметрів.
У клінічному моніторингу це особливо важливо. Якщо шкала створена, щоб бути чутливою до змін у симптомах, автоматично вимагати від неї дуже високої довгострокової тест-ретест стабільності означало б змішати дві різні властивості. COSMIN окремо визначає reliability як відтворюваність у людей, які не змінилися, а responsiveness — як здатність виявляти зміну конструкта в часі.
Тест-ретест також не замінює інші види надійності психологічного тесту. Якщо питання стосується узгодженості пунктів усередині шкали, потрібна внутрішня узгодженість; якщо різних оцінювачів — міжоцінювальна надійність; якщо двох еквівалентних форм — надійність паралельних форм. Кожен дизайн задає власне джерело варіативності.
Як проводять якісне тест-ретест дослідження
1. Повторно вимірюють тих самих людей
Базова схема передбачає, що один і той самий набір учасників проходить ту саму вимірювальну процедуру щонайменше двічі. Якщо між T1 і T2 істотно змінюється склад вибірки, порівняння вже змішує часову стабільність із відмінностями між людьми. Вибуття учасників теж потрібно описувати, особливо коли воно може бути пов’язане з рівнем симптомів, тяжкістю стану чи мотивацією.
2. Обґрунтовують стабільність конструкта
Дослідник має пояснити, чому учасників можна вважати достатньо стабільними щодо того, що вимірюється. COSMIN радить оцінювати це не формально, а змістово: враховувати втручання між вимірюваннями, природний перебіг стану, події, що могли змінити конструкт, і за можливості використовувати додаткову оцінку глобальної зміни або інше незалежне свідчення стабільності.
Якщо між двома тестуваннями відбулася психотерапія, медикаментозна зміна, навчання, тренування, гостра життєва подія або природна зміна стану, різниця між T1 і T2 може бути змістовним сигналом. Називати її просто «похибкою тесту» некоректно.
3. Вибирають доречний часовий інтервал
Універсального інтервалу для всіх психологічних тестів немає. Інтервал повинен бути достатньо довгим, щоб зменшити пряме запам’ятовування відповідей і короткочасний carry-over, але достатньо коротким, щоб справжній конструкт не встиг істотно змінитися. COSMIN прямо формулює цю логіку й зазначає, що для patient-reported measures часто використовують близько двох тижнів, однак доречність залежить від конструкта та цільової популяції.
У психологічних дослідженнях інтервали можуть бути від днів до місяців і років, якщо саме такий часовий горизонт відповідає intended use. Тому фраза «ретест роблять через два тижні» є лише типовим прикладом для певного класу інструментів, а не універсальним правилом.
4. Зберігають порівнювані умови
Окрім часу, інші умови мають бути максимально співмірними: інструкція, формат папір/екран, середовище, порядок стимулів, спосіб підрахунку, мова, допоміжні засоби, роль адміністратора. COSMIN вимагає, щоб повторні вимірювання проводилися за подібних умов, якщо саме ці умови не є навмисно досліджуваним джерелом варіативності.
Якщо перший раз людина проходить тест у тихій лабораторії на комп’ютері, а другий — удома з телефону під час перерви, отриманий коефіцієнт відображатиме не тільки часову стабільність. Він одночасно включатиме зміну середовища, пристрою та, можливо, способу взаємодії з тестом.
5. Зменшують вплив першого тестування на друге
Повторні адміністрації мають бути настільки незалежними, наскільки дозволяє дизайн. Учасник не повинен орієнтуватися на показаний йому попередній бал або навмисно відтворювати старі відповіді. Для когнітивних і нейропсихологічних тестів важливий ефект практики: людина може краще виконати завдання не тому, що змінилася її здатність, а тому, що вона вже знає формат, стратегію або частину стимулів. Метааналіз Calamia, Markon & Tranel (2012) показав, що practice effects залежать від типу тесту, віку, клінічного статусу, інтервалу та використання альтернативних форм.
Який коефіцієнт використовують
Відповідь залежить від шкали даних і від того, що саме потрібно назвати відтворюваним. Старі підручникові описи часто зводять тест-ретест до кореляції Пірсона між T1 і T2. Кореляція справді показує, наскільки зберігається відносний порядок людей, але сама по собі не гарантує, що числові значення залишилися близькими.
Для безперервних балів: ICC часто інформативніший
Для безперервних результатів COSMIN віддає перевагу внутрішньокласовому коефіцієнту кореляції — ICC — і для test-retest особливо оцінює моделі absolute agreement, які враховують систематичну зміну між моментами. Окрема стаття ХАБу про ICC пояснює, чому позначення моделі, типу та визначення agreement/consistency є частиною самого результату, а не технічною дрібницею.
Огляд Koo & Li (2016) показує, що існує кілька форм ICC, які можуть давати різні значення на тих самих даних. Автори рекомендують повідомляти модель, тип, визначення agreement/consistency та 95% довірчий інтервал. Сам запис «ICC = 0,82» без цих деталей часто недостатній для відтворюваної інтерпретації.
Чому Pearson r може вводити в оману
Уявімо, що кожен учасник під час повторного тестування отримав рівно на 10 балів більше, але порядок людей зберігся: хто був вище за інших у T1, той залишився вище у T2. Кореляція може залишатися майже ідеальною, хоча абсолютні результати систематично зсунулися. Робота Schuck (2004) демонструє цю проблему і пояснює, чому звичайна кореляція відображає лінійну асоціацію, але не тотожність парних вимірювань.
Подібне розрізнення формулює Berchtold (2016): reliability у вузькому сенсі може означати збереження ранжування, тоді як agreement — близькість конкретних значень. Для моніторингу індивідуальних змін саме agreement і абсолютна похибка часто мають не менше значення, ніж відносна стабільність.
Для категоріальних і порядкових результатів
Коли результат категоріальний, Pearson r або ICC можуть бути невідповідними. У рекомендаціях COSMIN для дихотомічних і номінальних категорій використовують kappa, а для порядкових категорій — weighted kappa з описом схеми ваг. Це ще раз показує: «коефіцієнт тест-ретест» не є одним універсальним числом для будь-якого типу результату.
Стабільність, agreement і похибка вимірювання — це не одне й те саме
Висока відносна надійність означає, що люди досить стабільно відрізняються одна від одної. Високий agreement означає, що повторні значення для конкретної людини близькі. Ці властивості пов’язані, але не тотожні. У широкій вибірці з великими реальними відмінностями між людьми ICC може бути високим навіть тоді, коли індивідуальна похибка помітна; у дуже однорідній вибірці ICC може бути нижчим, бо міжособистісної дисперсії мало.
Тому разом із коефіцієнтом reliability корисно оцінювати похибку вимірювання в одиницях самої шкали. Стандартна похибка вимірювання (SEM) описує очікуваний масштаб невизначеності індивідуального бала; це інше питання, ніж стандартна похибка середнього. Для висновку про те, чи змінився конкретний учасник, одного test-retest ICC недостатньо.
Що може знизити або штучно підвищити тест-ретест надійність
Справжня зміна конструкта
Якщо вимірювана характеристика реально змінилася, нижча відповідність між T1 і T2 не обов’язково свідчить про поганий тест. Особливо це стосується симптомів, настрою, стресу, втоми, болю, мотивації та інших станів. Ретестовий дизайн вимагає не просто повторити процедуру, а обґрунтувати, що в цьому конкретному дослідженні від учасників очікували стабільності.
Ефект пам’яті та практики
Надто короткий інтервал може підвищити схожість відповідей через пам’ять про попередню відповідь або покращити виконання завдяки знайомству із завданням. Standards прямо зазначають, що при використанні тієї самої форми кореляція може бути завищена через пригадування початкових відповідей. Для деяких когнітивних інструментів альтернативні форми зменшують practice effect, але тоді дизайн одночасно включає часову й формову варіативність.
Зміна умов проведення
Шум, пристрій, час доби, інструкція, адміністратор, спосіб подання, доступ до підказок або різний режим оцінювання можуть додати варіативності. Якщо ці фактори не є предметом дослідження, їх варто контролювати або щонайменше документувати.
Обмежений діапазон балів у вибірці
Коефіцієнти відносної надійності залежать від співвідношення між реальною варіативністю людей і похибкою. Дуже однорідна вибірка може дати нижчий ICC не тому, що повторні оцінки раптом стали хаотичними, а тому, що міжособистісні відмінності малі. Standards наголошують, що reliability/precision залежить від популяції і не повинна бездумно переноситися з однієї групи на іншу.
Залежні похибки між T1 і T2
Якщо один і той самий контекст систематично впливає на обидва вимірювання, похибки можуть бути пов’язаними, а коефіцієнт — завищеним. Groh (2025) показує на симуляціях, що така залежність може створювати ілюзію кращої reliability. Практичне правило звідси просте: дизайн тест-ретест потрібно оцінювати разом із коефіцієнтом, а не після нього.
Чи існує «правильний» поріг: 0,70, 0,80 чи 0,90
Універсального порога для всіх тестів, популяцій і рішень немає. Значення, потрібне для групового дослідження, може бути недостатнім для високоризикового індивідуального рішення. Важливість помилки залежить від того, для чого використовують бал, а точність самого коефіцієнта — від вибірки та її розміру.
У системі COSMIN для оцінювання reliability patient-reported outcome measures використовується критерій 0,70 як межа «sufficient» для ICC або kappa. Це корисне правило всередині конкретного framework, а не універсальний закон психометрії. Koo & Li пропонують інші практичні категорії для ICC і водночас прямо зазначають, що стандартних універсальних значень прийнятності немає. Тому якісне повідомлення має включати сам коефіцієнт, його 95% довірчий інтервал, дизайн, популяцію, інтервал і intended use.
Не варто перетворювати 0,69 і 0,71 на дві різні «реальності». Якщо довірчі інтервали широкі, така різниця може бути статистично й практично малозначущою. Порогові ярлики зручні для скринінгу літератури, але не замінюють повної інтерпретації.
Чому висока ретестова надійність не означає валідність
Надійність і валідність відповідають на різні запитання. Ретестова надійність показує, чи відтворюється результат у часі за релевантних повторень. Валідність стосується того, чи підтримують докази та теорія саме ту інтерпретацію балів і те використання, яке планується.
Уявімо опитувальник, що стабільно вимірює соціальну бажаність, але його помилково назвали тестом «емоційного інтелекту». Він може показати високу test-retest reliability й залишатися слабким інструментом для заявленої інтерпретації. Так само низька temporal stability станового показника не автоматично робить його «невалідним»: він може правильно відображати реальну мінливість конструкта.
Тест-ретест і внутрішня узгодженість вимірюють різні речі
Високий α Кронбаха або ω Макдональда не доводить, що результати стабільні через тиждень чи місяць. Внутрішня узгодженість працює з відносинами між пунктами в одному вимірюванні; тест-ретест — з повторенням у часі. Standards прямо застерігають, що internal-consistency, alternate-form і test-retest коефіцієнти не слід трактувати як взаємозамінні, бо вони включають різні визначення похибки.
Тому твердження «шкала надійна, α = 0,91» не відповідає на питання про часову стабільність. Для цього потрібні окремі ретестові дані або інший дизайн, який безпосередньо моделює варіативність між моментами.
Тест-ретест надійність і реальна зміна людини
Одна з найважливіших практичних помилок — прирівнювати різницю між двома балами до справжньої зміни. Якщо людина мала 18 балів у T1 і 23 у T2, сама різниця +5 ще не говорить, чи відбулася зміна конструкта, чи це варіація вимірювання, practice effect, систематичний зсув або поєднання кількох причин.
Для індивідуального моніторингу потрібно окремо враховувати measurement error. SEM оцінює невизначеність бала; показники на кшталт minimal detectable change намагаються визначити величину зміни, що перевищує очікувану похибку за заданого рівня довіри. Reliable Change Index — ще один підхід до питання про статистично надійну індивідуальну зміну. Але навіть статистично надійна зміна не автоматично є клінічно або особисто важливою.
Тобто тест-ретест reliability — фундамент для інтерпретації повторних вимірювань, але не готовий алгоритм «змінився / не змінився». Потрібні інші характеристики інструмента, контекст людини й мета оцінювання.
Чим тест-ретест відрізняється від надійності паралельних форм
У класичному same-form test-retest людина повторно проходить ту саму форму тесту. У parallel-forms design використовують дві форми, створені для еквівалентного вимірювання того самого конструкта. Якщо форма B подається пізніше за форму A, результат одночасно залежить від часової стабільності та еквівалентності форм. Тому такий коефіцієнт не можна механічно називати чистою test-retest reliability.
Окреме розведення цих джерел помилки важливе і для практики. Альтернативна форма може послабити пам’ять про конкретні завдання, але додати варіативність через відмінність самих форм. Саме тому надійність паралельних форм є окремим психометричним питанням.
Як читати ретестове дослідження: практичний чекліст
1. Чітко названо конструкт і пояснено, чому він мав залишатися стабільним між T1 і T2.
2. Вказано точний часовий інтервал і наведено змістове обґрунтування його тривалості.
3. Описано цільову популяцію, розмір вибірки, вибуття учасників і релевантні характеристики групи.
4. Умови двох адміністрацій були порівнюваними або відмінності свідомо включені в дослідницьке питання.
5. Учасникам не давали такої інформації про T1, яка могла б прямо керувати відповідями під час T2.
6. Для безперервних балів вказано конкретну форму ICC або інший обґрунтований показник; для категоріальних результатів застосовано відповідний показник agreement.
7. Повідомлено 95% довірчий інтервал, а не лише одну точкову оцінку.
8. Перевірено можливий систематичний зсув середніх або інший evidence of change між T1 і T2; за потреби наведено Bland–Altman або показники measurement error.
9. Автори не називають один коефіцієнт універсальним доказом «якості тесту», а співвідносять його з intended use.
10. Якщо тест використовується українською, є дані саме для відповідної мовної та культурної версії й релевантної української популяції; сам переклад не замінює психометричну перевірку.
Українська термінологія: «тест-ретест» чи «ретестова надійність»
В українській професійній літературі реально вживаються обидві форми: «ретестова надійність» і «тест-ретест надійність». У наукових публікаціях та навчальних матеріалах частіше трапляється «ретестова надійність», тоді як англомовний термін test–retest широко впізнаваний і часто входить у змішані формулювання. Для пошукової та термінологічної ясності ця стаття використовує обидві назви як синонімічні, з пріоритетом природної української форми «ретестова надійність» у звичайному тексті.
Водночас старі українські джерела нерідко описують ретест виключно як кореляцію Пірсона. Сучасна інтерпретація ширша: кореляція може бути одним із показників, але для continuous scores, де важлива абсолютна відтворюваність, ICC agreement та аналіз систематичного зсуву часто краще відповідають питанню.
Тест-ретест у психологічних і нейропсихологічних тестах
Нейропсихологія добре демонструє, чому одного загального правила недостатньо. Метааналіз Calamia, Markon & Tranel (2013) показав, що test-retest coefficients для багатьох поширених нейропсихологічних показників були достатньо високими, але для частини пам’яті та виконавчих функцій — нижчими; серед можливих причин автори називали ceiling effects, practice effects і реальну часову варіативність здібностей.
Це не означає, що для всіх когнітивних тестів слід очікувати один поріг або один інтервал. Важливо знати, що саме робить повторення із конкретним завданням: чи запам’ятовуються стимули, чи виробляється стратегія, чи є альтернативна форма, чи очікується навчання між вимірюваннями.
Клінічні та дослідницькі наслідки
У дослідженнях індивідуальних відмінностей низька temporal reliability обмежує точність зв’язків із іншими змінними та знижує відтворюваність ефектів. Але інтерпретація завжди повинна враховувати часовий масштаб: конструкт може бути достатньо стабільним на тижнях і помітно змінюватися на роках.
У клінічній практиці ретестові дані особливо корисні, коли інструмент застосовують повторно й потрібно зрозуміти, наскільки зміна бала перевищує очікувану варіативність. Водночас жоден ретестовий коефіцієнт сам по собі не встановлює діагноз, ремісію, погіршення чи терапевтичний ефект. Клінічне рішення спирається на симптоми, функціонування, анамнез, контекст, інші джерела інформації та валідність конкретного використання.
Типові помилки інтерпретації
«Високий Pearson r означає, що два вимірювання однакові». Ні. Висока кореляція може співіснувати із систематичним зсувом балів.
«Є універсальний оптимальний інтервал у два тижні». Ні. Два тижні — поширений орієнтир у частині PROM-досліджень; інтервал визначається конструктом, популяцією, practice/recall effects та intended use.
«Низький test-retest автоматично означає поганий тест». Ні. Він може відображати реальну мінливість конструкта, невдалий дизайн, зміну умов або похибку вимірювання.
«Високий α Кронбаха гарантує ретестову стабільність». Ні. Internal consistency і temporal stability оцінюють різні джерела варіативності.
«Якщо різниця між двома балами велика, людина точно змінилася». Ні. Потрібно врахувати measurement error, practice effects, systematic shift і контекст.
«Ретестова надійність належить тесту назавжди». Ні. Вона залежить від популяції, інтервалу, умов, версії та способу використання балів.
FAQ
Через скільки днів повторювати тест для оцінки ретестової надійності?
Універсального числа немає. Інтервал має бути достатньо довгим, щоб зменшити запам’ятовування, і достатньо коротким, щоб конструкт не встиг реально змінитися. Для багатьох patient-reported measures COSMIN наводить близько двох тижнів як поширений орієнтир, але в інших конструктах доречними можуть бути дні, тижні, місяці або значно довші періоди.
Чи достатньо кореляції Пірсона?
Для опису збереження лінійного ранжування вона може бути інформативною. Для відтворюваності безперервних балів, де систематичний зсув має вважатися похибкою, часто доцільніший ICC absolute agreement. Додатково можуть бути потрібні аналіз середньої зміни, Bland–Altman і показники абсолютної похибки.
Чи означає test-retest = 0,80, що тест «на 80% точний»?
Ні. Reliability coefficient є співвідношенням компонентів варіативності або показником відтворюваності за певною моделлю; його не слід перекладати як «80% правильності». Значення залежить від статистичного показника, популяції та дизайну.
Чи може стабільний тест бути невалідним?
Так. Стабільність не доводить, що інструмент вимірює потрібний конструкт або що його бали доречно використовувати для конкретного рішення. Reliability підтримує можливість точної інтерпретації, але не замінює validity evidence.
Чи потрібен test-retest для шкали, яка вимірює стан?
Іноді — так, але питання треба формулювати обережно. Якщо стан природно змінюється, тривалий ретест змішує реальну динаміку з похибкою. Може знадобитися коротший стабільний період, контроль контексту або інший longitudinal design.
Чи можна використовувати іншу форму тесту під час ретесту?
Можна, якщо це відповідає призначенню інструмента, але тоді коефіцієнт відображатиме і часову стабільність, і еквівалентність форм. Такий дизайн не слід плутати з чистим same-form test-retest.
Як зрозуміти, чи зміна бала в людини реальна?
Потрібні не лише ретестові дані, а й оцінка абсолютної похибки — наприклад SEM, а для конкретного завдання можуть використовувати MDC або RCI. Далі окремо оцінюють, чи є зміна клінічно або особисто важливою. «Перевищила похибку» і «має важливе значення» — різні твердження.
Пов’язані статті
Джерела
Groh, D. (2025). On the Unreliability of Test–Retest Reliability. Applied Psychological Measurement.
