top of page

Психологічна енкциклопедія

Класична теорія тестів: істинний бал, похибка вимірювання і надійність

6 днів тому
Читати 14 хв

Оновлено: 6 днів тому

Автор: Український психологічний ХАБ · Опубліковано: 23 вересня 2026 · Редакційна політика


Класична теорія тестів (Classical Test Theory, CTT) — це базова психометрична рамка, у якій спостережуваний тестовий бал розглядають як суму істинного бала та похибки вимірювання: X = T + E. Її головна ідея проста, але наслідки принципові: один отриманий бал не є абсолютно точною величиною, а надійність описує, наскільки варіативність результатів пов’язана зі стабільними відмінностями між людьми, а не з похибкою. Сучасні Standards for Educational and Psychological Testing і далі ставлять надійність/точність та похибки вимірювання серед фундаментальних основ коректної інтерпретації тестових результатів.


CTT також називають теорією істинного бала. Тут «істинний бал» не означає приховану абсолютну правду про людину. У строгому класичному сенсі це математичне очікування результату в концептуальній сукупності допустимих повторень вимірювання. Огляд Cappelleri, Lundy та Hays формулює це як очікуваний бал за нескінченної кількості незалежних проведень. Це визначення є операційним і модельним: воно прив’язане до конкретного інструмента, процедури та умов вимірювання.


Коротко: що дає класична теорія тестів


Класична теорія тестів дає мову для чотирьох пов’язаних запитань: що означає отриманий бал; яку частину його мінливості можна пов’язати з похибкою; наскільки надійно тест розрізняє людей у певній популяції; з якою обережністю слід інтерпретувати індивідуальний результат.


У найпростішій моделі CTT спостережуваний бал X складається з істинного бала T і випадкової похибки E. Якщо припущення моделі виконуються, похибка в середньому дорівнює нулю, не корелює з істинним балом, а дисперсія спостережуваних балів може бути розкладена на дисперсію істинних балів і дисперсію похибки. Саме з цього розкладу випливає класичне визначення коефіцієнта надійності.


Ця схема стала історичною основою великої частини психометрії, але сучасна практика не зводить оцінювання якості тесту до одного коефіцієнта. AERA, APA та NCME наголошують, що докази точності мають відповідати конкретному призначенню бала, популяції та способу використання результату.


Основна формула: X = T + E


У формулі X = T + E символ X означає спостережуваний бал — те число, яке реально отримано після тестування. T означає істинний бал у сенсі CTT. E — похибка вимірювання, тобто відхилення конкретного спостережуваного бала від істинного бала в межах заданої моделі.


Формула не каже, що будь-який тест точно знає T і потім «додає» до нього помилку. Навпаки: безпосередньо спостерігаємо лише X. Компоненти T та E є теоретичним розкладом, який дає змогу формалізувати невизначеність і оцінювати надійність за даними про повторення, паралельні форми, пункти, оцінювачів або інші джерела варіативності.


Якщо базові припущення виконуються, можна записати σ²X = σ²T + σ²E. Тоді класична надійність ρXX′ = σ²T / σ²X = 1 − σ²E / σ²X. У словах: надійність — це частка дисперсії спостережуваних балів у певній популяції, яку модель приписує істинним відмінностям між людьми.


Таке визначення прямо використовують сучасні методологічні роботи про надійність. Hu та співавтори підкреслюють, що традиційна надійність у CTT зазвичай оцінюється на рівні популяції, а не як фіксована властивість кожної окремої людини.


Що насправді означає «істинний бал»


Істинний бал у CTT — не тотожний латентній рисі, «справжньому рівню інтелекту», «реальній тривожності» або іншій психологічній сутності. Він визначається через очікуваний результат конкретної процедури вимірювання. Тому істинний бал є тестоспецифічним: дві різні шкали, що претендують вимірювати близький конструкт, можуть мати різні істинні бали й різні шкали чисел.


Уявлення про нескінченні повторення — математичний прийом, а не практична вимога тестувати людину нескінченно. Концептуально ми питаємо: якби умови, які вважаються випадковими, могли багато разів змінюватися в допустимих межах, навколо якого середнього результату коливалися б спостережувані бали? Це середнє і є T у класичній моделі.


Звідси випливає важливе обмеження: істинний бал не є автоматично незмінним «ядром» людини. Якщо сам вимірюваний стан реально змінюється — наприклад, настрій, втома або гостра тривога — просте припущення про один незмінний T між часовими точками може бути непридатним. Для таких ситуацій потрібен дизайн, який розрізняє реальну зміну конструкта і похибку.


Сучасні дослідження також показують, що оцінювання істинного бала має власну статистичну невизначеність. У роботі van der Ark та співавторів 2026 року порівнюються класичне оцінювання істинного бала зі стандартною похибкою вимірювання та підхід Келлі з регресією до середнього; обидва потребують врахування упередженості й варіативності оцінок.


Похибка вимірювання: що входить у E


У базовій CTT E — випадкова складова, через яку конкретний результат відхиляється від істинного бала. Джерелами можуть бути випадкові коливання уваги, конкретний набір завдань, момент проведення, неоднозначність окремих пунктів, випадкові відмінності у поведінці оцінювача або інші фактори, які дизайн трактує як похибку.


Ключове слово — «дизайн». Те, що в одному дослідженні вважають похибкою, в іншому може бути частиною об’єкта інтересу. Якщо тест має вимірювати стабільну рису, часові коливання можуть виступати джерелом похибки. Якщо ж мета — виміряти стан саме в конкретний момент, реальна зміна стану між днями не є автоматично похибкою.


Це добре видно в сучасній методології досліджень надійності та похибки: Mokkink та співавтори показують, що час, оцінювачі, обладнання та інші джерела варіативності треба визначати наперед, а формула коефіцієнта залежить від того, які джерела варіюють і які утримують сталими.


Випадкова похибка і систематичне зміщення — різні речі


У спрощеній класичній моделі похибка E має випадковий характер і нульове математичне очікування. Систематичне зміщення працює інакше: воно може стабільно зсувати результати в один бік і при цьому майже не знижувати повторюваність. Тест може давати дуже стабільні, але систематично викривлені результати.


Тому висока надійність не доводить валідність. Надійність відповідає на питання про точність, узгодженість або відтворюваність балів у визначеній моделі. Валідність стосується обґрунтованості інтерпретацій і використання цих балів. Стабільно вимірювати «не те» цілком можливо.


Надійність у CTT: частка дисперсії, а не «відсоток правди»


Якщо коефіцієнт надійності дорівнює 0,84, це не означає, що «84% бала конкретної людини є правильними», що «тест точний на 84%» або що 16% відповідей помилкові. У класичному тлумаченні 0,84 означає, що за прийнятої моделі приблизно 84% дисперсії спостережуваних балів у відповідній популяції приписують дисперсії істинних балів, а решту — похибці.


Саме тому коефіцієнт надійності залежить не лише від інструмента. Якщо вибірка дуже однорідна і реальні відмінності між людьми малі, частка дисперсії похибки відносно загальної дисперсії може зростати, і коефіцієнт зменшиться. У більш різнорідній вибірці той самий інструмент може показати інше значення.


Це одна з причин говорити про «надійність балів у певній популяції та за певного використання», а не про незмінну «надійність тесту». Дослідження індивідуальної надійності додатково показує, що навіть усередині однієї популяції точність вимірювання може істотно відрізнятися між людьми.


Різні види надійності відповідають на різні запитання


Внутрішня узгодженість, тест-ретестова надійність, міжоцінювальна надійність і надійність паралельних форм не є різними назвами одного показника. Кожен дизайн змінює інше джерело потенційної похибки, тому коефіцієнти не слід механічно замінювати один одним.


Внутрішня узгодженість описує зв’язок між пунктами в межах одного вимірювання. Вона не перевіряє стабільність у часі і не показує, чи різні оцінювачі дадуть однаковий результат. Висока внутрішня узгодженість також не доводить одновимірність шкали.


Тест-ретестова надійність оцінює, наскільки результати відтворюються у часі за умов, коли конструкт очікується достатньо стабільним. Якщо сам конструкт змінюється, низька кореляція може відображати не лише похибку, а й реальну динаміку. Інтервал між вимірюваннями, ефекти пам’яті, навчання і зміни стану мають значення.


Міжоцінювальна надійність стосується узгодженості між оцінювачами. Для безперервних балів часто застосовують різні варіанти ICC, для категоріальних рішень — коефіцієнти κ. ICC і Cohen’s kappa відповідають різним типам даних та моделям узгодженості й не є взаємозамінними.


Надійність паралельних форм оцінює еквівалентність різних форм тесту. У строгій класичній теорії паралельні форми мають дуже сильні вимоги до істинних балів і дисперсій похибок. Реальні форми часто лише наближаються до цих умов, тому інтерпретація потребує перевірки того, наскільки припущення справді правдоподібні.


Сучасний огляд Revelle та Condon розглядає ці джерела надійності окремо та показує, що вибір коефіцієнта має випливати з моделі вимірювання і того, яку саме відтворюваність потрібно оцінити.


Чому альфа Кронбаха не є універсальною оцінкою якості тесту


Альфа Кронбаха стала надзвичайно популярною, але її часто використовують ширше, ніж дозволяє модель. Вона є показником внутрішньої узгодженості за певних припущень. Альфа не перевіряє тест-ретестову стабільність, міжоцінювальну узгодженість, валідність, культурну еквівалентність або клінічну корисність.


Класична критика Sijtsma показує, чому альфа має суттєві обмеження як універсальний індекс надійності. Revelle та Condon рекомендують розглядати модельно обґрунтовані альтернативи, зокрема різні коефіцієнти ω, але й вони не є магічною заміною: правильність оцінки залежить від структури даних і моделі.


Сучасні симуляційні дослідження підтверджують, що вибір між α, ω та іншими оцінками не зводиться до правила «омега завжди краща». Cho (2024) порівнює точність кількох однотестових оцінювачів і показує важливість умов, за яких кожен з них застосовується.


Висока альфа може зростати просто через велику кількість дуже схожих пунктів. Тест із повторюваними формулюваннями може мати високу внутрішню узгодженість і водночас вузько охоплювати конструкт. Тому «α ≥ 0,70» не є універсальним знаком того, що інструмент добрий, а значення нижче довільного порога не є автоматичним доказом непридатності. Потрібно враховувати мету, ставки рішення, структуру тесту, популяцію та інші докази якості.


Стандартна похибка вимірювання (SEM) і точність індивідуального бала


Коефіцієнт надійності описує співвідношення варіацій у групі. Для інтерпретації окремого бала корисно перейти до одиниць самої шкали через стандартну похибку вимірювання — standard error of measurement, SEM. У простій CTT-моделі її часто обчислюють як SEM = SDX × √(1 − r), де SDX — стандартне відхилення балів у відповідній вибірці, а r — доречна оцінка надійності.


SEM тут не означає standard error of the mean — стандартну похибку середнього. Це різні статистичні поняття, хоча англійська абревіатура SEM може створювати плутанину. Standard error of measurement описує типову невизначеність індивідуального вимірювання в одиницях тестової шкали; standard error of the mean описує невизначеність оцінки середнього вибірки.


У сучасних рекомендаціях з дослідження похибки Mokkink та співавтори окремо розрізняють reliability і measurement error: відносний коефіцієнт показує, наскільки добре можна розрізняти людей, тоді як SEM та споріднені абсолютні індекси показують розмір похибки в одиницях вимірювання.


Простий числовий приклад


Припустімо, у певній нормативній вибірці шкала має SD = 10, а доречний для нашої інтерпретації коефіцієнт надійності r = 0,84. Тоді SEM = 10 × √(1 − 0,84) = 4 бали. Якщо людина отримала 62 бали, один результат слід читати як оцінку з невизначеністю, а не як математично точну точку.


За найпростішої моделі з нормально розподіленою та сталою похибкою навколо спостережуваного бала часто будують орієнтовний інтервал X ± z·SEM для невизначеності істинного бала. За z = 1,96 для нашого прикладу це приблизно 54,2–69,8 бала. Такий інтервал має коректне тлумачення лише за припущень конкретної моделі; він не означає, що повторний результат гарантовано потрапить у ці межі, і не перетворює істинний бал на безпосередньо спостережувану величину.


Особливо важливо не перетворювати такий інтервал на діагностичну межу. Якщо тест має cutoff, похибка вимірювання означає, що люди біля порога можуть переходити через нього при повторенні без будь-якої суттєвої зміни стану. Сам cutoff також потребує окремих доказів діагностичної точності й клінічної корисності.


Похибка вимірювання не дорівнює реальній зміні


Різниця між двома балами може виникнути через реальну зміну конструкта, випадкову похибку або їх поєднання. Тому формула «було 52, стало 56 — отже, стало краще на 4 бали» без інформації про похибку є надто сильною інтерпретацією.


Для оцінювання зміни використовують окремі підходи: стандартну похибку різниці, reliable change index, мінімально виявлювану зміну та інші моделі залежно від дизайну. RCI не є тим самим, що клінічно або особисто важлива зміна; MDC не є тим самим, що MIC/MID. Статистично надійна зміна може бути надто малою, щоб мати практичне значення, і навпаки.


Чому надійність залежить від популяції та умов


Коефіцієнт надійності — відношення компонентів дисперсії. Через це він змінюється, коли змінюється розкид істинних відмінностей або розмір похибки. Обмеження діапазону, дуже однорідна вибірка, інша вікова група, нова мова, інший спосіб адміністрування, інше середовище або інша мета використання можуть змінити оцінку.


Тому не можна взяти число з одного дослідження — наприклад, α = 0,91 у студентів певного університету — і проголосити «надійність тесту = 0,91» для всіх людей, мов і завдань. Потрібні докази, релевантні саме тій популяції та інтерпретації, для якої використовують бал.


Цей принцип узгоджується з Standards for Educational and Psychological Testing: докази надійності/точності мають надаватися для кожного передбачуваного способу інтерпретації балів, а вид доказів повинен відповідати меті використання і психометричній моделі.


Надійність не дорівнює валідності


Надійність — необхідна передумова багатьох сильних інтерпретацій, але сама по собі не доводить, що тест вимірює саме потрібний конструкт. Якщо ваги стабільно показують на 5 кг більше, вони можуть бути дуже відтворюваними і водночас систематично неточними. У психологічному тестуванні аналогічно: стабільний бал може відображати небажану мовну складність, соціальну бажаність, специфічний формат завдань або інший сторонній фактор.


Валідність стосується доказів на користь конкретної інтерпретації та використання бала. Надійність стосується точності/відтворюваності в певному дизайні. Face validity — те, що тест «на вигляд здається правильним», — не є доказом конструктної валідності. Висока альфа також не є таким доказом.


Класична теорія тестів і культурна адаптація


Переклад тесту українською не створює автоматично валідованої української версії. Навіть якщо переклад граматично бездоганний і показує прийнятну внутрішню узгодженість, ще потрібно перевірити змістову та конструктну еквівалентність, надійність у цільовій популяції, структуру шкали, потенційне диференційне функціонування пунктів, норми та інші докази залежно від призначення.


Міжнародна тестова комісія у Guidelines for Translating and Adapting Tests прямо розрізняє переклад і ширший процес адаптації та вимагає емпіричних доказів еквівалентності, надійності й валідності в новій мовній і культурній популяції.


Вимірювальна інваріантність також не означає автоматичної відсутності bias, а DIF сам по собі не є автоматичним доказом несправедливості тесту. Це окремі рівні аналізу, які треба інтерпретувати разом зі змістом пунктів, моделлю конструкта та наслідками використання результатів.


Що CTT добре робить


Сила класичної теорії тестів — у прозорій логіці й практичності. Вона дає зрозумілий спосіб мислити про невизначеність бала, дозволяє оцінювати різні форми надійності, працює з простими сумарними показниками й залишається корисною для розроблення та аналізу багатьох психологічних і освітніх шкал.


CTT особливо корисна, коли дослідника цікавить якість сумарного бала в конкретній популяції, коли вибірки не дозволяють складніші моделі або коли потрібна зрозуміла діагностика проблеми: чи надто велика випадкова похибка, чи достатньо відтворюється ранжування людей, чи дають паралельні форми близькі результати.


Обмеження класичної теорії тестів


Перше обмеження — залежність багатьох показників від конкретної вибірки й тестової форми. Статистики пунктів, дисперсія балів і надійність можуть змінюватися разом зі складом вибірки. Через це коефіцієнт не слід переносити в іншу популяцію без перевірки.


Друге — у базовій моделі похибка представлена одним загальним компонентом E. Якщо важливо одночасно розкласти похибку на оцінювачів, випадки, дні, форми, пункти та їх взаємодії, теорія генералізованості дає багатший апарат компонентів дисперсії.


Третє — традиційна CTT переважно дає глобальну оцінку точності для шкали та групи. У багатьох тестах точність відрізняється на різних рівнях латентної риси. Теорія відповіді на завдання (IRT) моделює ймовірність конкретних відповідей і може описувати інформацію та похибку залежно від рівня риси.


Порівняльний огляд CTT та IRT показує, що ці підходи відповідають на різні психометричні запитання; вибір між ними має залежати від типу інструмента, даних та мети аналізу, а не від правила «старе проти нового».


Четверте — одна загальна оцінка надійності може приховувати неоднакову точність для різних людей. Дослідження індивідуальної надійності показують, що припущення однакової похибки для всіх може бути надмірно спрощеним, особливо для змінних психологічних станів.


CTT, теорія генералізованості та IRT: як вони співвідносяться


Класична теорія тестів дає базовий розклад «істинний бал + похибка». Теорія генералізованості розширює цю логіку, коли джерел похибки декілька і їх потрібно оцінити одночасно. IRT переносить фокус на модель зв’язку між латентною рисою і відповідями на окремі завдання.


Ці рамки можна використовувати комплементарно. CTT може показати загальну надійність сумарного бала, G-theory — які саме фасети створюють похибку і як зміниться точність за іншого дизайну, IRT — де на континуумі риси тест дає найбільше інформації. Вибір моделі має випливати з вимірювального запитання.


Практичне читання тестового бала


Перед інтерпретацією психологічного бала корисно поставити не одне, а кілька послідовних запитань. Що саме тест претендує вимірювати? Для якої популяції зібрані докази? Який вид надійності релевантний нашому висновку? Який розмір похибки в одиницях шкали? Які є докази валідності? Чи підходять норми, мова і спосіб адміністрування? Які наслідки помилкового рішення?


Для низькоставкового дослідницького опису може бути прийнятний один рівень точності. Для рішення з високими ставками — клінічного, освітнього, професійного чи правового — потрібна сильніша сукупність доказів і більш обережна інтерпретація. Універсального коефіцієнта, який самостійно робить тест «достатньо хорошим», немає.


У професійному психологічному оцінюванні тест є лише одним джерелом інформації. Психологічна оцінка й оцінювання передбачають інтеграцію результатів із питанням оцінювання, контекстом та іншими релевантними даними.


YMYL: чого не можна висновувати з одного бала


Окремий тестовий бал, навіть отриманий дуже надійним інструментом, не встановлює психічний розлад. Скринінг не дорівнює діагнозу; symptom не дорівнює disorder; ризик-фактор не є діагнозом; cutoff не є універсальною біологічною межею «є / немає».


Для скринінгового або діагностичного застосування крім надійності потрібні окремі докази валідності, sensitivity і specificity, а для інтерпретації конкретного позитивного або негативного результату — PPV і NPV, які залежать від поширеності стану та базової ймовірності в цільовій популяції. ROC/AUC не дорівнює клінічній корисності.


Якщо тест не має валідованої української адаптації для потрібної популяції, сам факт існування українського перекладу не дає підстав використовувати норми чи cutoff з іншої мови так, ніби вони автоматично перенеслися. Права на використання тесту й психометрична якість — також різні питання: ліцензія не доводить валідність, а добра валідність не скасовує вимог авторського права та тестової безпеки.


Типові помилки інтерпретації


• «Надійність 0,90 означає, що тест правильний на 90%». Ні. Це відношення компонентів дисперсії в конкретній моделі та популяції.


• «Висока альфа доводить, що шкала одновимірна». Ні. Внутрішня узгодженість не є тестом одновимірності.


• «Якщо тест надійний, він валідний». Ні. Стабільно можна вимірювати не той конструкт або мати систематичне зміщення.


• «Істинний бал — це реальна психологічна сутність людини». У CTT це математично визначений очікуваний бал для конкретної процедури вимірювання.


• «Будь-яка різниця між двома тестуваннями — реальна зміна». Ні. Потрібно врахувати похибку різниці та модель зміни.


• «SEM — це стандартна похибка середнього». У психометричному контексті SEM часто означає standard error of measurement; це інше поняття.


• «Одна надійність достатня для всіх популяцій». Ні. Коефіцієнт залежить від варіативності вибірки, умов і використання.


• «Український переклад автоматично є українською валідованою адаптацією». Ні. Адаптація потребує окремого процесу та емпіричних доказів.


Науковий статус класичної теорії тестів


Класична теорія тестів — усталена психометрична теорія, а не попередня гіпотеза чи інтернет-термін. Її базовий апарат — істинний бал, похибка та надійність — залишається частиною сучасних стандартів тестування й методологічної освіти. Водночас конкретні спрощення базової моделі мають добре відомі межі, тому сучасна психометрія використовує також факторні моделі надійності, теорію генералізованості, IRT та інші підходи.


Чинні на момент публікації Standards for Educational and Psychological Testing — видання 2014 року; AERA, APA та NCME вже ведуть його перегляд. APA повідомляє, що спільний комітет з ревізії сформовано у 2024 році. Тому стаття спирається на чинний стандарт і водночас враховує новіші методологічні публікації до 2026 року.


Часті запитання


Чи є істинний бал реально існуючим числом?


У межах CTT він є теоретично визначеним математичним очікуванням результату за концептуальних повторень вимірювання. Це не безпосередньо спостережуване число і не універсальна «істина про людину» незалежно від конкретного тесту.


Чи можна дізнатися істинний бал точно?


Ні, безпосередньо ми спостерігаємо X. Істинний бал оцінюють статистично, а оцінка має невизначеність. Розмір цієї невизначеності залежить від надійності, дисперсії, моделі та способу оцінювання.


Що краще: висока надійність чи низький SEM?


Це пов’язані, але різні подання точності. Висока надійність означає велику частку істинної дисперсії відносно загальної у певній популяції. Малий SEM означає невелику абсолютну похибку в одиницях шкали. Для індивідуальної інтерпретації SEM часто інтуїтивно корисніший, але обидва показники залежать від моделі й даних.


Який коефіцієнт надійності вважається достатнім?


Універсального порога немає. Вимоги залежать від призначення, ставок рішення, типу коефіцієнта, популяції та наслідків помилки. Значення, прийнятне для групового дослідження, може бути недостатнім для індивідуального високоставкового рішення.


Чи завжди треба рахувати альфу Кронбаха?


Ні. Альфа відповідає лише одному класу питань про внутрішню узгодженість і має модельні припущення. Для стабільності в часі потрібен тест-ретестовий дизайн, для оцінювачів — міжоцінювальний, для паралельних форм — відповідний дизайн. Для внутрішньої структури можуть бути доречні модельні коефіцієнти ω та факторний аналіз.


Чи означає тест-ретест кореляція, що тест точний?


Вона показує один аспект відтворюваності, але може змішувати похибку з реальною зміною конструкта, залежати від інтервалу, пам’яті та умов. Вона не замінює інші докази надійності й валідності.


Чим CTT відрізняється від IRT?


CTT переважно описує властивості сумарних балів і загальну похибку в конкретній вибірці. IRT моделює відповіді на окремі завдання як функцію латентної риси і параметрів пунктів, що дозволяє описувати інформацію та точність уздовж континууму риси.


Чим CTT відрізняється від теорії генералізованості?


У базовій CTT похибка часто представлена одним агрегованим E. G-theory дозволяє одночасно оцінювати кілька джерел варіативності — наприклад, пункти, оцінювачів, ситуації та їх взаємодії — і прогнозувати, як зміна дизайну вплине на залежність результатів.


Чи можна використовувати CTT для клінічного тесту?


Так, CTT широко застосовують до клінічних шкал, але сама надійність не встановлює діагностичну придатність. Потрібні докази валідності, точності для цільової популяції, коректних норм або порогів, а для діагностичних рішень — окремі показники діагностичної точності та професійна оцінка.


Чи робить високий коефіцієнт надійності тест справедливим?


Ні. Надійність не доводить культурну еквівалентність, відсутність DIF, вимірювальну інваріантність або справедливість наслідків тестування. Fairness потребує окремих доказів і аналізу контексту використання.


Пов’язані статті









Джерела


American Educational Research Association, American Psychological Association, & National Council on Measurement in Education. (2014). Standards for Educational and Psychological Testing. Офіційна сторінка APA


Cappelleri, J. C., Lundy, J. J., & Hays, R. D. (2014). Overview of Classical Test Theory and Item Response Theory for Quantitative Assessment of Items in Developing Patient-Reported Outcome Measures. Clinical Therapeutics, 36(5), 648–662. Повний текст


Cho, E. (2024). Beyond alpha and omega: The accuracy of single-test reliability estimators in unidimensional continuous data. Behavior Research Methods, 56(6), 6299–6317. PubMed


Hu, Y., Nesselroade, J. R., Erbacher, M. K., Boker, S. M., & Burt, S. A. (2016). Test Reliability at the Individual Level. Structural Equation Modeling, 23(4), 532–543. Повний текст


International Test Commission. (2017). The ITC Guidelines for Translating and Adapting Tests (Second Edition). Офіційний документ


Mokkink, L. B., Eekhout, I., Boers, M., van der Vleuten, C. P. M., & de Vet, H. C. W. (2023). Studies on Reliability and Measurement Error of Measurements in Medicine – From Design to Statistics Explained for Medical Researchers. Patient Related Outcome Measures, 14, 193–212. Повний текст


Revelle, W., & Condon, D. M. (2019). Reliability from α to ω: A tutorial. Psychological Assessment, 31(12), 1395–1411. PubMed


Sijtsma, K. (2009). On the use, the misuse, and the very limited usefulness of Cronbach’s alpha. Psychometrika, 74, 107–120. Springer


van der Ark, L. A., Emons, W. H. M., Ellis, J. L., & Sijtsma, K. (2026). Bias and precision in true-score estimation. British Journal of Mathematical and Statistical Psychology. Advance online publication. PubMed

 
 
bottom of page