top of page

Психологічна енкциклопедія

Істинний бал у класичній теорії тестів: що означає формула X = T + E

6 днів тому
Читати 13 хв

Автор: Український психологічний ХАБ · Опубліковано: 23 вересня 2026 року · Редакційна політика


Формула X = T + E — одна з найвідоміших формул психометрії. Вона стверджує, що спостережуваний бал X можна подати як суму істинного бала T і похибки E. Її простота оманлива: слово «істинний» часто змушує читача уявляти приховану «справжню психологічну величину» людини, яку тест нібито намагається відкрити. У класичній теорії тестів це поняття значно точніше й вужче.


У сучасному професійному словнику National Council on Measurement in Education (NCME) класична теорія тестів визначається як психометрична теорія, у якій спостережуваний результат складається з компонента істинного бала та незалежного випадкового компонента похибки. Сам істинний бал NCME визначає як середнє значення результатів, які людина отримала б на необмеженій кількості строго паралельних форм того самого тесту. Тобто T — це модельне математичне очікування результату вимірювання, а не безпосередньо спостережувана «сутність» людини.


Коротко: що означає X = T + E


У базовій класичній моделі:


X — observed score, спостережуваний бал: число, яке реально отримано під час конкретного тестування.


T — true score, істинний бал: очікуване значення спостережуваного бала за нескінченної кількості належно визначених повторень або строго паралельних форм.


E — error score, похибка: різниця між конкретним спостережуваним балом і відповідним істинним балом, тобто E = X − T.


Цю саму ідею фіксує APA Dictionary of Psychology: класична теорія тестів розкладає спостережуваний результат на істинний компонент і помилку вимірювання. У строгій психометричній інтерпретації головне слово тут не «істина», а «очікуване значення».


Що таке істинний бал у класичній теорії тестів


Істинний бал — теоретичне середнє результатів людини у визначеному просторі повторень вимірювання. Якщо уявити, що одну й ту саму людину можна без навчання, виснаження, запам’ятовування відповідей та інших систематичних змін протестувати нескінченну кількість разів за еквівалентних умов, середнє цих результатів і буде її класичним істинним балом для цього вимірювального процесу.


Таке трактування походить із фундаментальної класичної теорії. У статті Мелвіна Новіка 1966 року The Axioms and Principal Results of Classical Test Theory поняття реплікації, паралельних вимірювань і надійності формалізуються як частини єдиної стохастичної моделі. Пізніші огляди зберігають ту саму основу: T є математичним очікуванням X за повторних незалежних вимірювань.


Огляд Cappelleri, Lundy і Hays у Clinical Therapeutics підкреслює практичний наслідок: користувач тесту ніколи безпосередньо не спостерігає T. Він спостерігає лише X. Тому істинний бал є модельною величиною, яку можна оцінювати через властивості вимірювальної процедури, але не «зчитати» з одного результату.


Чому «істинний» не означає «справжня сутність людини»


Слово true у true score історично зручне, але легко вводить в оману. Класичний істинний бал прив’язаний до конкретного тесту, правила підрахунку, набору завдань і визначення повторного вимірювання. Він не є автоматично справжнім рівнем інтелекту, тривоги, депресивності, екстраверсії чи будь-якого іншого психологічного конструкту.


Цю межу добре показують сучасні роботи з надійності. McNeish і Dumas у статті 2025 року Reliability representativeness наголошують, що в класичній теорії T не обов’язково дорівнює фактичному значенню психологічного конструкту. Це очікуване значення саме того композитного бала, який утворюють вибрані дослідником пункти та правила підрахунку.


Звідси випливає критично важливе розрізнення: стабільно вимірювати певний бал і валідно вимірювати потрібний психологічний конструкт — різні задачі. Тест може давати дуже відтворювані результати, але ці результати можуть включати систематичні впливи, які не належать до цільового конструкту.


Що таке похибка E


У формулі X = T + E похибка E — це відхилення конкретного спостережуваного бала від його класичного істинного бала. Якщо X вище T, E додатна; якщо нижче — від’ємна. У класичній випадковій моделі очікуване значення похибки для людини дорівнює нулю: за нескінченних еквівалентних повторень позитивні й негативні випадкові відхилення взаємно компенсуються.


NCME визначає error of measurement як різницю між спостережуваним і відповідним істинним балом, а random error — як несистематичний компонент, що не має систематичного зв’язку з іншими змінними. Професійний глосарій NCME також окремо визначає systematic error — систематичну похибку, яка послідовно підвищує або знижує результати всіх чи частини респондентів і не належить до цільового конструкту.


На практиці випадковими джерелами варіації можуть бути коливання уваги, випадкове вгадування, дрібні відмінності у формулюваннях паралельних завдань, тимчасовий шум середовища, частина коливань стану або випадкова неточність оцінювання. Яке саме джерело вважатиметься похибкою, залежить від того, що в дослідженні визначено як допустиме повторення вимірювання.


Гіпотетичний приклад


Уявімо шкалу з діапазоном 0–40 балів. Людина проходить багато строго паралельних форм за умов, де цільова характеристика не змінюється. Її результати коливаються: 26, 29, 28, 31, 27, 30 і так далі. У нескінченному ряді середнє могло б, наприклад, дорівнювати 28,4. У межах цієї моделі 28,4 — T.


Якщо під час конкретного тестування людина отримала X = 31, то модельна похибка для цього вимірювання дорівнювала б E = 31 − 28,4 = +2,6. Якщо отримано X = 27, E = −1,4.


Це суто навчальний приклад. У реальній практиці ми не знаємо точного T людини, бо нескінченний ряд паралельних вимірювань недоступний. Тому не можна подивитися на результат 31 і заявити: «ваш істинний бал — 28,4, а похибка — 2,6». Психометрія працює з оцінками надійності, похибки та невизначеності на рівні моделі й даних.


Базові припущення класичної моделі


Формула X = T + E сама по собі є визначенням розкладу, але корисні статистичні висновки потребують додаткових припущень. У базовій класичній моделі зазвичай припускають, що середнє значення випадкової похибки дорівнює нулю, похибка не корелює з істинним балом, а похибки незалежних паралельних вимірювань не корелюють між собою.


Ці припущення детально розглядаються у класичній роботі Novick (1966) та в сучасних навчальних оглядах, зокрема Himelfarb (2019). Вони потрібні, щоб розкласти варіативність спостережуваних балів на істинну та випадкову компоненти.


За відповідних припущень на рівні популяції дисперсія спостережуваних балів розкладається як Var(X) = Var(T) + Var(E). Це не означає, що для окремої людини можна побачити обидві компоненти. Це означає, що в моделі загальна варіативність результатів у групі може бути описана як варіативність істинних балів плюс варіативність випадкової похибки.


Як із X = T + E виникає надійність


Класична надійність описує, яка частка варіативності спостережуваних балів пов’язана з варіативністю істинних балів, а яка — з випадковою похибкою. За класичним розкладом reliability можна подати як Var(T) / Var(X), або еквівалентно як 1 − Var(E) / Var(X).


У глосарії NCME reliability/precision визначено як ступінь узгодженості балів за повторних застосувань вимірювальної процедури та ступінь свободи балів від випадкової похибки для певної групи. Це формулювання важливе: надійність стосується балів у конкретному контексті й популяції, а не є вічною властивістю назви тесту.


Для окремих методів оцінювання надійності діють різні припущення. Внутрішня узгодженість, тест-ретест, міжекспертна надійність і надійність паралельних форм відповідають на різні питання про джерела варіації. Тому один коефіцієнт не описує «загальну якість» інструмента. Наприклад, формула Спірмена–Брауна стосується зв’язку між довжиною тесту та оцінкою надійності за певних умов, а не доводить валідність тесту.


Чому висока надійність не робить істинний бал «істинним конструктом»


У класичній теорії все, що відтворюється систематично в межах визначеної процедури, може потрапляти до компонента T. Саме тому класичний true score не захищений автоматично від систематичного зміщення.


Огляд Himelfarb про стандартизоване тестування й CTT прямо звертає увагу на цю проблему: систематичні впливи можуть увійти до істинного компонента класичного бала, тоді як випадкова похибка знижує надійність. Внаслідок цього тест може бути надійним і водночас мати слабке обґрунтування потрібної інтерпретації.


Сучасні Standards for Educational and Psychological Testing розглядають валідність через накопичення теорії та evidence, які підтримують конкретну інтерпретацію балів для конкретного використання. Отже, формула X = T + E описує точність і варіативність вимірювання, але не замінює валідизацію.


Систематична похибка і випадкова похибка — різні речі


Випадкова похибка змінює результат непослідовно й у класичній моделі в середньому прагне до нуля. Систематична похибка діє спрямовано: наприклад, мовна складність, що стабільно занижує результати певної групи, невідповідні умови тестування або спосіб оцінювання, який стабільно додає чи віднімає бали.


Якщо систематичний вплив відтворюється, він може не погіршити коефіцієнт надійності так само, як випадкова похибка. Проте він може спотворити значення бала, зменшити валідність інтерпретації та створити проблеми справедливості. Тому «стабільно неправильно» може бути дуже надійним, але не бути хорошим вимірюванням цільового конструкту.


NCME пов’язує fairness з валідністю інтерпретацій для всіх релевантних підгруп і з мінімізацією construct-irrelevant variance. Це ще одна причина не читати T як абсолютну психологічну істину. Див. визначення fairness, bias і construct-irrelevant variance у NCME Assessment Glossary.


Чи можна точно обчислити істинний бал конкретної людини


Ні, у класичній теорії тестів T є неспостережуваною величиною. Один результат X не дає достатньо інформації, щоб точно розкласти його на T і E. З рівняння 72 = T + E математично можливі безліч пар: T = 70 і E = 2; T = 74 і E = −2; T = 71,3 і E = 0,7 тощо.


Щоб говорити про точність індивідуального результату, потрібна інформація про надійність/precision, структуру похибки та шкалу бала. На її основі оцінюють стандартну похибку вимірювання та будують інтервали невизначеності. Це оцінювання, а не пряме спостереження T.


De Champlain у праймері з CTT та IRT пояснює: якби кандидата можна було тестувати нескінченну кількість разів без навчання між спробами, середнє результатів відповідало б істинному балу, а стандартне відхилення повторних результатів — стандартній похибці вимірювання.


Стандартна похибка вимірювання: як перейти від надійності до шкали бала


Стандартна похибка вимірювання, SEM, показує типовий масштаб випадкових відхилень спостережуваного бала навколо істинного бала в заданій моделі. Вона виражена в тих самих одиницях, що й тестовий бал. Це робить SEM практично зрозумілішою за безрозмірний коефіцієнт надійності, коли потрібно оцінити точність індивідуального результату.


NCME визначає standard error of measurement як стандартне відхилення спостережуваних результатів людини за повторних адміністрацій тесту або паралельних форм в однакових умовах; зазвичай його доводиться оцінювати за груповими даними. Джерело: NCME Assessment Glossary.


SEM у психометрії не слід плутати зі standard error of the mean — стандартною похибкою середнього. Обидва скорочуються як SEM в англомовній літературі, але описують різні об’єкти. Стандартна похибка вимірювання стосується точності індивідуального тестового бала; standard error of the mean — точності оцінки вибіркового середнього як оцінки середнього популяції.


Істинний бал залежить від того, що саме вважається повторенням


Найглибша ідея класичної теорії прихована в слові «повторення». Щоб визначити T, потрібно визначити universe of replications — набір вимірювань, які вважаються еквівалентними реалізаціями тієї самої процедури. Чи змінюються завдання? Чи змінюється час? Чи може змінюватися оцінювач? Чи зберігається однакова мова й формат?


Якщо повторення означає нову випадкову вибірку завдань із великого домену, item sampling стає джерелом похибки. Якщо змінюються оцінювачі, частина міжекспертних відмінностей може бути похибкою. Якщо нас цікавить стабільний trait у часі, тимчасові коливання можуть входити до похибки. Якщо ж сам стан у часі є предметом вимірювання, ці зміни можуть бути змістовним signal, а не error.


Саме цю проблему ширше розгортає generalizability theory, яка моделює кілька джерел варіативності окремо. NCME визначає її як framework для оцінювання reliability/precision через розклад різних джерел error variance. NCME Assessment Glossary.


Істинний бал і реальна зміна


Формула X = T + E не означає, що T завжди незмінний у житті. У класичному thought experiment T вважають стабільним у межах того набору повторень, для якого побудовано модель. Якщо між вимірюваннями відбувається навчання, лікування, розвиток, втома тривалої дії або справжня зміна стану, це вже може бути зміною самого цільового рівня, а не випадковою E.


Тому два результати, наприклад 18 і 22, не можна автоматично трактувати ані як «покращення на 4 пункти», ані як «лише похибку». Потрібно оцінити precision, часову стабільність, expected measurement error, контекст повторного тестування та мінімальну величину зміни, яка перевищує очікувану похибку. Окремо від цього постає питання, чи є зміна клінічно або особисто важливою.


Measurement error ≠ real change. І водночас перевищення очікуваної похибки ≠ автоматично clinically important change. Це різні рівні висновку.


Істинний бал, latent trait та IRT — не синоніми


У класичній теорії тестів T — очікуване значення конкретного тестового бала в заданому просторі повторень. У теорії відповіді на завдання (IRT) параметр особи, часто позначуваний θ, описує положення людини на латентній шкалі в межах конкретної IRT-моделі. Ці величини можуть бути концептуально пов’язані, але не є одним і тим самим об’єктом.


NCME визначає IRT як математичну модель функціонального зв’язку між відповіддю на завдання, характеристиками завдання та положенням респондента на вимірюваному конструкті. У тому ж глосарії ability/parameter в IRT названо аналогом, а не тотожністю класичного true score.


Практичне порівняння CTT та IRT подано в огляді De Champlain і в огляді Cappelleri, Lundy і Hays. CTT переважно працює з сумарними балами та їхньою надійністю; IRT описує взаємодію характеристик завдань і латентного параметра на рівні відповідей.


Істинний бал не дорівнює сирому, стандартизованому чи T-балу


Сирий бал — безпосередньо підрахований результат: сума або інша комбінація відповідей. Стандартизований бал — перетворення сирого бала на певну шкалу. Процентиль показує положення результату відносно розподілу референтної групи. T-score — конкретна стандартна шкала, часто з середнім 50 і стандартним відхиленням 10, якщо так її визначено.


Класичний true score T — інше поняття. Літера T у формулі X = T + E не означає «T-score». Так само T не є t-статистикою Стьюдента. Збіг літери не робить ці поняття пов’язаними.


Можна мати спостережуваний сирий бал, його стандартизоване перетворення, процентиль і при цьому окремо міркувати про класичний істинний компонент та похибку цього вимірювання.


Чому один бал не є діагнозом


У клінічній і скринінговій практиці true score не перетворює тестовий результат на діагноз. Навіть дуже надійний інструмент вимірює певний score або construct у межах своєї валідизації. Діагноз потребує клінічного оцінювання, критеріїв розладу, контексту, диференційної оцінки та, залежно від ситуації, інших джерел інформації.


Cutoff також не є магічною межею, яка відкриває «істинний стан». Його інтерпретація залежить від intended use, популяції, поширеності стану, наслідків false positive і false negative, sensitivity/specificity та predictive values. Тому screening score ≠ diagnosis, а true score ≠ diagnostic truth.


Професійні Standards for Educational and Psychological Testing вимагають обґрунтовувати інтерпретації й використання балів відповідною evidence base; один коефіцієнт precision не замінює всього validity argument.


Мова, культура і «істинний» бал


Якщо тест перекладено українською, формула X = T + E не гарантує, що український T має те саме психологічне значення, що й T оригінальної версії. Переклад може змінити складність пунктів, семантичні відтінки, response processes, нормативний контекст або construct relevance.


Надійний український переклад може стабільно вимірювати дещо відмінне від оригінального конструкту. Тому translation ≠ validated cultural adaptation. Потрібні дані про змістову еквівалентність, внутрішню структуру, reliability/precision, relations to other variables, fairness, за потреби measurement invariance/DIF та локальні норми.


Ця логіка узгоджується з сучасним підходом до measurement properties: COSMIN окремо структурує reliability, measurement error, validity і responsiveness, а не зводить якість вимірювання до одного показника.


Що формула X = T + E дозволяє сказати — і чого не дозволяє


Формула дозволяє концептуально відділити стабільний очікуваний компонент бала від випадкового відхилення конкретного вимірювання.


Вона дозволяє визначити reliability як відношення істинної варіативності до загальної варіативності за відповідних припущень і пов’язати reliability з precision та SEM.


Вона дозволяє зрозуміти, чому два вимірювання однієї людини можуть відрізнятися без реальної зміни цільової характеристики.


Вона не дозволяє побачити точний T людини з одного X.


Вона не доводить, що T є «справжнім рівнем» психологічного конструкту.


Вона не доводить валідність, справедливість, культурну еквівалентність або клінічну корисність тесту.


Вона не робить будь-який cutoff діагностичною межею.


Вона не визначає автоматично, які джерела варіації мають бути error: це залежить від intended interpretation і визначеного простору повторень.


Як правильно читати результат тесту в логіці CTT


Починайте не з питання «який у мене істинний бал?», а з питання «що саме означає цей спостережуваний бал у цьому тесті й для цього використання?»


Далі перевірте, який тип reliability/precision оцінено. Internal consistency не замінює test-retest reliability; agreement між оцінювачами не описує часову стабільність; alpha не є універсальним показником якості.


З’ясуйте, чи наведено SEM або conditional SEM і чи можна оцінити невизначеність індивідуального бала. Один score без інформації про precision створює ілюзію більшої точності, ніж реально підтримують дані.


Окремо перевірте validity evidence для конкретної інтерпретації: content, response processes, internal structure, relations to other variables, consequences та інші релевантні джерела evidence відповідно до сучасних стандартів.


Перевірте intended population, нормативну групу, мову, культурну адаптацію та умови адміністрації. Якщо контекст відрізняється від валідизаційного, переносити значення бала автоматично не можна.


Для клінічних рішень розділяйте screening, assessment, diagnosis, monitoring і outcome measurement. Кожна задача має власні вимоги до точності та evidence.


Типові помилки інтерпретації


Помилка 1. «Істинний бал — це справжнє значення риси»


У CTT це очікуване значення конкретного score за визначених повторень. Його близькість до цільового психологічного конструкту — питання валідності.


Помилка 2. «Похибка — це помилка психолога або респондента»


E — математичний компонент відхилення X від T. Його джерелом можуть бути різні випадкові впливи. Людська помилка може бути одним із джерел, але поняття значно ширше.


Помилка 3. «Якщо reliability = 0,90, то 90% мого бала істинні»


Коефіцієнт reliability у класичній моделі описує співвідношення компонентів варіативності на рівні групи/процедури. Це не означає, що конкретний результат людини складається з «90% істини і 10% помилки».


Помилка 4. «Надійний тест автоматично валідний»


Надійність потрібна для багатьох інтерпретацій, але сама не доводить, що тест вимірює потрібний construct або підтримує конкретне рішення.


Помилка 5. «Повторне тестування дасть точний true score»


Повтори можуть допомагати оцінювати precision, але реальні повторення самі змінюють умови: виникають навчання, пам’ять, втома, адаптація до формату, зміна стану. Нескінченне повторення є визначальним thought experiment, а не практичною процедурою для знаходження T.


Помилка 6. «T у X = T + E — це T-score»


Ні. True score T і стандартизований T-score — різні поняття.


Часті запитання


Що таке істинний бал простими словами?


Це середній результат, який людина теоретично отримала б за необмеженої кількості належно еквівалентних повторень того самого вимірювання. Він визначений моделлю і безпосередньо не спостерігається.


Чи можна визначити істинний бал за одним тестуванням?


Точно — ні. Один X не дозволяє окремо побачити T і E. Можна оцінювати precision та ймовірний діапазон значень за допомогою reliability, SEM та інших модельних засобів.


Чи дорівнює істинний бал реальному рівню інтелекту або тривоги?


Не обов’язково. Класичний T — очікуване значення конкретного тестового score. Чи відповідає цей score цільовому конструкту, визначає validity evidence.


Що означає E = 0 у середньому?


Це означає, що в класичній випадковій моделі позитивні й негативні випадкові відхилення за нескінченних еквівалентних повторень у середньому взаємно компенсуються. Це не означає, що під час кожного окремого тестування похибка дорівнює нулю.


Чи може систематичне зміщення бути частиною T?


Так. Якщо вплив стабільно відтворюється в заданому процесі, класичний true-score компонент може його поглинати. Саме тому reliability не замінює validity, fairness і аналіз construct-irrelevant variance.


Як пов’язані істинний бал і SEM?


SEM описує типовий розкид повторних спостережуваних балів навколо true score в заданій моделі. Вона допомагає виразити precision в одиницях самої шкали.


Чи є формула X = T + E актуальною сьогодні?


Так. CTT залишається фундаментальною мовою для reliability, measurement error і роботи з сумарними тестовими балами. Поряд із нею застосовують IRT, generalizability theory, latent-variable models та інші сучасні підходи, які деталізують або інакше моделюють структуру вимірювання.


Чи означає високий true score, що людина має розлад?


Ні. Значення score залежить від того, що саме вимірює інструмент, як побудована шкала, які є норми та validity evidence. Screening або symptom score не є діагнозом.


Підсумок


Формула X = T + E — це не твердження про те, що психологічний тест бачить приховану «істину про людину». Це модель вимірювання. X — конкретний спостережуваний результат; T — очікуване значення цього результату в заданому просторі еквівалентних повторень; E — відхилення конкретного вимірювання від цього очікування.


Сила класичної теорії тестів полягає в тому, що вона робить похибку явною. Число в психології перестає виглядати абсолютно точним і починає розглядатися разом із reliability, precision, SEM, validity evidence, нормами, мовою, популяцією та intended use. Саме так тестовий бал стає науково інтерпретованим вимірюванням, а не самодостатнім ярликом.


Пов’язані статті








Джерела


American Educational Research Association, American Psychological Association, National Council on Measurement in Education. (2014). Standards for Educational and Psychological Testing. NCME / open-access Standards


American Psychological Association. (2018). Classical test theory. APA Dictionary of Psychology. APA Dictionary


Cappelleri, J. C., Lundy, J. J., & Hays, R. D. (2014). Overview of classical test theory and item response theory for the quantitative assessment of items in developing patient-reported outcomes measures. Clinical Therapeutics, 36(5), 648–662. https://doi.org/10.1016/j.clinthera.2014.04.006


COSMIN. (n.d.). Consensus-based Standards for the selection of health Measurement Instruments. COSMIN


De Champlain, A. F. (2010). A primer on classical test theory and item response theory for assessments in medical education. Medical Education, 44(1), 109–117. https://doi.org/10.1111/j.1365-2923.2009.03425.x


Himelfarb, I. (2019). A primer on standardized testing: History, measurement, classical test theory, item response theory, and equating. Journal of Chiropractic Education, 33(2), 151–163. https://doi.org/10.7899/JCE-18-22


McNeish, D., & Dumas, D. (2025). Reliability representativeness: How well does coefficient alpha summarize reliability across the score distribution? Behavior Research Methods, 57, 93. https://doi.org/10.3758/s13428-025-02611-8


National Council on Measurement in Education. (n.d.). Assessment Glossary. NCME Assessment Glossary


National Council on Measurement in Education. (n.d.). Reliability in Classical Test Theory. NCME learning module


Novick, M. R. (1966). The axioms and principal results of classical test theory. Journal of Mathematical Psychology, 3(1), 1–18. https://doi.org/10.1016/0022-2496(66)90002-2

 
 
bottom of page