Нормативно-орієнтоване і критеріально-орієнтоване тестування: порівняння з людьми чи з критерієм
Автор: Український психологічний ХАБ · Опубліковано: 23 вересня 2026 · Редакційна політика
Нормативно-орієнтоване і критеріально-орієнтоване тестування відрізняються насамперед тим, відносно чого тлумачать результат. У нормативно-орієнтованій інтерпретації бал порівнюють із розподілом результатів у визначеній референтній популяції: людина отримує інформацію про своє відносне місце серед інших. У критеріально-орієнтованій інтерпретації результат співвідносять із визначеним доменом умінь, рівнем виконання, зовнішнім критерієм або обґрунтованим порогом: головне питання — що саме людина демонструє або чи досягнуто заданого рівня. Саме так це розрізнення формулюють Standards for Educational and Psychological Testing та глосарій NCME.
Ключова сучасна поправка: це не завжди два взаємовиключні «типи тестів». Часто точніше говорити про два способи інтерпретації тестового бала. Один і той самий набір результатів може підтримувати і нормативне, і критеріальне тлумачення, якщо для кожного висновку є окремі докази валідності, надійності та справедливості. Тому назва тесту сама по собі не відповідає на питання, що означає конкретний бал.
Для ширшого контексту дивіться матеріали «Психологічне тестування: що це, як проводиться і які обмеження має результат тесту» та «Психометрія: що це, що вона вимірює і як оцінюють якість психологічних тестів».
Коротка відповідь: порівняння з людьми чи з критерієм
• Нормативно-орієнтоване тлумачення відповідає на питання: «Де цей результат розташований відносно результатів визначеної групи?»
• Критеріально-орієнтоване тлумачення відповідає на питання: «Що цей результат означає відносно визначеного рівня, домену або критерію?»
• Нормативний результат потребує релевантної референтної популяції та якісних норм.
• Критеріальний результат потребує змістовно й емпірично обґрунтованого критерію, а якщо використовується поріг — захищуваної процедури його встановлення.
• Пороговий бал не робить інтерпретацію автоматично критеріально-орієнтованою: поріг може бути встановлений і нормативно, наприклад для відбору фіксованої частки кандидатів.
• Процентиль не є відсотком правильних відповідей, а «вище норми» не означає автоматично «краще», «здоровіше» або «правильніше».
Що таке нормативно-орієнтована інтерпретація
За визначенням NCME, norm-referenced score interpretation — це тлумачення результату через порівняння виконання конкретної людини з розподілом виконання у певній референтній популяції. Психометричні норми — це статистики або таблиці, які описують розподіл балів у визначених групах, зазвичай створених для представлення ширшої популяції.
Тут значення має не сам сирий бал. Бал набуває відносного змісту лише після відповіді на питання: з ким саме його порівнюють. Результат 42 бали може означати зовсім різне, якщо один норматив побудований на підлітках певного віку, інший — на дорослих, третій — на клінічній вибірці, а четвертий — на кандидатах у конкретну професійну програму.
У Testing Standards наголошено, що валідність нормативної інтерпретації частково залежить від доречності референтної групи. Норми, отримані на госпіталізованих пацієнтах, наприклад, можуть бути непридатними для певних висновків про негоспіталізованих людей. Так само старі, мовно або культурно нерелевантні норми здатні змінити зміст індивідуального результату.
Що саме може показувати нормативний результат
Нормативна інтерпретація найчастіше описує відносне положення: нижче, близько до або вище певної частини референтного розподілу. Для цього можуть використовуватися процентилі, стандартизовані бали, T-бали, z-бали, стенайни та інші шкали. Конкретна трансформація не змінює головної логіки: точкою відліку є розподіл результатів у визначеній групі.
Наприклад, 90-й процентиль означає, що результат розташований на рівні або вище приблизно 90% результатів у відповідній референтній групі за правилами конкретного тесту. Це не означає «90% правильних відповідей» і не означає, що людина «на 90% має» певну психологічну властивість.
Що психометрична норма не означає
Слово «норма» в психометрії не є синонімом здоров’я, бажаності, моральної правильності або клінічної відсутності розладу. Норма описує референтний розподіл. Якщо шкала вимірює симптоми, високий нормативний бал може означати вищу вираженість симптомів; якщо шкала вимірює певну здатність — інше відносне положення. Знак «вище» чи «нижче» набуває змісту тільки разом із тим, що саме вимірює шкала і для чого її використовують.
Що таке критеріально-орієнтована інтерпретація
За глосарієм NCME, criterion-referenced score interpretation описує рівень виконання відносно визначеного домену критерію. У Testing Standards наведено кілька можливих форм такого тлумачення: очікувана частка правильних відповідей у ширшому домені завдань, імовірність успішного виконання певних типів завдань, зв’язок із зовнішньою змінною або ймовірність того, що рівень знань чи навички достатній для виконання певної діяльності.
В українському професійному словнику також закріплене формулювання «критеріально-орієнтоване тестування». Історично поняття criterion-referenced measurement було чітко сформульоване Робертом Глейзером у статті 1963 року: досягнення можна описувати відносно критеріального стандарту незалежно від того, як виконали завдання інші люди.
Отже, критеріально-орієнтований результат має зміст тоді, коли визначено, що саме є критерієм. Це може бути опис компетентності, домен знань або навичок, зовнішній результат, рівень виконання чи пороговий бал, який відділяє категорії для конкретного рішення.
Критерій — це не обов’язково один пороговий бал
Критеріальне тлумачення ширше за просте «пройшов / не пройшов». Воно може описувати кілька рівнів виконання, профіль опанованих умінь, очікувану здатність виконувати певні завдання або зв’язок бала з важливим зовнішнім результатом. Пороговий бал є лише одним із способів перетворити безперервний результат на категоріальне рішення.
Тому фраза «70% — це критерій» сама по собі нічого не доводить. Щоб 70% мали зміст як межа достатнього володіння навичкою, потрібно показати, чому саме цей рівень відповідає заявленому стандарту, наскільки точно тест вимірює поблизу порога і які помилки класифікації можливі.
Нормативне і критеріальне тестування: головні відмінності
1. Точка відліку
У нормативній логіці точкою відліку є референтна група. У критеріальній — визначений рівень, домен або зовнішній критерій.
2. Основне питання
Нормативна інтерпретація питає: «Як результат співвідноситься з іншими?» Критеріальна питає: «Що людина демонструє відносно заданого стандарту або результату?»
3. Тип інформації
Нормативна інтерпретація дає передусім інформацію про відносне положення. Критеріальна — про досягнення, класифікацію, імовірність певного зовнішнього результату або відповідність змістовно визначеному рівню.
4. Вимоги до доказів
Для нормативного висновку критичні релевантність і репрезентативність нормативної вибірки, актуальність норм, точність шкали та валідність такого порівняння. Для критеріального — визначеність домену або зовнішнього критерію, обґрунтованість стандарту, точність у релевантній частині шкали, валідність рішення та, якщо є поріг, якість процедури встановлення стандарту (standard setting).
5. Типові сфери застосування
Нормативна логіка природна там, де важливі індивідуальні відмінності, ранжування або відносне положення — наприклад, у багатьох тестах здібностей, когнітивних показниках чи стандартизованих особистісних шкалах. Критеріальна логіка природна там, де треба визначити володіння навичкою, рівень компетентності, готовність до конкретного завдання або категорію рішення. У реальній практиці ці задачі часто поєднуються.
Один тест може підтримувати обидві інтерпретації
Сучасні Testing Standards прямо застерігають від надто жорсткого поділу. Один і той самий тестовий бал може мати нормативне й критеріальне значення, якщо кожне тлумачення окремо валідоване.
Уявімо тест професійної навички. Результат може бути поданий як 78-й процентиль серед релевантної групи кандидатів — це нормативна інформація. Той самий результат може одночасно відповідати рівню «самостійно виконує стандартні завдання» за обґрунтованими дескрипторами компетентності — це критеріальна інформація.
Це важлива причина не питати лише «цей тест нормативний чи критеріальний?». Точніше запитати: «Яку інтерпретацію цього бала заявляє розробник, для якої популяції та мети вона перевірена і які докази її підтримують?»
Пороговий бал може бути і нормативним, і критеріальним
Наявність порогового бала (cut score) не визначає тип інтерпретації автоматично. Testing Standards наводять принципово різні сценарії.
Якщо організація ранжує кандидатів і встановлює межу так, щоб відібрати наперед задану кількість або частку людей із верхньої частини розподілу, рішення спирається на відносне положення серед інших. Такий поріг має нормативну логіку, навіть якщо після нього стоїть ярлик «пройшов» або «не пройшов».
Якщо межа відокремлює змістовно різні рівні володіння навичкою або встановлюється за зв’язком із релевантним зовнішнім критерієм, інтерпретація може бути критеріальною. Тут необхідно пояснити, чому саме ця точка шкали відповідає заявленому рівню.
Чому поріг не є магічною межею
У Testing Standards підкреслено, що між людьми трохи нижче і трохи вище порога зазвичай немає різкого природного розриву. Імовірність помилкової класифікації особливо важлива для результатів поблизу cut score.
Якщо два результати відрізняються на один бал навколо порога, це не означає, що люди належать до двох психологічно різних «видів». Рішення може вимагати категорії, але вимірювана характеристика часто залишається безперервною. Саме тому для високоставкових рішень важливі похибка вимірювання, точність біля порога, повторюваність класифікації та наслідки хибнопозитивних і хибнонегативних рішень.
Сучасний розділ про встановлення стандартів (standard setting) у Educational Measurement, Fifth Edition також наголошує, що встановлення стандартів поєднує емпіричні дані, професійні судження та наслідки рішення; невизначеність і можливі помилки класифікації мають бути явною частиною процесу.
Надійність для двох типів інтерпретації
Надійність не дорівнює валідності, а тип потрібної точності залежить від того, який висновок роблять із бала. Якщо мета — порівнювати людей і ранжувати їх, важлива достатня точність відносних відмінностей у потрібному діапазоні шкали. Якщо мета — класифікувати відносно порога, особливо важлива точність поблизу цього порога.
Розділ про reliability/precision у Testing Standards окремо вводить сталість рішення (decision consistency) — ступінь, до якого класифікація людей залишалася б тією самою за реплікації процедури тестування, — і точність рішення (decision accuracy) — узгодженість спостережуваної класифікації з істинним статусом за моделлю. Ці показники залежать не тільки від загальної надійності тесту, а й від розташування конкретного порога.
Практичний наслідок: високий загальний коефіцієнт надійності ще не гарантує безпомилкового рішення «вище / нижче порога». Для категоріального рішення потрібні докази точності саме там, де проходить межа.
Критеріально-орієнтоване тестування не дорівнює критеріальній валідності
Ці терміни легко сплутати через спільне слово «критерій», але вони відповідають на різні питання.
• Критеріально-орієнтована інтерпретація описує значення бала відносно визначеного домену, рівня або критерію.
• Докази валідності на основі зв’язку з іншими змінними показують, як тестовий бал пов’язаний із релевантним зовнішнім показником — одночасним або майбутнім.
Зв’язок із зовнішнім критерієм може допомогти обґрунтувати певну критеріальну інтерпретацію, але ці поняття не є синонімами. Так само сам факт кореляції з зовнішньою змінною не створює автоматично змістовного порога.
Нормативна вибірка: від неї залежить зміст бала
У International Guidelines for Test Use компетентним користувачам рекомендують розуміти характеристики норм або груп порівняння, використовувати доречні референтні групи й ураховувати вік, освіту, культуру та інші релевантні чинники під час інтерпретації.
Це означає, що нормативний бал не можна переносити між популяціями механічно. Якщо норми створено для іншої країни, іншої мови, іншого віку, іншої клінічної групи або іншого історичного періоду, зміст порівняння може змінитися. Переклад інструкції чи пунктів українською не створює українських норм і не доводить валідність української версії.
Референтна група має бути описана достатньо конкретно: хто входив до вибірки, як її набирали, який був розмір і склад, коли збирали дані, які правила включення застосовували, чи відповідає вона популяції, для якої тепер тлумачиться результат. «Норма для дорослих» без цих деталей може бути занадто грубим орієнтиром.
Культурна адаптація, справедливість і групові порівняння
Ні нормативний, ні критеріальний підхід сам по собі не робить тест справедливим. Нормативне порівняння може бути хибним через нерелевантну референтну групу. Критеріальний поріг може бути хибним через невідповідний домен, систематичну похибку, мовні бар’єри або наслідки рішення, які не були належно оцінені.
Для міжгрупових порівнянь потрібні окремі докази того, що бали мають порівнюваний зміст. Відмінність середніх значень між групами сама по собі не доводить bias. Так само інваріантність вимірювання (measurement invariance) не є автоматичним доказом повної відсутності упередженості, а диференційне функціонування завдань (DIF) потребує змістової інтерпретації, а не механічного ярлика «несправедливий пункт».
Загальна вимога Testing Standards полягає в тому, щоб інтерпретації для запланованого використання спиралися на докази справедливості, надійності/точності та валідності. Це стосується і порівняння з групою, і рішень за критерієм.
Клінічний скринінг: чому пороговий бал (cutoff) не є діагнозом
У психологічних і медико-психологічних шкалах критеріально-орієнтоване тлумачення інколи пов’язують із порогами, ризиком або ймовірністю наявності певного стану. Саме тут особливо легко зробити надмірний висновок.
У Testing Standards як приклад критеріально-орієнтованої інтерпретації згадується ймовірність певної психопатології, але одночасно наголошено: імовірність може змінюватися поступово, а не стрибком у конкретній точці шкали, і біля порога ризик помилкової класифікації зазвичай вищий.
Тому скринінговий пороговий бал (cutoff) означає правило інтерпретації для конкретної мети й популяції. Він не перетворює скринінг на діагностику. Діагноз потребує клінічної оцінки, критеріїв розладу, контексту функціонування, анамнезу, диференційних пояснень та інших релевантних даних. Поширеність стану також впливає на те, що означає позитивний результат у конкретній популяції.
Так само поріг, отриманий в одній країні, мовній версії або клінічній вибірці, не слід оголошувати універсальним для української популяції без відповідної перевірки.
Процентиль, відсоток правильних відповідей і пороговий бал — три різні речі
Процентиль описує відносне місце у референтному розподілі. Відсоток правильних відповідей описує частку правильно виконаних завдань у конкретному наборі. Пороговий бал — це точка на шкалі, вище й нижче якої результати повідомляють, тлумачать або використовують по-різному.
Ці величини можуть бути пов’язані в конкретній системі оцінювання, але вони не взаємозамінні. Наприклад, 80% правильних відповідей не означає 80-й процентиль. А 80-й процентиль не означає, що людина досягла змістовно визначеного рівня компетентності.
Якщо тестова система повідомляє одразу сирий бал, процентиль і рівень «достатній / недостатній», кожен із цих показників відповідає на своє питання. Їх потрібно читати за технічною документацією конкретного інструмента, а не за інтуїтивними асоціаціями з числом.
Де який підхід корисний
Коли важлива нормативна інтерпретація
• Опис індивідуальних відмінностей відносно релевантної популяції.
• Порівняння результату з віковою, освітньою, професійною або іншою обґрунтованою референтною групою.
• Ранжування, якщо саме відносний порядок є частиною легітимної мети використання.
• Інтерпретація стандартизованих шкал, для яких норми є центральною частиною звіту.
Коли важлива критеріальна інтерпретація
• Визначення рівня опанування знаннями або навичками.
• Сертифікаційні та кваліфікаційні рішення, коли існує обґрунтований стандарт достатньої компетентності.
• Рівні виконання з описаними поведінковими або змістовими дескрипторами.
• Рішення, для яких тестовий бал валідовано відносно релевантного зовнішнього критерію.
Коли потрібні обидві
У психології та освіті часто корисно знати і відносне положення, і зміст результату. Наприклад, когнітивний показник може бути незвично низьким відносно вікової групи і водночас мати певне функціональне значення лише з урахуванням інших даних. А результат тесту професійної компетентності може відповідати мінімальному стандарту, хоча людина посідає середнє місце серед дуже сильної групи кандидатів.
Типові помилки інтерпретації
• «Вище середнього» = «добре». Насправді напрям бажаності залежить від конструкта і мети.
• «Нижче середнього» = «розлад». Нормативне відхилення не є діагнозом.
• «Є cutoff» = «це критеріальний тест». Поріг може бути нормативним, якщо його встановили за квотою або відносним ранжуванням.
• «Критерій» = «критеріальна валідність». Це різні поняття.
• «70% правильних» = «70-й процентиль». Це різні шкали.
• «Перекладений тест» = «має українські норми». Переклад не створює нормативної бази й не замінює культурної адаптації та валідації.
• «Пороговий бал» = «точна природна межа». Біля порога завжди потрібно враховувати похибку та невизначеність класифікації.
• «Надійний тест» = «валідне рішення». Надійність потрібна, але валідність стосується конкретної інтерпретації та використання.
• «Одна норма підходить усім». Нормативна інтерпретація залежить від того, наскільки референтна популяція відповідає конкретній людині та меті.
Як правильно читати тестовий звіт: практичний алгоритм
Перед тим як робити висновок із числа, варто послідовно відповісти на кілька питань.
1. Що вимірює шкала? Назва тесту не замінює визначення конструкта.
2. Для якої мети призначений цей результат? Скринінг, опис, відбір, діагностичне оцінювання, моніторинг або дослідження потребують різних доказів.
3. Це нормативна, критеріальна чи комбінована інтерпретація? Треба знати точку відліку.
4. Якщо є норми — хто становив референтну популяцію, коли й де збирали дані, чи відповідає вона людині, чий результат тлумачать?
5. Якщо є поріг — як його встановили? За змістовною процедурою встановлення стандарту, емпіричним зв’язком із зовнішнім критерієм, квотою, локальним правилом чи іншим способом?
6. Наскільки точний результат саме в потрібній частині шкали? Для категоріального рішення важлива точність біля порога.
7. Які докази валідності підтримують саме цей висновок і саме це використання? Загальна репутація тесту не замінює evidence для конкретного рішення.
8. Чи валідована саме ця мовна й культурна версія? Наявність українського перекладу не є достатньою відповіддю.
9. Які наслідки помилкового рішення? Для високоставкових рішень потрібно оцінювати не тільки статистичну точність, а й наслідки хибної класифікації.
10. Чи потрібен ширший контекст? Матеріал «Інтерпретованість результатів психологічного вимірювання: як надати зміст балу і зміні бала» пояснює, чому саме число ще не є готовим психологічним висновком.
Науковий статус розрізнення
Розрізнення norm-referenced і criterion-referenced має усталений статус у теорії психологічного та освітнього вимірювання. Водночас сучасна психометрія трактує його переважно як розрізнення способів тлумачення балів і рішень, а не як непроникну межу між двома класами інструментів.
Усталені докази: значення нормативного результату залежить від визначеної референтної популяції; критеріальне тлумачення залежить від визначеного критеріального домену або іншої обґрунтованої точки відліку; один тест може підтримувати обидва типи інтерпретації; порогові бали можуть бути і нормативними, і критеріальними; рішення біля порога мають невизначеність.
Контекстно залежні питання: конкретний поріг, конкретні норми, рівні компетентності та допустима величина похибки не є універсальними. Їх потрібно обґрунтовувати для певного інструмента, популяції, мети та наслідків використання.
Практичний висновок простий: тестовий бал не має повного змісту без системи відліку. Якщо система відліку — люди, потрібні релевантні норми. Якщо система відліку — критерій, потрібен обґрунтований стандарт. Якщо результат використовується для рішення про конкретну людину, потрібні ще точність, валідність, справедливість і контекст.
Часті запитання
Що таке нормативно-орієнтований тест простими словами?
Це тестовий результат, який тлумачать через порівняння з результатами визначеної групи. Він відповідає на питання, де людина розташована відносно референтної популяції.
Що таке критеріально-орієнтований тест простими словами?
Це результат, який тлумачать відносно заздалегідь визначеного змісту, рівня виконання, зовнішнього критерію або обґрунтованого стандарту, а не тільки відносно інших людей.
Чи може один тест бути і нормативно-, і критеріально-орієнтованим?
Так. Ті самі бали можуть підтримувати обидві інтерпретації, якщо кожна має належне психометричне обґрунтування. Наприклад, звіт може одночасно показувати процентиль і рівень компетентності.
Чи будь-який пороговий бал є критеріальним?
Ні. Якщо поріг визначили через місце людини відносно інших або для відбору фіксованої частки кандидатів, його логіка може бути нормативною. Критеріальним він стає не через сам факт порога, а через спосіб установлення й значення, яке йому приписують.
Чим процентиль відрізняється від відсотка правильних відповідей?
Процентиль показує відносне місце в розподілі референтної групи. Відсоток правильних відповідей — частку правильно виконаних завдань. 90-й процентиль не означає 90% правильних відповідей.
Чи означає результат «вище норми», що все добре?
Ні. Психометрична норма описує розподіл балів, а не здоров’я чи бажаність. Для шкали симптомів вищий бал може означати більшу вираженість проблеми; для іншого конструкта значення буде іншим.
Чи встановлює скринінговий пороговий бал (cutoff) психологічний або психіатричний діагноз?
Ні. Скринінговий поріг допомагає організувати подальшу оцінку або оцінити ризик у конкретній популяції, але один бал не встановлює діагноз.
Чи можна використовувати іноземні норми для української версії тесту?
Іноді вони можуть слугувати дослідницьким орієнтиром, але не стають автоматично валідними українськими нормами. Для практичної інтерпретації потрібно оцінювати мовну й культурну адаптацію, відповідність референтної популяції та докази валідності саме для запланованого використання.
Пов’язані статті
Джерела
American Educational Research Association, American Psychological Association, & National Council on Measurement in Education. (2014). Standards for Educational and Psychological Testing. Офіційна відкрита версія.
Ferrara, S., Davis-Becker, S., Kannan, P., & Reynolds, K. (2026). Standard Setting: A Cognitive and Social Model. In Educational Measurement, Fifth Edition. https://doi.org/10.1093/oso/9780197654965.003.0012.
Glaser, R. (1963). Instructional technology and the measurement of learning outcomes: Some questions. American Psychologist, 18(8), 519–521. https://doi.org/10.1037/h0049294.
International Test Commission. (2001). International Guidelines for Test Use. International Journal of Testing, 1(2), 93–114. Офіційний документ ITC.
National Council on Measurement in Education. (n.d.). Glossary. NCME Glossary.
Всеукраїнська психодіагностична асоціація. (n.d.). Критеріально-орієнтоване тестування. Глосарій ВПА.
