top of page

Психологічна енкциклопедія

Сирий і стандартизований бал: як результат тесту перетворюють на показник, який можна порівнювати з нормами

6 днів тому
Читати 20 хв

Автор: Український психологічний ХАБ · Опубліковано: 23 вересня 2026 · Редакційна політика


Сирий бал — це результат, який безпосередньо отримують після підрахунку відповідей або інших елементів тесту за правилами скорингу. Він може бути кількістю правильних відповідей, сумою балів за пунктами, зваженою сумою або іншою комбінацією показників. Стандартизований або стандартний бал — це похідний показник, у якому первинний результат перетворено на визначену шкалу, щоб зробити його інтерпретацію зрозумілішою і, коли це виправдано, порівняти позицію людини з референтною групою. Глосарій NCME


Саме перетворення не створює нової психологічної інформації з нічого. Воно змінює спосіб подання результату. У професійних Standards for Educational and Psychological Testing окремо розглядаються сирі бали, шкальні бали, норми, зв’язування шкал і порогові значення. Стандарти підкреслюють, що шкала має підтримувати передбачену інтерпретацію, а норми повинні бути прив’язані до чітко описаної популяції. Standards for Educational and Psychological Testing


У цій статті «стандартизований бал» використовується як практична пара до «сирого бала» для опису перетвореного результату. Водночас у статистиці термін standardized score нерідко вживають у вужчому значенні — для z-подібного перетворення через середнє і стандартне відхилення. У тестових посібниках також трапляються терміни standard score, scale score, scaled score, T-score, stanine, sten і percentile rank. Вони не є взаємозамінними: зміст конкретного числа визначає документація саме того інструмента, з яким працює користувач. APA Dictionary: standardized score


Що таке сирий бал


Сирий бал, або первинний бал, є числовим результатом до переведення на іншу шкалу. Для тесту знань це може бути кількість правильно виконаних завдань. Для опитувальника — сума кодованих відповідей. Для шкали з реверсивними пунктами спочатку виконують потрібне перекодування, а потім підсумовують значення. Для деяких інструментів застосовують ваги, правила пропущених відповідей або складніший алгоритм. Тому сирий бал не обов’язково дорівнює «кількості правильних відповідей». Саме таке ширше визначення дає NCME: raw score часто є кількістю правильних відповідей, але загальніше — сумою чи іншою комбінацією балів за окремими завданнями. NCME Glossary


Сирий бал має сенс лише разом із правилами, за якими його отримано. Значення 18 нічого не говорить саме по собі, доки невідомо, чи можливий діапазон 0–20, 0–80 або 10–50; чи вищі бали означають більшу вираженість конструкта; чи є пропущені пункти; чи застосовувалися ваги; чи всі завдання входять до однієї шкали. Тому перший крок інтерпретації — встановити, що саме було підраховано. Для цього потрібен офіційний посібник або технічна документація інструмента, а не випадкова таблиця конверсії з інтернету.


В українській професійній мові вживаються і «сирий бал», і «первинний бал». Наприклад, Всеукраїнська психодіагностична асоціація описує норми як таблиці, що дають змогу переводити первинні бали у стандартні, а в українських освітніх програмах із психометрії прямо використовуються словосполучення «сирий бал», «стандартизація тестових балів» і «норми». У цій статті основним є термін «сирий бал», а «первинний бал» використовується як зрозумілий синонім. ВПА: Норми


Від відповідей до сирого бала: скоринг не дорівнює стандартизації


Скоринг — це перетворення відповідей, виконаних завдань або оцінок спостерігача на тестовий результат за заздалегідь установленими правилами. Стандартизація бала відбувається після цього, коли вже отриманий результат переводять на іншу шкалу або співвідносять із нормативним розподілом. Це різні операції. Реверсивне кодування пунктів, сумування підшкал, облік пропущених відповідей і застосування ваг належать до правил скорингу; обчислення z-бала, T-бала чи іншої шкальної оцінки — до подальшого перетворення результату.


У сучасній психометрії ця послідовність не завжди буквально виглядає як «відповіді → сума → стандартизований бал». У моделях теорії відповіді на завдання (IRT) оцінка латентної характеристики може розраховуватися безпосередньо з патерну відповідей, а потім переводитися на зручну звітну шкалу. AERA, APA та NCME прямо зазначають, що початковим результатом може бути raw score у класичній теорії тестів або IRT score у модельному підході, після чого інтерпретацію часто полегшує перехід до scale score. Standards for Educational and Psychological Testing


Отже, поняття «сирий бал» найбільш буквально працює там, де тест має явний первинний підрахунок. Для інших інструментів коректніше говорити про початкову оцінку параметра і звітну шкалу. В обох випадках принцип однаковий: число отримує зміст не від самої математичної операції, а від моделі вимірювання, правил тесту та доказів, які підтримують конкретну інтерпретацію.


Що таке стандартизований або стандартний бал


У вузькому статистичному сенсі стандартизований бал показує, на скільки стандартних відхилень спостереження віддалене від середнього значення певного розподілу. Найвідоміша форма — z-бал. Американська психологічна асоціація визначає standardized score як значення, отримане з сирого бала після віднімання середнього та ділення на стандартне відхилення, і наводить z- та T-бали серед типів стандартизованих оцінок. APA Dictionary: standardized score


У ширшій тестологічній практиці результат після перетворення часто називають шкальним балом або standard/scale score. NCME визначає scale score як бал, отриманий шляхом перетворення сирих балів, зазвичай для полегшення інтерпретації. Така шкала може бути лінійною, нормалізованою, пов’язаною з IRT, створеною для порівняння форм тесту або сконструйованою під конкретну систему звітування. NCME Glossary


Тому слово «стандартизований» не слід читати як обіцянку, що всі перетворені бали мають однакову математичну природу. У конкретному тесті треба перевірити, як саме була створена шкала: яка референтна популяція використана, чи перетворення лінійне, чи застосована нормалізація, який центр і розкид задано, як поводяться крайні значення, чи є окремі норми для вікових або інших груп і які інтерпретації дозволяє посібник.


Навіщо взагалі перетворювати сирий бал


Головна проблема сирого бала — його залежність від конкретної форми тесту. Результат 28 може бути дуже високим у шкалі 0–30 і низьким у шкалі 0–100. Навіть у межах одного тесту різні підшкали можуть мати різну кількість пунктів і різні діапазони. Перетворення на спільну шкалу робить числове представлення зручнішим для інтерпретації та звітування.


Друга задача — показати відносне положення результату в референтній популяції. Якщо ми знаємо, що середній сирий бал у нормативній групі дорівнює 24, а стандартне відхилення — 4, то сирий бал 32 можна описати як два стандартні відхилення вище середнього для цієї групи. Саме тут виникає z-бал. Якщо той самий відносний результат перетворити на T-шкалу із середнім 50 і стандартним відхиленням 10, він дорівнюватиме T = 70.


Третя задача — уникнути плутанини між різними первинними шкалами. Професійні Standards зазначають, що scale scores можуть допомагати показати, як результат співвідноситься з результатами інших тестованих, підтримувати порівнюваність різних форм одного тесту та зменшувати плутанину між різними видами балів. Водночас саме слово «scale score» не гарантує порівнюваності: якщо йдеться про різні форми або різні тести, потрібні спеціальні процедури зв’язування чи еквівалентування і докази того, що таке порівняння коректне. Standards for Educational and Psychological Testing


Норми: з ким саме порівнюють результат


Норма в психометрії — це не абстрактне уявлення про «нормальну людину». Це статистична інформація про розподіл тестових балів у визначеній групі, яка має представляти референтну популяцію. NCME визначає norms як статистики або табличні дані, що описують розподіл балів для однієї чи кількох specified groups, а reference population — як популяцію, представлену цими нормами. Вона може бути визначена за віком, класом навчання, клінічним статусом або іншими характеристиками. NCME Glossary


Це означає, що стандартизований бал завжди має прихований додаток: «відносно кого?». Один і той самий сирий бал може мати різне відносне значення в різних нормативних групах. Якщо для підлітків певного віку середній результат нижчий, ніж для дорослих, однакова первинна сума може перетворитися на різні z- або T-бали. Це не математичний дефект, а наслідок різних точок відліку — за умови, що використання окремих норм справді обґрунтоване.


AERA, APA та NCME вимагають, щоб норми посилалися на чітко описані популяції, а звіти про нормування містили специфікацію популяції, процедури вибірки, участь, ваги, дати тестування та описову статистику. Стандарти також наголошують на потребі оновлювати норми, коли старі вже не підтримують точну й доречну інтерпретацію. Standards for Educational and Psychological Testing


Отже, фраза «T-бал 60» без назви тесту, версії, нормативної групи і правил інтерпретації є неповною. Вона повідомляє форму шкали, але не весь зміст результату. Для професійного висновку потрібно знати, для якої популяції створені норми і чи належить до неї конкретна людина.


Як сирий бал перетворюють на стандартизований: простий приклад


Уявімо навчальний приклад, який не належить до жодного реального психологічного тесту. Є шкала з можливим сирим результатом від 0 до 40. У референтній групі середній бал M = 24, стандартне відхилення SD = 4. Людина отримала X = 32. Для z-перетворення використовуємо формулу z = (X − M) / SD. Отримаємо z = (32 − 24) / 4 = 2. Це означає: результат лежить на два стандартні відхилення вище середнього саме в цьому референтному розподілі.


Той самий z-бал можна лінійно перевести в T-шкалу: T = 50 + 10z. Для z = 2 отримаємо T = 70. Відносне положення не змінилося: ми лише замінили шкалу з центром 0 і стандартним відхиленням 1 на шкалу з центром 50 і стандартним відхиленням 10. APA визначає T score саме як стандартизований бал у розподілі із середнім 50 і стандартним відхиленням 10. APA Dictionary: T score


Тепер змінимо лише референтну групу. Припустімо, в іншій нормативній популяції M = 30 і SD = 5. Той самий сирий бал 32 дає z = 0,4 і T = 54. Людина не «стала іншою» через формулу; змінилася точка порівняння. Саме тому норми є частиною інтерпретації, а не декоративним додатком до тесту.


Цей приклад демонструє ще одну важливу річ: стандартизований бал не є абсолютною властивістю людини. Це результат певної процедури вимірювання, певної шкали та певної системи порівняння. Його треба читати як «результат на цій шкалі, отриманий цим інструментом і співвіднесений із цією референтною інформацією».


z-бал: відстань від середнього у стандартних відхиленнях


z-бал має середнє 0 і стандартне відхилення 1, якщо його обчислено для того самого набору даних за звичайною формулою стандартизації. z = 0 означає значення на рівні середнього, z = +1 — на одне стандартне відхилення вище, z = −1 — на одне стандартне відхилення нижче. APA наводить z score як стандартизований бал, що переводить набір даних у шкалу із середнім 0 і стандартним відхиленням 1. APA Dictionary: z score


Обчислення z-бала саме по собі не вимагає нормального розподілу. Нормальність стає важливою, коли з z-бала роблять імовірнісні або процентильні висновки за теоретичною нормальною кривою. Якщо емпіричний розподіл сильно асиметричний, має важкі хвости, стелю або підлогу, твердження «z = 1 відповідає приблизно такому-то процентилю» може бути неточним. У такій ситуації слід використовувати правила конкретного тесту або емпіричний розподіл, а не механічно підставляти нормальну таблицю.


Також z-бал не повідомляє, чи є різниця клінічно важливою, чи надійною, чи діагностичною. Він описує позицію на шкалі відносно середнього та стандартного відхилення. Усі подальші висновки потребують окремих доказів.


T-бал: та сама відносна позиція на зручнішій шкалі


T-бал у класичному вигляді є лінійним перетворенням z-бала з центром 50 і стандартним відхиленням 10. Таку шкалу зручно використовувати, бо більшість типових результатів стають додатними числами без великої кількості десяткових знаків. За цією конвенцією z = 0 відповідає T = 50, z = +1 — T = 60, z = −1 — T = 40. APA Dictionary: T score


T-бал треба відрізняти від t-статистики Стьюдента. Літера T в обох термінах не робить їх одним і тим самим показником. T-score — шкала подання індивідуального або тестового результату; t-statistic — статистика для перевірки гіпотез або побудови інтервалів у відповідних моделях. У клінічних тестах конкретні діапазони T-балів можуть мати спеціальні підписи, але ці межі є властивістю конкретного інструмента, а не універсальним законом усіх T-шкал.


Процентильний ранг: інший тип перетворення


Процентильний ранг відповідає на інше питання: який відсоток балів у визначеному розподілі лежить нижче певного результату. NCME визначає percentile rank як відсоток балів у заданому розподілі, що нижчі за конкретний бал. Тому 90-й процентиль означає приблизно, що результат вищий за результати 90% референтного розподілу; це не означає 90% правильних відповідей. NCME Glossary


Процентилі зручні для комунікації, але мають іншу геометрію шкали. Різниця між 50-м і 60-м процентилем не обов’язково відповідає тій самій різниці у вимірюваній характеристиці, що й різниця між 80-м і 90-м. У центрі розподілу процентильні ранги можуть змінюватися швидше, а на краях — інакше. Тому процентиль не слід трактувати як інтервальну шкалу з рівними відстанями.


Докладно цю тему розкрито в статті «Процентиль у психологічному тесті: що означає 50-й, 90-й або інший процентиль». Тут важливо зафіксувати головне розрізнення: percentile rank ≠ percent correct, а процентильне перетворення ≠ лінійний z-бал.


Лінійні й нелінійні перетворення


Лінійне перетворення має форму Y = a + bX. Якщо b додатне, порядок людей за результатом не змінюється: вищий X залишається вищим Y. z-перетворення та класичне T-перетворення є лінійними. Вони змінюють центр і одиницю шкали, але не змінюють форму розподілу та відносний порядок результатів.


Нелінійне перетворення може змінювати відстані між сусідніми результатами. Процентильний ранг є типовим прикладом: однакова різниця сирих балів у різних частинах розподілу може відповідати дуже різним змінам процентиля. Нормалізовані стандартні бали можуть спочатку прив’язувати емпіричний процентиль до позиції на теоретичному нормальному розподілі. Це вже інша процедура, ніж просте z = (X − M) / SD.


Практичне правило: не вгадуйте вид перетворення за назвою шкали. Якщо в посібнику написано «стандартний бал», треба знайти, як саме його обчислено. Для одних тестів це пряме лінійне перетворення, для інших — таблиця емпіричних норм, нормалізація, IRT-шкала або інша модель.


Стандартизований бал, шкальний бал, нормалізація, scaling і equating — не одне й те саме


Scaling — створення шкали, на якій результати повідомляють та інтерпретують. Standardization у статистичному сенсі — перетворення відносно середнього та стандартного відхилення. Normalization — процедура, що може змінювати форму розподілу, наприклад зіставляючи ранги з нормальною кривою. Equating — спеціальний процес, покликаний зробити результати альтернативних форм тесту взаємозамінними. Linking — ширше поняття для встановлення зв’язку між шкалами. Standards for Educational and Psychological Testing


Ці терміни часто змішують, тому що всі вони пов’язані з перетворенням чисел. Але їхні цілі різні. Просте переведення двох тестів у z-бали не доводить, що вони вимірюють те саме, що їхні одиниці мають однаковий психологічний зміст або що результати взаємозамінні. Для порівняння різних форм і різних інструментів потрібні відповідні психометричні дослідження.


Нормативна інтерпретація і критеріальна інтерпретація


Нормативна інтерпретація відповідає на питання «де розташований результат людини порівняно з визначеною референтною популяцією?». Критеріальна інтерпретація відповідає на питання «чи відповідає результат певному описаному рівню, умінню, критерію або порогу?». Це два різні способи надати балу зміст.


Стандартизований бал часто використовується в нормативній логіці, але не обмежується нею. AERA, APA та NCME прямо зазначають, що і raw scores, і scale scores можуть бути призначені для criterion-referenced interpretations, якщо обґрунтовано зміст та межі такої інтерпретації. Отже, не можна автоматично вважати, що будь-який стандартний бал є «нормативним», а будь-який сирий — «критеріальним». Standards for Educational and Psychological Testing


Що змінює перетворення бала — і чого воно не змінює


Перетворення може зробити шкалу зручнішою, надати їй зрозумілий центр і розкид, показати відносну позицію в нормативній групі та підтримати стандартне звітування. Воно може допомогти порівнювати підшкали, якщо саме для цього створено спільну метрику. Воно може зменшити ризик того, що користувач сплутає бали з різними первинними діапазонами.


Перетворення не збільшує автоматично надійність. Якщо первинний результат містить значну випадкову похибку, лінійне переведення на T-шкалу перенесе цю невизначеність у нові одиниці. Коефіцієнт надійності не стає кращим лише тому, що 18 балів перетворили на 57. Детальніше про те, що означає надійність і чому її не можна зводити до одного універсального коефіцієнта, дивіться в окремій статті «Надійність психологічного тесту».


Перетворення не створює валідність. Якщо немає достатніх доказів, що бал підтримує певну інтерпретацію та використання, красивий стандартний формат цього не виправляє. Шкала 50 ± 10 може виглядати професійно, але сама форма числа не є доказом того, що тест вимірює заявлений конструкт або придатний для конкретного рішення.


Перетворення також не усуває систематичну похибку, культурну невідповідність, нерепрезентативні норми або дефекти процедури. Воно змінює представлення результату, а не якість даних, з яких цей результат отримано.


Стандартизований бал і похибка вимірювання


Кожен психологічний бал має певну точність. Якщо тест дає результат 60 на T-шкалі, це не означає, що психологічна характеристика людини «точно дорівнює 60». Спостережуваний результат залежить від процедури та містить невизначеність. Standard error of measurement, умовні похибки та інші показники точності потрібні для оцінки того, наскільки стабільно можна локалізувати результат на шкалі. Standards for Educational and Psychological Testing


Якщо шкалу лінійно змінюють, похибка також змінює одиниці. Наприклад, коли z-шкалу перетворюють на T-шкалу множенням на 10, стандартна похибка в одиницях z також множиться на 10. Тому більші числа на новій шкалі не означають меншої чи більшої точності — змінилися лише одиниці.


Важливо також розрізняти standard error of measurement і standard error of the mean. Перше стосується невизначеності індивідуального вимірювання в психометричному контексті, друге — невизначеності оцінки середнього в статистичній вибірці. Докладно про випадкову й систематичну похибку, SEM та інтервали навколо бала читайте в статті «Похибка вимірювання в психології».


Чому стандартний бал не є діагнозом


Високий або низький стандартизований бал описує положення результату на певній шкалі. Він не встановлює діагноз сам по собі. Навіть якщо клінічний інструмент використовує T-бали, процентилі або порогові значення, їхнє значення залежить від intended use, популяції, чутливості, специфічності, базової частоти стану, контексту оцінювання та інших джерел інформації. Скринінг, case-finding, психологічне оцінювання і діагностика — різні задачі. APA Guidelines for Psychological Assessment and Evaluation


APA в етичних вимогах до використання оцінювальних інструментів наголошує, що методики мають застосовуватися для цілей і популяцій, для яких є відповідні дані про їхню придатність, а за відсутності таких даних потрібно чітко описувати обмеження інтерпретації. APA Ethical Principles, Standard 9.02


Тому формула «T ≥ 65 = розлад» не може бути універсальним правилом для всіх психологічних шкал. У конкретному інструменті певна межа може мати емпірично обґрунтоване значення, але це значення належить конкретній методиці, популяції і способу використання. Воно не переноситься автоматично на інші тести.


Один і той самий стандартний бал у різних тестах може означати різне


Два тести можуть обидва звітувати T = 60, але вимірювати різні конструкти, мати різні нормативні групи, різну точність і різний напрямок шкали. В одному тесті вищий бал може означати більшу вираженість ресурсу, в іншому — більше симптомів. Формально числа однакові, психологічно — це різні результати.


Навіть якщо два тести вимірюють близькі конструкти, проста стандартизація не робить їх еквівалентними. Standards відрізняють scaling від score linking і equating. Щоб заявити, що бали з двох форм або двох інструментів можна використовувати на спільній шкалі, потрібна спеціальна методологія і докази порівнюваності. Standards for Educational and Psychological Testing


Чи можна порівнювати бали різних людей


Так, але лише в межах інтерпретації, яку підтримує тест. Якщо дві людини проходили ту саму валідовану версію інструмента за однаковими правилами і для них доречна та сама система норм, їхні шкальні бали можна порівнювати у передбаченому тестом сенсі. Це не означає, що різниця в один бал обов’язково психологічно значуща або перевищує похибку вимірювання.


Коли люди належать до різних мовних, культурних або демографічних груп, питання складніше. Окремі групові норми інколи виправдані, але їх застосування має бути психометрично й етично обґрунтованим. Сам факт, що тест має окремі таблиці для груп, не доводить автоматично справедливість такого поділу.


Мовна й культурна адаптація: переклад не переносить норми автоматично


Якщо тест перекладено українською, з цього не випливає, що норми оригінальної версії стали українськими нормами. International Test Commission прямо вказує: норми, докази надійності та валідності вихідної мовної версії не переносяться автоматично на адаптацію для іншої культури й мови. Для адаптованої версії потрібні емпіричні докази в intended populations; якщо використовуються оригінальні норми, треба показати, що це статистично й справедливо. ITC Guidelines for Translating and Adapting Tests, 2nd ed.


ITC також розрізняє переклад і адаптацію. Переклад стосується перенесення мовного змісту, тоді як адаптація включає перевірку конструкта, еквівалентності, адміністративних умов, психометричних характеристик і способу інтерпретації. Тому наявність українського тексту опитувальника — лише одна частина роботи. International Test Commission


Українська практика має власну професійну інфраструктуру. Всеукраїнська психодіагностична асоціація публікує психодіагностичні стандарти та окремо виділяє вимоги до норм, процедури проведення, обробки й інтерпретації результатів. Це важлива локальна рамка для користувачів тестів, але конкретну придатність кожної методики все одно треба перевіряти за її документацією. Єдині психодіагностичні стандарти ВПА


Порівняння між мовами і культурами потребує більше, ніж однакової шкали


Якщо українська та англійська версії тесту обидві видають, наприклад, T-бали, це ще не робить результати безпосередньо порівнюваними. ITC рекомендує порівнювати бали між популяціями лише тоді, коли встановлено потрібний рівень інваріантності на шкалі звітування, а для зв’язування мовних версій використовувати відповідний дизайн і аналіз. ITC Guidelines for Translating and Adapting Tests, 2nd ed.


Measurement invariance не означає автоматичної відсутності будь-якого bias, а DIF не є автоматичним доказом несправедливості тесту. Це окремі психометричні питання. Для цієї статті важливий принцип: однаковий числовий формат не є достатнім доказом того, що результати мають однаковий психологічний зміст у різних групах.


Чи можна інтерпретувати сирий бал без перетворення


Іноді так. Якщо сирий бал має прямо обґрунтований зміст для intended use, його можна інтерпретувати без переходу на нормативну шкалу. Standards прямо передбачають таку ситуацію: коли raw scores призначені для безпосередньої інтерпретації, їхній зміст, intended interpretations і limitations мають бути описані та обґрунтовані так само, як для scale scores. Standards for Educational and Psychological Testing


Прикладом може бути тест знань, де за належного дизайну частка правильних відповідей має зміст щодо чітко визначеної області завдань, або інструмент із критеріальним порогом, для якого обґрунтовано саме первинний рахунок. Але навіть у таких випадках «сирий» не означає «самоочевидний»: потрібні правила, докази і контекст.


Стандартний бал не завжди робить інтерпретацію простішою


Перетворена шкала може полегшувати професійне звітування й одночасно бути незрозумілою читачеві. T = 63 часто менш інтуїтивний, ніж фраза «результат приблизно на 1,3 стандартного відхилення вище середнього референтної групи». Хороший звіт пояснює і число, і систему координат, у якій воно має сенс.


Окрема проблема — надмірна точність. Якщо таблиця видає T = 61,7, це не означає, що тест здатен розрізняти людей з точністю до десятої бала. Кількість десяткових знаків повинна відповідати точності вимірювання і правилам звітування. Псевдоточність може створювати враження більшої впевненості, ніж дозволяють дані.


Саме тому інтерпретація результату є окремим шаром психометричної роботи. Про те, як балу або зміні бала надають зміст, чим референтні значення відрізняються від meaningful thresholds і чому статистична різниця не тотожна практичній важливості, читайте в матеріалі «Інтерпретованість результатів психологічного вимірювання».


Стандартизований бал при повторному вимірюванні


Коли тест повторюють у тієї самої людини, зміна стандартного бала може виникати з двох різних причин: змінився сирий результат або змінилася система, відносно якої цей результат стандартизують. Якщо для обох моментів використано ті самі фіксовані норми, зміна відображає зміну позиції на тій самій шкалі. Якщо ж норми залежать від віку і людина переходить в іншу вікову групу, стандартний бал може залишитися схожим навіть при зміні сирого результату — або навпаки.


Це особливо важливо для розвитку дітей і підлітків. Віково-нормований бал може відповідати питанню «як дитина виглядає порівняно з ровесниками свого віку», тоді як сирий бал — питанню «скільки завдань або індикаторів вона виконала/набрала». Для оцінки розвитку ці два питання не тотожні.


Ще одна помилка — вважати будь-яку зміну стандартного бала «реальною зміною». Для цього треба враховувати похибку вимірювання, надійність, practice effects, регресію до середнього, умови повторного тестування та мету інструмента. RCI, MDC і клінічно важлива зміна — різні поняття, які не можна замінити простим порівнянням двох чисел.


Сирий бал, стандартний бал і психологічний конструкт


Психологічний тест не вимірює абстрактний конструкт безпосередньо. Він створює спостережувані дані, з яких за моделлю роблять висновок про латентну характеристику. Сирий бал — один із можливих способів агрегувати ці дані; стандартизований бал — спосіб подати або інтерпретувати отриману оцінку на визначеній шкалі.


Тому відстань між «людина відповіла так» і «у людини такий-то рівень конструкта» проходить через кілька логічних кроків: визначення конструкта, операціоналізацію, дизайн завдань, скоринг, модель вимірювання, оцінку надійності/точності, валідизацію інтерпретації та, за потреби, норми. Перетворення бала — лише один із цих кроків. Докладніше про саму логіку конструкта дивіться в статті «Психологічний конструкт».


Найпоширеніші помилки під час тлумачення


Перша помилка — читати сирий бал як абсолютний рівень. «30 балів» без діапазону, ключа, напрямку шкали й норм майже нічого не означає. Друга — вважати стандартний бал відсотком правильних відповідей. T = 70 — не «70%». Третя — плутати процентиль і відсоток правильних відповідей: 90-й процентиль описує відносну позицію, а не частку виконаних завдань.


Четверта помилка — універсалізувати T-шкалу. У багатьох системах середнє T = 50 і SD = 10, але конкретна інтерпретація діапазонів залежить від тесту. П’ята — плутати T-score з t-statistic. Шоста — припускати, що z = 2 автоматично означає «патологію» або «обдарованість». z описує статистичну позицію, а психологічний ярлик потребує окремого обґрунтування.


Сьома помилка — використовувати норми для іншої популяції без доказів. Восьма — переносити норми з іншої мовної версії після простого перекладу. Дев’ята — вважати, що стандартизація виправляє слабку валідність або надійність. Десята — порівнювати стандартизовані бали двох різних тестів лише тому, що вони мають однаковий центр і стандартне відхилення.


Одинадцята помилка — ігнорувати напрямок шкали. У деяких тестах високий бал означає більшу вираженість проблеми, в інших — кращу функцію або ресурс. Дванадцята — використовувати старі норми без перевірки актуальності. AERA, APA та NCME прямо вимагають підтримувати норми достатньо актуальними для точних і доречних інтерпретацій. Standards for Educational and Psychological Testing


Як правильно читати результат тесту: практичний алгоритм


Крок 1. З’ясуйте, що саме вимірює шкала і для якої мети створено тест. Крок 2. Перевірте версію, мову, вікову або іншу intended population. Крок 3. Встановіть правила скорингу: як із відповідей утворюється сирий бал або модельна оцінка. Крок 4. Знайдіть опис шкали звітування: z, T, percentile, sten, stanine, IRT scale score чи інша система.


Крок 5. Перевірте, яка референтна популяція стоїть за нормами, коли збирали нормативні дані і наскільки група релевантна конкретній людині. Крок 6. З’ясуйте, чи є окремі норми за віком, статтю, клінічним статусом або іншими ознаками та чим обґрунтовано їх використання. Крок 7. Перевірте показники надійності/точності та інформацію про похибку вимірювання.


Крок 8. Читайте standardized/scale score лише в межах дозволеної інтерпретації. Крок 9. Не перетворюйте нормативну позицію на діагноз без відповідної діагностичної процедури. Крок 10. Якщо результат впливає на важливе клінічне, освітнє або професійне рішення, використовуйте тест як частину ширшого оцінювання і спирайтеся на кваліфіковану інтерпретацію. Про різницю між тестом як інструментом і процедурою тестування дивіться «Психологічне тестування».


Коли таблиці перетворення не можна переносити між версіями тесту


Таблиця «сирий бал → стандартний бал» належить конкретній версії інструмента і конкретній системі норм. Якщо тест переглянули, змінили кількість завдань, змінили ключ, адаптували мову або перевели на іншу форму адміністрування, старі конверсії можуть втратити коректність. Standards вимагають повідомляти користувачів про зміни специфікацій, коригування шкали та ступінь порівнюваності результатів старої й нової версій. Standards for Educational and Psychological Testing


Це одна з причин, чому не слід копіювати таблиці з неофіційних сайтів, старих методичок або чужих перекладів. Навіть якщо числа виглядають правдоподібно, без provenance неможливо впевнено встановити, до якої версії тесту, популяції та процедури вони належать. Окремо існує питання авторського права та ліцензування тестових матеріалів: психометрична якість і право на використання — різні речі.


Коли стандартні бали особливо корисні


Стандартні бали особливо корисні, коли потрібно описати відносну позицію на одній і тій самій нормативній шкалі; зіставити підшкали, для яких спеціально створено спільну метрику; звітувати результати різних форм тесту після належного equating; відстежувати результат на стабільній шкалі; уникнути плутанини через різні сирі діапазони; або комунікувати складну модельну оцінку у зрозумілішій формі.


Їхня сила — у стандартизованій системі координат, а не в магічній властивості числа. Якщо система координат добре задокументована, бал стає більш інтерпретованим. Якщо норми слабкі, популяція невідповідна або призначення шкали незрозуміле, перетворення може лише надати невизначеному результату вигляд точності.


FAQ


Чим сирий бал відрізняється від стандартного бала?


Сирий бал безпосередньо утворюється з відповідей або виконання завдань за правилами скорингу. Стандартний або шкальний бал є результатом подальшого перетворення на визначену шкалу. Перетворення може використовувати середнє і стандартне відхилення, нормативну таблицю, процентилі, IRT-модель або інший алгоритм.


Чи є сирий бал тим самим, що відсоток правильних відповідей?


Не обов’язково. У деяких тестах сирий бал справді дорівнює кількості правильних відповідей, а відсоток можна обчислити з цієї кількості. В опитувальниках сирий бал часто є сумою категорій відповідей, а в інших інструментах застосовують ваги або складніший скоринг. NCME Glossary


Чи стандартний бал завжди має середнє 50?


Ні. Середнє 50 і стандартне відхилення 10 — класична конвенція T-бала. z-бал має центр 0 і стандартне відхилення 1. Інші шкали можуть мати інші центри та одиниці. Назву і параметри треба брати з посібника конкретного тесту.


Що означає z = 0?


У звичайному z-перетворенні це означає результат на рівні середнього значення референтного розподілу. Це не означає «нульова вираженість» психологічної характеристики. APA Dictionary: z score


Що означає T = 50?


У класичній T-шкалі це центр розподілу, тобто значення, що відповідає z = 0. Але психологічний зміст T = 50 залежить від того, який тест, яка шкала і яка нормативна група стоять за числом. APA Dictionary: T score


Чи 90-й процентиль означає 90% правильних відповідей?


Ні. Процентильний ранг описує місце результату в розподілі: приблизно 90% балів у референтній групі лежать нижче нього. Відсоток правильних відповідей описує частку правильно виконаних завдань. Це різні показники. NCME Glossary


Чи можна порівняти T-бали двох різних тестів?


Математично вони можуть мати однаковий формат, але змістовно порівнювати їх можна лише тоді, коли є підстави вважати, що тести вимірюють порівнювані величини, а шкали належно пов’язані. Однакові 50 ± 10 не створюють психометричної еквівалентності.


Чи стандартний бал точніший за сирий?


Сам факт перетворення не підвищує точність. Якщо це лінійне перетворення, інформація і похибка просто виражаються в інших одиницях. Точність залежить від вимірювальної процедури, надійності та джерел похибки, а не від того, наскільки «професійно» виглядає шкала.


Чому однаковий сирий бал може дати різні стандартні бали?


Тому що використовуються різні норми або різні правила перетворення. Наприклад, вікові групи можуть мати різні середні та стандартні відхилення. У такому разі одна й та сама первинна сума означає різну позицію відносно відповідної референтної групи.


Чи можна використовувати норми англомовної версії для українського перекладу?


Лише якщо є емпіричні докази, що таке використання статистично доречне й справедливе. ITC прямо зазначає, що норми, надійність і валідність вихідної версії не переносяться на адаптовану версію автоматично. ITC Guidelines for Translating and Adapting Tests, 2nd ed.


Чи високий стандартний бал означає проблему?


Не універсально. Напрямок шкали і зміст високих значень залежать від конструкта. В одному тесті високий бал може означати більшу вираженість симптому, в іншому — сильнішу навичку або ресурс. Навіть для симптомної шкали високий бал не дорівнює діагнозу без відповідної клінічної оцінки.


Що робити, якщо в тесті немає опису норм і перетворення?


Не вигадувати власну інтерпретацію. Якщо немає технічної документації, незрозуміло, що означає шкала, для кого вона створена і з якою точністю працює. Такий дефіцит інформації є обмеженням тесту або його доступної документації, а не проблемою, яку можна виправити самостійним множенням бала на коефіцієнт.


Пов’язані статті


Процентиль у психологічному тесті: що означає 50-й, 90-й або інший процентиль — як читати процентильний ранг, нормативну групу та різницю між процентилем і відсотком правильних відповідей.


Психометрія: що це, що вона вимірює і як оцінюють якість психологічних тестів — загальна рамка психологічного вимірювання, надійності, валідності та якості тестів.


Психологічний конструкт: що це і як невидимі властивості перетворюють на вимірювані показники — про зв’язок між латентною характеристикою, спостережуваними індикаторами та тестовим балом.


Психологічне тестування: що це, як проводиться і які обмеження має результат тесту — про процедуру проведення тесту, скоринг і межі висновків.


Похибка вимірювання в психології: випадкова, систематична і чому один бал не є абсолютно точним — про невизначеність результату, SEM і те, чому перетворена шкала не усуває похибку.


Інтерпретованість результатів психологічного вимірювання: як надати зміст балу і зміні бала — про те, як число стає змістовною інтерпретацією та які межі має така інтерпретація.


Надійність психологічного тесту: що це, які бувають види і чому надійність не дорівнює валідності — про стабільність і точність балів, які не поліпшуються автоматично після стандартизації.


Норми психологічного тесту: як створюють референтні значення і чому вони залежать від популяції — про референтні популяції, нормативні вибірки, актуальність норм і межі порівняння.


Стандартизація психологічного тесту: єдина процедура, інструкції, підрахунок і умови проведення — про стандартизовані умови тестування і відмінність стандартизації процедури від перетворення бала.


z-бал: що це, як показує відхилення від середнього і як використовується в психометрії — окрема сторінка про z-перетворення, середнє, стандартне відхилення та межі інтерпретації.


T-бал у психологічних тестах: як перетворюють z-бали і що означають результати — окрема сторінка про T-шкалу, її перетворення та типові помилки тлумачення.


Джерела


American Educational Research Association, American Psychological Association, & National Council on Measurement in Education. (2014). Standards for Educational and Psychological Testing.



American Psychological Association. (2018). Standardized score. APA Dictionary of Psychology.


American Psychological Association. (2018). T score. APA Dictionary of Psychology.


American Psychological Association. (2020). APA Guidelines for Psychological Assessment and Evaluation.


American Psychological Association. (2023). z score. APA Dictionary of Psychology.



National Council on Measurement in Education. Glossary.


Всеукраїнська психодіагностична асоціація. Єдині психодіагностичні стандарти.


Всеукраїнська психодіагностична асоціація. Норми. Глосарій.

 
 
bottom of page