top of page

Психологічна енкциклопедія

Шкали вимірювання: номінальна, порядкова, інтервальна і відношень — що вони означають у психології

6 днів тому
Читати 11 хв

Автор: Український психологічний ХАБ · Опубліковано: 23 вересня 2026 · Редакційна політика


Шкали вимірювання — це спосіб описати, яку саме інформацію несуть значення змінної і які твердження про ці значення мають зміст. У класичній схемі, яку Стенлі Стівенс сформулював у 1946 році, розрізняють чотири рівні: номінальний, порядковий, інтервальний і рівень відношень. Вони відрізняються не тим, «наскільки точні» числа, а тим, які відношення між значеннями зберігають зміст.


Для психології ця класифікація корисна як початкова карта, але не як автоматичний алгоритм вибору статистичного тесту. Класичні правила Стівенса давно стали предметом методологічної дискусії: Velleman і Wilkinson показували, що чотирирівнева типологія може бути надто грубою, а сучасний аналіз порядкових даних демонструє, що наслідки вибору моделі залежать від структури даних, дослідницького питання та припущень моделі, а не лише від назви шкали.


Коротко: чотири рівні вимірювання


  • Номінальна шкала: значення позначають різні категорії. Можна встановити, чи належать два спостереження до тієї самої або різних категорій, але між категоріями немає природного порядку.

  • Порядкова шкала: значення можна впорядкувати — вище/нижче, більше/менше, сильніше/слабше, — але відстань між сусідніми позиціями не зобов’язана бути однаковою.

  • Інтервальна шкала: порядок має значення, а однакові числові різниці інтерпретуються як однакові інтервали. Нульова точка при цьому умовна, тому співвідношення на кшталт «удвічі більше» не є змістовними автоматично.

  • Шкала відношень: має властивості інтервальної шкали та змістовний нуль, що відповідає відсутності вимірюваної кількості. Тому за належної операціоналізації змістовними можуть бути і відношення: 20 секунд — удвічі довше за 10 секунд.


Першоджерелом цієї схеми є стаття Стівенса On the Theory of Scales of Measurement у Science. Її історичне значення велике: вона дала психологам і статистикам спільну мову для обговорення структури даних. Сьогодні цю схему варто читати як класичну модель вимірювання, а не як завершений закон статистики.


Що саме ми класифікуємо: конструкт, змінну чи спосіб запису


Рівень вимірювання належить не абстрактному психологічному конструкту сам по собі й не зовнішньому вигляду числа. Він стосується того, що означають значення в конкретній операціоналізації та які перетворення цих значень не змінюють зміст висновків.


Наприклад, тривогу можна описати номінально — «є/немає певної категорії відповіді», порядково — «низька/середня/висока вираженість», або числовим балом психометричного інструменту. Сам факт появи числа 17 не робить результат інтервальним. Потрібно знати, як отримано бал, що він представляє, як побудована шкала і які властивості підтримує її вимірювальна модель.


Тому одна й та сама сфера явищ може породжувати дані різних рівнів. І навпаки, однаковий формат 1–5 може означати різні речі: код категорії, ранг, окрему відповідь на пункт або компонент багатопунктової шкали.


Номінальна шкала: категорії без порядку


Номінальний рівень відповідає на запитання «це те саме чи інше?». Значення поділяють спостереження на взаємовиключні категорії, але самі категорії не утворюють природної числової осі.


У психологічному дослідженні номінальними можуть бути експериментальна умова, тип стимулу, категорія відповіді, вид завдання або код групи. Якщо дослідник позначив умови числами 1, 2 і 3, ці числа залишаються ярликами. З них не випливає, що умова 3 «утричі більша» за умову 1 або що середнє 2,1 має психологічний сенс.


Допустиме перетворення для номінальних значень — взаємно однозначне перейменування категорій. Якщо «А» замінити на 7, а «Б» на 2, інформація не змінюється, поки відповідність категорій збережена. Саме ця інваріантність є важливішою за те, чи записані категорії словами або числами.


Для номінальних даних природними описами є частоти, частки, мода та таблиці спряженості. Конкретний статистичний метод залежить від дизайну й моделі даних, але арифметичні дії над кодами категорій самі по собі не мають змісту.


Порядкова шкала: порядок є, рівних відстаней немає


Порядковий рівень додає до розрізнення категорій інформацію про порядок. Ми можемо сказати, що одна позиція вища за іншу, але не знаємо, чи однаковою є відстань між першою і другою позиціями та між другою і третьою.


Типові приклади — ранги, категорії «легкий/помірний/виражений», окрема відповідь на пункт від «повністю не згоден» до «повністю згоден», а також процентильний ранг. Усі вони задають впорядкування, але не гарантують рівних психологічних інтервалів.


Якщо значення 1, 2, 3, 4 і 5 кодують п’ять упорядкованих відповідей, різниця між 1 і 2 не обов’язково психологічно дорівнює різниці між 4 і 5. Код дає порядок; рівність інтервалів потребує окремого обґрунтування.


Для порядкової шкали зміст зберігається за будь-якого строго монотонного перетворення, яке не змінює порядок. Якщо оцінки 1, 2, 3 перетворити на 10, 20, 100, порядок лишається тим самим, хоча середні та різниці зміняться. Це добре показує, чому інтерпретація різниць потребує більшої структури, ніж проста впорядкованість.


Інтервальна шкала: змістовні рівні різниці


Інтервальний рівень означає, що однакові числові різниці представляють однакові інтервали на вимірюваній шкалі. Якщо різниця між A і B дорівнює 10 одиницям, а між C і D також 10, ці інтервали мають однаковий вимірювальний зміст у межах моделі.


Класичний приклад поза психологією — температура за Цельсієм: різниця між 10 °C і 20 °C така сама за розміром, як між 20 °C і 30 °C, але 20 °C не є «удвічі теплішим» за 10 °C, бо нуль за Цельсієм не означає відсутність теплової величини.


У психології поняття інтервальності складніше. Стандартизований бал, наприклад T-бал, є лінійним перетворенням іншого бала, але сам формат «середнє 50, стандартне відхилення 10» не доводить, що психологічний конструкт виміряно з рівними інтервалами. Інтервальна інтерпретація має спиратися на модель вимірювання та доказ того, що однакові зміни бала можна змістовно трактувати як однакові зміни на відповідній шкалі.


Математично інтервальна шкала допускає додатні лінійні перетворення виду y = a·x + b, де a > 0. Додавання константи змінює нуль, але не змінює відношення різниць. Це і є причина, чому різниці можуть бути змістовними, а прості співвідношення значень — ні.


Шкала відношень: змістовний нуль і змістовні відношення


Шкала відношень має впорядкованість, рівні інтервали та нуль, який має зміст як відсутність вимірюваної кількості. За цих умов співвідношення можуть бути інваріантними: 20 одиниць справді можуть означати вдвічі більшу кількість, ніж 10.


У психологічних і поведінкових дослідженнях до такого типу часто належать фізичні або лічильні показники: тривалість реакції, час виконання завдання, кількість певних подій, число помилок або частота поведінки за визначений період. Проте навіть тут потрібно розрізняти числову величину й психологічний висновок.


Наприклад, 20 помилок — удвічі більше помилок, ніж 10. З цього не випливає, що людина «удвічі менш уважна» або має «удвічі тяжчий» розлад. Відношення має зміст для лічильника помилок, але не переноситься автоматично на латентний психологічний конструкт.


Для шкали відношень допустиме перетворення має зберігати нуль і пропорції, тобто y = a·x за a > 0. Перехід із секунд у мілісекунди змінює числовий масштаб, але зберігає твердження про відношення тривалостей.


Чому нуль — головна пастка


Запис «0» сам по собі не робить шкалу шкалою відношень. Потрібно, щоб нуль означав відсутність саме тієї кількості, яку вимірюють, і щоб співвідношення значень були змістовними.


Нуль балів у тесті може означати відсутність набраних балів за конкретними правилами оцінювання, але не обов’язково повну відсутність здібності, симптомів або риси. Так само нуль на стандартизованій шкалі може бути просто умовною точкою відліку.


Практичне правило: перш ніж сказати «удвічі більше», запитайте, чи збереглося б це твердження після допустимої зміни одиниць вимірювання. Якщо відповідь залежить від довільно обраного нуля, відношення не є фундаментальною властивістю шкали.


Класична типологія Стівенса: науковий статус сьогодні


Чотирирівнева схема Стівенса є історичною та широко вживаною моделлю. Її варто знати, бо вона дає компактний спосіб говорити про структуру даних і допустимі твердження. Водночас Velleman і Wilkinson прямо критикували використання номінально-порядково-інтервально-відношеневої типології як жорсткого регулятора статистичного аналізу: реальні дані, цілі аналізу й моделі часто не вкладаються в просту чотириклітинну таблицю.


Методологічна позиція психологічної науки також не зводиться до правила «спочатку визнач рівень — потім за таблицею вибери тест». У рекомендаціях APA щодо статистичного висновування Wilkinson і Task Force on Statistical Inference наголошували на перевірці даних, припущень, ефектів і невизначеності. Рівень вимірювання є частиною цього рішення, але не єдиним його джерелом.


Отже, науково коректна позиція така: класифікація Стівенса залишається корисною для навчання та первинного аналізу властивостей даних; її використання як універсальної заборонної таблиці для статистики є спірним і методологічно недостатнім.


Шкала Лайкерта: де виникає найбільше суперечок


Окремий пункт із відповідями на кшталт «повністю не згоден — не згоден — важко сказати — згоден — повністю згоден» є порядковою відповіддю: категорії впорядковані, але рівність психологічних відстаней між сусідніми варіантами не задана самим форматом.


Коли кілька таких пунктів об’єднують у сумарний або середній бал, виникає інше питання: чи можна практично моделювати цей композит як приблизно метричний. Огляд Harpe показує, що для рейтингових і Likert-даних вибір параметричних або непараметричних методів залежить від конкретних умов, а не від одного ярлика.


У літературі немає одного простого правила. Norman узагальнив дані про стійкість багатьох параметричних методів до порушення припущень і виступив проти автоматичної заборони таких методів для Likert-шкал. Натомість Liddell і Kruschke продемонстрували сценарії, де аналіз порядкових даних метричними моделями може давати хибні позитивні висновки або втрачати чутливість.


Практичний висновок полягає не в тому, що «Likert завжди можна» або «Likert ніколи не можна» аналізувати параметрично. Потрібно розрізняти окремий пункт і багатопунктовий композит, кількість категорій, форму розподілу, вибірку, ціль оцінювання, модель похибки та наслідки можливого порушення припущень. Корисне коротке пояснення цього розрізнення також дають Sullivan і Artino.


Рівень вимірювання не визначає статистичний тест автоматично


Вибір аналізу починається з дослідницького запитання. Описати частоти, оцінити різницю між групами, побудувати модель прогнозування, оцінити латентну рису або перевірити зміну в часі — це різні завдання, навіть якщо вихідні дані мають той самий формат.


Далі мають значення дизайн дослідження, незалежність або залежність спостережень, розмір вибірки, форма розподілу, пропущені дані, викиди, структура похибки, кількість категорій, наявність цензурування, припущення конкретної моделі та те, який саме параметр дослідник хоче інтерпретувати.


Тому фраза «порядкова шкала — отже, лише непараметричний тест» занадто груба. Так само грубою є протилежна фраза «параметричні тести завжди достатньо стійкі, тому рівень вимірювання не має значення». Обидві позиції ігнорують контекст, у якому модель може бути стійкою або давати систематичне викривлення.


Найкраща практика — формулювати, що саме означають бали, які припущення робить обрана модель і чи змінюється висновок за розумних альтернатив. Це сильніше за механічне посилання на назву рівня.


Рейтингова шкала, шкала вимірювання і психометрична шкала — різні речі


Слово «шкала» в психології перевантажене. Рейтингова шкала — це формат відповіді або оцінювання, наприклад 0–10 чи «ніколи — інколи — часто — завжди». Рівень вимірювання — це властивість інформації, яку несуть значення. Психометрична шкала або субшкала — це набір пунктів і правил підрахунку, створений для оцінювання певного конструкта.


Одна рейтингова шкала може породжувати порядкові дані. Сума кількох пунктів може використовуватися як композитний бал. А висновок про інтервальність такого бала потребує окремого психометричного і модельного обґрунтування. Три значення слова «шкала» не можна взаємозамінювати.


Психометричний бал не успадковує рівень вимірювання від цифр


У психометрії числа є результатом процедури: добору завдань, правил кодування, моделі, нормування, перетворення та інтерпретації. Тому вигляд бала не дає достатньої інформації про його вимірювальні властивості.


Сирий бал 20 може бути просто сумою правильних відповідей або категорій. Процентиль 80 означає відносне положення у нормативному розподілі, а не «80 % властивості». T-бал 60 означає стандартизоване положення на шкалі з певним середнім і стандартним відхиленням, але його не слід плутати з t-статистикою з перевірки гіпотез.


Так само перетворення бала не створює нової валідності. Лінійне масштабування може змінити середнє та стандартне відхилення, але не доводить, що інструмент справді вимірює заявлений конструкт або що однакові прирости мають однакове психологічне значення.


Процентиль — не відсоток правильних відповідей


Процентиль показує, яка частка нормативної групи має результат нижчий за певний бал або не перевищує його за прийнятим правилом. Це позиція у розподілі. Відстань між 50-м і 60-м процентилями не зобов’язана відповідати тій самій різниці сирих балів, що й відстань між 80-м і 90-м.


Відсоток правильних відповідей — це частка виконаних завдань у конкретному наборі. Він має іншу природу. Навіть якщо 80 % чисельно збігається з 80-м процентилем, ці величини відповідають на різні запитання і не є взаємозамінними.


Категоризація безперервного бала змінює інформацію


Коли числовий бал розрізають на категорії «низький — середній — високий», нова змінна має порядкову структуру, навіть якщо вихідний бал аналізували як метричний. Межі категорій стискають інформацію: два близькі значення по різні боки порога потрапляють у різні групи, а два досить різні значення всередині однієї групи стають однаковою категорією.


У клінічному контексті це особливо важливо. Пороговий бал може бути корисним для скринінгу, маршрутизації або дослідницької класифікації, але не перетворює один тестовий результат на діагноз. Скринінг, оцінювання, клінічна діагностика та моніторинг результатів мають різні цілі.


Що рівень вимірювання означає для психологічного тестування


Сучасні Standards for Educational and Psychological Testing розглядають інтерпретацію тестових балів через ширшу систему доказів: валідність конкретного використання та інтерпретації, надійність/точність, справедливість, відповідність популяції й умов застосування. Рівень вимірювання не замінює жодного з цих питань.


Тому під час психологічного оцінювання потрібно знати не лише, до якого рівня віднести показник. Потрібно також розуміти, для кого створено інструмент, які норми використано, що відомо про надійність і валідність, яку похибку має вимірювання та чи відповідає спосіб інтерпретації заявленій меті.


Особливо небезпечно робити сильний клінічний висновок лише тому, що бал виглядає «точним» або поданий з десятими частками. Десяткові знаки збільшують кількість символів, а не доказовість. Точність інтерпретації визначається властивостями вимірювання та якістю доказів.


Поширені помилки інтерпретації


  • «Якщо категорії закодовані 1, 2, 3, то це вже кількісна шкала». Ні. Числа можуть бути лише мітками.

  • «Якщо порядок відомий, можна трактувати різницю між сусідніми балами як однакову». Ні. Це потребує інтервальної структури або обґрунтованої моделі.

  • «Нульовий бал означає повну відсутність психологічної властивості». Не обов’язково. Нуль може бути умовою правил підрахунку.

  • «Удвічі більший тестовий бал означає удвічі більше риси». Для більшості психологічних балів таке співвідношення не обґрунтоване.

  • «Процентиль 80 — це 80 % правильних відповідей». Ні. Процентиль описує позицію відносно нормативної групи.

  • «T-бал — це t-статистика». Ні. T-бал є стандартизованим способом подання тестового результату; t-статистика належить до статистичного висновування.

  • «Окремий Likert-пункт і сумарна багатопунктова шкала мають однакові вимірювальні властивості». Це різні об’єкти аналізу.

  • «Порядкові дані завжди забороняють параметричні методи». Таке універсальне правило не підтримується сучасною методологічною літературою.

  • «Якщо параметричний тест дав p < 0,05, шкала була інтервальною». Статистична значущість не є доказом рівня вимірювання.

  • «Рівень вимірювання доводить валідність тесту». Ні. Валідність стосується обґрунтованості інтерпретацій і використання балів, а не лише їх числового формату.


Як визначити рівень вимірювання на практиці


Замість того щоб дивитися лише на цифри, послідовно поставте п’ять запитань.


  • 1. Що означає значення? Категорію, місце в порядку, кількісну різницю чи фізичну/лічильну кількість?

  • 2. Чи має зміст порядок? Якщо перестановка категорій не змінює зміст, це номінальна структура.

  • 3. Якщо порядок є, чи однакові різниці мають однаковий зміст? Якщо ні або це не обґрунтовано, безпечніше мислити про порядкову структуру.

  • 4. Чи має нуль зміст як відсутність вимірюваної кількості? Якщо ні, навіть за рівних інтервалів це не шкала відношень.

  • 5. Які перетворення можна зробити, щоб суттєві твердження залишилися істинними? Це запитання часто точніше за просте «до якої клітинки віднести змінну?».


Якщо на третє або четверте запитання немає переконливої відповіді, не слід «підвищувати» рівень шкали лише для зручності статистичного аналізу. Краще явно описати припущення й перевірити, наскільки висновки до них чутливі.


Чотири рівні як ієрархія: корисно, але не буквально


У підручниках чотири рівні часто зображають як сходи: номінальний → порядковий → інтервальний → відношень. У цій схемі кожний наступний рівень зберігає попередні властивості та додає нову.


Це зручно як дидактична модель. Проте реальні вимірювальні системи можуть мати властивості, які не вкладаються в просту ієрархію, а психометричні моделі можуть визначати шкалу через інші припущення. Саме тому сучасна критика не відкидає потребу розуміти структуру даних — вона заперечує надто механічне перетворення чотирьох назв на універсальний закон аналізу.


FAQ


Чи є окремий пункт Лайкерта порядковою шкалою?


Так, у типовому випадку окрема відповідь із впорядкованими категоріями є порядковою. Категорії мають напрям, але рівність відстаней між ними не задана самим форматом.


Чи можна обчислювати середнє для порядкових даних?


Математично середнє можна порахувати для числового коду, але питання полягає в тому, чи має воно зміст для конкретної шкали і чи є модель, що робить таку інтерпретацію виправданою. Для окремих грубих порядкових категорій медіана й розподіл категорій часто прозоріші. Для багатопунктових композитів рішення залежить від психометричних властивостей і мети аналізу.


Чи є IQ інтервальною шкалою?


У прикладних дослідженнях IQ-бали часто аналізують як приблизно інтервальні стандартизовані показники. Але сам факт стандартизації не є доказом рівних інтервалів психологічної здатності на всій шкалі. Точна інтерпретація залежить від моделі тесту, способу шкалювання та завдання аналізу.


Чи є T-бал інтервальним?


T-бал — це лінійно перетворений стандартизований бал із заданими середнім і стандартним відхиленням. Він зберігає структуру вихідної метричної шкали, але не створює інтервальність там, де її не було обґрунтовано. T-бал також не має стосунку до t-статистики лише через схожу назву.


Чи є відсоток правильних відповідей шкалою відношень?


Як частка правильно виконаних завдань він має зрозумілий нуль і пропорційну числову структуру щодо кількості правильних відповідей у конкретному наборі. Але твердження «80 % означає удвічі більше здібності, ніж 40 %» не випливає з цього. Рівень лічильника не переноситься автоматично на латентну здатність.


Чи визначає рівень вимірювання, який статистичний тест треба використати?


Він впливає на допустимі інтерпретації та вибір моделі, але не є єдиним критерієм. Потрібно враховувати дизайн, розподіл, залежність спостережень, розмір вибірки, кількість категорій, дослідницьке питання, цільовий параметр і стійкість висновку до припущень.


Навіщо знати ці рівні, якщо сучасна статистика складніша?


Щоб не приписувати числам більше змісту, ніж вони мають. Класична типологія вчить відрізняти категорію від порядку, порядок від рівних різниць, а рівні різниці — від змістовних відношень. Сучасна методологія додає до цього головне уточнення: аналіз визначається не назвою шкали, а обґрунтованою моделлю даних і змістом висновку.


Пов’язані статті





Джерела


 
 
bottom of page