top of page

Психологічна енкциклопедія

Теорія відповіді на завдання (IRT): як моделюють зв’язок між латентною ознакою і відповідями на items

6 днів тому
Читати 19 хв

Оновлено: 6 днів тому

Автор: Український психологічний ХАБ · Опубліковано: 23 вересня 2026 · Редакційна політика


Теорія відповіді на завдання (Item Response Theory, IRT) — це сімейство психометричних моделей, які описують імовірність конкретної відповіді на окреме завдання залежно від рівня латентної ознаки людини та властивостей самого завдання. В освітній і психологічній практиці IRT використовують для калібрування завдань, побудови шкал та банків завдань, оцінювання точності вимірювання на різних рівнях ознаки, аналізу диференційного функціонування завдань і комп’ютеризованого адаптивного тестування. Огляд Нгуєн та співавторів і огляд Томаса показують, як ці принципи застосовують не лише до тестів здібностей, а й до психологічних та клінічних шкал.


Українська термінологія не цілком уніфікована. Поряд із назвою «теорія відповіді на завдання» в українських академічних і професійних матеріалах вживають «сучасна теорія тестів» та «теорія тестових завдань». Київський національний університет імені Тараса Шевченка прямо подає Item Response Theory як «Теорію Тестових Завдань», а Український центр оцінювання якості освіти використовує формулу «сучасна теорія тестів (Item Response Theory)». У цій статті IRT використовується як міжнародно впізнавана назва сімейства моделей, а слово item передається переважно як «завдання» або «пункт шкали» залежно від контексту.


Ключова ідея IRT полягає в переході від запитання «скільки балів набрала людина?» до запитання «яка модель найкраще описує зв’язок між її положенням на латентній шкалі та патерном відповідей на окремі завдання?». Саме тому IRT природно пов’язана з поняттями латентної та спостережуваної змінної: спостерігаються відповіді, а латентну ознаку оцінюють через модель.


IRT не є одним-єдиним рівнянням і не є автоматично «кращою» за класичну теорію тестів. Це велике сімейство одновимірних, багатовимірних, дихотомічних, політомних та інших моделей. Їхня корисність залежить від того, чи відповідають дані припущенням обраної моделі, чи достатньо даних для стабільного оцінювання параметрів і чи підтримує весь процес саме ту інтерпретацію балів, заради якої створено тест. Стандарти AERA, APA та NCME розглядають валідність, надійність, справедливість і належне використання тестів як ширшу систему доказів; сама наявність IRT-аналізу не встановлює валідність інструменту.


Що саме моделює IRT


У найзагальнішій формі IRT описує умовний розподіл відповіді на завдання за заданого рівня латентної ознаки. Для дихотомічного завдання це часто ймовірність відповіді 1 — наприклад, правильної відповіді або підтвердження твердження — за певного значення θ (тета). Для порядкових категорій модель описує ймовірності переходу через пороги або вибору окремих категорій.


Графічне представлення цього зв’язку називають функцією відповіді на завдання або характеристичною кривою завдання. По горизонталі відкладають латентну ознаку θ, по вертикалі — імовірність певної відповіді. Форма кривої визначається параметрами моделі. Завдання можуть відрізнятися тим, де на шкалі вони найінформативніші, наскільки різко вони розрізняють близькі рівні ознаки і, в деяких моделях, якою є нижня асимптота ймовірності правильної відповіді.


Латентна ознака θ


θ — це модельна координата людини на латентному континуумі: здібності, тяжкості симптомів, риси, установки або іншого конструкта, який передбачається вимірювати. Вона не є безпосередньо спостережуваною величиною і не повинна трактуватися як фізична властивість, що існує незалежно від моделі. Її значення має сенс у межах визначеного конструкта, конкретної калібровки, способу ідентифікації шкали та доказів того, що модель адекватно описує дані.


У багатьох калібровках шкалу θ умовно центрують біля 0 і задають стандартне відхилення 1 у референтній популяції. Це питання масштабу, а не твердження, що «нуль» означає відсутність ознаки. Ту саму латентну шкалу можна лінійно перетворити, наприклад у T-шкалу, якщо правила перетворення визначені та збережено зміст калібровки.


Параметри завдання


У різних IRT-моделях набір параметрів відрізняється. Найвідоміші параметри для дихотомічних логістичних моделей — положення або складність b, дискримінація a та нижня асимптота c. У політомних моделях замість одного параметра положення часто оцінюють кілька порогів між категоріями.


Параметр b показує, де завдання розташоване на латентному континуумі. У тесті здібностей його зазвичай називають складністю: вище b — вищий рівень здібності потрібен для заданої ймовірності правильної відповіді. У симптомній або особистісній шкалі природніше говорити про положення, тяжкість або поріг, тому що «складність» психологічного твердження може бути семантично хибною.


Параметр a описує крутизну зв’язку між θ і відповіддю. Вища дискримінація означає, що ймовірність відповіді швидше змінюється поблизу релевантної ділянки шкали, а завдання зазвичай дає більше інформації поблизу свого положення. Високе a саме по собі не робить завдання «кращим»: надзвичайно високі значення можуть сигналізувати локальну залежність, надмірну схожість пунктів або інші проблеми, а змістова репрезентативність шкали важливіша за механічне максимізування дискримінації.


Параметр c у трипараметричній логістичній моделі задає ненульову нижню асимптоту та історично пов’язаний із псевдовгадуванням у тестах із вибором відповіді. Він має значно менше природне змістове тлумачення у більшості особистісних, симптомних та інших опитувальників.


Логістична логіка: 1PL, 2PL і 3PL


Для дихотомічного завдання 2PL-модель можна записати як P(Xᵢ=1|θ)=1/[1+exp(−aᵢ(θ−bᵢ))]. Це рівняння говорить: імовірність відповіді 1 залежить від різниці між рівнем ознаки людини θ і положенням завдання bᵢ, а параметр aᵢ визначає крутизну кривої.


1PL: одна спільна дискримінація


В однопараметричній логістичній моделі всі завдання мають однакову дискримінацію, а між ними змінюється насамперед положення/складність. Саме тут часто згадують модель Раша. На рівні логістичної форми базова модель Раша близька до 1PL, але рашівська традиція має власну вимірювальну логіку, вимоги та способи оцінювання. Тому коректніше говорити про тісний зв’язок, а не оголошувати всі 1PL-аналізи просто синонімом моделюванням Раша.


2PL: завдання відрізняються і положенням, і дискримінацією


2PL дозволяє кожному завданню мати власний параметр a. Це робить модель гнучкішою для ситуацій, де одні пункти значно чіткіше розрізняють близькі рівні ознаки, ніж інші. Методологічний огляд IRT показує, як параметри положення, дискримінації та інформаційні функції утворюють центральний апарат сучасного IRT-аналізу.


3PL: додаткова нижня асимптота


3PL додає параметр c: P(Xᵢ=1|θ)=cᵢ+(1−cᵢ)/[1+exp(−aᵢ(θ−bᵢ))]. Така модель особливо відома у тестах досягнень із варіантами відповіді, де навіть за дуже низької здібності ймовірність правильної відповіді не обов’язково наближається до нуля. Додатковий параметр збільшує складність оцінювання, тому 3PL не слід вибирати лише тому, що «три параметри сучасніші за два».


Порівняння 1PL, 2PL і 3PL має бути емпіричним і змістовим: треба враховувати дизайн завдань, теорію конструкта, розмір і структуру вибірки, якість оцінювання параметрів та придатність моделі. Дослідження Браун та співавторів додатково показує, що навіть формальне порівняння вкладених моделей може мати нетривіальні статистичні нюанси.


Політомні моделі: IRT для шкал Лайкерта та багатокатегоріальних відповідей


Психологічні опитувальники часто мають не дві відповіді, а впорядковані категорії: «ніколи — рідко — інколи — часто — майже завжди», ступені згоди або рейтинги інтенсивності. Для таких даних застосовують політомні IRT-моделі. Їх не варто зводити до дихотомізації, якщо категорії несуть змістову й статистичну інформацію.


Модель градуйованих відповідей


Модель градуйованих відповідей (Graded Response Model, GRM) Фуміко Самеджіми широко застосовують для впорядкованих категорій у психологічних та медичних шкалах. Для кожного пункту оцінюється дискримінація та кілька порогів — по одному для переходів між послідовними кумулятивними категоріями. Огляд Стовер та співавторів описують GRM як базовий інструмент калібрування багатьох банків пунктів із порядковими відповідями.


Моделі часткових кредитів, узагальнених часткових кредитів і рейтингової шкали


Модель часткових кредитів належить до рашівського сімейства й дозволяє моделювати завдання з кількома впорядкованими категоріями. Узагальнена модель часткових кредитів (Generalized Partial Credit Model) додає гнучкість щодо дискримінації. Модель рейтингової шкали (Rating Scale Model) накладає спільнішу структуру порогів між категоріями для різних завдань. Вибір між цими моделями визначається не назвою шкали, а структурою відповідей, вимірювальною метою та відповідністю припущенням.


Номінальні відповіді


Коли категорії не мають природного порядку, існують номінальні IRT-моделі. Вони моделюють вибір між категоріями без припущення, що кожна наступна відповідь є «вищою» за попередню. Для більшості звичайних психологічних шкал це спеціалізований випадок, але він важливий як нагадування: IRT — сімейство моделей для різних типів даних, а не один шаблон.


Основні припущення одновимірних IRT-моделей


У прикладній психометрії найчастіше обговорюють одновимірність, локальну незалежність, монотонність і відповідність моделі даним. Сучасний методологічний огляд та COSMIN Reporting Guideline 2.0 розглядають перевірку цих умов як частину належного IRT/аналізу за моделлю Раша.


Одновимірність


Одновимірна IRT-модель передбачає, що домінантний латентний вимір достатньо описує систематичний зв’язок між відповідями на набір завдань. Це не означає, що поведінка людини буквально має лише одну психологічну причину. Йдеться про вимірювальне твердження: для цілей цієї шкали один латентний вимір має достатньо пояснювати структуру відповідей. Якщо потрібні кілька латентних вимірів, існують багатовимірні IRT-моделі.


Локальна незалежність


Після фіксації θ відповіді на різні завдання мають бути умовно незалежними у межах моделі. Якщо два пункти залишаються сильно пов’язаними навіть за однакового рівня ознаки — наприклад, майже дублюють одне одного, мають спільний стимул або один фактично підказує відповідь на інший — виникає локальна залежність. Вона може завищувати інформацію, дискримінацію та точність, якщо її ігнорувати.


Монотонність


Для багатьох моделей очікується, що зі зростанням θ імовірність відповіді, яка відображає вищий рівень ознаки, не зменшується. Для тесту здібностей це означає, що вищий рівень здібності не повинен систематично знижувати ймовірність правильної відповіді. Для симптомної шкали — що вища тяжкість латентного симптому не повинна систематично знижувати ймовірність вибору категорії, яка означає сильніший прояв, якщо саме так закодовано шкалу.


Відповідність моделі даним


Параметрична IRT-модель задає конкретну форму функції відповіді. Тому аналіз повинен перевіряти, чи ця форма адекватно описує емпіричні дані: на рівні всього тесту, окремих завдань, залишків, локальної залежності та передбачених кривих. Хороший результат одного індексу відповідності не замінює сукупної діагностики.


Інваріантність — умовна властивість, а не магічна гарантія


Однією з найважливіших переваг IRT є прагнення отримати параметри завдань, які залишаються стабільними в релевантних популяціях, та оцінки осіб, які не залежать від конкретного піднабору адекватно відкаліброваних завдань. Але це властивість за умов правильної моделі, належної калібровки та відсутності суттєвого диференційного функціонування. Фраза «IRT-параметри не залежать від вибірки» без цих умов є надмірним спрощенням.


Калібрування: звідки беруться параметри


IRT не отримує параметри завдання «з тексту». Параметри оцінюють на даних відповідей людей із визначеної вибірки або кількох пов’язаних вибірок. Калібрування — це статистичний процес, у якому одночасно або поетапно оцінюють властивості завдань і латентний розподіл/положення респондентів, задають шкалу та перевіряють модель.


У великих банках завдань калібрування часто спирається на широке покриття цільового континууму. HealthMeasures описує процес PROMIS як поєднання масштабного тестування, аналізу факторної структури, CTT та IRT з подальшим оцінюванням параметрів складності/положення й дискримінації.


Оцінювання параметрів


У практиці застосовують різні методи: маргінальне максимально правдоподібне оцінювання, EM-алгоритми, байєсівські підходи та інші процедури. Для оцінювання θ після калібрування можуть використовувати метод максимальної правдоподібності (maximum likelihood), MAP або EAP. Ці методи мають різні властивості, особливо на краях шкали та за коротких тестів. Тому в науковому звіті треба вказувати не лише «використано IRT», а й модель, програмне забезпечення, метод оцінювання та спосіб обчислення індивідуальних оцінок θ.


Чому шкалу треба ідентифікувати


IRT-шкала має довільний початок і одиницю, доки їх не зафіксовано. Зазвичай це роблять через параметри латентного розподілу, обмеження параметрів завдань або якірні завдання. Без такого кроку одна й та сама ймовірнісна структура може бути представлена на різних числових шкалах. Саме тому значення θ=1 має сенс лише разом із описом калібровки.


Інформація завдання і умовна похибка вимірювання


IRT дає змогу описувати точність не одним глобальним числом, а як функцію від θ. Інформаційна функція завдання показує, скільки статистичної інформації конкретний пункт дає на кожній ділянці латентної шкали. Інформації більше там, де відповідь на завдання найкраще розрізняє близькі рівні ознаки. Reise показує, що за локальної незалежності інформація завдань складається у тестову інформаційну функцію.


Для стандартних умовних оцінок стандартну похибку θ часто пов’язують із тестовою інформацією формулою SE(θ)≈1/√I(θ). Це означає: тест може бути дуже точним у середній частині шкали і значно менш точним на її краях або навпаки. Одне число надійності не показує цю локальну структуру точності.


Саме ця властивість є фундаментом адаптивного тестування: якщо система знає, на якій ділянці θ поточна невизначеність найбільша, вона може добирати завдання, що дає найбільше корисної інформації за дотримання інших обмежень.


IRT і класична теорія тестів: різні одиниці аналізу


Класична теорія тестів (CTT) і IRT розв’язують споріднені вимірювальні завдання, але організують їх по-різному. CTT часто працює на рівні сумарного бала та його властивостей у конкретній вибірці. IRT безпосередньо моделює відповіді на окремі завдання та латентний континуум.


• У CTT складність і дискримінація пункту зазвичай описуються вибірково залежними індексами; в IRT параметри формулюються як частина ймовірнісної моделі та прагнуть до умовної інваріантності.


• У CTT точність часто узагальнюють одним коефіцієнтом або стандартною похибкою; в IRT вона може змінюватися вздовж θ.


• У CTT сумарний бал часто є центральною статистикою; в IRT вага патерна відповідей залежить від моделі й параметрів завдань.


• IRT особливо природно підтримує банки завдань, зв’язування та вирівнювання шкал і адаптивне тестування; CTT часто простіша для розробки та інтерпретації за помірних вимог.


• Жодна з теорій не замінює змістову валідність, продуманий дизайн тесту, репрезентативні дані та відповідальну інтерпретацію.


Докладний огляд CTT та IRT у розробленні психологічних і медичних вимірювальних інструментів підкреслює саме відмінність між рівнем сумарного бала і моделями на рівні окремих завдань, а також роль інформації та параметрів завдань. Огляд Каппеллері, Ланді та Гейса


IRT і модель Раша: зв’язок без ототожнення


Модель Раша є центральною частиною історії сучасної психометрії та тісно пов’язана з IRT. У найпростішому дихотомічному записі вона має логістичну форму, де ймовірність правильної відповіді визначається різницею між здібністю людини і складністю завдання. Однак рашівська традиція робить особливий акцент на вимогах фундаментального вимірювання та «специфічній об’єктивності» (specific objectivity). Тому окрема канонічна стаття ХАБу про модель Раша розглядає її глибше, а ця сторінка зберігає ширший пошуковий інтент IRT.


Практичне правило для читача: модель Раша можна розглядати як особливо обмежувальну і концептуально специфічну гілку сучасного моделювання відповідей на завдання; 2PL, 3PL, модель градуйованих відповідей та інші моделі послаблюють або змінюють частину обмежень. Вибір не зводиться до «простішої» чи «складнішої» моделі — він залежить від вимірювальної теорії та даних.


IRT і факторний аналіз


IRT і факторний аналіз працюють із латентними структурами та мають глибокі математичні зв’язки. Для порядкових або дихотомічних відповідей багато IRT-моделей можна розглядати як повні моделі на рівні окремих завдань, близькі до категоріального факторного аналізу. У практиці факторний аналіз часто використовують для перевірки розмірності перед або разом з IRT-калібруванням.


Проте «однофакторний конфірматорний факторний аналіз (CFA) пройшла» не означає автоматичного виконання всіх IRT-припущень. Потрібно окремо розглядати локальну незалежність, монотонність, відповідність окремих завдань моделі, пороги, функціонування категорій і DIF. І навпаки, погана відповідність даним конкретної IRT-моделі не доводить, що сам психологічний конструкт не існує: проблема може бути в формулюваннях завдань, структурі даних, невідповідній параметризації або популяції.


Як вибирають IRT-модель


Модель повинна відповідати типу відповіді, теорії конструкта, дизайну тесту та реальним даним. Рішення «беремо 3PL, бо вона найповніша» або «беремо GRM, бо це шкала Лайкерта» є недостатнім. Коректний вибір включає попередню теоретичну специфікацію і емпіричну діагностику.


• Тип даних: дихотомічні, впорядковані, номінальні, дані про кількість подій, вимушеного вибору (forced-choice) або інші формати потребують відповідних моделей.


• Розмірність: одновимірна модель має бути виправданою; якщо конструкт багатовимірний, може знадобитися багатовимірна IRT (MIRT) або окремі шкали.


• Функціонування категорій: пороги мають бути змістовно і статистично інтерпретовані; надлишкові категорії не гарантують кращого вимірювання.


• Відповідність окремих завдань і моделі загалом оцінюють графічно та статистично, а не за одним універсальним пороговим значенням.


• Локальна залежність: залишкові зв’язки між завданнями можуть вимагати перегляду формулювань, тестлетів або моделі.


• DIF та інваріантність: перевіряють релевантні групи, якщо результати порівнюють між ними.


• Стабільність параметрів: складні моделі потребують достатнього інформаційного покриття та вибірки.


• Інтерпретованість: параметри й шкала повинні служити вимірювальній меті, а не лише покращувати відповідність моделі даним.


Відповідність моделі даним: одного індексу недостатньо


IRT-звіт повинен показувати, що модель перевіряли на кількох рівнях. До арсеналу можуть входити статистики відповідності окремих завдань, аналіз залишків, графічне зіставлення емпіричних і модельних кривих, тести локальної залежності, інформаційні критерії, перевірки функціонування категорій і порівняння альтернативних моделей. Конкретні методи залежать від моделі та програмного забезпечення.


Немає універсального правила «якщо один p-значення > 0,05, модель валідна». За великих вибірок дрібні відхилення можуть ставати статистично значущими, а за малих — важлива невідповідність моделі може не виявлятися. Потрібні ефект, графіка, зміст завдання і наслідки невідповідності для підрахунку балів та інтерпретації.


DIF, справедливість і культурна адаптація


Диференційне функціонування завдання (DIF) виникає, коли люди з різних груп, але з однаковим рівнем вимірюваної латентної ознаки, мають різні ймовірності відповіді на конкретне завдання. Це один із найважливіших інструментів перевірки групової еквівалентності в IRT. Докладне розмежування статистичного сигналу і справедливості подано у статті «Диференційне функціонування завдань (DIF)».


DIF не є автоматичним доказом несправедливості або упередженості. Він показує, що після вирівнювання за рівнем латентної ознаки завдання функціонує неоднаково. Причиною може бути культурний контекст, переклад, різний досвід, реальна багатовимірність, формулювання, формат, умови проведення або інша характеристика. Щоб говорити про упередженість, потрібна змістова й контекстна оцінка причин та наслідків.


Так само переклад тесту не дорівнює валідованій культурній адаптації. HealthMeasures описує переклад PROMIS як ітеративний процес із прямим і зворотним перекладом, експертною перевіркою, гармонізацією та когнітивними інтерв’ю (cognitive debriefing). Після мовної адаптації все одно потрібні емпіричні дані про структуру, параметри, DIF, надійність/точність та валідність у цільовій популяції.


IRT не доводить валідність конструкта


Це критичне розрізнення. IRT може показати, що набір відповідей добре узгоджується з певною латентною моделлю, але не може самостійно довести, що ця латентна змінна є саме тим психологічним конструктом, який записано в назві шкали. AERA/APA/NCME Standards розглядають валідність як аргумент щодо інтерпретації та використання балів, який спирається на різні джерела доказів.


Змістова валідність передує статистичній елегантності. Якщо важливі аспекти конструкта не представлені пунктами, жодна чудова відповідність моделі даним не поверне їх у шкалу. Якщо шкала змішує два різні конструкти, IRT може допомогти виявити проблему, але не визначить за дослідника, який із конструктів концептуально потрібний.


Для інструментів самооцінювання результатів здоров’я (patient-reported outcome measures) COSMIN окремо розрізняє змістову валідність (content validity), структурну валідність (structural validity), надійність, похибку вимірювання, міжкультурну валідність/інваріантність вимірювання, конструктну валідність і чутливість до змін (responsiveness). IRT та моделі Раша є потужними інструментами оцінювання структурної валідності й аналізу на рівні окремих завдань, але не замінюють всю систему властивостей вимірювання.


Коли IRT доречна для психологічної шкали


IRT особливо корисна, коли дослідницька мета вимагає вимірювання на рівні окремих завдань: побудови банку пунктів, точності на окремих ділянках конструкта, скорочення шкали без втрати заданого діапазону, зв’язування різних форм, адаптивного тестування, аналізу DIF або створення складнішої системи оцінювання балів.


Для короткої дослідницької шкали з невеликою вибіркою IRT може виявитися методологічно дорожчою, ніж потрібно. У такій ситуації добре спроєктована CTT/CFA-оцінка може бути прозорішою і стабільнішою. Метод треба добирати до запитання, а не до престижу техніки.


IRT найприродніше інтерпретується для рефлективних моделей вимірювання (reflective measurement models), де відповіді розглядаються як прояви спільної латентної ознаки. Для формативних індексів, де компоненти разом утворюють конструкт і не очікується, що вони є взаємозамінними проявами однієї причини, стандартна латентно-трейтова логіка може бути концептуально невідповідною.


IRT у клінічному вимірюванні та оцінюванні результатів здоров’я


Сучасне клінічне застосування IRT добре видно в системі PROMIS: великі банки пунктів калібрують на спільних латентних шкалах, після чого з них формують короткі форми й CAT. Рів та співавтори описали програму перевірки одновимірності, локальної незалежності, монотонності, відповідності моделі даним, DIF і калібрування банків PROMIS.


Це не означає, що IRT-оцінка є діагнозом. Латентний показник симптомної шкали описує положення людини на вимірюваному континуумі в межах інструменту. Діагностика психічного розладу вимагає окремих клінічних критеріїв, оцінювання контексту, тривалості, порушення функціонування, диференційної діагностики та інших джерел даних.


Комп’ютеризоване адаптивне тестування


Одне з найвідоміших практичних застосувань IRT — комп’ютеризоване адаптивне тестування (CAT). Алгоритм починає з початкової оцінки θ, добирає інформативне завдання, оновлює оцінку після відповіді та повторює цикл до виконання правила зупинки.


IRT і CAT не є синонімами. IRT може використовуватися без адаптивного тестування, а CAT потребує не лише IRT-калібровки, а й добре побудованого банку завдань, правил добору, балансування змісту, контролю частоти пред’явлення завдань, процедур безпеки, правил зупинки й перевірки того, що всі адаптивні маршрути зберігають валідність потрібної інтерпретації.


Банки завдань, зв’язування та вирівнювання шкал


Коли різні форми тесту містять якірні або іншим чином пов’язані завдання, IRT може допомогти розмістити параметри на спільній шкалі. Це створює основу для банків завдань, зв’язування (linking) та вирівнювання (equating) — процедур, які дають змогу порівнювати результати з різних наборів завдань за визначених умов.


Однак спільна числова шкала не виникає автоматично. Потрібні дизайн зв’язування, достатні якірні завдання, перевірка інваріантності, стабільність параметрів та явне документування перетворень. Якщо якірні завдання мають DIF або змінюють значення між популяціями, спільна метрика може бути спотворена.


Чи можуть два однакові сирі бали давати різні IRT-оцінки


У загальних IRT-моделях — так. Якщо завдання мають різні дискримінації, положення або інші параметри, два патерни відповідей з однаковою кількістю балів можуть містити різну інформацію про θ. Людина, яка відповіла правильно на більш дискримінативні або інакше розташовані завдання, може отримати іншу модельну оцінку, ніж людина з тим самим сумарним сирим балом, але іншим патерном.


Важливий виняток — базові моделі Раша, де за відповідних умов сирий сумарний бал є достатньою статистикою для параметра особи θ. Саме тому не можна переносити загальне твердження про оцінювання за патерном відповідей на всі IRT-моделі та моделі Раша без уточнення.


Розмір вибірки: універсального N для IRT немає


Питання «скільки людей потрібно для IRT?» не має одного числа-відповіді. Необхідна вибірка залежить від моделі, кількості параметрів, довжини тесту, кількості категорій, розподілу θ, частки пропусків, цільової точності, DIF-аналізу, способу оцінювання та наслідків помилки. Шредерс і Гнамбс (2025) рекомендують планувати розмір вибірки під конкретне дослідницьке завдання за допомогою симуляцій Монте-Карло замість механічного правила.


Нові симуляції підтверджують, що вимоги сильно залежать від цільового параметра. У дослідженні Ікеди (2026) для graded response model кількість завдань і розмір вибірки по-різному впливали на точність θ та дискримінації a: більша кількість завдань могла частково компенсувати меншу вибірку для person estimates, тоді як точне оцінювання a вимагало більшого N. Це ще раз показує, чому правило «IRT завжди потребує N=500» або «N=1000» є методологічно грубим.


Для високоризикового або high-stakes використання вимоги до точності й стабільності мають бути вищими, ніж для попереднього дослідницького аналізу. Крім загального N, критично важливе покриття тієї ділянки латентної шкали, де потрібно точно оцінити параметри: тисяча респондентів у вузькому діапазоні θ не обов’язково дає кращу калібровку країв шкали, ніж менша, але краще спроєктована вибірка.


Послідовність проведення IRT-дослідження


Якісне IRT-моделювання починається задовго до запуску статистичного пакета. Для розроблення нового інструменту логіка зазвичай виглядає так:


• 1. Чітко визначити конструкт, цільову популяцію, передбаченого використання та тип висновків, які мають підтримувати бали.


• 2. Створити або відібрати змістово репрезентативні завдання, перевірити їхню зрозумілість і релевантність.


• 3. Провести пілотування й когнітивне тестування і перевірити функціонування категорій відповіді.


• 4. Зібрати калібрувальну вибірку, достатню саме для запланованої моделі та цілей оцінювання.


• 5. Дослідити розмірність і локальну залежність; визначити, чи виправдана одновимірна модель.


• 6. Обрати модель відповідно до типу даних та вимірювальної теорії, а не лише за кращим fit.


• 7. Оцінити параметри та перевірити відповідність окремих завдань моделі, відповідність моделі загалом, залишки, монотонність і функціонування категорій.


• 8. Перевірити DIF/інваріантність для релевантних груп і умов використання.


• 9. Оцінити test/item information та conditional standard errors у цільовому діапазоні θ.


• 10. Побудувати процедури оцінювання балів і зв’язування шкал, якщо вони потрібні, та перевірити їх на незалежних або додаткових даних.


• 11. Зібрати докази валідності, які виходять за межі IRT: зміст, зв’язки з іншими змінними, наслідки використання, інтерпретацію.


• 12. Документувати модель, популяцію, версію інструменту, параметри, невизначеність, правила оцінювання балів та обмеження.


Типові помилки інтерпретації IRT


«IRT робить тест об’єктивним»


IRT створює сильні умови для порівнюваності й параметризації, але результат залишається модельним і залежить від конструкта, даних, fit, калібровки та використання. Об’єктивність не виникає з назви методу.


«Висока дискримінація означає якісне завдання»


Дискримінація — лише одна властивість. Завдання може бути високодискримінативним, але змістово вузьким, локально залежним, культурно специфічним або непридатним для потрібної ділянки шкали.


«Після IRT сумарний бал більше не потрібний»


Залежить від моделі та призначення. У моделях Раша сирий бал має особливу достатність; в інших моделях оцінювання за патерном відповідей може використовувати більше інформації. Для комунікації результати часто все одно трансформують у зрозумілі шкали.


«Якщо модель добре відповідає даним, шкала валідна»


Відповідність моделі даним показує, наскільки конкретна статистична модель узгоджується зі спостережуваними відповідями. Валідність стосується обґрунтованості інтерпретації та використання балів і вимагає ширших доказів.


«DIF означає дискримінацію людей»


DIF — статистичний сигнал неоднакового функціонування завдання за однакового latent trait. Він потребує пояснення й оцінки impact; сам по собі не встановлює причин, несправедливості або юридичної дискримінації.


«Перекладена шкала має ті самі параметри»


Переклад може змінити семантичні труднощі, пороги, стилі відповідей і зв’язок завдання з конструктом. Параметри та DIF треба перевіряти в цільовій мовній і культурній популяції.


«Універсальне порогове значення можна перенести між популяціями»


IRT-калібровка не робить клінічне порогове значення універсальним. Порогове рішення залежить від передбаченого використання, критеріальних доказів, поширеності/базової частоти, наслідків хибнопозитивних і хибнонегативних рішень та конкретної популяції. Скринінг залишається скринінгом, а не діагнозом.


Як читати IRT-звіт або статтю


Перед довірою до IRT-висновку варто знайти в публікації щонайменше такі елементи:


• Який конструкт і для якої популяції вимірюють.


• Який тип завдань та категорії відповідей використано.


• Яку саме IRT/Rasch-модель обрано і чому.


• Як перевіряли розмірність, локальну незалежність і монотонність.


• Який метод оцінювання параметрів і яке програмне забезпечення використано.


• Як ідентифіковано шкалу θ і яка референтна популяція.


• Які параметри завдань отримано та з якою невизначеністю.


• Як оцінено відповідність окремих завдань моделі, відповідність моделі загалом і залишки.


• Яка інформація/conditional precision доступна в діапазоні θ, що реально цікавить.


• Чи перевіряли DIF для релевантних груп.


• Як поводилися з пропущеними даними, крайніми патернами відповідей та малозаповненими категоріями.


• Чи є зовнішні докази валідності та незалежна перевірка процедури оцінювання балів.


• Чи можна законно і методологічно застосовувати інструмент у вашій мові, популяції та меті.


Що IRT змінює в практичній психологічній оцінці


Для користувача тесту найважливіша зміна полягає в тому, що точність результату перестає бути однаковою для всіх. Один і той самий інструмент може вимірювати середні рівні ознаки дуже точно, а крайні — слабше. IRT-звіт може показати цю різницю безпосередньо через інформаційну та стандартно-похибкову функції.


Для розробника шкали IRT дозволяє бачити, які завдання перекривають одне одного, де на континуумі бракує інформації, які категорії фактично не працюють, які завдання поводяться по-різному в групах і які піднабори можна формувати без втрати потрібної точності.


Для клініциста або психолога-практика це не скасовує контекст. Модельну оцінку треба читати разом із призначенням інструменту, діапазоном його валідності, умовну похибку, нормативною або референтною системою, клінічним запитанням і всією іншою інформацією про людину.


Науковий статус IRT


IRT є зрілим і фундаментальним напрямом сучасної психометрії з десятиліттями теоретичного розвитку та широкими застосуваннями в освіті, психології, медицині, оцінюванні результатів здоров’я, про які повідомляють самі пацієнти, і масштабних освітніх оцінюваннях. Основні моделі, характеристичні функції завдань, інформаційні функції, калібрування та DIF є усталеними методологічними компонентами.


Водночас конкретні рекомендації щодо відповідності моделі даним, розміру вибірки, виявлення DIF, багатовимірності, стилів відповідей, байєсівського оцінювання, калібрування з використанням машинного навчання та інших процедур продовжують розвиватися. Тому «IRT» слід розрізняти як усталену наукову рамку і як набір конкретних методологічних рішень, частина яких залежить від поточного стану досліджень.


Актуальність цього розвитку добре видно у методологічній статті Шредерс і Гнамбса 2025 року щодо simulation-based sample-size planning та у симуляційному дослідженні Ікеди 2026 року для graded response model.


FAQ


Що простими словами означає IRT?


IRT — це спосіб моделювати не лише загальну кількість балів, а зв’язок між прихованою психологічною ознакою людини та ймовірністю її відповіді на кожне окреме завдання. Модель оцінює, де завдання розташоване на шкалі, наскільки воно розрізняє рівні ознаки та скільки інформації дає в різних частинах шкали.


IRT і модель Раша — це одне й те саме?


Ні. Модель Раша тісно пов’язана з однопараметричним моделювання відповідей на завданням, але має власну вимірювальну традицію й сильніші структурні обмеження. IRT охоплює значно ширше сімейство моделей, включаючи 2PL, 3PL, graded response, partial credit, multidimensional IRT та інші. Докладніше — у статті «Модель Раша».


Чи можна використовувати IRT для шкал Лайкерта?


Так. Для впорядкованих категорій часто використовують модель градуйованих відповідей, модель часткових кредитів, узагальнену модель часткових кредитів або модель рейтингової шкали. Вибір залежить від припущень, структури категорій і вимірювальної мети.


Що таке параметр складності b у психологічному опитувальнику?


У тесті здібностей b природно називати складністю. У симптомній або особистісній шкалі це радше положення або поріг на латентному континуумі. Він показує ділянку θ, де зростання латентної ознаки найбільше змінює ймовірність вибору вищої категорії відповіді.


Чи завжди завдання з вищою дискримінацією краще?


Ні. Висока дискримінація може збільшувати локальну інформацію, але якість завдання також визначається змістом, репрезентативністю, локальною незалежністю, справедливістю, стабільністю параметрів і тим, чи покриває він потрібну ділянку конструкта.


Скільки респондентів потрібно для IRT?


Універсального числа немає. Вимоги залежать від моделі, кількості параметрів, довжини тесту, категорій, розподілу ознаки, способу оцінювання та цільової точності. Для серйозного дослідження розмір вибірки краще планувати під конкретний дизайн за симуляцією, а не переносити фіксоване N з іншої роботи.


Чи може IRT довести, що тест валідний?


Ні. IRT дає важливі докази про структуру й функціонування завдань, але валідність стосується всієї аргументації щодо інтерпретації та використання балів: змісту, структури, зв’язків з іншими змінними, наслідків використання, популяції та контексту.


Чим IRT корисна для адаптивного тестування?


IRT дає інформаційну функцію кожного завдання і поточну оцінку θ, тому алгоритм може вибрати наступне завдання, який найкраще зменшує невизначеність у релевантній ділянці. Але CAT потребує також банку завдань, обмежень щодо змісту, контролю частоти пред’явлення завдань і правил зупинки.


Чи однакові сирі бали завжди дають однакову IRT-оцінку?


Не в усіх моделях. У 2PL, 3PL та багатьох політомних моделях патерн відповідей може містити додаткову інформацію, тому однаковий сумарний сирий бал може привести до різних оцінок θ. У базовій моделі Раша сирий бал має особливий статус достатньої статистики за виконання умов моделі.


DIF означає, що тест несправедливий?


DIF означає, що завдання по-різному функціонує між групами за однакового рівня латентної ознаки. Це сигнал для подальшого аналізу, а не автоматичний висновок про упередженість. Потрібно оцінити величину ефекту, вплив на результати, зміст і можливу причину. Див. окрему статтю про DIF.


Чи можна використовувати IRT-оцінку для діагнозу?


Сам по собі — ні. IRT-оцінка є модельною оцінкою вимірюваної ознаки. Скринінговий або symptom score не дорівнює клінічному діагнозу. Діагностика потребує критеріїв, клінічного оцінювання, контексту, функціонування та диференційної діагностики.


Пов’язані статті







Джерела


















 
 
bottom of page