Модель Раша: як вона пов’язує складність завдання, здібність і ймовірність відповіді
Оновлено: 6 днів тому
Автор: Український психологічний ХАБ · Опубліковано: 23 вересня 2026 · Редакційна політика
Коротка відповідь
Модель Раша (Rasch model) — психометрична ймовірнісна модель, у якій відповідь людини на завдання пояснюється різницею між двома величинами: рівнем її латентної здібності або властивості та складністю завдання. У найпростішій дихотомічній формі що вищою є здібність людини відносно складності завдання, то вища ймовірність правильної відповіді; якщо ці величини рівні, модель передбачає ймовірність 0,5. Сучасний огляд застосування моделі Раша описує саме цю логістичну залежність як ядро моделі.
Модель Раша є частиною сучасної психометрії та математично близька до однопараметричних моделей теорії відповіді на завдання (Item Response Theory, IRT). Водночас Rasch measurement має власну методологічну традицію: дослідник перевіряє, чи узгоджуються дані з вимогами наперед заданої моделі вимірювання, а не просто додає параметри, щоб краще описати конкретний набір даних. Це важливе розрізнення, яке докладно обговорюють Tennant і Küçükdeveci та Tesio і співавтори.
Добра відповідність моделі Раша не робить тест автоматично надійним, валідним, справедливим або клінічно корисним. Вона дає конкретний тип доказу про внутрішню структуру вимірювання. Для повноцінної інтерпретації потрібні також змістові докази, надійність і похибка, зовнішні зв’язки, аналіз справедливості, цільова популяція та обґрунтування способу використання результату відповідно до Standards for Educational and Psychological Testing.
Звідки походить модель Раша
Модель названа на честь данського математика й статистика Георга Раша (Georg Rasch), який сформулював ідею ймовірнісного вимірювання здібності через взаємодію параметра людини та параметра завдання. Історично модель виникла в освітньому тестуванні, але згодом поширилася на психологічні шкали, опитувальники, реабілітацію, patient-reported outcomes та інші сфери, де дослідники працюють із латентними характеристиками.
В українському професійному контексті вживається саме назва «модель Раша». Український центр оцінювання якості освіти включає модель Раша до матеріалів про сучасну теорію тестів (IRT), поряд з одновимірними моделями, політомічними моделями, одно-, дво- та трипараметричними IRT-моделями, вирівнюванням і DIF.
Головна ідея: відповідь визначає різниця між здібністю і складністю
Позначимо рівень здібності або латентної властивості людини через θ (тета), а складність або локацію завдання через b. Для дихотомічного завдання, де X = 1 означає правильну відповідь або іншу «позитивну» категорію, базова модель має вигляд:
P(X = 1 | θ, b) = exp(θ − b) / [1 + exp(θ − b)].
Ця формула означає, що модель працює не з абсолютною «силою» людини чи абсолютною «важкістю» пункту, а з їхньою різницею. Якщо θ = b, різниця дорівнює нулю, exp(0) = 1, а ймовірність відповіді X = 1 дорівнює 0,5. Якщо здібність на один логіт вища за складність, ймовірність становить приблизно 0,73; якщо на два логіти — приблизно 0,88. Якщо людина на один логіт нижче завдання, ймовірність падає приблизно до 0,27.
Саме тому «складність» у моделі Раша має технічне значення. Завдання з b = 0 не є «середньо складним у житті»; це завдання, розташоване в нульовій точці обраної логітної шкали після калібрування. Так само θ = 1 не означає «здібність 1 бал». Значення має положення на спільній латентній шкалі.
Що таке логіт і навіщо він потрібен
Логіт — це логарифм відношення шансів: logit(P) = ln[P / (1 − P)]. У базовій моделі Раша logit(P) = θ − b. Імовірність обмежена інтервалом від 0 до 1, а логітна шкала простягається від мінус нескінченності до плюс нескінченності. Це дозволяє подати параметри людини й завдання в однакових одиницях.
Нульова різниця логітів відповідає шансам 1:1 і ймовірності 0,5. Збільшення θ − b на один логіт множить шанси позитивної відповіді приблизно на e ≈ 2,718. Логіт тому не є відсотком правильних відповідей, процентилем, z-балом чи T-score. Перетворювати одне на інше без конкретної моделі та калібрування не можна.
Крива характеристики завдання: одна й та сама логіка для кожного пункту
Для кожного дихотомічного завдання модель задає S-подібну item characteristic curve — криву, що пов’язує θ з імовірністю правильної або позитивної відповіді. Складність b зсуває криву вздовж латентної шкали: легше завдання розташоване лівіше, складніше — правіше.
У класичній моделі Раша дискримінативність усіх завдань фіксується однаковою. Це одна з причин, чому модель має лише один вільний параметр завдання — його складність. У 2PL IRT кожне завдання може мати власний параметр дискримінативності a; у 3PL додається параметр нижньої асимптоти, який часто інтерпретують як компонент псевдовгадування. Огляд Hays, Morales і Reise показує цю різницю між одно-, дво- і трипараметричними моделями.
Модель Раша і IRT: споріднені, але не тотожні поняття
У багатьох підручниках модель Раша описують як 1PL IRT — однопараметричну логістичну модель. Для практичного читача це корисне математичне наближення: і Rasch, і 1PL пов’язують відповідь із різницею між рівнем латентної риси та складністю завдання, за однакової дискримінативності пунктів.
Проте ототожнювати всі 1PL-моделі з Rasch measurement без уточнення теж не варто. У Rasch-традиції модель часто має прескриптивний статус: набір даних оцінюють щодо вимог вимірювальної моделі, а порушення розглядають як підставу досліджувати пункти, структуру або сам конструкт. У ширшій IRT-практиці дослідник може порівнювати 1PL, 2PL, 3PL чи інші моделі й обирати ту, що краще описує дані та відповідає меті. Tesio та співавтори прямо називають Rasch-теорію прескриптивною, а Tennant і Küçükdeveci обговорюють окрему традицію Rasch measurement theory.
Це методологічне розрізнення не означає, що одна традиція «правильна», а інша «неправильна». Вони відповідають на дещо різні питання. Для статті про конкретний психометричний інструмент важливо вказати, яку саме модель, спосіб оцінювання параметрів і критерії fit застосовували автори, а не обмежуватися словом «IRT».
Чому модель Раша називають моделлю вимірювання
Головна привабливість моделі — можливість побудувати спільну шкалу для людей і завдань. Людина з вищим θ має більшу ймовірність успіху на будь-якому завданні, а складніше завдання має меншу ймовірність успіху для будь-якої людини, якщо решта вимог моделі виконуються. Звідси походить ідея інваріантного порівняння.
У Rasch-літературі часто вживають поняття specific objectivity — специфічної об’єктивності. Практично це означає умовну властивість: за належної відповідності моделі порівняння двох людей не повинно принципово залежати від того, який придатний набір завдань із тієї самої шкали використано, а порівняння двох завдань — від конкретної придатної вибірки людей. Це не означає буквальної відсутності вибіркової похибки, стандартних помилок або потреби в репрезентативних даних.
У реальних дослідженнях параметри завжди оцінюються з невизначеністю. Інваріантність є властивістю моделі за її припущень, а не магічною гарантією, що калібрування в будь-якій маленькій або зміщеній вибірці дасть однакові числа.
Які припущення та вимоги потрібно перевіряти
Результат Rasch-аналізу має сенс лише разом із перевіркою того, чи достатньо дані відповідають моделі. Для одновимірних IRT-моделей сучасні методологічні огляди виділяють щонайменше одновимірність, локальну незалежність, монотонність і загальну відповідність моделі даним. Огляд Stover та співавторів систематизує ці вимоги для розроблення й уточнення patient-reported outcome measures.
Одновимірність
Одновимірність означає, що для конкретного сумарного вимірювання існує один домінантний латентний вимір, який пояснює структуру відповідей настільки, щоб один параметр θ був змістовно інтерпретованим. Це не вимагає, щоб психологічний конструкт був «абсолютно простим» або щоб у даних не існувало жодної другорядної структури.
Перевірка одновимірності не зводиться до одного індексу. У Rasch-практиці аналізують залишкову структуру, локальну залежність, іноді використовують додатковий факторний аналіз або спеціальні тести. Структурна валідність є ширшим поняттям: Rasch-fit може бути одним джерелом структурних доказів, але не замінює всі інші валідизаційні аргументи.
Локальна незалежність
Локальна незалежність означає, що після врахування латентної риси відповіді на окремі завдання не повинні мати додаткового систематичного зв’язку. Порушення виникає, наприклад, коли два пункти майже дублюють одне одного, коли один пункт підказує відповідь на інший або коли кілька завдань побудовані на одному спільному стимулі й утворюють testlet.
Локальна залежність може штучно збільшувати інформацію та створювати враження більшої точності, ніж є насправді. Тому кореляції залишків і зміст пунктів потрібно аналізувати разом, а не механічно видаляти будь-яку пару з підвищеним залишковим зв’язком.
Монотонність
Монотонність означає, що зі зростанням латентної здібності або властивості ймовірність відповіді, яка означає вищий рівень цієї властивості, не повинна систематично зменшуватися. Якщо вищий θ робить «позитивну» категорію менш імовірною без змістовного пояснення, пункт може не відповідати передбаченій шкалі.
Відповідність моделі даним
Fit показує, наскільки спостережувані відповіді узгоджуються з імовірнісними очікуваннями моделі. На практиці використовують комбінацію загальних тестів, item fit, person fit, залишків, item characteristic curves, infit/outfit та інших діагностик. Tennant і Conaghan наголошують, що читати Rasch-дослідження потрібно саме як сукупність перевірок, а не як один коефіцієнт.
Популярні пороги для infit/outfit, наприклад 0,5–1,5 mean square у деяких рекомендаціях, є робочими евристиками, а не універсальним законом. COSMIN використовує конкретні критерії для оцінювання структурної валідності, але прямо розміщує їх у контексті мети, дизайну й якості дослідження. Рішення про пункт не повинно ґрунтуватися на одній цифрі.
Дискримінативність: чому в Rasch вона фіксована
У 2PL IRT дискримінативність a описує, наскільки різко змінюється ймовірність відповіді навколо локації пункту. Модель Раша вимагає однакової дискримінативності: фактично всі item characteristic curves мають однакову форму й відрізняються переважно горизонтальним зсувом.
Якщо один пункт набагато «гостріше» розділяє людей навколо своєї складності, а інший дуже слабко реагує на θ, це може бути сигналом невідповідності Rasch-моделі. У більш гнучкій IRT-традиції така різниця може бути змодельована через окремі a-параметри. Вибір підходу залежить від мети вимірювання й теоретичних вимог, а не від бажання отримати найвищий статистичний fit за будь-яку ціну.
Person–item map: чи відповідає складність завдань рівню людей
Один із найінформативніших Rasch-виходів — карта «люди — завдання» (person–item map, Wright map). На одній логітній осі вона показує розподіл оцінених рівнів людей і розташування складностей завдань. Це дозволяє побачити targeting — наскільки набір завдань покриває рівні риси в цільовій популяції.
Якщо більшість завдань занадто легкі, люди з високим θ погано розрізняються між собою; якщо занадто складні — недостатньо інформації для нижнього діапазону. Погане targeting не обов’язково означає «поганий тест» загалом: інструмент може бути спеціально створений для певного діапазону, але його межі потрібно чітко описати.
Похибка вимірювання в моделі Раша
Оцінка θ є точковою оцінкою, а не точною величиною. Для неї існує стандартна похибка, яка залежить від того, скільки інформації дають завдання саме в цій частині латентної шкали. У цьому Rasch/IRT-підхід відрізняється від спрощеного читання класичної теорії тестів: точність вимірювання може бути різною для людей із різними рівнями риси.
Психометрична стандартна похибка оцінювання не є standard error of the mean. Так само person separation reliability або person separation index у Rasch-звітах не треба механічно називати α Кронбаха. Надійність психологічного тесту — ширше поняття, для якого потрібен коефіцієнт, що відповідає джерелу похибки й intended use.
Сирий бал і Rasch-міра — не те саме
У найпростішій дихотомічній Rasch-моделі сумарний сирий бал має особливу роль: за умов моделі він є достатньою статистикою для параметра людини. Проте сам сирий бал залишається порядковим підсумком відповідей. Перехід до логітної міри відбувається через калібровану модель.
Тому різниця між 10 і 11 сирими балами не обов’язково дорівнює різниці між 20 і 21. Rasch-перетворення може створити шкалу з рівними логітними інтервалами за умови прийнятної відповідності моделі. Це не дає права автоматично оголошувати будь-яку суму пунктів «інтервальною шкалою» без аналізу структури та fit.
Крайні патерни — усі відповіді 0 або всі 1 — створюють додаткову проблему: у базовому максимізаційному оцінюванні відповідний θ прямує до мінус або плюс нескінченності. Програмне забезпечення використовує різні способи поводження з такими випадками. У публікації потрібно вказувати метод оцінювання й не подавати крайні person measures як звичайні точні значення.
Політомічні відповіді: коли категорій більше ніж дві
Психологічні шкали часто мають не «так/ні», а кілька впорядкованих категорій: «ніколи — інколи — часто — майже завжди», бали 0–4 або частковий кредит за виконання завдання. Для таких даних використовують політомічні моделі сімейства Раша.
Rating Scale Model Девіда Андріча описує випадок, коли структура порогів між категоріями спільна для всіх пунктів. Оригінальна робота Andrich (1978) формалізує ordered response categories у Rasch-рамці.
Partial Credit Model Джеффа Мастерса дозволяє крокам між категоріями відрізнятися між завданнями. Masters (1982) розробив цю модель для завдань із двома або більше впорядкованими категоріями. Вибір між політомічними моделями залежить від структури шкали й емпіричної відповідності, а не від самої кількості варіантів відповіді.
Пороги категорій: що означає «порядок» відповідей
У політомічній моделі важливо, щоб категорії працювали як передбачено. Пороги між сусідніми категоріями відображають точки латентної шкали, де дві сусідні категорії мають однакову умовну ймовірність. Якщо пороги невпорядковані або певна категорія майже ніколи не є найбільш імовірною, це може вказувати на проблеми формулювання, надто велику кількість категорій, нерозрізнені варіанти відповіді або невідповідність моделі.
Об’єднувати категорії тільки заради кращого fit небезпечно. Спочатку потрібно з’ясувати зміст проблеми й перевірити, чи нове кодування зберігає теоретично важливі відмінності.
DIF: коли завдання працює по-різному для груп
Differential item functioning, DIF, виникає, коли люди з однаковим рівнем латентної риси, але з різних груп, мають різні ймовірності відповіді на конкретний пункт. Наприклад, за однакового θ пункт може бути систематично «важчим» для однієї мовної групи, вікової категорії або іншої релевантної підгрупи.
DIF є сигналом порушення інваріантності пункту, але статистично значущий DIF не є автоматичним доказом несправедливості. Потрібно оцінювати розмір ефекту, напрямок, частку пунктів, вплив на шкалу та змістовне пояснення. Rouquette та співавтори показали, що практичні наслідки DIF залежать не лише від p-value, а й від magnitude та структури DIF.
Для мовної та культурної адаптації це особливо важливо. Кроскультурна валідність потребує доказів еквівалентності; простий переклад пунктів українською не доводить, що складності, пороги та інтерпретації збереглися. Rasch/DIF-аналіз може бути частиною такої перевірки, але не замінює змістову адаптацію. Міжнародна тестова комісія (ITC) у настановах з перекладу й адаптації тестів розглядає адаптацію як ширший процес, що охоплює культурний і мовний контекст, методи розроблення, адміністрування, документування та інтерпретацію. Тому наявність перекладу сама по собі не є доказом валідованої української адаптації.
DIF, bias і fairness — три різні рівні
DIF — статистична властивість функціонування пункту за умовного контролю латентної риси. Bias — змістовний і валідизаційний висновок про систематичне зміщення, нерелевантне до конструкта. Fairness — ширша характеристика всього процесу тестування, яка включає зміст, доступність, умови проведення, наслідки рішень, інтерпретацію, стандартизацію та групову порівнюваність.
Тому алгоритм «знайшли DIF — видалили пункт» може погіршити інструмент. Іноді DIF відображає змістовно релевантну відмінність, іноді кілька DIF-пунктів компенсують один одного на рівні шкали, іноді потрібне групове калібрування або інша модель. Рішення має поєднувати статистичну й змістову експертизу.
Що таке item fit і person fit
Item fit оцінює, чи відповіді на конкретний пункт відповідають очікуванням моделі. Misfit може вказувати на неоднозначне формулювання, іншу латентну вимірність, різну дискримінативність, вгадування, локальну залежність, проблемну категоризацію або інший механізм.
Person fit стосується того, наскільки патерн відповідей конкретної людини є очікуваним за моделю. Незвичний патерн може виникати через неуважність, випадкове відповідання, нестандартну стратегію, помилку введення даних або реальну складність, яку одновимірна модель не описує. Person misfit не є психологічним діагнозом і не повинен автоматично трактуватися як «нечесність» чи «аномальність» респондента.
Infit та outfit: корисні діагностики, а не магічні пороги
Infit і outfit — дві родини статистик відповідності. Infit сильніше зважує несподівані відповіді на завдання, що близькі до рівня людини й тому найбільш інформативні для неї. Outfit чутливіший до віддалених, рідкісних несподіваних відповідей — наприклад, коли дуже здібна людина помиляється на надзвичайно легкому завданні.
Значення mean square близько 1 зазвичай означає відповідність очікуваній варіативності. Але конкретні прийнятні межі залежать від мети, вибірки, кількості пунктів і наслідків рішення. Надто вузькі cutoffs у великій вибірці можуть відсіювати змістовно корисні пункти; надто широкі — приховувати реальну невідповідність.
Розмір вибірки: універсального мінімуму немає
Rasch-аналіз потребує достатньої інформації для стабільного калібрування, але немає одного магічного N, яке гарантує якість. Потрібні обсяг вибірки, розподіл θ, кількість завдань, кількість категорій, targeting, спосіб оцінювання та мета — скринінг fit, точна калібрація, DIF між групами чи побудова item bank.
COSMIN наводить правила-орієнтири для оцінювання якості досліджень структурної валідності, включно з Rasch/IRT, але їх потрібно читати як методологічні критерії конкретної рамки, а не як доказ того, що «N = 100 завжди достатньо». Для DIF потрібні також достатні підгрупи й адекватні anchor items.
Модель Раша і валідність
Відповідність Rasch-моделі є доказом про внутрішню структуру, але валідність ширша. Валідність психологічного тесту стосується того, наскільки теорія й дані підтримують конкретну інтерпретацію та використання балів. Навіть ідеальний внутрішній fit не доводить, що обрані пункти репрезентують потрібний конструкт, що бал прогнозує релевантний критерій або що рішення за цим балом є корисним.
Rasch-аналіз також не замінює змістову валідність, процес відповіді, зв’язки з іншими змінними та аналіз наслідків використання. Саме тому сучасні Standards AERA/APA/NCME розглядають validity як інтегрований аргумент, а не як одиничний коефіцієнт.
Модель Раша і надійність
Rasch-модель може дати інформацію про точність person estimates і здатність набору пунктів розрізняти людей на латентній шкалі. Проте «Rasch reliability», person separation reliability, test information, test-retest reliability і внутрішня узгодженість відповідають на різні питання.
Висока внутрішня узгодженість не доводить Rasch-fit або одновимірність; хороший Rasch-fit не доводить стабільність у часі. Для повторного вимірювання потрібно окремо оцінювати відповідний тип надійності, похибку та можливу реальну зміну.
Модель Раша і класична теорія тестів
Класична теорія тестів описує спостережуваний бал через істинний бал і похибку та часто оцінює властивості тесту на рівні сумарного бала. Rasch/IRT переносить фокус на модель відповіді на окремі завдання та на зв’язок параметрів завдань із латентним рівнем людини.
Ці підходи не обов’язково є конкурентами. Один інструмент може досліджуватися і в CTT, і в Rasch/IRT-рамці. CTT може бути достатньою для певних практичних завдань, а Rasch потрібен, коли важливі item-level calibration, item bank, adaptive testing, DIF, person–item targeting або модельна побудова латентної шкали.
Комп’ютеризоване адаптивне тестування і банки завдань
Калібрований банк завдань дозволяє добирати пункти залежно від поточної оцінки θ: після кожної відповіді система може обирати наступне завдання там, де воно дає найбільше інформації. Це основа комп’ютеризованого адаптивного тестування (CAT), для якого IRT/Rasch-підходи особливо природні.
Проте наявність Rasch-калібрування ще не робить CAT готовим до використання. Потрібні стабільний item bank, перевірка content coverage, правила початку й зупинки, контроль експозиції пунктів, безпека матеріалів, дослідження точності, справедливості та еквівалентності різних маршрутів тестування.
Коли Rasch-аналіз особливо корисний
коли потрібно калібрувати складність завдань і оцінювати рівень латентної риси на спільній шкалі;
коли розробляють або скорочують тест і хочуть дослідити item-level fit, targeting та локальну залежність;
коли будують item bank або комп’ютеризоване адаптивне тестування;
коли потрібно перевірити DIF і порівнюваність пунктів між групами;
коли аналізують шкали з упорядкованими категоріями та перевіряють роботу порогів;
коли важливо оцінити, в яких діапазонах латентної риси вимірювання є точнішим або слабшим;
коли потрібно обґрунтувати перетворення сирого порядкового бала на модельну логітну міру.
Коли модель Раша не розв’язує проблему сама
Rasch не компенсує нечітке визначення конструкта, слабкий зміст пунктів, погану вибірку, неякісну мовну адаптацію або неправильне використання результату. Якщо інструмент вимірює не те, що потрібно, хороший статистичний fit не виправить концептуальну помилку.
Модель також може бути занадто жорсткою для даних, у яких завдання справді мають різну дискримінативність або де конструкт суттєво багатовимірний. У такій ситуації дослідник має перевірити теорію, дизайн і альтернативні моделі — 2PL/3PL, multidimensional IRT, bifactor, testlet models або інші підходи — замість механічного видалення пунктів доти, поки залишок «підійде» під Rasch.
Типові помилки інтерпретації
«Модель зійшлася — отже тест валідний». Fit підтримує лише частину структурного аргументу; валідність потребує ширших доказів.
«Rasch — це просто інша назва будь-якої IRT». Rasch має конкретні обмеження та власну вимірювальну традицію; 2PL і 3PL — інші моделі.
«Логіт — це відсоток». Логіт є логарифмом шансів; він не дорівнює percent correct, процентилю чи T-score.
«b = 1 означає, що завдання важке на 1 бал». b — локація на конкретній латентній шкалі після калібрування.
«Якщо θ = b, людина точно відповість правильно». Модель передбачає ймовірність 0,5, а не детермінований результат.
«DIF означає дискримінацію». DIF є статистичним сигналом; висновок про bias/fairness потребує змістовної та практичної оцінки.
«Пункт із misfit треба одразу видалити». Спершу потрібно дослідити зміст, кодування, локальну залежність, підгрупи та наслідки видалення.
«Висока α Кронбаха доводить Rasch-fit». Internal consistency, одновимірність і модельний fit — різні властивості.
«Один cutoff infit/outfit універсальний для всіх тестів». Порогові правила є контекстними евристиками.
«Rasch-міра є точним індивідуальним числом». Кожна person estimate має стандартну похибку, а точність залежить від targeting і даних.
«Перекладена українська шкала автоматично працює так само». Потрібні cultural adaptation, validation і перевірка порівнюваності, зокрема DIF/invariance.
«Rasch-score може поставити діагноз». Психометрична міра не замінює клінічне оцінювання, діагностичні критерії та контекст.
Клінічне та YMYL-тлумачення
У клінічних і health-outcome дослідженнях Rasch-моделі часто використовують для побудови шкал функціонування, болю, втоми, якості життя або симптомів. Це може покращувати структуру вимірювання, але не перетворює шкалу на діагностичний інструмент.
Латентний параметр θ, person measure або перетворений Rasch-score не означає «є / немає розладу». Для screening чи diagnosis потрібні окремі докази щодо intended population, клінічного критерію, чутливості, специфічності, predictive values, prevalence/base rate, cutoff і наслідків помилкових рішень. Навіть статистично добре відкалібрована шкала може бути призначена лише для моніторингу або research outcomes.
Як читати Rasch-дослідження: практичний чекліст
Що саме є латентним конструктом і чому для нього обрано один сумарний вимір?
Яка модель застосована: dichotomous Rasch, Rating Scale Model, Partial Credit Model або інше розширення?
Який спосіб оцінювання параметрів і яке програмне забезпечення використано?
Чи перевірено одновимірність, локальну незалежність, монотонність і model-data fit?
Які item-fit і person-fit діагностики використані та як обґрунтовано пороги?
Чи досліджено targeting на person–item map і точність на різних рівнях θ?
Як працюють категорії та пороги в політомічних пунктах?
Чи перевірено DIF для релевантних мовних, вікових, гендерних, культурних або клінічних груп?
Чи показано розмір і практичний вплив DIF, а не лише його статистичну значущість?
Що робили з misfit/DIF-пунктами і чи збережено зміст конструкта після модифікацій?
Чи наведено standard errors, reliability/precision та обмеження крайніх оцінок?
Чи підтверджують інші види evidence заплановану інтерпретацію й використання балів?
Науковий статус моделі Раша
Модель Раша — усталена психометрична модель з десятиліттями теоретичного розвитку та практичного застосування в освіті, психології, медицині й реабілітації. Її математичне ядро й основні діагностичні принципи належать до established measurement science.
Водночас окремі школи по-різному трактують філософський статус Rasch measurement, його відношення до IRT, допустимі критерії fit, способи роботи з multidimensionality, local dependence та DIF. Це не робить модель «спірною» як таку; спірними або контекстними є конкретні методологічні рішення й твердження про те, що Rasch завжди створює фундаментальне або інтервальне вимірювання.
Найсильніша позиція така: Rasch-модель створює формальні умови для лінійного латентного вимірювання, якщо дані й зміст інструмента достатньо відповідають її вимогам. Саме перевірка цих умов, а не назва програмного методу, визначає силу висновку.
Поширені запитання
Чим модель Раша відрізняється від 1PL IRT?
Математично вони дуже близькі: в обох випадках імовірність відповіді визначається здібністю та складністю за однакової дискримінативності пунктів. У Rasch measurement дискримінативність зазвичай фіксується, а модель має сильніший прескриптивний статус: перевіряється, чи дані відповідають вимогам вимірювання. У загальній IRT 1PL часто є одним із кількох моделей-кандидатів.
Що означає, якщо здібність дорівнює складності завдання?
У дихотомічній Rasch-моделі θ = b означає P = 0,5: людина має 50% модельної ймовірності правильної або позитивної відповіді на це завдання.
Чи означає +1 логіт 1 правильну відповідь більше?
Ні. Логіт — одиниця логарифмічної шкали шансів. Зв’язок між сирим балом і логітною мірою нелінійний і залежить від калібрування набору завдань.
Чи можна використовувати Rasch для шкал Лайкерта?
Так, для впорядкованих категорій застосовують політомічні моделі сімейства Раша, зокрема Rating Scale Model і Partial Credit Model. Потрібно перевіряти роботу категорій, пороги, одновимірність, локальну незалежність і fit.
Чи доводить хороший Rasch-fit валідність тесту?
Ні. Він підтримує частину доказів про внутрішню структуру. Валідність конкретної інтерпретації потребує змістових, структурних, зовнішніх та інших релевантних доказів.
Чи є DIF доказом несправедливого завдання?
Не автоматично. DIF показує різне функціонування пункту між групами за однакового рівня латентної риси. Потрібно оцінити величину, напрямок, зміст і наслідки для загального результату.
Чи можна за Rasch-score поставити психологічний або психіатричний діагноз?
Ні. Rasch-score є модельною оцінкою латентної риси. Діагноз потребує відповідних клінічних критеріїв, професійного оцінювання, валідованого intended use і ширшого контексту.
Чи потрібна дуже велика вибірка?
Потрібна достатня вибірка для мети аналізу, але універсального мінімуму немає. Точність калібрування залежить від кількості пунктів, категорій, targeting, розподілу риси, способу оцінювання та окремих завдань, наприклад DIF.
Чи перетворює Rasch будь-який порядковий тест на інтервальний?
Ні. Інтервальноподібна логітна міра обґрунтована лише настільки, наскільки дані й зміст шкали відповідають вимогам моделі. Сам запуск Rasch-програми не змінює природу поганої шкали.
Що важливіше: fit чи зміст пунктів?
Вони працюють разом. Статистичний fit без змістовної репрезентації конструкта не створює валідний інструмент; змістовно прекрасний пункт, який систематично порушує вимірювальну модель, теж потребує дослідження. Якісна психометрія поєднує теорію, зміст, дані й intended use.
Пов’язані статті
Психометрія: що це, що вона вимірює і як оцінюють якість психологічних тестів
Структурна валідність: чи відповідає факторна структура тесту теоретичній будові конструкта
Кроскультурна валідність: чи вимірює адаптований тест той самий конструкт у різних мовах і культурах
Класична теорія тестів: істинний бал, похибка вимірювання і надійність
Надійність психологічного тесту: що це, які бувають види і чому надійність не дорівнює валідності
Валідність психологічного тесту: що це і які докази потрібні для інтерпретації результатів
Георг Раш: модель Раша, об’єктивне вимірювання і внесок у психометрію
