Складність завдання в психометрії: що означає item difficulty у тестах здібностей і досягнень
Автор: Український психологічний ХАБ · Опубліковано: 23 вересня 2026 · Редакційна політика
Складність завдання, або item difficulty, — це характеристика того, наскільки легко чи складно певній групі людей дати передбачену відповідь на окремий елемент тесту або де на латентній шкалі розташоване це завдання. Ключове слово тут — «модель». У класичній теорії тестів складність дихотомічного завдання найчастіше описують часткою правильних відповідей p: що вище p, то легшим виявилося завдання в конкретній вибірці. У Rasch та інших моделях IRT параметр складності b є координатою на латентній шкалі: що вище b, то вищий рівень здібності потрібен для тієї самої модельної ймовірності відповіді.
Через цю різницю одна й та сама фраза «складність item» може позначати різні статистичні об’єкти. Саме тому значення 0,70 у класичному item analysis не можна механічно порівнювати з b = 0,70 логіта в IRT. Standards for Educational and Psychological Testing вимагають інтерпретувати характеристики завдань у межах визначеної моделі, популяції, способу підрахунку та цільового використання тесту. Складність є частиною доказів про функціонування завдання, а не універсальним штампом «якісний / неякісний item».
Коротка відповідь
Для тестів здібностей і досягнень найпоширеніше класичне визначення просте: p = кількість правильних відповідей / кількість валідних відповідей на завдання. Якщо p = 0,72, це означає, що 72% відповідей у конкретній аналізованій групі були правильними. За цією конвенцією високе p означає легше завдання, низьке p — складніше.
У моделі Раша логіка інша: складність b і здібність θ виражені на одній латентній шкалі. У дихотомічній Rasch-моделі, коли θ = b, модельна ймовірність правильної відповіді дорівнює 0,50. Параметр b = 1 логіт означає завдання, зміщене вище за завдання з b = 0 на цій шкалі, а не «100% складності».
У політомічних завданнях, рейтингових шкалах і опитувальниках поняття ще ширше: замість одного показника «правильно / неправильно» можуть оцінюватися пороги між категоріями, location або severity parameters. Тому перед інтерпретацією будь-якого числа потрібно з’ясувати, який саме формат item, яка модель і що в ній названо difficulty.
Чому термін «складність» легко переплутати
В українській практиці оцінювання термін «складність тестового завдання» часто вживають для P-value, що фактично є показником успішності виконання. Наприклад, офіційний звіт Українського центру оцінювання якості освіти визначає складність тестового завдання (P-value) як відношення набраних усіма учасниками балів до максимально можливої кількості балів. У тому самому звіті значення понад 80% класифікують як «дуже легке» завдання, а 20% і менше — як «дуже складне».
Отже, назва «індекс складності» може бути семантично підступною: у класичній конвенції p число зростає тоді, коли завдання стає легшим для вибірки. В англомовній літературі це іноді називають item facility або item easiness. Інші автори для буквальної «трудності» використовують q = 1 − p, де більше число вже означає важче завдання.
Додаток Ради Європи з класичної теорії тестів прямо звертає увагу на цю неоднозначність: p часто визначають як частку правильних відповідей, але в окремих джерелах difficulty виражають через 1 − p. Обидві конвенції математично прозорі, якщо автор чітко вказав формулу і напрям шкали. Найгірший варіант — опублікувати «індекс складності 0,80» без пояснення, чи це p, чи 1 − p.
P-value у психометрії не дорівнює p-value у перевірці статистичних гіпотез
Позначення P-value або p для складності завдання не має значення статистичного p-value з тесту нульової гіпотези. У item analysis p — це описова пропорція або нормована частка набраних балів. Статистичний p-value відповідає на інше питання і має іншу математичну природу. Змішування цих двох значень — поширена термінологічна помилка.
Складність у класичній теорії тестів
Дихотомічне завдання: базова формула
Для завдання, яке оцінюють 0 = неправильно і 1 = правильно, класичний індекс p зазвичай обчислюють як p = Nправильних / Nвалідних. Наприклад, якщо із 400 учасників 260 відповіли правильно і всі 400 відповідей увійшли до аналізу, p = 260 / 400 = 0,65. У цій групі завдання мало 65% успішності виконання.
Огляд класичної теорії тестів та IRT формулює це саме так: для дихотомічних items P-value відображає частку кандидатів, які відповіли правильно; нижчі значення вказують на складніші завдання, вищі — на легші. Це опис емпіричного виконання конкретної групи, а не абсолютна фізична властивість запитання.
Завдання з частковим балом
Якщо завдання може приносити 0, 1, 2 або більше балів, просту частку правильних відповідей потрібно замінити показником, який відповідає схемі scoring. Один із варіантів — відношення фактично набраної всіма учасниками суми балів до максимально можливої суми. Тоді індекс також лежить від 0 до 1 або від 0% до 100%, але означає вже частку доступного балу, а не частку людей із повністю правильною відповіддю.
Саме так сформульовано P-value в методичних матеріалах УЦОЯО: знаменник — максимальна кількість балів, яку всі учасники могли б отримати за це завдання. Ця формула добре працює для освітніх завдань із визначеним максимумом, однак її не слід автоматично переносити на будь-яку психологічну шкалу з категоріями відповідей.
Складність залежить від вибірки
Scheuneman і Steinhaus підкреслювали принципову річ: традиційна item difficulty є статистичним поняттям, визначеним через виконання завдання людьми, а не лише через «внутрішні» властивості самого item. Та сама задача може мати p = 0,85 у сильній підготовленій групі і p = 0,40 у групі з нижчим рівнем відповідної здібності. Обидва числа можуть бути коректними.
Тому вислів «це завдання має складність 0,42» неповний без опису вибірки, умов проведення і способу scoring. У класичній теорії тестів показник p є sample-dependent. Якщо складність порівнюють між роками, мовними версіями, формами тесту або групами, потрібно відрізняти реальну зміну item functioning від зміни складу учасників.
Оцінка має статистичну невизначеність
Спостережене p — вибіркова оцінка. За малого N воно може помітно коливатися випадково. Для важливих рішень доцільно повідомляти розмір вибірки, правила роботи з пропусками і, за потреби, інтервал невизначеності. Псевдоточність на кшталт p = 0,673 при кількох десятках респондентів не робить оцінку стабільною.
Особливо обережно слід читати крайні значення. Якщо майже всі відповіли правильно або майже всі помилилися, спостережена частка може бути дуже чутливою до кількох відповідей, а можливості оцінити зв’язок item із загальним рівнем здібності в цій вибірці звужуються.
Чи існує універсально «правильна» складність
Ні. Для окремих програм оцінювання можуть існувати робочі категорії, але вони не є універсальними законами психометрії. У звітах УЦОЯО, наприклад, діапазон 40–59% названо оптимальним для конкретної системи аналізу, а сусідні діапазони — легкими або складними. Це операційна класифікація, корисна в її контексті, а не стандарт, який треба механічно застосовувати до всіх тестів.
Чому p = 0,50 часто вважають привабливим
Для дихотомічної змінної дисперсія дорівнює p(1 − p) і максимальна при p = 0,50. Тому завдання середньої емпіричної складності часто створює найбільшу варіативність відповідей у конкретній вибірці. Огляд Cappelleri, Lundy і Hays пояснює цю логіку в контексті item evaluation. Проте максимальна варіативність відповіді ще не означає максимальну цінність item для будь-якої мети.
Коли дуже легкі й дуже складні завдання потрібні
Якщо тест має точно розрізняти високі рівні здібності, йому потрібні завдання, які не стають занадто легкими для сильних учасників. Якщо головна задача — перевірити базове мінімальне засвоєння, навмисно легкі items можуть бути змістово необхідними. Для адаптивного тестування потрібен банк завдань, що покриває широкий діапазон латентної шкали.
У критеріально орієнтованих тестах розподіл складності часто проектують навколо важливого порогу рішення. У нормоорієнтованих тестах може бути важливим ширше розсіювання. Тому питання «який p найкращий?» без intended use поставлене занадто вузько. Спершу визначають, для якого рішення створено тест і де на шкалі потрібна точність.
Що впливає на емпіричну складність завдання
Складність виникає у взаємодії вимог завдання й характеристик респондента. На неї впливають не лише знання або здібність, яку тест планує виміряти, а й читабельність, обсяг робочої пам’яті, мовна складність, знайомість із форматом, часові обмеження, спосіб подання, якість інструкції та стратегія відповіді.
Теоретична рамка ETS описує difficulty як функцію вимог task, здібностей та інших атрибутів, які людина використовує для правильної відповіді. Це важливо для validity argument: якщо item стає складним через побічну мовну заплутаність замість цільової математичної операції, він може вимірювати не те, що планувалося.
Мова, формулювання і культурний контекст
Переклад може змінити синтаксичне навантаження, частотність слів, культурну знайомість прикладу або очевидність дистракторів. Тому однаковий зміст не гарантує однакової емпіричної складності. Наявність українського перекладу також не є доказом валідованої української адаптації інструмента.
Час і швидкість виконання
У speeded test низьке p наприкінці форми може відображати не лише складність змісту, а й дефіцит часу. Якщо частина учасників систематично не доходить до останніх items, позиційний ефект і швидкість виконання стають альтернативними поясненнями. Такі завдання не варто тлумачити як просто «дуже складні» без аналізу часу й пропусків.
Ключ, scoring і технічні помилки
Раптово аномально низьке p може виникнути через помилковий ключ, неправильне реверсивне кодування, невраховані кілька правильних відповідей або збій у передачі балів. Перед психологічною інтерпретацією item statistics потрібно перевірити технічний pipeline.
Multiple choice: дистрактори і вгадування
У завданні з варіантами відповіді спостережене p залежить не лише від знання правильної відповіді. Воно може зростати через випадкове вгадування, тестову кмітливість, граматичні підказки, надто слабкі дистрактори або нерівномірну привабливість варіантів. Тому аналіз складності варто поєднувати з аналізом вибору дистракторів.
Дистрактор, який майже ніхто не обирає, може не виконувати своєї функції. Дистрактор, який приваблює сильних учасників частіше за слабких, може сигналізувати двозначність або проблемний ключ. Саме тому число p потрібно читати разом із розподілом відповідей і дискримінативністю.
У трьохпараметричній IRT-моделі вводять параметр нижньої асимптоти c, пов’язаний із ненульовою ймовірністю правильної відповіді на низьких рівнях здібності. Огляд базових IRT-моделей ETS пояснює різницю між одно-, дво- і трьохпараметричними моделями. Це ще одна причина, чому observed p і IRT b не є взаємозамінними.
Складність і дискримінативність — різні властивості
Складність відповідає на питання, наскільки часто або на якому рівні здібності виникає передбачена відповідь. Дискримінативність завдання описує, наскільки відповіді змінюються разом із рівнем цільової ознаки. Завдання може бути середньої складності й майже не дискримінувати, якщо воно двозначне, неправильно ключоване або стосується іншого конструкта.
Так само дуже складний item не є автоматично сильним item. Якщо його правильно виконують випадкові учасники або він потребує побічного знання, низький p лише описує рідкість правильної відповіді. Він не доводить, що завдання добре розрізняє саме за цільовою здібністю.
Sweeney та співавтори показали, що емпіричний зв’язок між difficulty та discrimination змінюється залежно від теоретичної рамки й набору даних: у CTT, 2PL і 3PL він може мати різний напрям і величину. Тому не слід виводити дискримінативність із одного показника складності.
У практичному аналізі завдань тесту складність, дискримінативність, item-rest correlations, розподіл дистракторів і групове функціонування розглядають як взаємодоповнювальні діагностичні сигнали, а не як взаємозамінні метрики.
Складність у моделі Раша
У найпростішій дихотомічній Rasch-моделі ймовірність правильної відповіді визначається різницею між здібністю людини θ і складністю item b: P(X = 1 | θ, b) = 1 / [1 + exp(−(θ − b))]. Tennant і Küçükdeveci описують цю логістичну залежність як ядро моделі.
Якщо θ = b, різниця дорівнює нулю, а ймовірність правильної відповіді — 0,50. Якщо θ на один логіт нижче за b, ймовірність приблизно 0,27; якщо на один логіт вище — приблизно 0,73. Тут складність є координатою item на латентній шкалі, а не часткою правильних відповідей.
Що означає вищий b
Вищий b означає, що та сама модельна ймовірність відповіді досягається при вищому рівні θ. Наприклад, item з b = 1,2 розташований вище на шкалі, ніж item з b = −0,5. Але різницю 1,7 логіта не можна перекласти як «на 170% складніше». Логіт — одиниця логарифмічного відношення шансів на латентній шкалі.
Rasch difficulty має сенс лише всередині моделі та шкали
Параметр b не існує окремо від калібрування. Його значення залежить від того, як зафіксована нульова точка і масштаб латентної шкали, яким методом оцінювали параметри та чи відповідають дані вимогам моделі. Для порівняння item parameters між формами потрібне коректне linking/equating або спільна калібрація.
Що змінюється у 2PL і 3PL IRT
Nguyen та співавтори описують IRT як сімейство моделей, а не одну формулу. У 2PL окрім difficulty b кожен item має власну discrimination a. Параметр a визначає крутизну item characteristic curve, тоді як b визначає її горизонтальне розташування. За стандартної 2PL без нижньої асимптоти b відповідає θ, де ймовірність правильної відповіді дорівнює 0,50.
У 3PL додається c — нижня асимптота. Формула має вигляд P(θ) = c + (1 − c) / [1 + exp(−a(θ − b))]. Тоді при θ = b ймовірність дорівнює (1 + c) / 2, а не 0,50, якщо c > 0. Отже, популярна фраза «b — це здібність, де P = 0,50» коректна для Rasch/1PL і стандартної 2PL, але потребує уточнення для 3PL.
Це важливе методологічне розрізнення. Одна назва difficulty parameter не гарантує однакову геометричну інтерпретацію у всіх моделях. Перед читанням таблиці параметрів треба знати, яка модель оцінена і яка її параметризація.
IRT не робить складність автоматично незалежною від вибірки
Одна з переваг IRT — можливість отримувати параметри item, які за достатньої відповідності моделі мають бути стабільнішими щодо зміни розподілу здібності, ніж сире класичне p. Але ця invariance є модельно зумовленою властивістю, а не магічною гарантією.
Огляд Michaelides показує, що item parameter invariance передбачає належний model fit і сильні припущення, зокрема щодо одновимірності; параметри можуть дрейфувати через контекст, формулювання, позицію завдання, зміни програми або інші порушення. Тому b теж має стандартну похибку і потребує перевірки стабільності.
Якщо дані багатовимірні, items локально залежні або модель не описує реальні response processes, оцінки b можуть змінюватися між групами й формами. У такій ситуації фраза «IRT очистила difficulty від вибірки» вводить в оману.
DIF, групові відмінності і справедливість
Якщо дві групи мають різне сире p, цього недостатньо, щоб оголосити item упередженим. Групи можуть реально відрізнятися за рівнем цільової здібності. Диференційне функціонування завдання ставить інше питання: чи мають групи різну ймовірність відповіді після контролю рівня вимірюваного конструкта.
Диференційне функціонування завдань (DIF) є статистичним сигналом, який потребує змістової інтерпретації. DIF не є автоматичним доказом несправедливості, так само як відсутність DIF не доводить повну fairness. Потрібно оцінювати величину ефекту, контекст, language/cultural adaptation і наслідки рішення.
Для багатомовних або кроскультурних версій порівняння difficulty корисне як діагностичний крок, але переклад ≠ валідована адаптація. Якщо українська версія item стала суттєво легшою або складнішою, це може вказувати на зміну wording, cultural familiarity або response process; причину потрібно досліджувати, а не вгадувати за одним числом.
Політомічні завдання: замість одного числа можуть бути пороги
Для item із категоріями 0–1–2–3 або шкал типу «ніколи — іноді — часто — майже завжди» один показник difficulty часто занадто грубий. Kim і Wilson розрізняють overall item location і step difficulty parameters у політомічних IRT-моделях. Кожен поріг описує перехід між сусідніми категоріями або іншу модельно визначену межу.
У graded response model, як пояснює огляд Cappelleri та співавторів, difficulty/severity parameters можуть відповідати рівням латентної ознаки, де ймовірність відповісти нижче певної категорії дорівнює ймовірності відповісти на цій або вищій категорії. Отже, один item може мати кілька threshold parameters.
Шкала Лайкерта не є екзаменаційним питанням
Для твердження «Мені важко заснути» відповідь «часто» не є правильною, а «ніколи» — неправильною. Тут терміни location, severity або threshold зазвичай точніші за «складність». Якщо дослідник все ж дихотомізує відповіді, він створює нову змінну і має обґрунтувати межу; звичайне p як «частка правильних» до такого item не застосовується.
У клінічних і symptom scales параметр item severity не є діагнозом і не перетворює окрему відповідь на клінічний висновок. Скринінговий score, latent trait estimate і діагностичне рішення належать до різних рівнів оцінювання.
Складність, надійність і валідність
Item з бажаним p не стає валідним автоматично. Валідність стосується обґрунтованості інтерпретацій і використання балів; reliability — точності та відтворюваності вимірювання. Difficulty описує лише один аспект функціонування завдання.
Статистично «ідеальний» item може бути змістово зайвим, а змістово критичний item може бути дуже легким. Саме тому змістова валідність має оцінювати репрезентативність, релевантність і повноту домену. Оптимізація тесту лише за p та item-total correlations здатна звузити зміст до того, що найкраще поводиться у конкретній вибірці.
Так само надійність не можна максимізувати нескінченним видаленням легких або складних items. Надійність конкретного score залежить від варіації респондентів, довжини тесту, структури помилок і цільової популяції. Difficulty лише взаємодіє з цими чинниками.
Як аналізувати item difficulty на практиці
1. Визначити intended use і цільову популяцію
Спочатку формулюють, для кого створено тест, який конструкт він вимірює і яке рішення підтримує. Difficulty, що корисна для відбору найсильніших абітурієнтів, може бути невдалою для скринінгу базового рівня навички. Без intended population число p позбавлене головного контексту.
2. Перевірити scoring, ключ і пропуски
До статистичного аналізу перевіряють правильний ключ, реверсивне кодування, часткові бали, правила щодо пропущених відповідей та технічні перетворення. Знаменник p має бути визначений явно: усі учасники, лише ті, хто відповів, чи інша заздалегідь задана група.
3. Обчислити описову складність
Для дихотомічного item обчислюють p; для partial-credit — доречний нормований середній бал або інший показник, що відповідає scoring model. Разом із числом повідомляють N і, коли це важливо, невизначеність оцінки.
4. Подивитися на категорії та дистрактори
Одне p не показує, чому люди помилялися. Розподіл варіантів відповіді допомагає побачити нефункціональні дистрактори, підказки, неоднозначність і технічні аномалії. Для політомічних шкал аналогічно аналізують використання категорій та порогів.
5. Читати difficulty разом із discrimination
Перевіряють дискримінативність, item-rest statistics та інші показники, придатні для формату даних. Легкість або складність не замінює інформацію про те, чи відповіді узгоджуються з цільовою ознакою.
6. Якщо застосовується IRT — оцінити model fit
Перед інтерпретацією b або threshold parameters перевіряють припущення й fit обраної моделі. Для Rasch/IRT це може включати одновимірність, локальну незалежність, item fit, category functioning та інші діагностики, релевантні конкретній моделі.
7. Перевірити групове функціонування
Якщо тест використовується в різних мовних, гендерних, вікових, освітніх або інших релевантних групах, аналізують не лише сирі p, а й DIF або інші відповідні методи measurement invariance. Це допомагає відрізнити різницю у trait distribution від різниці у функціонуванні самого item.
8. Перевірити стабільність на нових даних
Рішення про редагування або вилучення item не варто будувати на одній випадковій вибірці, особливо якщо N малий або item працює біля порогу. Крос-валідація, нова форма, інша когорта або повторна калібрація показують, чи зберігається висновок.
9. Поєднати статистику зі змістовою експертизою
Остаточне рішення має враховувати конструкт, змістовий blueprint, вимоги справедливості, доступність, цільове рішення та захищеність тестових матеріалів. Психометричний індекс є аргументом у рішенні, а не автоматичним правилом видалення.
Як правильно звітувати складність завдань
У звіті варто назвати теоретичну рамку: CTT, Rasch, 2PL, 3PL, graded response model, partial credit model або іншу. Далі описують формат item, scoring, формулу difficulty, напрям шкали і правила роботи з missing responses. Якщо в таблиці використано p, читач повинен одразу розуміти, чи високе значення означає легкість.
Для CTT повідомляють N і склад вибірки, p або нормований score, бажано uncertainty для ключових рішень. Для IRT повідомляють модель, спосіб калібрування, b/threshold estimates та їх стандартні похибки, fit diagnostics, спосіб фіксації латентної шкали і, якщо порівнюються форми, linking/equating procedure.
Standards for Educational and Psychological Testing наголошують на документуванні характеристик вибірки, статистичної моделі, процедур screening та evidence щодо item functioning. Така прозорість важливіша за красивий ярлик «оптимальна складність».
Типові помилки інтерпретації
Помилка 1. «p = 0,80 означає дуже складне завдання»
У найпоширенішій класичній конвенції навпаки: p = 0,80 означає, що 80% проаналізованих відповідей правильні, тобто завдання було легким для цієї групи. Якщо автор використовує q = 1 − p як індекс буквальної трудності, це повинно бути написано прямо.
Помилка 2. «p = 0,50 — універсальний стандарт якості»
Значення 0,50 максимізує дисперсію дихотомічної відповіді, але не визначає змістову цінність item і не враховує intended use. Тест може навмисно містити items значно легші або складніші.
Помилка 3. «Складніший item краще вимірює здібність»
Ні. Складність і вимірювальна якість не синоніми. Надзвичайно складне завдання може бути неінформативним для більшості цільової популяції, а просте може бути критично важливим для базового порогу або coverage construct.
Помилка 4. «Difficulty і discrimination — одне й те саме»
Difficulty описує розташування або частоту успішної відповіді; discrimination — зміну response probability разом із рівнем ознаки. Ці характеристики можуть бути пов’язані, але мають різні визначення і не повинні підміняти одна одну.
Помилка 5. «Класичне p можна порівнювати між будь-якими вибірками»
Порівнювати можна лише з урахуванням складу групи й умов. Різні p не доводять, що item «змінився»: могла змінитися здібність вибірки. Для строгого порівняння потрібна відповідна design/model strategy.
Помилка 6. «IRT b — це просто трансформоване p»
Ні. b оцінюється всередині латентної моделі й має іншу інтерпретацію. Його зв’язок з observed p залежить від розподілу θ, discrimination, guessing, моделі, fit та інших умов.
Помилка 7. «IRT гарантує інваріантність»
Parameter invariance є очікуваною властивістю за адекватної моделі й коректного калібрування. Model misfit, multidimensionality, local dependence, DIF, context effects і parameter drift можуть порушувати практичну стабільність оцінок.
Помилка 8. «Однакова difficulty після перекладу доводить еквівалентність»
Ні. Подібні числа не доводять semantic equivalence, construct equivalence або fairness. Так само різні числа не є автоматичним доказом bias. Потрібні змістова перевірка, cultural adaptation і відповідні групові моделі.
Помилка 9. «Складність symptom item визначає діагноз»
Ні. Навіть якщо клінічний item має IRT severity parameter, це лише характеристика функціонування завдання у моделі. Окрема відповідь, окремий threshold або сумарний screening score не є самостійним діагнозом.
Одна назва — три різні числа
Уявімо одне дихотомічне завдання. У класичному аналізі p = 0,72 означає: 72% валідних відповідей у цій вибірці були правильними. Якщо той самий автор вирішив називати буквальну трудність q = 1 − p, він отримає q = 0,28. Це два комплементарні описи тієї самої observed proportion, але напрям шкали протилежний.
Після IRT-калібрування той самий item може мати, наприклад, b = 0,80 на обраній логітній шкалі. Число 0,80 тепер не означає 80% і не дорівнює p. Воно означає location item відносно θ у конкретній параметризації моделі.
Саме тому таблиця без назви моделі, формули й напряму шкали є недостатньою. Коректний звіт робить різницю між p, 1 − p і b машинно та людськи однозначною.
Практичні наслідки для тестів здібностей і досягнень
Під час конструювання тесту не намагаються зробити всі items «середніми». Набір завдань має покривати змістовий blueprint і той діапазон здібності, де тест повинен бути точним. Якщо всі завдання легкі, виникає ceiling effect; якщо всі складні — floor effect. Ширший або цілеспрямовано зміщений діапазон difficulty може бути правильним рішенням залежно від мети.
Для item bank і computer adaptive testing каліброване b особливо важливе: алгоритм добирає завдання відповідно до поточної оцінки θ і потрібної інформації. Тут observed p з однієї вибірки не замінює IRT calibration.
Для звичайного фіксованого тесту difficulty також потрібна, але рішення про item слід приймати разом із аналізом завдань, дискримінативністю, змістовим coverage, reliability evidence, валідністю і fairness.
Scientific status: що в цій темі є усталеним, а що залежить від моделі
Усталено: у CTT для дихотомічних achievement/ability items p як частка правильних відповідей є стандартною описовою характеристикою, і її значення залежить від аналізованої групи. Так само усталено, що difficulty та discrimination — різні психометричні властивості.
Усталено: у Rasch/IRT difficulty описується модельними item parameters або category thresholds, а їх інтерпретація визначається конкретною моделлю та параметризацією. Твердження про invariance є умовним щодо model fit і design.
Залежить від контексту: категорії «дуже легке», «оптимальне», «дуже складне», цільовий діапазон p та правила редагування. Такі пороги є operational rules конкретної програми, а не природними межами психометричної реальності.
Залежить від evidence: чи потрібно вилучати item, чи змінювати wording, чи зберігати його заради content coverage. Це рішення не виводиться з одного числа і має бути задокументоване.
FAQ
Що таке item difficulty простими словами?
Це показник того, наскільки легко або складно люди відповідають на item, або модельна координата, що показує, де завдання розташоване на латентній шкалі. Точне значення залежить від CTT, Rasch/IRT та формату item.
Що означає P-value = 0,70 для тестового завдання?
У звичайній CTT-конвенції це означає, що 70% валідних відповідей у проаналізованій групі були правильними або, для нормованого partial-credit показника, набрано 70% максимально можливого балу. Це радше легше, а не складніше завдання.
Чому високий p означає легше завдання?
Тому що p визначають як частку успішних відповідей. Чим більше людей відповіли правильно, тим більше p. Якщо автор хоче, щоб більше число означало більшу трудність, він може використати 1 − p, але має чітко це зазначити.
Чи є p = 0,50 найкращою складністю?
Не універсально. Воно максимізує дисперсію дихотомічної відповіді, але оптимальна difficulty залежить від мети тесту, cut score, цільової популяції, content blueprint і потрібного діапазону точності.
Чим p відрізняється від IRT параметра b?
p — observed proportion у конкретній вибірці. b — параметр location завдання на латентній шкалі в заданій IRT-моделі. Вони пов’язані через response model і distribution θ, але не є одним числом у різних одиницях.
Що означає b = 0 у Rasch-моделі?
Це означає, що item розташований у нульовій точці обраної латентної шкали. Людина з θ = 0 має для такого дихотомічного item модельну ймовірність правильної відповіді 0,50. Нуль не означає «відсутність складності».
Чи можна порівнювати p між різними роками або групами?
Можна описово, але різницю слід інтерпретувати з урахуванням різного складу вибірок, умов, змісту форми та можливого DIF. Самої різниці p недостатньо, щоб стверджувати, що item став простішим або упередженим.
Як оцінюють difficulty для шкали Лайкерта?
Залежно від моделі використовують category thresholds, item location або severity parameters. Частка «правильних» відповідей зазвичай непридатна, бо категорії Лайкерта не є правильними та неправильними.
Чи треба видаляти дуже легке або дуже складне завдання?
Не автоматично. Спочатку перевіряють intended use, змістову необхідність, discrimination, scoring, дистрактори, sample composition, floor/ceiling effects, DIF і модельний fit. Крайня difficulty може бути запланованою.
Чим difficulty відрізняється від discrimination?
Difficulty описує частоту успішної відповіді або location item; discrimination описує, наскільки response probability змінюється разом із рівнем цільової ознаки. Середньо складний item може дискримінувати слабо, а складний — добре або погано.
Чи можна за difficulty окремого item робити клінічний висновок?
Ні. Item difficulty або severity є властивістю функціонування завдання в даних чи моделі. Діагностика потребує валідованого assessment process, відповідної популяції, норм, клінічної інформації та професійної інтерпретації.
Пов’язані статті
Аналіз завдань тесту: складність, дискримінативність, кореляції item-total і рішення про редагування — ширша процедура item analysis, у якій difficulty є лише одним із показників.
Дискримінативність завдання: як item відрізняє респондентів з різним рівнем вимірюваної ознаки — окремо про discrimination index, point-biserial, item-rest і IRT-параметр a.
Модель Раша: як вона пов’язує складність завдання, здібність і ймовірність відповіді — детально про θ, b, логіти, fit і Rasch measurement.
Психометрія: що це, що вона вимірює і як оцінюють якість психологічних тестів — загальна рамка психологічного вимірювання.
Класична теорія тестів: істинний бал, похибка вимірювання і надійність — контекст для класичних item statistics і залежності від вибірки.
Диференційне функціонування завдань (DIF): коли однаковий рівень конструкта дає різну ймовірність відповіді в різних групах — групове функціонування та fairness.
Змістова валідність: чи охоплюють завдання тесту той конструкт, який потрібно виміряти — чому статистично зручна difficulty не замінює змістову репрезентативність.
Психологічний тест: що це, з чого складається і за якими ознаками оцінюють його якість — базова сторінка про стандартизоване тестування.
Джерела
American Educational Research Association, American Psychological Association, & National Council on Measurement in Education. (2014). Standards for Educational and Psychological Testing.
Cappelleri, J. C., Lundy, J. J., & Hays, R. D. (2014). Overview of Classical Test Theory and Item Response Theory for Quantitative Assessment of Items in Developing Patient-Reported Outcome Measures. Clinical Therapeutics, 36(5), 648–662.
Council of Europe. (2004). Reference Supplement to the Preliminary Pilot Version of the Manual for Relating Language Examinations to the Common European Framework of Reference for Languages.
De Champlain, A. F. (2010). A primer on classical test theory and item response theory for assessments in medical education. Medical Education, 44(1), 109–117.
Guo, H., Lu, R., Johnson, M. S., & McCaffrey, D. F. (2022). Alternative Methods for Item Parameter Estimation: From CTT to IRT. ETS Research Report RR-22-12.
Kim, J., & Wilson, M. (2020). Polytomous Item Explanatory Item Response Theory Models. Educational and Psychological Measurement, 80(4), 670–693.
Michaelides, M. P. (2010). A Review of the Effects on IRT Item Parameter Estimates with a Focus on Misbehaving Common Items in Test Equating. Frontiers in Psychology, 1, 167.
Nguyen, T. H., Han, H.-R., Kim, M. T., & Chan, K. S. (2014). An Introduction to Item Response Theory for Patient-Reported Outcome Measurement. The Patient, 7(1), 23–35.
Scheuneman, J. D., & Steinhaus, K. S. (1987). A Theoretical Framework for the Study of Item Difficulty and Discrimination. ETS Research Report RR-87-44.
Sweeney, S. M., Sinharay, S., Johnson, M. S., & Steinhauer, E. W. (2022). An Investigation of the Nature and Consequence of the Relationship between IRT Difficulty and Discrimination. Educational Measurement: Issues and Practice, 41(4), 50–67.
Tennant, A., & Küçükdeveci, A. A. (2023). Application of the Rasch measurement model in rehabilitation research and practice: early developments, current practice, and future challenges. Frontiers in Rehabilitation Sciences, 4, 1208670.
Український центр оцінювання якості освіти. (2024). Офіційний звіт: психометричні характеристики завдань ЄВІ 2024, том 2.
