top of page

Психологічна енкциклопедія

Дискримінативність завдання: як item відрізняє респондентів з різним рівнем вимірюваної ознаки

6 днів тому
Читати 14 хв

Автор: Український психологічний ХАБ · Опубліковано: 23 вересня 2026 · Редакційна політика


Дискримінативність завдання, або item discrimination, — це здатність окремого завдання тесту розрізняти людей із різним рівнем тієї ознаки, яку має вимірювати тест. У найпростішому випадку добре спрямоване завдання дає вищі бали або правильні відповіді частіше людям із вищим рівнем вимірюваної ознаки і рідше — людям із нижчим рівнем. У психометрії це одна з центральних характеристик функціонування item, але її сенс залежить від моделі вимірювання, способу підрахунку балів, вибірки та мети тесту.


Standards for Educational and Psychological Testing прямо вимагають, щоб під час оцінювання психометричних властивостей завдань було задокументовано модель — класичну теорію тестів, IRT або іншу, — описано вибірку достатнього розміру й різноманітності та пояснено процедури скринінгу таких характеристик, як складність, дискримінативність і диференційне функціонування завдань. Отже, дискримінативність не існує як універсальна «оцінка якості item», відірвана від даних і моделі.


У класичній теорії тестів дискримінативність часто оцінюють через різницю між верхньою і нижньою групами, точково-бісеріальну кореляцію, бісеріальну кореляцію або кореляцію завдання із сумарним балом. У IRT близьку, але не тотожну роль виконує параметр дискримінації a: він описує крутизну зміни ймовірності відповіді вздовж латентної шкали. ETS окремо підкреслює, що оцінювання дискримінативності має різні реалізації у CTT та IRT і що зв’язок між відповідними показниками потребує моделювання, а не механічного прирівнювання.


У цій статті слово «завдання» охоплює не лише екзаменаційне запитання з правильною відповіддю. Item може бути твердженням опитувальника, пунктом шкали, стимулом, поведінковим індикатором або іншим елементом, з якого формується тестовий бал. Саме тому «висока дискримінативність» означає різні речі для тесту знань, шкали депресивних симптомів, особистісного опитувальника чи рейтингової шкали.


Що саме означає дискримінативність завдання


Дискримінативність відповідає на локальне запитання: наскільки відповідь на конкретний item узгоджується з розташуванням респондента на вимірюваному континуумі. Для завдання «правильно / неправильно» очікується, що ймовірність правильної відповіді зростатиме разом із рівнем відповідної здібності або знання. Для шкали з упорядкованими категоріями очікується, що вибір вищих категорій систематично змінюватиметься разом із латентною ознакою відповідно до напряму кодування.


Це визначення має важливу умову: критерій, із яким порівнюють item, повинен справді представляти цільову ознаку. Якщо сумарний бал змішує кілька різних конструкцій, сильна або слабка кореляція окремого завдання з цим балом може відображати багатовимірність, а не «добру» чи «погану» якість формулювання. Тому item analysis потрібно читати разом із внутрішньою структурою тесту та конструктною валідністю.


Дискримінативність також не є синонімом складності. Завдання може бути дуже легким і при цьому мало розрізняти людей, бо майже всі дають однакову відповідь. Воно може бути складним, але добре розрізняти респондентів у певній ділянці континууму. А може бути середньої складності та все одно працювати слабко через двозначність, неправильне кодування або невідповідність конструкта.


Дискримінативність у класичній теорії тестів


У класичній теорії тестів статистика завдання прив’язана до конкретної вибірки та конкретної форми тесту. Це принципово для інтерпретації: той самий item може демонструвати іншу дискримінативність у вузькій високоздібній вибірці, у загальній популяції або в групі, для якої завдання має підлоговий чи стельовий ефект.


Індекс D: різниця між верхньою і нижньою групами


Один із найстаріших і найінтуїтивніших показників — upper–lower discrimination index, або D-індекс. Для дихотомічного завдання його можна записати як D = pᵁ − pᴸ, де pᵁ — частка правильних відповідей у групі з високим загальним результатом, а pᴸ — частка правильних відповідей у групі з низьким результатом. Значення близьке до +1 означає дуже сильне розрізнення в очікуваному напрямі; близьке до 0 — майже відсутнє розрізнення; від’ємне — результат, який потребує перевірки.


Історично часто брали верхні й нижні 27% розподілу. Це зручна класична евристика, а не природна межа психометрії. D використовує лише частину даних і залежить від того, як визначено групи, тому його не варто подавати як єдиний показник якості item. Сучасний огляд ETS з аналізу завдань розглядає дискримінативність поряд з іншими статистик завдань у ширшій системі аналізу тесту.


Точково-бісеріальна і бісеріальна кореляції


Для дихотомічних item поширена точково-бісеріальна кореляція між балом за завданням 0/1 і неперервним тестовим критерієм. Бісеріальна кореляція базується на додатковому припущенні про латентну неперервність дихотомізованої змінної. Lei і Wu у своєму описі класичного item analysis перелічують D-індекс, point-biserial і biserial як різні індекси дискримінації для дихотомічних завдань, а item-total correlation — як один із підходів для політомних item.


Ці коефіцієнти не слід змішувати в одну шкалу з універсальними порогами. Вони мають різні статистичні припущення, а величина кореляції залежить від варіативності item, варіативності сумарного бала, довжини тесту, складу вибірки й структури конструкта.


Item-total і corrected item-total: проблема частини та цілого


Звичайна item-total кореляція може містити аналізоване завдання всередині сумарного бала, з яким його корелюють. Тоді item є частиною обох змінних, і зв’язок частково посилюється математично. Тому в практичному аналізі часто корисніша corrected item-total, або item-rest correlation: бал item корелюють із сумою решти завдань.


Zijlmans та співавтори визначають item-rest correlation саме як кореляцію бала конкретного item із сумарним балом інших item. Вони також показують, що в літературі трапляються різні евристичні мінімальні значення — 0,20, 0,30 або 0,40 — і немає одного універсального числа, яке автоматично вирішує долю завдання.


Corrected item-total особливо корисна для одновимірних або чітко визначених субшкал. Якщо тест має кілька факторів, item потрібно співвідносити насамперед із тією субшкалою, до якої він належить. Низька кореляція із загальним балом може бути закономірною, якщо загальний бал об’єднує різні змістові домени.


Дискримінативність у IRT: параметр a


У теорії відповіді на завдання дискримінативність моделюють інакше. У двопараметричній логістичній моделі 2PL для кожного item оцінюють параметр розташування або складності та параметр дискримінації a. Чим більший a, тим крутіше змінюється ймовірність відповіді поблизу відповідної ділянки латентної шкали, тобто item тонше розрізняє людей із близькими рівнями ознаки саме там.


Огляд Nguyen та співавторів чітко розрізняє моделі: у Rasch-моделі дискримінація вважається однаковою для всіх item, у 2PL окремо оцінюють розташування і дискримінацію кожного item, а в 3PL додають параметр псевдовгадування. Для політомних відповідей існують моделі, у яких дискримінація може змінюватися між item, і моделі з обмеженням рівної дискримінації.


Звідси випливає ключове правило: IRT-параметр a не дорівнює D-індексу, point-biserial чи corrected item-total. Вони можуть бути пов’язані, але належать до різних моделей і шкал. Guo та співавтори спеціально досліджували зв’язок між бісеріальною кореляцією та IRT-параметром дискримінації, що саме по собі показує: перетворення одного показника на інший є модельною задачею, а не тотожністю.


Навіть усередині IRT величина a залежить від параметризації, масштабу θ, моделі, припущень і якості fit. Тому фраза «a = 1,5 — це добре» без назви моделі, метрики, вибірки і діапазону θ є неповною.


Дискримінація і інформація


За інших рівних умов крутіший item у 2PL зазвичай дає більше інформації поблизу своєї ділянки розташування. Однак інформаційна функція залежить не лише від a: важливі також місце item на латентній шкалі, формат відповіді, інші параметри моделі та те, де саме потрібно отримати точне вимірювання. Тому високу дискримінацію не слід відривати від відповідності діапазону тесту.


Локальна залежність може викривити a


IRT зазвичай спирається на припущення локальної незалежності після врахування латентної ознаки. Якщо два item додатково взаємодіють — наприклад, мають спільний стимул або один фактично підказує інший, — оцінка дискримінації може спотворюватися. Tuerlinckx і De Boeck показали на теоретичних і симуляційних моделях, що ігнорування позитивної item-взаємодії може завищувати оцінений параметр дискримінації у 2PL, а негативної — занижувати.


Що означають позитивна, нульова і негативна дискримінативність


Позитивна дискримінативність


Позитивне значення означає, що item змінюється в очікуваному напрямі разом із тестовою або латентною ознакою. Для тесту знань це зазвичай означає, що респонденти з вищим рівнем знань частіше відповідають правильно. Для правильно закодованої шкали рис чи симптомів — що вищий рівень ознаки пов’язаний із вищим очікуваним балом item.


Величина позитивного показника потребує контексту. Слабка позитивна кореляція може бути нормальною для дуже широкого багатовимірного тесту або для item, який навмисно покриває периферійну, але змістово необхідну грань конструкта. Сильна кореляція може бути бажаною, але інколи сигналізує надмірну змістову подібність із сусідніми item.


Дискримінативність близька до нуля


Значення близьке до нуля означає, що в цій вибірці і за цим критерієм відповіді на item майже не пов’язані з рівнем, який представляє тестовий бал або латентна модель. Причинами можуть бути дуже мала варіативність відповідей, невідповідність item цільовому конструкту, випадкове вгадування, нечітке формулювання, надто неоднорідний зміст тесту, вузький діапазон здібності або недостатня статистична точність.


Негативна дискримінативність


Від’ємне значення означає, що item поводиться протилежно до очікуваного напряму: люди з вищим загальним рівнем частіше дають відповідь, яка отримує нижчий бал, або навпаки. Це важливий діагностичний сигнал, але ще не пояснення причини.


Перед видаленням item потрібно перевірити ключ або ключ оцінювання, реверсивне кодування, помилки імпорту даних, формулювання, кілька можливих правильних відповідей, роботу дистракторів, належність до правильної субшкали, мовне розуміння, часові обмеження, локальну залежність, групову неоднорідність і розмір вибірки. У тестах знань негативний point-biserial нерідко виявляє неправильний ключ або неоднозначний item; в опитувальниках частою причиною буває невраховане реверсивне кодування.


Чому немає універсального порога «хорошої дискримінативності»


Числа 0,20, 0,30 або 0,40 часто зустрічаються в навчальних матеріалах і прикладних статтях. Їх можна використовувати як локальні правила скринінгу, якщо заздалегідь пояснено метод і мету, але вони не є універсальними психометричними межами. Порогове значення не може мати однаковий зміст для D-індексу, corrected item-total і IRT a.


На величину показника впливають довжина тесту, діапазон ознаки у вибірці, частка відповідей у кожній категорії, багатовимірність, формат item, спосіб підрахунку балів, локальна залежність, модель і вибіркова похибка. Саме тому Стандарти AERA / APA / NCME вимагають документувати модель, вибірку та процедуру оцінювання властивості завдань, а не зводять аналіз до єдиного числового порога.


Практично це означає: порогове значення може бути підставою для перегляду, але не автоматичним вироком. Item із показником нижче локального порога потрібно дослідити; item із показником вище порога все одно потрібно перевірити на зміст, структуру, справедливість і придатність до цільового використання.


Зв’язок між складністю і дискримінативністю


У класичній статистиці дуже легкі або дуже складні дихотомічні завдання мають малу варіативність відповідей, а це обмежує можливу кореляцію з тестовим балом. Тому низька observed discrimination інколи відображає не дефект формулювання, а невідповідність складності завдання діапазону конкретної вибірки.


Зв’язок не зводиться до правила «середня складність завжди дає найкращу дискримінацію». Sweeney, Sinharay, Johnson і Steinhauer показали, що емпіричний зв’язок між difficulty та discrimination змінюється між CTT, 2PL і 3PL та між наборами даних. Отже, інтерпретувати ці параметри потрібно всередині обраної моделі.


Змістова мета теж важлива. Для тесту, який має точно працювати біля певного порогового бала, потрібні item, інформативні саме в цій зоні. Для широкої шкали може бути корисним набір item, що охоплює різні рівні ознаки, а не максимізує один глобальний коефіцієнт.


Висока дискримінативність не робить item автоматично «якісним»


Статистика може бути високою з небажаних причин. Два майже однакові item можуть сильно корелювати з тим самим сумарним балом, але додавати мало нового змісту. Item може дуже точно відображати вузький фактор і водночас звужувати заявлений конструкт. Спільний стимул або локальна залежність можуть штучно підвищувати параметр. Нарешті, item може добре розрізняти групу за construct-irrelevant характеристикою.


Тому статистичний відбір потрібно узгоджувати зі змістовою валідністю. Якщо послідовно видаляти всі item з нижчими кореляціями лише заради максимальної однорідності, шкала може втратити важливі аспекти конструкта. Висока внутрішня гомогенність і висока дискримінативність не замінюють доказу того, що зміст тесту репрезентує заявлену область.


Друга проблема — оптимізація на тій самій вибірці. Якщо item обирають переважно за емпіричними зв’язками, частина ефекту може бути випадковою. Стандарт 4.11 у Standards for Educational and Psychological Testing рекомендує перехресну валідацію, коли item або тести відбирають переважно за емпіричними відношеннями, щоб перевірити стабільність результату на незалежних даних.


Дискримінативність, DIF і справедливість — це різні питання


Item discrimination питає, наскільки item розрізняє рівні ознаки. Диференційне функціонування завдань (DIF) питає інше: чи мають люди з однаковим рівнем цільової ознаки різну ймовірність відповіді залежно від належності до групи. Тому item може мати високу загальну дискримінативність і водночас демонструвати DIF.


DIF також не є автоматичним доказом несправедливості або упередженості. Він є статистичним сигналом групової неоднорідності функціонування item, який потребує змістового й контекстуального пояснення. І навпаки, відсутність очевидного DIF в одній вибірці не доводить універсальну справедливість тесту для всіх мовних, культурних і демографічних груп.


Інваріантність вимірювання, DIF, дискримінативність завдання і справедливість пов’язані, але не взаємозамінні. Висока дискримінативність не гарантує інваріантність; DIF не означає автоматично несправедливість; інваріантність у конкретній моделі не звільняє від перевірки змісту, доступності та цільового використання.


Дискримінативність не дорівнює надійності або валідності


Добре функціонуючі item можуть підтримувати точність тестового бала, але item discrimination не є окремим доказом того, що весь тест надійний. Надійність психологічного тесту стосується точності та відтворюваності оцінок у визначеній процедурі вимірювання. Кореляція окремого item із рештою шкали — лише один локальний фрагмент цієї картини.


Так само дискримінативність не встановлює валідність. Вона може дати інформацію про внутрішню структуру і функціонування item, але не доводить, що тест справді підтримує заявлену інтерпретацію балів для конкретного використання. Для цього потрібні ширші докази: зміст, структура, процес відповіді, зв’язки з іншими змінними, наслідки й інші релевантні джерела.


Не слід також «покращувати» тест шляхом нескінченного видалення item, які знижують alpha. Внутрішня узгодженість є окремою властивістю, а Cronbach’s alpha не є універсальним показником якості тесту. Максимізація alpha може винагороджувати повторюваність і звужувати зміст.


Як аналізувати дискримінативність на практиці


1. Спочатку визначити конструкт і цільового використання


До розрахунків потрібно зафіксувати, що саме вимірює шкала, для кого вона призначена і як інтерпретуватимуть бал. Без цього навіть математично точний коефіцієнт не має однозначного змісту. Item може бути релевантним для однієї субшкали й нерелевантним для іншої.


2. Перевірити scoring і напрям кодування


Спершу перевіряють ключі правильних відповідей, пропуски, реверсивні item, ваги й перетворення категорій. Негативна дискримінативність після помилки кодування не є психометричною властивістю item — це помилка даних.


3. Подивитися на розподіл відповідей


Перед кореляціями корисно оцінити частоти категорій, пропуски, floor/ceiling, частку правильних відповідей або середній бал item. Item без варіативності фізично не може сильно корелювати з іншими показниками.


4. Використовувати показник, який відповідає формату item і моделі


Для дихотомічних завдань у CTT можуть бути доречними D, point-biserial або biserial; для шкал — corrected item-total/item-rest, item-factor relations та інші показники. Для IRT оцінюють параметри й fit конкретної моделі. Lei і Wu нагадують, що навіть у класичному item analysis набір статистик залежить від формату завдання.


5. Не читати item ізольовано від шкали


Потрібно перевірити, до якого фактора належить item, чи не має він крос-навантажень, чи немає локальної залежності, чи збігається статистичний результат із теоретичною роллю item. Низька corrected item-total у багатовимірному інструменті може бути очікуваною, якщо загальний total не є коректним одновимірним критерієм.


6. Перевірити стабільність на іншій вибірці


Відбір завдань на тих самих даних, де обчислено коефіцієнти, підсилює ризик підлаштування під випадкові особливості вибірки. Для важливих інструментів потрібні незалежна валідаційна вибірка, повторне польове тестування або інша форма перехресної валідації.


7. Дослідити групове функціонування


Якщо тест використовують у кількох групах, загальної дискримінативності недостатньо. Потрібно досліджувати DIF або інші релевантні моделі інваріантності, а зміст item переглядати з урахуванням мови, культури, доступності й потенційної construct-irrelevant variance.


8. Приймати рішення на перетині статистики і змісту


Результат item analysis має приводити не до механічного «залишити / видалити», а до діагностичного рішення: залишити без змін, перевірити ключ, переписати, перенести до іншої субшкали, протестувати на новій вибірці, дослідити DIF, змінити scoring або вилучити. Аналіз завдань тесту саме тому є ширшим процесом, ніж один коефіцієнт дискримінативності.


Як правильно звітувати дискримінативність


Мінімальний прозорий звіт повинен вказувати: формат item; спосіб підрахунку балів; модель аналізу; вибірку та її релевантні характеристики; точне визначення коефіцієнта; чи виключено item із сумарного бала; спосіб формування верхньої і нижньої груп, якщо використано D; програмне забезпечення; невизначеність або стандартні похибки, якщо вони доступні; критерії перегляду; рішення щодо item та його змістове обґрунтування.


Наприклад, повідомлення «дискримінативність = 0,34» є недостатнім. Потрібно уточнити, чи це point-biserial, corrected item-rest, D-індекс або IRT a. Для D слід описати, які частки розподілу утворили групи. Для IRT — модель, параметризацію, шкалу θ, метод оцінювання, відповідність моделі даним і стандартну похибку.


Відтворюваність важлива ще й тому, що одна й та сама назва «discrimination» приховує різні математичні об’єкти. Guo та співавтори порівнювали бісеріальну кореляцію й IRT discrimination parameter саме як різні оцінювачі, а не як взаємозамінні записи одного числа.


Типові помилки інтерпретації


Помилка 1: «0,30 — універсальна межа». Ні. Це поширена евристика для частини кореляційних статистик завдань, а її доречність залежить від тесту, вибірки, мети і показника.


Помилка 2: «чим більше, тим завжди краще». Надзвичайно висока узгодженість може бути наслідком змістової надлишковості або локальної залежності, а не додаткової вимірювальної цінності.


Помилка 3: «низька дискримінативність означає поганий текст item». Причина може бути в невдалому формулюванні, але також у надто легкому/складному item, вузькому діапазоні ознаки, багатовимірності, невідповідному total score, малій вибірці або свідомій змістовій ролі завдання.


Помилка 4: «негативний коефіцієнт одразу означає видалення». Спочатку перевіряють ключ, реверсивне кодування, структуру, дані й зміст. Автоматичне видалення може приховати технічну помилку або важливу багатовимірність.


Помилка 5: «item discrimination = discriminant validity». Це різні поняття. Дискримінативність item стосується того, як завдання розрізняє рівні ознаки; discriminant validity стосується доказів того, що конструкт емпірично відрізняється від сусідніх конструкцій.


Помилка 6: «item discrimination = DIF». Загальна дискримінативність не порівнює групи за однакового рівня θ; DIF саме ставить це умовне групове питання.


Помилка 7: «висока дискримінативність доводить валідність». Вона є локальною властивістю функціонування item у певній моделі й вибірці, а валідність стосується обґрунтованості інтерпретацій і використань тестових балів.


Психодіагностика, скринінг і клінічне використання


У психодіагностиці висока item discrimination не перетворює окреме запитання на діагностичний маркер. Скринінг, case-finding, клінічне assessment, diagnosis, monitoring і outcome measurement мають різні цілі. Якість item потрібно оцінювати всередині валідованого інструмента, для intended population і цільового використання.


Дискримінативність також не дорівнює діагностичній sensitivity або specificity. Параметр a в IRT не є чутливістю тесту до клінічного стану; point-biserial не є PPV або NPV; D-індекс не визначає клінічний cutoff. Для діагностичних рішень потрібні окремі дані про reference standard, prevalence/base rate, ROC-характеристики, predictive values, наслідки помилок і клінічну корисність.


Один score, один symptom або один screening result не встановлює діагноз. Навіть психометрично сильний інструмент має застосовуватися в межах тієї популяції, мови, культурної адаптації та процедури, для яких є достатні докази.


Короткий алгоритм рішення щодо item


Якщо дискримінативність низька або негативна, перевірка йде в такому порядку: дані й підрахунок балів → розподіл відповідей → відповідність субшкалі → формулювання і зміст → складність/відповідність діапазону → вимірність/локальна залежність → групове функціонування → повторна оцінка на незалежних даних. Така послідовність зменшує ризик видалити змістово важливий item через один нестабільний коефіцієнт.


Якщо дискримінативність висока, перевірка не завершується. Потрібно впевнитися, що item не дублює сусідні, не отримує перевагу через спільний стимул, не звужує конструкт, не демонструє DIF і справді покращує точність у потрібній ділянці шкали.


FAQ


Що означає висока дискримінативність завдання?


Вона означає, що відповіді на item помітно змінюються разом із рівнем цільової ознаки у вибірці та моделі, які аналізують. Точне значення залежить від показника: D, point-biserial, item-rest або IRT a не мають спільної універсальної шкали.


Чи є 0,30 універсальною межею хорошої дискримінативності?


Ні. 0,30 — поширена евристика для деяких кореляційних статистик завдань. У науковому звіті потрібно назвати конкретний показник, вибірку, модель, мету тесту й обґрунтування критерію.


Чому дискримінативність може бути негативною?


Серед причин — неправильний ключ, невраховане реверсивне кодування, неоднозначний item, невідповідність субшкалі, багатовимірність, локальна залежність, групова неоднорідність, мала вибірка або статистичний шум. Негативне значення є приводом для діагностики причини.


Чим item-total відрізняється від item-rest?


Item-total може корелювати item із сумою, до якої входить той самий item, створюючи part–whole overlap. Item-rest виключає аналізоване завдання із сумарного критерію і тому зазвичай є чистішою оцінкою зв’язку item із рештою шкали.


Чи можна порівнювати point-biserial з IRT параметром a?


Їх можна досліджувати як пов’язані показники, але не прирівнювати. Point-biserial є класичною кореляційною статистикою, а a — параметром конкретної IRT-моделі, залежним від її параметризації та шкали θ.


Чим дискримінативність відрізняється від DIF?


Дискримінативність описує зв’язок item із рівнем ознаки. DIF перевіряє, чи відрізняється функціонування item між групами після контролю рівня цієї ознаки. Висока дискримінативність не виключає DIF.


Чи треба видаляти item з низькою дискримінативністю?


Автоматично — ні. Спочатку перевіряють підрахунок балів, зміст, складність, субшкалу, варіативність, структуру, групове функціонування і стабільність оцінки. Іноді редагування або перенесення item є кращим рішенням, а іноді низька дискримінативність закономірна для змістово необхідного елемента.


Чи може занадто висока дискримінативність бути проблемою?


Так, у певних ситуаціях. Вона може супроводжувати змістову надлишковість, локальну залежність або занадто вузьке охоплення конструкта. Високе число потрібно оцінювати разом із охопленням змісту, вимірністю і моделлю.


Пов’язані статті


Аналіз завдань тесту: складність, дискримінативність, кореляції item-total і рішення про редагування — ширша процедура item analysis, у якій дискримінативність є одним із діагностичних показників.



Класична теорія тестів: істинний бал, похибка вимірювання і надійність — основа для інтерпретації класичних статистик завдань.





Змістова валідність: чи охоплюють завдання тесту той конструкт, який потрібно виміряти — чому статистично сильний item ще має бути змістово релевантним.



Психологічний тест: що це, з чого складається і за якими ознаками оцінюють його якість — загальна сторінка про стандартизований психологічний тест.


Джерела


American Educational Research Association, American Psychological Association, & National Council on Measurement in Education. (2014). Standards for Educational and Psychological Testing.


Guo, H., Lu, R., Johnson, M. S., & McCaffrey, D. F. (2022). Alternative Methods for Item Parameter Estimation: From CTT to IRT. ETS Research Report, RR-22-12.


Lei, P.-W., & Wu, Q. (2007). CTTITEM: SAS macro and SPSS syntax for classical item analysis. Behavior Research Methods, 39(3), 527–530.


Moses, T. P. (2017). A Review of Developments and Applications in Item Analysis. In R. E. Bennett & M. von Davier (Eds.), Advancing Human Assessment (pp. 19–46). Springer.


Nguyen, T. H., Han, H.-R., Kim, M. T., & Chan, K. S. (2014). An Introduction to Item Response Theory for Patient-Reported Outcome Measurement. The Patient, 7(1), 23–35.


Sweeney, S. M., Sinharay, S., Johnson, M. S., & Steinhauer, E. W. (2022). An Investigation of the Nature and Consequence of the Relationship between IRT Difficulty and Discrimination. Educational Measurement: Issues and Practice, 41(4), 50–67.


Tuerlinckx, F., & De Boeck, P. (2001). The effect of ignoring item interactions on the estimated discrimination parameters in item response theory. Psychological Methods, 6(2), 181–195.


Zijlmans, E. A. O., Tijmstra, J., van der Ark, L. A., & Sijtsma, K. (2018). Item-Score Reliability in Empirical-Data Sets and Its Relationship With Other Item Indices. Educational and Psychological Measurement, 78(6), 998–1020.

 
 
bottom of page