top of page

Психологічна енкциклопедія

Аналіз завдань тесту: складність, дискримінативність, кореляції item-total і рішення про редагування

6 днів тому
Читати 15 хв

Аналіз завдань тесту — це перевірка того, як кожне окреме завдання або пункт працює у реальних даних: наскільки часто люди дають певну відповідь, чи розрізняє завдання респондентів із різним рівнем вимірюваної ознаки, як воно пов’язане з рештою шкали, чи не створюють проблеми ключ, кодування, дистрактори або категорії відповіді. У сучасній психометрії це не механічний відбір за одним коефіцієнтом. Мета — зрозуміти поведінку завдання у межах конкретного конструкта, вибірки й призначення тесту та прийняти обґрунтоване рішення: залишити, переписати, перекодувати, перенести до іншої субшкали, додатково дослідити або вилучити.


Міжнародна тестова комісія прямо відносить аналіз завдань (item analysis) до контролю якості тестування і рекомендує переглядати його результати до висновків про учасників тесту; ITC Guidelines on Quality Control також нагадують, що аналіз може виявити помилковий ключ, неправильно оброблене реверсивне завдання та інші технічні проблеми. NCME розглядає операційний аналіз завдань (operational item analysis) як невід’ємну частину розроблення тесту в рамках класичної теорії тестів і теорії відповіді на завдання.


Коротко: які питання має закрити аналіз завдань


Якісний аналіз починається не з питання «чи перевищує коефіцієнт 0,30?», а з послідовності питань. Чи правильно закодовано відповіді? Чи має завдання достатню варіативність у потрібній популяції? Чи його відповідь узгоджується з балом тієї шкали, до якої воно належить? Чи не є зв’язок штучно завищеним через включення самого завдання до сумарного бала? Чи не ховається за середнім показником проблема в окремій групі? Чи зберігається зміст конструкта, якщо пункт вилучити?


Ця логіка відповідає сучасному підходу до тестування, за яким якість не зводиться до одного числа. Standards for Educational and Psychological Testing розглядають інтерпретацію тестових балів через сукупність доказів щодо валідності, надійності, справедливості й наслідків використання. Показники завдань є одним шаром цієї аргументації, а не сертифікатом «хорошого тесту».


Де аналіз завдань стоїть у розробці психологічного тесту


У типовому циклі спочатку визначають психологічний конструкт, виконують його операціоналізацію, створюють ширший початковий банк завдань, проводять когнітивну й експертну перевірку, пілотують матеріал і лише після цього аналізують дані на рівні окремих завдань. Аналіз завдань допомагає перейти від сирого набору формулювань до робочої шкали, але після редагування цикл потрібно повторити на нових даних.


У цьому сенсі аналіз завдань є частиною розроблення та контролю вимірювання, а не окремою процедурою «валідації». Clark і Watson (2019) підкреслюють, що розроблення шкали має починатися з чіткого визначення конструкта й достатньо широкого пулу пунктів, а статистичне скорочення не повинно руйнувати змістове охоплення. Stefana та співавт. (2025) так само радять поєднувати difficulty, discrimination, inter-item та item-total показники з факторною структурою й теоретичною відповідністю.


Спочатку визначте, який тип завдання ви аналізуєте


Одна й та сама назва показника може означати різні речі для тесту здібностей, клінічної шкали самозвіту та рейтингової шкали. У завданні з правильною відповіддю можна безпосередньо обчислити частку правильних відповідей. У пункті особистісного опитувальника немає «правильної» відповіді, тому коректніше говорити про частоту схвалення, розподіл відповідей, середній рівень або параметр розташування item у відповідній моделі.


Для шкал із кількома категоріями відповіді важливі не лише середнє й item-total кореляція, а й те, як люди використовують самі категорії. Якщо майже всі обирають одну відповідь, завдання може мати слабку інформаційну цінність у цій вибірці. Докладніше про сам формат відповіді див. у матеріалі про рейтингові шкали.


Перед статистикою перевірте ключ, кодування і дані


Негативна дискримінативність або дивна item-total кореляція інколи виникає не через психологічну природу завдання, а через технічну помилку. ITC окремо звертає увагу на проблеми ключа та реверсивного кодування. Тому перед інтерпретацією коефіцієнтів потрібно перевірити, чи правильний ключ, чи всі реверсивні пункти перекодовані, чи однаково позначені пропущені відповіді, чи не змінився формат шкали між хвилями збору даних і чи немає помилкового об’єднання різних версій тесту.


Для багатошкального опитувальника потрібно також правильно визначити референтний score. Пункт тривожності слід насамперед співвідносити з балом відповідної субшкали, а не з механічною сумою всього опитувальника, якщо загальний бал змішує кілька різних конструктів. Низька кореляція з неправильним total score не є доказом поганого item.


Складність завдання: що насправді означає item difficulty


Дихотомічні завдання з правильною відповіддю


У класичній теорії тестів для дихотомічного завдання найпростіший індекс — p, частка респондентів, які відповіли правильно: p = кількість правильних відповідей / кількість валідних відповідей. Попри назву «складність», високий p означає легше завдання, а низький p — складніше. Тому p = 0,90 описує завдання, яке правильно виконали 90% учасників конкретної вибірки, а не «складність 90%».


Цей показник належить до логіки класичної теорії тестів і залежить від вибірки. Те саме завдання може мати іншу частку правильних відповідей у вибірці школярів, студентів профільної програми або фахівців. Отже, p не є незмінною властивістю формулювання.


Немає універсально «ідеальної» складності


Завдання біля середини шкали часто дають більше варіативності, але правило «усі хороші items мають бути середньої складності» занадто грубе. Тест на широкий діапазон здібностей потребує завдань різної складності. Критеріально-орієнтований тест може навмисно містити багато відносно легких базових завдань. Завдання біля важливого порога рішення можуть мати особливу цінність навіть тоді, коли їхня загальна частка правильних відповідей не «ідеальна» для максимального розкиду балів.


Емпіричний зв’язок між difficulty та discrimination залежить від моделі й даних. Sweeney та співавт. (2022) показали, що характер цього зв’язку відрізняється між класичною теорією тестів, 2PL- і 3PL-моделями IRT. Це ще одна причина не перетворювати середню складність на універсальне правило якості.


Пункти самозвіту та особистісні шкали


У пунктах без правильної відповіді буквальний термін «складність» може вводити в оману. ITC Guidelines on Quality Control згадують для особистісних пунктів показник схильності до згоди (acquiescence) поряд зі складністю та дискримінативністю. На практиці аналізують частоти категорій, середній рівень відповіді, дисперсію, асиметрію, ефекти підлоги й стелі, а в IRT — параметри розташування або пороги категорій.


Дискримінативність: чи розрізняє завдання респондентів


Дискримінативність описує, наскільки відповідь на item пов’язана з рівнем тієї ознаки або результату, який тест має відображати. У простому тесті здібностей хороше дискримінативне завдання частіше виконують респонденти з вищим рівнем цільової здібності, ніж респонденти з нижчим. У шкалі самозвіту логіка подібна, але «вища відповідь» має зміст лише після правильного напрямку кодування.


У класичному аналізі завдань дискримінативність можна описувати різними статистиками. D-index порівнює частку правильних відповідей у групі з високими загальними балами з часткою у групі з низькими балами. Точково-бісеріальна кореляція пов’язує дихотомічний item із кількісним критерієм. Item-rest кореляція співвідносить item із сумою решти релевантних завдань. У IRT дискримінативність може бути параметром нахилу крива характеристик завдання (item characteristic curve). Ці числа пов’язані, але не взаємозамінні.


Що означає негативна дискримінативність


Стійко негативний зв’язок — сильний сигнал для перевірки, бо він означає, що люди з вищим релевантним загальним балом частіше дають відповідь у напрямку нижчого item score. Спочатку перевіряють ключ і реверсивне кодування. Далі — двозначність формулювання, кілька можливих правильних відповідей, невідповідність змісту шкалі, неправильну субшкалу, особливості вибірки, дуже малу варіативність або групову неоднорідність.


Негативний коефіцієнт не дає автоматичного діагнозу пункту. У багатовимірному тесті item може законно вимірювати інший компонент, а в малій вибірці коефіцієнт може бути нестабільним. Рішення приймають після технічної, змістової та структурної перевірки.


Item-total і item-rest: головне технічне розрізнення


Термін item-total correlation часто використовують для кореляції бала окремого пункту із сумарним балом шкали. Але є принципова деталь: чи входить сам пункт у цей сумарний бал. Якщо входить, виникає перекриття частини й цілого (part-whole overlap) — item корелює із сумою, частиною якої він сам є. Це механічно підвищує коефіцієнт.


Ця проблема відома давно. Henrysson (1963) показав, що item-total correlation, коли item включено до total, може бути оманливо завищеною саме через перекриття. Тому для відбору завдань зазвичай змістовніше використовувати corrected item-total correlation, тобто item-rest correlation: кореляцію Xᵢ з T − Xᵢ.


У скороченій формі: звичайний item-total відповідає на питання «як item пов’язаний із балом, до якого сам входить?», а item-rest — «як item пов’язаний із результатом за рештою завдань?». Саме друге питання краще відокремлює внесок пункту від математичного самоперекриття.


Який коефіцієнт кореляції використовувати


Для дихотомічного item і приблизно кількісного rest score часто використовують точково-бісеріальну кореляцію, яка є окремим випадком Pearson r. Для порядкових категорій можуть бути доречні кореляції, моделі або матриці, що враховують категоріальну природу даних; у факторному аналізі часто застосовують поліхоричні кореляції. Вибір коефіцієнта залежить від шкали вимірювання, розподілу, моделі й питання дослідження, а не від звички програмного пакета.


Кореляція Спірмена може бути корисною для певних порядкових або монотонних зв’язків, але вона не є універсальною заміною item-rest аналізу. Окремо про її припущення й інтерпретацію див. матеріал «Коефіцієнт кореляції Спірмена».


Чому поріг 0,30 не є магічною межею


У прикладній літературі часто зустрічається правило, за яким corrected item-total або item-rest correlation нижче приблизно 0,30 вважають приводом для перевірки. Stefana та співавт. подають дуже низьку скориговану item-total кореляцію нижче 0,30 як можливу підставу розглянути вилучення, а не як автоматичний наказ. Огляд емпіричних item indices у Zijlmans та співавт. (2018) показує, що в літературі використовували різні орієнтири — 0,20, 0,30 або 0,40 — і немає одного універсального числового правила для всіх типів тестів.


Порогове мислення тут небезпечне. Значення залежить від широти конструкта, довжини шкали, формату item, гетерогенності вибірки, етапу розроблення й того, чи обчислено кореляцію з правильною субшкалою. Пункт із r = 0,29 не стає «поганим» через одну соту, так само як r = 0,31 не робить його автоматично якісним.


Коли низька item-rest кореляція справді насторожує


Підозра сильніша, якщо низький зв’язок відтворюється в достатній вибірці, пункт має нормальну варіативність, правильно закодований, належить до одновимірної субшкали за теорією і водночас має слабке факторне навантаження, проблемний зміст або дивну поведінку категорій. Кілька незалежних сигналів створюють значно сильнішу підставу для редагування, ніж один cutoff.


Коли низька item-rest кореляція може мати змістовне пояснення


Пункт може вимірювати важливу рідкісну ознаку, охоплювати унікальну частину конструкта, бути навмисно дуже легким або дуже складним, працювати біля клінічно важливої межі або належати до іншої субшкали. Тоді його видалення може підвищити внутрішню однорідність і водночас звузити змістове охоплення. Саме тому статистичне «очищення» шкали має підпорядковуватися теорії вимірювання.


Міжпунктові кореляції (inter-item correlations): корисний сигнал, але не доказ одновимірності


Матриця міжпунктових кореляцій показує, які items рухаються разом. Дуже слабкі зв’язки можуть вказувати на іншу ознаку, шум або проблемний пункт. Дуже високі кореляції можуть означати змістову надлишковість: два формулювання майже дублюють одне одного й додають довжину без пропорційного приросту інформації.


Водночас висока внутрішня узгодженість не доводить, що шкала одновимірна. Clark і Watson радять не максимізувати внутрішню узгодженість ціною змістової вузькості. COSMIN також розрізняє structural validity та internal consistency як окремі психометричні властивості, для яких потрібні різні дизайни й статистичні аналізи.


«Альфа Кронбаха після вилучення завдання» (alpha if item deleted): чому це не алгоритм редагування


Стовпчик «альфа Кронбаха після вилучення завдання» (Cronbach’s alpha if item deleted) зручний як діагностичний сигнал: він показує, як зміниться alpha, якщо прибрати конкретний item у цій вибірці. Але видаляти пункт лише тому, що альфа Кронбаха трохи зростає, — слабка стратегія. Альфа Кронбаха залежить від кількості item і середньої кореляції між ними; скорочення або додавання пунктів змінює його математично, а високе значення може співіснувати з дублюванням змісту й багатовимірністю.


Тому «альфа Кронбаха зростає після вилучення» означає лише «цей item слабше вписується в поточний патерн коваріацій». Далі потрібно з’ясувати чому. Окремо про надійність психологічного тесту та про зв’язок довжини тесту з надійністю див. також формулу Спірмена—Брауна.


Дистракторний аналіз у завданнях з вибором відповіді


Для завдання з вибором відповіді недостатньо знати, скільки людей вибрали правильний варіант. Треба подивитися, хто і як вибирає кожен дистрактор. Корисний дистрактор має бути правдоподібним для частини респондентів, які ще не опанували потрібну ознаку або знання, але не повинен систематично приваблювати найсильніших учасників через двозначність чи помилковий ключ.


ITC наводить практично важливий приклад: дуже популярний дистрактор інколи виявляється фактично правильною відповіддю, тобто проблема лежить у ключі, а не в учасниках. NCME операційний аналіз завдань (operational item analysis) рекомендує розглядати не лише класичні статистики, а й графіки вибору дистракторів та крива характеристик завдання (item characteristic curve)s.


Дистрактор, який майже ніхто не обирає, може бути нефункціональним, але його не слід автоматично замінювати лише для досягнення певного відсотка вибору. Потрібно перевірити зміст, цільову складність, формулювання stem, правдоподібність альтернатив і те, чи відповідає завдання цільовий конструкт.


Категорії відповіді у шкалах Лайкерта й інших рейтингових форматах


Для політимічного item важливо перевірити частоти кожної категорії, пропуски, розподіл, середнє та дисперсію, а за відповідної моделі — порядок порогів. Якщо категорію майже не використовують, це може означати, що вона погано відрізняється від сусідньої, нечітко описана або просто рідко відповідає реальному рівню ознаки у цій вибірці.


Реверсивні формулювання потребують окремої уваги. Вони можуть зменшувати автоматичну згоду, але водночас створювати мовні труднощі та методні ефекти. Якщо після правильного перекодування реверсивний пункт і далі має негативні або аномально слабкі зв’язки, його слід перевірити змістово й структурно, а не «виправляти» ще одним механічним перетворенням.


Факторні докази: показники завдань не замінюють аналіз внутрішньої структури


Висока item-rest кореляція показує, що пункт рухається разом із рештою шкали, але не доводить, що всі items вимірюють один латентний конструкт. Дві сильно корельовані підшкали можуть створити високі item-total зв’язки навіть у багатовимірній структурі. Тому після первинного item analysis зазвичай перевіряють факторні навантаження, перехресні факторні навантаження (cross-loadings), локальну залежність і модель внутрішньої структури.


Це важливо для доказів валідності: item-level статистики допомагають оцінити функціонування пунктів, а докази внутрішньої структури відповідає на інше питання — чи узгоджується спосіб об’єднання item у score з передбачуваною структурою конструкта.


Класична теорія тестів та IRT: два рівні item analysis


У класичній теорії тестів difficulty, discrimination та item-rest correlation описують поведінку завдання відносно конкретної вибірки й конкретного total score. NCME підкреслює, що операційний аналіз завдань (operational item analysis) може виконуватися як у CTT, так і в IRT, але ці підходи відповідають на питання різними моделями.


У В IRT завдання описують через параметри та функції від латентної ознаки: розташування/складність, дискримінативність, іноді нижню асимптоту, інформаційну функцію завдання та fit. У моделі Раша дискримінативність зазвичай фіксується спільною для item, тоді як у 2PL вона оцінюється окремо. Такі параметри не можна механічно ототожнювати з p-value або corrected item-total correlation з CTT.


IRT не «скасовує» класичний аналіз. Навіть у сучасному калібруванні прості розподіли, пропуски, ключ, дистрактори й базові кореляції часто першими виявляють очевидні проблеми. Далі модельний аналіз уточнює, де на латентній шкалі item працює, скільки інформації дає і чи відповідає припущенням моделі.


Справедливість і DIF: хороший середній показник може приховувати групову проблему


Item може мати нормальну складність і високу дискримінативність у загальній вибірці та водночас поводитися по-різному в підгрупах. Саме для цього застосовують аналіз differential item functioning: порівнюють імовірність або патерн відповіді між групами за однакового рівня вимірюваної ознаки.


DIF є сигналом для подальшого аналізу, а не автоматичним доказом несправедливості. Потрібно перевірити зміст, мовні й культурні фактори, релевантність групового розрізнення та модель. Докладніше — у статті «Диференційне функціонування завдань (DIF)». Standards розглядають fairness як наскрізну вимогу до тестування, а ITC Guidelines for Translating and Adapting Tests вимагають доказів еквівалентності та придатності адаптованих версій.


Український переклад не дорівнює валідованій українській адаптації


Для української версії тесту item analysis має проводитися на релевантних українськомовних даних. Сам факт перекладу не переносить автоматично difficulty, discrimination, факторну структуру або норми з іншої мови. Всеукраїнська психодіагностична асоціація публікує українські переклади керівництв ITC з використання, аналізу, перекладу й адаптації тестів; ці стандарти підтримують вимогу перевіряти психометричні властивості в цільовій популяції.


IP/licensing і psychometric quality — окремі питання. Методика може бути легально ліцензована й водночас потребувати нових доказів для конкретного використання; навпаки, висока психометрична якість не дає права публікувати захищені items, ключі або secure scoring materials. Для енциклопедичного аналізу достатньо описувати принципи без відтворення захищених стимулів.


Вибірка: показники завдань завжди мають контекст


Показники завдання є оцінками, а не безпомилковими константами. У невеликій або вузькій вибірці difficulty, discrimination та correlations можуть бути нестабільними; звуження діапазону може штучно знижувати зв’язки. Якщо всі учасники мають дуже високий рівень ознаки, навіть хороший item може показати слабку дискримінативність просто через відсутність варіації.


ITC формулює це практично: item analysis доцільно виконувати, коли кількість учасників перевищує мінімум, який залежить від застосованої моделі, і повторювати після змін ключа або вилучення item. Універсального «N = ... достатньо для будь-якого item analysis» немає. Для високих ставок рішення особливо важливо перевіряти на незалежній або наступній вибірці.


Рішення про редагування: не одне порогове значення, а три рівні доказів


Практичне рішення найкраще будувати на трьох рівнях. Статистичний рівень показує, як item поводиться у даних. Змістовий рівень перевіряє, що саме він запитує і чи потрібен для охоплення конструкта. Модельний рівень оцінює, чи узгоджується пункт із факторною або IRT-структурою та чи однаково працює в релевантних групах. Сильне рішення виникає, коли ці рівні сходяться.


Сценарій 1: завдання дуже легке або дуже складне, але добре дискримінує


Таке завдання не слід автоматично вилучати. Воно може бути корисним на краю діапазону ознаки, підтримувати змістове покриття або бути важливим для конкретного рішення. Перевірте, чи його складність відповідає цільовій популяції й призначенню тесту.


Сценарій 2: середня складність, але слабка дискримінативність


Це привід перевірити формулювання, ключ, відповідність конструкту, можливі кілька правильних інтерпретацій, дистрактори, реверсивне кодування та належність до субшкали. Середня difficulty не компенсує відсутність змістовного зв’язку з вимірюваною ознакою.


Сценарій 3: негативна item-rest кореляція


Спочатку зупиніть автоматичне скоринг-рішення й перевірте техніку: ключ, напрямок балів, missing codes, версію тесту. Якщо все правильно, переходьте до змістового й структурного аналізу. Саме такий пункт може виявити неочевидну помилку раніше, ніж вона потрапить у висновки про людей.


Сценарій 4: вилучення завдання підвищує альфа Кронбаха


Перевірте, чи item справді суперечить шкалі, чи просто додає унікальний зміст. Якщо він важливий для змістове охоплення конструкта, невеликий приріст alpha не є достатньою підставою для вилучення. Після будь-якого скорочення перегляньте валідність змісту, а не лише новий коефіцієнт.


Сценарій 5: загальні показники добрі, але є DIF


Не маскуйте групову проблему середнім коефіцієнтом. Проведіть змістовий перегляд: чи групова різниця є релевантна конструкту, чи виникає через мову, культурний контекст, формат або іншу сторонню вимогу. DIF сам по собі ще не визначає bias, але ігнорувати його теж не можна.


Мінімальний робочий алгоритм аналізу завдань


Перший крок — зафіксувати цільовий конструкт, цільову популяцію, правило підрахунку балів і призначення score. Другий — перевірити дані, ключ, пропуски й реверсивне кодування. Третій — описати розподіл кожного item: частоти, середнє, дисперсію, ефекти підлоги й стелі або p для правильних відповідей. Четвертий — оцінити discrimination та corrected item-total/item-rest. П’ятий — розглянути inter-item зв’язки, дистрактори або категорії відповіді.


Шостий крок — зіставити показники завдань із доказами внутрішньої структури: factor loadings, перехресні факторні навантаження (cross-loadings), локальну залежність або відповідність IRT-моделі, якщо це передбачено моделлю. Сьомий — перевірити релевантні групи й fairness/DIF. Восьмий — провести змістову експертизу item, особливо якщо статистика сигналізує проблему. Дев’ятий — задокументувати рішення та його причину. Десятий — після редагування, зміни ключа або вилучення завдань повторити аналіз на новій або оновленій вибірці.


Умовний приклад: як читати кілька показників разом


Уявімо п’ять дихотомічних завдань у пілотному тесті здібності. Завдання A має p = 0,85 і item-rest r = 0,42: воно легке для цієї вибірки, але добре узгоджується з рештою шкали. Завдання B має p = 0,52 і r = 0,48: типово сильний центральний item. Завдання C має p = 0,38 і r = −0,12: це пріоритет для перевірки ключа, кодування і змісту. Завдання D має p = 0,51 і r = 0,14: середня складність не рятує слабку дискримінацію. Завдання E має p = 0,96 і r = 0,18: воно може бути занадто легким для цієї вибірки, але його доцільність залежить від функції в тесті.


Цей приклад навмисно не містить універсальних рішень «видалити/залишити» за цифрою. Для C, D і E потрібні різні запитання. C може бути технічно помилковим. D — концептуально чужим або двозначним. E — корисним базовим завданням, якщо тест має підтверджувати мінімальний рівень знань. Саме така диференціація і є сенсом аналізу завдань.


Що аналіз завдань не може довести


Висока discrimination не доводить валідність конструкта. Висока item-rest correlation не доводить одновимірність. Відсутність DIF у перевірених групах не доводить абсолютну fairness. Хороша difficulty не доводить клінічну корисність. Підвищення alpha після редагування не доводить, що тест став кращим. І жодна item statistic сама по собі не перетворює скринінговий бал на діагноз.


Для психологічного оцінювання score має сенс лише в межах intended use, популяції, норм, похибки вимірювання та доказів валідності. У клінічному контексті окремий item, сумарний бал або cutoff не встановлює діагноз без належної професійної оцінки.


Типові помилки інтерпретації


Найпоширеніша помилка — оптимізувати шкалу під максимальну внутрішню узгодженість. Друга — використовувати uncorrected item-total і не помічати part-whole inflation. Третя — називати p = 0,80 «складністю 80%» без пояснення, що це 80% правильних відповідей і фактично легкий item. Четверта — переносити один cutoff на всі типи тестів. П’ята — видаляти нестандартний пункт до змістового аналізу.


Ще одна помилка — робити відбір завдань на тій самій вибірці й трактувати отримані показники як остаточні. Редагування на основі випадкових особливостей конкретних даних може створити переадаптацію до конкретної вибірки (overfitting). Для відповідальних рішень потрібні повторна перевірка, нові дані або принаймні ясне розмежування exploratory та confirmatory етапів.


Що документувати в технічному звіті


Технічний звіт має дозволяти відтворити логіку рішення. Варто описати вибірку та intended population, версію тесту, правила кодування, правила роботи з пропущеними даними, розподіли відповідей на завдання, difficulty або endorsement, показники дискримінативності, спосіб обчислення corrected item-total/item-rest, дистракторний або аналіз категорій відповіді, структурні моделі, DIF/fairness перевірки, усі зміни item і повторний аналіз після змін.


Принцип тут простий: читач має бачити не лише фінальний список пунктів, а й підстави, через які вони залишилися. Саме така прозорість відповідає логіці AERA/APA/NCME Standards та професійних рекомендацій ITC.


FAQ


Яке значення складності завдання є хорошим?


Універсального значення немає. Для дихотомічного item p показує частку правильних відповідей у конкретній вибірці. Потрібний діапазон залежить від мети тесту, цільової популяції, діапазону здібності й того, де тест має бути найбільш інформативним.


Чи треба видаляти item, якщо corrected item-total нижче 0,30?


Ні. Значення близько 0,30 часто використовують як евристичний сигнал, але воно не є універсальним нормативом. Перевірте зміст, конструктивну роль, варіативність, вибірку, факторну структуру й інші item statistics.


Чим item-total відрізняється від item-rest?


У звичайному item-total item може входити до total score, тому кореляція частково завищується через самоперекриття. Item-rest, або corrected item-total, виключає аналізований item із сумарного бала й краще показує його зв’язок із рештою шкали.


Чому item може мати негативну дискримінативність?


Типові причини — неправильний ключ, неперекодований реверсивний пункт, двозначність, кілька правдоподібних правильних відповідей, невідповідність субшкалі, дуже мала або специфічна вибірка, multidimensionality або групова неоднорідність. Потрібна перевірка причини, а не автоматичне видалення.


Чи можна оцінити якість item лише за Cronbach’s alpha?


Ні. Alpha є показником внутрішньої узгодженості total score за певних умов, а не універсальною оцінкою якості кожного пункту. Він не замінює аналіз difficulty, discrimination, item-rest, factor structure, validity evidence та fairness.


Скільки учасників потрібно для item analysis?


Одного універсального мінімуму немає. Потреба залежить від моделі, типу item, кількості параметрів, розподілу відповідей і мети рішення. Для складніших IRT- або DIF-моделей зазвичай потрібні суттєво більші й репрезентативніші вибірки, ніж для первинного описового пілоту.


Чи є аналіз завдань доказом валідності тесту?


Він є частиною доказової картини, але не замінює змістову валідність, аналіз внутрішньої структури, зв’язки з іншими змінними, процес відповіді та оцінку наслідків використання. Валідність стосується обґрунтованості інтерпретації й використання score, а не одного коефіцієнта item.


Пов’язані статті










Складність завдання в психометрії: що означає item difficulty у тестах здібностей і досягнень — окрема сторінка про P-value у CTT, параметр b у Rasch/IRT, залежність від вибірки та типові помилки інтерпретації.



Джерела


American Educational Research Association, American Psychological Association, & National Council on Measurement in Education. (2014). Standards for Educational and Psychological Testing.


Clark, L. A., & Watson, D. (2019). Constructing validity: New developments in creating objective measuring instruments. Psychological Assessment, 31(12), 1412–1427.



Henrysson, S. (1963). Correction of Item-Total Correlations in Item Analysis. Psychometrika, 28(2), 211–218.




National Council on Measurement in Education. Module 8: Foundations of Operational Item Analysis.


Stefana, A., Damiani, S., Granziol, U., Provenzani, U., Solmi, M., & Youngstrom, E. A. (2025). Psychological, psychiatric, and behavioral sciences measurement scales: best practice guidelines for their development and validation. Frontiers in Psychology, 15, 1494261.


Sweeney, S. M., Sinharay, S., Johnson, M. S., & Steinhauer, E. W. (2022). An Investigation of the Nature and Consequence of the Relationship between IRT Difficulty and Discrimination. Educational Measurement: Issues and Practice, 41(4), 50–67.


Всеукраїнська психодіагностична асоціація. Єдині психодіагностичні стандарти.


Zijlmans, E. A. O., Tijmstra, J., van der Ark, L. A., & Sijtsma, K. (2018). Item-Score Reliability in Empirical-Data Sets and Its Relationship With Other Item Indices. Educational and Psychological Measurement, 78(6), 998–1020.

 
 
bottom of page