top of page

Психологічна енкциклопедія

Написання тестових завдань: як формулювати items без двозначності, навідних відповідей і зайвого шуму

6 днів тому
Читати 16 хв

Автор: Український психологічний ХАБ · Опубліковано: 23 вересня 2026 · Редакційна політика


Тестове завдання — це не просто вдало написане запитання. У психометрії item є спроєктованою одиницею вимірювання: він має викликати відповідь, яка дає інформацію про визначений психологічний конструкт або здатність, і водночас не додавати зайвої складності, підказок, мовного шуму чи сторонніх вимог. Саме тому якість формулювання входить до логіки психометричного вимірювання, а не до косметичного редагування тексту.


Сучасні Standards for Educational and Psychological Testing вимагають документувати процедури розроблення, перегляду, апробації та відбору завдань, а також залучати кваліфікованих рецензентів, коли потрібно оцінити зміст, ясність, відповідність специфікації та можливі джерела нерелевантної до конструкта складності. Огляди розроблення психологічних шкал так само ставлять генерацію завдань і перевірку змістової валідності на початок усього ланцюга вимірювання.


У цій статті всі приклади створені спеціально для пояснення принципів. Вони не є завданнями реальних клінічних, освітніх чи професійних тестів, не відтворюють захищені банк завданьs і не містять ключів до ліцензованих методик.


Що таке item у психологічному тесті


Item — технічний англомовний термін для окремої одиниці тесту або шкали. Українською залежно від формату природно вживати «тестове завдання», «пункт шкали», «твердження», «запитання» або «стимул». Item не обов’язково має форму запитання. У самооцінювальній шкалі це може бути твердження з категоріями відповіді, у тесті здібностей — задача з однією найкращою відповіддю, у ситуаційному тесті — короткий сценарій, а в практичному оцінюванні — інструкція до дії.


Ключова ознака item полягає не в граматичній формі, а у функції: він повинен створити спостережувану відповідь, яку можна інтерпретувати відповідно до моделі вимірювання. Тому формулювання item завжди підпорядковане конструкту, цільовій популяції, способу підрахунку бала й заплановане використання.


Це важливо і для психологічного тестування: один і той самий текст може бути прийнятним для дослідницької шкали дорослих, але неприйнятним для скринінгу підлітків, кроскультурного порівняння або тесту, де швидкість читання не повинна впливати на результат.


Науковий статус правил написання завдань


У item writing є правила різної сили. Частина спирається на авторитетні стандарти, теорію вимірювання та багаторічну практику розроблення тестів. Частина підтверджена емпіричними дослідженнями конкретних типів item. Частина працює як редакційна евристика: корисне правило за замовчуванням, яке треба перевіряти в конкретному інструменті, а не перетворювати на універсальний закон.


Boateng та співавтори описують розроблення шкали як послідовність від визначення домену й генерації великого початкового набору пунктів до перевірки змісту, попереднього тестування, item reduction, факторної структури та оцінювання психометричних властивостей. Сучасний огляд найкращих практик так само підкреслює, що якість шкали починається до статистичного аналізу — з чіткого конструкта, специфікації та продуманого пулу пунктів.


Емпіричні дослідження item-writing flaws показують, що формальні «порушення правил» не завжди мають однаковий ефект у кожному тесті. Наприклад, у дослідженні Pham, Besanko і Devitt окремі недоліки завдань множинного вибору змінювали показники складності або результати, але вплив був неоднорідним і непередбачуваним. Це не робить правила зайвими; навпаки, воно показує, чому item потрібно не лише редагувати, а й емпірично перевіряти.


Отже, надійна позиція така: правила формулювання зменшують передбачувані джерела шуму, але остаточна якість item встановлюється через поєднання змістового обґрунтування, перевірки зрозумілості цільовою групою, пілотування та психометричного аналізу.


До формулювання: спочатку визначте, що саме має вимірювати item


Найчастіша концептуальна помилка виникає ще до першого речення. Автор починає «вигадувати запитання», не встановивши межі конструкта. У результаті пул швидко наповнюється пунктами, які звучать правдоподібно, але вимірюють суміш рис, ситуацій, соціальних норм і мовних навичок.


Перед item writing потрібна робоча специфікація: назва конструкта, його визначення, домени або фасети, цільова група, контекст використання, бажаний тип відповіді та логіка інтерпретації. Для шкали самозвіту окремо визначають часовий горизонт, ситуаційний контекст і те, чи оцінюється частота, інтенсивність, типовість, згода або інша характеристика.


Цей етап безпосередньо пов’язаний зі змістовою валідністю. За рамкою COSMIN змістова валідність охоплює релевантність, повноту й зрозумілість змісту інструмента. Вдале речення може бути нерелевантним конструкту; набір дуже ясних пунктів може залишити цілу важливу фасету невиміряною.


COSMIN рекомендує оцінювати зміст не лише експертами, а й з погляду представників цільової популяції. Це особливо важливо для клінічних і patient-reported measures: те, що професіоналу здається однозначним, може мати інше значення для людини, яка реально відповідатиме.


Практичний наслідок простий: item не починається зі слова. Item починається з рішення, яку саме інформацію про конструкт ця одиниця повинна дати.


Один item — одна основна думка


Подвійне, або подвійне, формулювання об’єднує дві різні ознаки в одну відповідь. Наприклад: «Я легко зосереджуюся і завжди завершую справи вчасно». Людина може легко концентруватися, але систематично запізнюватися з дедлайнами. Одна категорія відповіді не покаже, на яку частину твердження вона реагувала.


Якщо обидві ознаки справді потрібні, їх краще розвести: «Мені легко утримувати увагу на одному завданні» і «Я завершую заплановані справи у встановлений термін». Після такого розділення ще треба перевірити, чи обидва пункти належать до того самого конструкта; граматичне виправлення саме по собі не вирішує питання валідності.


Подвійність буває прихованою. Конструкції «спокійний і впевнений», «організований та уважний», «часто хвилююся і погано сплю» теж можуть вимагати двох незалежних суджень. Редактор має запитати: чи можна чесно відповісти «так» на одну частину і «ні» на іншу? Якщо можна, item, імовірно, містить більше однієї цілі.


Однозначний референт: хто, де, коли і про що


Слова «це», «так», «такі ситуації», «останнім часом», «регулярно», «зазвичай» або «у складних умовах» можуть бути зрозумілими автору й невизначеними для респондента. Хороший item робить референт настільки конкретним, наскільки цього потребує конструкт, але не перевантажує текст деталями, які не мають вимірювальної функції.


Наприклад, «Останнім часом мені важко зосередитися» залишає відкритим часовий інтервал. Формулювання «Протягом останніх 7 днів мені було важко зосереджуватися на повсякденних справах» задає рамку чіткіше. Проте сім днів — не універсальний стандарт: потрібний період визначається змістом конструкта, клінічним або дослідницьким завданням і доказами для конкретного інструмента.


Така сама логіка стосується контексту. Якщо тест вимірює поведінку на роботі, слово «зазвичай» без вказівки контексту може змішати робочі та позаробочі ситуації. Якщо вимірюється загальна риса, надто вузький контекст, навпаки, може необґрунтовано звузити зміст.


Уникайте прихованих передумов


Item може непомітно вимагати досвіду, якого частина цільової групи не має. «Коли я сперечаюся з колегами, я швидко заспокоююся» передбачає, що людина працює, має колег і вступає з ними в конфлікти. Відповідь може відображати не регуляцію емоцій, а неможливість застосувати твердження до себе.


Передумови треба або прибрати, або обробити дизайном: фільтрувальним запитанням, категорією «не стосується», розгалуженням, іншим формулюванням чи зміною цільової популяції. Який варіант правильний, залежить від заплановане використання; універсальної кнопки «N/A» для будь-якої шкали немає.


Когнітивні інтерв’ю корисні саме тому, що виявляють такі проблеми до великого пілоту: неоднозначні слова, подвійні питання, складні заперечення та приховані передумови можуть бути невидимими для авторської команди, але очевидними в процесі реальної відповіді.


Не підказуйте соціально бажану або «правильну» відповідь


Навідне формулювання сигналізує, яку відповідь очікує автор. «Відповідальні люди завжди виконують обіцянки. Наскільки це схоже на вас?» уже містить оцінку бажаності. Так само слова «розумний», «здоровий», «правильний», «відповідальний» або «звичайно» можуть створювати нормативний тиск, якщо саме цей тиск не є предметом вимірювання.


У самооцінювальних шкалах повністю усунути соціальну бажаність неможливо, але item не повинен додавати її зайво. Нейтральна граматика, збалансовані категорії відповіді, конфіденційна процедура та ясне пояснення мети зменшують частину такого шуму.


У тестах знань або здібностей «навідність» має іншу форму: граматичні підказки, незвично довга правильна відповідь, повтор ключового слова зі stem лише в одному варіанті або абсурдні дистрактори можуть дозволити вгадати відповідь без тієї здатності, яку мав вимірювати тест.


Абсолютні слова: «завжди», «ніколи», «повністю»


Абсолютні слова часто роблять item занадто легким для заперечення. Людина, яка майже завжди поводиться певним чином, може не погодитися з «я завжди…» через один виняток. Тоді бал відображає буквальність формулювання, а не рівень конструкта.


Проте забороняти «завжди» й «ніколи» автоматично теж неправильно. Якщо саме екстремальність, відсутність винятків або категорична позиція є теоретично важливою, абсолютний квантор може бути змістовно виправданим. Правило тут не «не використовувати», а «використовувати лише тоді, коли абсолютність є частиною конструкта».


Заперечення й reverse-keyed items


Негативно сформульовані та reverse-keyed items історично часто використовували, щоб стримувати механічну згоду з усіма твердженнями. Проблема в тому, що граматичне розвертання не гарантує психометричної симетрії. Заперечення може підвищити когнітивне навантаження, створити окремий wording factor або працювати по-різному в різних групах.


Sliter і Zickar у дослідженні з використанням item response theory показали, що негативно сформульовані особистісні пункти можуть мати нижчу дискримінативність і не бути психометрично взаємозамінними з позитивними. Інші дослідження показують, що величина wording effects залежить від шкали, популяції та способу формулювання. Тому reverse wording слід розглядати як дизайнерське рішення, яке потребує перевірки, а не як обов’язкову ознаку «правильної» шкали.


Особливо небезпечне подвійне заперечення: «Я не вважаю, що мені не складно…». Якщо потрібен протилежний зміст, частіше краще сформулювати природний семантичний антонім без логічного лабіринту, а потім перевірити, чи справді він працює як протилежний індикатор у цільовій групі.


Мовна складність не повинна підміняти вимірюваний конструкт


Коли тест вимірює тривожність, імпульсивність, мотивацію або іншу психологічну характеристику, складний синтаксис може додати до бала ще й навичку читання. Якщо читання не входить до конструкта, це construct-irrelevant variance — результат починає залежати від того, чого тест не мав вимірювати.


Практичне правило: коротке речення, знайомі слова, мінімум професійного жаргону, одна логічна операція за раз. Це не означає примітивізувати мову. Текст має відповідати реальній мовній компетентності цільової популяції й зберігати потрібну точність.


Для дітей, людей із різною освітою, нейророзбіжних груп, людей з когнітивними чи сенсорними обмеженнями та багатомовних вибірок доступність формулювання стає частиною справедливості психологічного тестування. Якщо складність мови систематично створює перевагу одній групі, це вже питання вимірювання, а не лише стилістики.


Ясність української мови: пишіть для української цільової групи, а не для кальки


Український item має звучати як природне українське висловлювання. Буквальний переклад з англійської може зберегти словник і втратити прагматику: незвичний порядок слів, кальковані дієслівні конструкції, неприродні ступені інтенсивності або культурно чужі приклади змінюють спосіб, у який людина розуміє пункт.


Саме тому переклад не дорівнює валідованій культурній адаптації. Для адаптованого інструмента потрібна окрема перевірка змістової й мовної еквівалентності, зрозумілості, структури, надійності, валідності, а за потреби — інваріантності та DIF. Наявність українського тексту сама по собі нічого цього не доводить.


Якщо шкала створюється українською від початку, це дає важливу перевагу: можна будувати item з природного мовного досвіду цільової групи, а не з боротьби з калькою. Але й такий item усе одно потребує когнітивного попереднього тестування та емпіричної перевірки.


Варіанти відповіді мають продовжувати логіку item


Навіть ідеально сформульоване твердження може зламатися на варіанти відповіді. Якщо stem питає про частоту, категорії повинні кодувати частоту; якщо про інтенсивність — інтенсивність. Не варто змішувати в одній шкалі «ніколи — завжди», «зовсім не згоден — повністю згоден» і «дуже слабко — дуже сильно», якщо це не обґрунтовано моделлю.


Для категоріальних відповідей варіанти мають бути взаємовиключними настільки, наскільки це можливо, і разом покривати релевантний діапазон. Межі «1–3 рази», «3–5 разів» перетинаються в точці 3; категорія «інше» без пояснення може приховати систематичну проблему класифікації.


У шкалах з категоріями згоди або частоти треба окремо перевіряти, чи однаково респонденти розуміють словесні позначки категорій. Шкала Лайкерта — це не просто набір від 1 до 5: зміст item і зміст категорій відповіді разом утворюють вимірювальну процедуру.


Завдання множинного вибору: правильність без тестових хитрощів


У завданнях знань і здібностей центральна проблема має бути сформульована в stem настільки повно, щоб респондент розумів, що саме треба вирішити до перегляду варіантів. Варіанти відповіді мають бути граматично сумісними зі stem і належати до одного логічного класу.


Дистрактор повинен бути правдоподібним для людини, яка не володіє потрібним знанням або робить характерну помилку. Абсурдні дистрактори не додають вимірювальної інформації; вони лише зменшують фактичну кількість конкурентних варіантів. Так само небажані технічні підказки: правильна відповідь помітно довша, стилістично точніша або містить слово зі stem, якого немає в інших варіантах.


Дослідження item-writing flaws у оцінюванні з множинним вибором показує, що такі дефекти можуть непередбачувано змінювати складність і результативність. Дані з освітніх і медичних тестів не можна механічно переносити на самооцінювальні психологічні шкали, але загальний принцип релевантний: відповідь має залежати від цільової здатності, а не від тестової кмітливості.


Відкриті відповіді й практичні завдання


Відкрите завдання потребує такої самої точності, як завдання з готовими варіантами відповіді. Респондент має знати, яку дію виконати, який обсяг або формат очікується і що вважатиметься релевантною відповіддю. Якщо критерії оцінювання приховані або нечіткі, частина варіативності виникатиме з припущень про правила, а не з цільової здатності.


Довгий сценарій або vignette не є помилкою сам по собі. Він виправданий, коли контекст є частиною задачі та створює потрібну когнітивну вимогу. Зайвим шумом стають деталі, які не потрібні для рішення, але збільшують читання, пам’яттєве навантаження або культурну специфічність.


Що таке «зайвий шум» у item


Семантичний шум виникає, коли ключове слово має кілька правдоподібних значень. Лінгвістичний шум — коли складний синтаксис, незвичне заперечення або професійний жаргон додають вимоги до мови. Контекстуальний шум — коли відповідь залежить від досвіду певної професії, регіону чи культурної практики, хоча цього не передбачає конструкт.


Форматний шум з’являється в невдалих категоріях відповіді, випадковому чергуванні шкал, неочевидних інструкціях або візуальній неоднозначності. Адміністративний шум виникає, коли одна й та сама методика подається з різними інструкціями, часом, підказками або порядком дій. Тут item writing стикається зі стандартизацією психологічного тесту.


Мета не в тому, щоб зробити item максимально простим. Мета — залишити тільки ту складність, яка належить до конструкта або задачі вимірювання.


Експертний перегляд: що саме мають перевіряти рецензенти


Експертний перегляд має бути структурованим. Корисно окремо оцінювати відповідність item визначеній фасеті, ясність мови, однозначність, відповідність віку й контексту, відсутність сторонніх вимог, узгодженість з шкалою відповідей та можливі ризики для справедливості. Просте запитання експерту «цей пункт хороший?» дає мало інформації для рішення.


Standards AERA/APA/NCME рекомендують професійний перегляд специфікацій та матеріалів тесту, а за потреби — участь фахівців, які представляють релевантні популяції. Важливо фіксувати не лише фінальний текст, а й причини суттєвих змін, відхилені варіанти та критерії відбору.


Експертна згода не є фінальним доказом. Експерти можуть однаково не помітити проблему, яка з’являється лише в реальних респондентів. Тому експертна перевірка змісту і когнітивне попереднє тестування виконують різні функції й доповнюють одне одного.


Когнітивне попереднє тестування: як перевірити, що респондент читає той item, який ви написали


Когнітивне інтерв’ю досліджує процес відповіді: як людина зрозуміла запитання, яку інформацію згадала, як сформувала судження і як зіставила його з варіантами відповіді. Мета тут не оцінити людину, а перевірити інструмент.


Корисні нейтральні probes: «Що для вас означає це слово?», «Про який період ви думали?», «Як ви обрали між цими двома варіантами?», «Чи була частина формулювання, яку довелося перечитати?». Такі питання показують зсув значення, приховані припущення й розрив між задумом автора та реальною процес відповіді.


Дослідження Silva та співавторів демонструє практичну цінність cognitive interviewing для виявлення подвійні формулювання, double negatives, неоднозначних термінів і приховані передумови. Для психометричного процесу це міст між редакційним переглядом і великим пілотним дослідженням.


Пілотування й аналіз завдань: ясність треба перевіряти даними


Після якісного етапу потрібна емпірична перевірка. Item, який усім експертам здавався ідеальним, може мати слабку варіативність, надто високий ceiling/floor, несподівану факторну поведінку, низьку дискримінативність або різну роботу в підгрупах.


Аналіз завдань тесту розглядає item після збору даних: складність або частоту вибору відповіді, discrimination, item-total relations, функціонування категорій, модельну відповідність та рішення про збереження, редагування або вилучення. Item writing і item analysis — послідовні, але не взаємозамінні етапи.


Не слід оптимізувати текст лише заради статистичного показника. Висока item-total correlation не рятує пункт, який виходить за межі конструкта; підвищення alpha після видалення змістовно важливого пункту може звузити змістове охоплення. Статистичний результат завжди читають разом із теорією та заплановане використання.


Справедливість, DIF і культурна придатність


Справедливість починається ще на етапі формулювання. Культурно специфічні приклади, неочевидні ідіоми, професійний жаргон, вимоги до цифрового досвіду або різний доступ до ситуацій можуть створювати групові відмінності, не пов’язані з цільовим конструктом.


Після пілотування такі ризики можна досліджувати, зокрема, через диференційне функціонування завдань (DIF). DIF означає, що за однакового рівня латентного конструкта групи мають різну ймовірність певної відповіді на item. Сам по собі DIF ще не доводить несправедливість: він є сигналом для змістового й методологічного розслідування.


Так само measurement invariance не є автоматичною гарантією повної відсутності bias. Fairness охоплює ширшу систему: конструкт, доступність, administration, interpretation, наслідки використання й відповідність норм або cutoffs саме тій популяції, для якої роблять висновок.


Захищені тестові матеріали й авторське право


Якість психометрії та юридичний статус матеріалу — різні питання. Відкрита публікація валідного тесту може порушувати ліцензію або знищувати тестову безпеку; ліцензований інструмент, своєю чергою, не стає психометрично якісним лише через наявність правовласника.


APA визначає test security як захист тестових матеріалів і пов’язаної інформації від несанкціонованого розкриття та використання, оскільки витік може підірвати цілісність інтерпретації результатів. Тому енциклопедична стаття може пояснювати принципи item writing без відтворення захищені завдання, ключів, таблиці підрахунку балів або закритих стимулів.


Якщо потрібен приклад, безпечніше створити новий нейтральний item для пояснення правила або використати матеріал із чітко дозволеною відкритою ліцензією. Публікація «справжнього питання з тесту» заради наочності не є необхідною умовою якісної освіти.


Чи може штучний інтелект писати тестові завдання


Генеративний ШІ вже може швидко створювати варіанти формулювань, перефразування, дистрактори та великі початкові item pools. Дослідження Götz та співавторів показало можливість автоматизованої генерації особистісних пунктів у конкретному дослідницькому дизайні, а AI-GENIE у 2026 році продемонстрував перспективний pipeline генерації й відбору item на великих вибірках.


Це emerging evidence, а не універсальна гарантія якості. Модель може створити граматично бездоганний пункт із хибною змістовою межею, прихованою культурною передумовою, дублюванням інших item або занадто прозорою бажаною відповіддю. Якісна генерація тексту не замінює construct definition, content validity, перевірку цільовою групою, pilot testing і психометричну валідацію.


Рекомендації APA щодо відповідального використання AI в assessment наголошують на валідності, надійності, fairness, прозорості та людському нагляді. Для item writing це означає: ШІ може бути інструментом генерації кандидатів і редакційного аудиту, але рішення про включення item до тесту має спиратися на задокументований вимірювальний процес.


Окрема вимога — безпека даних. Закритий банк завдань не слід передавати сторонній AI-системі без дозволу, договору й зрозумілих правил щодо збереження та використання даних. Тестова безпека не зникає через те, що матеріал обробляє алгоритм.


Робочий процес написання item: від специфікації до фінальної версії


1. Зафіксуйте конструкт і фасету


Для кожного item має бути зрозуміло, яку частину конструкта він представляє. Якщо item неможливо прив’язати до домену або специфікації, його наявність у тесті потребує окремого обґрунтування.


2. Створіть пул більший за фінальну шкалу


Початковий пул має давати простір для видалення слабких, дубльованих або проблемних пунктів. У літературі трапляються евристики на кшталт створення кількох кандидатів на кожен майбутній item, але фіксованого універсального співвідношення немає: воно залежить від конструкта, моделі, довжини фінального тесту й ресурсів.


3. Відредагуйте на однозначність


Перевірте одну думку, референт, часову рамку, приховані передумови, заперечення, абсолютні слова, соціально бажані підказки, довжину, термінологію та відповідність варіанти відповіді. На цьому етапі корисний незалежний мовний редактор, який не бачив первинного задуму.


4. Проведіть експертний експертна перевірка змісту


Експерти оцінюють не тільки стиль, а й те, чи потрібен item у домені, чи не дублює він інший зміст, чи охоплює специфікацію та чи не створює construct-irrelevant demands.


5. Проведіть когнітивне попереднє тестування із представниками цільової групи


Перевірте, як люди реально тлумачать слова, часові межі, категорії відповіді та інструкцію. Якщо різні респонденти систематично читають item по-різному, це проблема вимірювання навіть тоді, коли текст граматично правильний.


6. Перепишіть і задокументуйте зміни


Зберігайте версії. Для важливих item варто фіксувати причину зміни: неоднозначність, культурна специфічність, ceiling effect у pretest, невдала зіставленням відповіді з категоріями або експертне зауваження. Така історія допомагає відрізняти обґрунтовану еволюцію інструмента від випадкового переписування.


7. Пілотуйте в релевантній вибірці


Пілот повинен бути достатнім для тих аналізів, які плануються далі. Вибірка, що зручна для редакційного pretest, не автоматично підходить для факторного аналізу, IRT, DIF або побудови норм.


8. Аналізуйте item і структуру тесту


Оцінюйте дані відповідно до моделі: розподіли відповідей, дискримінативність завдання, функціонування категорій, локальну залежність, факторні навантаження, відповідність моделі та інші релевантні показники. Набір метрик залежить від типу інструмента; жоден коефіцієнт не є універсальним паспортом якості.


9. Перевіряйте надійність, валідність, fairness і інтерпретацію


Item є частиною системи доказів. Фінальний інструмент потребує даних про надійність, похибку вимірювання, validity evidence, норми або критерії, fairness, мовну й культурну адаптацію та заплановане використання настільки, наскільки це релевантно для конкретного тесту.


10. Захищайте фінальний банк завдань


Для secure assessments потрібні правила доступу, версіонування, архівування, експозиції item і реагування на витік. Відбір якісних завдань завершує розроблення змісту, але відкриває окрему задачу підтримання цілісності тесту.


Швидкий редакційний аудит одного item


Перед включенням кандидата до pretest корисно пройти короткий набір запитань: чи вимірює item одну визначену змістову ціль; чи може респондент зрозуміти всі ключові слова однаково; чи чітко задані час і контекст; чи немає прихованої передумови; чи відповідь не підказується граматикою або соціально бажаною оцінкою; чи немає подвійного заперечення; чи складність мови належить до конструкта; чи варіанти відповіді відповідають stem; чи item придатний для цільової групи; чи потрібен він для coverage; чи можна пояснити правила scoring; чи не розкриває він захищений матеріал.


Такий аудит не замінює дослідження. Його функція — відсіяти передбачувані дефекти до того, як вони стануть дорогими даними.


Типові помилки інтерпретації якості item


«Респондентам усе зрозуміло, отже item валідний». Зрозумілість підтримує процес відповіді і content validity, але не доводить construct validity або придатність бала для заплановане використання.


«Item має високу кореляцію з сумарним балом, отже його треба залишити». Висока association може виникати через redundancy; item може погіршувати змістову повноту або створювати bias. Статистика не скасовує експертна перевірка змісту.


«Reverse item автоматично захищає від acquiescence». Він може зменшити певний response style, а може створити wording effect і помилки розуміння. Потрібна емпірична перевірка.


«Якщо item перекладено професійним перекладачем, він еквівалентний оригіналу». Переклад — лише частина адаптації; еквівалентність потребує доказів у цільовій мові й культурі.


«Якщо AI згенерував сотню кандидатів, проблема item pool вирішена». Кількість не замінює доменного покриття, незалежного review, когнітивне попереднє тестування і валідації.


Практичні наслідки для клінічних і дослідницьких інструментів


У клінічних шкалах погане формулювання особливо небезпечне, бо score може впливати на triage, подальше assessment, моніторинг або рішення про додаткову допомогу. Окремий пункт або cutoff не встановлює діагноз. Screening, виявлення ймовірних випадків, assessment, diagnosis і вимірювання результатів мають різні задачі й різні вимоги до evidence.


У дослідженнях item ambiguity збільшує похибку вимірювання і може послаблювати або спотворювати зв’язки між змінними. У великих вибірках статистично значущим може стати навіть дуже малий ефект поганого measurement model; велике N не виправляє слабке визначення конструкта.


У кроскультурних дослідженнях формулювання, що працює в одній мові, може змінити процес відповіді в іншій. Саме тому adaptation, invariance і DIF варто планувати до збору фінальних даних, а не додавати як косметичний перевірку після збору даних.


FAQ


Чи кожен item має бути запитанням?


Ні. Item може бути твердженням, задачею, сценарієм, стимулом, інструкцією або іншою одиницею, що викликає оцінювану відповідь. Формат визначається конструктом і моделлю тесту.


Чи існує оптимальна довжина тестового завдання?


Універсальної кількості слів немає. Item має бути настільки коротким, наскільки це дозволяє точність, і настільки довгим, наскільки цього потребує зміст. Критерій — відсутність зайвого навантаження читання та збереження потрібного контексту.


Чи завжди треба уникати слів «завжди» і «ніколи»?


Ні. Вони проблемні, коли випадково роблять твердження надто екстремальним. Якщо абсолютність є частиною теоретичного змісту, такі слова можуть бути виправдані.


Чи потрібні reverse-keyed items у кожній шкалі?


Ні. Reverse wording може бути корисним у певному дизайні, але здатне створювати method effects і проблеми розуміння. Рішення треба перевіряти когнітивне попереднє тестування і психометричними даними.


Чи достатньо експертної оцінки для якісного item?


Ні. Експертний review потрібен для змісту й специфікації, але target-population pretesting і емпіричний pilot відповідають на інші питання: як item реально розуміють і як він працює в даних.


Чим item writing відрізняється від item analysis?


Item writing створює й редагує кандидата до та під час pretest. Item analysis оцінює поведінку завдання після збору відповідей. Якісний процес поєднує обидва етапи й дозволяє повернутися до тексту після даних.


Чи може ШІ самостійно створити валідний психологічний тест?


ШІ може допомагати з генерацією кандидатів, перефразуванням і пошуком можливих дефектів. Валідний інструмент потребує незалежного специфікацію конструкта, експертна перевірка змісту, участі цільової групи, пілотування та психометричних доказів. Сам факт генерації моделлю нічого цього не забезпечує.


Чи можна публікувати реальні завдання з відомих тестів як приклади?


Лише якщо це дозволено правами, ліцензією та правилами test security. Для закритих або secure instruments відтворення item, ключів чи матеріали для підрахунку балів може зашкодити валідності використання й порушити умови доступу. Для навчальної статті достатньо оригінальних прикладів.


Чи добре сформульований item гарантує валідність тесту?


Ні. Ясність item є необхідною частиною якісного вимірювання, але валідність стосується ширшого аргументу: чи підтримують теорія й дані інтерпретації тестових балів для запропонованого використання.


Пов’язані статті


Розробка психологічного тесту — повний процес від визначення конструкта й специфікації до пілотування, валідності, норм та інтерпретації.



Змістова валідність — як перевіряють релевантність, повноту й зрозумілість завдань.


Аналіз завдань тесту — що роблять із item після пілотного збору даних.


Шкала Лайкерта — як працюють категорії відповіді та чому один Likert-item не дорівнює шкалі.


Справедливість психологічного тестування — bias, доступність і межі групових порівнянь.


Диференційне функціонування завдань (DIF) — як item може працювати по-різному в групах за однакового рівня конструкта.


Адаптація і переклад психологічних тестів — чому переклад не є доказом валідованої української версії.


Стандартизація психологічного тесту — як єдина процедура, інструкції та умови проведення підтримують порівнюваність.


Джерела


American Educational Research Association, American Psychological Association, & National Council on Measurement in Education. (2014). Standards for Educational and Psychological Testing.


American Psychological Association. (2026). Responsible Use of Artificial Intelligence in Assessment.


American Psychological Association. (2026). Test Security in the Age of Technology: Frequently Asked Questions.


Boateng, G. O., Neilands, T. B., Frongillo, E. A., Melgar-Quiñonez, H. R., & Young, S. L. (2018). Best Practices for Developing and Validating Scales for Health, Social, and Behavioral Research: A Primer. Frontiers in Public Health, 6, 149.


Götz, F. M., Maertens, R., Loomba, S., & van der Linden, S. (2024). Let the algorithm speak: How to use neural networks for automatic item generation in psychological scale development. Psychological Methods, 29(3), 494–518.


Morgado, F. F. R., Meireles, J. F. F., Neves, C. M., Amaral, A. C. S., & Ferreira, M. E. C. (2017). Scale development: ten main limitations and recommendations to improve future research practices. Psicologia: Reflexão e Crítica, 30, 3.



Russell-Lasalandra, L. L., Christensen, A. P., & Golino, H. (2026). Generative psychometrics via AI-GENIE: Automatic item generation and validation with network-integrated evaluation. Behavior Research Methods, 58(8), 217.


Silva, J. R., Fera, B., Sudula, S., Koetzle, D., & Schwalbe, C. (2019). Cognitive Interviewing to Improve Questionnaires for Justice-Involved Youth. International Journal of Offender Therapy and Comparative Criminology, 63(10).


Sliter, K. A., & Zickar, M. J. (2014). An IRT Examination of the Psychometric Functioning of Negatively Worded Personality Items. Educational and Psychological Measurement, 74(2).


Stefana, A., Damiani, S., Granziol, U., Provenzani, U., Solmi, M., Youngstrom, E. A., & Fusar-Poli, P. (2025). Psychological assessment: a review of best practice guidelines for scale development. Frontiers in Psychology, 15, 1494261.


Terwee, C. B., Prinsen, C. A. C., Chiarotto, A., Westerman, M. J., Patrick, D. L., Alonso, J., Bouter, L. M., de Vet, H. C. W., & Mokkink, L. B. (2018). COSMIN methodology for evaluating the content validity of patient-reported outcome measures: a Delphi study. Quality of Life Research, 27, 1159–1170.

bottom of page