Комп’ютеризоване адаптивне тестування: як алгоритм добирає наступне завдання за попередніми відповідями
Автор: Український психологічний ХАБ · Опубліковано: 23 вересня 2026 · Редакційна політика
Комп’ютеризоване адаптивне тестування (Computerized Adaptive Testing, CAT) — це спосіб тестування, за якого комп’ютер не показує всім людям один і той самий фіксований набір завдань. Після кожної відповіді система оновлює оцінку вимірюваної латентної ознаки — наприклад, здібності, рівня навички або вираженості певної характеристики — і на цій основі добирає наступне завдання з каліброваного банку. В українській фаховій мові трапляються обидві форми — «комп’ютеризоване адаптивне тестування» і «комп’ютерне адаптивне тестування»; у цій статті основною є форма, закріплена в назві.
Важлива деталь: CAT — це не просто правило «правильна відповідь → складніше запитання, неправильна → легше». У повноцінній психометричній системі наступний пункт обирають за моделлю вимірювання, поточною оцінкою параметра людини, інформаційністю доступних завдань, змістовими обмеженнями, правилами безпеки та критеріями зупинки. Саме так CAT описують сучасна психометрична література і огляд алгоритмів адаптивного тестування Han.
CAT є усталеною технологією психометричного вимірювання, що виросла з теорії відповіді на завдання (Item Response Theory, IRT) і послідовного дизайну вимірювання. Вона застосовується в освіті, сертифікаційних і ліцензійних іспитах, оцінюванні стану здоров’я, patient-reported outcomes та психологічних вимірюваннях. При цьому сам факт адаптивності не робить тест валідним, справедливим або клінічно корисним: ці властивості потребують окремих доказів для конкретної популяції та конкретного використання, як вимагають Standards for Educational and Psychological Testing AERA / APA / NCME.
Коротко: що робить алгоритм CAT
Бере стартову оцінку латентної ознаки або задає початковий розподіл імовірностей.
Відбирає з банку допустимі завдання, які відповідають змістовому плану тесту та іншим обмеженням.
Обирає серед них завдання, що має дати найбільше корисної психометричної інформації за поточного рівня оцінюваної ознаки.
Отримує відповідь, перераховує оцінку латентного параметра і її стандартну похибку.
Перевіряє правило зупинки. Якщо потрібної точності ще не досягнуто, цикл повторюється з новим завданням.
Цей цикл «оцінка → вибір завдання → відповідь → нова оцінка → перевірка зупинки» є ядром класичного CAT. Огляд розвитку психометрії CAT у Psychometrika показує, що за зовні простою логікою стоять окремі задачі оцінювання параметрів, оптимального вибору завдань, контролю експозиції та виконання змістових обмежень.
Чому CAT зазвичай спирається на IRT
У класичній теорії тестів результат часто розглядають на рівні сумарного бала конкретної форми тесту. IRT працює інакше: вона моделює ймовірність певної відповіді на окреме завдання як функцію латентної ознаки людини та параметрів самого завдання. Завдяки спільній шкалі людина і завдання можуть бути описані в одній моделі, а інформаційність кожного пункту — оцінена для різних ділянок цієї шкали.
Саме це робить можливим ключовий хід CAT: не ставити всім однакові запитання, а обирати ті, які найбільш інформативні саме за поточної оцінки конкретної людини. Bjorner та співавтори описують IRT як основу, що дозволяє калібрувати банк, добирати релевантні пункти і отримувати оцінки на спільній метриці навіть тоді, коли різні люди відповідають на різні набори пунктів.
IRT — це сімейство моделей, а не одна формула. Для дихотомічних завдань можуть використовуватися моделі з параметрами складності, дискримінативності та, в окремих моделях, вгадування; для шкал із кількома категоріями відповідей — політомічні моделі. Конкретний CAT має працювати з тією моделлю, яка відповідає природі даних, конструкта і способу відповідей.
Що таке θ
У формулах IRT латентну ознаку часто позначають грецькою літерою θ (тета). Це координата людини на шкалі конструкта в межах конкретної моделі. У тесті здібностей θ може представляти рівень вимірюваної здібності; у шкалі симптомів — рівень вираженості вимірюваного симптомного домену. θ не є «відсотком правильних відповідей» і не має автоматичного клінічного значення.
Після кожної нової відповіді система оновлює оцінку θ. Для цього можуть застосовуватися максимальна правдоподібність, weighted likelihood, Bayesian MAP або EAP та інші процедури. Тому одна окрема відповідь не «визначає рівень» людини: вона лише змінює сукупну оцінку з урахуванням попереднього патерну відповідей і властивостей уже пред’явлених завдань.
Інформація завдання: чому «найкраще наступне питання» залежить від поточного рівня
У IRT кожне завдання має інформаційну функцію. Вона показує, наскільки точно конкретний пункт допомагає розрізняти рівні латентної ознаки в певній ділянці шкали. Завдання може бути дуже інформативним біля одного значення θ і майже не додавати точності в іншій ділянці. CAT використовує цю властивість, щоб не витрачати довжину тесту на пункти, які для поточного респондента майже нічого нового не повідомляють.
Для багатьох IRT-моделей сумарна тестова інформація на певному рівні θ пов’язана з умовною стандартною похибкою оцінки: що більше інформації, то менша похибка. У спрощеному вигляді цей зв’язок часто записують як SE(θ) ≈ 1 / √I(θ). Це саме стандартна похибка індивідуальної оцінки в моделі; її не слід плутати зі standard error of the mean — стандартною похибкою вибіркового середнього. Про природу похибки вимірювання варто судити окремо від питання про середні значення вибірки.
Сучасне Educational Measurement (2026) підкреслює цю логіку: адаптивний тест може бути коротшим за фіксований, якщо його складність і інформація краще узгоджуються з оцінюваним рівнем, а банк містить достатньо якісних пунктів у потрібних ділянках шкали.
Як алгоритм реально вибирає наступне завдання
Найвідоміше правило — максимізація Fisher information: із допустимих невикористаних завдань система шукає те, яке за поточного θ очікувано дасть найбільше інформації. Але це лише один варіант. У CAT використовують також Bayesian критерії, Kullback–Leibler information, a-stratification, b-matching та інші стратегії. Han (2018) показує, що практична система вибору завдання складається щонайменше з трьох взаємопов’язаних блоків: змістового балансування, критерію вибору та контролю експозиції.
Отже, «найінформативніше завдання» не обов’язково буде показане. Спочатку алгоритм може відсіяти пункти, які порушують тестову специфікацію: наприклад, уже використано достатньо завдань певного змістового домену, конкретний формат не можна повторювати, пункт має занадто високу експозицію або між завданнями є залежність. Лише після цього оптимізація відбувається всередині допустимого набору.
Змістове балансування не дозволяє адаптивності зруйнувати blueprint тесту.
Контроль експозиції зменшує ризик надмірно частого показу найінформативніших пунктів.
Обмеження щодо «ворогуючих» або пов’язаних пунктів допомагають уникати підказок і локальної залежності.
Правила доступності та accommodations мають бути узгоджені з конструктом і валідністю інтерпретації.
У високоставкових системах безпека банку є частиною якості вимірювання, а не лише технічним питанням.
Чому CAT не дорівнює штучному інтелекту
Класичний CAT може працювати без машинного навчання: IRT-модель, оцінювач θ, інформаційний критерій і правила зупинки достатні для повністю адаптивної процедури. Сучасні дослідження дійсно інтегрують машинне навчання в побудову банків, моделювання відповідей і політики вибору; огляд Zhuang та співавторів (2026) систематизує такі ML-підходи. Але слово «адаптивний» саме по собі не означає «AI-driven».
З чого починається CAT
На першому кроці система ще не має відповідей конкретної людини. Тому їй потрібна стартова стратегія. Найпростіший варіант — почати із середнього рівня шкали або з наперед заданого θ. Можна використовувати prior-розподіл, попередню валідну інформацію про респондента або випадковий вибір із набору придатних стартових пунктів. Вибір старту впливає на перші кроки, але зі зростанням кількості інформативних відповідей його роль зазвичай зменшується.
Надто агресивний старт із одного «ідеального» середнього пункту має практичний недолік: той самий пункт може отримувати непропорційно високу експозицію. Тому операційні CAT часто вводять рандомізацію або інші правила, які трохи жертвують локальною оптимальністю заради безпеки й стабільності банку.
Коли CAT зупиняється
Адаптивним може бути не лише вибір пунктів, а й довжина тесту. Один CAT завершується після фіксованої кількості завдань; інший — коли стандартна похибка оцінки стає нижчою за заданий поріг; третій поєднує мінімальну і максимальну кількість пунктів із критерієм точності. У класифікаційному тесті правило може бути пов’язане з достатньою впевненістю щодо положення відносно конкретної межі.
Приклад із системи PROMIS демонструє практичну реалізацію: HealthMeasures описує CAT як динамічний вибір пунктів із item bank на основі попередніх відповідей із конкретними мінімальними, максимальними та precision-based правилами зупинки. Конкретні числа, правила й допустима похибка залежать від інструмента; їх не можна переносити з одного CAT на інший.
Правило зупинки — це компроміс між точністю, навантаженням на респондента, часом, покриттям змісту та вимогами рішення. Зупинити тест занадто рано означає залишити надмірну невизначеність; продовжувати після досягнення необхідної точності — збільшувати навантаження та експозицію пунктів без пропорційної користі.
Банк завдань: головна інфраструктура CAT
CAT не може бути кращим за свій банк завдань. Банк — це не просто великий список запитань. Пункти мають репрезентувати конструкт, пройти змістову й емпіричну перевірку, бути відкаліброваними на спільній шкалі та мати достатнє покриття діапазону, де тест має вимірювати. Bjorner та співавтори наголошують на перевірці припущень IRT, model fit, локальної незалежності, структури конструкта та функціонування пунктів у підгрупах.
Якщо на крайніх рівнях шкали бракує інформативних пунктів, CAT не може «вигадати» точність алгоритмом. Стандартна похибка залишатиметься високою або система почне повторно обирати близькі за інформаційністю пункти. Так само неточні параметри завдань, parameter drift чи зміна популяції здатні погіршувати оцінки навіть за бездоганного програмного коду.
Розмір банку також не є самостійним доказом якості. Сто погано відкаліброваних пунктів не утворюють сильний CAT лише тому, що їх багато. Важливі покриття конструкта, якість калібрування, інформація в потрібному діапазоні, стабільність параметрів, доступність, справедливість і відповідність intended use.
Точність і надійність: чому CAT не оцінюють одним α Кронбаха
У фіксованій шкалі легко звикнути до одного коефіцієнта внутрішньої узгодженості. У CAT різні люди можуть отримувати різні набори пунктів, а точність є умовною: вона залежить від того, де на латентній шкалі перебуває оцінка людини і скільки інформації містить доступний банк у цій ділянці. Тому одна глобальна α Кронбаха не описує якість адаптивного вимірювання.
У CAT важливі conditional information і conditional standard error. Дві людини можуть мати однакову кількість відповідей, але різну точність оцінки. І навпаки, система може зупинити тест для одного респондента після меншої кількості пунктів, якщо цільову точність уже досягнуто. Moses (2026) розглядає adaptive testing як систему, де precision, item pool, exposure controls і scale maintenance мають оцінюватися разом.
Надійність і валідність залишаються різними поняттями. CAT може дуже точно відтворювати оцінку в межах неправильно визначеного конструкта або непридатної моделі. Висока precision не доводить, що бал має саме те значення, яке йому приписують, і не доводить коректність практичного рішення.
CAT, звичайний комп’ютерний тест і багатоступеневе тестування
Звичайний комп’ютерний тест може лише переносити фіксовану форму з паперу на екран: набір і порядок завдань наперед визначені.
Item-level CAT переоцінює стан після кожної відповіді й може добирати кожне наступне завдання окремо.
Multistage testing адаптується блоками або модулями: після маршрутизувального етапу людина переходить до одного з наперед складених наборів.
Adaptive learning використовує схожу логіку персоналізації, але його метою є навчання й наступний навчальний крок; це не тотожне психометричному CAT.
У сучасному вимірюванні ці архітектури можуть співіснувати. Вибір залежить від змістових обмежень, безпеки, необхідної точності, можливості перегляду відповідей, технічної інфраструктури та того, наскільки важливо заздалегідь експертно перевірити повну форму тесту.
Де CAT застосовують у психології та вимірюванні здоров’я
У психології та health outcomes CAT особливо привабливий для великих item banks, де повна форма була б надто довгою. IRT дозволяє зберегти спільну метрику, а адаптивний алгоритм — поставити конкретній людині лише ті пункти, які найбільше уточнюють її оцінку. Thomas (2019) описує CAT як одну з найпомітніших практичних переваг IRT у клінічному вимірюванні.
PROMIS є відомим прикладом такого підходу для patient-reported outcomes. На сторінці HealthMeasures CAT визначено як динамічне пред’явлення пунктів із банку на основі попередніх відповідей, із низькою похибкою та наперед визначеними правилами зупинки. Це приклад конкретної інфраструктури, а не універсальна специфікація всіх CAT.
У психологічних шкалах адаптація може стосуватися не «складності» в побутовому сенсі, а того, які пункти найточніше розрізняють рівні латентної риси або симптомного домену. Для шкали з градуйованими відповідями немає обов’язкової пари «правильно / неправильно» — алгоритм використовує категорію відповіді та параметри item response model.
Fairness, DIF і культурна адаптація
Адаптивність створює додаткові вимоги до справедливості. Якщо банк містить пункти, що по-різному функціонують у групах за однакового рівня конструкта, алгоритм може по-різному маршрутизувати людей і накопичувати різну інформацію. Тому диференційне функціонування завдань (DIF) потрібно досліджувати в контексті intended population, але DIF саме по собі не є автоматичним доказом упередженості або несправедливості.
Ширша справедливість психологічного тестування включає зміст, доступність, accommodations, мовні умови, технологічний доступ, релевантні норми, наслідки використання, групові порівняння та прозорість рішень. Measurement invariance може бути важливим доказом порівнюваності, але не гарантує автоматично відсутність будь-якого bias.
Переклад CAT іншою мовою не є завершеною валідованою культурною адаптацією. Потрібно перевірити змістову й мовну еквівалентність, психометричну структуру, параметри пунктів, DIF, роботу алгоритму, шкалу і правила інтерпретації в цільовій популяції. Якщо змінилися параметри або значення пунктів, старий routing algorithm може вже не забезпечувати ту саму точність.
Безпека і контроль експозиції пунктів
Якщо алгоритм завжди обирає математично «найкращий» пункт для схожого θ, невелика частина банку може демонструватися надто часто. У високоставкових тестах це створює ризик витоку завдань і запам’ятовування відповідей. Саме тому CAT часто використовує exposure control: рандомізований вибір серед кількох сильних кандидатів, імовірнісні обмеження або складніші процедури. Огляд Han детально описує цю проблему.
Безпека не повинна суперечити валідності. Надмірна рандомізація може зменшити інформаційність; надмірне прагнення до інформаційності — зробити банк передбачуваним. Операційний CAT балансує ці цілі разом із content blueprint і доступністю.
Що може піти не так
Модель IRT погано відповідає даним або неправильно задає структуру конструкта.
Порушено локальну незалежність: відповіді на пункти пов’язані між собою сильніше, ніж допускає модель.
Банк недостатньо інформативний у частині шкали, де перебуває респондент.
Параметри пунктів відкалібровані на іншій популяції та не переносяться на intended population.
З часом виникає item parameter drift, але калібрування не оновлюють.
Алгоритм надмірно експонує певні пункти або не дотримується змістового blueprint.
Технічні умови, таймінг, інтерфейс чи accommodations змінюють процес відповіді.
Шкала перекладена, але не пройшла психометричну адаптацію в новій мові та культурі.
Результат використовують для рішення, для якого не зібрано валідизаційних доказів.
Тому якість CAT визначається всім вимірювальним ланцюгом: конструктом, банком, калібруванням, моделлю, алгоритмом, стандартизованою процедурою, правилами зупинки, способом звітування і конкретним intended use. Комп’ютеризація не виправляє слабку психометрію — вона лише швидше реалізує ту модель, яку в неї закладено.
Як читати результат CAT
Результат адаптивного тесту потрібно інтерпретувати разом із його метрикою та невизначеністю. Це може бути θ, трансформований scale score, T-score, standard score або інша звітна шкала. Однакові числа в різних системах не обов’язково означають однаковий рівень конструкта. T-score, наприклад, не є t-статистикою, а percentile не є відсотком правильних відповідей.
Похибка вимірювання також має практичне значення. Невелика різниця між двома CAT-оцінками може вкладатися в очікувану невизначеність вимірювання. Сам факт числової зміни ще не доводить реальну зміну, а статистично виявлена зміна не автоматично є клінічно або особисто важливою.
У клінічному контексті adaptive screening або symptom CAT не дорівнює діагнозу. Скринінг, case-finding, assessment, diagnosis, monitoring і outcome measurement — різні задачі. Один CAT-score або cutoff може бути частиною оцінювання лише тоді, коли інструмент валідований саме для цієї мети та популяції. Загальні принципи психологічного тестування залишаються чинними незалежно від того, чи тест адаптивний.
Умовний приклад роботи CAT
Уявімо банк із 300 завдань для вимірювання певної когнітивної здібності. Усі пункти відкалібровані на спільній IRT-шкалі. Система стартує з θ = 0, тобто з робочої оцінки біля центру калібрувальної шкали, і показує один із допустимих пунктів середньої складності.
Людина відповідає. Алгоритм оновлює θ і стандартну похибку.
Із невикористаних пунктів відбираються ті, що не порушують blueprint, security та exposure rules.
Серед допустимих алгоритм обирає пункт, який очікувано найбільше зменшить невизначеність біля нового θ.
Після кожної наступної відповіді оцінка та її похибка перераховуються.
Коли precision criterion виконано або досягнуто максимальну довжину, тест завершується й формує звітний бал.
Двоє людей можуть побачити різні завдання і все ж отримати порівнювані оцінки, якщо пункти справді відкалібровані на спільній шкалі, модель адекватна, linking збережено, а intended interpretation підтримана доказами. Саме ця можливість — одна з центральних переваг IRT-based CAT.
Що CAT змінює в самій ідеї тесту
У фіксованій формі тест — це наперед зібраний набір пунктів. У CAT тест стає процедурою побудови індивідуальної форми в реальному часі. Його одиницею дизайну є вже не лише «готовий тест», а система: calibrated item bank + measurement model + estimator + selection rule + constraints + stopping rule + reporting scale.
Це зрушення не скасовує класичних вимог до психометрії. Навпаки, воно робить їх видимішими. Щоб дозволити алгоритму динамічно збирати різні форми, потрібно ще точніше знати, що вимірює кожен пункт, де він інформативний, як поводиться в підгрупах і які наслідки має його включення.
Часті запитання
Чи завжди після правильної відповіді наступне завдання стає складнішим?
Ні. У простому здібнісному CAT така тенденція можлива, але реальний вибір залежить від поточної оцінки θ, інформаційності, змістових обмежень, exposure control і доступного банку. У шкалах із градуйованими відповідями взагалі може не існувати категорії «правильно / неправильно».
Чи CAT завжди коротший за звичайний тест?
Не обов’язково. CAT часто підвищує вимірювальну ефективність, але довжина залежить від precision target, структури банку, рівня респондента та обмежень. Якщо банк слабкий у потрібній ділянці шкали, для досягнення точності може знадобитися багато пунктів або заданого рівня точності взагалі не буде досягнуто.
Чи можна порівнювати людей, якщо вони відповідали на різні запитання?
Так, за належних умов IRT-based scaling і linking. Порівнюваність підтримує не тотожність набору пунктів, а їхнє калібрування на спільній шкалі та валідність моделі. Якщо calibration, linking або parameter stability порушені, сама назва CAT порівнюваність не гарантує.
Чи CAT є штучним інтелектом?
Ні. Класичний CAT може повністю працювати на статистичних психометричних правилах без машинного навчання. AI/ML-методи можуть доповнювати сучасні системи, але вони не є визначальною ознакою CAT.
Чи хороший CAT, якщо його standard error дуже малий?
Малий standard error означає високу точність оцінки в межах моделі й поточного банку, але не доводить валідність конструкта, fairness або придатність конкретного рішення. Надійність не дорівнює валідності.
Чи можна використати перекладений CAT без нової перевірки?
Переклад не дорівнює валідованій культурній адаптації. Потрібні докази того, що пункти, параметри, шкала, DIF, алгоритм і правила інтерпретації працюють належно в цільовій мовній та культурній популяції.
Чи може адаптивний психологічний тест поставити діагноз?
Сам по собі — ні. CAT є способом вимірювання й адміністрування. Діагноз потребує відповідного клінічного процесу, критеріїв, контексту, анамнезу та інших даних. Навіть добре валідований adaptive screener залишається скринінговим інструментом, якщо саме так визначено його intended use.
Пов’язані статті
Психометрія: що це, що вона вимірює і як оцінюють якість психологічних тестів
Психологічне тестування: що це, як проводиться і які обмеження має результат тесту
Класична теорія тестів: істинний бал, похибка вимірювання і надійність
Похибка вимірювання в психології: випадкова, систематична і чому один бал не є абсолютно точним
Справедливість психологічного тестування: bias, доступність, групові порівняння і межі інтерпретації
Джерела
Chang, H.-H. (2015). Psychometrics behind computerized adaptive testing. Psychometrika, 80(1), 1–20.
