top of page

Психологічна енкциклопедія

Надійність паралельних форм: як перевіряють еквівалентність двох версій психологічного тесту

6 днів тому
Читати 16 хв

Автор: Український психологічний ХАБ · Опубліковано: 23 вересня 2026 року · Редакційна політика


Надійність паралельних форм — це спосіб оцінити, наскільки стабільно дві різні версії одного психологічного тесту відтворюють відносне положення людей і, якщо форми мають бути взаємозамінними, наскільки близькі їхні бали на одній шкалі. Йдеться про форми A і B, створені для вимірювання того самого конструкта за однаковими специфікаціями, але з різними завданнями або стимулами. У Стандартах AERA, APA і NCME альтернативні, або паралельні, форми описані як версії, що мають спільні змістові та статистичні специфікації, однакові процедури проведення і призначені для однакової інтерпретації результатів.


Ключове слово тут — «еквівалентність». Висока кореляція між балами двох форм важлива, але сама по собі не доводить, що форму A можна без наслідків замінити формою B. Дві версії можуть ранжувати людей майже однаково і водночас систематично давати різні середні бали, мати різну дисперсію, різну точність на окремих ділянках шкали або по-різному працювати в підгрупах. Саме тому сучасна перевірка паралельних форм виходить за межі одного коефіцієнта кореляції.


Що саме перевіряє надійність паралельних форм


Надійність у психометрії стосується точності та відтворюваності балів за визначених умов вимірювання. Вона не є однією незмінною властивістю «тесту взагалі»: оцінка залежить від того, які джерела похибки входять до дизайну дослідження, у якій популяції отримано дані і для якого використання потрібні результати. ETS у методичному огляді Test Reliability—Basic Concepts прямо описує надійність як узгодженість балів між різними моментами тестування, різними виданнями тесту або різними оцінювачами — залежно від того, який тип відтворення нас цікавить.


Паралельні форми спеціально вводять джерело варіативності «який набір завдань випав людині». Якщо учасник має однаковий рівень вимірюваної ознаки, а форма A і форма B справді взаємозамінні, зміна форми не повинна істотно змінювати зміст і практичний сенс результату. Тому цей тип надійності найближче відповідає запитанню: «Наскільки результат узагальнюється на іншу, еквівалентно сконструйовану версію тесту?»


Це інше запитання, ніж стабільність у часі. Якщо людині двічі дають ту саму форму, дослідження насамперед стосується тест-ретест надійності. Якщо їй дають дві різні форми, до часової варіативності додається варіативність через добір завдань. Стандарти тестування виділяють окремо коефіцієнти альтернативних форм, тест-ретест коефіцієнти та коефіцієнти внутрішньої узгодженості й застерігають, що індекси, які охоплюють різні джерела похибки, не слід автоматично вважати взаємозамінними.


Що означає «паралельні форми» у строгому і практичному сенсі


У класичній теорії тестів поняття строго паралельних форм має сильні математичні припущення. Дві форми вимірюють той самий конструкт, мають однакові істинні бали для кожної людини, однакові середні та дисперсії в популяції, однакову дисперсію похибки й однакові зв’язки з іншими змінними. За такого ідеалу кореляція між формами має пряме тлумачення як коефіцієнт надійності.


У реальних тестових програмах частіше говорять про альтернативні або еквівалентні форми, які наближаються до цього ідеалу. AERA/APA/NCME вимагають від них однакового загального розподілу змісту й форматів завдань, тих самих процедур адміністрування та принаймні приблизно однакових середніх і стандартних відхилень у визначених популяціях. Тобто назва «форма A» і «форма B» ще нічого не доводить: еквівалентність є емпіричним твердженням, яке потребує даних.


Це розрізнення важливе і для читання наукових статей. Автори можуть називати форми parallel, alternate, equivalent або comparable, але методологічний зміст треба шукати в описі конструкції форм і статистичних перевірок. Дослідження Мігеля Гарсії-Переса показує, що кореляція без перевірки розподільчих властивостей форм може створювати надто сильне враження паралельності; у класичній постановці мають значення також рівність середніх і дисперсій. Стаття Гарсії-Переса у Behavior Research Methods присвячена саме статистичним критеріям паралельності.


Що має бути еквівалентним у двох версіях тесту


Еквівалентність форм починається ще до обчислення статистики. Якщо дві версії побудовані за різними змістовими правилами, жоден високий коефіцієнт не перетворить їх на справді взаємозамінні форми. Для запланованого використання потрібно заздалегідь описати, що саме має залишатися сталим.


  • Конструкт і межі того, що тест має вимірювати.

  • Змістовий план: частки доменів, підтем, типів стимулів або поведінкових проявів.

  • Формати завдань і правила відповіді, якщо вони впливають на процес виконання.

  • Очікувана складність і, для модельних підходів, точність або інформація тесту на потрібних рівнях конструкта.

  • Довжина, часові обмеження, інструкції, спосіб адміністрування та умови тестування.

  • Правила підрахунку, шкала балів і спосіб інтерпретації.

  • Цільова популяція, для якої заявляється взаємозамінність.


Еквівалентність завжди має сферу дії. Якщо форми продемонстрували близькі властивості у вибірці студентів певного віку, це не дає автоматичної підстави переносити той самий висновок на дітей, клінічну популяцію або іншу мовну групу. Надійність і точність залежать від розподілу вимірюваної ознаки та від популяції, тому технічна документація має чітко називати вибірку.


Навіщо психологічним тестам створюють паралельні форми


Найочевидніша причина — повторне вимірювання. Якщо дослідник або клініцист використовує ту саму форму кілька разів, людина може запам’ятати конкретні завдання, стратегії відповіді або правильні рішення. Інша форма зменшує пряме повторення матеріалу, хоча не усуває загальні ефекти практики, знайомства з процедурою чи мотиваційні зміни.


  • Лонгітюдні дослідження, де одну й ту саму характеристику оцінюють у кілька моментів.

  • Оцінювання до і після втручання, коли повторення конкретних завдань може спотворювати зміну.

  • Освітні та кваліфікаційні програми з кількома сесіями тестування.

  • Комп’ютеризоване або адаптивне тестування, де різні учасники отримують різні набори завдань.

  • Високоставкові тести, для яких багато форм потрібні також із міркувань безпеки.

  • Дослідження, де потрібно відокремити варіативність через добір завдань від інших джерел похибки.


У тестах із захищеним змістом паралельні форми мають ще одну функцію: зменшувати ризик попереднього знайомства з конкретними завданнями. Публікація повних форм, ключів, стимулів або захищених алгоритмів може підірвати валідність майбутніх результатів. Актуальні рекомендації APA щодо безпеки тестів прямо відносять живі завдання, повні тестові форми, ключі та інші матеріали, здатні відтворити оцінювання, до контенту, який може потребувати обмеженого доступу.


Як конструюють паралельні форми до емпіричної перевірки


Спільний тестовий план


Форми повинні походити з одного й того самого змістового плану, а не просто бути двома наборами «схожих» запитань. Для кожної форми визначають частку завдань за доменами, рівнями складності, форматами, навичками або поведінковими індикаторами. Чим точніше специфікація, тим менше шансів, що форма A випадково вимірюватиме одну частину конструкта сильніше, а форма B — іншу.


Порівнювана статистична складність і точність


У класичній теорії тестів дивляться на розподіли балів, варіативність і характеристики завдань. У моделях теорії відповіді на завдання можна збирати форми так, щоб вони наближалися до спільної цільової інформаційної функції й однаково точно вимірювали потрібний діапазон латентної ознаки. Важливий принцип незмінний: загальна подібність середніх не гарантує однакової точності на всій шкалі.


Однакові умови адміністрування і підрахунку


Форма B не є еквівалентною формі A, якщо одна проходиться на папері без ліміту часу, а інша — на смартфоні з жорстким таймером, якщо саме ці відмінності можуть змінити поведінку учасника. Те саме стосується інструкцій, порядку подання, доступних підказок, правил пропусків, системи балів і кваліфікації оцінювачів.


Безпека і незалежність завдань


Якщо мета другої форми — зменшити ефект пам’яті, просте переставляння тих самих пунктів місцями зазвичай не створює повноцінної незалежної форми. Високий збіг тоді може частково відображати запам’ятовування матеріалу. У захищених тестах розробник також має зберігати авторські права, ліцензійні умови і безпеку банку завдань окремо від питання психометричної якості.


Дизайн дослідження: як перевіряють еквівалентність форм A і B


Найпряміший дизайн передбачає, що ті самі учасники виконують обидві форми, а дослідник намагається зробити так, щоб справжній рівень вимірюваної характеристики між сесіями не встиг істотно змінитися. Саме так можна спостерігати різницю, пов’язану з формою, на рівні конкретної людини. Лівінгстон для ETS підкреслює: пряме оцінювання надійності альтернативних форм потребує двох різних видань тесту в людей, які між тестуваннями не змінилися щодо знань або навичок, що вимірюються.


Порядок форм краще контрбалансувати


Якщо всі учасники спочатку проходять A, а потім B, ефект форми змішується з ефектом порядку. Друга сесія може бути кращою через практику або гіршою через втому. Тому типовий сильніший дизайн випадково розподіляє учасників на послідовності A→B і B→A або використовує інше контрбалансування. Після цього можна окремо перевірити, чи є систематичний ефект порядку.


Інтервал між сесіями не має універсальної правильної довжини


Надто короткий інтервал підсилює пам’ять, тренування і перенесення стратегії. Надто довгий дозволяє реально змінитися конструкта: знання, симптоми, настрій, функціонування або навички можуть уже бути іншими. Дослідження Адама Вайза показує, що кількість днів між сесіями здатна змінювати оцінки надійності альтернативних форм; самі Стандарти не задають універсального інтервалу. Інтервал обирають із теорії конструкта, мети тесту й очікуваних ефектів пам’яті та розвитку.


Для стабільної риси допустима логіка інтервалу одна, для швидкозмінного стану — інша. Якщо тест вимірює настрій, біль або гострі симптоми, відмінність між сесіями може бути справжньою зміною стану, а не похибкою чи нееквівалентністю форм. Тому автор дослідження має пояснити, чому обраний інтервал відповідає саме цьому конструкту.


Вибірка має відповідати цільовій популяції


Результат надійності не слід читати як універсальну константу. В однорідній вибірці кореляційні коефіцієнти можуть бути нижчими через обмежений діапазон істинних балів, тоді як у дуже різнорідній вибірці — вищими. Потрібно описувати вік, мову, освітній або клінічний контекст, критерії включення, розподіл балів і достатність вибірки для запланованих аналізів.


Які статистики потрібні: кореляція — лише початок


1. Описова порівнюваність


Спершу порівнюють самі розподіли: середні, стандартні відхилення, медіани або квантили за потреби, діапазони, асиметрію, частку мінімальних і максимальних балів. Якщо форма B систематично легша, учасники можуть зберегти той самий порядок ранжування, але бали вже не будуть взаємозамінними.


Наприклад, уявімо B = A + 5 для кожної людини. Кореляція дорівнюватиме 1,00, бо ранги й відносні відстані повністю збережені. Проте форма B завжди додає п’ять балів. Для рішення «можна використовувати A і B як один і той самий бал» така ситуація є систематичною незгодою, а не ідеальною еквівалентністю.


2. Кореляція між сумарними балами


Кореляція Пірсона часто є базовим індексом для безперервних балів, якщо її припущення прийнятні. Вона показує, наскільки люди, що мають високі результати у формі A, також мають високі результати у формі B. Для строго паралельних форм у класичній теорії саме кореляція між формами пов’язана з коефіцієнтом надійності.


Однак кореляція вимірює асоціацію, а не тотожність шкал. Цей принцип добре відомий у методології аналізу узгодженості: огляд аналізу Бланда—Альтмана пояснює, чому високий r може співіснувати із систематичною різницею між двома вимірюваннями. Для паралельних тестових форм високу кореляцію потрібно читати разом із різницями рівня, розсіювання і, якщо заявлена взаємозамінність, прямими показниками узгодженості.


3. Узгодженість і ICC


Для безперервних балів інколи використовують внутрішньокласовий коефіцієнт кореляції (ICC), особливо коли запитання стосується не лише рангової стабільності, а й узгодженості числових значень. Але «ICC» не є одним універсальним коефіцієнтом: існують різні моделі, типи та визначення. Ку і Лі наголошують, що дослідник має називати модель, тип і визначення ICC та обирати їх відповідно до дизайну.


Коли мета — взаємозамінність форм, концептуально важлива саме абсолютна узгодженість, а не лише сталість, яка може залишатися високою за систематичного зсуву. Конкретний варіант ICC залежить від того, чи форми розглядаються як фіксовані, чи узагальнюються на ширший всесвіт форм, скільки вимірювань утворює підсумковий бал і який дизайн використано. Тому публікація просто «ICC = 0,86» без специфікації моделі є неповною.


4. Різниці між індивідуальними балами


Якщо форми мають замінювати одна одну на рівні конкретної людини, потрібно дивитися не лише на коефіцієнт для вибірки, а й на розподіл парних різниць A−B. Корисними можуть бути середня різниця, її невизначеність, графік різниць і межі узгодженості. Це допомагає побачити постійний зсув, збільшення розбіжностей на високих балах або окремі діапазони шкали, де форми поводяться по-різному.


У методології надійності та узгодженості GRRAS рекомендує прозоро описувати вибірку, дизайн і статистичний аналіз, оскільки надійність і узгодженість відповідають на пов’язані, але не тотожні питання. Для психологічного тесту це особливо важливо, коли від різниці в кілька балів залежить індивідуальна інтерпретація.


5. Рішення за порогами і категоріями


Якщо тест використовує категорії, рівні ризику або порогові значення, взаємозамінність потрібно перевіряти і на рівні рішень. Дві форми можуть мати високу кореляцію загальних балів, але переводити частину людей по різні боки порогу. Тоді до аналізу додають частку збігу класифікацій, таблиці переходів і, за відповідного типу даних, коефіцієнти узгодженості на кшталт каппи. ICC і каппа Коена тут не взаємозамінні: вони призначені для різних типів результатів і моделей узгодженості.


І ще одне важливе розрізнення: узгодженість між двома формами не є діагностичною чутливістю або специфічністю. Чутливість і специфічність порівнюють результат із зовнішнім референсним станом або критерієм. Надійність паралельних форм порівнює форми між собою.


Класична модель: чому кореляція форм може бути коефіцієнтом надійності


У найпростішому записі класичної теорії спостережуваний бал форми можна представити як X = T + E, де T — істинний бал у межах моделі, а E — похибка вимірювання. Для строго паралельних форм A і B припускають той самий T, однакову дисперсію похибки та відповідні умови незалежності похибок. Тоді спільна варіативність форм походить від істинних відмінностей між людьми, а кореляція X_A і X_B оцінює надійність.


У реальному тестуванні строгі припущення часто виконуються лише приблизно. Саме тому AERA/APA/NCME розрізняють теоретично строго паралельні тести (strictly parallel tests) і практичні альтернативні форми (alternate forms). Якщо середні, дисперсії, зміст або точність форм відрізняються, коефіцієнт кореляції перестає бути достатнім описом взаємозамінності.


З цією логікою пов’язана і формула Спірмена–Брауна. У методі розщеплення дві половини одного тесту іноді моделюють як паралельні компоненти, а кореляцію між половинами коригують до довжини повного тесту. Але надійність за методом розщеплення та надійність двох незалежно створених паралельних форм — різні дизайни. Спільна математика паралельності не робить їх одним і тим самим методом.


Еквівалентність форм і вирівнювання шкал (equating) — не одне й те саме


Навіть добре сконструйовані форми можуть трохи відрізнятися за складністю. У великих тестових програмах сирі бали різних форм часто пов’язують на спільну шкалу за допомогою вирівнювання шкал (equating). Його мета — скоригувати невеликі відмінності так, щоб шкаловані бали мали порівнюваний зміст.


Але вирівнювання шкал не є чарівною процедурою, що автоматично робить будь-які дві форми еквівалентними. Стандарт 5.12 AERA/APA/NCME вимагає чіткої аргументації та доказів для твердження, що шкальні бали альтернативних форм взаємозамінні. Стандарт 5.13 додає: коли еквівалентність ґрунтується на вирівнюванні шкал, потрібно документувати метод і точність функції вирівнювання, подібність конструкта, близькі рівні надійності, умовні стандартні похибки вимірювання (SEM) та придатність результатів для релевантних підгруп.


Отже, є три різні питання: чи форми вимірюють той самий конструкт, чи вони достатньо точні, і чи їхні бали можна поставити на спільну шкалу для конкретного використання. На них не завжди відповідає одна й та сама статистика.


Який коефіцієнт вважати «достатнім»


Універсальної межі на кшталт «r ≥ 0,70 — тест хороший» для всіх цілей немає. Вимоги мають випливати із запланованого використання і наслідків помилки. Для групового дослідження середніх може бути достатньою одна точність, для індивідуального клінічного рішення або високоставкового відбору — значно вища. Один і той самий коефіцієнт може бути прийнятним в одному контексті й недостатнім в іншому.


Важливо повідомляти не лише точкове число, а й довірчий інтервал або іншу характеристику невизначеності, розмір і склад вибірки, порядок форм, інтервал між сесіями, конкретні версії тесту та джерела похибки, які охоплює коефіцієнт. Стандарти тестування прямо підкреслюють, що фраза на кшталт «надійність тесту X дорівнює 0,90» без уточнення типу надійності й умов є недостатньою.


Так само p-значення не перетворює питання еквівалентності на просту відповідь «так/ні». Відсутність статистично значущої різниці між середніми ще не доводить практичної взаємозамінності, особливо в малих вибірках. Американська статистична асоціація наголошує, що p-значення відображають сумісність даних із моделлю та вибіркову невизначеність, а не практичну важливість ефекту; пороги слід визначати з урахуванням цілей і наслідків рішення.


Надійність паралельних форм, тест-ретест і метод розщеплення: у чому різниця


  • Надійність паралельних форм: ті самі люди виконують різні форми, а дослідження охоплює варіативність через добір форми; якщо сесії рознесені в часі, до неї може домішуватися часовий компонент.

  • Тест-ретест надійність: та сама форма застосовується повторно; головне питання — стабільність результату в часі, але можливі пам’ять і практика.

  • Надійність за методом розщеплення: одну форму в одній адміністрації ділять на частини; це індекс внутрішньої узгодженості, а не пряме дослідження двох незалежних форм.

  • Внутрішня узгодженість: оцінює зв’язки між завданнями або частинами одного тесту. Альфа Кронбаха не є універсальною заміною надійності альтернативних форм.

  • Міжоцінювальна надійність: стосується узгодженості оцінювачів, коли результат залежить від людського судження.


Ці коефіцієнти можуть бути чисельно схожими, але вони охоплюють різні джерела похибки. Тому висока альфа в кожній із двох форм не доводить, що A і B взаємозамінні; вона лише говорить про певний аспект внутрішньої структури балів у кожній формі окремо.


Надійність не дорівнює валідності


Навіть ідеально узгоджені форми можуть стабільно вимірювати не те, що заявлено. Надійність відповідає на питання про точність і відтворюваність результатів за заданою моделлю реплікації. Валідність стосується обґрунтованості інтерпретацій і використання балів. Тому висока надійності альтернативних форм є потрібним елементом доказової бази для взаємозамінних форм, але не замінює докази щодо змісту, внутрішньої структури, зв’язків з іншими змінними та наслідків використання.


Це розрізнення особливо важливе в психодіагностиці. Надійний результат скринінгу залишається результатом скринінгу, а не діагнозом. Навіть якщо дві скринінгові форми добре узгоджуються між собою, окремо потрібні дані про діагностичну точність для конкретної популяції, пороги, базову частоту, контекст оцінювання та клінічне рішення.


Паралельна форма не дорівнює перекладу: українська адаптація потребує окремих доказів


Дві мовні версії тесту інколи неформально називають «паралельними», але переклад сам по собі не створює валідованої паралельної форми. Мова може змінити складність пункту, конотації, знайомість змісту, спосіб відповіді й навіть структуру конструкта. Тому український переклад англомовної шкали не слід вважати психометрично еквівалентним лише тому, що текст перекладено професійно.


Настанови Міжнародної тестової комісії (ITC) з перекладу й адаптації тестів вимагають емпіричних доказів еквівалентності конструкта, методу й окремих пунктів, а також окремої підтримки норм, надійності та валідності адаптованої версії у цільовій популяції. ITC прямо зазначає, що психометричні докази вихідної мовної версії не автоматично переносяться на нову адаптацію.


Для мовної або культурної адаптації можуть бути потрібні факторні моделі, аналіз інваріантності вимірювання (measurement invariance), аналіз differential item functioning (DIF), порівняння точності та, якщо заявляється спільна шкала, відповідний дизайн зв’язування або вирівнювання шкал. Інваріантність вимірювання не означає автоматичну відсутність будь-якої упередженості, а виявлений DIF сам по собі ще не доводить несправедливість пункту: потрібно з’ясувати джерело диференційного функціонування і його наслідки для заявленої інтерпретації.


Що відбувається, коли форми використовують для вимірювання змін


У дослідженнях лікування, навчання або розвитку форми часто чергують: A до втручання, B після нього. Такий дизайн зменшує повторення конкретних завдань, але створює новий ризик: відмінність між A і B може маскуватися під реальну зміну людини. Якщо B трохи легша, покращення буде завищене; якщо складніша — справжній прогрес може зникнути.


Тому для моніторингу важлива не лише кореляція між формами, а й величина ефекту форми та похибка індивідуальної різниці. Похибка вимірювання (measurement error) — це не те саме, що реальна зміна. Стандартна похибка вимірювання (SEM) — також не те саме, що стандартна похибка середнього (standard error of the mean). А показники на кшталт MDC, MIC/MID або RCI відповідають уже на інші питання і не повинні підміняти доказ того, що форми A і B справді порівнювані.


Якщо тест має клінічне порогове значення, не можна автоматично переносити його з форми A на форму B без доказів. Навіть після вирівнювання шкали варто перевірити поведінку біля порогу, узгодженість рішень та наслідки помилкової перекласифікації.


Типові помилки під час перевірки паралельних форм


  • Назвати дві версії «паралельними» до того, як їхню еквівалентність показано змістово й емпірично.

  • Обмежитися однією кореляцією і не перевірити систематичну різницю між рівнями балів.

  • Вважати статистично незначущу різницю автоматичним доказом еквівалентності.

  • Показати високу альфу Кронбаха в A і B, але не порівняти форми між собою.

  • Використати лише одну послідовність A→B і переплутати ефект форми з ефектом практики, втомою або ефектом порядку.

  • Не пояснити інтервал між сесіями або взяти універсальне правило без огляду на швидкість реальної зміни конструкта.

  • Порівнювати коефіцієнти, отримані в різних за варіативністю популяціях, як прямі властивості форм.

  • Повідомити ICC без моделі, типу, definition і довірчого інтервалу.

  • Провести вирівнювання шкал і вважати його доказом того, що форми вимірюють той самий конструкт.

  • Назвати переклад українською валідованою паралельною формою без культурної адаптації та окремої психометричної перевірки.

  • Перенести порогове значення, норми або клінічну інтерпретацію з однієї форми на іншу без доказів.

  • Розкривати захищені тестові завдання, ключі або матеріали для підрахунку балів, плутаючи наукову прозорість із публікацією захищеного тестового контенту.


Як читати статтю або технічний посібник про надійність паралельних форм


Добре звітування дозволяє читачеві зрозуміти, що саме було повторено, яке джерело похибки оцінено і для якої популяції висновок має силу. Практичний чекліст виглядає так:


  • Чи описано заплановане використання і цільову популяцію?

  • Чи пояснено, як форми A і B будувалися за спільними змістовими та статистичними специфікаціями?

  • Чи справді ті самі учасники виконували обидві форми, якщо робиться висновок про індивідуальну еквівалентність?

  • Чи рандомізовано або контрбалансовано порядок A/B?

  • Чи обґрунтовано інтервал між сесіями для конкретного конструкта?

  • Чи наведено середні, стандартні відхилення і розподіли для обох форм?

  • Чи наведено коефіцієнт зв’язку або надійності з інтервалом невизначеності?

  • Якщо заявлена взаємозамінність, чи оцінено узгодженість або індивідуальні різниці, а не лише кореляцію?

  • Якщо є порогові значення, чи перевірено узгодженість рішень поблизу порогу?

  • Якщо бали вирівняно, чи описано дизайн і якість процедури вирівнювання і похибку вирівнювання?

  • Чи перевірено релевантні підгрупи, мовні версії та культурну придатність?

  • Чи чітко відділено докази надійності від докази валідності?


Якщо на кілька з цих запитань відповіді немає, цифра надійності може бути правильно обчислена, але її інтерпретація лишається значно слабшою.


Практичний приклад без реального тестового контенту


Уявімо дослідницьку шкалу з двома формами по 30 завдань. Форми створені за одним тестовим планом, мають однакові домени й формат відповіді. 240 учасників випадково розподілили: половина виконує A→B, половина B→A. Інтервал — сім днів, обраний тому, що конструкт очікується стабільним протягом тижня, але дослідники хочуть зменшити пряме запам’ятовування завдань.


Правильний аналіз не закінчується на r = 0,88. Дослідники дивляться, чи близькі середні та стандартні відхилення, чи немає систематичного зсуву A−B, чи впливає порядок, обчислюють обґрунтований індекс узгодженості з довірчим інтервалом, оцінюють розподіл індивідуальних різниць і перевіряють, чи не погіршується узгодженість на крайніх балах. Якщо потрібне порогове значення, окремо дивляться на збіг класифікацій.


Якщо з’ясується, що r високий, але B у середньому на чотири бали вища за A, висновок буде не «паралельність доведено», а «форми добре зберігають ранжування, проте мають систематичну різницю шкали». Далі потрібне пояснення причини, можлива реконструкція форми або коректне зв’язування чи вирівнювання шкал — залежно від мети.


Часті запитання


Чи достатньо просто порахувати кореляцію між формою A і B?


Ні. Кореляція показує силу зв’язку і стабільність ранжування, але не доводить однаковість рівня балів або їхню взаємозамінність. Потрібні щонайменше описові порівняння форм, а для заявленої взаємозамінності — аналіз узгодженості та індивідуальних різниць.


Якщо r = 0,90, форми вже еквівалентні?


Такого висновку з одного r зробити не можна. Значення 0,90 може співіснувати з постійним зсувом, різною дисперсією або різною точністю на окремих рівнях конструкта. Критерії мають відповідати запланованому використанню.


Чи може альфа Кронбаха замінити надійність паралельних форм?


Ні. Альфа оцінює аспект внутрішньої узгодженості в межах однієї форми. Навіть якщо альфа висока в A і B, це не показує, що бали A і B взаємозамінні. Формула Спірмена–Брауна також має іншу роль: вона пов’язана зі зміною довжини й логікою методу розщеплення за відповідних припущень.


Який інтервал між двома формами правильний?


Універсального числа днів немає. Інтервал має бути достатнім для зменшення пам’яті та перенесення конкретних відповідей, але достатньо коротким, щоб реальна характеристика не змінилася настільки, що ефект форми неможливо відділити від реальної зміни.


Чи є український переклад оригінального тесту паралельною формою?


Не автоматично. Переклад — лише частина адаптації. Для заяв про еквівалентність потрібні дані щодо конструкта, пунктів, методу, надійності, валідності, норм і, коли це потрібно, аналіз інваріантності вимірювання та процедури зв’язування або вирівнювання шкал. ITC прямо вимагає окремої емпіричної підтримки адаптованої версії.


Чи можна дві форми давати одна одразу після одної?


Іноді так, якщо конструкт швидко змінюється і пряма пам’ять про різні завдання є невеликою загрозою. Але такий дизайн підвищує ризик втоми, порядку та перенесення. Їх потрібно мінімізувати контрбалансуванням і перевіряти в аналізі.


Чи треба використовувати ті самі норми для двох форм?


Лише якщо є достатня підстава вважати шкали та інтерпретації еквівалентними для потрібної популяції. Наявність спільного конструкта ще не доводить, що одна й та сама нормативна таблиця придатна для обох форм.


Чи можна міняти форму під час клінічного моніторингу?


Можна лише тоді, коли є належні докази порівнюваності балів для такого використання. Інакше різниця між сесіями змішує реальну зміну людини з ефект форми. Один результат скринінгу або зміна бала самі по собі не є діагнозом.


Чи можна публікувати завдання двох форм, щоб показати їхню еквівалентність?


Для відкрито ліцензованого інструменту це залежить від ліцензії. Для пропрієтарних або захищених тестів повні завдання, ключі, стимульний матеріал та алгоритми можуть бути захищені й не повинні публікуватися без дозволу. Наукову якість можна описувати через тестовий план, статистичні властивості, дизайн і результати без розкриття захищеного тестового контенту.


Пов’язані статті





Джерела











 
 
bottom of page