Структурна валідність: чи відповідає факторна структура тесту теоретичній будові конструкта
Автор: Український психологічний ХАБ · Опубліковано: 23 вересня 2026 · Редакційна політика
Структурна валідність показує, наскільки внутрішня будова психологічного тесту відповідає теоретичній будові конструкта, який тест має вимірювати. Якщо теорія передбачає один латентний вимір, дані повинні бути сумісні з одновимірною моделлю; якщо конструкт має кілька компонентів, очікується відповідна багатовимірна структура. У сучасних Standards for Educational and Psychological Testing внутрішня структура розглядається як одне з джерел доказів валідності для певної інтерпретації та використання тестових балів, а не як довічна властивість інструмента.
Практично це означає, що запитання «чи має тест структурну валідність?» треба розгорнути: для якої популяції, якої мовної версії, якої моделі вимірювання, якого способу підрахунку балів і якого передбаченого використання? Одна й та сама шкала може добре відтворювати очікувану структуру в одній вибірці й працювати інакше в іншій. Тому структурна валідність — це система доказів про відповідність емпіричної структури теоретичній моделі, а не печатка «валідно / невалідно».
Найчастіше структурну валідність перевіряють експлораторним факторним аналізом, конфірматорним факторним аналізом, а для моделей теорії відповіді на завдання та Раша — через перевірку їхніх припущень і відповідності моделі. COSMIN визначає структурну валідність як ступінь, до якого бали інструмента адекватно відображають вимірність конструкта. Це формулювання добре передає головну ідею: нас цікавить не краса статистичних показників сама по собі, а те, чи підтримує структура даних той спосіб, яким ми хочемо тлумачити шкали й підшкали.
Що саме перевіряє структурна валідність
Психологічні конструкти — тривога, самоповага, виконавчий контроль, емпатія, депресивна симптоматика, професійне вигорання — часто не спостерігаються безпосередньо. Дослідник спостерігає відповіді на пункти, виконання завдань або оцінки експертів і припускає, що спільна варіація цих показників відображає один чи кілька латентних вимірів. Структурна валідність перевіряє, наскільки ця припущена карта латентних вимірів узгоджується з даними.
У факторній моделі пункт має факторне навантаження — показник сили його зв’язку з латентним фактором. Пункти, які теоретично належать до однієї підшкали, мають переважно бути пов’язані з відповідним фактором; пункти різних підшкал не повинні без пояснення утворювати хаотичні перехресні навантаження; кореляції між факторами мають бути змістово правдоподібними; залишкова структура не повинна свідчити, що модель систематично пропускає важливі залежності.
Важливо: структурна валідність не вимагає, щоб кожен психологічний тест був одновимірним. Багатовимірна шкала може мати сильну структурну валідність, якщо її теорія передбачає кілька вимірів і дані відтворюють саме цю будову. Навпаки, насильне «стискання» багатовимірного конструкта в один загальний бал може погіршити інтерпретацію, навіть якщо загальний коефіцієнт внутрішньої узгодженості виглядає високим.
Структурна валідність у сучасній концепції валідності
Історично валідність часто подавали як набір окремих «видів»: змістову, критеріальну, конструктну та інші. Сучасні стандарти тестування трактують валідність ширше: це ступінь, до якого сукупність доказів і теорія підтримують запропоновану інтерпретацію балів для певного використання. Докази щодо внутрішньої структури є одним із компонентів такого аргументу. AERA, APA та NCME прямо пов’язують внутрішню структуру з тим, наскільки взаємозв’язки між пунктами й компонентами тесту відповідають конструкції, на якій ґрунтується інтерпретація балів.
Отже, хороша факторна структура сама по собі не доводить «валідність тесту взагалі». Вона підтримує конкретне твердження: внутрішня організація балів узгоджується з очікуваною вимірною моделлю. Для повного валідизаційного аргументу можуть бути потрібні також змістові докази, зв’язки з іншими змінними, аналіз наслідків використання, кроскультурні докази та перевірка справедливості.
Структурна валідність, надійність і внутрішня узгодженість — різні речі
Структурну валідність особливо часто плутають із надійністю. Надійність психологічного тесту описує прецизійність і відтворюваність балів за визначених умов. Структурна валідність описує відповідність внутрішньої будови тесту теоретичній будові конструкта. Тест може мати стабільні бали, але неправильну факторну структуру; може мати правдоподібну факторну модель, але недостатню точність окремих балів.
Високий α Кронбаха не доводить структурну валідність і не доводить одновимірність. Коефіцієнт α може бути високим у багатовимірному наборі пунктів, особливо коли пунктів багато або вони частково дублюють одне одного. Перед осмисленою оцінкою внутрішньої узгодженості треба зрозуміти, які пункти справді утворюють спільну шкалу. Саме тому сучасні рекомендації з розробки шкал розводять аналіз вимірності та оцінювання надійності як різні етапи; це добре показують Boateng та співавтори і новіші рекомендації з розробки психологічних шкал.
Коли факторний аналіз доречний
Факторний аналіз найбільш природний для рефлективної моделі вимірювання: припускається, що латентний конструкт зумовлює спільну варіацію індикаторів. Наприклад, якщо кілька пунктів є проявами одного латентного виміру соціальної тривоги, вони мають корелювати тому, що залежать від спільної прихованої характеристики. У такій логіці аналіз факторної структури безпосередньо стосується структурної валідності.
Для формативних індексів логіка інша: показники разом формують індекс, але не зобов’язані бути проявами одного прихованого джерела. Наприклад, перелік незалежних стресорів може бути корисним сумарним показником навантаження, хоча окремі стресори не мають корелювати. Вимагати високої внутрішньої узгодженості або красивої однофакторної структури від такого індексу означає нав’язувати йому чужу модель вимірювання.
Експлораторний факторний аналіз: коли структуру треба відкрити
Експлораторний факторний аналіз (EFA) застосовують, коли кількість факторів і схема зв’язків між пунктами ще не задані достатньо жорстко або коли нова шкала перебуває на етапі структурного пошуку. EFA дозволяє оцінити, скільки латентних факторів потрібно для опису спільної варіації пунктів, які пункти навантажуються на кожний фактор і чи є суттєві перехресні навантаження.
EFA — не натискання однієї кнопки. Результат залежить від матриці кореляцій, методу виділення факторів, способу визначення їх кількості, обертання, обробки пропусків та рішень щодо проблемних пунктів. Класичний огляд Fabrigar та співавторів показав, що технічні рішення в EFA можуть істотно змінювати висновки. Тому опис «проведено факторний аналіз і отримано три фактори» без методологічних деталей недостатній для оцінки доказів.
Скільки факторів залишати
Одна з найважчих задач EFA — визначити кількість факторів. Правило «власне значення > 1» не слід використовувати як єдиний автоматичний критерій. Скрі-графік корисний, але його інтерпретація частково суб’єктивна. Паралельний аналіз порівнює емпіричні власні значення з тими, які можна отримати у випадкових даних, і зазвичай дає змістовніший орієнтир. Сучасна методологічна література розглядає вибір кількості факторів як окреме модельне рішення; див. Goretzko.
Найкраще рішення ґрунтується не на одному числі, а на поєднанні статистичних критеріїв, теорії конструкта, простоти й інтерпретованості структури, достатньої кількості сильних індикаторів на фактор і стабільності рішення. Якщо паралельний аналіз натякає на чотири фактори, а теорія передбачає два, це не привід автоматично обрати «правильний» результат. Це привід з’ясувати, чи теорія надто проста, чи пункти змішують різні змісти, чи вибірка специфічна, чи метод аналізу невідповідний.
Обертання факторів
У психології фактори часто корелюють, тому косокутне обертання зазвичай змістово реалістичніше за ортогональне, яке примушує фактори бути некорельованими. Якщо тривога, уникання і негативний афект теоретично пов’язані, заборона кореляції між факторами може створити штучну картину. Вибір обертання має виходити з моделі конструкта, а не з традиції конкретної програми.
Факторні навантаження і перехресні навантаження
Факторне навантаження показує, наскільки індикатор пов’язаний із фактором у вибраній моделі. Не існує одного універсального числа, після якого пункт стає «валідним». Значення треба читати разом із розміром вибірки, кількістю індикаторів, спільностями, перехресними навантаженнями, змістом пункту й метою шкали. COSMIN у своїх критеріях для систематичних оглядів використовує навантаження ≥0,30 та обмеження на значні перехресні навантаження як частину операційного правила оцінювання EFA/PCA, але це саме рамка оцінювання доказів, а не універсальний природний закон.
Конфірматорний факторний аналіз: перевірка наперед заданої моделі
Конфірматорний факторний аналіз (CFA) потрібен, коли теоретична структура вже сформульована. Дослідник наперед задає, скільки факторів існує, які пункти мають навантажуватися на кожний фактор, чи можуть фактори корелювати, які параметри фіксуються та які обмеження накладаються на модель. CFA перевіряє, наскільки така модель відтворює спостережувану матрицю коваріацій або кореляцій.
Сильна CFA не починається з пошуку способу «отримати хороший CFI». Вона починається з чіткої теорії вимірювання. Якщо шкала нібито має три виміри, має бути змістове пояснення, чому конкретні пункти є індикаторами саме цих факторів, чому фактори пов’язані або незалежні, чи припускаються перехресні навантаження, і який бал планується інтерпретувати після аналізу.
χ²: точний тест відповідності
Статистика χ² перевіряє гіпотезу про точну відповідність моделі даним за заданими припущеннями. У великих вибірках навіть невеликі відхилення можуть робити χ² статистично значущим, тоді як у малих вибірках тест може мати недостатню чутливість до серйозної невідповідності. Тому структурну валідність не оцінюють за формулою «χ² незначущий — модель добра, значущий — модель погана».
CFI і TLI
CFI та TLI — порівняльні індекси відповідності: вони показують, наскільки запропонована модель покращує опис даних порівняно з базовою моделлю дуже слабких зв’язків між змінними. Значення ближче до 1 зазвичай свідчать про кращу відповідність, але конкретний поріг залежить від моделі, даних, методу оцінювання та мети аналізу.
RMSEA і SRMR
RMSEA оцінює приблизну помилку відповідності моделі з урахуванням її складності, а SRMR узагальнює стандартизовані розбіжності між спостережуваними та відтвореними кореляціями або коваріаціями. Вони відповідають на різні питання, тому корисно дивитися на кілька індексів одночасно, а не оголошувати модель підтвердженою за одним сприятливим числом.
Чи існують універсальні пороги CFI, TLI, RMSEA і SRMR
Відомі орієнтири CFI/TLI близько 0,95, SRMR близько 0,08 та RMSEA близько 0,06 походять насамперед із симуляційної роботи Hu і Bentler для певних моделей і умов. Вони стали популярними, а COSMIN використовує близькі критерії в операційній системі оцінювання структурної валідності. Проте ці числа не слід перетворювати на механічний пропускний пункт.
Marsh, Hau і Wen спеціально застерігали від «золотих правил» і некритичного перенесення порогових значень на всі моделі. Індекс відповідності залежить від ступенів свободи, кількості факторів та індикаторів, величини навантажень, розподілів, методу оцінювання, розміру вибірки й типу помилки моделі. Тому висновок «CFI = 0,949, отже тест невалідний» настільки ж слабкий, як «CFI = 0,951, отже тест доведено валідним».
Відповідність моделі — це не лише чотири індекси
Якісний аналіз структурної валідності розглядає всю модель: факторні навантаження та їх невизначеність; кореляції між факторами; залишки; локальні зони невідповідності; проблемні дисперсії; надто високі факторні кореляції; стійкість результатів; альтернативні теоретично правдоподібні моделі. Глобальні індекси можуть виглядати прийнятно, коли окрема важлива частина моделі працює погано.
Наприклад, двофакторна модель може мати добрі CFI і RMSEA, але кореляція між факторами 0,97 ставить практичне питання: чи справді це два розрізнювані виміри? Або модель може мати прийнятний глобальна відповідність, але два ключові пункти систематично навантажуватися на «чужий» фактор. Структурна інтерпретація потребує аналізу таких деталей.
Модифікаційні індекси: підказка, а не автоматичний ремонт
Модифікаційні індекси показують, де звільнення фіксованого параметра потенційно покращило б відповідність моделі. Вони корисні як діагностика, але небезпечні як алгоритм полювання за кращою відповідністю. Якщо після кожного запуску дозволяти нову кореляцію залишків або перехресне навантаження лише тому, що цього просить програма, модель поступово підлаштовується під випадкові особливості конкретної вибірки.
Зміна моделі має мати змістове пояснення. Корельовані залишки можуть бути виправдані, якщо два пункти мають майже однакове формулювання, спільний метод або специфічний контекст, але тоді варто запитати, чи не дублюють вони одне одного. Якщо модифікована модель народилася з даних, її бажано перевірити на новій вибірці або хоча б через заплановану процедуру перехресної перевірки.
EFA і CFA на одній вибірці: чому «відкрив і підтвердив» — слабке твердження
Якщо дослідник спочатку шукає структуру EFA, а потім на тих самих людях запускає CFA для тієї ж структури, друга процедура не є незалежним підтвердженням. Модель уже була вибрана з урахуванням випадкових особливостей цих даних. Такий CFA може описати, наскільки добре уточнена модель відтворює ту саму вибірку, але не дає сильного доказу відтворюваності.
Краща стратегія за достатнього N — розділити вибірку на дослідницьку і перевірочну або, ще сильніше, перевірити CFA у незалежній новій вибірці. У сучасних рекомендаціях з розробки шкал EFA і CFA часто розводять між етапом побудови та етапом оцінювання; це прямо відображено в огляді Stefana та співавторів.
Порядкові відповіді Лайкерта і вибір методу оцінювання
Багато психологічних шкал використовують відповіді на кшталт «ніколи — рідко — іноді — часто — майже завжди». Такі пункти є порядковими, а не ідеально неперервними. Якщо категорій мало, розподіли асиметричні або є виражені скупчення відповідей біля максимуму або мінімуму шкали, стандартна CFA з припущенням багатовимірної нормальності неперервних показників може давати викривлені оцінки.
Flora і Curran у симуляційному дослідженні показали переваги методів, пристосованих до порядкових даних, зокрема робастного зваженого методу найменших квадратів у багатьох розглянутих умовах. У сучасній практиці часто використовують поліхоричні кореляції та робастні оцінювачі для категоріальних індикаторів. Вибір методу має відповідати шкалі відповіді, розподілам і програмній реалізації, а не звичці дослідника.
Розмір вибірки: чому правило «10 осіб на пункт» не є законом
Для факторного аналізу немає універсального мінімуму N, який однаково працює для всіх тестів. Стабільність факторного рішення залежить від величини навантажень, спільностей, кількості індикаторів на фактор, кількості факторів, їх кореляцій, якості даних, методу оцінювання, пропусків і складності моделі. MacCallum та співавтори показали, що фіксовані правила на кшталт «5 або 10 респондентів на змінну» можуть бути дуже оманливими.
Це не означає, що розмір вибірки неважливий. Навпаки: малий N підвищує нестабільність навантажень, кореляцій факторів і індексів відповідності, особливо у слабко визначених або складних моделях. Замість магічного співвідношення бажано обґрунтувати вибірку через очікувану структуру, попередні навантаження, кількість параметрів, точність оцінок і, коли можливо, симуляцію або аналіз потужності для конкретної моделі.
PCA і факторний аналіз — не одне й те саме
Аналіз головних компонент (PCA) і спільний факторний аналіз можуть давати схожі картини в деяких даних, але мають різну логіку. PCA стискає загальну дисперсію спостережуваних змінних у компоненти; факторна модель намагається пояснити спільну варіацію латентними факторами й відокремити унікальну та помилкову варіацію. Якщо наукове питання стосується латентної будови психологічного конструкта, факторна модель зазвичай концептуально пряміша.
Тому фраза «PCA виявив три компоненти» не повинна автоматично перетворюватися на «доведено три латентні психологічні фактори». Fabrigar та співавтори детально розбирають відмінності та наслідки вибору методу. COSMIN допускає EFA/PCA у своїй операційній рубриці оцінювання досліджень, але це не стирає концептуальної різниці між редукцією даних і латентною моделлю.
KMO і тест Бартлетта не є доказом структурної валідності
Коефіцієнт Кайзера—Маєра—Олкіна (KMO) та тест сферичності Бартлетта часто подають у психометричних статтях перед EFA. KMO допомагає оцінити, чи має кореляційна структура достатньо спільної варіації для факторизації; тест Бартлетта перевіряє, чи відрізняється кореляційна матриця від одиничної. Вони можуть підтримувати рішення про доцільність факторного аналізу, але не відповідають на питання, чи правильна факторна структура.
Статистично значущий тест Бартлетта у великій вибірці дуже легко отримати навіть за слабких кореляцій. Високий KMO також не показує, скільки факторів має бути, чи відповідають вони теорії та чи можна підсумовувати всі пункти в один бал. Отже, KMO і тест Бартлетта — передумовні діагностики, а не сертифікат валідності.
Одновимірність: потрібна не кожному тесту, але критична для певних балів
Одновимірність означає, що один домінантний латентний вимір достатньо пояснює залежності між індикаторами для передбаченого способу вимірювання. Вона особливо важлива, коли всі пункти планують складати в один загальний бал або коли застосовують моделі IRT і Раша, що припускають один основний вимір.
Проте психологічні конструкти часто ієрархічні. Наприклад, загальний конструкт може мати кілька пов’язаних підвимірів. У такому разі можуть розглядатися корельовані фактори першого порядку, фактор вищого порядку або біфакторна модель. Вибір має бути теоретично мотивованим. Факт, що складніша модель дає кращу відповідність, ще не означає, що загальний бал психометрично виправданий.
Біфакторні й ієрархічні моделі: не машинка для виправлення відповідності
Біфакторна модель дозволяє кожному пункту навантажуватися на загальний фактор і водночас на специфічний груповий фактор. Вона може бути корисною, коли теорія передбачає одночасно загальну та доменно-специфічну варіацію. Але через високу гнучкість така модель нерідко покращує глобальну відповідність навіть тоді, коли її параметри нестабільні або специфічні фактори слабко визначені.
Перед висновком про «сильний загальний фактор» варто дивитися не лише на CFI/RMSEA, а й на величину й патерн навантажень, надійність загального та специфічних факторів, інтерпретованість і відтворюваність структури. Ієрархічна модель відповідає іншій теоретичній гіпотезі: фактори першого порядку пояснюються фактором вищого порядку. Ці моделі не є взаємозамінними косметичними способами покращити відповідність.
Структурна валідність у IRT і моделях Раша
У теорії відповіді на завдання (IRT) та моделях Раша структурна валідність пов’язана не лише з числом факторів. Треба перевіряти щонайменше вимірність, локальну незалежність і, залежно від моделі, монотонність та загальну відповідність моделі. Локальна незалежність означає, що після врахування латентної ознаки відповіді на пункти не повинні залишатися надмірно залежними через спільне формулювання, контекст або інший прихований чинник.
У COSMIN Manual 2.0 для оцінювання доказів за IRT і моделями Раша структурної валідності окремо наведено критерії для одновимірності, локальної незалежності, монотонності та відповідність моделі. Це корисно як систематизована рамка, але конкретне дослідження має також описати тип моделі IRT або Раша, метод оцінювання, спосіб перевірки припущень і правила виключення пунктів; такі вимоги наголошує й COSMIN Reporting Guideline 2.0.
Структурна валідність і інваріантність вимірювання
Модель може добре описувати загальну вибірку й водночас працювати по-різному в групах. Наприклад, однакова назва факторів може приховувати різні навантаження пунктів у чоловіків і жінок, молодших і старших людей або в різних мовних групах. Для коректного порівняння груп потрібно окремо перевіряти інваріантність вимірювання.
Putnick і Bornstein описують послідовність конфігуральної, метричної, скалярної та, за потреби, строгої інваріантності. Конфігуральна інваріантність стосується подібності самої конфігурації факторів; метрична — навантажень; скалярна — інтерцептів або порогів. Отже, структурна валідність є необхідним підґрунтям для багатьох групових порівнянь, але інваріантність вимірювання — окреме питання.
Інваріантність вимірювання не означає автоматичної відсутності упередження, так само як її порушення не доводить дискримінаційності тесту. Це статистичний сигнал про те, що параметри вимірювання відрізняються. Причину треба досліджувати: переклад, культурна релевантність, різне розуміння формулювань, реальна неоднорідність конструкта, методичний ефект або диференційне функціонування окремих пунктів.
Переклад тесту не гарантує збереження факторної структури
Навіть якісний прямий і зворотний переклад не є доказом того, що україномовна версія має ту саму вимірну модель, що й оригінал. Зміна формулювання може змінити складність пункту, емоційний відтінок, соціальну бажаність або зв’язок із латентним фактором. Культурний контекст також може змінити спосіб, яким люди організують відповіді.
Тому для української адаптації слід окремо перевіряти структурну валідність у релевантній українській вибірці, а для порівнянь з оригінальною або іншими мовними версіями — інваріантність та інші аспекти кроскультурної валідності. «Є український переклад» і «є валідована українська версія» — різні твердження.
Структурна валідність і спосіб підрахунку балів
Факторна структура має прямі наслідки для підрахунку балів. Якщо шкала стабільно має три розрізнювані фактори, механічне складання всіх пунктів у один загальний бал може змішувати різні психологічні виміри. Якщо дані підтримують загальний фактор разом із підфакторами, треба окремо обґрунтувати, чи достатньо надійний і змістовний загальний бал, чи краще інтерпретувати підшкали.
Це особливо важливо в клінічних і скринінгових інструментах. Структурна валідність не перетворює сумарний бал на діагноз і не визначає автоматично порогове значення. Діагностична точність, чутливість, специфічність, позитивна й негативна прогностична цінність, клінічна корисність і пороги — інші властивості, які потребують окремих досліджень.
Що робити, якщо CFA показує погану відповідність
Погана відповідність — не технічна аварія, яку треба будь-якою ціною «полагодити». Вона може означати, що теорія конструкта неповна, деякі пункти вимірюють інші змісти, є методичний фактор, кількість факторів задана неправильно, категоріальні дані проаналізовані невідповідним оцінювачем, у вибірці змішані різні підгрупи або модель занадто жорстко забороняє реальні перехресні навантаження.
Розумний порядок дій: перевірити якість даних і кодування; переглянути описові характеристики пунктів; переконатися, що оцінювач відповідає типу даних; дослідити навантаження та залишки; повернутися до змісту проблемних пунктів; порівняти заздалегідь правдоподібні альтернативні моделі; позначити будь-які зміни після перегляду даних як дослідницькі; перевірити модифіковану модель на нових даних.
Типові помилки під час оцінювання структурної валідності
Перша помилка — оголосити високий α Кронбаха доказом одного фактора. Друга — вважати значущий тест Бартлетта доказом валідності. Третя — прирівняти PCA до підтвердженої латентної моделі. Четверта — обрати кількість факторів лише за правилом «власне значення > 1». П’ята — використати ортогональне обертання тільки тому, що воно стоїть у програмі за замовчуванням.
Шоста помилка — оцінити CFA за одним індексом відповідності. Сьома — читати поріг 0,95 або 0,06 як абсолютну межу істини. Восьма — додавати кореляції залишків за модифікаційними індексами без теорії. Дев’ята — провести EFA і «підтвердити» його CFA на тих самих даних. Десята — ігнорувати порядкову природу відповідей і застосувати оцінювач, який погано відповідає даним.
Одинадцята помилка — користуватися магічним правилом розміру вибірки замість обґрунтування стабільності конкретної моделі. Дванадцята — видаляти кожний пункт із навантаженням нижче довільного порога, не оцінюючи змістову втрату. Тринадцята — вважати, що модель з найкращою відповідністю автоматично має найкращий психологічний сенс. Чотирнадцята — припускати, що структура оригінальної мовної версії автоматично переноситься на переклад.
Практичний алгоритм оцінювання структурної валідності
1. Зафіксуйте теоретичну модель до аналізу
Опишіть конструкт, очікувану кількість вимірів, зв’язки між ними та спосіб підрахунку балів. Для CFA бажано визначити модель до перегляду індексів відповідності. Якщо структура невідома або шкала нова, прямо позначте EFA як дослідницький етап.
2. Перевірте, чи відповідає модель природі індикаторів
З’ясуйте, чи пункти є рефлективними індикаторами латентного конструкта, чи це формативний індекс або чекліст різнорідних подій. У другому випадку вимога однорідної факторної структури може бути методологічно хибною.
3. Оцініть якість даних
Перевірте пропуски, частоти категорій, асиметрію, екстремальні скупчення відповідей біля максимуму або мінімуму шкали, помилки кодування, дублікати, інверсні пункти та нестабільні категорії відповіді. Частина «факторних проблем» насправді є проблемами підготовки даних.
4. Оберіть аналіз і оцінювач
Для дослідницького пошуку — обґрунтований EFA; для перевірки заздалегідь визначеної структури — CFA; для IRT і моделей Раша — відповідна модель і перевірка її припущень. Для порядкових пунктів розгляньте методи, що коректно працюють із категоріальними даними. Не обирайте метод лише тому, що він найпростіший у конкретній програмі.
5. Визначте кількість факторів кількома джерелами інформації
Поєднуйте теорію, паралельний аналіз, графік осипу, стабільність і інтерпретованість факторів. Не покладайтеся виключно на правило «власне значення > 1». Якщо методи суперечать один одному, покажіть цю невизначеність замість вибіркового звітування лише зручного критерію.
6. Читайте локальні параметри, а не лише глобальну відповідність
Оцініть навантаження, перехресні навантаження, кореляції факторів, залишки, проблемні пункти та незвичні параметри. У CFA перевірте кілька індексів відповідності і довірчі інтервали там, де вони доступні. У моделях IRT і Раша — локальну незалежність, монотонність і відповідність пунктів та моделі.
7. Пов’яжіть модель зі способом інтерпретації балів
Поясніть, які бали підтримує структура: один загальний, кілька підшкал, ієрархічну систему або інший спосіб підрахунку. Якщо модель не підтримує запланований загальний бал, не приховуйте це за високою надійністю.
8. Перевірте відтворюваність
Модель, отримана на одній вибірці, є початком, а не завершенням доказів. За можливості перевірте її в незалежній вибірці, у релевантних групах, у потрібній мовній версії та в умовах, де тест реально використовуватиметься.
Як читати результат дослідження структурної валідності
Сильний звіт дозволяє відповісти щонайменше на дев’ять питань: яка теоретична модель; хто увійшов у вибірку; який тип пунктів; який аналіз; який оцінювач; як визначали число факторів; які навантаження і проблемні пункти; як оцінювали відповідність; чи перевіряли модель незалежно. Якщо більшість цієї інформації відсутня, висновок «структурну валідність підтверджено» треба читати обережно.
COSMIN Reporting Guideline рекомендує для факторного аналізу описувати тип аналізу, метод оцінювання, критерії відповідності моделі і правила збереження або виключення пунктів, а для IRT і моделей Раша — також способи перевірки вимірності, локальної незалежності та монотонності. Така прозорість важливіша за декоративний список коефіцієнтів.
Структурна валідність у клінічній і дослідницькій практиці
Для дослідника структурна валідність визначає, що саме можна робити з балами: чи допустимий загальний показник, чи потрібні окремі підшкали, чи можна порівнювати групи та чи відтворюється теоретична модель. Помилка на цьому рівні поширюється далі на кореляції, регресії, медіації, групові порівняння та оцінку ефектів.
Для клініциста або практичного психолога головне питання простіше: чи має бал, який я бачу, психометрично обґрунтовану структуру саме в релевантній популяції? Навіть хороша факторна структура не дозволяє ставити діагноз за одним балом. Структурна валідність не замінює клінічної оцінки, норм, оцінки надійності, діагностичної точності, історії людини та професійного судження.
Для користувача адаптованого тесту важливо перевірити не тільки наявність перекладу, а й публікацію психометричних даних саме для цієї версії. Якщо українська версія просто відтворює текст оригіналу, але її факторна структура не досліджувалася, структурна валідність для української інтерпретації залишається непідтвердженою.
Науковий статус і межі висновку
Структурна валідність є усталеною складовою сучасної психометричної оцінки. Факторний аналіз, CFA, IRT і моделі Раша мають розвинену методологічну базу, а міжнародні стандарти прямо включають внутрішню структуру до валідизаційного аргументу. Водночас немає універсального алгоритму, який за одним набором порогових значень автоматично вирішує, «правильний» тест чи ні.
Невизначеність виникає через модельну природу психометрії. Різні теоретично правдоподібні моделі можуть описувати ті самі дані; показники відповідності залежать від умов; факторна структура може змінюватися між популяціями; модифікації моделі можуть відтворювати випадковий шум. Сильний висновок спирається на теорію, прозорий аналіз, кілька видів діагностики та реплікацію.
Поширені запитання
Чи означає високий α Кронбаха, що шкала одновимірна?
Ні. α Кронбаха оцінює аспект внутрішньої узгодженості за певними припущеннями, але не встановлює кількість факторів. Багатовимірний набір пунктів може мати високий α. Одновимірність перевіряють моделями внутрішньої структури.
Чи може багатовимірний тест мати хорошу структурну валідність?
Так. Якщо теорія передбачає кілька вимірів і дані підтримують відповідну структуру, багатовимірність є очікуваним результатом. Структурна валідність означає відповідність теоретичній будові, а не обов’язкову однофакторність.
Що краще: EFA чи CFA?
Вони відповідають на різні етапи питання. EFA корисний, коли структуру досліджують; CFA — коли перевіряють наперед сформульовану модель. Для нової шкали часто логічний послідовний шлях EFA → незалежна CFA, але конкретний дизайн залежить від теорії та наявних доказів.
Який CFI або RMSEA вважається хорошим?
Орієнтири близько CFI/TLI ≥0,95, RMSEA ≤0,06, SRMR ≤0,08 часто цитують із Hu і Bentler та використовують у деяких методологічних рамках, зокрема COSMIN. Це не універсальні межі істини. Оцінюйте кілька індексів, параметри моделі, дані, метод оцінювання, складність і теоретичний сенс.
Чи достатньо KMO і тесту Бартлетта?
Ні. Вони допомагають оцінити придатність кореляційної матриці до факторизації, але не показують, чи правильна кількість факторів і чи відповідає структура теорії.
Чи можна підтвердити структуру CFA на тій самій вибірці після EFA?
Можна описати відповідність моделі на тих самих даних, але називати це незалежним підтвердженням слабко. Для сильнішого доказу потрібна перевірочна підвибірка або нова вибірка.
Чи доводить хороша факторна структура, що поріг клінічно правильний?
Ні. Структурна валідність і діагностична точність — різні властивості. Порогове значення потребує окремої перевірки щодо зовнішнього критерію, базової частоти стану, наслідків хибнопозитивних і хибнонегативних рішень та передбаченого використання.
Чи достатньо перекласти тест українською і повторити оригінальну модель?
Ні. Переклад — лише частина адаптації. Українська версія потребує власних доказів структурної валідності в релевантній вибірці, а для порівнянь між мовами або групами — окремої перевірки інваріантності та інших аспектів кроскультурної валідності.
Короткий висновок
Структурна валідність відповідає на принципове питання психометрії: чи організовані відповіді на тест так, як передбачає теорія конструкта. Її не можна звести до α Кронбаха, одного факторного навантаження або магічного CFI. Сильний доказ поєднує теоретично визначену модель, адекватний тип факторного або аналізу IRT або Раша, правильний оцінювач, локальні й глобальні діагностики, обґрунтований розмір вибірки та перевірку відтворюваності.
У практичному читанні будь-якого психологічного тесту корисно запитати: який саме бал ми хочемо інтерпретувати, яку структуру він припускає і де показано, що ця структура працює для потрібної популяції та мовної версії? Це питання захищає від однієї з найпоширеніших психометричних помилок — від упевненого тлумачення числа, внутрішня будова якого ще не обґрунтована.
Пов’язані статті
Психометрія: що це, що вона вимірює і як оцінюють якість психологічних тестів — базова сторінка про психологічне вимірювання, якість тестів, надійність, валідність і похибку.
Надійність психологічного тесту: що це, які бувають види і чому надійність не дорівнює валідності — окремий розбір відтворюваності балів, видів надійності та меж коефіцієнта α.
Конструктна валідність: як перевіряють, що тест вимірює саме задуманий психологічний конструкт — ширший контекст перевірки відповідності психологічному конструкту.
Джерела
American Educational Research Association, American Psychological Association, & National Council on Measurement in Education. (2014). Standards for Educational and Psychological Testing.
Boateng, G. O., Neilands, T. B., Frongillo, E. A., Melgar-Quiñonez, H. R., & Young, S. L. (2018). Best Practices for Developing and Validating Scales for Health, Social, and Behavioral Research: A Primer. Frontiers in Public Health, 6, 149.
de Arruda, G. T., Terwee, C. B., Elsman, E. B. M., Avila, M. A., Gagnier, J. J., Mokkink, L. B., & PROM Reporting Group. (2025). Explanation & Elaboration document of the COSMIN Reporting Guideline 2.0 for studies on measurement properties of patient-reported outcome measures. Quality of Life Research, 34(7), 1891–1899.
Fabrigar, L. R., Wegener, D. T., MacCallum, R. C., & Strahan, E. J. (1999). Evaluating the Use of Exploratory Factor Analysis in Psychological Research. Psychological Methods, 4(3), 272–299.
Flora, D. B., & Curran, P. J. (2004). An Empirical Evaluation of Alternative Methods of Estimation for Confirmatory Factor Analysis With Ordinal Data. Psychological Methods, 9(4), 466–491.
Goretzko, D. (2022). Factor Retention in Exploratory Factor Analysis With Missing Data. Educational and Psychological Measurement, 82(3), 444–464.
Hu, L.-T., & Bentler, P. M. (1999). Cutoff Criteria for Fit Indexes in Covariance Structure Analysis: Conventional Criteria Versus New Alternatives. Structural Equation Modeling, 6(1), 1–55.
MacCallum, R. C., Widaman, K. F., Zhang, S., & Hong, S. (1999). Sample Size in Factor Analysis. Psychological Methods, 4(1), 84–99.
Marsh, H. W., Hau, K.-T., & Wen, Z. (2004). In Search of Golden Rules: Comment on Hypothesis-Testing Approaches to Setting Cutoff Values for Fit Indexes and Dangers in Overgeneralizing Hu and Bentler’s (1999) Findings. Structural Equation Modeling, 11(3), 320–341.
Mokkink, L. B., Elsman, E. B. M., & Terwee, C. B. (2024). COSMIN guideline for systematic reviews of patient-reported outcome measures version 2.0. Quality of Life Research.
Putnick, D. L., & Bornstein, M. H. (2016). Measurement Invariance Conventions and Reporting: The State of the Art and Future Directions for Psychological Research. Developmental Review, 41, 71–90.
Stefana, A., Damiani, S., Granziol, U., Provenzani, U., Solmi, M., Youngstrom, E. A., & Fusar-Poli, P. (2025). Psychological, Psychiatric, and Behavioral Sciences Measurement Scales: Best Practice Guidelines for Their Development and Validation. Frontiers in Psychology, 15, 1494261.
