top of page

Психологічна енкциклопедія

Конфірматорний факторний аналіз (CFA): як перевіряють теоретичну структуру психологічного тесту

6 днів тому
Читати 18 хв

Оновлено: 6 днів тому

Автор: Український психологічний ХАБ · Опубліковано: 23 вересня 2026 · Редакційна політика


Конфірматорний факторний аналіз (confirmatory factor analysis, CFA; українською також уживають назву «підтверджувальний факторний аналіз») — це метод моделювання латентних змінних, за допомогою якого перевіряють, наскільки заздалегідь сформульована теоретична структура психологічного вимірювання узгоджується з емпіричними даними. Дослідник не просить алгоритм «знайти будь-які фактори», а задає модель наперед: скільки латентних факторів очікується, які пункти мають бути їхніми індикаторами, чи можуть фактори корелювати, які перехресні навантаження або кореляції залишків допускаються.


У психометрії CFA найчастіше використовують для перевірки внутрішньої структури шкали або тесту. Це один із центральних інструментів оцінювання структурної валідності: чи підтримують дані той спосіб, у який теорія пропонує об’єднувати окремі відповіді в підшкали, фактори або загальний бал.


CFA не «доводить теорію» і не перетворює хороший набір індексів відповідності на сертифікат істинності тесту. У сучасних Standards for Educational and Psychological Testing внутрішня структура є одним із джерел доказів валідності для конкретної інтерпретації та використання балів. Тому результат CFA треба читати разом зі змістом пунктів, якістю вибірки, оцінюванням надійності, зв’язками з іншими змінними, процесом відповіді, наслідками використання та контекстом застосування.


Ключова ідея проста: CFA перевіряє не те, чи «гарний тест взагалі», а те, чи є конкретна наперед задана вимірювальна модель достатньо сумісною з конкретними даними, щоб її подальша інтерпретація була обґрунтованою.


Що саме перевіряє CFA


Більшість психологічних конструктів не спостерігаються безпосередньо. Тривожність, робоча пам’ять, емпатія, самоповага або емоційна регуляція не лежать у даних як готові числа. Ми спостерігаємо відповіді на пункти, результати завдань, рейтинги або поведінкові показники й припускаємо, що спільна варіація цих індикаторів пов’язана з одним чи кількома латентними факторами. Детальніше це розрізнення пояснює стаття про латентні й спостережувані змінні.


CFA формалізує таке припущення як вимірювальну модель. Наприклад, теорія може стверджувати, що шість пунктів вимірюють два пов’язані фактори: три пункти — когнітивну тривогу, ще три — соматичну. У CFA дослідник прямо задає цю двофакторну структуру й перевіряє, чи може вона правдоподібно відтворити спостережувані зв’язки між відповідями.


Тому об’єктом перевірки є ціла система обмежень: належність індикаторів до факторів, величини факторних навантажень, кореляції між факторами, залишкові дисперсії та, якщо це теоретично обґрунтовано, окремі додаткові зв’язки. Модель оцінюється як цілісна структура, а не як набір незалежних коефіцієнтів.


Якщо дані погано узгоджуються з моделлю, це може означати різні речі: теоретична структура неповна; певні пункти працюють інакше; модель занадто жорстка; оцінювач не відповідає типу даних; вибірка замала; розподіли або пропуски оброблено невдало; є локальна залежність пунктів; або потрібна інша модель. CFA локалізує проблему, але її змістове пояснення залишається психометричним і теоретичним завданням.


CFA, EFA і PCA відповідають на різні питання


Експлораторний факторний аналіз (EFA) використовують, коли структура ще досліджується: скільки факторів може бути доречним, які індикатори з ними пов’язані, які перехресні навантаження виникають. CFA використовують, коли структура сформульована наперед і її потрібно перевірити як гіпотезу. Межа між методами не завжди абсолютна, але різниця в логіці принципова: EFA шукає структуру з меншою кількістю попередніх обмежень, CFA перевіряє конкретну структуру.


Аналіз головних компонент (PCA) має іншу мету: він стискає спостережувану варіацію у компоненти. PCA не є синонімом факторного аналізу й не моделює спільну та унікальну дисперсію так, як латентна факторна модель. Тому успішний PCA не замінює CFA, якщо дослідницьке питання стосується теоретичного латентного конструкта.


На практиці хороша стратегія розробки нового інструмента часто розводить дослідницькі фази: структура формується з теорії, змістового аналізу й, за потреби, EFA, а потім перевіряється CFA на незалежних або принаймні належно розділених даних. Перетворення тієї самої вибірки на безкінечний цикл «пошуку» і «підтвердження» робить підтверджувальну логіку значно слабшою.


Як влаштована конфірматорна факторна модель


Латентні фактори та індикатори


Латентний фактор — теоретична змінна, яку безпосередньо не спостерігають. Індикатор — вимірювана змінна: відповідь на пункт, результат завдання, оцінка спостерігача. CFA описує, як очікуване значення та коваріації індикаторів пов’язані з латентними факторами.


У найпростішій однофакторній моделі кожен індикатор можна уявити як суму частини, пов’язаної зі спільним фактором, і залишкової частини. Ця залишкова частина не означає «помилку» в побутовому сенсі: вона охоплює унікальну варіацію індикатора та вимірювальну похибку, яку модель не пояснює фактором.


Факторні навантаження


Факторне навантаження показує силу й напрям зв’язку індикатора з фактором у межах заданої моделі. Високе стандартизоване навантаження зазвичай означає, що індикатор сильно пов’язаний із фактором, але універсального числа, після якого пункт автоматично стає «хорошим», немає. Значення треба тлумачити разом зі змістом пункту, точністю оцінки, структурою моделі та призначенням шкали.


Статистична значущість навантаження також не є достатньою. У великій вибірці дуже мале навантаження може бути статистично відмінним від нуля, залишаючись слабким з практичного погляду. Для психометричної інтерпретації важливі величина ефекту, стандартна похибка або довірчий інтервал і зміст індикатора.


Кореляції факторів


Коли модель містить кілька пов’язаних конструктів, фактори часто дозволяють корелювати. Надто висока латентна кореляція може ставити питання, чи справді два фактори відрізняються. Це пов’язано з дискримінантною валідністю, але жоден окремий поріг латентної кореляції не є універсальним доказом або спростуванням відмінності конструктів.


Залишкові дисперсії та локальна залежність


Кожен індикатор має залишкову дисперсію. У стандартній простій CFA часто припускають, що залишки різних пунктів не корелюють після врахування факторів. Якщо два майже однаково сформульовані пункти мають додатковий спільний методичний компонент, це припущення може порушуватися. Дозволяти корельовані залишки варто через теоретичне або методичне пояснення, а не лише тому, що так покращується fit.


Що задають до аналізу


Підтверджувальна сила CFA виникає з обмежень, сформульованих до перегляду результатів. Дослідник визначає кількість факторів, список їхніх індикаторів, допустимі кореляції факторів, зафіксовані нульові навантаження, можливі перехресні навантаження, структуру залишків і спосіб масштабування латентних змінних.


Теоретично сильна модель пояснює, чому саме цей пункт належить саме цьому фактору. Слабка модель фактично каже: «ми будемо змінювати зв’язки, доки індекси стануть красивими». У другому випадку процедура поступово втрачає підтверджувальний характер і перетворюється на постфактум-пошук структури.


Добре, коли основна модель, ключові альтернативи, оцінювач, правила роботи з пропусками, критерії оцінювання fit і заплановані перевірки інваріантності визначені заздалегідь. Пререгістрація не є обов’язковою умовою CFA, але вона робить межу між підтверджувальними й експлораторними рішеннями значно прозорішою.


Ідентифікація моделі: чому не кожну схему можна оцінити


Щоб оцінити параметри CFA, модель має бути ідентифікованою: спостережувані дані повинні містити достатньо інформації для однозначного оцінювання вільних параметрів за прийнятими припущеннями. Якщо різні набори параметрів однаково добре відтворюють дані, задача не має унікального розв’язку.


Латентний фактор не має природної одиниці виміру, тому його шкалу треба задати. Типові способи — зафіксувати одне факторне навантаження на 1 або зафіксувати дисперсію фактора. Це технічна умова масштабування, а не твердження, що вибраний «маркерний» пункт є ідеальним.


Проблеми ідентифікації можуть проявлятися як неможливість збіжності, надзвичайно великі стандартні похибки, кореляції факторів поза допустимою межею або інші неприйнятні розв’язки. Такі результати не варто маскувати добором іншого набору індексів fit: спочатку треба з’ясувати, чи сама модель математично й психометрично осмислена.


Тип даних визначає спосіб оцінювання


Вибір оцінювача — частина моделі, а не технічна дрібниця. Класичний maximum likelihood (ML) найприродніше працює з безперервними індикаторами за відповідних розподільчих припущень. Якщо нормальність порушена, застосовують робастні варіанти ML або інші методи, але вибір залежить від структури даних.


Пункти типу Лайкерта є порядковими категоріальними змінними. Для них часто використовують категоріальну CFA на основі порогів і поліхоричних кореляцій із робастним weighted least squares / diagonally weighted least squares, зокрема WLSMV. Класична симуляційна робота Flora & Curran (2004) показала добру поведінку робастного WLS у досліджених умовах, а Li (2016) продемонстрував, що відносна поведінка WLSMV і robust ML залежить від кількості категорій, розміру вибірки та форми латентних розподілів.


Отже, правило «для всіх Likert-пунктів завжди один оцінювач» теж надто грубе. Потрібно враховувати кількість категорій, асиметрію відповідей, розмір вибірки, пропуски, складність моделі та програмну реалізацію. У звіті варто називати оцінювач і пояснювати, чому він відповідає даним.


Пропущені дані


Спосіб роботи з пропусками має узгоджуватися з оцінювачем і механізмом пропущеності. Просте видалення всіх випадків із хоча б одним пропуском може суттєво зменшити вибірку й змінити її склад. У CFA слід явно повідомляти частку пропусків, метод їх обробки та припущення, від яких залежить цей метод.


Скільки учасників потрібно для CFA


Універсального правила «CFA потребує N = 200» не існує. Не існує й надійного загального правила на кшталт «10 людей на один пункт». Потрібний розмір вибірки залежить від кількості факторів та індикаторів, сили навантажень, величини факторних кореляцій, типу даних, кількості категорій, частоти рідкісних відповідей, оцінювача, пропусків і того, який параметр або тип невідповідності дослідник хоче виявити.


У симуляційному дослідженні Wolf та співавт. (2013) вимоги до N істотно змінювалися залежно від параметрів моделі; одна фіксована цифра не забезпечувала однакову точність, потужність і коректність розв’язку в різних умовах.


Для важливих досліджень корисніші апріорний аналіз потужності для конкретної задачі або Monte Carlo симуляція з параметрами, подібними до запланованої моделі. Це дозволяє поставити практичне питання: чи буде вибірка достатньою саме для тих навантажень, кореляцій, рівня misspecification і пропусків, які мають значення в цьому дослідженні?


Як оцінюють відповідність моделі даним


Model fit — це відповідність між коваріаційною або кореляційною структурою, яку передбачає модель, і структурою, що спостерігається в даних. Жоден індекс не описує всю відповідність. Тому сучасна практика зазвичай поєднує глобальні індекси, параметри моделі, залишки й змістову оцінку.


χ²: тест точної відповідності


Модельний χ² перевіряє жорстку нульову гіпотезу, що модель точно відтворює відповідну популяційну матрицю за умов оцінювання. Статистично значущий χ² означає відхилення від точної відповідності, але його чутливість до розміру вибірки робить просте правило «p > 0,05 = добра модель» непридатним як єдиний критерій.


У великій вибірці навіть невелика практично несуттєва невідповідність може дати значущий χ². У малій вибірці, навпаки, тест може не мати достатньої чутливості. χ² треба повідомляти, але тлумачити разом з іншими показниками.


CFI


Comparative Fit Index (CFI) порівнює досліджувану модель із базовою моделлю, яка зазвичай припускає відсутність коваріацій між індикаторами. Вищі значення означають кращу відносну відповідність, але величина CFI залежить від характеристик моделі та якості вимірювання.


TLI


Tucker–Lewis Index (TLI, також NNFI в деякій літературі) теж є інкрементним індексом і враховує складність моделі. Він корисний разом із CFI, але не є незалежним «другим голосом істини»: обидва індекси мають споріднену логіку й можуть реагувати на модельні характеристики.


RMSEA


Root Mean Square Error of Approximation (RMSEA) оцінює приблизну невідповідність моделі з урахуванням ступенів свободи. Для RMSEA варто повідомляти не лише точкову оцінку, а й довірчий інтервал. Особливо в моделях із малими ступенями свободи поведінка RMSEA може бути нетривіальною, тому механічне рішення за одним порогом ризиковане.


SRMR


Standardized Root Mean Square Residual (SRMR) узагальнює стандартизовані різниці між спостережуваними й передбаченими моделлю зв’язками. Нижче значення означає менші середні стандартизовані залишки. Проте середня величина може приховувати кілька дуже проблемних локальних залишків.


Чому пороги CFI, TLI, RMSEA і SRMR не є законами


Одна з найпоширеніших практик у CFA — перевірити, чи CFI/TLI перетнули певну межу, а RMSEA/SRMR залишилися нижче певного числа. Часто цитують симуляції Hu & Bentler (1999), з яких походять відомі орієнтири приблизно CFI/TLI ≈ .95, RMSEA ≈ .06 і SRMR ≈ .08 для досліджених ними умов.


Ці числа стали корисними історичними орієнтирами, але перетворювати їх на універсальний закон не можна. Уже Marsh, Hau & Wen (2004) прямо застерігали від «золотих правил» і перенесення симуляційних порогів на всі моделі без урахування контексту.


Методологічні дослідження показують, що fit-індекси залежать від сили факторних навантажень, кількості індикаторів і факторів, типу misspecification та інших властивостей моделі. McNeish, An & Hancock (2018) продемонстрували сильну залежність індексів від якості вимірювання, а Heene та співавт. (2011) показали, як збільшення унікальних дисперсій може маскувати невідповідність.


Сучасна лінія dynamic fit index cutoffs пропонує формувати модель-специфічні орієнтири через симуляції. McNeish & Wolf (2023) описали цей підхід для CFA, а пізніша робота McNeish (2023) показала, що звичні пороги, отримані для безперервних даних, можуть погано переноситися на категоріальні Likert-відповіді.


Тому сильний висновок звучить не «CFI = .951, отже модель доведена», а «сукупність глобальних і локальних показників, параметрів та змістових аргументів свідчить, що ця модель є достатньо правдоподібним описом даних для заявленої мети, з такими-то обмеженнями».


Глобальна і локальна відповідність


Глобальні індекси стискають велику кількість інформації в кілька чисел. Це зручно, але небезпечно: середня загальна відповідність може виглядати прийнятною, навіть якщо конкретна пара індикаторів систематично відтворюється погано.


Тому після CFI/TLI/RMSEA/SRMR варто дивитися на локальні залишки, параметри й ділянки, де модель помиляється. У методичному огляді Kline (2024) підкреслюється, що відповідність SEM-моделі має оцінюватися і на глобальному, і на локальному рівні: добрий середній fit не гарантує відсутності серйозної локальної misspecification.


На практиці це означає аналіз стандартизованих залишків, проблемних коваріацій, аномальних параметрів, дуже великих modification indices, неочікуваних факторних кореляцій та інших сигналів. Кожен сигнал потребує змістового пояснення.


Неприйнятні розв’язки і попереджувальні сигнали


CFA може формально збігтися, але дати параметри, які свідчать про проблему. Класичний приклад — негативна оцінка дисперсії, дуже часто названа Heywood case. Інші сигнали — стандартизоване навантаження за межами очікуваного діапазону, майже одинична або надмірна факторна кореляція, величезні стандартні похибки, нестабільність результатів при невеликих змінах моделі.


Такі випадки не слід «ремонтувати» автоматичним видаленням пункту. Причина може бути в невдалій специфікації, надмірній подібності факторів, слабкій вибірці, особливостях категоріальних даних, локальній залежності, неправильних обмеженнях або реальній невідповідності теорії.


Modification indices: діагностика, а не команда


Modification index оцінює, наскільки очікувано покращиться певна характеристика fit, якщо зараз зафіксований параметр зробити вільним. Наприклад, програма може запропонувати дозволити перехресне навантаження або кореляцію залишків.


Це корисний діагностичний інструмент, але не автоматичний алгоритм побудови шкали. Якщо додавати всі запропоновані параметри по черзі на тій самій вибірці, модель починає підлаштовуватися під випадкові особливості конкретних даних.


Зміна моделі має мати теоретичне або методичне пояснення: схоже формулювання пунктів, спільний контекст, очевидний перехресний зміст, відомий методичний фактор. Постфактум-зміни треба позначати як експлораторні й, бажано, перевіряти на незалежній вибірці.


Порівняння альтернативних моделей


Один із сильних сценаріїв CFA — порівнювати кілька теоретично осмислених моделей. Наприклад: однофакторну модель, модель із двома корельованими факторами, модель другого порядку або біфакторну модель. Важливо, щоб кожна альтернатива мала змістове обґрунтування, а не була створена лише заради кращого числа.


Для вкладених моделей можуть застосовуватися різновиди χ² difference test, причому конкретна процедура залежить від оцінювача й корекцій. Для моделей, які порівнюються через likelihood і не є вкладеними, інколи розглядають інформаційні критерії на кшталт AIC і BIC. Вони відповідають на інше питання, ніж абсолютний або приблизний fit, тому їх не варто змішувати в один «бал якості».


Найкраща модель серед поганого набору альтернатив не стає доброю автоматично. Порівняння говорить, яка з розглянутих моделей краще відповідає критерію; воно не доводить, що жодна інша структура не описала б дані краще.


Біфакторні й ієрархічні моделі


У психологічних тестах часто виникає питання про загальний бал і підшкали. Модель другого порядку припускає, що кореляції між факторами першого порядку пояснюються вищим фактором. Біфакторна модель задає загальний фактор, на який навантажуються всі або більшість пунктів, і специфічні фактори, що пояснюють додаткову спільну варіацію.


Ці моделі мають різну психологічну інтерпретацію. Кращий fit біфакторної моделі не означає автоматично, що загальний бал є найкращим, а специфічні підшкали зайві. Потрібні оцінка сили загального й специфічних факторів, надійності відповідних балів, змісту індикаторів і практичної мети.


Складніша модель має більше свободи описувати дані, тому додаткові параметри повинні виправдовуватися не лише статистично. Модель, яку неможливо стабільно відтворити або пояснити, може бути менш корисною, ніж простіша, теоретично прозора структура.


CFA і структурна валідність


У системі доказів валідності CFA найпряміше відповідає на питання про внутрішню структуру. COSMIN розглядає CFA як сильний метод оцінювання структурної валідності, коли є наперед задана модель, і вимагає тлумачити результат у зв’язку з теорією конструкта.


Однак структурна відповідність — лише одна частина доказів валідності. Добрий CFA не доводить, що зміст пунктів повністю покриває конструкт, що бали пов’язані з зовнішніми критеріями як очікується, що процес відповіді відповідає теорії або що використання тесту має прийнятні наслідки.


Так само CFA не замінює конструктну валідність у ширшому сенсі. Він дає важливе свідчення про те, чи узгоджується внутрішня структура з теоретичною моделлю, але весь валідизаційний аргумент ширший за факторну структуру.


Внутрішня узгодженість не замінює CFA


Висока α Кронбаха або ω Макдональда не доводить одновимірність. Кілька корельованих факторів можуть породжувати високу внутрішню узгодженість загального набору пунктів. Тому перед інтерпретацією коефіцієнтів внутрішньої узгодженості треба мати обґрунтовану структуру шкали.


Це ключове розрізнення докладно пояснює сторінка про внутрішню узгодженість. CFA відповідає на питання про структуру спільної варіації, а коефіцієнти надійності — на питання про точність або узгодженість балів за конкретних припущень. Один клас показників не є заміною іншого.


Так само надійність тесту і валідність належать до різних частин аргументації. Надійний бал може систематично вимірювати не те, що потрібно; структурно правдоподібна модель може мати недостатню точність окремих балів.


CFA, мовна адаптація і вимірювальна інваріантність


Переклад психологічного тесту українською не гарантує збереження його факторної структури. Зміна формулювань, культурного контексту, частоти досвіду, семантики відповіді або складу вибірки може змінити спосіб, у який пункти пов’язані з латентним конструктом.


Міжнародна тестова комісія в ITC Guidelines for Translating and Adapting Tests прямо розглядає адаптацію як ширший процес, ніж переклад: потрібні докази еквівалентності конструкта, методу й окремих пунктів та психометричні дані для цільових популяцій.


Для порівняння груп часто використовують багатогрупову CFA й послідовно перевіряють рівні вимірювальної інваріантності. Типова логіка включає конфігуральну інваріантність (подібна структура), метричну (обмеження навантажень), скалярну (додаткові обмеження порогів або інтерсептів залежно від типу даних) і, в окремих задачах, строгішу інваріантність.


Огляд Putnick & Bornstein (2016) підкреслює, що інваріантність має перевірятися й прозоро звітуватися, якщо дослідник хоче робити міжгрупові або часові порівняння. Без такого аналізу однакова назва шкали ще не гарантує однакового змісту бала в різних групах.


Вимірювальна інваріантність не є автоматичним доказом повної відсутності bias або соціальної несправедливості. І навпаки, локальна неінваріантність не завжди робить інструмент непридатним. Потрібно оцінити, які параметри відрізняються, наскільки це впливає на потрібні висновки й чи можна захистити часткову інваріантність.


Диференційне функціонування завдання (differential item functioning, DIF) — споріднений, але окремий рівень аналізу: воно перевіряє, чи поводиться конкретний пункт по-різному в групах за однакового рівня вимірюваної латентної ознаки. Виявлений DIF є сигналом для змістового й методичного розслідування, а не автоматичним доказом упередженості або несправедливості пункту. Martinková та співавт. (2017) показують, що статистично позначені DIF-пункти потребують експертного аналізу причин: відмінність може відображати як construct-irrelevant вплив, так і зміст, що закономірно належить до самого конструкта.


Типові помилки інтерпретації CFA


«CFI > .95, отже тест валідний»


Ні. Це максимум один сигнал про fit за певних умов. Валідність — аргумент на основі багатьох джерел доказів, а не властивість одного індексу.


«RMSEA < .06 означає, що модель правильна»


Ні. Модель може мати прийнятний RMSEA й водночас проблемні локальні залишки, невдалі параметри або змістову помилку. Інші моделі можуть описувати дані не гірше.


«Незначущий χ² доводить добрий fit»


Ні. Незначущий χ² може бути наслідком малої потужності. Значущий χ² у великій вибірці теж не означає автоматично практично неприйнятну модель. Потрібна сукупна оцінка.


«Усі Likert-пункти можна бездумно трактувати як безперервні»


Ні. Іноді таке наближення може бути прийнятним, але його властивості залежать від кількості категорій, розподілів, вибірки й оцінювача. Для порядкових даних існують спеціальні категоріальні методи.


«Modification indices показують, як виправити модель»


Вони показують потенційну локальну зміну fit за певного звільнення параметра. Чи має цей параметр психологічний сенс — окреме питання.


«Видалимо всі пункти з нижчими навантаженнями»


Механічне очищення за одним порогом може звузити зміст конструкта й створити надто однорідну, але концептуально бідну шкалу. Пункт оцінюють за змістом, навантаженням, точністю, інформаційною цінністю, локальною залежністю й роллю в усьому тесті.


«Якщо модель добре fit-иться, можна ставити діагноз за балом»


Ні. CFA перевіряє вимірювальну структуру. Діагностичне використання потребує інших доказів: клінічної валідності, чітко визначеного intended use, даних про чутливість і специфічність, прогностичні значення з урахуванням prevalence/base rate, процедури професійного оцінювання та контексту. Скринінг і діагноз залишаються різними задачами.


Як читати результати CFA по кроках


1. Спочатку прочитайте модель, а не індекси


Скільки факторів? Які пункти на них навантажуються? Чи дозволено факторам корелювати? Чи є перехресні навантаження або корельовані залишки? Якщо модель не зрозуміла, числа fit нічого не пояснюють.


2. Перевірте дані й оцінювач


Які індикатори — безперервні чи порядкові? Скільки категорій? Який N? Як оброблено пропуски? Який оцінювач використано? Чи відповідає він типу даних?


3. Подивіться на збіжність і допустимість розв’язку


Чи модель збіглася? Чи немає негативних дисперсій, надмірних факторних кореляцій, нестабільних стандартних похибок або інших аномалій?


4. Оцініть глобальний fit кількома показниками


Розгляньте χ² разом із CFI/TLI, RMSEA з інтервалом і SRMR. Не перетворюйте один поріг на єдине рішення.


5. Перейдіть до локального fit


Дивіться на факторні навантаження, залишки, проблемні коваріації, кореляції факторів і те, які конкретні зв’язки модель відтворює погано.


6. Порівняйте з теоретично осмисленими альтернативами


Якщо існують реальні конкуренти — наприклад, один фактор проти двох корельованих — порівняйте їх. Не створюйте десятки альтернатив лише заради пошуку найкращого fit.


7. Відокремте первинну модель від постфактум-модифікацій


Чітко позначте, що було задано до аналізу, а що змінено після перегляду результатів. Модифіковану модель краще перевірити на нових даних.


8. Поверніться до психологічної інтерпретації


Навіть статистично переконлива модель має відповідати змісту конструкта. Психометрична модель є інструментом інтерпретації, а не заміною теорії.


Як звітувати CFA так, щоб аналіз можна було оцінити


Якісне звітування повинно дозволяти іншому досліднику зрозуміти, яку саме модель було перевірено, на яких даних і з якими припущеннями. Огляд Jackson, Gillaspy & Purc-Stephenson (2009) показав значну варіативність практик звітування CFA і сформулював рекомендації щодо прозорішого опису.


Мінімально варто повідомити: вибірку й критерії включення; тип і розподіли індикаторів; пропущені дані; програму та її версію; оцінювач; кореляційну/коваріаційну основу; точну специфікацію моделі; спосіб масштабування факторів; оцінені навантаження та їхню невизначеність; кореляції факторів; χ² і df; кілька релевантних індексів fit.


Для RMSEA бажано давати довірчий інтервал. Якщо застосовували робастні статистики, треба вказати саме робастні версії. Якщо порівнювали моделі, слід назвати процедуру порівняння й пояснити, чому вона коректна для використаного оцінювача.


Якщо модель модифікували за modification indices або залишками, повідомте кожну змістово важливу зміну й позначте її як постфактум. Не слід описувати модифіковану модель так, ніби вона була єдиною апріорною гіпотезою.


Сучасна COSMIN Reporting Guideline 2.0 для досліджень властивостей вимірювальних інструментів прямо рекомендує для CFA подавати всі факторні навантаження та індекси fit первинної й, якщо застосовно, найкраще відповідної моделі; для багатогрупової CFA — описувати модель, оцінювач, тип кореляційної матриці та критерії змін fit.


Для максимальної відтворюваності корисно додавати синтаксис аналізу, точні правила перекодування, інформацію про реверсивні пункти, матрицю кореляцій або дані, якщо це дозволяють етика й ліцензія. Прозорість важливіша за демонстрацію «ідеального» набору індексів.


Що CFA може і чого не може сказати практичному психологу


CFA може показати, чи підтримує досліджена вибірка конкретну модель балів: один загальний показник, кілька підшкал, ієрархічну структуру тощо. Це важливо, бо клінічна або консультативна інтерпретація підшкали має сенс лише тоді, коли є підстави вважати, що така підшкала справді є окремим виміром.


CFA не встановлює діагноз, не визначає універсальний cutoff і не перетворює скринінговий опитувальник на діагностичний інструмент. Він також не доводить, що одна й та сама структура однаково працює в кожному віці, культурі, мові або клінічній групі.


У YMYL-контексті ключове питання звучить так: чи є достатній пакет доказів саме для цієї популяції, мовної версії й intended use? Якщо CFA виконано на іншій популяції, це корисна інформація, але вона не переноситься автоматично на конкретного пацієнта або українську адаптацію.


Науковий статус CFA


CFA — усталений метод психометрії та структурного моделювання. Його математичний апарат, оцінювачі, діагностика model fit і методи інваріантності мають велику методологічну літературу. Водночас окремі практичні правила — передусім універсальні fit-cutoffs і прості правила розміру вибірки — залишаються предметом активного методологічного уточнення.


Established evidence: CFA є стандартним способом перевірки наперед заданої факторної структури; тип даних і оцінювач мають значення; глобальний fit треба доповнювати оцінкою параметрів і локальної невідповідності; адаптація тесту потребує перевірки в цільовій популяції.


Mixed / context-dependent evidence: конкретний універсальний поріг для CFI, TLI, RMSEA або SRMR, який однаково працює для всіх моделей; єдине правило мінімального N; автоматична перевага одного оцінювача для всіх Likert-даних. Тут рішення залежать від моделі й даних, а сучасні симуляційні підходи прямо намагаються врахувати цю залежність.


FAQ


Чим CFA відрізняється від EFA?


EFA переважно досліджує можливу факторну структуру з меншою кількістю попередніх обмежень. CFA перевіряє конкретну наперед задану модель. Якщо дослідник після кожного результату CFA довільно переписує модель на тій самій вибірці, аналіз стає дедалі більш експлораторним.


Чи можна провести CFA на пунктах Лайкерта?


Так. Але порядковий характер відповідей треба врахувати в методі оцінювання. Часто використовують WLSMV/DWLS та поліхоричні кореляції; за деяких умов застосовують robust ML. Вибір залежить від числа категорій, розподілів, N і конкретної моделі.


Які значення CFI, TLI, RMSEA та SRMR вважаються хорошими?


Існують широко вживані історичні орієнтири, але універсальних магічних порогів немає. Значення індексів залежать від характеристик моделі та даних. Краще повідомляти кілька показників, їхню невизначеність, локальний fit і змістову аргументацію.


Чи обов’язково χ² має бути статистично незначущим?


Ні. χ² є тестом точної відповідності й дуже чутливий до N. У великих вибірках невеликі відхилення часто стають статистично значущими. Його треба повідомляти, але не використовувати як єдиний критерій.


Скільки людей потрібно для CFA?


Немає одного числа для всіх моделей. Потрібний N залежить від навантажень, кількості факторів та індикаторів, типу даних, оцінювача, пропусків і цілі аналізу. Для складних або високоризикових рішень найкраще планувати вибірку за допомогою аналізу потужності або Monte Carlo simulation.


Чи можна видалити пункт, якщо він має невисоке навантаження?


Можна розглядати це як один із сигналів, але рішення не повинно бути механічним. Потрібно врахувати зміст пункту, точність оцінки, роль у покритті конструкта, локальну залежність, наслідки для підшкали й перевірку зміненої моделі на нових даних.


Чи можна додавати кореляції залишків за modification indices?


Можна лише за змістового або методичного обґрунтування. Сам факт покращення fit не пояснює, чому залишки мають корелювати. Постфактум-зміни треба прозоро описувати й бажано перевіряти незалежно.


Чи доводить добрий CFA, що шкала одновимірна?


Добра відповідність однофакторної моделі є важливим доказом сумісності з одновимірною інтерпретацією, але її треба оцінювати разом із локальним fit, альтернативними моделями, параметрами й теорією. Один індекс не «доводить» одновимірність.


Чи достатньо перекласти тест і повторити CFA?


Ні. CFA є важливою частиною адаптації, але потрібні також якісний переклад і культурна адаптація, аналіз змісту й процесу відповіді, надійність, інші докази валідності, а для міжгрупових порівнянь — інваріантність. Наявність українського перекладу сама по собі не означає валідованої української версії.


Чи може CFA підтвердити, що тест придатний для діагнозу?


Ні. CFA оцінює вимірювальну структуру. Діагностичне рішення потребує окремої клінічної валідації, оцінки diagnostic accuracy, врахування base rate, клінічного інтерв’ю та професійного контексту.


Пов’язані статті


Структурна валідність: чи відповідає факторна структура тесту теоретичній будові конструкта — ширший контекст, у якому CFA є одним із основних способів перевірки внутрішньої структури.


Латентні й спостережувані змінні: чим відрізняється психологічний конструкт від його показників — базові поняття, без яких важко правильно читати факторні моделі.


Конструктна валідність: як перевіряють, що тест вимірює саме задуманий психологічний конструкт — як факторна структура входить до ширшого аргументу про інтерпретацію конструкта.


Докази валідності: зміст, внутрішня структура, зв’язки з іншими змінними та процес відповіді — карта основних джерел доказів валідності сучасного психологічного тесту.


Внутрішня узгодженість шкали: що вона показує і чому не доводить одновимірність — чому α або ω не можуть замінити аналіз факторної структури.




Джерела


American Educational Research Association, American Psychological Association, & National Council on Measurement in Education. (2014). Standards for Educational and Psychological Testing.




Flora, D. B., & Curran, P. J. (2004). An Empirical Evaluation of Alternative Methods of Estimation for Confirmatory Factor Analysis With Ordinal Data. Psychological Methods, 9(4), 466–491.


Heene, M., Hilbert, S., Draxler, C., Ziegler, M., & Bühner, M. (2011). Masking Misfit in Confirmatory Factor Analysis by Increasing Unique Variances: A Cautionary Note on the Usefulness of Cutoff Values of Fit Indices. Psychological Methods, 16(3), 319–336.


Hu, L.-T., & Bentler, P. M. (1999). Cutoff Criteria for Fit Indexes in Covariance Structure Analysis: Conventional Criteria Versus New Alternatives. Structural Equation Modeling, 6(1), 1–55.



Jackson, D. L., Gillaspy, J. A., & Purc-Stephenson, R. (2009). Reporting Practices in Confirmatory Factor Analysis: An Overview and Some Recommendations. Psychological Methods, 14(1), 6–23.


Kline, R. B. (2024). How to Evaluate Local Fit (Residuals) in Large Structural Equation Models. International Journal of Psychology, 59(6), 1293–1306.




Martinková, P., Drabinová, A., Liaw, Y.-L., Sanders, E. A., McFarland, J. L., & Price, R. M. (2017). Checking Equity: Why Differential Item Functioning Analysis Should Be a Routine Part of Developing Conceptual Assessments. CBE—Life Sciences Education, 16(2), rm2.



McNeish, D., An, J., & Hancock, G. R. (2018). The Thorny Relation Between Measurement Quality and Fit Index Cutoffs in Latent Variable Models. Journal of Personality Assessment, 100(1), 43–52.


McNeish, D., & Wolf, M. G. (2023). Dynamic Fit Index Cutoffs for Confirmatory Factor Analysis Models. Psychological Methods, 28(1), 61–88.



Wolf, E. J., Harrington, K. M., Clark, S. L., & Miller, M. W. (2013). Sample Size Requirements for Structural Equation Models: An Evaluation of Power, Bias, and Solution Propriety. Educational and Psychological Measurement, 76(6), 913–934.

 
 
bottom of page