top of page

Психологічна енкциклопедія

Змістова валідність: чи охоплюють завдання тесту той конструкт, який потрібно виміряти

6 днів тому
Читати 18 хв

Автор: Український психологічний ХАБ · Опубліковано: 23 вересня 2026 · Редакційна політика


Змістова валідність — це обґрунтованість того, що зміст психологічного тесту, шкали, опитувальника або іншого інструмента справді представляє той конструкт, який планують вимірювати, для визначеної популяції та конкретного використання. Йдеться не лише про окремі запитання. До змісту належать також інструкції, стимули, сценарії, формати відповіді, часові рамки, спосіб виконання та інші елементи, від яких залежить, що фактично означатиме тестовий бал. Standards for Educational and Psychological Testing розглядають докази, засновані на змісті тесту, як одне з джерел обґрунтування запропонованої інтерпретації балів.


Для інструментів вимірювання результатів методологія COSMIN формулює три центральні питання: чи є зміст релевантним, чи охоплює він усі важливі аспекти конструкта і чи розуміють його респонденти так, як задумано. Огляд COSMIN 2025 року називає ці компоненти relevance, comprehensiveness і comprehensibility та підкреслює роль якісних методів — зокрема інтерв’ю, фокус-груп і Delphi-процедур — у встановленні змістової валідності.


В українській фаховій мові трапляються дві назви: «змістова валідність» і «контентна валідність». У цій статті використовується «змістова валідність» як основний термін, а content validity — як англійський відповідник. Обидві назви стосуються одного фундаментального питання: чи є зміст інструмента достатнім і доречним представленням того, про що надалі робитимуть висновок за його балами.


Що таке змістова валідність у сучасній психометрії


Історично змістову валідність часто описували як окремий «тип валідності» поруч із критеріальною або конструктною. Сучасна рамка точніша: валідність стосується обґрунтованості інтерпретацій і використань тестових балів, а зміст тесту є одним із джерел доказів для цього аргументу. Тому фраза «тест має змістову валідність» без уточнення конструкта, популяції, контексту та intended use є надто загальною.


У глосарії NCME content-related validity evidence визначено як докази, засновані на змісті тесту, що підтримують заплановану інтерпретацію результатів для певної мети. Це може включати відповідність змісту реальній діяльності, репрезентативність вибірки завдань із ширшої змістової області та інші зв’язки між тестовим матеріалом і доменом, про який роблять висновок.


Для психологічних шкал це принципово. Якщо шкала заявляє, що вимірює складний конструкт, але містить завдання лише про одну його вузьку грань, високий бал не може автоматично представляти весь конструкт. Якщо ж завдання систематично вимагають умінь або знань, які не належать до конструкта, результат може відбивати сторонні чинники.


Три запитання: релевантність, повнота охоплення і зрозумілість


Релевантність: чи кожний елемент справді стосується потрібного конструкта


Релевантність означає, що завдання, твердження, інструкції, варіанти відповіді та умови виконання відповідають визначеному конструкту, цільовій популяції та контексту використання. Завдання може бути граматично бездоганним і статистично «працювати», але залишатися змістово недоречним, якщо воно вимірює іншу властивість або вимагає досвіду, якого значна частина цільової групи не має.


Наприклад, якщо інструмент має вимірювати здатність планувати повсякденні справи, завдання, що фактично перевіряє знання специфічної професійної термінології, додає до бала сторонній компонент. У термінах сучасного вимірювання це може створювати construct-irrelevant variance — варіативність, спричинену чинниками поза цільовим конструктом. NCME окремо визначає construct-irrelevant variance як варіативність балів від сторонніх факторів, що спотворюють значення результату.


Повнота охоплення: чи не випала важлива частина конструкта


Повнота охоплення означає, що інструмент не пропускає ключові аспекти конструкта. Добір лише «хороших» окремих завдань не гарантує повноти. Можна отримати набір дуже релевантних пунктів, який усе одно систематично ігнорує одну або кілька важливих граней.


Такий дефіцит описують як construct underrepresentation — недостатнє представлення конструкта. Глосарій NCME пояснює це як ситуацію, коли тест не охоплює важливих аспектів задуманої змістової області, через що бал представляє конструкт лише частково. Саме тому змістову валідність оцінюють на рівні окремих завдань і всього інструмента.


Зрозумілість: чи читає респондент завдання так, як задумав розробник


Зрозумілість стосується не максимального спрощення мови, а відповідності між задумом і фактичним розумінням. Двозначне слово, невдалий часовий інтервал, перевантажена конструкція речення, незнайомий приклад або нечітка інструкція можуть змінити процес відповіді навіть тоді, коли експертам формулювання здається очевидним.


У методології COSMIN зрозумілість є окремим компонентом змістової валідності. COSMIN Manual Version 2.0 рекомендує оцінювати релевантність, повноту й зрозумілість окремо, щоб не приховувати сильні та слабкі сторони інструмента одним загальним висновком.


Змістова валідність починається з чіткого визначення конструкта


Перш ніж оцінювати завдання, потрібно визначити, що саме має вимірювати тест. Без цього експертне оцінювання перетворюється на голосування про те, чи «подобається» формулювання. Змістове рішення потребує карти конструкта: його меж, граней, типових проявів, відмінностей від близьких понять, очікуваного рівня узагальнення і того, що свідомо не входить до вимірюваної області.


У ХАБі окремо розібрано, що таке психологічний конструкт і як невидиму психологічну властивість пов’язують зі спостережуваними показниками. Для змістової валідності це вихідна точка: спочатку задають конструкт, а вже потім питають, чи достатньо добре набір завдань його представляє.


Наступний крок — операціоналізація: перехід від теоретичного поняття до конкретних спостережуваних ознак, завдань, шкал або процедур. Змістова валідність перевіряє якість цього переходу на рівні змісту. Якщо операціональне визначення звужує або підмінює конструкт, статистичне вдосконалення шкали пізніше не поверне автоматично втрачений зміст.


Корисний технічний інструмент — специфікація тесту або матриця змісту. У ній кожну грань конструкта пов’язують із запланованою кількістю завдань, форматом відповіді, рівнем складності, контекстом і, за потреби, вагою в підсумковому балі. Така матриця робить видимим те, що легко пропустити при читанні пунктів по одному: надмірне представлення однієї грані та відсутність іншої.


Що саме належить до «змісту» тесту


Зміст — ширше поняття, ніж текст окремого запитання. Залежно від інструмента до нього можуть належати формулювання завдань, стимули, зображення, сценарії, поведінкові описи, інструкції, варіанти відповіді, шкала відповіді, часовий період, спосіб виконання, обмеження часу, приклади, правила переходу між завданнями й те, що пропонується робити спостерігачеві або клініцисту.


Для опитувальника самозвіту важливо, чи охоплюють твердження досвід, доступний цільовій групі, і чи однаково респонденти розуміють ключові слова. Для performance-based інструмента питання зміщується до того, чи є виконувані завдання репрезентативними для цільової здатності. FDA у схемі розроблення clinical outcome assessments ставить визначення concept of interest і context of use перед формуванням інструмента та оцінюванням його змістової валідності.


Для шкал із періодом пригадування змістом стає також сам recall period. «За останні 24 години», «за останній тиждень» і «зазвичай» створюють різні когнітивні задачі. Для шкал із градаціями частоти або інтенсивності важливо, чи варіанти відповіді покривають реальний діапазон досвіду й чи межі між категоріями зрозумілі.


Змістовий аналіз стосується і правил підрахунку настільки, наскільки вони визначають, які частини змісту реально впливають на бал. Якщо декларативно тест охоплює п’ять граней, але алгоритм підрахунку майже весь підсумковий бал формує з двох, сама наявність пунктів інших граней не гарантує репрезентативності підсумкового показника.


Як оцінюють змістову валідність під час розроблення тесту


1. Визначають конструкт, популяцію і контекст використання


Один і той самий термін може мати різний зміст у різних дослідницьких або практичних завданнях. Тому до написання завдань фіксують концептуальне визначення, цільову популяцію, передбачуване рішення або висновок, формат застосування та межі узагальнення. Зміна популяції чи мети може вимагати нових доказів змістової валідності.


2. Виявляють змістову область і ключові грані


Джерелами можуть бути теорія, систематичні огляди, якісні дослідження, професійні стандарти, спостереження, аналіз діяльності та, коли йдеться про людський досвід, інтерв’ю з представниками цільової групи. Для PROMs Patrick та співавтори підкреслюють документування внеску цільової популяції в генерацію пунктів і перевірку того, чи охоплено значущі для неї аспекти.


3. Створюють набір завдань ширший за фінальну версію


На ранньому етапі доцільно мати достатній набір кандидатів, прив’язаних до карти конструкта, а не одразу скорочувати шкалу до мінімуму. Скорочення лише за статистичними критеріями може підвищити внутрішню узгодженість і водночас погіршити змістове охоплення, якщо зникають концептуально важливі, але менш однорідні прояви.


4. Залучають фахівців із релевантною предметною компетентністю


Експерти оцінюють, чи відповідає кожний елемент конструкту, чи не містить він зайвих вимог, наскільки він репрезентативний для своєї грані та чи достатньо весь інструмент охоплює домен. У якісному звіті пояснюють, хто саме був експертом і чому його компетентність релевантна; сам титул або науковий ступінь не робить оцінку автоматично змістово обґрунтованою.


Класичні психометричні роботи запропонували структуровані процедури експертного оцінювання. Lawshe описав content validity ratio (CVR) для суджень про необхідність пунктів; Lynn — процедури визначення й кількісного узагальнення content validity. Сьогодні ці індекси доречно розглядати як допоміжні засоби документування експертних суджень, а не як заміну змістового аргументу.


5. Залучають представників цільової групи


Експерт знає теорію, але не може повністю замінити людину, для якої створено інструмент. Представники цільової групи допомагають виявити пропущений досвід, незрозумілі слова, неприродні категорії відповіді, припущення розробника, що не працюють у реальному житті, і теми, які професійна мова описує інакше, ніж сама людина.


Це особливо важливо для patient-reported та інших self-report інструментів. У COSMIN Delphi-study методи розроблення PROM і дослідження змістової валідності оцінювалися окремо; консенсус охопив релевантність пунктів, варіантів відповіді, recall period, повноту й зрозумілість. Для інших типів психологічних тестів роль респондентів може відрізнятися, але перевірка фактичної взаємодії цільової групи з матеріалом залишається принциповою.


6. Проводять когнітивні інтерв’ю та пілотування


Когнітивне інтерв’ю не просто запитує «чи все зрозуміло?». Дослідник з’ясовує, як людина тлумачить ключові слова, який досвід пригадує, як обирає відповідь, де вагається і що вважає неоднозначним. ISPOR Task Force присвятив окремий звіт оцінюванню розуміння респондентами під час встановлення content validity нових PRO-інструментів.


Для регуляторних clinical outcome assessments FDA guidance також надає ваги внеску цільової популяції та якісним даним, включно з когнітивними інтерв’ю, коли зміст інструмента має підтримувати конкретне клінічне використання. Цей регуляторний контекст не переноситься механічно на всі психологічні тести, але добре ілюструє загальний принцип: змістову відповідність потрібно документувати, а не припускати.


7. Ітеративно переглядають інструмент і зберігають слід рішень


Оцінювання змісту — не одна експертна нарада наприкінці. Після інтерв’ю або рейтингу частину завдань переписують, додають або вилучають, а потім повторно перевіряють розуміння і покриття. Mokkink та співавтори, 2025 описують послідовність, у якій визначення й перевірка змісту є ітеративними: за потреби цикл повторюється після внесення змін.


Для прозорості варто зберігати версії інструмента, карту «грань → завдання», причини змін, характеристики експертів і учасників, інструкції для оцінювання, кількісні індекси, якісні коментарі та пояснення фінальних рішень. Сильний звіт дозволяє сторонньому читачеві відтворити логіку переходу від визначення конструкта до фінального набору змісту.


Експерти і цільова група відповідають на різні питання


Експертна оцінка найсильніша там, де потрібно співвіднести завдання з теорією, професійною моделлю, навчальною програмою, робочою діяльністю або формальним описом домену. Цільова група найкраще показує, чи є зміст упізнаваним, зрозумілим і доречним для її контексту та чи не пропущені значущі аспекти досвіду.


Тому «десять експертів погодилися» і «сто респондентів сказали, що все зрозуміло» не є взаємозамінними доказами. Перше не гарантує, що реальні респонденти тлумачать завдання як задумано; друге не гарантує, що набір охоплює теоретичні межі конструкта.


Склад панелі залежить від типу інструмента. Для тесту професійної компетентності потрібні люди, які знають зміст роботи й вимоги до неї. Для клінічного self-report інструмента важливі і клінічні фахівці, і люди з релевантним досвідом. Для дитячої шкали можуть знадобитися вікові та мовні перевірки, а іноді окремий внесок дитини, батьків і фахівців, якщо вони є різними джерелами інформації.


Кількість учасників сама по собі не визначає якість змістової валідації. Потрібно обґрунтувати, чому саме ці люди можуть судити про конкретний аспект змісту, як збирали їхні судження і як вони вплинули на рішення щодо інструмента.


Які методи використовують


Специфікація тесту і картування завдань


Матриця специфікації задає змістові грані й очікуване представлення кожної з них. Потім кожне завдання зіставляють із цією картою. Такий підхід добре виявляє пропуски, надлишкове дублювання та дисбаланс між частинами конструкта ще до статистичного аналізу відповідей.


Фокус-групи й напівструктуровані інтерв’ю


Вони корисні для elicitation — виявлення того, які аспекти досвіду або поведінки справді належать до цільового конструкта в заданому контексті. Сильний дизайн не обмежується питанням «що ви думаєте про ці пункти?», а перевіряє, що ще має бути виміряно і чи не нав’язує розробник людям власну категоризацію.


Когнітивні інтерв’ю


Їхня мета — дослідити процес розуміння і відповіді. Вони допомагають відрізнити проблему змісту від проблеми формулювання: іноді пункт концептуально потрібний, але слова, приклад або формат відповіді ведуть респондента до іншої інтерпретації.


Delphi-процедури


Delphi дає змогу кільком раундам незалежних суджень і зворотного зв’язку поступово уточнювати критерії та формувати консенсус. Метод корисний для складних доменів, але консенсус не дорівнює істині: якість результату залежить від складу панелі, формулювання питань, правил завершення і прозорості процесу.


Кількісні рейтинги релевантності


Експерти або представники цільової групи можуть оцінювати релевантність, зрозумілість чи інші характеристики за шкалою, після чого дослідник узагальнює частку позитивних оцінок або спеціальні індекси. Такі числа корисні для порівняння пунктів і документування рішень, але вони не замінюють пояснення того, що саме було оцінено і чому.


CVI: індекс змістової валідності


Content Validity Index (CVI) зазвичай узагальнює, яка частка експертів оцінила пункт як достатньо релевантний за заданим правилом. На рівні окремого пункту часто використовують I-CVI, а на рівні всієї шкали — один із варіантів S-CVI. Важливо завжди вказувати точну процедуру, бо одна абревіатура CVI може приховувати різні способи агрегації.


У методичному огляді Polit, Beck і Owen підкреслили переваги CVI як зрозумілого показника експертного консенсусу, але також його обмеження: звичайний CVI не коригує випадкову згоду. Автори запропонували пов’язувати I-CVI з модифікованою κ і обговорили часто цитований орієнтир I-CVI 0,78 або вище для панелей від трьох експертів.


Цей орієнтир не є універсальним законом якості тесту. Значення CVI залежить від кількості експертів, шкали рейтингу, порога для «релевантного», незалежності суджень, компетентності панелі й того, чи оцінювали лише релевантність, чи також повноту і зрозумілість. Один високий S-CVI може приховати критичний пропуск цілої грані конструкта.


CVR: коефіцієнт Лоше


Content Validity Ratio (CVR) Лоше створено для іншої задачі: експерти класифікують кожний елемент як необхідний, корисний, але не необхідний, або не потрібний. Класична формула CVR = (ne − N/2) / (N/2), де ne — кількість експертів, які назвали пункт необхідним, а N — загальна кількість експертів. Значення змінюється від −1 до +1.


У первинній роботі Lawshe, 1975 CVR був способом кількісно узагальнити судження про необхідність елементів. Пізніше Wilson, Pan і Schumsky перерахували критичні значення для різних розмірів панелі. Тому механічне застосування старої таблиці або одного універсального порога без урахування N є помилкою.


CVI і CVR відповідають на різні питання й не мають автоматично замінювати одне одного. CVI найчастіше відображає оцінки релевантності; CVR — судження про необхідність. Обидва показники залишаються залежними від того, хто оцінює, що саме і за якою концептуальною картою.


Чому число не може «довести» змістову валідність


Змістова валідність має суттєвий якісний компонент. Якщо конструкт визначено нечітко, панель оцінює не той домен або ключова грань взагалі відсутня серед кандидатів, математичне узагальнення експертних рейтингів не виправляє початкову проблему. Число може стисло описати судження, але не створює зміст, якого не було в дизайні.


Саме тому сучасні підходи поєднують декілька джерел: теоретичне визначення, специфікацію змісту, процедуру генерації завдань, експертні судження, внесок цільової групи, когнітивне тестування, пілотування й прозоре документування змін. COSMIN побудував оцінювання content validity як сукупність стандартів розроблення, окремих досліджень змісту і підсумкового синтезу доказів.


Що змістова валідність не доводить


Вона не дорівнює очевидній валідності


Очевидна валідність (face validity) відповідає радше на питання, чи виглядає тест доречним і правдоподібним для користувача або спостерігача. Це може бути корисно для прийнятності інструмента, але сама зовнішня очевидність не доводить, що зміст репрезентує конструкт повно й без сторонніх домішок.


Вона не доводиться коефіцієнтом альфа


Cronbach’s alpha описує певний аспект внутрішньої узгодженості за конкретних припущень. Висока α не відповідає на запитання, чи всі потрібні грані конструкта представлені в тесті. Дуже однорідний набір близьких за змістом завдань може мати високу внутрішню узгодженість і водночас вузько охоплювати конструкт. Тому надійність психологічного тесту і змістова валідність — різні властивості та різні питання.


Вона не замінює структурну або конструктну перевірку


Експерт може переконливо обґрунтувати, чому завдання належать до теоретичних граней, але це ще не показує, що емпірична структура відповідей відповідає моделі. Для цього потрібні інші джерела доказів — аналіз внутрішньої структури, зв’язків з іншими змінними, процесів відповіді та інші процедури, доречні для конкретного використання.


Вона не є діагностичною точністю


Змістова валідність не повідомляє, наскільки добре тест розрізняє людей із певним клінічним станом і без нього. Sensitivity, specificity, PPV, NPV і ROC/AUC належать до іншого кола питань. Навіть дуже добре побудований зміст не перетворює скринінговий бал на діагноз.


Вона не визначає похибку окремого бала


Зміст може бути добре обґрунтований, а індивідуальний результат усе одно міститиме невизначеність. Похибка вимірювання стосується точності конкретного бала та джерел випадкової й систематичної помилки; це не те саме, що питання про репрезентативність змісту.


Вона не гарантує інтерпретованість


Навіть коли зміст відповідає конструкту, користувачеві ще потрібно знати, що означає отриманий бал або зміна бала. Інтерпретованість результатів психологічного вимірювання охоплює норми, референтні значення, пороги, невизначеність і практичний зміст результату. Це окремий шар роботи з вимірюванням.


Змістова валідність і культурна адаптація


Переклад тесту не є доказом того, що його зміст валідний для нової мовної та культурної групи. Слова можуть бути перекладені точно, але ситуації, соціальні ролі, приклади, частота певного досвіду, культурні норми або спосіб використання шкали відповідей можуть змінити релевантність і розуміння завдань.


У ITC Guidelines for Translating and Adapting Tests адаптація розглядається як процес, що має враховувати мовні, психологічні та культурні відмінності цільових популяцій і залучати фахівців із відповідною комбінованою компетентністю. Це сильніша вимога, ніж буквальний переклад.


Для української адаптації потрібно окремо показати, що українські формулювання відтворюють задуманий зміст, зрозумілі цільовій групі, охоплюють ті самі або належно адаптовані грані та не вносять нових культурно специфічних вимог. Наявність «української версії» без описаної процедури адаптації, вибірки, когнітивного тестування й психометричних даних не означає валідовану українську адаптацію.


Після змістової адаптації зазвичай потрібні й інші докази — структурна валідність, надійність, інваріантність або DIF, залежно від завдання. Measurement invariance не означає автоматичної відсутності bias, а DIF не є сам по собі доказом несправедливості: ці результати потрібно інтерпретувати разом зі змістом і контекстом.


Змістова валідність, справедливість і доступність


Погано підібраний зміст може створювати систематичну перевагу або перешкоду для частини респондентів. Якщо завдання для вимірювання цільового конструкта потребує непотрібно складної мови, специфічного культурного знання, моторної навички або сенсорної здатності, бал може відбивати не лише цільову властивість.


Це не означає, що будь-яка групова різниця є bias. Потрібно встановити, чи стороння вимога справді не належить до конструкта і чи вона змінює інтерпретацію балів для відповідної групи. Аналіз справедливості починається з чіткого визначення конструкта: без нього неможливо вирішити, яка вимога релевантна, а яка стороння.


Контентна експертиза доповнює статистичні процедури. DIF може вказати, що завдання поводиться по-різному в групах за однакового рівня латентної ознаки, але причину потрібно досліджувати змістово. І навпаки, змістова підозра на bias може бути підставою для подальшого статистичного тестування.


Змістова валідність у клінічних і скринінгових інструментах


У клінічних шкалах особливо важливо розрізняти symptom, trait, risk factor, screening, case-finding, assessment, diagnosis, monitoring і outcome measurement. Те, що шкала добре охоплює зміст певних симптомів, не означає, що її сумарний бал є діагностичним рішенням або що певний cutoff універсально відділяє «розлад є» від «розладу немає».


Для клінічного використання потрібні докази, специфічні до intended population і intended use: надійність, валідність інтерпретацій, точність класифікації, базова частота стану, наслідки помилкових рішень та інші характеристики. Змістова валідність створює необхідну основу, але не замінює ці етапи.


Це також пояснює, чому результат скринінгу не є діагнозом. Скринінговий інструмент може мати доречний і добре перевірений зміст, але остаточна клінічна оцінка спирається на ширший контекст, функціонування, тривалість симптомів, диференційну оцінку та професійне рішення.


Умовний приклад: як виявляють неповне охоплення конструкта


Уявімо, що дослідники створюють шкалу «керування повсякденним часом». Вони визначили три грані: планування, пріоритизація і коригування плану після непередбачуваних змін. На першому етапі автори написали 24 твердження.


Експерти помітили, що 18 із 24 тверджень фактично стосуються складання плану, чотири — пріоритизації і лише два — адаптації до змін. Майже кожне твердження окремо виглядає доречним. Проте інструмент як ціле недопредставляє третю грань. Це проблема повноти, яку не можна побачити з одного середнього рейтингу релевантності.


Під час когнітивних інтерв’ю учасники додатково повідомили, що слово «ефективно» у кількох твердженнях вони тлумачать по-різному: частина як «швидко», частина як «без стресу», частина як «встигнути все». Отже, з’явилася проблема зрозумілості, хоча експертам формулювання здавалося однозначним.


Після перегляду автори додають завдання про коригування плану, уточнюють мову, повторюють когнітивні інтерв’ю й оновлюють матрицю змісту. Лише після цього переходять до польового дослідження, факторної структури, надійності й інших психометричних властивостей.


Приклад показує головну логіку: змістова валідність не питає лише, чи «правильні» окремі пункти. Вона питає, чи вся система змісту достатньо й зрозуміло представляє той конструкт, про який надалі говоритиме тестовий бал.


Типові помилки під час оцінювання змістової валідності


1. Починати з готових завдань без явного визначення конструкта. У такому разі експерти оцінюють набір текстів, але не можуть перевірити його відносно стабільної змістової карти.


2. Запрошувати тільки експертів і не перевіряти цільову групу там, де саме її досвід є джерелом змісту. Для self-report інструментів це особливо ризиковано.


3. Зводити всю оцінку до CVI або CVR. Індекс може бути корисним, але не показує автоматично, чи пропущена ціла грань, чи правильно люди розуміють формулювання і чи коректно визначено сам домен.


4. Вважати високий Cronbach’s alpha підтвердженням змістової валідності. Внутрішня узгодженість і змістове охоплення відповідають на різні питання.


5. Видаляти завдання лише тому, що вони погіршують статистичний показник, не перевіряючи їхню концептуальну функцію. Так можна отримати компактну й однорідну, але змістово збіднену шкалу.


6. Плутати зрозумілість із «простотою». Складний термін може бути необхідним для фахового тесту, якщо він належить до цільового конструкта і цільова популяція має його знати. Критерій — не мінімальна складність, а відсутність сторонніх вимог і відповідність intended use.


7. Вважати переклад готовою адаптацією. Культурна й мовна адаптація потребує окремих доказів змісту та, як правило, подальших психометричних досліджень.


8. Робити висновок про весь тест із одного зручного середнього показника. Добрий звіт зберігає окрему інформацію про релевантність, повноту, зрозумілість і ключові проблеми конкретних граней.


Як читати дослідження змістової валідності


Передусім знайдіть чітке визначення конструкта. Якщо автори не пояснюють його межі, подальші експертні числа важко інтерпретувати.


Перевірте, для кого створено інструмент. Вік, мова, культурний контекст, клінічний статус, освіта, професійна роль і спосіб застосування можуть змінювати релевантність та зрозумілість змісту.


Подивіться, хто генерував завдання і на яких джерелах. Теоретична модель, література, якісні інтерв’ю та аналіз реальної діяльності дають різні типи внеску; найсильніша схема пояснює, як вони були поєднані.


Оцініть склад експертів і цільової групи, а не лише їхню кількість. Потрібно знати, яку компетентність представляла кожна група і яке питання вона оцінювала.


Шукайте якісні дані про проблемні формулювання та пропущений зміст. Таблиця CVI без опису коментарів, критеріїв рішень і фактичних змін дає значно менше інформації.


Перевірте, чи розділено рівень пункту і рівень шкали. Усі пункти можуть мати прийнятні рейтинги, а домен усе одно бути неповним через неправильні пропорції або відсутню грань.


Подивіться, чи повторювали перевірку після значного переписування. Суттєво змінене завдання — фактично новий стимул, і старі дані про його зрозумілість не обов’язково описують нову версію.


Нарешті, не вимагайте від змістової валідності того, чого вона не оцінює. Після сильного content-validity етапу залишаються питання структури, надійності, похибки, зв’язків з іншими змінними, справедливості, інваріантності, інтерпретації балів і, для класифікаційних задач, діагностичної точності.


Змістова валідність як частина повного циклу психометрії


У психометрії якість тесту формується ланцюгом взаємопов’язаних рішень. Визначення конструкта задає, що має бути виміряно; операціоналізація переводить це в спостережувані показники; змістова валідність перевіряє, чи достатньо добре ці показники представляють конструкт; подальші аналізи досліджують, як система працює емпірично.


Те, що психологічний конструкт часто є латентною змінною, пояснює особливу роль змісту: ми не спостерігаємо латентну властивість безпосередньо, а робимо висновок про неї через відповіді, поведінку або інші показники. Якщо сам набір показників концептуально зміщений, статистична модель лише точніше опише зміщений набір.


Отже, сильна змістова валідність — не декоративний вступ до «справжньої статистики». Це фундамент того, щоб статистичний аналіз узагалі працював із матеріалом, який має належний психологічний зміст.


Питання та відповіді


Чи достатньо експертної оцінки для змістової валідності?


Зазвичай ні, якщо інструмент вимірює досвід, який має повідомляти сама цільова група. Експерти потрібні для зв’язку з теорією та доменом; респонденти — для перевірки релевантності їхньому досвіду, зрозумілості й виявлення пропусків. Для різних типів тестів баланс цих джерел відрізняється.


Скільки експертів потрібно?


Універсального числа немає. Розмір панелі залежить від методу, складності домену, різноманітності потрібної компетентності та способу кількісного аналізу. Якщо використовують CVR або CVI, кількість експертів впливає на інтерпретацію індексів; тому N і правила рішення мають бути задані й обґрунтовані.


Чи можна встановити змістову валідність лише статистично?


Ні. Статистика може узагальнити рейтинги експертів або респондентів, але питання «чи представляє зміст конструкт?» вимагає змістового визначення, якісних суджень і документованого зв’язку між доменом та елементами інструмента.


Чи є CVI = 0,80 доказом, що тест валідний?


Ні. Навіть якщо конкретна методика використовує такий поріг, він стосується визначеного способу агрегування суджень і не доводить загальну валідність тесту. Потрібно знати, хто оцінював, що оцінював, як задано конструкт, чи охоплено всі грані й які інші джерела доказів доступні.


Чи можна мати хорошу змістову валідність і низьку надійність?


Так. Інструмент може концептуально добре охоплювати домен, але давати нестабільні або неточні результати. І навпаки, дуже надійний інструмент може стабільно вимірювати лише вузький або не той зміст. Надійність і валідність взаємопов’язані, але не взаємозамінні.


Чи дорівнює змістова валідність face validity?


Ні. Face validity описує поверхове враження, що тест «схожий» на доречний. Змістова валідність потребує систематичного зіставлення змісту з конструктом, популяцією та використанням і перевірки релевантності, повноти та зрозумілості.


Чи може перекладений тест мати добру змістову валідність?


Так, але переклад має бути частиною культурної адаптації, а не єдиною процедурою. Потрібно перевірити релевантність, повноту й зрозумілість у новій популяції та зібрати інші потрібні психометричні докази для запланованого використання.


Чи означає хороша змістова валідність, що cutoff правильний?


Ні. Порогове значення потребує окремого емпіричного обґрунтування для визначеної задачі й популяції. Змістова валідність відповідає на питання про представлення конструкта, а не про оптимальну межу класифікації.


Чи можна опублікувати всі завдання тесту, щоб читач сам оцінив зміст?


Лише якщо права й режим безпеки це дозволяють. Для proprietary або secure tests не слід публікувати захищені завдання, ключі відповідей чи матеріали підрахунку. Змістову валідність можна прозоро описувати через карту конструкта, процедури, характеристики вибірок і результати оцінювання без розкриття захищеного тестового матеріалу.


Короткий практичний висновок


Щоб оцінити змістову валідність, поставте чотири послідовні запитання. По-перше, що саме визначено як конструкт і де його межі? По-друге, чи кожний елемент справді потрібний для цього конструкта в цій популяції та меті? По-третє, чи не пропущені ключові грані? По-четверте, чи розуміють люди матеріал так, як задумано?


Якщо відповідь на будь-яке з цих питань слабка, один коефіцієнт не врятує інтерпретацію. Сильна змістова валідність виникає з узгодження теорії, карти змісту, експертної компетентності, досвіду цільової групи, якісного тестування формулювань, кількісних індикаторів там, де вони доречні, та прозорого документування рішень.


Пов’язані статті


Психометрія: що це, що вона вимірює і як оцінюють якість психологічних тестів — загальна карта психологічного вимірювання, надійності, валідності та інтерпретації.


Психологічний конструкт: що це і як невидимі властивості перетворюють на вимірювані показники — про те, що саме стоїть за тестовим балом і чому чітке визначення конструкта передує валідації.



Латентні й спостережувані змінні: чим відрізняється психологічний конструкт від його показників — про зв’язок невидимої властивості з відповідями, поведінкою та іншими спостережуваними даними.



Похибка вимірювання в психології: випадкова, систематична і чому один бал не є абсолютно точним — про невизначеність конкретного результату та відмінність похибки від змістової відповідності.


Інтерпретованість результатів психологічного вимірювання: як надати зміст балу і зміні бала — про те, як перейти від числового результату до обґрунтованого практичного змісту.



Джерела


American Educational Research Association, American Psychological Association, & National Council on Measurement in Education. (2014). Standards for Educational and Psychological Testing.



Haynes, S. N., Richard, D. C. S., & Kubany, E. S. (1995). Content validity in psychological assessment: A functional approach to concepts and methods. Psychological Assessment, 7(3), 238–247.



Lawshe, C. H. (1975). A quantitative approach to content validity. Personnel Psychology, 28(4), 563–575.


Lynn, M. R. (1986). Determination and quantification of content validity. Nursing Research, 35(6), 382–385.


Mokkink, L. B., Elsman, E., & Terwee, C. B. (2024). COSMIN Manual, Version 2.0.


Mokkink, L. B., Herbelet, S., Tuinman, P. R., & Terwee, C. B. (2025). Content validity: judging the relevance, comprehensiveness, and comprehensibility of an outcome measurement instrument — a COSMIN perspective. Journal of Clinical Epidemiology, 185, 111879.


National Council on Measurement in Education. (n.d.). NCME Assessment Glossary.


Patrick, D. L., Burke, L. B., Gwaltney, C. J., Leidy, N. K., Martin, M. L., Molsen, E., & Ring, L. (2011a). Content validity — Part 1: eliciting concepts for a new PRO instrument. Value in Health, 14(8), 967–977.


Patrick, D. L., Burke, L. B., Gwaltney, C. J., Leidy, N. K., Martin, M. L., Molsen, E., & Ring, L. (2011b). Content validity — Part 2: assessing respondent understanding. Value in Health, 14(8), 978–988.


Polit, D. F., Beck, C. T., & Owen, S. V. (2007). Is the CVI an acceptable indicator of content validity? Appraisal and recommendations. Research in Nursing & Health, 30(4), 459–467.


Terwee, C. B., Prinsen, C. A. C., Chiarotto, A., Westerman, M. J., Patrick, D. L., Alonso, J., Bouter, L. M., de Vet, H. C. W., & Mokkink, L. B. (2018). COSMIN methodology for evaluating the content validity of patient-reported outcome measures: a Delphi study. Quality of Life Research, 27(5), 1159–1170.


Wilson, F. R., Pan, W., & Schumsky, D. A. (2012). Recalculation of the critical values for Lawshe’s content validity ratio. Measurement and Evaluation in Counseling and Development, 45(3), 197–210.

 
 
bottom of page