Конкурентна валідність: як тест порівнюють із критерієм, виміряним у той самий час
Автор: Український психологічний ХАБ · Опубліковано: 23 вересня 2026 року · Редакційна політика
Конкурентна валідність — це доказ того, наскільки результати тесту або іншого вимірювання узгоджуються із зовнішнім критерієм чи референтним вимірюванням, отриманим у той самий період. APA PsycTests визначає concurrent validity як відповідність результатів тесту результатам уже встановленого пов’язаного вимірювання, зібраним в один момент часу. Ключова ознака тут — не просто наявність кореляції, а те, що порівнюваний показник справді є релевантним для тієї інтерпретації, яку ми хочемо обґрунтувати.
У сучасній психометрії конкурентну валідність варто розуміти як частину ширшого аргументу валідності. Standards for Educational and Psychological Testing прямо визначають валідність як ступінь, до якого докази й теорія підтримують конкретні інтерпретації тестових балів для запропонованих способів використання. Тому коректніше питати не «чи валідний тест взагалі?», а «чи достатньо доказів для цього тлумачення балів, у цій популяції та для цього рішення?»
Конкурентна валідність: коротке визначення
Конкурентна валідність оцінює зв’язок між балами досліджуваного тесту та зовнішнім показником, який характеризує той самий або теоретично пов’язаний стан у поточний момент. Якщо критерій вимірюють пізніше, щоб перевірити, чи передбачає тест майбутній результат, це вже прогностична валідність.
Наприклад, новий тест професійної навички можна порівняти з актуальними показниками виконання роботи; новий клінічний скринінговий опитувальник — зі структурованою оцінкою, проведеною в той самий часовий період; коротку форму шкали — з її повною версією. Але сам факт одночасного порівняння ще не робить будь-який зовнішній показник добрим критерієм.
Український термін «конкурентна валідність» реально використовується у професійному психодіагностичному середовищі; зокрема його подає Всеукраїнська психодіагностична асоціація. У частині україномовних джерел також трапляється назва «поточна валідність». В англомовній літературі базовий термін — concurrent validity.
Науковий статус: окремий «вид валідності» чи джерело доказів
У старішій навчальній традиції валідність часто поділяли на змістову, критеріальну й конструктну, а конкурентну та прогностичну розглядали як підвиди критеріальної. Сучасні Standards AERA/APA/NCME використовують інтегрованішу модель: валідність стосується інтерпретацій і використання балів, а докази збирають з різних джерел — змісту, процесів відповіді, внутрішньої структури, зв’язків з іншими змінними та наслідків тестування.
Для конкурентної валідності найважливішим є блок доказів, що ґрунтуються на зв’язках з іншими змінними. У Standards зазначено, що зовнішні змінні можуть включати критерії, які тест має відображати або передбачати, інші тести того самого чи суміжного конструкта та показники реальної діяльності. Саме відповідність спостережуваного зв’язку теоретичним очікуванням підтримує конкретну інтерпретацію балів.
Ця логіка узгоджується з аргументативним підходом Майкла Кейна: Kane (2013) наголошує, що валідизують запропоновані інтерпретації та способи використання балів, а не «тест сам по собі». Тому одна успішна конкурентна кореляція є фрагментом доказової картини, а не остаточним сертифікатом якості інструмента.
Що означає «критерій, виміряний у той самий час»
«У той самий час» не обов’язково означає в ту саму хвилину. Сенс конкурентного дизайну полягає в тому, що тест і критерій описують один актуальний стан або той самий релевантний часовий період, а дослідження не ставить за мету передбачити подію в майбутньому.
Допустимий часовий інтервал залежить від конструкта. Для відносно стабільної характеристики кілька днів можуть майже нічого не змінювати. Для гострих симптомів, настрою, болю, стресу або стану після втручання навіть короткий проміжок може бути суттєвим. Дослідник має пояснити, чому обраний інтервал дозволяє вважати показники одночасними у змістовному сенсі.
Якщо між тестом і критерієм минув час, протягом якого об’єкт закономірно міг змінитися, зниження зв’язку може відображати реальну зміну, а не слабку валідність. І навпаки, якщо критерій збирають після тесту та саме майбутній результат є ціллю, мова вже йде про прогностичний дизайн.
Конкурентна, критеріальна і прогностична валідність: як не плутати
Критеріальна валідність — ширше поняття про зв’язок результату тесту з релевантним зовнішнім критерієм. Конкурентний дизайн перевіряє цей зв’язок для поточного критерію. Прогностичний дизайн перевіряє зв’язок із результатом, який з’явиться пізніше.
У практичній мові можна сказати: «конкурентна» відповідає на запитання «як тест співвідноситься з тим, що ми спостерігаємо зараз?», а «прогностична» — «як тест пов’язаний із тим, що станеться потім?». Різниця стосується передусім часової логіки критерію, а не назви статистичного коефіцієнта.
Один і той самий інструмент може мати добрі конкурентні докази й слабші прогностичні, або навпаки. Поточна відповідність зовнішньому показнику не гарантує точного передбачення майбутнього, бо майбутні результати залежать від нових умов, втручань, розвитку, навчання, середовища та інших змінних.
Найважливіше рішення — що вважати критерієм
Якість конкурентного дослідження визначається не лише статистикою, а передусім якістю зовнішнього критерію. Якщо критерій погано представляє цільову характеристику, висока кореляція з ним може підтримувати хибний висновок. Критерій має бути змістово релевантним, достатньо надійним, придатним для цільової популяції та максимально незалежним від досліджуваного тесту.
Це особливо важливо для опитувальників і patient-reported outcome measures. COSMIN Reporting Guideline 2.0 визначає критеріальну валідність як ступінь відповідності балів «золотому стандарту», але водночас підкреслює: для багатьох суб’єктивних конструктів справжнього gold standard просто немає. Популярний або давно вживаний опитувальник не стає еталоном автоматично.
Коли зовнішній критерій може бути доречним
Доречним критерієм може бути незалежний об’єктивний показник поточної діяльності, якісно проведена експертна або клінічна оцінка, структуроване інтерв’ю для відповідної мети, лабораторний чи поведінковий показник, а в окремих задачах — визнаний референтний метод. Вибір залежить від того, що саме означають бали тесту й для якого рішення їх планують використовувати.
Коли інший тест — це не «золотий стандарт»
Якщо нову шкалу просто корелюють з іншим опитувальником того самого або близького конструкта, а другий інструмент не є справжнім еталоном, таке порівняння часто краще трактувати як конвергентний доказ або перевірку гіпотез про конструктну валідність. COSMIN прямо застерігає від автоматичного оголошення широко вживаного інструмента gold standard.
Це важливе розрізнення: «старіший», «відоміший» і «частіше цитований» не означає «істинний критерій». Два опитувальники можуть добре корелювати тому, що поділяють однаковий формат самоопису, схожі формулювання, спільну упередженість відповіді або один і той самий контекст, а не тому, що обидва точно відображають цільовий феномен.
Як проводять дослідження конкурентної валідності
Добре дослідження починається до обчислення коефіцієнтів. Спочатку формулюють, яку саме інтерпретацію балів треба підтримати, у якій популяції та для якого використання. Після цього визначають зовнішній критерій і обґрунтовують, чому він відповідає потрібному конструкту або результату.
Далі задають часову схему: тест і критерій мають відображати один релевантний стан. Якщо оцінювання виконує експерт або клініцист, бажано мінімізувати залежність оцінки від результату досліджуваного тесту, інакше виникає ризик контамінації критерію: сам тест починає впливати на те, з чим його потім порівнюють.
Вибірка повинна відповідати тій популяції, для якої робитимуть висновки. Показник, отриманий у студентів, не переноситься автоматично на клінічну популяцію; оцінка в дорослих не стає доказом для дітей; результат для однієї мовної версії не підтверджує іншу версію без додаткової перевірки.
До аналізу корисно сформулювати очікуваний напрямок і приблизну силу зв’язку, можливі альтернативні пояснення, правила роботи з пропущеними даними та план статистичного аналізу. Такий підхід зменшує ризик того, що після отримання результатів дослідник підбере зручну інтерпретацію під уже побачені цифри.
У звіті потрібні характеристика вибірки, точний опис тесту й критерію, часовий інтервал, спосіб збору даних, статистичний метод, оцінка ефекту з невизначеністю, а також обмеження. Одна фраза «r = 0,62, p < 0,05, тест валідний» не закриває питання валідності.
Яку статистику використовують
Для двох кількісних показників часто використовують кореляцію Пірсона або Спірмена залежно від шкали, розподілу, монотонності зв’язку й передумов моделі. COSMIN також рекомендує обґрунтовувати обрану статистику: для неперервного критерію можуть бути доречними кореляції, а для дихотомічного gold standard — ROC/AUC, чутливість і специфічність.
Вибір коефіцієнта має випливати з типу даних і конкретного питання. Pearson r характеризує лінійний зв’язок між двома кількісними змінними; Spearman rho — монотонний ранговий зв’язок і часто є стійкішим до порушень окремих передумов. Для категорій можуть бути потрібні інші показники асоціації або узгодженості. Жоден коефіцієнт не є універсальною «формулою конкурентної валідності».
Важливо показувати не лише точкову оцінку, а й довірчий інтервал. Один і той самий коефіцієнт може мати зовсім різну переконливість у вибірці з 40 і з 4000 учасників. Широкий інтервал означає велику невизначеність, навіть якщо саме число здається великим.
Статистична значущість також не дорівнює змістовній валідності. American Statistical Association наголошує, що p-value не показує ймовірність істинності гіпотези, не вимірює розмір ефекту і не повинен бути єдиною підставою для наукового висновку. Для конкурентної валідності важливі величина й напрямок зв’язку, невизначеність, дизайн, якість критерію та відповідність попередній гіпотезі.
Кореляція і згода — різні питання
Два методи можуть дуже сильно корелювати й водночас систематично давати різні значення. Якщо один інструмент стабільно дає на 10 балів більше за інший, ранжування людей може бути майже однаковим і кореляція — високою, але методи не є взаємозамінними.
Класична робота Bland & Altman (1986) показала, що кореляція сама по собі є неналежним способом оцінювати взаємозамінність двох методів вимірювання. Коли дослідницьке питання саме про абсолютну згоду між методами, потрібні методи аналізу згоди, а не лише кореляція.
Тому у звіті треба чітко сказати, що саме перевіряли: асоціацію, здатність класифікувати, абсолютну згоду, точність відносно критерію чи можливість замінити один метод іншим. Ці питання споріднені, але не тотожні.
Що може спотворити оцінку конкурентної валідності
Ненадійний або слабкий критерій
Якщо зовнішній критерій містить багато похибки, зв’язок із тестом може знижуватися навіть тоді, коли тест вимірює потрібну характеристику. Саме тому дані про надійність психологічного тесту і надійність критерію потрібні для інтерпретації валідизаційної кореляції. Надійність і валідність залишаються різними властивостями доказів: висока надійність не гарантує валідності.
Обмеження діапазону
Якщо у вибірці майже всі учасники мають схожі значення критерію, кореляція може штучно зменшуватися. Наприклад, тест професійних здібностей, перевірений лише серед уже відібраних високоефективних працівників, може показати слабший зв’язок, ніж у повному діапазоні кандидатів.
Спільний метод і спільне джерело
Коли і тест, і критерій є самоопитувальниками з однаковим форматом відповідей, їхній зв’язок частково може відображати спільний метод: стиль самоопису, соціальну бажаність, загальну негативну афективність, контекст заповнення або подібне формулювання пунктів. Такий зв’язок не слід автоматично трактувати як чистий доказ цільового конструкта.
Контамінація критерію
Критерій стає контамінованим, якщо оцінювач знає бал досліджуваного тесту й використовує його у власному рішенні. Тоді тест частково порівнюють із наслідком самого себе, і зв’язок може бути завищеним. У клінічних та експертних дослідженнях за можливості розділяють джерела інформації або засліплюють оцінювача щодо індексного тесту.
Викиди, нелінійність і невдалий коефіцієнт
Окремі екстремальні значення можуть суттєво змінювати Pearson r, а нелінійний зв’язок може виглядати слабким, хоча між змінними є систематичне співвідношення. Графічний огляд даних, перевірка передумов і заздалегідь обґрунтований вибір моделі мають передувати остаточній інтерпретації.
Чи існує «достатній» коефіцієнт конкурентної валідності
Універсального числа, після якого тест автоматично стає «конкурентно валідним», немає. Очікувана величина залежить від конструкта, точності обох вимірювань, типу критерію, неоднорідності вибірки, ставок рішення та того, наскільки близькими мають бути два показники за теорією.
Порогові орієнтири можуть бути виправдані в конкретній методологічній системі. Наприклад, COSMIN для окремих PROM-сценаріїв задає конкретні очікування, але ці числа пов’язані з певними типами інструментів і не є універсальним законом для всіх психологічних тестів. Переносити їх без контексту на інтелект, особистість, професійний відбір або клінічний скринінг некоректно.
Сильна інтерпретація має спиратися на попередньо сформульовану гіпотезу, довірчий інтервал, якість критерію, адекватність дизайну й узгодженість з іншими джерелами доказів. Слабкий зв’язок теж не завжди означає, що тест «поганий»: можливо, критерій вимірює інший аспект, має велику похибку або вибірка надто однорідна.
Що конкурентна валідність не доводить
Конкурентна валідність не доводить причинність. Якщо тестовий бал пов’язаний з актуальним результатом, це не означає, що вимірювана риса спричинила цей результат або що зміна балу спричинить зміну критерію.
Вона не доводить прогностичну валідність. Поточна відповідність не є доказом того, що інструмент точно передбачає майбутній перебіг, успіх, рецидив, навчальний результат або іншу майбутню подію.
Вона не доводить надійність, справедливість, культурну еквівалентність, measurement invariance чи відсутність bias. Ці питання потребують окремих доказів. Висока кореляція в одній групі не показує автоматично, що тест працює однаково для різних мовних, вікових, культурних або клінічних груп.
Вона не доводить клінічну корисність. Навіть інструмент з хорошим зв’язком із критерієм може бути занадто довгим, дорогим, незручним, неінформативним для конкретного рішення або мати неприйнятні наслідки помилок.
І вона не перетворює скринінг на діагноз. Скринінговий бал може підвищувати або знижувати ймовірність певного стану та бути корисним для подальшого оцінювання, але діагностика потребує відповідного клінічного процесу, контексту й професійної інтерпретації.
Мовна й культурна адаптація: окремий рівень доказів
Докази конкурентної валідності, отримані для англомовної версії, не переносяться автоматично на український переклад. International Test Commission розрізняє простий переклад і повну адаптацію тесту: адаптація включає перевірку еквівалентності, надійності, валідності та інших характеристик у новій мовній і культурній популяції.
Тому наявність українського тексту методики ще не означає наявність валідованої української версії. Для конкурентної валідності важливо, щоб і тест, і критерій були придатними для цієї популяції, а спосіб їх інтерпретації відповідав саме українському мовному та культурному контексту.
Практичні приклади
Професійний відбір
Новий тест навичок продажу порівнюють із поточними показниками роботи співробітників за той самий період. Це може дати конкурентний доказ, якщо показники діяльності справді відображають цільову компетентність. Але продажі залежать також від території, ціни, маркетингу, портфеля клієнтів і досвіду, тому критерій може містити багато сторонньої варіації.
Клінічний скринінг
Короткий опитувальник симптомів порівнюють із незалежним структурованим клінічним інтерв’ю, проведеним у тому самому часовому вікні. Якщо мета — відрізняти випадки від невипадків за референтним стандартом, доречними можуть бути чутливість, специфічність і ROC/AUC. Але cutoff не є універсальною межею «є / немає розладу», а скринінг не замінює діагноз.
Коротка і повна форма
Нову коротку форму інструмента порівнюють із повною версією, виміряною одночасно. У деяких системах це може бути сильним критеріальним сценарієм, бо повна форма слугує референтом для скороченої. Проте дослідник усе одно має оцінити, чи скорочення не змінило зміст, діапазон або практичне значення балів.
Новий опитувальник і відомий опитувальник
Нову шкалу тривоги корелюють з іншою популярною шкалою тривоги. Якщо друга шкала не є gold standard, логічніше говорити про конвергентний доказ: дві методики, що теоретично вимірюють близькі конструкти, мають показувати очікуваний зв’язок. Назвати це критеріальною валідністю лише через популярність другого тесту було б надмірним висновком.
Практичний чекліст для читання дослідження
1. Яку саме інтерпретацію балів автори хочуть підтримати? Формулювання має бути конкретним, а не загальним «тест валідний».
2. Що обрано критерієм і чому? Потрібне змістове обґрунтування, а не лише посилання на популярність іншого тесту.
3. Чи справді тест і критерій описують один часовий стан? Для змінних симптомів навіть короткий інтервал може мати значення.
4. Чи відповідає вибірка цільовій популяції? Вік, мова, культура, клінічний статус, рівень освіти й умови тестування можуть змінювати результати.
5. Чи є дані про надійність тесту та критерію? Значна похибка в будь-якому з двох вимірювань впливає на спостережуваний зв’язок.
6. Чи відповідає статистика типу даних і дослідницькому питанню? Кореляція, класифікаційна точність і абсолютна згода відповідають на різні запитання.
7. Чи подано величину ефекту та довірчий інтервал, а не лише p-value? Статистична значущість сама по собі не робить доказ сильним.
8. Чи враховано альтернативні пояснення: спільний метод, контамінацію критерію, обмеження діапазону, викиди, нелінійність, невідповідність конструкта?
9. Чи не виходять висновки за межі даних? Конкурентний дизайн не доводить майбутній прогноз, причинність, діагностичну достатність або культурну еквівалентність.
10. Чи узгоджується результат з іншими джерелами доказів валідності? Найсильніший висновок виникає з сукупності незалежних і теоретично узгоджених доказів.
Поширені запитання
Що таке конкурентна валідність простими словами?
Це перевірка того, чи співвідносяться результати нового тесту з релевантним зовнішнім показником, отриманим приблизно в той самий час. Вона показує поточну відповідність, а не майбутній прогноз.
Чим конкурентна валідність відрізняється від прогностичної?
За конкурентної валідності критерій вимірюють у тому самому релевантному часовому періоді. За прогностичної — критерій з’являється пізніше, і перевіряється здатність початкового балу передбачати майбутній результат.
Чи достатньо високої кореляції, щоб сказати, що тест валідний?
Ні. Потрібно знати, з чим саме корелює тест, наскільки якісний критерій, чи відповідає вибірка цільовій популяції, який дизайн дослідження, яка невизначеність оцінки та які альтернативні пояснення зв’язку. Валідність — це аргумент, побудований із кількох джерел доказів.
Чи можна використовувати інший опитувальник як критерій?
Можна використовувати інший інструмент як компаратор, але не кожен компаратор є gold standard. Якщо обидва опитувальники вимірюють близькі конструкти й жоден не є еталоном, результат частіше підтримує конвергентну або конструктну валідність.
Який коефіцієнт конкурентної валідності вважається добрим?
Універсального порога немає. Очікувана величина залежить від конструкта, критерію, похибки вимірювання, діапазону вибірки й цілей застосування. Порогові значення мають сенс лише всередині конкретної методології та заздалегідь обґрунтованої гіпотези.
Чи треба, щоб тест і критерій проводили в один день?
Не завжди. Важливо, щоб часовий інтервал був достатньо коротким відносно швидкості змін цільового стану. Для стабільних характеристик припустимий інтервал може бути довшим, для гострих симптомів — значно коротшим.
Чи може конкурентна валідність підтвердити діагноз?
Ні. Вона може показати, наскільки бал тесту узгоджується з релевантним поточним критерієм, але діагноз не встановлюють за одним score або скринінговим результатом. Для діагностики потрібні відповідні критерії, клінічне оцінювання та контекст.
Чи є конкурентна валідність тим самим, що конвергентна?
Ні. Конкурентність описує часову логіку порівняння з актуальним зовнішнім показником; конвергентний доказ стосується очікуваного зв’язку між методами, що вимірюють однакові або близькі конструкти. В одному дослідженні ці логіки можуть перетинатися, але вони не є синонімами.
Висновок
Конкурентна валідність відповідає на конкретне питання: наскільки бали тесту узгоджуються з релевантним показником того самого актуального стану. Її сила залежить від якості критерію, дизайну, вибірки, статистичного аналізу й теоретичної логіки. У сучасній психометрії це один із компонентів ширшої системи доказів, що підтримує певну інтерпретацію та використання тестових балів.
Найкорисніше правило для практики: не запитувати лише «наскільки висока кореляція?». Спершу запитати «з чим саме ми порівнюємо тест, чому це є добрим критерієм, у кого отримано дані і який висновок ми маємо право зробити?». Саме така логіка відповідає сучасному розумінню валідності у Standards AERA/APA/NCME та аргументативному підході до валідизації Kane.
Пов’язані статті
Психометрія: що це, що вона вимірює і як оцінюють якість психологічних тестів — базова карта психологічного вимірювання, валідності, надійності та інтерпретації тестових балів.
Надійність психологічного тесту: що це, які бувають види і чому надійність не дорівнює валідності — про прецизійність, стабільність, внутрішню узгодженість і похибку вимірювання.
Джерела
American Educational Research Association, American Psychological Association, & National Council on Measurement in Education. (2014). Standards for Educational and Psychological Testing. Standards.
American Psychological Association. APA PsycTests Methodology Field Values. APA.
American Statistical Association. (2016). Statement on Statistical Significance and P-Values. ASA.
Bland, J. M., & Altman, D. G. (1986). Statistical methods for assessing agreement between two methods of clinical measurement. The Lancet, 327(8476), 307–310. https://doi.org/10.1016/S0140-6736(86)90837-8.
de Arruda, G. T., et al. (2025). Explanation & Elaboration document of the COSMIN Reporting Guideline 2.0. COSMIN.
International Test Commission. (2017). The ITC Guidelines for Translating and Adapting Tests (Second edition). International Test Commission.
Kane, M. T. (2013). Validating the Interpretations and Uses of Test Scores. Journal of Educational Measurement, 50(1), 1–73. https://doi.org/10.1111/jedm.12000.
Messick, S. (1995). Validity of psychological assessment: Validation of inferences from persons’ responses and performances as scientific inquiry into score meaning. American Psychologist, 50(9), 741–749. https://doi.org/10.1037/0003-066X.50.9.741.
Всеукраїнська психодіагностична асоціація. Конкурентна валідність. Глосарій. ВПА.
