top of page

Психологічна енкциклопедія

Критеріальна валідність: як результати тесту співвідносять із зовнішнім критерієм

6 днів тому
Читати 15 хв

Автор: Український психологічний ХАБ · Опубліковано: 23 вересня 2026 · Редакційна політика


Критеріальна валідність описує докази, отримані з того, наскільки результати психологічного тесту або шкали пов’язані із зовнішнім критерієм, важливим для заявленого використання результатів. У сучасній психометрії йдеться не про постійний ярлик «тест валідний», а про обґрунтованість конкретної інтерпретації та використання балів. Саме так валідність розглядають Standards for Educational and Psychological Testing та аргументативний підхід до валідизації, детально сформульований Майклом Кейном.


Найпростіший приклад: якщо тест претендує на прогнозування майбутньої успішності навчання, зовнішнім критерієм може бути подальша академічна успішність. Якщо інструмент використовується для оцінювання професійної придатності, критерієм може бути незалежно виміряна ефективність роботи. У клінічному контексті критерієм або референтним стандартом може бути результат ширшого діагностичного оцінювання. У кожному випадку якість висновку залежить не лише від зв’язку між двома числами, а й від якості самого критерію, дизайну дослідження, популяції, статистичної моделі та intended use — призначення тесту.


Коротка відповідь


Критеріальна валідність — це доказ того, що результати тесту систематично співвідносяться із зовнішнім показником, який має змістове значення для того, що тест повинен описувати, розрізняти або прогнозувати. Такий доказ може бути одночасним, коли тест і критерій оцінюють приблизно в один період, або прогностичним, коли тест використовують для передбачення майбутнього критерію.


Важлива умова: зовнішній критерій має бути справді доречним. Висока кореляція зі слабким, упередженим або нерелевантним критерієм не перетворюється на сильну валідність. Так само відсутність великої кореляції не обов’язково означає, що тест марний: зв’язок може послаблюватися через похибку вимірювання, обмеження діапазону, невідповідну вибірку, нестабільний критерій або невдалу статистичну модель.


Що таке критеріальна валідність


У традиційній термінології criterion-related validity часто описували як окремий «вид валідності». Сучасні стандарти змістили акцент: взаємозв’язок із критерієм є одним із джерел доказів валідності для певного тлумачення та використання score. AERA, APA та NCME прямо вимагають, щоб у дослідженнях такого типу повідомляли придатність і технічну якість критерію, його надійність, репрезентацію цільового конструкта та можливу сторонню варіативність.


В українській професійній термінології вживається форма «критеріальна валідність». Всеукраїнська психодіагностична асоціація подає її як загальне поняття, що охоплює прогностичну та конкурентну валідність. У старіших джерелах можна зустріти «критерійна валідність» або «поточна валідність»; у цій статті основними термінами є «критеріальна», «конкурентна» та «прогностична валідність».


Критеріальна валідність не належить тесту раз і назавжди


Фраза «цей тест має критеріальну валідність» є надто грубою, якщо не зазначено, для якої популяції, якого критерію та якого рішення це показано. Один і той самий інструмент може добре прогнозувати один результат і слабко — інший; мати сильні докази у студентській вибірці та недостатні — у клінічній; працювати для групових досліджень і бути недостатньо точним для індивідуального високоризикового рішення.


У сучасній психометрії валідизація є накопичувальним аргументом. Критеріальні зв’язки доповнюють, а не замінюють докази змісту, внутрішньої структури, зв’язків з іншими змінними, наслідків використання та теоретичної узгодженості.


Що таке зовнішній критерій


Зовнішній критерій — це показник поза самим тестом, із яким порівнюють його результати, щоб перевірити практично або теоретично значущий зв’язок. Критерій може бути неперервним, наприклад середній бал навчання або кількість виконаних завдань, категоріальним, наприклад наявність чи відсутність стану за незалежним референтним стандартом, порядковим, часовим або складеним із кількох компонентів.


Слово «зовнішній» не означає «ідеальний». Критерій також вимірюється з похибкою, може залежати від контексту, містити випадковий шум, систематичне упередження або лише частково відображати потрібний результат. Тому дослідження критеріальної валідності одночасно є дослідженням якості самого критерію.


Яким має бути хороший критерій


Доречність. Критерій повинен відповідати заявленому рішенню. Якщо тест заявлено як предиктор навчальної успішності, критерій має відображати реальну й релевантну успішність, а не випадковий сурогат. Якщо інструмент використовується для моніторингу функціонування, критерій має бути пов’язаний саме з функціонуванням, а не лише з близьким за змістом самоописом.


Надійність. Нестабільний критерій створює додаткову похибку й зазвичай послаблює спостережуваний зв’язок. Це одна з причин, чому коефіцієнт кореляції не можна тлумачити без даних про точність обох вимірювань.


Незалежність. Якщо оцінювач знає результат тесту й несвідомо використовує його під час виставлення критеріальної оцінки, зв’язок може бути штучно завищений. У діагностичних дослідженнях аналогічна проблема виникає, коли index test входить до референтного стандарту або впливає на нього.


Відповідність популяції. Критерій, який має певний зміст в одній системі освіти, професії, культурі чи клінічній практиці, може мати інше значення в іншій. Валідність не переноситься автоматично між мовами, країнами, віковими групами та умовами використання.


Дефіцит і контамінація критерію


У психометрії праці особливо чітко описані дві проблеми. Criterion deficiency, або дефіцит критерію, виникає, коли вимірюваний критерій пропускає важливу частину реального результату. Criterion contamination, або контамінація критерію, виникає, коли в критерій потрапляють сторонні чинники, які не належать до цільового результату. Ці поняття систематизовані, зокрема, у матеріалах SIOP про теорію та розроблення критеріїв.


Наприклад, оцінювати якість роботи психолога лише кількістю проведених консультацій — дефіцитно, бо критерій не охоплює якість допомоги, етичність і результати. Оцінювати її тільки суб’єктивним рейтингом керівника, який значною мірою залежить від особистої симпатії, — потенційно контаміновано. У такому випадку кореляція тесту з рейтингом може відображати не заявлений конструкт, а сторонні соціальні фактори.


Конкурентна і прогностична валідність


Конкурентна валідність описує зв’язок результату тесту з критерієм, виміряним приблизно в той самий період. Вона корисна, коли потрібно з’ясувати, чи пов’язаний новий або коротший інструмент із уже наявним незалежним показником поточного стану. Часова близькість не робить критерій автоматично сильним: його природу та якість все одно потрібно обґрунтувати.


Прогностична валідність описує здатність результату тесту передбачати майбутній критерій: подальшу успішність навчання, ефективність роботи, ризик певної події або інший outcome. Тут особливо важливі часовий порядок, стабільність умов, attrition — вибуття учасників, зміна базової частоти події та незалежна перевірка прогностичної моделі.


Різниця між конкурентним і прогностичним дизайном стосується часу та призначення, а не двох незалежних концепцій валідності. Обидва є способами отримати evidence про відношення тестових балів до зовнішніх критеріїв.


Як оцінюють критеріальну валідність


Правильне дослідження починається з питання, а не з коефіцієнта. Потрібно визначити, яку саме інтерпретацію або рішення має підтримати тест, хто є цільовою популяцією, що вважатиметься критерієм, коли його вимірюють, які джерела похибки можливі та яка статистична модель відповідає формату даних.


1. Формулюють intended use і критерій


Спочатку задають практичне твердження: наприклад, «результат X допомагає прогнозувати результат Y у популяції Z протягом шести місяців». Така формула одразу показує, що потрібно перевірити: X, Y, Z, часовий інтервал, спосіб вимірювання та силу/невизначеність прогностичного зв’язку. Без цього статистична асоціація легко перетворюється на число без ясного значення.


2. Перевіряють якість критерію


Згідно зі Стандартом 1.17 AERA/APA/NCME, коли валідність обґрунтовується зв’язком із критерієм, слід описати його придатність, технічну якість, надійність, те, наскільки він репрезентує intended construct, а також сторонні джерела варіативності. Якщо критерій сам є слабким, точність тесту неможливо оцінити коректно.


3. Обирають статистичний метод за типом критерію


Для двох неперервних показників часто аналізують кореляцію, але цього може бути недостатньо. Якщо питання звучить як «якого рівня критерію очікувати за конкретного тестового бала?», потрібна регресійна модель або умовний розподіл критерію для різних score. Для категоріального критерію застосовують моделі, придатні до категоріальних outcome, наприклад логістичну регресію, а не механічно перетворюють усе на звичайну кореляцію.


Це прямо відображено у Стандарті 1.18: для тверджень про прогнозування рівня критерію за score регресійний аналіз часто корисніший за одну кореляцію, а для категоріальних критеріїв потрібні відповідні статистичні процедури.


4. Оцінюють величину ефекту і невизначеність


Коефіцієнт без довірчого інтервалу створює хибне відчуття точності. Стандарт 1.20 рекомендує повідомляти міру величини відношення разом із показником невизначеності, наприклад стандартною похибкою або довірчим інтервалом. Для практичного рішення важливі і величина ефекту, і межі правдоподібних значень.


5. Перевіряють форму зв’язку


Одна кореляція стискає відношення до одного числа. Вона не показує нелінійність, неоднорідність дисперсії, різні патерни в підгрупах, ceiling/floor effects або ділянки, де прогноз стає особливо неточним. Графік даних, аналіз залишків і перевірка припущень моделі часто дають більше інформації, ніж формальна значущість коефіцієнта.


6. Враховують обмеження діапазону


Якщо в дослідження потрапила лише вузька частина популяції, зв’язок може виглядати слабшим або інакшим. Класичний приклад — валідизація вступного тесту тільки серед уже зарахованих студентів: найнижчі результати відсутні, бо ці люди не потрапили до вибірки. Це restriction of range. Корекції можливі лише за обґрунтованих припущень і повинні бути прозоро описані.


AERA/APA/NCME Стандарт 1.21 вимагає, щоб при корекції зв’язку через обмеження діапазону або attenuation повідомляли і скориговані, і нескориговані результати та процедуру корекції.


7. Перевіряють модель на нових даних


Якщо ваги кількох тестів або предикторів підібрано емпірично на одній вибірці, модель може підлаштуватися під випадковий шум. Стандарт 1.19 вимагає крос-валідації, коли емпіричні ваги отримано на основі даних. Практичний сенс простий: модель повинна працювати не лише там, де її побудували.


Кореляція з критерієм: що вона показує і чого не показує


Кореляція показує силу та напрямок статистичного зв’язку між двома змінними за певних припущень. Вона може бути корисною частиною критеріальної валідизації, але не є автоматичним доказом точного прогнозу, причинності, справедливості або клінічної корисності.


Кореляція r = 0,40 не означає, що тест «правильний на 40%». Квадрат кореляції r² іноді описують як частку спільної варіативності у простій лінійній ситуації, але й це не є відсотком правильних індивідуальних рішень. Для прикладних рішень важливі помилка прогнозу, базова частота outcome, пороги, наслідки хибних рішень і те, чи додає тест інформацію понад уже доступні предиктори.


Статистично значуща кореляція також не гарантує практичної важливості. За великої вибірки дуже малий ефект може мати мале p-значення. І навпаки, перспективний за величиною ефект у невеликій вибірці може бути оцінений неточно. Тому критеріальну валідність читають через effect size, довірчий інтервал, дизайн і контекст використання.


Чи існує універсальний «хороший» коефіцієнт


Універсального порога на кшталт «r ≥ 0,50 означає валідний тест» немає. Прийнятність зв’язку визначається призначенням, якістю критерію, надійністю обох вимірювань, базовою частотою події, альтернативними предикторами, ціною помилок і тим, наскільки точні рішення потрібні. Для високоризикових індивідуальних рішень вимоги до evidence вищі, ніж для описового дослідження групових закономірностей.


У деяких спеціалізованих системах оцінювання measurement properties є власні operational thresholds. Наприклад, COSMIN створений насамперед для patient-reported outcome measures і використовує доменно-специфічні правила. Такі пороги не слід механічно переносити на всі психологічні тести, професійний відбір, освітнє тестування або діагностичні рішення.


«Золотий стандарт» — найскладніше місце критеріальної валідності


Ідея критеріальної валідності найпростіша, коли існує незалежний і високоякісний критерій, близький до «золотого стандарту». У психології це часто недосяжно: багато конструктів латентні, а доступні інструменти є різними способами вимірювання того самого теоретичного поняття, а не безпомилковими стандартами істини.


COSMIN-класифікація добре демонструє цю проблему в сфері health-related PROM. Mokkink та співавтори зазначають, що для багатьох patient-reported outcomes справжнього gold standard не існує. Тому зв’язок нової шкали з іншою широко вживаною шкалою може бути доказом конструктної або конвергентної валідності, а не критеріальної валідності в строгому сенсі.


Інший психологічний тест не завжди є зовнішнім критерієм


Якщо нову шкалу депресивних симптомів порівнюють з іншою шкалою депресивних симптомів, це ще не робить другу шкалу золотим стандартом. Обидва інструменти можуть мати власну похибку, різне змістове охоплення та спільні методичні упередження самооцінювання. У такому дизайні правильніше говорити про зв’язки з іншими мірами і про конвергентні докази, якщо немає обґрунтування, чому один інструмент справді є критерієм.


Це розрізнення важливе для наукової мови. «Наш тест корелює з відомим опитувальником» і «наш тест валідовано проти зовнішнього критерію» — не однакові твердження. Друге вимагає сильнішого аргументу щодо статусу критерію.


Критеріальна валідність і діагностична точність


Коли тест або скринінг використовують для розрізнення станів за категоріальним референтним стандартом, виникає окрема мова diagnostic accuracy. Тут аналізують чутливість, специфічність, позитивну й негативну прогностичну цінність, likelihood ratios, ROC-криву та AUC. Це пов’язана, але не тотожна критеріальній валідності область.


Методологію таких досліджень систематизують Cochrane Handbook for Systematic Reviews of Diagnostic Test Accuracy та STARD 2015. Обидві рамки наголошують на якості референтного стандарту, репрезентативній вибірці, уникненні систематичних похибок і повному описі потоку учасників та порогів.


Чутливість і специфічність не дорівнюють PPV і NPV


Чутливість описує частку позитивних за референтним стандартом випадків, які тест правильно позначив як позитивні. Специфічність — частку негативних випадків, правильно позначених як негативні. PPV і NPV відповідають на інше питання: наскільки ймовірно, що людина справді належить до відповідної категорії за певного результату тесту. Прогностичні цінності сильно залежать від поширеності стану та базової частоти у конкретній популяції.


ROC/AUC не дорівнює клінічній корисності


AUC узагальнює здатність показника розрізняти дві категорії за різних порогів, але не повідомляє, чи є конкретний cutoff оптимальним для певної практики, які наслідки хибнопозитивних і хибнонегативних рішень та чи змінює тест допомогу людині. Для глибшого розуміння цієї логіки див. також теорію виявлення сигналу.


Скринінг не є діагнозом


Навіть добре валідований скринінговий cutoff не є універсальною межею «розлад є / розладу немає». Скринінг має виявляти людей, яким може бути потрібне подальше оцінювання. Діагноз спирається на ширший клінічний процес: критерії, інтерв’ю, анамнез, функціонування, диференційну оцінку та інші релевантні дані. Один score є джерелом інформації, а не самостійним діагнозом.


Надійність, похибка вимірювання і критеріальна валідність


Надійність і валідність відповідають на різні питання. Надійність психологічного тесту описує стабільність або точність вимірювання щодо конкретного джерела похибки; критеріальна валідність — обґрунтованість зв’язку score із зовнішнім критерієм для певної інтерпретації та використання.


Низька надійність тесту або критерію зазвичай обмежує максимальний спостережуваний зв’язок. Через це іноді застосовують correction for attenuation. Але скоригований коефіцієнт є модельною оцінкою за певних припущень, а не «справжньою валідністю». Саме тому сучасні стандарти вимагають показувати і скориговані, і сирі результати, а також метод корекції.


У класичній теорії тестів спостережуваний бал розглядають як поєднання істинної компоненти та похибки. Ця рамка допомагає зрозуміти, чому слабка точність вимірювання обох сторін зв’язку впливає на критерійні коефіцієнти, але не замінює окремий аналіз валідності.


Обмеження діапазону, відбір і селекційне упередження


Критеріальна валідність особливо чутлива до того, хто потрапив у вибірку. Якщо організація досліджує тест лише серед кандидатів, які вже пройшли попередній відбір, розподіл балів і outcome стає вужчим. Якщо клінічне дослідження включає лише очевидно тяжкі випадки та дуже здоровий контроль, діагностична точність може бути завищена порівняно з реальною практикою, де трапляються суміжні, легкі й неоднозначні стани.


Тому сильне дослідження описує eligibility criteria, спосіб набору, частку вибулих, відсутні дані та те, наскільки досліджувана вибірка схожа на популяцію, в якій тест реально використовуватиметься. Репрезентативність тут має безпосереднє значення для перенесення результатів.


Крос-валідація і ризик overfitting


Коли дослідник підбирає формулу прогнозу на тих самих даних, де потім оцінює її якість, результат може бути оптимістичним. Особливо це стосується багатьох предикторів, малих вибірок, автоматичного відбору змінних або тонкого налаштування cutoff. Крос-валідація, окрема validation sample або зовнішня реплікація показують, чи зберігається результат поза training data.


Висока критеріальна асоціація в одній вибірці — початок доказу, а не кінець. Для високоставкових рішень важливо бачити повторюваність результату в незалежних вибірках, у різних умовах і, якщо це частина intended use, у релевантних підгрупах.


Справедливість, групи і можливий bias


Загальна кореляція тесту з критерієм у всій вибірці не доводить, що тест однаково працює для різних груп. Можуть відрізнятися intercept, slope, calibration, похибка прогнозу або значення самого критерію. Для рішень, що впливають на освіту, роботу чи доступ до допомоги, ці питання є частиною валідизації та fairness.


AERA/APA/NCME Стандарт 1.17 окремо вказує на потребу розглядати bias критерію для ідентифікованих груп. Це важливе нагадування: несправедливим може бути не лише тест, а й критерій, з яким його порівнюють.


Measurement invariance і differential item functioning можуть бути важливими для порівнянь між групами, але вони не є синонімами критеріальної валідності. Інваріантність не гарантує автоматичної відсутності bias, а DIF сам по собі ще не доводить несправедливості тесту. Fairness потребує ширшого аналізу конструкта, процедури, прогнозу та наслідків.


Мова, переклад і культурна адаптація


Переклад тесту українською не доводить, що його критеріальна валідність збережена. International Test Commission розглядає адаптацію як ширший процес, що включає мовну, культурну, психометричну й процедурну еквівалентність. Після адаптації потрібно окремо перевіряти, чи відношення score до релевантних критеріїв зберігається в цільовій популяції.


Адаптувати інколи потрібно і критерій. Наприклад, «успішність» або «функціонування» можуть операціоналізуватися по-різному в різних системах. Якщо критерій змінює зміст, старий validity coefficient не переноситься автоматично, навіть коли сам тест перекладено якісно.


Чим критеріальна валідність відрізняється від інших понять


Від надійності: надійність стосується точності й відтворюваності вимірювання, а критеріальна валідність — зовнішнього відношення score до критерію. Висока надійність є важливою передумовою точного вимірювання, але не доводить, що тест пов’язаний із потрібним outcome.


Від конструктної валідності: конструктна валідність охоплює широку мережу теоретично очікуваних зв’язків і структуру доказів щодо того, що означає score. Зв’язок із зовнішнім критерієм може бути частиною цієї ширшої мережі, але не вичерпує її.


Від конвергентної валідності: конвергентні докази показують очікувані зв’язки з іншими мірами близьких конструктів. Інший опитувальник не стає автоматично критерієм лише тому, що він відоміший.


Від content validity: змістова валідність стосується того, наскільки зміст пунктів репрезентує потрібний construct domain. Тест може мати добре сформовані пункти, але слабко прогнозувати зовнішній результат; і навпаки, практичний предиктор може корелювати з outcome без достатньо ясного теоретичного змісту.


Від діагностичної точності: diagnostic accuracy аналізує класифікацію відносно референтного стандарту й використовує специфічні метрики. Вона є спорідненим випадком criterion-based evidence, але має власну методологію, ризики bias і правила інтерпретації.


Від causal evidence: навіть сильний прогностичний зв’язок не доводить, що вимірюваний конструкт спричиняє outcome. Тест може бути корисним предиктором через спільні причини, кореляційні структури або проксі-змінні. Валідність прогнозу й причинне пояснення — різні задачі.


Три практичні приклади


Приклад 1. Вступний тест і подальше навчання


Університет хоче з’ясувати, чи допомагає вступний тест прогнозувати успішність на першому курсі. Тест є predictor, майбутня академічна успішність — criterion. Дослідники мають вирішити, як саме вимірювати успішність, врахувати різницю між програмами, можливе restriction of range через сам відбір і перевірити модель на новій когорті. Одна кореляція між тестом і GPA — лише частина аргументу.


Приклад 2. Професійний відбір


Організація використовує когнітивний тест для прогнозування ефективності працівника. Якщо критерій — рейтинг керівника, потрібно знати його надійність, критерії оцінювання й можливий bias. Якщо рейтинг залежить від того самого керівника, який знає тестові результати, виникає ризик контамінації. Якщо «ефективність» включає кілька важливих компонентів, один рейтинг може бути дефіцитним.


Приклад 3. Скринінговий опитувальник


Короткий опитувальник перевіряють відносно незалежного структурованого клінічного оцінювання. Тут важливі не лише загальна кореляція, а й чутливість, специфічність, PPV/NPV, обраний cutoff, базова частота стану, спектр тяжкості, blinding і якість референтного стандарту. Навіть за добрих показників скринінг не замінює діагностичне оцінювання.


Як читати дослідження критеріальної валідності: практичний чекліст


1. Яке саме твердження перевіряють? Чи йдеться про опис поточного стану, прогноз, класифікацію або практичне рішення?


2. Який критерій використано? Чому він релевантний, хто його вимірював і наскільки він надійний?


3. Чи є критерій незалежним від тесту? Чи могли результати тесту вплинути на оцінювача або референтний стандарт?


4. Чи відповідає вибірка реальній популяції використання? Чи є spectrum bias, restriction of range, селекція або значне вибуття?


5. Чи відповідає статистична модель типу outcome? Для неперервного критерію можуть бути потрібні регресія та error of prediction; для категоріального — методи класифікації/логістичні моделі та diagnostic accuracy metrics.


6. Чи показано величину ефекту та довірчий інтервал? Одного p-value недостатньо.


7. Чи перевірено нелінійність, підгрупи та припущення моделі? Один загальний coefficient може приховувати важливі відмінності.


8. Якщо модель створена на цих самих даних, чи була крос-валідація або незалежна validation sample?


9. Чи враховано практичну ціну помилок? Для скринінгу, відбору або triage хибнопозитивні й хибнонегативні рішення мають різні наслідки.


10. Чи не роблять із criterion evidence ширший висновок, ніж дозволяє дизайн: наприклад про причинність, діагноз, універсальність між культурами або загальну «якість тесту»?


Типові помилки інтерпретації


«Є значуща кореляція — тест валідний». Значущість показує сумісність даних із певною нульовою моделлю за припущень, а не практичну достатність доказу. Потрібні effect size, uncertainty, якість критерію, population match та intended use.


«Кореляція з відомим тестом — це критеріальна валідність». Не обов’язково. Якщо відомий тест не є обґрунтованим зовнішнім критерієм або gold standard, це радше evidence based on relations to another measure — часто конвергентне чи конструктне.


«Висока AUC доводить клінічну корисність». Ні. AUC не враховує конкретні наслідки рішень, prevalence, ресурси, шкоду хибної класифікації та вигоду від наступних дій.


«Cutoff 10 означає, що з 10 балів починається розлад». Cutoff — operational decision threshold, валідність якого залежить від популяції, референтного стандарту та intended purpose. Він не перетворює скринінг на діагноз.


«Після перекладу коефіцієнт лишається тим самим». Дані з іншої мови або культури не є автоматичним evidence для нової адаптації. Потрібна локальна перевірка вимірювання й зовнішніх зв’язків.


«Корекція на attenuation показує справжню валідність». Корекція оцінює, яким міг би бути зв’язок за моделлю без частини measurement error; результат залежить від припущень та надійності оцінок. Він не замінює емпіричний нескоригований зв’язок.


«Один coefficient придатний для всіх груп». Загальний результат може приховувати різні slopes, intercepts, base rates або error patterns. Для важливих рішень потрібно перевіряти релевантні групи та fairness.


Практичне значення для психолога, дослідника і читача


Для психолога критеріальна валідність допомагає зрозуміти, чи має score практично підтверджений зв’язок із тим зовнішнім результатом, для якого тест справді використовується. Це захищає від ситуації, коли інструмент виглядає науково через красиві коефіцієнти, але не має evidence для конкретного рішення.


Для дослідника головний урок полягає в тому, що criterion selection є частиною теорії вимірювання. Поганий критерій не можна «виправити» складнішою статистикою. Навпаки, чіткий intended use, сильний criterion, прозорий дизайн, uncertainty та незалежна перевірка часто важливіші за пошук максимально великого коефіцієнта.


Для читача або користувача тесту найкорисніше запитання звучить так: «З чим саме цей результат був порівняний і що це дає право робити?» Якщо відповідь нечітка, твердження про критеріальну валідність потребує обережнішого читання.


FAQ


Критеріальна валідність — це те саме, що прогностична валідність?


Ні. Прогностична валідність є одним із варіантів criterion-related evidence: тестовий результат використовують для прогнозу майбутнього критерію. Конкурентна валідність оцінює зв’язок із критерієм, виміряним приблизно одночасно.


Який коефіцієнт критеріальної валідності вважають хорошим?


Універсального порога немає. Інтерпретація залежить від призначення тесту, якості та надійності критерію, популяції, базової частоти outcome, альтернативних предикторів, невизначеності й наслідків помилкових рішень.


Чи достатньо кореляції з іншим психологічним тестом?


Не завжди. Якщо інший тест не є обґрунтованим зовнішнім критерієм або gold standard, така кореляція частіше є доказом конвергентної чи ширшої конструктної валідності.


Чи може зовнішній критерій бути ненадійним?


Так. Критерії теж мають похибку, нестабільність і можливий bias. Низька надійність критерію ускладнює оцінку зв’язку та зазвичай послаблює спостережувану асоціацію.


Чи доводить критеріальна валідність причинність?


Ні. Вона показує емпіричний зв’язок або прогностичну здатність щодо критерію. Причинний висновок потребує окремого дизайну та припущень.


Чи є чутливість і специфічність показниками критеріальної валідності?


Це показники діагностичної або класифікаційної точності відносно референтного стандарту. Вони можуть бути частиною criterion-based evidence, але мають окрему методологію й не замінюють загальний валідизаційний аргумент.


Чи означає високий AUC, що тест корисний у клініці?


Не автоматично. AUC характеризує discrimination за різних порогів, але не враховує prevalence, наслідки хибних рішень, ресурси, користь подальших дій та реальну clinical utility.


Чи переноситься критеріальна валідність після перекладу тесту українською?


Автоматично — ні. Переклад потребує культурної адаптації та локальної перевірки psychometric properties, зокрема зв’язку результатів із релевантними критеріями в цільовій українській популяції.


Пов’язані статті







Джерела










 
 
bottom of page