Семюел Мессік: сучасна теорія валідності, інтерпретація тестових балів і наслідки використання
Автор: Український психологічний ХАБ · Опубліковано: 23 вересня 2026 · Редакційна політика
Семюел Мессік — одна з ключових постатей сучасної психометрії, тому що він змінив сам спосіб ставити питання про валідність. У центрі його підходу стоїть не абстрактне запитання «чи валідний тест?», а значно точніше: наскільки теорія й емпіричні докази підтримують конкретне тлумачення тестових балів і наскільки обґрунтоване їх використання для певної мети. Саме ця логіка лежить в основі сучасного визначення валідності у Standards for Educational and Psychological Testing AERA, APA та NCME.
Мессік не запропонував ще один «вид валідності» поруч зі змістовою, критеріальною чи конструктною. Його внесок полягав у переході до уніфікованої теорії: різні джерела доказів мають працювати разом у межах одного аргументу про значення балів. У роботі 1995 року він описав шість взаємопов’язаних аспектів конструктної валідності — змістовий, субстантивний, структурний, узагальнюваності, зовнішній і наслідковий — і прямо критикував уявлення про валідність як набір взаємозамінних ярликів.
Ця стаття розглядає підхід Мессіка як історично впливову теорію, що сформувала сучасну мову валідизації. Водночас вона відділяє його власну концепцію від чинних Standards: базовий принцип єдиної валідності та фокус на інтерпретаціях тестових балів стали нормативною основою сучасного тестування, тоді як роль соціальних наслідків і цінностей сьогодні формулюють точніше й обережніше.
Хто такий Семюел Мессік
Семюел Дж. Мессік (Samuel J. Messick, 1931–1998) — американський психолог і фахівець із психометрії, чия професійна кар’єра була пов’язана з Educational Testing Service (ETS). Біографічний огляд у The Wiley Encyclopedia of Clinical Psychology називає його насамперед дослідником теорії тестів і валідності. У публікаціях ETS його ім’я систематично пов’язане з проблемами конструктної валідності, інтерпретації тестових балів, справедливості та наслідків тестування.
Його теорія формувалася протягом десятиліть. Уже в роботі 1979 року Мессік розділяв питання емпіричного обґрунтування інтерпретації результатів і питання етичної прийнятності застосування тесту. У 1986 році він чітко просував уніфіковане розуміння валідності, а велика праця Validity 1987 року систематизувала цю рамку. Подальші тексти уточнювали зв’язок між значенням балів, цінностями, використанням результатів і соціальними наслідками.
Тому «теорія валідності Мессіка» — це не одна коротка схема, опублікована в єдиній статті. Це послідовна програма, кульмінацією якої стали роботи початку 1990-х і стаття 1995 року про валідність психологічного оцінювання. Для історії психометрії важливо читати цю програму як розвиток: від критики старої трикомпонентної моделі — до єдиної теорії валідності та до аналізу того, що відбувається, коли тестові бали стають основою реальних рішень.
Яку проблему Мессік змінив у теорії тестування
У старішій навчальній традиції валідність часто подавали як три окремі категорії: змістову, критеріальну та конструктну. Така схема корисна для історії дисципліни, але легко породжує помилкову логіку: ніби тест може «мати» один вид валідності, не мати іншого, а дослідник може вибрати найзручніший доказ і оголосити питання закритим. Мессік називав цю фрагментацію неповною, оскільки різні докази стосуються одного центрального питання — що саме означають бали.
У Foundations of Validity він сформулював уніфіковану позицію: зміст тесту, зв’язки з критеріями, теоретично очікувані відносини та наслідки використання не повинні існувати як незалежні «сертифікати». Вони мають інтегруватися в конструктну рамку, яка перевіряє раціональні гіпотези про значення результатів.
Звідси виникає фундаментальний зсув одиниці аналізу. Валідність не належить тесту як предмету назавжди. Вона стосується обґрунтованості конкретної інтерпретації балів для конкретного використання. Один інструмент може мати переконливі докази для оцінювання вираженості певної риси в дорослих і водночас не мати достатньої бази для діагностичного рішення, прогнозу навчальної успішності, кадрового відбору або порівняння культурних груп.
Цей принцип нині є усталеним. Чинні Standards визначають валідність як ступінь, до якого докази й теорія підтримують інтерпретації тестових балів для запропонованих використань. Вони прямо застерігають від некваліфікованої фрази «валідність тесту». Якщо для тих самих балів пропонують кілька різних інтерпретацій або застосувань, кожне з них потребує власного обґрунтування.
Уніфікована теорія валідності: що саме є «єдиним»
Слово «уніфікована» означає, що валідність розглядають як одну інтегровану наукову оцінку, а не як колекцію автономних типів. Це не означає, що всі докази однакові або що кожне дослідження має перевіряти все одразу. Різні питання потребують різних методів: аналізу змісту, дослідження процесів відповіді, факторного аналізу, кореляцій із зовнішніми змінними, оцінювання генералізованості, аналізу справедливості та наслідків.
У Validity of Test Interpretation and Use Мессік наголошував, що валідність є питанням ступеня, а не режимом «так/ні». Нова інформація може посилити або послабити попереднє обґрунтування. Тому валідизація є тривалим процесом накопичення, зіставлення і критичного перегляду доказів, а не одноразовою процедурою перед публікацією тесту.
Це має важливий практичний наслідок. Висока кореляція з іншим тестом не завершує валідизацію. Добра факторна модель не завершує її. Високий коефіцієнт α Кронбаха не є доказом валідності взагалі. Навіть велика кількість статистично значущих результатів не замінює чітко сформульованого твердження про те, що означає бал і які альтернативні пояснення результату були перевірені.
Шість аспектів валідності у Мессіка
У публікації 1995 року Мессік виокремив шість аспектів конструктної валідності. Їх коректніше розуміти як взаємодоповнювальні напрями перевірки одного валідизаційного аргументу. Це не шість незалежних «видів валідності» і не чекліст, де достатньо поставити кілька позначок.
1. Змістовий аспект
Змістовий аспект стосується того, наскільки завдання, стимули та інші елементи тесту репрезентують заявлений конструкт і не зміщують його до випадково вибраного фрагмента. Для тесту знань це питання охоплення предметної області; для психологічної шкали — відповідності пунктів теоретичному змісту конструкта. Експертна оцінка може бути частиною доказової бази, але сама по собі не доводить усього валідизаційного аргументу.
2. Субстантивний аспект
Субстантивний аспект пов’язує теорію конструкта з процесами, за допомогою яких люди фактично відповідають на завдання. Якщо тест нібито вимірює робочу пам’ять, дослідник має пояснити, які когнітивні операції викликають завдання і чи відповідають вони теоретичній моделі. У сучасних Standards близьку функцію виконує доказова лінія, пов’язана з процесами відповіді, хоча повної термінологічної тотожності між рамками немає.
3. Структурний аспект
Структурний аспект перевіряє, чи узгоджується внутрішня організація балів із теоретичною будовою конструкта. Тут можуть бути доречними факторний аналіз, моделі теорії відповіді на завдання, моделі Раша та інші структурні методи. Якщо теорія передбачає один вимір, а дані стабільно показують кілька різних факторів, це не просто «технічна невідповідність»: вона ставить під сумнів заявлене значення сумарного балу.
4. Аспект узагальнюваності
Аспект узагальнюваності стосується того, наскільки властивості інтерпретації зберігаються за релевантних змін завдань, форм, ситуацій, часу, оцінювачів або популяцій. Тут особливо важливо не плутати узагальнюваність із механічною вимогою «однакових цифр усюди». Питання полягає в тому, які джерела варіації допустимі для конструкта, а які створюють похибку або змінюють значення балу.
5. Зовнішній аспект
Зовнішній аспект охоплює очікувані зв’язки тестових балів з іншими змінними. Сюди входять конвергентні та дискримінантні зв’язки, відношення до зовнішніх критеріїв, прогнозування та інші теоретично передбачені асоціації. Центральний принцип Мессіка полягає в тому, що кореляції мають інтерпретуватися через теорію: висока кореляція з будь-яким показником не є автоматичним доказом потрібного конструкта.
6. Наслідковий аспект
Наслідковий аспект стосується ціннісних наслідків інтерпретації та реальних наслідків використання тесту. У Meaning and Values in Test Validation та пізнішій роботі Consequences of Test Interpretation and Use Мессік розглядав валідність і справедливість у ширшій рамці, де тестові рішення мають не лише статистичну, а й соціальну дію. Саме цей компонент став одним із найбільш дискусійних і водночас найвпливовіших елементів його спадщини.
Дві головні загрози: недопредставлення конструкта і нерелевантна домішка
Підхід Мессіка особливо добре пояснює дві класичні загрози валідному тлумаченню. Перша — недопредставлення конструкта (construct underrepresentation): тест охоплює занадто вузьку частину того, що заявлено у визначенні конструкта. Наприклад, оцінка «математичного мислення», побудована лише на механічному відтворенні формул, може пропускати важливі компоненти міркування, якщо саме вони входять до теоретичного визначення.
Друга — конструктно-нерелевантна варіативність (construct-irrelevant variance): на бал істотно впливають чинники, які не належать до заявленого конструкта. Тест логічного мислення може надмірно залежати від складної лексики; шкала симптомів — від культурно специфічних формулювань; тест знань — від навичок роботи з незвичним інтерфейсом. У такому разі бали відображають суміш потрібної властивості й стороннього джерела відмінностей.
Ці загрози пояснюють, чому переклад методики не дорівнює валідованій культурній адаптації, а однакова процедура не гарантує справедливості. Якщо мовний або культурний фактор змінює те, що фактично вимірює завдання, проблема стосується самого значення балів. Тому для української версії інструменту потрібні власні докази змісту, структури, надійності, зв’язків з іншими змінними, інваріантності та доречності норм — залежно від заявленого використання.
Що означає «інтерпретувати тестовий бал»
Тестовий бал — це спостережуваний результат процедури. Психологічний висновок починається лише тоді, коли цьому числу надають значення. Якщо людина отримала 18 балів, саме число ще не повідомляє, чи є це «високим» результатом, наскільки точно він оцінений, який конструкт стоїть за ним, з якою нормативною групою його можна порівнювати і для якого рішення він придатний.
У рамці Мессіка інтерпретація повинна бути теоретично визначеною і емпірично перевірюваною. Дослідник має назвати конструкт, пояснити зв’язок між відповідями та балом, показати відповідність внутрішньої структури, перевірити очікувані зовнішні відносини та дослідити альтернативні причини результату. Чим сильніше твердження, тим ширшого набору доказів воно потребує.
Особливо важливо розділяти вимірювання, скринінг, оцінювання і діагностику. Бал психологічної шкали може бути валідним показником вираженості симптомів, але з цього не випливає, що він самостійно встановлює клінічний діагноз. Для діагностичного використання потрібні додаткові докази, визначена цільова популяція, доречний референтний стандарт, оцінка чутливості та специфічності, урахування базової частоти стану й клінічний контекст.
Те саме стосується порогових значень. Cutoff не перетворюється на універсальну природну межу лише тому, що він опублікований у статті або в інструкції. Його корисність залежить від популяції, мети, ціни хибнопозитивних і хибнонегативних рішень, поширеності стану та якості самої валідизації. Такий спосіб мислення прямо продовжує мессіківський зсув від «властивостей тесту» до обґрунтованості висновків і дій.
Наслідки використання: найскладніша частина спадщини Мессіка
Мессік наполягав, що тестування відбувається у світі рішень і цінностей. Коли бал використовують для вступу, працевлаштування, клінічного маршруту, освітнього розподілу або доступу до послуг, процедура створює наслідки. На його думку, валідизація не повинна абстрагуватися від цього рівня, особливо коли наслідки допомагають виявити, що тест систематично недопредставляє конструкт або включає нерелевантні бар’єри.
Водночас сучасна інтерпретація потребує важливого уточнення. Негативний наслідок сам по собі не доводить невалідність значення балу. Чинні Standards розрізняють наслідки, що випливають із дефекту вимірювання, і наслідки, які виникають через політику, правила прийняття рішень, ресурси або інші фактори поза самим конструктним тлумаченням.
Наприклад, якщо тест непропорційно знижує результати певної мовної групи через складну лексику, нерелевантну до заявленого конструкта, це може бути прямою проблемою валідності та справедливості. Якщо ж коректно виміряний показник використовують у політично або організаційно невдалий спосіб, проблема використання може бути реальною й серйозною, але її не слід автоматично описувати як доказ того, що сам бал неправильно представляє конструкт.
Саме тут корисно зберігати два рівні аналізу: валідність інтерпретації та обґрунтованість використання. Вони пов’язані, проте не тотожні. Добре обґрунтована інтерпретація ще не робить кожне рішення на її основі виправданим; невдале рішення, своєю чергою, не завжди руйнує базову інтерпретацію. Цю відмінність особливо чітко формулює сучасний аргументний підхід.
Мессік і сучасні Standards: що збереглося, а що змінилося
Найважливіший спадок Мессіка у чинних Standards видно безпосередньо у визначенні валідності: оцінюють інтерпретації тестових балів для запропонованих використань, а не «тест сам по собі». Валідність розглядають як єдине поняття, що спирається на сукупність релевантних доказів і теоретичних підстав.
Однак сучасні Standards організують доказову базу не за шістьма аспектами Мессіка, а за п’ятьма основними джерелами: докази на основі змісту тесту; процесів відповіді; внутрішньої структури; зв’язків з іншими змінними; наслідків тестування. Це близька за логікою, але не ідентична класифікація.
Змістовий аспект Мессіка приблизно відповідає доказам на основі змісту; субстантивний має зв’язок із процесами відповіді; структурний — з внутрішньою структурою; зовнішній — зі зв’язками з іншими змінними; наслідковий — з наслідками тестування. Аспект узагальнюваності не має простого окремого «слота»: питання генералізації проходять через дизайн тесту, надійність, вибірки, умови застосування та межі заявленої інтерпретації.
Тому некоректно писати, що сучасні Standards просто «скопіювали шість джерел Мессіка». Вони розвивають ту саму уніфіковану логіку, але використовують іншу організацію доказів. Для професійного тексту важливо зберігати цю історичну різницю, інакше сучасну нормативну рамку легко перетворити на спрощену популярну схему.
Мессік і Майкл Кейн: від уніфікованої теорії до аргументу
Наступним важливим кроком стала аргументна модель Майкла Кейна. У статті 2013 року Кейн визначає валідизацію як оцінювання правдоподібності тверджень, які ми робимо на основі тестових балів. Спочатку треба побудувати інтерпретаційно-використовувальний аргумент: явно показати, які висновки й припущення ведуть від виконання завдань до балу, від балу до конструкта, від конструкта до узагальнення і, за потреби, до рішення.
Ця модель робить практично видимим те, що у Мессіка було загальною архітектурою валідності. Замість переліку статистичних аналізів дослідник формулює ланцюг тверджень, а потім шукає найбільш критичні припущення і перевіряє їх. Якщо одне ключове припущення слабке, десять другорядних кореляцій не компенсують проблему.
Кейн також прямо розрізняє валідність інтерпретації й оцінювання використання. Негативні наслідки можуть зробити конкретне використання неприйнятним, не обов’язково спростовуючи попередній рівень інтерпретації. І навпаки: доказове тлумачення балу не автоматично валідизує кожне практичне рішення. Це уточнення особливо корисне для клінічної, освітньої та кадрової психодіагностики.
Що підхід Мессіка означає для психологічної практики
Для психолога головний урок простий за формою й вимогливий за змістом: перед використанням тесту треба знати, яке саме твердження дозволено робити на підставі його балів. Назва шкали не є доказом. Публікація методики не є доказом. Наявність норм не є доказом. Високий α Кронбаха не є доказом. Навіть «золотий стандарт» у джерелі може не переноситися на іншу мову, вік, культурний контекст або клінічну популяцію.
Для дослідника це означає, що валідизаційна програма починається з конструкта і заявленої інтерпретації, а не зі статистичного меню. Потрібно описати домен конструкта, сформулювати очікувану структуру, передбачити зв’язки з іншими змінними, визначити релевантні групи й умови, оцінити похибку вимірювання та заздалегідь пояснити, які результати підтримають або послаблять гіпотези.
Для читача психологічного висновку підхід Мессіка дає корисне правило: будь-яке сильне твердження про людину має бути сильніше обґрунтоване, ніж саме число в протоколі. Результат скринінгу означає результат скринінгу; ризик — ризик; симптом — симптом; риса — оцінку риси; діагноз потребує діагностичного процесу. Ці рівні не слід зливати.
Типові помилки в інтерпретації валідності
Перша помилка — говорити «цей тест валідний» без уточнення популяції, мови, мети й запропонованої інтерпретації. Друга — подавати змістову, критеріальну та конструктну валідність як три незалежні печатки якості. Третя — вважати будь-яку високу кореляцію достатнім доказом. Четверта — плутати надійність із валідністю: стабільний або внутрішньо узгоджений тест може стабільно вимірювати не те, що заявлено.
П’ята помилка — трактувати один статистично значущий результат як завершену валідизацію. p-value не показує, що гіпотеза «правильна», і не визначає практичну величину ефекту. Шоста — вважати cutoff універсальною межею «є / немає розладу». Сьома — припускати, що переклад автоматично переносить валідність оригіналу на українську версію.
Восьма помилка — використовувати наслідки тестування як риторичний ярлик. Негативний ефект треба досліджувати: він може сигналізувати про недопредставлення конструкта, нерелевантну варіативність, bias, невідповідний поріг, неправильну популяцію або про проблему політики використання. Різні механізми потребують різних висновків і різних виправлень.
Як застосувати логіку Мессіка: практична послідовність
1. Сформулюйте інтерпретацію. Не «шкала вимірює тривогу», а, наприклад: «сумарний бал використовується як показник вираженості симптомів соціальної тривоги в україномовних дорослих у неекстреному амбулаторному контексті».
2. Сформулюйте використання. Чи це опис стану, скринінг, моніторинг змін, дослідницька змінна, групове порівняння, прогноз або рішення щодо конкретної людини? Одна й та сама шкала може вимагати різної доказової бази для різних цілей.
3. Побудуйте карту доказів. Перевірте зміст, процес відповіді, внутрішню структуру, надійність і похибку, зв’язки з іншими змінними, генералізацію, культурно-мовну еквівалентність і релевантні наслідки. Не кожний проєкт має однаковий набір аналізів, але кожне ключове припущення має мати спосіб перевірки.
4. Шукайте не тільки підтвердження. Сильна валідизація передбачає спроби знайти альтернативні пояснення: мовну складність, методові ефекти, соціальну бажаність, вплив оцінювача, навчальний ефект, нерівну роботу завдань між групами, зміни структури в часі. Доказова база стає сильнішою, коли вона витримує серйозні спроби спростування.
5. Визначте межі висновку. Валідність завжди має область застосування. Якщо дослідження проведено на студентах, воно не автоматично валідизує використання у людей старшого віку. Якщо адаптовано український переклад, це не автоматично доводить еквівалентність іншого перекладу. Якщо перевірено групові середні, це не автоматично обґрунтовує індивідуальне клінічне рішення.
Науковий статус концепції Мессіка сьогодні
Уніфікована теорія Мессіка є історичною теоретичною рамкою, а її центральний принцип — валідність інтерпретацій тестових балів для конкретних використань — закріплений у сучасних професійних Standards. Тому внесок Мессіка не є лише сторінкою історії психометрії: він визначає мову, якою сьогодні описують валідизацію.
Водночас окремі теоретичні питання залишаються предметом дискусії, передусім межа між валідністю та етикою використання, статус наслідків тестування й те, наскільки широко слід включати ціннісні судження до самого поняття валідності. Сучасна практика розв’язує це не декларацією, а точнішим розділенням: наслідки релевантні валідності тоді, коли вони свідчать про проблему значення балів або конструкта; ширша прийнятність використання потребує також окремої оцінки користі, шкоди, справедливості та контексту.
FAQ
Чи вважав Мессік валідність властивістю самого тесту?
Ні в тому сенсі, який часто вкладають у фразу «тест валідний». Його підхід зміщує фокус на обґрунтованість значення тестових балів і висновків, які з них роблять. Сучасні Standards формулюють це ще пряміше: оцінюють інтерпретації тестових балів для запропонованих використань, а не тест як абстрактний об’єкт.
Скільки «видів валідності» виділяв Мессік?
Його зріла теорія заперечувала логіку незалежних і взаємозамінних типів валідності. Мессік говорив про єдину конструктну валідність і про різні аспекти або лінії доказів. У 1995 році він систематизував шість аспектів: змістовий, субстантивний, структурний, узагальнюваності, зовнішній і наслідковий.
Чи є шість аспектів Мессіка тим самим, що п’ять джерел доказів у Standards?
Ні. Між ними є змістова спорідненість, але прямої відповідності один до одного немає. Сучасні Standards використовують п’ять груп доказів: зміст тесту, процеси відповіді, внутрішня структура, зв’язки з іншими змінними та наслідки тестування. Узагальнюваність у сучасній практиці проходить через кілька компонентів валідизаційного аргументу.
Чи доводять негативні наслідки, що тест невалідний?
Не автоматично. Треба встановити механізм. Якщо наслідок виникає через недопредставлення конструкта або нерелевантний чинник, це безпосередньо стосується валідності. Якщо проблема виникає через правило використання, організаційну політику або ресурсне рішення, може бути неприйнятним саме застосування, тоді як базова інтерпретація балу залишиться обґрунтованою.
Чи може надійний тест бути невалідним?
Так. Надійність стосується відтворюваності та точності балів за релевантних умов, тоді як валідність — обґрунтованості їх значення та використання. Тест може дуже стабільно відображати суміш потрібного конструкта й стороннього чинника. Надійність часто необхідна для сильного валідизаційного аргументу, але вона не є його достатньою умовою.
Чи достатньо факторного аналізу для доказу валідності?
Ні. Факторний аналіз може підтримати структурний аспект або докази на основі внутрішньої структури. Він не відповідає сам по собі на питання про зміст завдань, процеси відповіді, зовнішні зв’язки, узагальнюваність, мовно-культурну еквівалентність і доречність конкретного використання.
Чому Мессік важливий для українських адаптацій тестів?
Його логіка показує, чому переклад тексту методики не переносить валідність автоматично. Значення балів треба знову обґрунтувати у новій мовній і культурній популяції. Які саме докази потрібні, залежить від конструкта та використання, але щонайменше слід перевіряти змістову відповідність, зрозумілість, структуру, надійність, зовнішні зв’язки, норми або пороги за потреби та міжгрупову еквівалентність.
