top of page

Психологічна енкциклопедія

Специфічність діагностичного тесту: що вона показує і як пов’язана з хибнопозитивними результатами

6 днів тому
Читати 12 хв

Автор: Український психологічний ХАБ · Опубліковано: 23 вересня 2026 · Редакційна політика


Специфічність діагностичного тесту (specificity, true negative rate) показує, яку частку людей без цільового стану тест правильно класифікує як негативних. У стандартній таблиці 2 × 2 вона обчислюється як TN / (TN + FP): кількість істинно негативних результатів ділиться на всі випадки, у яких цільовий стан відсутній за референтним стандартом. Таке саме визначення використовують FDA у статистичному керівництві з оцінювання діагностичних тестів та Methods Guide for Medical Test Reviews AHRQ.


Cochrane Handbook for Systematic Reviews of Diagnostic Test Accuracy розглядає sensitivity і specificity як показники точності індексного тесту відносно цільового стану та підкреслює, що їх потрібно інтерпретувати разом із порогом, популяцією, референтним стандартом і дизайном дослідження.


Ключове слово тут — «без цільового стану». Специфічність відповідає на умовне запитання: якщо стану немає, наскільки часто тест буде негативним? Вона не відповідає на інше запитання: якщо тест позитивний, яка ймовірність, що стан справді є? Для цього потрібна позитивна прогностична цінність, яка залежить не лише від характеристик тесту, а й від поширеності або передтестової ймовірності.


У психологічному скринінгу це розрізнення особливо важливе. Позитивний результат анкети або бал вище порога є результатом скринінгу чи case-finding, а не самостійним клінічним діагнозом. Значення специфічності має сенс лише для визначеного інструмента, порога, цільового стану, популяції, мови, способу проведення та референтного стандарту.


Коротко: що показує специфічність


Специфічність — це частка правильно негативних результатів серед усіх людей, у яких цільовий стан відсутній за прийнятим референтним стандартом.


Формула: специфічність = TN / (TN + FP).


TN (true negatives, істинно негативні) — люди без цільового стану, яких тест правильно класифікував як негативних. FP (false positives, хибнопозитивні) — люди без цільового стану, яких тест помилково класифікував як позитивних.


Хибнопозитивна частота (false positive rate, FPR) у тій самій таблиці дорівнює FP / (FP + TN), тому для одного й того самого порога FPR = 1 − specificity. Якщо специфічність становить 0,90, хибнопозитивна частота становить 0,10 — саме серед людей без цільового стану.


Це не означає, що 10% усіх позитивних результатів є хибними. Частка хибнопозитивних серед усіх позитивних результатів залежить від PPV і базової частоти стану. Плутанина знаменника — одна з найпоширеніших помилок у тлумаченні діагностичних показників.


Таблиця 2 × 2: звідки береться специфічність


Для бінарного тесту результат індексного тесту порівнюють із наявністю або відсутністю цільового стану за референтним стандартом. STARD 2015 і його пояснення та розширення вимагають прозоро описувати індексний тест, референтний стандарт, пороги та повну структуру результатів, тому що без цього числа точності важко оцінити.


Чотири комірки мають таке значення:


• TP — тест позитивний, цільовий стан за референтним стандартом наявний.


• FP — тест позитивний, але цільовий стан за референтним стандартом відсутній.


• FN — тест негативний, хоча цільовий стан за референтним стандартом наявний.


• TN — тест негативний і цільовий стан за референтним стандартом відсутній.


Саме стовпець «стан відсутній» утворює знаменник специфічності: TN + FP. У таблиці AHRQ 2 × 2 специфічність прямо визначено як TN / (FP + TN), а позитивну прогностичну цінність — як TP / (TP + FP). Ці формули схожі лише тим, що містять FP; їхні знаменники принципово різні.


Як специфічність пов’язана з хибнопозитивними результатами


За фіксованого порога специфічність і хибнопозитивна частота є доповненнями до одиниці. Висока специфічність означає низьку частоту хибнопозитивних класифікацій серед людей без цільового стану. Низька специфічність означає, що тест частіше позначає як позитивних людей, які за референтним стандартом належать до негативної групи.


Наприклад, якщо специфічність дорівнює 90%, то в групі зі 100 людей без цільового стану за умов, подібних до умов валідизаційного дослідження, очікувано приблизно 90 матимуть негативний результат і приблизно 10 — позитивний. Це і є 10% хибнопозитивних відносно референтно негативної групи.


Однак у реальній вибірці кількість хибнопозитивних залежить ще й від того, скільки людей без стану взагалі тестують. Якщо стан рідкісний, негативна група дуже велика; навіть невелика хибнопозитивна частота може створити значну абсолютну кількість хибнопозитивних результатів.


Чому специфічність 90% не означає «90% позитивних результатів правильні»


Уявімо скринінг із чутливістю 80% і специфічністю 90% у популяції, де цільовий стан має 10% людей. Серед 1000 людей 100 мають стан, а 900 — ні. Тест правильно виявить приблизно 80 із 100 випадків, а серед 900 людей без стану дасть приблизно 90 хибнопозитивних результатів. Усього позитивних результатів буде 170: 80 істиннопозитивних і 90 хибнопозитивних. PPV у такому прикладі становить приблизно 47%, хоча специфічність дорівнює 90%.


Якщо той самий умовний тест застосувати там, де стан має лише 1% людей, частка істинних випадків серед позитивних стане ще нижчою. Це не суперечить високій специфічності: specificity умовиться на відсутності стану, а PPV — на позитивному результаті. Саме тому базова частота або передтестова ймовірність є критичною для тлумачення позитивного результату.


Для переходу від характеристик тесту до післятестової ймовірності корисні відношення правдоподібності LR+ і LR−. LR+ поєднує чутливість і специфічність за формулою sensitivity / (1 − specificity), а потім використовується разом із передтестовими шансами.


Специфічність і чутливість: два різні знаменники


Чутливість і специфічність описують різні групи. Чутливість відповідає на запитання, як часто тест позитивний серед людей із цільовим станом: TP / (TP + FN). Специфічність відповідає на запитання, як часто тест негативний серед людей без цільового стану: TN / (TN + FP).


Тому специфічність не можна «підмінити» чутливістю, а високе значення одного показника не гарантує високого значення іншого. Обидва слід подавати разом для конкретного порога, якщо мета — описати бінарну діагностичну точність. FDA прямо рекомендує звітувати пари sensitivity/specificity із двобічними 95% довірчими інтервалами, а не одне число без контексту.


Популярна мнемоніка «SpPin» — високоспецифічний тест, якщо позитивний, нібито підтверджує стан — корисна лише як груба навчальна підказка. Для реального висновку важливі LR+, передтестова ймовірність, поріг, дизайн дослідження, наслідки помилок і відповідність популяції. Дуже висока специфічність при низькій чутливості може залишати тест малокорисним для конкретного завдання.


Порогове значення: чому specificity залежить від cutoff


Багато психологічних скринінгових інструментів спочатку дають не бінарний результат, а числовий бал. Щоб утворити категорії «позитивний/негативний», дослідник або розробник задає порогове значення. Саме для цього порога й оцінюють чутливість та специфічність.


Якщо в шкалі вищий бал означає більшу вираженість цільового стану, зниження порога зазвичай робить тест більш чутливим, але менш специфічним: позитивними стають більше людей, разом із більшою кількістю істинних випадків зростає й число хибнопозитивних. Підвищення порога зазвичай збільшує специфічність, але може збільшити хибнонегативні результати. Для шкал з протилежним напрямком оцінювання логіка напрямку порога відповідно змінюється.


Отже, «специфічність тесту» без зазначення cutoff часто є неповним формулюванням. Один і той самий опитувальник може мати кілька пар sensitivity/specificity для різних порогів, а оптимальний поріг залежить від intended use і співвідношення наслідків FP та FN.


ROC-крива та AUC не замінюють специфічність конкретного порога


ROC-крива відображає, як змінюються true positive rate і false positive rate при зміні порога. Оскільки false positive rate = 1 − specificity, кожна точка ROC відповідає певній парі sensitivity/specificity.


AUC стисло описує здатність показника розрізняти групи в діапазоні порогів, але не повідомляє, яка саме специфічність буде при клінічно або практично обраному cutoff. Високий AUC також не встановлює автоматично клінічну корисність, оптимальний поріг, PPV у конкретній популяції або прийнятність наслідків хибних рішень.


Чи залежить специфічність від поширеності


У математичній формулі specificity немає prevalence: це умовна частка серед людей без цільового стану. Тому в ідеалізованій моделі за незмінних умов специфічність не перераховується просто через зміну поширеності. З цього, однак, не випливає, що оцінка specificity є незмінною властивістю тесту в усіх популяціях.


Емпіричні дослідження показують, що sensitivity і specificity можуть змінюватися між популяціями через spectrum effects, клінічну тяжкість, супутні стани, спосіб добору та особливості верифікації. Leeflang, Bossuyt і Irwig описали, як prevalence може бути маркером таких відмінностей, тому для застосування результатів важливо зіставляти власну популяцію з тією, у якій тест оцінювали.


Практичне правило: не переносити specificity з одного дослідження як універсальну константу на інший вік, мову, клінічний контекст, рівень тяжкості або маршрут відбору без перевірки застосовності.


Референтний стандарт: специфічність завжди відносна до того, як визначено «стан відсутній»


У формулах TP, FP, FN і TN слово «істинний» не означає абсолютну істину. Воно означає класифікацію відносно референтного стандарту, який дослідження прийняло як найкращий доступний спосіб встановити наявність або відсутність цільового стану.


FDA наголошує, що якщо новий тест порівнюють не з референтним стандартом, а лише з іншим неперевіреним методом, терміни sensitivity і specificity можуть бути недоречними. У такому випадку коректніше говорити про positive percent agreement і negative percent agreement, оскільки оцінюється узгодженість, а не діагностична правильність.


Для психологічних станів референтним стандартом може бути структуроване або напівструктуроване клінічне оцінювання за попередньо визначеними критеріями. Воно також може мати похибки. Якщо референтний стандарт систематично помиляється або частково включає сам індексний тест, оцінка specificity може бути зміщена.


Точкова оцінка без довірчого інтервалу — неповна інформація


Специфічність у вибірці — це оцінка, а не безпомилкове знання про популяцію. Її точність залежить насамперед від кількості референтно негативних учасників, адже саме TN + FP є знаменником specificity.


У поясненні STARD 2015 підкреслено: менша кількість учасників дає менш точні оцінки sensitivity і specificity, тому разом із точковими оцінками слід подавати 95% довірчі інтервали. Specificity 95% із вузьким інтервалом і 95% із дуже широким інтервалом — статистично різна сила інформації.


Особливо небезпечно порівнювати два тести лише за округленими відсотками — наприклад 92% проти 89% — без розміру вибірки, довірчих інтервалів, дизайну, порога та характеристик учасників.


Основні джерела bias у дослідженнях специфічності


Сучасний інструмент QUADAS-3 оцінює ризик систематичного зміщення та застосовність досліджень діагностичної точності на рівні конкретних оцінок. Його домени охоплюють учасників, індексний тест, цільовий стан і аналіз. Для specificity важливо дивитися не лише на число, а й на спосіб, у який його отримано.


Типові проблеми:


• Нерепрезентативний добір учасників. Порівняння очевидно тяжких випадків із «ідеально здоровими» контролями може зробити групи штучно легкими для розділення й завищити точність.


• Порогове значення підібрано після перегляду даних. Post hoc cutoff може виглядати оптимальнішим у тій самій вибірці, ніж у незалежній.


• Непридатний або нестабільний референтний стандарт. Помилки у визначенні цільового стану змінюють склад TP, FP, FN і TN.


• Часткова або диференційована верифікація. Якщо референтний стандарт застосовують не до всіх або його вибір залежить від результату індексного тесту, оцінки можуть зміщуватися.


• Інтерпретатор знає результат іншого тесту. Відсутність незалежного або засліпленого тлумачення може створити review bias.


• Вилучення «невизначених» результатів із аналізу. Видалення незручних випадків може штучно покращити показники.


• Надто мала негативна група. Тоді specificity має велику статистичну невизначеність навіть за високої точкової оцінки.


Специфічність у психологічному скринінгу


У психологічному тестуванні один інструмент може використовуватися для опису симптомів, моніторингу, скринінгу або як частина ширшого assessment. Specificity стосується саме задачі класифікації щодо чітко визначеного цільового стану і не перетворює опитувальник на автономну діагностичну процедуру.


Для коректного тлумачення specificity психологічного скринера потрібно знати щонайменше: яку групу тестували; які критерії визначали цільовий стан; який референтний стандарт застосували; який cutoff використали; якою мовною версією; чи була ця версія валідована для відповідної популяції; хто й у яких умовах проводив assessment; які були sensitivity, PPV/NPV або LR; наскільки точними були оцінки.


Наявність перекладу українською не є доказом валідованої української адаптації. Якщо specificity отримано для англомовної версії в іншій країні, цей показник не слід автоматично приписувати перекладеній версії. Мовні, культурні, клінічні та організаційні відмінності можуть змінювати розподіл балів і класифікацію навколо cutoff.


Стандарти AERA/APA/NCME розглядають інтерпретацію тестових балів у зв’язку з доказами для конкретного використання та популяції. Це ширший принцип, який пояснює, чому один коефіцієнт specificity не може замінити оцінку валідності, надійності та придатності інструмента до поставленої задачі.


Специфічність ≠ валідність, надійність або responsiveness


У психометрії якість інструмента описується системою різних доказів. Diagnostic specificity — характеристика класифікації щодо цільового стану при конкретному порозі. Вона не є синонімом construct validity і не показує, наскільки стабільно або точно вимірюється психологічний конструкт.


Так само специфічність не дорівнює reliability. Нестабільність балів і похибка вимірювання можуть впливати на те, хто опиниться по різні боки cutoff, але коефіцієнт specificity не замінює оцінювання test-retest reliability, internal consistency або інших форм надійності.


COSMIN окремо розглядає reliability, measurement error, validity і responsiveness як властивості вимірювальних інструментів. Diagnostic sensitivity/specificity відповідають іншій задачі — точності класифікації за зовнішнім станом — тому терміни не слід змішувати.


Специфічність ≠ PPV і NPV


Specificity дивиться з боку реального статусу: серед людей без стану — скільки тест правильно назвав негативними? PPV дивиться з боку результату тесту: серед усіх позитивних — скільки справді мають стан? NPV: серед усіх негативних — скільки справді не мають стану?


Через різні знаменники PPV/NPV сильніше залежать від prevalence/base rate. Тому повідомлення «тест має 95% specificity» не можна перефразувати як «якщо тест позитивний, імовірність стану 95%». Це математично інша величина.


Специфічність ≠ overall accuracy


Загальна accuracy — частка всіх правильних класифікацій (TP + TN) / N. Вона змішує позитивну й негативну групи та може бути оманливо високою, якщо одна група значно переважає. Specificity має власний знаменник і відповідає лише за правильну класифікацію референтно негативних випадків.


Наприклад, у вибірці, де цільовий стан дуже рідкісний, модель, яка майже всіх називає негативними, може мати високу overall accuracy, але нульову або дуже низьку корисність для виявлення випадків. Тому accuracy не замінює пару sensitivity/specificity, а тим більше не замінює аналіз наслідків рішень.


Коли висока специфічність особливо важлива


Потреба у вищій specificity зростає, коли хибнопозитивне рішення має суттєві наслідки: запускає дорогі або інвазивні подальші процедури, створює сильне навантаження на систему, впливає на права чи доступ, спричиняє стигматизацію або інші значущі наслідки. Це не універсальне правило «завжди максимізувати specificity», а частина decision context.


У первинному скринінгу пріоритет інколи зміщується в бік чутливості, якщо головна мета — не пропустити потенційні випадки, а позитивні результати потім перевіряються точнішим assessment. У підтверджувальному етапі вища specificity може мати більшу вагу. Оптимальний баланс залежить від intended use, а не від абстрактного бажання отримати максимальні коефіцієнти.


Що робити з хибнопозитивним результатом психологічного скринінгу


Хибнопозитивний результат у дослідженні означає, що індексний тест дав позитивну класифікацію, а референтний стандарт не підтвердив цільовий стан. Для конкретної людини до завершення належного assessment зазвичай невідомо, чи є результат хибнопозитивним — відомо лише, що скринінг позитивний.


Тому безпечна інтерпретація звучить так: результат вище cutoff підвищує підстави для подальшого оцінювання в межах валідованого intended use. Він не встановлює діагноз і не визначає причину симптомів. Наступні кроки залежать від конкретного інструмента, контексту та клінічної задачі.


Типові помилки інтерпретації


• «Specificity 90% означає, що 90% позитивних результатів правильні». Ні: це плутанина specificity з PPV.


• «Specificity — незмінна властивість тесту». Ні: оцінка прив’язана до порога, популяції, дизайну, референтного стандарту й умов застосування.


• «Висока specificity доводить валідність тесту». Ні: вона не замінює аргумент валідності інтерпретації балів.


• «Висока specificity означає високу reliability». Ні: це різні психометричні поняття.


• «1 − specificity — частка хибних серед позитивних». Ні: це частка позитивних серед людей без стану.


• «Cutoff універсальний». Ні: поріг має бути обґрунтований для конкретної мети й популяції.


• «Скринінг із високою specificity ставить діагноз». Ні: screening і diagnosis мають різні функції.


• «AUC високий, отже клінічна корисність доведена». Ні: AUC не задає наслідки рішень, prevalence, PPV/NPV або оптимальний поріг.


• «Порівняли з іншим тестом — отримали specificity». Не завжди: без прийнятного reference standard правильніше може бути говорити про negative percent agreement.


Як читати специфічність у науковій статті: практичний чекліст


1. Знайдіть точне визначення цільового стану.


2. Перевірте, що було референтним стандартом і чи застосували його незалежно від індексного тесту.


3. Знайдіть конкретний cutoff або правило позитивного результату.


4. Подивіться, кого включили у вибірку і чи схожа вона на intended population.


5. Перевірте числа TN і FP, а не лише округлений відсоток.


6. Подивіться на 95% довірчий інтервал specificity.


7. Читайте specificity разом із sensitivity; для позитивного результату також дивіться LR+ і PPV у релевантній популяції.


8. Перевірте, чи поріг був визначений наперед або підібраний після аналізу даних.


9. Оцініть ризик bias і applicability — STARD допомагає перевірити повноту звітування, а QUADAS-3 призначений для оцінки ризику bias та застосовності досліджень діагностичної точності.


10. Для психологічного інструмента окремо перевірте мовну й культурну версію, надійність, валідність, норми та призначення.


FAQ


Що означає специфічність 90% простими словами?


За конкретного порога і в умовах, подібних до дослідження, приблизно 90% людей без цільового стану тест правильно класифікує як негативних, а приблизно 10% отримують хибнопозитивну класифікацію. Це не означає, що 90% позитивних результатів є істинними.


Чим специфічність відрізняється від чутливості?


Чутливість рахується серед людей із цільовим станом і показує частку істиннопозитивних. Специфічність рахується серед людей без стану і показує частку істинно негативних.


Як пов’язані specificity і false positive rate?


Для одного порога FPR = 1 − specificity. Якщо specificity = 0,95, то FPR = 0,05 серед референтно негативної групи.


Чи означає висока специфічність, що позитивний тест майже напевно правильний?


Ні. Для цього потрібно оцінювати PPV або післятестову ймовірність. Вони залежать від базової частоти стану й передтестової ймовірності, а також від sensitivity/specificity або likelihood ratios.


Чи залежить специфічність від поширеності стану?


Прямо у формулі prevalence немає. Але реальні оцінки specificity можуть змінюватися між популяціями через spectrum effects, тяжкість, супутні стани, відбір і дизайн дослідження. Тому показник не слід переносити як універсальну константу.


Що важливіше — чутливість чи специфічність?


Це залежить від задачі та наслідків помилок. Скринінг може надавати більшу вагу уникненню пропущених випадків, а підтверджувальний етап — уникненню хибнопозитивних рішень. Потрібно розглядати обидва показники разом із intended use.


Чи може тест із високою специфічністю поставити психологічний діагноз?


Ні. Specificity — характеристика класифікації в дослідженні. Діагноз потребує комплексного клінічного оцінювання, належних критеріїв, контексту та професійної інтерпретації.


Чому specificity може бути іншою в українській версії тесту?


Переклад, культурний контекст, популяція, розподіл симптомів і обраний cutoff можуть змінювати класифікацію. Переклад не дорівнює валідованій культурній адаптації, тому показники іншомовної версії не переносяться автоматично.


Пов’язані статті











Джерела










 
 
bottom of page