Чутливість діагностичного тесту: що вона показує і чому висока sensitivity не означає точний діагноз
Автор: Український психологічний ХАБ · Опубліковано: 23 вересня 2026 · Редакційна політика
Чутливість діагностичного тесту (sensitivity, true positive rate) показує, яку частку людей із цільовим станом тест правильно класифікує як позитивних. У таблиці 2 × 2 вона дорівнює TP / (TP + FN): істинно позитивні результати ділять на всіх людей, у яких цільовий стан наявний за прийнятим референтним стандартом. Саме так sensitivity визначається в сучасній методології оцінювання діагностичної точності, зокрема в Cochrane Handbook for Systematic Reviews of Diagnostic Test Accuracy.
У цьому визначенні вирішальним є знаменник: люди, у яких стан справді є за референтним стандартом. Тому чутливість відповідає на запитання «як часто тест спрацьовує серед людей із цільовим станом?». Вона не відповідає на запитання «якщо мій тест позитивний, яка ймовірність, що стан у мене справді є?». Друге запитання стосується позитивної прогностичної цінності та післятестової ймовірності.
Висока sensitivity зменшує частку пропущених випадків, але сама по собі не робить тест точним діагнозом. Тест може бути дуже чутливим і водночас давати багато хибнопозитивних результатів, працювати інакше в іншій популяції, залежати від cutoff, мати невизначені оцінки через малу вибірку або використовувати слабкий референтний стандарт. Для психологічного скринінгу це принципове розрізнення: позитивний бал або результат вище порога є сигналом для подальшого оцінювання, а не автоматичним клінічним висновком.
Коротко: що показує чутливість тесту
Чутливість — це частка істинно позитивних результатів серед усіх людей, у яких цільовий стан наявний за референтним стандартом.
Формула: sensitivity = TP / (TP + FN).
TP (true positives, істинно позитивні) — люди з цільовим станом, яких тест правильно класифікував як позитивних. FN (false negatives, хибнонегативні) — люди з цільовим станом, яких тест помилково класифікував як негативних.
Хибнонегативна частота (false negative rate, FNR) для того самого порога дорівнює FN / (TP + FN), тому FNR = 1 − sensitivity. Якщо чутливість становить 0,90, то хибнонегативна частота становить 0,10 — саме серед людей, у яких стан є.
Чутливість не є ймовірністю діагнозу після позитивного результату, не є загальною часткою правильних відповідей, не є валідністю тесту в цілому і не є здатністю шкали відстежувати зміни з часом.
Таблиця 2 × 2: звідки береться sensitivity
Будь-яка оцінка діагностичної чутливості починається з порівняння індексного тесту з референтним стандартом. Індексним тестом може бути анкета, шкала, алгоритм, клінічне правило або інший спосіб класифікації. Референтний стандарт — процедура, за якою в дослідженні визначають, чи належить людина до групи з цільовим станом.
Комбінації утворюють чотири клітинки: позитивний тест + стан є = TP; негативний тест + стан є = FN; позитивний тест + стану немає = FP; негативний тест + стану немає = TN.
Чутливість використовує тільки TP і FN, тобто тільки групу з цільовим станом. Специфічність використовує TN і FP, тобто групу без стану. Ці показники мають різні знаменники, тому один не можна вивести з іншого.
STARD 2015 і його пояснення для досліджень діагностичної точності вимагають прозоро описувати індексний тест, референтний стандарт, спосіб вибору порога, потік учасників і самі оцінки точності. Без цього цифра sensitivity має значно меншу інтерпретаційну цінність.
Що означає чутливість 90%
Уявімо 100 людей, у яких цільовий стан справді є за референтним стандартом. Якщо чутливість тесту дорівнює 90%, очікувана інтерпретація така: приблизно 90 із цих 100 отримають позитивний результат, а приблизно 10 — хибнонегативний.
Це не означає, що 90% усіх позитивних результатів є правильними. Це також не означає, що людина з позитивним тестом має «90% імовірності діагнозу». Для такого висновку потрібен інший знаменник: усі позитивні результати, а не всі випадки цільового стану.
Через цю зміну умовної ймовірності виникає одна з найпоширеніших помилок у читанні тестів: P(тест+ | стан+) помилково сприймають як P(стан+ | тест+). Ці величини можуть дуже відрізнятися.
Чому висока sensitivity не означає точний діагноз
Діагностична чутливість характеризує один аспект класифікації за конкретного порога. Діагноз у психології та психіатрії є результатом ширшого клінічного оцінювання: анамнезу, симптомів, тривалості, функціонування, диференційної оцінки, контексту, можливих медичних причин і, за потреби, кількох джерел інформації.
Стандарти AERA/APA/NCME розглядають інтерпретацію результатів тестування через докази, мету використання й відповідність популяції. Отже, показник чутливості не можна відривати від мети застосування (intended use) — того рішення, для якого тест насправді застосовується.
У ХАБі окремо розмежовано скринінг і діагностику: скринінговий результат може підвищувати або знижувати підозру щодо стану, але не підмінює клінічну діагностику.
Приклад: 90% sensitivity і лише 19% PPV
Розглянемо умовний приклад на 1000 людей. Припустімо, цільовий стан має 5% групи, тобто 50 людей. Нехай sensitivity = 90%, а specificity = 80%.
Серед 50 людей зі станом тест правильно виявить 45 і пропустить 5. Саме 45 / 50 = 90% — це чутливість.
Серед 950 людей без стану за specificity 80% буде 760 істинно негативних і 190 хибнопозитивних. Загалом позитивний тест отримають 235 людей: 45 істинно позитивних і 190 хибнопозитивних.
У такій умовній популяції PPV = 45 / 235 ≈ 19%. Отже, тест із sensitivity 90% у цьому прикладі зовсім не означає, що позитивний результат має 90% імовірності бути істинним.
Позитивна прогностична цінність та базова частота / поширеність мають власні канонічні пояснення, бо це окремі статистичні питання.
Чутливість і специфічність: два різні запитання
Специфічність відповідає на запитання: якщо цільового стану немає, як часто тест правильно буде негативним? Її формула — TN / (TN + FP). Чутливість відповідає на дзеркальне, але не взаємозамінне запитання: якщо стан є, як часто тест буде позитивним?
Можна підвищити чутливість, знизивши поріг позитивного результату, але це часто збільшує кількість хибнопозитивних результатів і знижує специфічність. Підвищення порога часто рухає баланс у протилежний бік.
Тому фраза «тест має високу точність» без окремих sensitivity, specificity, порога, популяції та інтервалів невизначеності майже нічого не пояснює.
Чутливість і хибнонегативний результат
Хибнонегативний результат (false negative) — це випадок, коли людина, у якої цільовий стан є, але індексний тест дає негативний результат. Чутливість і FNR доповнюють одна одну: sensitivity = 1 − FNR.
Коли наслідки пропуску стану серйозні, дослідники та клінічні програми можуть надавати більшої ваги високій чутливості. Але навіть дуже висока sensitivity не гарантує відсутності хибнонегативних результатів.
Негативна прогностична цінність (NPV) відповідає на інше запитання: серед людей із негативним тестом яка частка справді не має стану? NPV залежить від поширеності та передтестової ймовірності, тому її не можна замінювати sensitivity.
Чи можна «виключити» стан за високої sensitivity
Популярне мнемонічне правило «дуже чутливий тест, якщо негативний, допомагає rule out» може бути корисним як груба навчальна підказка, але для реального рішення воно недостатнє. Потрібно знати, наскільки висока чутливість, яка її невизначеність, що відбувається зі specificity, який cutoff застосовано і якою була передтестова ймовірність.
Відношення правдоподібності LR− безпосередньо пов’язує негативний результат із переходом від передтестових до післятестових шансів. Воно враховує і sensitivity, і specificity, тому краще описує, наскільки негативний тест змінює ймовірність стану.
Якщо клінічна підозра висока, негативний скринінг не обов’язково завершує оцінку. Подальші дії залежать від контексту, ризику, симптомів, якості інструмента та професійних рекомендацій.
Порогове значення: sensitivity існує для конкретного cutoff
Порогове значення тесту визначає, який бал або результат вважають позитивним. Для шкали з безперервним балом одна й та сама анкета може мати різні sensitivity і specificity за різних cutoff.
Зниження порога зазвичай переводить частину людей із негативної категорії в позитивну: серед осіб зі станом стає менше FN і більше TP, тому sensitivity зростає. Водночас серед осіб без стану може зрости FP, тому specificity знижується.
STARD explanation and elaboration наголошує на важливості прозорого опису порогів і того, чи були вони визначені наперед. Пошук «найкращого» cutoff після перегляду тих самих даних може давати надто оптимістичну оцінку точності.
Немає універсального порога, який автоматично є найкращим для всіх популяцій і цілей. Рішення про cutoff пов’язане з наслідками пропусків і хибних тривог, доступністю подальшого оцінювання та метою застосування.
ROC-крива та AUC не замінюють sensitivity конкретного порога
ROC-крива показує співвідношення true positive rate і false positive rate за різних порогів. AUC підсумовує здатність тесту розрізняти дві групи в усьому діапазоні порогів.
Однак клінічне або скринінгове рішення відбувається за конкретного порога. Саме тому AUC не повідомляє, скільки конкретно випадків буде пропущено за обраного cutoff, і не встановлює, чи переважає користь тестування над можливими наслідками помилок.
Висока AUC, висока sensitivity за певного cutoff і клінічна корисність — три різні твердження, кожне з яких потребує окремих доказів.
Референтний стандарт: sensitivity завжди відносна до способу визначення стану
TP і FN неможливо визначити без правила, за яким дослідження вирішує, у кого цільовий стан є. Тому sensitivity не існує «сама по собі»: вона є результатом порівняння індексного тесту з конкретним референтним стандартом.
Оновлений QUADAS-3 оцінює ризик bias та застосовність доказів діагностичної точності через домени учасників, індексного тесту, цільового стану й аналізу. Це відображає принцип: значення показника діагностичної точності залежить не лише від формули, а й від того, як отримано дані.
У психічному здоров’ї референтним стандартом часто є структуроване або напівструктуроване діагностичне інтерв’ю. Різні типи інтерв’ю можуть класифікувати частину учасників по-різному, а отже змінювати і sensitivity скринінгової шкали.
Індивідуально-учасницький метааналіз PHQ-9 показав саме такий контекстний ефект: за cutoff ≥10 sensitivity щодо напівструктурованих інтерв’ю становила близько 0,85, але була нижчою щодо інших категорій референтних інтерв’ю. Це не «нестабільність математики», а наслідок того, що діагностичну точність завжди оцінюють відносно конкретної процедури класифікації.
Довірчий інтервал: sensitivity — це оцінка, а не точна константа
У дослідженні sensitivity обчислюють на вибірці людей із цільовим станом. Тому 0,90 у вибірці є точковою оцінкою параметра, а не магічно точним значенням для всіх майбутніх людей.
Невизначеність залежить передусім від кількості учасників із цільовим станом, тобто від знаменника TP + FN. Якщо таких учасників мало, довірчий інтервал може бути широким навіть тоді, коли загальна вибірка виглядає великою.
Для практичної інтерпретації потрібно читати sensitivity разом із 95% довірчим інтервалом або іншим коректним інтервалом невизначеності, а в систематичних оглядах — також із гетерогенністю між дослідженнями.
Популяція й ефект спектра (spectrum effect): чому sensitivity може змінюватися
У підручниковій формулі поширеність не входить безпосередньо до sensitivity. Через це sensitivity і specificity часто називають характеристиками тесту, відносно незалежними від prevalence. Для простих розрахунків це корисне наближення, але в реальних дослідженнях воно не робить показники незмінними.
Leeflang та співавтори показали на даних 23 метааналізів діагностичної точності, що sensitivity або specificity в частині оглядів змінювалися разом із prevalence. Поширеність тут працює не як член формули, а як маркер відмінностей спектра випадків, тяжкості, відбору, клінічного середовища та інших характеристик популяції.
Тест, перевірений у спеціалізованій клініці на виражених випадках, може показати іншу sensitivity, ніж той самий тест у первинній ланці, студентській вибірці або популяційному скринінгу. Тому переносити одне число між середовищами без перевірки застосовності небезпечно.
Дизайн дослідження може завищувати sensitivity
Висока sensitivity заслуговує довіри настільки, наскільки надійно проведене дослідження точності. Дизайн здатний зробити результат кращим, ніж він буде у звичайній практиці.
Відбір учасників
Якщо дослідники порівнюють очевидно тяжкі випадки з очевидно здоровими контролями, завдання стає штучно легшим. Реальна скринінгова популяція містить легкі, прикордонні, коморбідні та неоднозначні випадки.
Заздалегідь визначений cutoff
Поріг, підібраний на тих самих даних для максимізації діагностичної точності, може працювати гірше в новій вибірці. Зовнішня перевірка або незалежна валідація зменшує ризик такої оптимістичної оцінки.
Цільовий стан і референтна процедура
Якщо процедура визначення стану сама має систематичні помилки або частково залежить від результату індексного тесту, TP і FN можуть бути класифіковані упереджено.
Аналіз усіх учасників
Виключення невизначених результатів, неповна верифікація або аналіз тільки зручної підгрупи може змінити sensitivity. Сучасний QUADAS-3 переносить увагу саме на довіру до конкретної оцінки діагностичної точності та її застосовність до сформульованого питання.
Психологічний приклад: PHQ-9 показує, чому число не можна відривати від контексту
Оновлений систематичний огляд та individual participant data meta-analysis PHQ-9 включив понад 44 тисячі учасників і оцінив sensitivity та specificity за cutoff 5–15 окремо для різних типів діагностичних інтерв’ю.
За стандартного cutoff ≥10 щодо напівструктурованих інтерв’ю pooled sensitivity і specificity були приблизно по 0,85. Для повністю структурованих інтерв’ю sensitivity за того самого cutoff була близько 0,64, а для MINI — близько 0,74. Сам факт різниці показує, що «чутливість PHQ-9» не є одним позаконтекстним числом.
Цей приклад також демонструє, чому скринінговий інструмент не слід перетворювати на діагностичний ярлик. Дослідження оцінює, наскільки добре бал за шкалою відтворює класифікацію референтного інтерв’ю за конкретних умов. Воно не перетворює анкету на автономний діагностичний процес.
Коли висока sensitivity справді корисна
Висока чутливість особливо важлива, коли головне завдання — не пропустити потенційні випадки, а подальший етап може відсіяти частину хибнопозитивних результатів. Це типова логіка першого скринінгового етапу.
Однак навіть у скринінгу рішення про бажаний баланс sensitivity і specificity залежить від наслідків двох типів помилок. Якщо хибнопозитивні результати запускають дорогі, інвазивні або психологічно навантажувальні процедури, надто низька specificity також може бути проблемою.
Тому «чим вища sensitivity, тим кращий тест» — некоректне універсальне правило. Кращим є тестовий процес, у якому характеристики інструмента відповідають меті, популяції, порогу, ресурсам і наслідкам рішень.
Sensitivity ≠ PPV і NPV
PPV — це P(стан+ | тест+), тобто ймовірність стану після позитивного результату. NPV — P(стан− | тест−), тобто ймовірність відсутності стану після негативного результату.
Sensitivity має протилежний напрям умовності: P(тест+ | стан+). Навіть якщо формули виглядають подібно, вони відповідають на різні запитання.
PPV та NPV сильно залежать від поширеності / передтестової ймовірності. У популяції з низькою базовою частотою позитивні результати можуть містити велику частку хибнопозитивних навіть за добрих sensitivity і specificity.
Чутливість ≠ валідність і надійність
Валідність психологічного тесту стосується того, наскільки обґрунтованими є інтерпретації та використання результатів для визначеної мети. Надійність стосується точності й відтворюваності вимірювання. Чутливість за конкретного cutoff не замінює жодне з цих питань.
Тест може мати високу sensitivity для одного бінарного рішення і водночас мати слабку доказову базу для інших інтерпретацій. І навпаки, надійна та валідна шкала конструкта може взагалі не бути призначена для діагностичної класифікації.
AERA/APA/NCME Standards підкреслюють, що докази потрібно прив’язувати до конкретної інтерпретації та використання тестового результату, а не до абстрактного ярлика «якісний тест».
Діагностична чутливість ≠ responsiveness
COSMIN визначає responsiveness як здатність вимірювального інструмента виявляти зміну в конструкті з часом. Це поздовжня властивість вимірювання, а не точність класифікації стану.
Чутливість до змін (responsiveness) має власну канонічну сторінку в ХАБі. Спільне слово «чутливість» не робить ці поняття тотожними.
Діагностична чутливість (diagnostic sensitivity) показує, скількох людей із цільовим станом тест виявив. Responsiveness питає, чи відображає зміна бала реальну зміну вимірюваного конструкта. Змішування цих понять створює категоріальну помилку.
Діагностична чутливість ≠ аналітична чутливість
У лабораторній медицині «аналітична чутливість» може стосуватися найменшої концентрації або сигналу, який метод здатен виявити. Це інше поняття, ніж клінічна або діагностична sensitivity у таблиці 2 × 2.
У психологічному тестуванні, коли йдеться про класифікацію людей щодо цільового стану, коректніше прямо писати «діагностична чутливість» або «чутливість скринінгового тесту» і наводити формулу TP / (TP + FN).
Переклад українською не успадковує sensitivity автоматично
International Test Commission Guidelines for Translating and Adapting Tests розглядають адаптацію як ширший процес, ніж буквальний переклад: потрібно враховувати мовну, культурну, методичну та інтерпретаційну еквівалентність.
Якщо англомовна версія інструмента має sensitivity 0,90 за певного cutoff, це число не можна автоматично приписати українському перекладу. Потрібні дані саме для української версії, релевантної популяції, процедури проведення, референтного стандарту та порога.
Права інтелектуальної власності, ліцензування і психометрична якість — окремі питання. Легальний дозвіл на використання тесту не доводить його діагностичної точності, а хороша accuracy не скасовує ліцензійних обмежень.
Як читати sensitivity у науковій статті: практичний чекліст
1. Що саме є цільовим станом? Назва розладу, ризиковий стан, симптоматичний профіль чи інша категорія мають бути визначені наперед.
2. Який індексний тест і яка його конкретна версія? Важливі мова, спосіб адміністрування, scoring і формат.
3. Який cutoff використано? Sensitivity без порога для шкали з безперервним балом неповна.
4. Який референтний стандарт? Потрібно знати, хто й як встановлював статус цільового стану.
5. Чи визначено cutoff наперед? Оптимізація post hoc на тих самих даних може завищувати показники.
6. Яка популяція? Вік, клінічне середовище, тяжкість, коморбідність, критерії включення й виключення впливають на застосовність.
7. Скільки людей реально мали цільовий стан? Саме цей знаменник визначає статистичну точність оцінки sensitivity.
8. Який 95% довірчий інтервал? Точкова оцінка без інтервалу приховує невизначеність.
9. Які specificity, PPV/NPV або likelihood ratios? Один показник діагностичної точності не описує весь тестовий процес.
10. Чи дослідження відповідає вашій меті застосування? Дані діагностичної точності для дослідницького відбору, первинного скринінгу та клінічного підтвердження не слід автоматично переносити між задачами.
QUADAS-3 і STARD 2015 дають сучасну методологічну рамку для оцінювання ризику bias, застосовності та прозорості звітності в дослідженнях діагностичної точності.
Типові помилки інтерпретації
Помилка 1. «Sensitivity 90% означає, що позитивний результат правильний у 90% випадків». Ні: це PPV, а не sensitivity.
Помилка 2. «Висока sensitivity означає, що тест діагностичний». Ні: скринінг ≠ діагноз.
Помилка 3. «Sensitivity — властивість тесту назавжди». Ні: оцінка прив’язана до популяції, cutoff, референтного стандарту, версії та процедури.
Помилка 4. «Поширеність (prevalence) не входить у формулу, отже вона ніколи не пов’язана із sensitivity». У реальних вибірках спектр випадків і prevalence можуть змінюватися разом, а діагностична точність може відрізнятися між середовищами.
Помилка 5. «100% sensitivity робить тест ідеальним». Тест із 100% sensitivity може мати дуже низьку specificity і позначати позитивними майже всіх.
Помилка 6. «Негативний результат за високої sensitivity повністю виключає стан». Післятестова ймовірність залежить також від specificity, передтестової ймовірності та контексту.
Помилка 7. «Чутливість до змін — це те саме». Ні: responsiveness і diagnostic sensitivity — різні конструкції.
Помилка 8. «Український переклад має ті самі показники, що оригінал». Переклад не дорівнює валідованій культурній адаптації.
Практичні наслідки для психолога, дослідника і читача
Для психолога
Не перетворюйте sensitivity на самостійний діагностичний аргумент. Читайте її разом із specificity, cutoff, PPV/NPV, передтестовою ймовірністю та даними про популяцію. Якщо інструмент використовується для скринінгу, позитивний результат має вести до визначеного маршруту подальшого оцінювання.
Для дослідника
Заздалегідь визначайте цільовий стан, індексний тест, cutoff і план аналізу; використовуйте доречний референтний стандарт; звітуйте TP, FN, FP, TN, sensitivity, specificity та їхні інтервали; пояснюйте невизначені результати й втрати учасників. Для досліджень діагностичної точності орієнтуйтеся на STARD, а для оцінювання ризику систематичної помилки (risk of bias) у систематичних оглядах — на QUADAS-3.
Для читача або користувача тесту
Запитуйте не «наскільки тест точний взагалі?», а «точний для чого, у кого, за якого порога і порівняно з чим?». Це просте уточнення захищає від більшості помилок у популярному тлумаченні sensitivity.
Для української практики
Перевіряйте, чи існують саме українські дані для потрібної версії інструмента. Наявність україномовного бланка або перекладу сама по собі не встановлює sensitivity, specificity, норми або валідність для української популяції.
FAQ
Що означає sensitivity 90% простими словами?
За конкретного порога приблизно 90% людей, у яких цільовий стан є за референтним стандартом, отримують позитивний результат тесту; приблизно 10% у цій групі будуть хибнонегативними.
Чи означає 100% sensitivity, що тест ідеальний?
Ні. Тест може досягти 100% sensitivity, класифікуючи позитивними дуже багато людей без стану. Потрібно знати specificity, наслідки помилок, поріг і практичну мету.
Чи може висока sensitivity поставити психологічний діагноз?
Ні. Sensitivity — характеристика класифікації індексного тесту щодо референтного стандарту. Клінічний діагноз потребує повного професійного оцінювання.
Чи залежить sensitivity від поширеності?
Prevalence не входить безпосередньо у формулу TP / (TP + FN). Водночас у реальних дослідженнях sensitivity може відрізнятися між популяціями через spectrum effect, відбір, тяжкість, середовище застосування й пов’язані з поширеністю зміни структури вибірки.
Чи можна довіряти негативному результату, якщо sensitivity висока?
Висока sensitivity зменшує ризик пропуску серед людей зі станом, але для конкретної людини потрібно врахувати specificity, NPV або LR−, передтестову ймовірність, точність оцінки та клінічний контекст.
Чим diagnostic sensitivity відрізняється від responsiveness?
Diagnostic sensitivity показує частку виявлених випадків серед людей із цільовим станом. Responsiveness показує, чи інструмент здатен валідно відображати зміну конструкта з часом.
Чи має український переклад ту саму sensitivity, що англомовний тест?
Не автоматично. Потрібна валідована адаптація та емпірична оцінка діагностичної точності для відповідної української версії, популяції, порога й референтного стандарту.
Чи є sensitivity тим самим, що recall у машинному навчанні?
У бінарній класифікації recall для позитивного класу математично збігається з true positive rate: TP / (TP + FN). Однак у психодіагностиці вирішальними залишаються клінічне визначення цільового стану, валідність референтного стандарту, мета застосування та наслідки помилок.
