Хибнонегативний результат: чому тест може пропустити стан і чому негативний скринінг не завжди завершує оцінку
Автор: Український психологічний ХАБ · Опубліковано: 23 вересня 2026 · Редакційна політика
Коротка відповідь
Хибнонегативний результат виникає тоді, коли цільовий стан у людини є за обраним референтним стандартом, а тест або скринінг класифікує результат як негативний. У таблиці діагностичної точності це комірка FN — false negative. Для тесту з бінарним рішенням частка пропущених випадків серед усіх людей, які справді мають стан, пов’язана з чутливістю: FNR = FN / (TP + FN) = 1 − sensitivity. Методологію таких оцінок систематизує Cochrane Handbook for Systematic Reviews of Diagnostic Test Accuracy.
Негативний скринінг зменшує підозру на стан настільки, наскільки це дозволяють чутливість, специфічність, негативне відношення правдоподібності, передтестова ймовірність, порогове значення, якість референтного стандарту й придатність тесту саме для цієї популяції. Він не перетворює ймовірність на абсолютний нуль. У психологічній практиці це особливо важливо, тому що скринінг і діагностика виконують різні функції.
Практичний висновок простий: негативний результат є даними для подальшого висновку, а не універсальним дозволом припинити оцінювання. Коли симптоми, функціональні труднощі, анамнез або інший клінічний контекст залишають суттєву підозру, оцінка продовжується незалежно від одного негативного скринінгового бала. Для депресії, наприклад, NICE рекомендує комплексне оцінювання, яке враховує не лише кількість симптомів, а й їхню тяжкість, перебіг, анамнез і функціональне порушення у чинній настанові NG222.
Що таке хибнонегативний результат
Щоб говорити про хибнонегативний результат, потрібні дві класифікації: результат індексного тесту та визначення цільового стану за референтним стандартом. Якщо референтний стандарт відносить людину до групи зі станом, а індексний тест дає негативний результат, маємо FN.
Чотири можливі комбінації утворюють класичну таблицю 2×2:
істинно позитивний результат (TP): стан є, тест позитивний;
хибнопозитивний результат (FP): стану немає, тест позитивний;
істинно негативний результат (TN): стану немає, тест негативний;
хибнонегативний результат (FN): стан є, тест негативний.
STARD наголошує, що точність тесту оцінюється відносно конкретного цільового стану, референтного стандарту, популяції та клінічної ролі тесту; sensitivity і specificity не є незмінними властивостями, відірваними від умов застосування і мають описуватися разом із дизайном дослідження.
Як хибнонегативний результат пов’язаний із чутливістю
Чутливість, або true positive rate, відповідає на запитання: яку частку людей із цільовим станом тест правильно визначає як позитивних? Формула: sensitivity = TP / (TP + FN).
Хибнонегативна частка, або false-negative rate (FNR), дивиться на ту саму групу з протилежного боку: яку частку людей із цільовим станом тест пропускає? Формула: FNR = FN / (TP + FN). Для одного й того самого порога, референтного стандарту та набору даних FNR = 1 − sensitivity.
Якщо чутливість у дослідженні становить 0,85, точкова оцінка FNR становить 0,15: приблизно 15% референтно позитивних випадків у цій вибірці та за цих умов дали негативний індексний тест. Це групова характеристика роботи тесту, а не персональна ймовірність того, що конкретний негативний результат є помилковим.
Саме тут часто виникає помилка інтерпретації. Питання «скільки випадків тест пропускає серед людей зі станом?» належить до sensitivity/FNR. Питання «яка ймовірність, що стану немає після вже отриманого негативного тесту?» належить до негативної прогностичної цінності (NPV).
FNR, NPV і LR− відповідають на різні запитання
Три показники часто стоять поруч, але мають різні знаменники й різне практичне значення.
FNR = FN / (TP + FN): частка пропущених тестом випадків серед людей, які справді мають стан.
NPV = TN / (TN + FN): частка людей без стану серед усіх, хто отримав негативний результат. NPV істотно залежить від поширеності та передтестової ймовірності.
LR− = (1 − sensitivity) / specificity: показує, наскільки негативний результат змінює шанси стану. Детальніше — у статті про відношення правдоподібності LR+ і LR−.
Тому твердження «чутливість 90%» не означає, що після негативного тесту ймовірність стану дорівнює 10%. Десять відсотків у цьому прикладі — хибнонегативна частка серед людей, які вже належать до групи зі станом. Для конкретного негативного результату потрібна інша умовна ймовірність — NPV або байєсівське оновлення через LR−.
Специфічність також не є показником пропущених позитивних випадків. Вона описує частку істинно негативних серед людей без цільового стану і безпосередньо пов’язана з хибнопозитивною часткою. Окреме пояснення є у статті «Специфічність діагностичного тесту».
Один і той самий тест: два різні значення негативного результату
Уявімо тест із чутливістю 80% і специфічністю 90%. Умовно візьмемо 1000 людей.
Якщо поширеність стану 10%
Стан мають 100 людей. За чутливості 80% тест правильно виявить 80 і пропустить 20 — це FN. Серед 900 людей без стану специфічність 90% дасть 810 істинно негативних і 90 хибнопозитивних результатів. Серед усіх 830 негативних результатів 810 є істинно негативними, тому NPV ≈ 97,6%.
Якщо передтестова частота 50%
Стан мають 500 людей. Тест правильно виявить 400 і пропустить 100. Серед 500 людей без стану 450 отримають істинно негативний результат. Тепер серед 550 негативних результатів 450 є істинно негативними, тому NPV ≈ 81,8%.
Чутливість і специфічність у прикладі залишилися тими самими, але значення негативного результату для людини змінилося, бо змінився контекст. У реальних дослідженнях sensitivity і specificity теж можуть варіювати між популяціями через spectrum effect та інші механізми; це показано в аналізі 23 метааналізів Leeflang і співавторів.
Чому тест може пропустити наявний стан
Хибнонегативний результат не має однієї універсальної причини. Він може виникати через властивості порога, конструкта, процедури вимірювання, популяції, референтного стандарту або через їхню комбінацію.
1. Порогове значення відсікає безперервний бал
Багато психологічних шкал спочатку дають безперервний score, а потім за cutoff перетворюють його на «позитивний» або «негативний». Якщо поріг підвищити, за інших рівних умов зростає специфічність і може знижуватися чутливість — частина людей зі станом опиняється нижче межі. Поріг тому слід тлумачити через intended use, популяцію й наслідки помилок, а не як біологічну межу розладу. Детально це розібрано у статті про порогове значення тесту.
2. Симптоми можуть бути слабшими, нетиповими або змінюватися з часом
Скринінг фіксує відповіді в певний момент і охоплює певний набір проявів. Стан із раннім, субпороговим, епізодичним або нетиповим профілем може давати сумарний бал нижче cutoff. Це не означає, що тест «зламався»: його операційне правило може бути недостатньо чутливим до конкретної презентації.
Особливо важливо розрізняти момент вимірювання та клінічний перебіг. Якщо симптоми швидко змінилися після тестування, попередній негативний результат описує попередній момент, а не гарантує поточний стан.
3. Самозвіт залежить від доступної людині інформації та способу відповіді
У самооцінювальних опитувальниках результат формується з відповідей людини. Недостатнє розпізнавання власних симптомів, буквальне або інше розуміння формулювань, сором, страх наслідків, свідоме заниження, випадкові пропуски чи поспішне заповнення можуть зменшити score. Для окремих станів значущу інформацію може давати клінічне інтерв’ю, анамнез або дані від інших джерел, коли це етично й доречно.
AERA/APA/NCME Standards розглядають валідність інтерпретацій через конкретне використання тестових балів, а APA підкреслює важливість придатності інструмента до мети та популяції у спільних Standards for Educational and Psychological Testing.
4. Конструкт або зміст тесту можуть не охоплювати потрібний прояв
Жодна коротка шкала не репрезентує весь можливий клінічний фенотип. Якщо цільовий стан проявляється ознаками, які мало представлені в item content, людина може мати клінічно значущі труднощі й водночас не досягти порога. Це питання змістової репрезентації та intended use, а не лише арифметики cutoff.
5. Версія, мова й культурний контекст мають значення
Перекладений текст опитувальника ще не є доказом еквівалентної психометричної роботи. International Test Commission розглядає адаптацію як ширший процес, що включає перевірку конструктної, мовної, культурної та емпіричної еквівалентності у Guidelines for Translating and Adapting Tests. Тому український переклад без даних про адаптацію, reliability, validity та релевантні норми не слід автоматично вважати валідованою українською версією.
Практичний розбір цього процесу є в окремій статті «Адаптація і переклад психологічних тестів».
6. Популяція може відрізнятися від тієї, на якій оцінювали тест
Діагностична точність залежить від spectrum — розподілу тяжкості, супутніх станів, віку, контексту звернення та інших характеристик. Огляд spectrum effect у BMJ показує, чому показники тесту з однієї вибірки не слід механічно переносити на іншу.
Звідси випливає важливе правило fairness: однакова формула підрахунку не гарантує однакової точності для всіх підгруп. Потрібні дані про застосовність, а за потреби — subgroup analyses, invariance/DIF та локальну валідацію.
7. Референтний стандарт теж може помилятися або відрізнятися
Назва «хибнонегативний» визначається відносно reference standard. Якщо референтний стандарт класифікує стан із помилкою, сам статус TP/FN/FP/TN стає невизначеним. У психіатрії різні структуровані або напівструктуровані інтерв’ю можуть давати різні оцінки діагностичної точності одного скринера.
У великому IPD-метааналізі PHQ-9 оцінки sensitivity помітно відрізнялися залежно від типу діагностичного інтерв’ю, використаного як reference standard Negeri et al., BMJ 2021.
8. Дизайн дослідження може завищувати або занижувати точність
Непослідовне включення учасників, знання результату іншого тесту під час інтерпретації, невдале поводження з невизначеними результатами, пропуски та аналіз лише частини вибірки можуть спотворити sensitivity і specificity. Актуальний інструмент QUADAS-3 оцінює risk of bias та applicability у дослідженнях діагностичної точності на рівні конкретних оцінок.
Точність тесту не є однією сталою цифрою
STARD прямо підкреслює, що diagnostic accuracy варіює між settings, patient groups і залежно від попереднього тестування та клінічної ролі індексного тесту. Тому фраза «цей тест має sensitivity 90%» потребує продовження: у якій популяції, за якого cutoff, проти якого reference standard, з яким confidence interval і для якого intended use.
Для читача це означає: рекламна або довідкова цифра чутливості не може самостійно визначити, наскільки переконливим є ваш конкретний негативний результат. Потрібна відповідність між дослідженням і ситуацією застосування.
Приклад із психічним здоров’ям: PHQ-9
PHQ-9 часто використовують для скринінгу депресивних симптомів. В оновленому systematic review та individual participant data meta-analysis, що включив 44 503 учасники зі 100 досліджень, за cutoff ≥10 і напівструктурованим діагностичним інтерв’ю як reference standard pooled sensitivity та specificity обидві становили приблизно 0,85 за даними Negeri та співавторів.
Ця оцінка означає, що в середньому частина людей, які відповідали reference-standard визначенню великої депресії, мала PHQ-9 нижче порога. Водночас автори показали, що sensitivity суттєво змінювалася залежно від категорії reference standard. Один cutoff не перетворює PHQ-9 на діагностичний вирок.
Свіжіший rapid systematic review 2026 року зосередився саме на rule-out performance screening tools для mood та anxiety disorders у primary care й оцінював, зокрема, negative likelihood ratios Corso et al.. Автори знайшли інструменти з сильними rule-out показниками для певних цілей, водночас підкреслили обмеженість доказів для окремих станів і популяцій. Це ілюструє правильну логіку: здатність «виключати» завжди належить до конкретного тесту, порога, стану, вибірки й доказової бази.
Окремий systematic review скринінгових інструментів для множинних психічних розладів у primary care виявив значну неоднорідність діагностичного охоплення й якості досліджень Neulinger et al., 2024.
Коли негативний скринінг справді суттєво знижує підозру
Негативний результат має найбільшу rule-out цінність, коли кілька умов узгоджуються одночасно:
інструмент валідований саме для потрібного intended use і цільового стану;
використано ту саму версію, мову, спосіб проведення та поріг, для яких є дані;
чутливість і LR− достатні для конкретної клінічної мети, а їхні confidence intervals прийнятні;
популяція людини подібна до тієї, для якої оцінювали точність;
передтестова ймовірність невисока;
відповіді та процедура тестування були надійними й інтерпретованими;
немає суттєвої суперечності між негативним score та іншою клінічною інформацією.
Навіть за цих умов коректний висновок формулюється як зниження післятестової ймовірності, а не як логічна неможливість стану.
Коли негативний скринінг не завершує оцінку
NICE для підозри на депресію рекомендує комплексне оцінювання, яке не спирається лише на symptom count і враховує тяжкість, анамнез, тривалість, перебіг та функціональне порушення у розділі Recognition and assessment. Це конкретна клінічна настанова для депресії, але вона добре демонструє загальний принцип YMYL: screening result — один компонент оцінювання.
Продовження оцінки особливо обґрунтоване, коли:
симптоми або функціональні труднощі тривають попри негативний screening score;
анамнез, попередній епізод або клінічний контекст роблять передтестову ймовірність вищою;
результат суперечить спостереженням, клінічному інтерв’ю або іншій релевантній інформації;
використана версія тесту не має належної валідації для мови, віку, культурної групи чи setting;
між тестуванням і поточною оцінкою стан помітно змінився;
результат лежить близько до cutoff і невелика measurement error або варіативність відповідей може змінити бінарну класифікацію;
ціна пропуску стану висока й рішення потребує ширшої доказової основи.
Для суїцидального ризику, психозу, манії або іншої гострої клінічної небезпеки негативний онлайн-скринінг не є підставою відкладати професійну оцінку. У таких ситуаціях рішення визначається актуальними ознаками ризику й клінічним контекстом, а не одним score.
Що робити після негативного результату
З’ясуйте, що саме тест вимірює і для чого він призначений: screening, case-finding, severity monitoring, outcome measurement чи іншу задачу.
Перевірте, який cutoff використано і для якої популяції його валідовано. Порогове значення є правилом рішення, а не універсальною межею «є / немає розладу».
Подивіться на sensitivity, specificity, NPV та LR− як на різні показники. Для вже отриманого негативного результату особливо корисні NPV та LR− разом із передтестовою ймовірністю.
Якщо симптоми або порушення функціонування залишаються значущими, обговоріть їх із кваліфікованим фахівцем навіть за негативного скринінгу.
Повторюйте тестування тоді, коли для цього є змістовна причина: змінився час, стан, версія інструмента або мета оцінки. Механічне багаторазове проходження онлайн-тестів не створює діагностичної певності.
Не починайте, не припиняйте і не змінюйте лікування лише за результатом одного скринінгового опитувальника.
Measurement error біля cutoff
Психологічний score є вимірюванням із невизначеністю. Дві людини з балами по різні боки cutoff можуть мати дуже близькі латентні рівні конструкта, а невелика випадкова варіація відповіді — змінити бінарну категорію.
Тому хибнонегативний результат біля порога може бути наслідком не лише «поганої чутливості», а й звичайної похибки вимірювання та дискретного рішення над безперервним score. У високоставкових рішеннях доречно враховувати precision, confidence intervals і сукупність даних.
Водночас diagnostic sensitivity не дорівнює responsiveness. Sensitivity описує виявлення цільового стану відносно reference standard; responsiveness описує здатність шкали валідно відображати зміни конструкта з часом.
Fairness, мова та культурна адаптація
Якщо тест працює по-різному в підгрупах, частота хибнонегативних результатів також може відрізнятися. Це може бути пов’язано з мовою, item functioning, різним розподілом симптомів, доступністю змісту запитань, нормами або контекстом застосування.
ITC рекомендує під час адаптації перевіряти еквівалентність конструкта, метод перекладу, емпіричні характеристики, administration, score scales та інтерпретацію у другому виданні Guidelines. Простий факт наявності українського тексту не доводить українську валідність.
Measurement invariance також не є автоматичним доказом повної відсутності bias, а DIF не є автоматичним доказом несправедливості тесту. Для висновку потрібні зміст, величина ефекту, наслідки для score та intended use.
Для дослідників і клініцистів: що перевіряти в доказах про false negatives
Перед тим як покладатися на заявлену хибнонегативну частку або sensitivity, корисно перевірити методологічний ланцюг.
Чітко визначений target condition та intended use індексного тесту.
Описаний cutoff і відсутнє вибіркове звітування лише «найкращого» порога.
Репрезентативна для практики вибірка без штучного контрасту між дуже тяжкими cases і надто здоровими controls.
Reference standard застосований послідовно й незалежно від index test.
Інтерпретація index test та reference standard була достатньо blinded.
Невизначені, прикордонні та missing results не вилучені так, щоб штучно покращити accuracy.
Є 95% confidence intervals для sensitivity, specificity та інших ключових показників.
Наведені абсолютні TP, FP, TN, FN або дані, з яких їх можна відновити.
Показники стосуються саме потрібної мови, версії, setting та популяції.
Оцінено applicability і risk of bias; для systematic reviews актуальним інструментом є QUADAS-3.
STARD задає стандарт прозорого звітування досліджень diagnostic accuracy з описом participant flow, index test, reference standard та accuracy estimates, а QUADAS-3 допомагає оцінити risk of bias й applicability. Це різні інструменти: STARD — reporting guideline, QUADAS-3 — інструмент оцінки якості доказу.
Типові помилки інтерпретації
«Негативний результат означає, що стану немає»
Коректніше: негативний результат змінює ймовірність стану. Наскільки сильно — залежить від test performance і передтестової ймовірності.
«Sensitivity 90% означає, що 10% негативних результатів хибні»
Це різні знаменники. 1 − sensitivity — частка FN серед усіх людей зі станом. Частка FN серед усіх негативних результатів дорівнює 1 − NPV.
«Висока NPV — властивість тесту в будь-якій популяції»
NPV змінюється разом із prevalence/base rate. Тому її слід переносити лише між достатньо подібними контекстами. Окремо дивіться «Базова частота і поширеність».
«Специфічність відповідає за хибнонегативні результати»
Основний комплементарний зв’язок для FN — sensitivity: FNR = 1 − sensitivity. Специфічність пов’язана з false-positive rate.
«AUC показує, чи можна безпечно завершити оцінку після негативного тесту»
AUC описує discrimination across thresholds. Воно не дає автоматичної відповіді про clinical utility, конкретний cutoff, post-test probability або ціну пропуску випадку.
«Однаковий cutoff має однакове значення для всіх груп»
Поріг потребує валідації у відповідній популяції й залежить від intended use. Перенесення threshold без перевірки може змінити баланс FN і FP.
Науковий статус поняття
Хибнонегативний результат — established methodological concept у diagnostic test accuracy, epidemiology, screening та класифікації. Його визначення через 2×2 contingency table і зв’язок із sensitivity є стандартними.
Водночас точна частота FN для конкретного психологічного тесту є емпіричною оцінкою, а не універсальною константою. Вона залежить від threshold, reference standard, sample spectrum, setting, language/version та study design. Тому перенос конкретного відсотка між контекстами потребує доказів застосовності.
Сучасні methodological standards від Cochrane, STARD і QUADAS-3 узгоджуються в ключовій логіці: оцінка діагностичної точності потребує чіткого питання, target condition, index test, reference standard, опису популяції та прозорого аналізу Cochrane, STARD, QUADAS-3.
FAQ
Що означає хибнонегативний результат тесту?
Це ситуація, коли цільовий стан наявний за референтним стандартом, але індексний тест дає негативний результат. Позначення — FN.
Чи може психологічний скринінг пропустити розлад?
Так. Будь-який screening tool із чутливістю нижче 100% за визначенням пропускає частину reference-positive cases у відповідному дослідженні. Реальна частота залежить від порога, популяції, референтного стандарту та умов застосування.
Чи означає sensitivity 90%, що після негативного тесту шанс розладу 10%?
Ні. 10% у такому прикладі — FNR серед людей, які справді мають стан. Імовірність стану після негативного результату залежить ще й від specificity та передтестової ймовірності; для цього використовують NPV або LR−.
Чим хибнонегативний результат відрізняється від низької NPV?
FN — категорія окремого результату в таблиці 2×2. NPV — частка істинно негативних серед усіх негативних результатів у певній популяції. Велика кількість людей і певна prevalence можуть давати реальні FN навіть за високої NPV.
Чи може негативний скринінг виключити депресію або тривожний розлад?
Деякі валідовані інструменти за певних порогів можуть мати сильний rule-out performance, але це твердження завжди прив’язане до конкретного стану, setting, population і evidence base. Клінічне оцінювання залишається потрібним, коли симптоми або контекст підтримують підозру.
Чи треба одразу повторювати тест після негативного результату?
Автоматичного правила немає. Повторне вимірювання має сенс, коли змінився стан або час, виникла підозра на процедурну помилку чи є клінічна причина оцінити динаміку. Механічне повторення того самого онлайн-скринера не замінює assessment.
Чи впливає поширеність на кількість хибнонегативних результатів?
Так, на абсолютну кількість FN і на NPV — безпосередньо. Крім того, sensitivity і specificity можуть відрізнятися між популяціями через spectrum effects, тому prevalence часто сигналізує, що вибірки мають різну структуру.
Чи є негативний результат діагнозом «здоровий»?
Ні. Screening, assessment і diagnosis — різні рівні висновку. Негативний screening result означає, що за правилами цього інструмента та його cutoff результат нижчий за позитивний поріг; клінічний висновок потребує ширшого контексту.
Пов’язані статті
Скринінг і діагностика: чим відрізняється опитувальник ризику від клінічного діагнозу
Відношення правдоподібності (LR+ і LR−): як результат тесту змінює ймовірність стану
Специфічність діагностичного тесту: що вона показує і як пов’язана з хибнопозитивними результатами
Чутливість до змін (responsiveness): чи здатна шкала виявити реальну зміну психологічного стану
Чутливість діагностичного тесту: що вона показує і чому висока sensitivity не означає точний діагноз
