top of page

Психологічна енкциклопедія

Хибнопозитивний результат: чому тест може показати ризик у людини без цільового стану

6 днів тому
Читати 18 хв

Автор: Український психологічний ХАБ · Опубліковано: 23 вересня 2026 · Редакційна політика


Коротка відповідь


Хибнопозитивний результат (false positive) виникає тоді, коли тест або скринінгове правило класифікує результат як позитивний — наприклад, показує підвищений ризик чи перевищення порога, — але цільовий стан за належним референтним стандартом у людини не підтверджується. Для бінарної класифікації це клітина FP у таблиці 2 × 2: позитивний індексний тест за відсутності цільового стану.


Хибнопозитивний результат не означає автоматично, що тест «поганий», а позитивний результат не означає автоматично, що стан присутній. Кількість хибнопозитивних результатів залежить від специфічності тесту, порогового значення, популяції, способу застосування, якості референтного стандарту та інших умов. Те, яка частка всіх позитивних результатів справді підтвердиться, описує позитивна прогностична цінність (PPV), яка сильно залежить від базової частоти або передтестової ймовірності.


У психічному здоров’ї ця різниця особливо важлива: позитивний скринінг є сигналом для подальшого оцінювання, а не клінічним діагнозом. У рекомендації USPSTF щодо скринінгу депресії прямо зазначено, що люди з позитивним скринінгом мають пройти подальше оцінювання для встановлення діагнозу та визначення подальшої допомоги (USPSTF, 2023).


Що саме називають хибнопозитивним результатом


Щоб назвати результат хибнопозитивним, потрібно визначити три речі: що саме є індексним тестом, який цільовий стан він має виявляти і за яким референтним стандартом встановлюють наявність або відсутність цього стану. Без цих трьох елементів слово «хибнопозитивний» втрачає точний зміст.


У методології досліджень діагностичної точності цільовий стан — це чітко визначений стан, який тест має виявити, індексний тест — процедура, точність якої оцінюють, а референтний стандарт — найкращий доступний спосіб класифікувати учасників щодо наявності або відсутності цільового стану. Саме таку логіку використовують STARD 2015 і Cochrane Handbook for Diagnostic Test Accuracy.


У психології цільовим станом може бути клінічний розлад, синдром, когнітивне порушення, високий ризик певного наслідку або інша наперед визначена категорія. Якщо інструмент вимірює безперервну рису — наприклад, тривожність як континуум, — саме поняття «хибнопозитивний» з’являється лише після того, як безперервний бал перетворюють на категоріальне рішення за певним порогом.


Таблиця 2 × 2: чотири можливі результати


Для найпростішого бінарного тесту існують чотири комбінації результату тесту та референтного статусу.


Істинно позитивний (TP): тест позитивний, цільовий стан підтверджено.


Хибнопозитивний (FP): тест позитивний, але цільовий стан не підтверджено.


Хибнонегативний (FN): тест негативний, хоча цільовий стан присутній.


Істинно негативний (TN): тест негативний, цільовий стан відсутній.


Ця проста матриця лежить в основі чутливості, специфічності, PPV, NPV, відношень правдоподібності та багатьох інших показників точності. Вона також показує, чому один і той самий позитивний результат можна описувати різними показниками залежно від того, яке запитання ми ставимо.


Хибнопозитивний результат і специфічність: прямий зв’язок


Специфічність відповідає на запитання: серед людей без цільового стану яка частка отримає негативний результат? Формула: специфічність = TN / (TN + FP). Докладно це розібрано в окремій статті «Специфічність діагностичного тесту».


Частота хибнопозитивних результатів, або false-positive rate (FPR), дивиться на ту саму групу людей без цільового стану, але рахує протилежне: FPR = FP / (FP + TN). Для одного й того самого бінарного правила класифікації FPR = 1 − специфічність.


Якщо специфічність становить 90%, це означає, що за умов, у яких цю специфічність оцінювали, приблизно 90% людей без цільового стану класифікувалися негативно, а приблизно 10% — позитивно. Це не означає, що 10% усіх позитивних результатів є хибними. Частка хибних серед усіх позитивних — інше запитання, пов’язане з PPV.


Головна плутанина: частота хибнопозитивних результатів (FPR) ≠ частка хибних серед позитивних


Частота хибнопозитивних результатів (FPR) має знаменник FP + TN, тобто всіх людей без цільового стану. Натомість PPV має знаменник TP + FP, тобто всіх людей із позитивним результатом. Через різні знаменники ці величини відповідають на різні запитання.


FPR запитує: «Як часто тест спрацьовує позитивно серед тих, у кого цільового стану немає?» PPV запитує: «Якщо тест уже позитивний, яка ймовірність, що цільовий стан справді є?» Класична статистична нотатка Altman і Bland пояснює, що чутливість і специфічність самі по собі не відповідають на друге, пацієнт-орієнтоване запитання; для цього потрібні прогностичні цінності (Altman & Bland, 1994).


Частка хибнопозитивних серед усіх позитивних результатів дорівнює FP / (TP + FP), тобто 1 − PPV. Саме її часто інтуїтивно мають на увазі люди, коли запитують: «Яка ймовірність, що мій позитивний результат помилковий?»


Чому низька поширеність може зробити більшість позитивних результатів хибнопозитивними


Навіть хороший тест може давати багато хибнопозитивних результатів у широкій популяції, де цільовий стан трапляється рідко. Це наслідок базової частоти та поширеності, а не парадокс і не математична помилка.


Уявімо 1000 людей. Цільовий стан має 5% — тобто 50 людей. Чутливість тесту становить 80%, специфічність — 90%. Серед 50 людей зі станом тест правильно виявить 40 і пропустить 10. Серед 950 людей без стану 90% отримають істинно негативний результат — 855 людей, але 10% отримають хибнопозитивний — 95 людей.


Отже, позитивних результатів буде 135: 40 істинно позитивних і 95 хибнопозитивних. PPV = 40 / 135 ≈ 29,6%. Тобто приблизно 70,4% позитивних результатів у цьому прикладі не підтвердяться як цільовий стан, хоча специфічність тесту дорівнює 90%.


Тепер залишимо чутливість і специфічність незмінними, але уявімо популяцію, де цільовий стан має 20% людей. Із 1000 осіб це 200 випадків: 160 істинно позитивних і 40 хибнонегативних. Серед 800 людей без стану буде 80 хибнопозитивних і 720 істинно негативних. PPV стає 160 / 240 ≈ 66,7%. Один і той самий модельний тест дає зовсім інше значення позитивного результату.


Ця залежність не означає, що поширеність завжди механічно змінює саму специфічність. У навчальній моделі чутливість і специфічність можна тримати фіксованими. У реальних даних вони також можуть змінюватися разом із поширеність через відмінності у складі популяції, тяжкості стану, коморбідності та маршруті направлення; це показали метааналітичні дослідження Leeflang та співавт. і огляд спектрального ефекту в BMJ.


Чому скринінг часто «дозволяє» більше хибнопозитивних результатів


Скринінг і діагностика мають різні функції. Скринінг часто використовують як ранній фільтр: його завдання — не пропустити людей, яким варто запропонувати докладніше оцінювання. Тому в певних програмах навмисно обирають поріг, що підвищує чутливість, навіть якщо це зменшує специфічність. Різницю між етапами розглянуто в статті «Скринінг і діагностика».


Коли вищий бал означає більшу ймовірність цільового стану, зниження порогового значення, або cutoff, зазвичай переводить у позитивну категорію більше людей. Чутливість часто зростає, а специфічність знижується, тому хибнопозитивних результатів стає більше. Підвищення порога часто робить протилежний обмін: зменшує FP, але може збільшувати FN.


Саме тому STARD 2015 explanation and elaboration вимагає чітко описувати пороги позитивності, їх обґрунтування та те, чи були вони визначені наперед або підібрані після перегляду даних. Порогове значення є правилом рішення для конкретного призначення, а не природною межею між двома типами людей.


Позитивний психологічний скринінг не дорівнює діагнозу


Психологічні скринінгові шкали часто створені для виявлення підвищеної ймовірності стану, а не для самостійного встановлення діагнозу. Один бал може бути корисним сигналом, але він не замінює оцінювання симптомів, їх тривалості, функціонального впливу, анамнезу, контексту, диференціальних пояснень і клінічного судження.


Методологічний аналіз Zimmerman показує, як використання скринінгових шкал як діагностичних проксі може створювати групи, в яких значна частина «випадків» насправді є хибнопозитивними за діагностичним інтерв’ю (Zimmerman, 2022). У дослідженні скринінгу біполярного розладу при порозі, налаштованому на високу чутливість, PPV становила лише 22,1% — тобто більшість позитивних результатів не відповідали діагнозу за структурованим інтерв’ю (Zimmerman et al., 2011).


У рекомендаціях USPSTF щодо скринінгу тривожних розладів також прямо розглядаються потенційні наслідки хибнопозитивного скринінгу: зайві направлення, надмірна діагностика чи лікування, ярлики та стигматизація; величина цих ризиків може відрізнятися між популяціями та контекстами (USPSTF, 2023).


Хибнопозитивний результат не означає, що «з людиною все гаразд»


Статистичне слово «хибнопозитивний» стосується конкретної цільової категорії. Воно не означає, що переживання людини вигадані, симптоми незначні або допомога їй не потрібна. Людина може не відповідати критеріям одного розладу, але мати субклінічні симптоми, інший розлад, гостру стресову реакцію, соматичний стан або іншу проблему, що підвищила бал.


Це особливо важливо для опитувальників психічного здоров’я, де окремі симптоми перетинаються між різними станами. Безсоння, втома, труднощі концентрації, зниження настрою, дратівливість, напруга чи уникання не належать виключно одному діагнозу. Скринінг може правильно зафіксувати реальний дистрес, але помилково віднести його до конкретної цільової категорії.


Тому клінічно грамотна відповідь на позитивний скринінг — не механічне «є розлад» і не механічне «це просто помилка», а уточнення того, що саме виміряв інструмент і яке подальше оцінювання відповідає його призначенню.


Чому психологічний тест може дати хибнопозитивний результат


1. Порогове значення перетворює континуум на категорію


Багато психологічних характеристик і симптомів розподілені безперервно. Коли шкала вводить cutoff, дві людини з майже однаковими балами можуть опинитися по різні боки адміністративної межі. Категорія корисна для рішення, але вона не створює біологічного або психологічного розриву там, де дані його не мають.


2. Неповна специфічність


Якщо специфічність менша за 100%, частина людей без цільового стану за визначенням отримає позитивний результат. Це очікувана властивість класифікації, а не обов’язково дефект конкретного застосування. Важливо знати, у якій популяції оцінювали специфічність і з яким референтним стандартом.


3. Випадкова та систематична похибка вимірювання


Будь-який спостережуваний бал містить невизначеність. Настрій у день тестування, неуважність, умови заповнення, спосіб адміністрування, інтерпретація формулювань та інші фактори можуть змістити результат. Біля cutoff навіть невелика варіація може змінити категорію з негативної на позитивну.


4. Тимчасовий стан у момент вимірювання


Скринінг може бути чутливим до актуального стану. Гострий стрес, недосипання, фізичне захворювання, біль, втрата, конфлікт або інша короткочасна подія можуть підвищити симптомний бал. Якщо референтна процедура оцінює довший часовий критерій або інший конструкт, позитивний результат може не підтвердитися.


5. Перекриття симптомів і коморбідність


Один і той самий пункт може бути позитивним з різних причин. Наприклад, труднощі концентрації можуть супроводжувати тривогу, депресію, порушення сну, ADHD, медикаментозні ефекти або соматичний стан. Якщо шкала орієнтована на один цільовий стан, симптомне перекриття може знижувати специфічність.


6. Відмінність між конструкцією шкали та діагностичними критеріями


Опитувальник може вимірювати тяжкість симптомів або ризиковий профіль, тоді як діагноз вимагає додаткових критеріїв: тривалості, функціонального порушення, виключення інших причин, часової структури симптомів або клінічної значущості. Високий бал тоді не є «невдалим діагнозом» — це просто результат іншого інструмента з іншою метою.


7. Недосконалий референтний стандарт


Клас «хибнопозитивний результат» виникає відносно референтного стандарту. Якщо референтний стандарт сам має похибки, не охоплює весь спектр стану або застосовується непослідовно, частину розбіжностей не можна чесно приписати лише індексному тесту.


8. Відбір популяції та спектральний ефект


Тест може поводитися по-різному у спеціалізованій клініці, первинній ланці, університеті, школі, робочому середовищі або загальній популяції. огляд спектрального ефекту в BMJ показує, що робочі характеристики для прогнозування, скринінг і діагностика варіює між підгрупами; результати найкраще переносити на популяції, близькі до тієї, у якій тест оцінювали.


9. Мовна й культурна невідповідність


Переклад опитувальника сам по собі не доводить еквівалентність вимірювання. ITC Guidelines for Translating and Adapting Tests вимагають враховувати культурний контекст, конструктивну еквівалентність, процедури адаптації, адміністрування, документацію та інтерпретацію балів. Порогове значення з однієї мовної версії не слід автоматично переносити на іншу.


10. Помилки адміністрування, підрахунку балів та інтерпретації


Неправильний ключ, інша версія шкали, пропущені пункти, невалідне автоматичне округлення, помилкова вікова норма або використання порога з іншої популяції можуть створити позитивну класифікацію, якої не було б за правильного протоколу.


Похибка вимірювання біля cutoff: чому один бал не є абсолютною межею


Коли бал знаходиться близько до порога, категоріальне рішення особливо чутливе до похибка вимірювання. Спостережуваний результат є оцінкою, а не безпомилковим доступом до «істинного» рівня конструкта. Для шкал, що мають дані про надійність та стандартна похибка вимірювання, невизначеність навколо індивідуального бала можна оцінювати формальніше.


Водночас SEM у психометрії не слід плутати зі standard error of the mean. Перший стосується похибки індивідуального вимірювання, другий — невизначеності оцінки середнього у вибірці. Для класифікаційного рішення важливі властивості конкретного інструмента, його поріг і призначення.


Повторне проходження того самого тесту іноді дає інший результат, але це не універсальна «перевірка істини». Повторення може бути корисним, якщо протокол це передбачає, проте воно також піддається похибка вимірювання, ефектам пам’яті, змінам стану й регресії до середнього. Підтвердження зазвичай потребує не просто другого кліку по тій самій шкалі, а належної наступної процедури.


Референтний стандарт: хто вирішує, що результат був «хибним»


У дослідженні діагностичної точності індексний тест порівнюють із референтним стандартом. STARD 2015 вимагає описувати обидві процедури, обґрунтовувати вибір референтного стандарту, визначати пороги та показувати перехресну таблицю результатів. Причина проста: висновок про TP, FP, FN або TN залежить від того, як встановлювали «істинний» статус.


У психіатричних дослідженнях референтом часто є структуроване або напівструктуроване клінічне інтерв’ю за визначеними діагностичними критеріями. В інших завданнях це може бути експертна процедура, комплексне нейропсихологічне оцінювання, спостереження або майбутній результат при прогнозуванні ризику.


Референтні стандарти теж не є магічно безпомилковими. Розбіжності між оцінювачами, неповна верифікація, знання результату індексного тесту, різні референтні стандарти для різних учасників або надто довгий інтервал між процедурами можуть зміщувати оцінки точності. Систематичний огляд джерел bias у діагностичних дослідженнях Whiting et al. і пояснення STARD описують ці механізми як суттєві для інтерпретації.


Спектральний ефект (спектральний ефект): тест не має однієї точності для всіх людей і всіх місць


У навчальних таблицях чутливість і специфічність часто виглядають як сталі числа. У практиці робочі характеристики залежить від того, кого саме тестують. У спеціалізованій клініці можуть бути тяжчі та типовіші випадки; у загальній популяції — більше легких, субклінічних і неоднозначних проявів та більше альтернативних пояснень.


STARD прямо зазначає, що діагностична точність не є фіксованою властивістю тесту і може змінюватися між контексти, групи пацієнтів та залежно від попереднього тестування (Cohen et al., 2016). Велике дослідження Leeflang та співавт. показало, що чутливість або специфічність статистично змінювалися разом із поширеність у частині метааналізів, і автори пов’язували це зі спектром пацієнтів та дизайном (Leeflang et al., 2013).


Тому питання «скільки хибнопозитивних дає цей тест?» без популяції, порога, способу відбору та референтного стандарту часто не має однієї коректної відповіді.


Хибнопозитивний результат у прогнозі ризику: окремий випадок


Для тестів, що визначають поточний стан, позитивний результат можна порівняти з тим, чи є стан зараз. Для прогнозу майбутньої події логіка інша. Ризик — це ймовірність, а не пророцтво.


Якщо модель відносить людину до групи з 20% імовірністю події, то в добре каліброваній групі приблизно 80% людей можуть не мати цієї події. Це не означає, що для кожної з них оцінка ризику була «неправильною». Хибнопозитивною класифікація стає лише після того, як безперервний ризик перетворили на бінарне рішення за конкретним порогом.


Огляд спектральний ефект у BMJ навмисно охоплює прогнозування, скринінг і діагностика та показує, що спектр популяції впливає на робочі характеристики у всіх цих сценаріях (Usher-Smith et al.). Тому фраза «тест показав ризик» потребує уточнення: він видав імовірність, ризикову категорію чи позитивний скринінговий статус?


Хибнопозитивний результат ≠ помилка першого роду


У статистиці термін хибнопозитивний результат іноді неформально використовують для помилки першого роду (Type I error), але це інше поняття. Type I error належить до перевірки статистичних гіпотез: це відхилення нульової гіпотези в ситуації, коли вона істинна, відповідно до заданої моделі й правила тестування.


Хибнопозитивний результат діагностичного або скринінгового тесту — це помилка класифікації конкретного випадку відносно цільового стану й референтного стандарту. Тут працюють чутливість, специфічність, прогностичні цінності та інші метрики класифікації.


Обидва явища можуть звучати як «помилково позитивне», але формули, знаменники, контекст і наслідки різні. Змішування цих понять створює помилки і в статистичному аналізі, і в клінічній інтерпретації.


Хибнопозитивний результат ≠ низька валідність тесту як така


Окремий FP не дозволяє зробити висновок, що тест «невалідний». Сучасні Standards for Educational and Psychological Testing розглядають валідність як сукупність доказів і теоретичних підстав для конкретної інтерпретації та використання тестових балів. Для класифікаційного використання діагностична точність є лише частиною ширшої доказової картини.


Тест може мати добре обґрунтоване призначення і водночас давати певну частку FP, тому що нульова помилка класифікації часто недосяжна або вимагала б неприйнятної втрати чутливість. І навпаки, висока специфічність не компенсує проблеми конструктивної валідності, невідповідних норм, слабкої надійності або неправильного призначення.


Оцінювати тест потрібно на рівні рішення: для кого, навіщо, за яким порогом, з якими наслідками і на основі яких доказів він застосовується.


Хибнопозитивний результат ≠ надмірна діагностика


Хибнопозитивний результат і надмірна діагностика (overdiagnosis) — близькі за наслідками, але різні за змістом. При хибнопозитивному результаті цільовий стан за референтним критерієм відсутній. При надмірній діагностиці стан або зміна можуть бути реально виявлені, але їх виявлення не приносить очікуваної користі або призводить до позначення проблеми, яка інакше не спричинила б клінічно значущої шкоди.


У психології до цього додається ще один рівень: патологізація — перетворення нормальної варіації, реакції на контекст або життєвого досвіду на клінічний ярлик без достатніх підстав. Один позитивний скринінговий бал може сприяти такій помилці, якщо його подати як діагноз.


Чому повторне тестування не завжди розв’язує проблему


Інтуїтивна реакція на сумнівний позитивний результат — пройти той самий тест ще раз. Іноді повторне вимірювання є частиною коректного протоколу, особливо коли результат може бути нестабільним або технічно сумнівним. Проте повтор того самого інструмента не створює незалежної діагностичної істини.


Якщо джерелом FP є систематичне перекриття симптомів, невідповідний cutoff, культурна нееквівалентність або хибно перенесена норма, друге проходження може відтворити ту саму помилку. Якщо джерелом є випадкова варіація, повторний бал може змінитися, але це ще не пояснить, який результат краще відображає цільовий стан.


У програмах скринінгу позитивний перший етап часто веде до іншої, більш специфічної процедури. Українське МОЗ так само пояснює це батькам у контексті неонатального скринінгу: потреба в повторному або подальшому дослідженні сама по собі не означає наявності захворювання (МОЗ України). Принцип двоетапного підтвердження добре ілюструє загальну логіку скринінгу, хоча конкретні протоколи завжди залежать від сфери.


Коли багато тестів підвищують шанс отримати хоча б один позитивний результат


Якщо людині дати багато різних скринінгових інструментів, і кожен має ненульовий частота хибнопозитивних результатів, ймовірність отримати хоча б один позитивний результат може зростати. Проте не можна просто додавати відсотки: психологічні шкали часто корелюють, мають спільні симптоми й не є незалежними.


Це також не слід автоматично називати «multiple testing problem» у сенсі статистичних p-values. Класифікаційні FP і помилки множинного тестування гіпотез — різні механізми. Для батареї скринінгів потрібно оцінювати спільну стратегію прийняття рішень, а не лише кожен тест окремо.


Чому висока AUC не гарантує мало хибнопозитивних результатів


ROC-крива і AUC описують дискримінацію в діапазоні можливих порогів. AUC може бути високою, але практичний cutoff усе одно створюватиме конкретний баланс TP, FP, FN і TN. Для людини або програми скринінгу важливе саме робоче правило рішення.


AUC також не повідомляє PPV у конкретній популяції і не оцінює клінічну чи практичну корисність. Два тести з подібною AUC можуть мати різні характеристики на порозі, який реально використовують. Тому фраза «AUC 0,90, отже позитивним результатам можна довіряти на 90%» є некоректною.


Відношення правдоподібності: ще один спосіб читати позитивний результат


Позитивне відношення правдоподібності LR+ = чутливість / (1 − специфічність) показує, у скільки разів позитивний результат імовірніший у людей із цільовим станом, ніж без нього. Воно не дорівнює PPV і саме по собі не є післятестовою ймовірністю. Докладніше — у статті «Відношення правдоподібності (LR+ і LR−)».


LR+ можна поєднати з передтестовими шансами за правилом Байєса, щоб отримати післятестові шанси. Такий підхід добре показує ключову ідею: значення позитивного тесту формується не одним числом точність, а взаємодією попередньої ймовірності та сили самого результату.


Справедливість оцінювання, культура і мова: хибнопозитивність може бути нерівномірною


Середній частота хибнопозитивних результатів для всієї вибірки може приховувати різні показники у підгрупах. Якщо зміст пунктів, норми, способи відповіді або порогові значення по-різному працюють для мовних, вікових, культурних чи інших груп, одна група може частіше потрапляти до позитивної категорії без відповідного зростання цільового стану.


Це одна з причин, чому AERA/APA/NCME Standards вимагають доказів, релевантних конкретній інтерпретації й популяції, а ITC Guidelines розглядають адаптацію як ширший процес, ніж переклад тексту. Українська мовна версія інструмента потребує власних доказів придатності для призначення; сам факт перекладу не встановлює валідований cutoff.


Інваріантність вимірювання і диференційне функціонування пунктів (DIF) можуть допомагати досліджувати міжгрупову порівнюваність, але жоден окремий статистичний тест автоматично не доводить наявність або відсутність справедливого оцінювання. DIF потребує змістовної інтерпретації, оцінки масштабу й наслідків для рішення.


Чому хибнопозитивний результат може мати реальні наслідки


Хибнопозитивний результат може запустити додаткове оцінювання, витрати часу й коштів, непотрібне занепокоєння, самостигматизацію, зовнішній ярлик або невиправдане лікування. USPSTF називає серед потенційних harms скринінгу зайві направлення й лікування, labeling, anxiety та stigma у відповідних клінічних контекстах (депресія і суїцидальний ризик; тривожні розлади).


Масштаб шкоди залежить від подальший маршрут. Позитивний результат дешевого й безпечного першого етапу, після якого йде якісна підтверджувальна оцінка, має інший профіль наслідків, ніж той самий результат, який одразу запускає із високими наслідками рішення.


Тому якість скринінгової програми оцінюють не лише за чутливість і специфічність. Важливо знати, що відбувається після позитивного результату, чи доступне підтвердження, скільки FP створюється в реальній популяції, які наслідки має помилка і чи переважає загальна користь.


Що робити з позитивним результатом психологічного скринінгу


Перший крок — з’ясувати призначення інструмента. Якщо це скринінговий інструмент, його позитивний результат означає підвищену ймовірність або потребу в наступному етапі, а не встановлений діагноз.


Другий крок — перевірити, для якої популяції, мови й версії валідований інструмент, який cutoff використано і чи відповідає він вашому контексту.


Третій крок — шукати дані про специфічність, чутливість, PPV, NPV та, якщо доступно, likelihood ratios саме для релевантної популяції. Рекламний відсоток «точності» без цих деталей малоінформативний.


Четвертий крок — врахувати симптоми й контекст, які могли підвищити бал: інші психічні або соматичні стани, гострий стрес, сон, медикаменти, зміни функціонування, часовий перебіг.


П’ятий крок — якщо результат має клінічне значення, перейти до належного оцінювання, передбаченого маршрутом допомоги. Позитивний скринінг не замінює діагностику.


Як оцінювати заяву «тест дає мало хибнопозитивних»


Попросіть конкретне число й знаменник. Чи йдеться про специфічність, FPR, PPV, частку FP серед усіх учасників або щось інше? Ці величини не взаємозамінні.


Перевірте cutoff. Один і той самий інструмент може мати кілька порогів з різним балансом чутливість і специфічність.


Перевірте цільову популяцію. Клінічна вибірка з високою передтестовою ймовірністю та загальнопопуляційний онлайн-скринінг — різні сценарії.


Перевірте референтний стандарт. Якщо «істину» встановлювали слабкою процедурою, точність може бути зміщена.


Перевірте невизначеність. Показник 95% у маленькій вибірці може мати широкий довірчий інтервал.


Перевірте зовнішню валідацію. Один центр, одна мова або одна демографічна група не гарантують тієї самої робочі характеристики в іншому середовищі.


Перевірте якість звітування. STARD 2015 створений саме для того, щоб дослідження точності тесту прозоро повідомляли дизайн, учасників, індексний тест, референтний стандарт, порогові значення, потік учасників та результати.


Як дослідникам правильно повідомляти хибнопозитивні результати


Найкраще показувати повну таблицю 2 × 2 або дані, з яких її можна відновити. Тоді читач може перевірити чутливість, специфічність, PPV, NPV та інші метрики.


Потрібно називати точний cutoff і вказувати, чи був він визначений заздалегідь. Порогове значення, підібране на тій самій вибірці для максимізації точність, може давати оптимістичну оцінку.


Слід описувати набір учасників, контекст, критерії включення, поширеність або частку цільового стану, спектр тяжкості, альтернативні діагнози та всі референтні стандарти. Без цього переносимість показників невідома.


Оцінки точності мають супроводжуватися показниками статистичної невизначеності — наприклад, довірчими інтервалами, — а не подаватися як безпомилкові константи.


Для реального рішення важливо повідомляти не лише дискримінаційну здатність, а й наслідки FP та FN, подальший маршрут після позитивного результату, практична здійсненність, справедливість оцінювання і клінічну або практичну корисність.


Науковий статус: що встановлено добре, а де потрібна обережність


Встановлено добре: хибнопозитивний результат є стандартною категорією бінарної класифікації; специфічність та FPR мають прямий математичний зв’язок; PPV залежить від співвідношення TP і FP і в модельних умовах змінюється з поширеність; зміна cutoff зазвичай змінює баланс чутливість і специфічність; позитивний скринінговий результат не є тотожним діагностика.


Встановлено добре також те, що точність залежить від дизайну та клінічного контексту. Cochrane DTA Handbook, STARD і дослідження спектрального ефекту документують роль відбору пацієнтів, порогових значень, референтних стандартів, контексту та інших джерел варіативності.


Потребує конкретних даних: точна частота FP для окремої психологічної шкали в українській популяції, оптимальний cutoff для певного призначення, subgroup справедливість оцінювання та наслідки позитивного результату. Такі величини не слід переносити з іншої країни, мови чи клінічного середовища без перевірки.


Не є достатнім доказом: популярність тесту, наявність перекладу, високий Cronbach’s alpha, висока AUC без робочого cutoff, відсоток «точності» без 2 × 2 даних або один позитивний бал без подальшої оцінки.


Практичний приклад: як один позитивний бал перетворюється на рішення


Уявімо короткий опитувальник, який у первинному скринінгу має поріг 10 балів. Людина набрала 11. На цьому етапі коректний висновок: результат перевищив поріг, встановлений для конкретного скринінг rule.


Наступне запитання — не «чи має людина розлад?», а «яка ланцюг доказів підтримує це рішення?» Потрібно знати, чи валідований саме цей cutoff, у якій популяції, якими були чутливість і специфічність, яка передтестова ймовірність і яке подальше оцінювання передбачене.


Якщо людина проходить структуроване клінічне інтерв’ю й критерії цільового розладу не підтверджуються, первинний результат класифікують як FP відносно цього референтного стандарту. Але симптоми, що дали 11 балів, усе одно залишаються даними про стан людини й можуть вимагати іншого пояснення або підтримки.


Що змінює поширеність, а що — ні


У базовій формулі при фіксованих чутливості та специфічності зміна поширеності не змінює FPR = 1 − специфічність, але змінює PPV та NPV. Це означає, що однакова частка позитивних серед людей без стану може давати дуже різну композицію всіх позитивних результатів залежно від того, скільки в популяції справжніх випадків.


У реальних вибірках поширеність часто йде разом зі зміною склад випадків, тому чутливість і специфічність також можуть відрізнятися. Leeflang et al. і Usher-Smith et al. показують, чому поширеність слід розглядати не лише як число для формули Байєса, а й як сигнал того, що популяції можуть бути клінічно різними.


Чого не можна висновувати з одного хибнопозитивного результату


Не можна висновувати, що весь тест невалідний.


Не можна висновувати, що людина симулює або неправильно описала свій стан.


Не можна висновувати, що цільовий стан неможливий у майбутньому або ніколи не був присутній раніше.


Не можна висновувати, що специфічність тесту низька: один випадок не оцінює популяційні metric.


Не можна висновувати, що повторний негативний результат автоматично «скасував» перший; потрібна інтерпретація протоколу й часових змін.


Не можна перетворювати позитивний скринінговий бал на діагноз без процедур, яких потребує конкретна клінічна система.


FAQ


Чи означає хибнопозитивний результат, що тест поганий?


Ні. Жоден класифікаційний інструмент не оцінюють за одним випадком. Потрібні популяційні дані про точність, призначення, поріг, надійність, валідність, справедливість оцінювання і наслідки помилок. Для скринінгу певна кількість FP може бути прийнятною, якщо це дозволяє не пропускати важливі випадки й існує якісний підтверджувальний етап.


Якщо специфічність 95%, чи означає це, що 95% позитивних результатів правильні?


Ні. Специфічність описує на людей без цільового стану. Частку підтверджених серед позитивних описує PPV, і вона залежить від поширеність та інших умов.


Чи може більшість позитивних результатів бути хибнопозитивними?


Так. За низької базової частоти навіть тест із високою специфічність може створити більше FP, ніж TP, тому PPV буде низькою.


Чи завжди нижчий cutoff збільшує хибнопозитивні результати?


Для монотонної шкали, де вищий бал означає більшу ймовірність стану, зниження порога зазвичай збільшує число позитивних результатів і часто FP. Точний ефект потрібно перевіряти на емпіричних даних конкретної шкали.


Чи можна поставити діагноз за позитивним онлайн-тестом?


Ні. Онлайн-скринінг може вказувати на підвищену ймовірність або потребу в оцінюванні, але скринінг не дорівнює діагностиці. Діагностичне рішення вимагає процедури, валідної для цієї мети.


Чи допоможе повторити той самий тест?


Іноді повтор є частиною протоколу, але сам по собі він не усуває систематичне зміщення, невідповідний cutoff, проблеми перекладу чи перекриття симптомів. Підтвердження часто потребує іншої процедури.


Чи хибнопозитивний результат — це те саме, що Type I error?


Ні. FP у скринінгу та дослідженнях діагностичної точності — помилка класифікації відносно цільового стану. Type I error — поняття перевірки статистичних гіпотез.


Чи висока AUC гарантує мало FP?


Ні. AUC узагальнює дискримінаційна здатність через діапазон порогів. Кількість FP визначається конкретним робочим cutoff, спектра популяції та того, як визначено цільовий стан.


Чи може «хибнопозитивна» людина все одно мати реальні труднощі?


Так. FP означає лише, що конкретний цільовий стан не підтвердився за референтний стандарт. Симптоми можуть бути реальними, клінічно значущими й пояснюватися іншим станом або контекстом.


Чи можна використати англомовний cutoff для українського перекладу?


Не автоматично. ITC Guidelines розглядають адаптацію як доказовий процес, що виходить далеко за межі буквального перекладу. Потрібні дані для відповідної версії, популяції та призначення.


Що важливіше: уникнути хибнопозитивних результатів чи хибнонегативних результатів?


Універсальної відповіді немає. Вибір залежить від мети тестування, наслідків кожного типу помилки, доступності підтвердження, ресурсів і етичного контексту. Саме тому cutoff є рішенням для конкретного сценарію застосування.


Чи існує тест без хибнопозитивних результатів?


Для окремого порога в конкретній вибірці специфічність іноді може бути 100%, але це не гарантує нуль FP у новій популяції. Максимальна специфічність також може коштувати низької чутливість. Практична якість визначається балансом доказів і наслідків, а не пошуком одного абсолютного числа.


Пов’язані статті









Джерела















 
 
bottom of page