Базова частота і поширеність: чому base rate змінює значення позитивного та негативного результату тесту
Оновлено: 6 днів тому
Автор: Український психологічний ХАБ · Опубліковано: 23 вересня 2026 · Редакційна політика
Коротка відповідь
Базова частота (base rate) — це вихідна частота цільового стану або події в релевантній популяції до того, як ми врахуємо новий результат тесту. У скринінгу її часто наближено представляє поширеність стану в тій групі, де застосовують тест. Вона принципово змінює те, що означає позитивний або негативний результат: той самий тест із тією самою чутливістю і специфічністю може мати зовсім різну позитивну та негативну прогностичну цінність у популяціях із різною поширеністю.
Саме тому запитання «тест позитивний — яка ймовірність, що стан справді є?» не можна коректно відповісти лише за чутливістю або специфічністю. Потрібно знати ще й вихідну ймовірність стану. Класичне пояснення цієї логіки дають Altman і Bland у BMJ: прогностичні цінності відповідають на інше умовне запитання, ніж sensitivity і specificity, і залежать від поширеності.
Для психологічного та психіатричного скринінгу це має безпосереднє YMYL-значення. Позитивний скринінговий результат означає підвищену ймовірність або потребу в подальшому оцінюванні, але не встановлює діагноз. USPSTF прямо вказує, що позитивні результати скринінгу депресії мають вести до додаткового оцінювання для підтвердження діагнозу, визначення тяжкості та супутніх проблем.
Що таке базова частота, поширеність і передтестова ймовірність
Три терміни часто стоять поруч, але їх корисно розрізняти. «Базова частота» — ширше статистичне поняття: наскільки часто певний клас, стан або подія трапляються в обраній референтній групі до врахування нової інформації. «Поширеність» (prevalence) — частка людей із цільовим станом у визначеній популяції та в певний момент або період. «Передтестова ймовірність» (pre-test probability) — оцінка ймовірності цільового стану до конкретного тесту.
У масовому скринінгу людей без уже встановленого діагнозу поширеність у цільовій популяції часто є природною стартовою оцінкою базової частоти. У клінічній практиці передтестова ймовірність може бути вищою або нижчою за загальнопопуляційну поширеність, тому що до уваги входять причина звернення, симптоми, попередні тести, вік, контекст, фактори ризику та маршрут направлення.
Отже, «поширеність розладу в країні» не є автоматично правильною базовою частотою для будь-якого тестування. Для людини, яка вже звернулася до спеціалізованої клініки з вираженими симптомами, релевантною є інша передтестова ймовірність, ніж для випадково відібраного учасника загальнопопуляційного скринінгу.
В українській професійній термінології вживаються «прогностична цінність» і «прогностичне значення» діагностичного тесту. Український глосарій Альянсу громадського здоров’я прямо пов’язує позитивну й негативну прогностичну цінність із чутливістю, специфічністю та поширеністю стану в певній групі населення.
Чому однаковий тест дає різне значення результату
Причина — у різних знаменниках. Чутливість і специфічність починають із відомого фактичного стану та запитують, як поводиться тест. Прогностична цінність починає з уже отриманого результату тесту та запитує, яким є фактичний стан людини. Це обернені умовні ймовірності.
• Чутливість: серед людей, у яких цільовий стан є, яка частка отримає позитивний результат?
• Специфічність: серед людей, у яких цільового стану немає, яка частка отримає негативний результат?
• Позитивна прогностична цінність (PPV): серед усіх людей із позитивним результатом, у якої частки цільовий стан справді є?
• Негативна прогностична цінність (NPV): серед усіх людей із негативним результатом, у якої частки цільового стану справді немає?
У Cochrane Handbook for Systematic Reviews of Diagnostic Test Accuracy ці показники розглядаються в загальній логіці діагностичної точності та застосовності результатів до конкретної клінічної популяції. Для практичного тлумачення важлива саме та передтестова ймовірність, яка відповідає реальному контексту використання.
Приклад: тест із чутливістю 95% і специфічністю 95%
Уявімо суто навчальний скринінговий тест. Його чутливість — 95%, специфічність — 95%. Ці цифри тут задані умовно й не описують жодний конкретний психологічний інструмент. Ми застосуємо той самий тест із тим самим порогом до двох груп по 10 000 людей.
Сценарій 1: поширеність 1%
У групі 10 000 людей цільовий стан мають 100 осіб, а 9 900 — не мають.
• Із 100 людей зі станом тест правильно виявить приблизно 95: це істинно позитивні результати.
• Приблизно 5 людей зі станом отримають негативний результат: це хибнонегативні результати.
• Із 9 900 людей без стану приблизно 9 405 отримають правильний негативний результат.
• Приблизно 495 людей без стану отримають позитивний результат: це хибнопозитивні результати.
Отже, позитивних результатів буде 590: 95 істинно позитивних і 495 хибнопозитивних. PPV становитиме приблизно 16,1%. Інакше кажучи, за цих припущень лише близько одного з шести позитивних результатів відповідатиме справжній наявності цільового стану. NPV буде приблизно 99,95%.
Цей приклад показує парадокс лише на рівні інтуїції, але не математики. Коли стан рідкісний, група людей без нього дуже велика. Навіть невелика частка хибнопозитивних результатів у цій великій групі може чисельно перевищити кількість істинно позитивних.
Сценарій 2: поширеність 20%
Тепер візьмемо 10 000 людей, серед яких цільовий стан мають 2 000, а 8 000 — не мають.
• Із 2 000 людей зі станом тест правильно виявить приблизно 1 900.
• Приблизно 100 людей зі станом отримають хибнонегативний результат.
• Із 8 000 людей без стану приблизно 7 600 матимуть правильний негативний результат.
• Приблизно 400 людей без стану отримають хибнопозитивний результат.
Тепер позитивних результатів буде 2 300: 1 900 істинно позитивних і 400 хибнопозитивних. PPV зростає приблизно до 82,6%, а NPV становить близько 98,7%.
Чутливість і специфічність у навчальному прикладі не змінилися. Змінилася лише базова частота. Проте значення позитивного результату для людини змінилося радикально: приблизно від 16% до 83% посттестової ймовірності.
Формули PPV і NPV
Якщо чутливість позначити Se, специфічність Sp, а поширеність або передтестову ймовірність Prev, то:
PPV = (Se × Prev) / [(Se × Prev) + ((1 − Sp) × (1 − Prev))].
NPV = (Sp × (1 − Prev)) / [((1 − Se) × Prev) + (Sp × (1 − Prev))].
Ці формули є прямим застосуванням умовної ймовірності та теореми Байєса. Їхній практичний зміст простий: позитивний або негативний результат не існує у вакуумі. Він оновлює вже наявну ймовірність стану.
Класична статистична нотатка Altman і Bland показує те саме через 2×2 таблицю та через odds: передтестові шанси множаться на відповідне відношення правдоподібності, щоб отримати післятестові шанси.
Байєсівська логіка без складної математики
Тест не створює ймовірність з нуля. Він змінює попередню оцінку. Якщо цільовий стан до тесту був дуже рідкісним, навіть сильний позитивний сигнал може залишити післятестову ймовірність помітно нижчою за 100%. Якщо ж до тесту стан уже був досить імовірним, той самий позитивний результат може зробити його значно ймовірнішим.
У зворотному напрямку негативний результат часто особливо переконливий у популяції з низькою базовою частотою. Але в групі з високою передтестовою ймовірністю негативний тест може бути недостатнім, щоб завершити оцінювання, особливо якщо пропуск стану має серйозні наслідки.
Тому коректне мислення про скринінг має послідовність: передтестова ймовірність → властивості тесту за конкретного порога → результат → післятестова ймовірність → рішення про подальше оцінювання.
Base rate neglect: чому мозок легко ігнорує базову частоту
Нехтування базовою частотою (base-rate neglect) — це помилка міркування, за якої яскрава або індивідуальна інформація отримує непропорційно велику вагу, а статистична частота відповідного стану в референтній групі недооцінюється. У психології рішень це один із класичних способів, яким умовні ймовірності плутаються між собою.
На практиці помилка виглядає так: людина бачить «чутливість 95%» і несвідомо перетворює її на «якщо тест позитивний, імовірність стану 95%». Це різні твердження. Детальніше про ширшу систему таких помилок дивіться у статті «Когнітивні упередження: що це, чому вони виникають і як впливають на судження та рішення».
Чутливість і специфічність не дорівнюють PPV і NPV
Це центральне розрізнення всієї теми. Чутливість і специфічність описують поведінку тесту відносно відомого стану. PPV і NPV описують імовірність стану після відомого результату тесту. Переставити місцями умову та висновок не можна.
Запис через умовні ймовірності робить різницю видимою:
• Чутливість = P(позитивний тест | стан є).
• PPV = P(стан є | тест позитивний).
• Специфічність = P(негативний тест | стану немає).
• NPV = P(стану немає | тест негативний).
Саме тому фраза «цей тест має 90% чутливість, отже позитивний результат правильний у 90% випадків» є некоректною, якщо PPV окремо не розраховано для релевантної популяції.
Чи справді чутливість і специфічність не залежать від поширеності
У підручниковій 2×2 моделі, якщо властивості тесту та спектр людей фіксовані, чутливість і специфічність математично не містять prevalence у своїх формулах. Саме на цьому ґрунтується просте пояснення, що PPV/NPV змінюються з поширеністю, а sensitivity/specificity — ні.
У реальних дослідженнях популяції не залишаються однаковими. Зі зміною setting та поширеності часто змінюються тяжкість проявів, спектр симптомів, коморбідність, маршрут направлення, попереднє тестування та складність диференційної діагностики. Це називають spectrum effect — ефектом спектра.
Метааналіз Leeflang та співавторів на 416 дослідженнях із 23 метааналізів показав, що в значній частині наборів даних оцінки чутливості або специфічності асоціювалися з поширеністю. Велике метаепідеміологічне дослідження Murad та співавторів 2023 року проаналізувало 6 909 досліджень діагностичної точності й також виявило зв’язок: за вищої поширеності оцінена чутливість у середньому була вищою, а специфічність — нижчою.
Ці результати не означають, що сама prevalence механічно «перепрограмовує» тест. Автори підкреслюють роль спектра стану, setting, відбору учасників, референтного стандарту та інших характеристик дизайну. Практичний висновок сильніший за просте правило: переносити показники точності з однієї популяції в іншу потрібно обережно.
Чому setting змінює базову частоту
Поширеність цільового стану може різко відрізнятися між загальною популяцією, первинною допомогою, спеціалізованою клінікою, стаціонаром, групою з попереднім позитивним скринінгом і вибіркою дослідження. Тому назва тесту сама по собі не визначає його PPV або NPV.
• Загальнопопуляційний скринінг зазвичай має нижчу передтестову ймовірність, ніж спеціалізована клінічна вибірка.
• Направлення після попереднього тесту збагачує вибірку людьми з вищою ймовірністю стану.
• Вікові, клінічні, мовні та соціальні критерії включення можуть змінити як поширеність, так і спектр проявів.
• Case-control дослідження, де дослідник штучно набирає окремо «випадки» і «контролі», не дає природної prevalence вибірки, з якої можна напряму взяти реальний PPV/NPV.
Саме тому STARD 2015 вимагає прозоро описувати intended use тесту, клінічну роль, критерії включення, setting, спосіб відбору, поріг, референтний стандарт і 2×2 результати. Без цього читач не може оцінити застосовність отриманої точності до власної популяції.
Скринінг, case-finding, оцінювання і діагноз — різні завдання
У психології та психіатрії короткий опитувальник часто використовується для скринінгу: він допомагає помітити людей, у яких імовірність певного стану достатньо підвищена для наступного кроку. Це не те саме, що комплексне психологічне оцінювання і не те саме, що клінічний діагноз.
Огляд Zimmerman 2022 спеціально розбирає помилку, коли самооцінювальні скринінгові шкали в дослідженнях використовують як заміну case-finding або діагностичного інтерв’ю. За низької поширеності позитивна прогностична цінність може бути недостатньою, і значна частина «позитивних» за шкалою людей не відповідатиме діагностичним критеріям під час повнішого оцінювання.
Тому позитивний скринінг коректно читати як «результат перевищив визначений поріг і потребує інтерпретації в контексті», а не як «у людини встановлено розлад». Негативний скринінг означає зниження імовірності цільового стану, але не гарантує його відсутності за будь-яких обставин.
Позитивна прогностична цінність: що означає позитивний результат
PPV — це ймовірність наявності цільового стану серед людей із позитивним результатом за конкретного тесту, конкретного порога і конкретної популяції. Вона зростає, коли збільшується базова частота стану, якщо інші параметри фіксовані.
Це означає, що PPV не є універсальною «паспортною характеристикою» тесту. Значення, отримане в спеціалізованій клініці, не можна автоматично переносити на масовий онлайн-скринінг. І навпаки, низький PPV у загальній популяції не доводить, що сам інструмент «поганий»: можливо, його роль — чутливий перший етап, після якого передбачене уточнювальне оцінювання.
Негативна прогностична цінність: що означає негативний результат
NPV — це ймовірність відсутності цільового стану серед людей із негативним результатом. За інших рівних умов вона зазвичай вища там, де цільовий стан рідкісний, і нижча там, де передтестова ймовірність висока.
Тому дуже висока NPV у низькоризиковій популяції може частково відображати саму низьку базову частоту. Якщо майже всі люди й до тесту не мали цільового стану, негативний результат легко буде «правильним» у більшості. Це не робить тест автоматично клінічно корисним.
Відношення правдоподібності та перехід від pre-test до post-test probability
Ще один спосіб оновити ймовірність — використовувати likelihood ratios. LR+ показує, наскільки позитивний результат більш імовірний у людей зі станом, ніж без нього. LR− показує, наскільки негативний результат більш імовірний у людей зі станом, ніж без нього.
LR+ = чутливість / (1 − специфічність).
LR− = (1 − чутливість) / специфічність.
Передтестову ймовірність спочатку переводять у odds, множать на LR і отримують післятестові odds, які можна повернути в probability. Ця форма особливо корисна, коли потрібно явно показати, як новий результат змінює попередню оцінку, а не просто назвати «позитивний» чи «негативний» статус.
ROC/AUC не вирішує проблему базової частоти
ROC-крива та AUC оцінюють здатність показника розрізняти групи в діапазоні можливих порогів. AUC не є PPV, не є NPV і не повідомляє, скільки людей із позитивним результатом у вашій конкретній популяції справді матимуть цільовий стан.
Через це два середовища можуть мати подібну дискримінацію тесту, але дуже різний практичний склад позитивних результатів. Для розуміння порогів і співвідношення hit/false alarm корисно також прочитати «Теорія виявлення сигналу: як рішення про стимул залежать від чутливості та критерію».
Cutoff не є універсальною межею «є / немає»
Будь-який поріг перетворює безперервний бал або ризик на категорію. Зміщення cutoff зазвичай змінює компроміс між чутливістю та специфічністю: нижчий поріг може знаходити більше потенційних випадків, але створювати більше хибнопозитивних результатів; вищий — зменшувати хибнопозитивні, але пропускати більше людей зі станом.
Те, який компроміс прийнятний, залежить від intended use, наслідків двох типів помилок, доступності підтверджувального оцінювання та характеристик популяції. STARD 2015 окремо наголошує, що пороги мають бути описані й бажано визначені заздалегідь: вибір найвигіднішого cutoff після перегляду тих самих даних може завищувати оцінену точність.
Базова частота і клінічна корисність — не одне й те саме
Навіть правильно розраховані PPV і NPV не відповідають на всі питання. Клінічна корисність включає наслідки тестування: чи змінює результат подальшу дію, чи доступне підтвердження, чи є ефективна допомога, якою є ціна хибнопозитивних і хибнонегативних рішень, чи створює скринінг надмірне навантаження або стигматизацію.
Всесвітня організація охорони здоров’я у гайді про програми скринінгу розглядає скринінг як програму, а не як ізольований тест: потрібні доказова база, маршрут подальших дій, контроль якості, оцінка користі та шкоди. Висока статистична точність одного інструмента сама по собі не доводить користь усієї програми.
Що особливо важливо для психологічних опитувальників
Психологічні скринінгові шкали часто вимірюють симптоми або ризик за самозвітом. Багато симптомів є неспецифічними: порушення сну, втома, напруження, труднощі концентрації чи знижений настрій можуть виникати за різних станів і життєвих обставин. Тому позитивний результат за короткою шкалою не слід трактувати як самодостатню нозологічну класифікацію.
Крім base rate, важливі валідність саме цього використання, надійність, якість перекладу й культурної адаптації, характеристики нормативної або клінічної вибірки, референтний стандарт і спосіб встановлення cutoff. Standards for Educational and Psychological Testing розглядають валідність, надійність і fairness як центральні компоненти відповідального використання тестів; докази мають відповідати конкретній інтерпретації та конкретній меті.
Сам факт наявності українського перекладу не доводить, що для нього встановлено українські показники чутливості, специфічності або прогностичних цінностей. Переклад, психометрична адаптація та доказ клінічної точності — окремі завдання.
Прогностична цінність не дорівнює прогностичній валідності
Ці терміни легко сплутати через слово «прогностична». Прогностична валідність (predictive validity) у психометрії стосується того, наскільки тестовий показник передбачає майбутній зовнішній критерій. Позитивна та негативна прогностична цінність (positive/negative predictive value) стосуються ймовірності цільового стану після позитивного або негативного класифікаційного результату.
Детальний розбір першого поняття є у статті «Прогностична валідність: наскільки тест передбачає майбутній критерій і чому прогноз не є долею».
Чому «95% точності» майже нічого не пояснює
Фраза «тест точний на 95%» без уточнень є статистично неповною. Вона може означати загальну частку правильних класифікацій у конкретній вибірці, чутливість, специфічність, agreement або взагалі рекламне спрощення. Загальна accuracy особливо залежить від складу вибірки: коли один клас дуже поширений, навіть примітивне правило «всім негативний результат» може мати високу частку формально правильних відповідей.
Для серйозної інтерпретації потрібні щонайменше 2×2 дані або окремі sensitivity, specificity, PPV, NPV із довірчими інтервалами, опис population/setting, threshold і reference standard. STARD рекомендує подавати фактичні кількості істинно позитивних, хибнопозитивних, хибнонегативних та істинно негативних результатів, а не лише відсотки.
Типові помилки інтерпретації
• «Чутливість 90%» перетворюють на «після позитивного результату ймовірність стану 90%».
• PPV із дослідження спеціалізованої клініки переносять на загальнопопуляційний онлайн-скринінг.
• Поширеність у країні використовують замість базової частоти релевантної вікової, клінічної або ризикової групи.
• Один cutoff подають як природну межу між «здоровий» і «має розлад».
• Негативний скринінг тлумачать як абсолютне виключення стану навіть за високої передтестової ймовірності або виражених симптомів.
• Високий AUC сприймають як доказ високої PPV у будь-якій популяції.
• Скринінговий опитувальник використовують як діагностичний проксі без підтверджувального оцінювання.
• Ігнорують невизначеність: довірчі інтервали, невеликі вибірки, пропущені дані й невизначені результати.
• Вважають, що переклад тесту автоматично переносить його точність і cutoff на нову мову та культуру.
Як правильно читати позитивний результат скринінгу
Корисна послідовність запитань виглядає так:
• 1. Для чого цей інструмент створено: скринінг, case-finding, діагностика, моніторинг, прогноз чи інша мета?
• 2. Для якої популяції валідовано конкретну мовну версію та конкретний cutoff?
• 3. Якою є передтестова ймовірність або базова частота цільового стану в цій популяції?
• 4. Які чутливість і специфічність саме за використаного порога?
• 5. Які PPV і NPV за релевантної prevalence, а не лише у вибірці розробника?
• 6. Наскільки ці оцінки точні: які довірчі інтервали та розмір вибірки?
• 7. Яким є наступний крок після позитивного результату: інтерв’ю, повторне вимірювання, інший інструмент, клінічне оцінювання?
Цей алгоритм не замінює професійне рішення. Він показує, яку статистичну інформацію потрібно мати, щоб не перетворити screening result на діагноз одним кроком.
Як правильно читати негативний результат
Негативний результат знижує ймовірність цільового стану настільки, наскільки це дозволяють чутливість тесту, базова частота та конкретний клінічний контекст. Якщо передтестова ймовірність була дуже низькою, негативний результат часто мало змінює вже низький ризик. Якщо вона була високою, навіть хороший тест може залишити достатню залишкову ймовірність для подальшого оцінювання.
Тому фраза «тест негативний — питання закрите» також потребує контексту. Особливо це важливо, коли симптоми виражені, є інші незалежні ознаки або наслідки пропущеного стану є значними.
Що має бути в якісному дослідженні діагностичної або скринінгової точності
Щоб результати можна було перенести в практику, дослідження має дати читачеві можливість відновити контекст. STARD 2015 є стандартом звітності, а не інструментом оцінювання якості, але його чекліст добре показує, яку інформацію не можна ховати.
• Чітко визначена цільова умова і референтний стандарт.
• Опис intended use і ролі тесту: скринінг, triage, add-on, replacement тощо.
• Критерії включення та виключення, спосіб набору учасників, setting і часовий період.
• Заздалегідь визначений або чітко обґрунтований cutoff.
• Кількості TP, FP, FN і TN.
• Sensitivity, specificity, PPV, NPV або інші релевантні показники з довірчими інтервалами.
• Поширеність цільового стану в досліджуваній вибірці та пояснення, наскільки вона відповідає майбутній популяції застосування.
• Опис невизначених, пропущених або виключених результатів.
• Оцінка застосовності результатів до інших груп і setting.
Для психологічного тесту до цього додаються питання психометричної якості. Базову рамку можна знайти у матеріалах ХАБу про психометрію та психологічні тести.
Base rate у дослідженнях і в реальному застосуванні
Показник prevalence у статті не слід механічно ототожнювати з prevalence майбутніх користувачів тесту. Дослідження може набирати учасників із клініки, використовувати enrichment design, виключати складні випадки або включати лише людей із повним референтним стандартом. Усе це змінює склад вибірки.
Коли дослідницька prevalence не відповідає реальній, найнадійніше не просто копіювати PPV/NPV з публікації, а використовувати sensitivity/specificity або likelihood ratios разом із обґрунтованою передтестовою ймовірністю — за умови, що ці параметри самі достатньо транспортовані до вашого setting.
Саме тут потрібна подвійна обережність: формула Байєса може бути математично бездоганною, але результат залишиться хибно точним, якщо в неї підставлено невідповідну prevalence або перенесено нестабільні показники тесту з іншої популяції.
Base rate і fairness
Базові частоти можуть відрізнятися між групами, але статистична відмінність prevalence сама по собі не є дозволом використовувати різні стандарти без теоретичного, етичного та емпіричного обґрунтування. У fairness-аналізі потрібно розглядати джерело відмінностей, якість вимірювання, доступ до діагностики, selection effects, differential item functioning, measurement invariance та наслідки рішень.
Сучасні Standards AERA/APA/NCME ставлять fairness поруч із validity і reliability. Тому питання «у цієї групи інша base rate» не завершує аналіз упередженості тесту, а лише додає один статистичний параметр до ширшої оцінки.
Що змінює поширеність, а що — ні
• Поширеність безпосередньо змінює PPV і NPV, якщо sensitivity і specificity вважати фіксованими.
• Поширеність не перетворює percentile на probability і не робить високий тестовий бал автоматичним діагнозом.
• Зміна setting часто змінює не лише prevalence, а й case mix, тому в реальних даних можуть змінюватися sensitivity і specificity.
• AUC може залишатися подібною, тоді як PPV різко змінюється через іншу base rate.
• Cutoff визначає компроміс помилок, але його практичне значення залежить від популяції та intended use.
• Жодна base rate не усуває потреби перевіряти валідність конкретної інтерпретації тесту.
Практичний приклад для психологічного скринінгу
Уявімо короткий опитувальник, який у первинному дослідженні показав добру здатність знаходити людей із певним психічним станом. Якщо його застосувати в спеціалізованому сервісі, де багато людей уже мають відповідні симптоми, позитивний результат може мати досить високу PPV. Якщо той самий cutoff винести в масове тестування широкої аудиторії з набагато нижчою prevalence, частка хибнопозитивних серед усіх позитивних може суттєво зрости.
Це не означає, що широке скринування завжди помилкове або що психологічні опитувальники не корисні. Це означає, що роль результату має відповідати дизайну програми. Скринінг може бути корисним як перший фільтр, якщо після нього існує адекватний маршрут підтвердження, підтримки або клінічного оцінювання.
Саме таку логіку видно в рекомендаціях USPSTF щодо скринінгу депресії: користь скринінгу пов’язана не з ізольованим заповненням шкали, а з подальшим оцінюванням позитивних результатів і доступом до доказової допомоги.
FAQ
Чи може більшість позитивних результатів бути хибнопозитивними навіть у хорошого тесту?
Так. Якщо цільовий стан дуже рідкісний, велика кількість людей без нього може створити більше хибнопозитивних результатів, ніж буде істинно позитивних, навіть за високої специфічності. Навчальний приклад вище показує це для sensitivity 95%, specificity 95% і prevalence 1%.
Чи є PPV властивістю самого тесту?
Ні. PPV залежить від характеристик тесту, порога та передтестової ймовірності або prevalence в конкретній популяції. Тому PPV із однієї вибірки не слід автоматично переносити в іншу.
Чи є NPV властивістю самого тесту?
Так само ні. NPV зростає за нижчої prevalence і зменшується за вищої, якщо інші параметри незмінні. Її потрібно інтерпретувати для конкретного контексту.
Чи однакові base rate і prevalence?
Не завжди. Base rate — ширше поняття вихідної частоти. Prevalence — частка людей із цільовим станом у визначеній популяції й часовому контексті. У багатьох задачах скринінгу prevalence є емпіричною оцінкою base rate, але передтестова ймовірність конкретної людини може відрізнятися від популяційної prevalence.
Чи змінюється sensitivity, коли змінюється prevalence?
У простій математичній моделі sensitivity визначається серед людей зі станом і не містить prevalence у формулі. У реальних дослідженнях зміна prevalence часто супроводжується зміною спектра стану, setting і відбору, тому оцінена sensitivity може змінюватися. Це показують Leeflang et al. (2013) і велике метаепідеміологічне дослідження Murad et al. (2023).
Чи означає негативний скринінг, що розладу точно немає?
Ні. Негативний результат знижує ймовірність, але величина цього зниження залежить від sensitivity, specificity та передтестової ймовірності. За високої початкової підозри або значущих симптомів може бути потрібне подальше оцінювання.
Чи можна визначити діагноз за одним cutoff?
Для психічних розладів скринінговий cutoff не є автоматичним діагностичним кордоном. Діагноз потребує оцінювання критеріїв, функціонального впливу, тривалості, контексту, альтернативних пояснень і, залежно від стану, клінічного інтерв’ю та інших джерел інформації.
Чи достатньо знати ROC/AUC?
Ні. ROC/AUC описує дискримінацію, але не дає безпосередньо PPV/NPV і не враховує prevalence у тій формі, яка потрібна для відповіді на запитання «що означає мій позитивний результат?». Для цього потрібна післятестова ймовірність у релевантній популяції.
Яку prevalence брати для інтерпретації?
Найкращу оцінку для популяції, яка максимально відповідає реальним людям, маршруту та умовам застосування тесту. Якщо інструмент використовують у спеціалізованій клініці, загальнопопуляційна prevalence може суттєво занижувати передтестову ймовірність. Якщо тест винесли в масовий онлайн-скринінг, клінічна prevalence може її завищувати.
Чому онлайн-тест може створити надмірну впевненість?
Онлайн-інтерфейс часто показує лише score або категорію і приховує ключовий контекст: для якої популяції валідований cutoff, якими були sensitivity і specificity, яка була prevalence у дослідженні та чи пройшла конкретна мовна версія належну адаптацію. Без цієї інформації число виглядає точнішим, ніж є насправді.
