Відношення правдоподібності (LR+ і LR−): як результат тесту змінює ймовірність стану
Оновлено: 6 днів тому
Автор: Український психологічний ХАБ · Опубліковано: 23 вересня 2026 · Редакційна політика
Відношення правдоподібності (likelihood ratio, LR) показує, наскільки конкретний результат тесту змінює шанси наявності цільового стану. Для бінарного результату використовують два показники: LR+ для позитивного результату та LR− для негативного. На відміну від простого твердження «тест позитивний» або «тест негативний», LR переводить результат у кількісну зміну від передтестової до післятестової оцінки. Deeks і Altman (2004) визначають LR як відношення ймовірності певного результату в людей із цільовим станом до ймовірності того самого результату в людей без нього.
Ключова ідея проста: сам результат тесту не існує у вакуумі. Його значення залежить від того, наскільки правдоподібним був стан до тестування, які чутливість і специфічність має тест у релевантній популяції, який поріг використано, наскільки надійним є референтний стандарт і чи відповідає досліджена вибірка людині або групі, для якої результат тлумачать. Cochrane Handbook for Systematic Reviews of Diagnostic Test Accuracy розглядає ці характеристики як частину ширшої оцінки діагностичної точності, а не як самодостатні числа.
Коротко: що означають LR+ і LR−
LR+ відповідає на запитання: у скільки разів позитивний результат імовірніший у людини з цільовим станом, ніж у людини без нього. Чим більше LR+ перевищує 1, тим сильніше позитивний результат підвищує шанси стану.
LR− відповідає на запитання: у скільки разів негативний результат імовірніший у людини з цільовим станом, ніж у людини без нього. Чим ближче LR− до 0, тим сильніше негативний результат знижує шанси стану.
LR = 1 означає, що такий результат трапляється однаково часто за наявності й відсутності цільового стану, тому сам по собі не змінює шанси. Значення по інший бік 1 від очікуваного напрямку — наприклад LR+ < 1 — означає, що ярлик «позитивний» спрямований протилежно діагностичній інформації; це привід перевірити кодування, поріг і саму логіку тесту, а не оголошувати число математично неможливим.
Формули LR+ і LR−
Для звичайної таблиці 2 × 2 формули випливають із чутливості та специфічності. Їх у такому вигляді наводить Methods Guide for Medical Test Reviews AHRQ.
LR+ = чутливість / (1 − специфічність)
LR− = (1 − чутливість) / специфічність
Якщо позначити наявність стану як D+, його відсутність як D−, позитивний результат як T+, а негативний як T−, тоді:
LR+ = P(T+ | D+) / P(T+ | D−)
LR− = P(T− | D+) / P(T− | D−)
У чисельнику завжди стоїть імовірність конкретного результату за наявності цільового стану, а в знаменнику — імовірність того самого результату за його відсутності. Саме тому LR описує інформаційну силу результату, а не частку людей із діагнозом серед тих, хто отримав певний результат.
Звідки беруться ці формули: логіка таблиці 2 × 2
У дослідженні діагностичної точності результат індексного тесту порівнюють із референтним стандартом. Виникають чотири групи: істинно позитивні (TP), хибнопозитивні (FP), хибнонегативні (FN) та істинно негативні (TN).
Чутливість = TP / (TP + FN): частка людей із цільовим станом, у яких тест позитивний.
Специфічність = TN / (TN + FP): частка людей без цільового стану, у яких тест негативний.
Тоді 1 − специфічність є часткою хибнопозитивних результатів серед людей без стану, а 1 − чутливість — часткою хибнонегативних серед людей зі станом. LR+ порівнює істиннопозитивну частоту з хибнопозитивною; LR− — хибнонегативну частоту з істиннонегативною.
LR працює з шансами, а не безпосередньо з відсотками
Баєсівське оновлення через LR виконується в просторі шансів. McGee (2002) популяризував практичне використання цього переходу в клінічному мисленні.
Передтестові шанси = передтестова ймовірність / (1 − передтестова ймовірність)
Післятестові шанси = передтестові шанси × LR
Післятестова ймовірність = післятестові шанси / (1 + післятестові шанси)
Це важливе розрізнення. Ймовірність 20 % — не те саме, що шанси 0,20. Для ймовірності 20 % шанси становлять 0,20 / 0,80 = 0,25. Саме 0,25 множиться на LR.
Приклад: як один і той самий тест змінює ймовірність
Припустімо, перед тестом обґрунтована ймовірність цільового стану становить 20 %. Передтестові шанси дорівнюють 0,20 / 0,80 = 0,25.
Якщо позитивний результат має LR+ = 6, післятестові шанси: 0,25 × 6 = 1,5. Перетворюємо назад у ймовірність: 1,5 / 2,5 = 0,60. Отже, за цих припущень позитивний результат підвищує оцінку з 20 % до 60 %.
Якщо негативний результат має LR− = 0,20, післятестові шанси: 0,25 × 0,20 = 0,05. Післятестова ймовірність: 0,05 / 1,05 ≈ 4,8 %. Негативний результат знижує оцінку з 20 % приблизно до 4,8 %.
Це навчальний приклад, а не діагностичний алгоритм. У реальній практиці передтестова ймовірність, самі LR та їхня невизначеність мають походити з релевантних даних і клінічної оцінки.
Чому однаковий LR дає різну післятестову ймовірність
LR є множником шансів, тому одна й та сама сила доказу приводить до різних абсолютних післятестових імовірностей залежно від стартової точки. Якщо LR+ = 6 і передтестова ймовірність 5 %, післятестова ймовірність становитиме приблизно 24 %. Якщо стартова ймовірність 60 %, той самий LR+ = 6 дасть приблизно 90 %.
Звідси випливає головна практична помилка: не можна переносити фразу «позитивний тест означає 90 % імовірності» між популяціями без урахування базової частоти, клінічного контексту та способу формування передтестової оцінки.
LR+ і LR− не є чутливістю та специфічністю
Чутливість і специфічність описують роботу тесту умовно щодо відомого статусу за референтним стандартом. LR комбінує ці дві характеристики в показник, який можна використати для оновлення шансів після конкретного результату.
Висока чутливість сама по собі не гарантує сильного LR+: якщо специфічність низька, позитивних результатів буде багато і серед людей без стану. Аналогічно висока специфічність не гарантує сильного LR−: для цього потрібна також достатня чутливість.
Не слід плутати діагностичну чутливість із чутливістю до змін (responsiveness). Responsiveness описує здатність шкали відображати зміну конструкта з часом; діагностична чутливість — частку позитивних результатів серед людей із цільовим станом.
LR не є PPV або NPV
Позитивна прогностична цінність (PPV) відповідає на запитання: яка частка людей із позитивним результатом справді має цільовий стан у конкретній популяції. Негативна прогностична цінність (NPV) — яка частка людей із негативним результатом справді не має стану.
PPV і NPV безпосередньо залежать від поширеності або базової частоти стану. AHRQ показує це у формулах прогнозних цінностей через prevalence. Таблиця AHRQ одночасно демонструє, що LR+ і LR− обчислюються з чутливості та специфічності.
Водночас фраза «LR не залежить від поширеності» потребує точності. У чистій алгебрі формула LR не містить prevalence. Але чутливість, специфічність і, відповідно, LR можуть змінюватися між популяціями через спектр тяжкості, відмінності добору, пороги, референтний стандарт та інші особливості дизайну. Тому значення LR з одного дослідження не стає автоматично універсальною константою тесту.
Наскільки «сильним» має бути LR
У навчальній літературі часто використовують орієнтири: LR+ понад 10 або LR− нижче 0,1 зазвичай створюють велику зміну шансів; значення ближчі до 1 дають меншу зміну. Ці пороги описані, зокрема, у Deeks і Altman (2004) та в методологічних посібниках з діагностичної точності.
Це евристика, а не універсальний клінічний cutoff. Значущість LR залежить від передтестової ймовірності, наслідків хибнопозитивного і хибнонегативного рішення, доступності подальшої оцінки, мети тестування та порогів дії. Навіть LR+ = 10 не перетворює позитивний скринінг на діагноз, якщо початкова ймовірність мала або сам тест застосований поза валідованою популяцією.
Позитивний скринінг не дорівнює діагнозу
У психології особливо важливо розрізняти скринінг, case-finding, повне оцінювання, діагностику, моніторинг і вимірювання результатів. Стандарти AERA, APA та NCME вимагають обґрунтовувати інтерпретацію балів і їх конкретне використання, а не переносити висновки з одного контексту на інший.
Скринінговий опитувальник може мати корисні LR для певного порога, але його позитивний результат означає лише зміну ймовірності цільового стану відповідно до доказів для цієї популяції й цього способу використання. Діагноз потребує професійного оцінювання, клінічних критеріїв, диференційної діагностики, оцінки функціонування, контексту й часто додаткових джерел даних.
Загальну логіку багатоджерельної оцінки в психології варто читати разом зі статтею «Психологічна оцінка й оцінювання».
Звідки береться передтестова ймовірність
Передтестова ймовірність — це обґрунтована оцінка ймовірності цільового стану до отримання нового результату. У популяційному скринінгу стартовою наближеною точкою може бути поширеність у релевантній групі. У клінічній практиці вона може враховувати симптоми, анамнез, попередні результати, вік, контекст звернення та інші дані.
Передтестову ймовірність не слід довільно «вигадувати», бо математично точне множення на LR не виправляє погану стартову оцінку. Якщо вихідне число не має емпіричного або клінічного обґрунтування, післятестовий відсоток створює лише видимість точності.
Поріг тесту змінює LR
Для шкал із безперервним або порядковим балом позитивний/негативний результат виникає лише після вибору порога. Зміна cutoff змінює чутливість і специфічність, а отже — LR+ і LR−. Зазвичай суворіший поріг може підвищити специфічність і LR+ ціною нижчої чутливості; м’якший поріг може підвищити чутливість і покращити LR−, але збільшити частоту хибнопозитивних результатів.
Теоретично це пов’язано з компромісом між виявленням сигналу і критерієм рішення. Для глибшого розуміння цієї логіки див. «Теорія виявлення сигналу».
Для безперервних балів один cutoff може втрачати інформацію
Якщо результат природно безперервний, його примусове поділення на «позитивний/негативний» відкидає інформацію про те, наскільки далеко бал лежить від порога. Brown і Reeves (2003) описують interval likelihood ratios — окремі LR для кількох діапазонів значень — як спосіб зберегти більше діагностичної інформації.
Наприклад, дуже високий бал і бал на одну одиницю вище cutoff можуть мати різну доказову силу, хоча за бінарною схемою обидва називаються «позитивними». Якщо дослідження має достатньо даних, багаторівневі або інтервальні LR можуть відображати це краще.
Водночас надмірне дроблення шкали на багато інтервалів за малої вибірки робить оцінки нестабільними. Інтервали, моделі й пороги мають бути статистично обґрунтованими та бажано перевіреними на незалежних даних.
LR, ROC-крива та AUC відповідають на різні запитання
ROC-крива показує компроміс між чутливістю та часткою хибнопозитивних результатів при різних порогах. AUC узагальнює здатність показника розрізняти дві групи в широкому діапазоні порогів. LR натомість описує доказову силу конкретного результату або конкретної категорії результатів.
Висока AUC не повідомляє автоматично, якою буде післятестова ймовірність для окремої людини, не визначає найкращий cutoff для всіх цілей і не доводить клінічну корисність. Для практичної інтерпретації потрібні поріг, відповідні LR або інші показники точності, базова частота, наслідки рішень і контекст.
Невизначеність: LR треба читати разом із довірчим інтервалом
LR у дослідженні — оцінка, а не відоме безпомилкове число. Невелика вибірка, мало людей із цільовим станом або без нього, рідкісні хибні результати та сильний дисбаланс груп можуть створювати дуже широкі довірчі інтервали.
Особливо обережно слід читати «ідеальні» значення на кшталт LR+ = ∞ або LR− = 0, отримані через нульову клітинку таблиці 2 × 2. Вони можуть відображати реальну високу точність, але можуть бути й наслідком малої вибірки. Для висновку важливі точність оцінки, довірчий інтервал та відтворення в інших вибірках.
Звіти досліджень діагностичної точності мають прозоро описувати вибір учасників, індексний тест, референтний стандарт, пороги та оцінки точності. STARD 2015 створено саме для повнішого й відтворюваного звітування таких досліджень.
Референтний стандарт може бути недосконалим
Формули чутливості, специфічності та LR передбачають, що статус цільового стану визначено достатньо надійним референтним стандартом. У психології та психіатрії «золотий стандарт» часто є складним: структуроване діагностичне інтерв’ю, експертне клінічне рішення або композитний критерій також мають похибку.
Якщо референтний стандарт помиляється, залежить від результату індексного тесту або застосовується не до всіх учасників, оцінки точності можуть бути зміщені. Тому число LR слід оцінювати разом із дизайном дослідження, а не виривати з таблиці.
Для систематичного оцінювання ризику упередження в дослідженнях діагностичної точності нині рекомендована QUADAS-3, опублікована у 2026 році. Вона оцінює ризик упередження у чотирьох доменах: Participants, Index test, Target condition та Analysis; для перших трьох доменів окремо оцінюють застосовність. У домені Target condition перевіряють, зокрема, адекватність референтного стандарту та часовий інтервал між індексним тестом і встановленням цільового стану.
Spectrum effect: LR може змінюватися між популяціями
Чутливість і специфічність часто називають характеристиками, менш залежними від поширеності, ніж PPV і NPV. Однак емпірично їх значення можуть змінюватися разом зі спектром стану, тяжкістю, супутніми станами та складом вибірки. Leeflang, Bossuyt і Irwig (2009) показали механізми, через які prevalence може бути маркером відмінностей популяції та дизайну, що впливають на оцінки точності.
Тому LR, отриманий у спеціалізованій клініці з тяжкими випадками і чіткими контролями, може не переноситися на первинну ланку, школу, онлайн-скринінг або загальну популяцію. Зовнішня застосовність потребує зіставлення віку, мови, культури, спектра симптомів, супутніх станів, способу рекрутингу і референтного стандарту.
Культурна та мовна адаптація: переклад не переносить LR автоматично
Якщо психологічний опитувальник перекладено українською, це ще не означає, що LR оригінальної версії діє для української версії. Standards for Educational and Psychological Testing вимагають доказів для конкретної інтерпретації, використання та популяції.
Мовні формулювання, культурні норми відповіді, доступність допомоги, базова частота стану, спосіб встановлення діагнозу та навіть значення окремих симптомів можуть змінити класифікаційні характеристики. Валідована культурна адаптація потребує окремої доказової бази; сам переклад не є валідизацією.
Ширше про вимірювальні властивості тестів див. «Психометрія: що це, що вона вимірює і як оцінюють якість психологічних тестів».
Кілька тестів поспіль: коли LR не можна просто перемножити
У простій баєсівській схемі після першого тесту післятестові шанси можуть стати передтестовими шансами для другого. Тоді здається природним послідовно множити LR. Це коректно лише за умов, які підтримують таке оновлення.
Якщо два тести вимірюють дуже схожі ознаки або мають спільні джерела помилки, їх результати можуть залишатися залежними навіть після врахування істинного статусу. Holleman і Simel (1997) показали, що наївне множення LR за порушення умовної незалежності може давати неточні післятестові оцінки.
У психологічній оцінці це особливо актуально, коли кілька опитувальників містять близькі питання, спираються на одну й ту саму самозвітність або реагують на спільний фактор дистресу. Кількість тестів не дорівнює кількості незалежних порцій інформації.
LR і статистичне likelihood ratio — не завжди одне й те саме
Термін likelihood ratio використовується також у математичній статистиці для відношення правдоподібностей моделей або гіпотез, а likelihood-ratio test — для статистичного порівняння вкладених моделей. Діагностичні LR+ і LR− — конкретні показники точності результату тесту. Їх не слід плутати з p-value, likelihood-ratio test, odds ratio або Bayes factor.
Так само LR не є відношенням шансів (odds ratio). Обидва показники є відношеннями, але відповідають на різні питання і мають різні формули та інтерпретацію.
Що LR не може сказати сам по собі
LR не встановлює, що людина має або не має розладу. Він змінює шанси цільового стану за певного результату і за припущення, що оцінка LR застосовна до цієї ситуації.
LR не доводить валідність конструкта. Інструмент може добре класифікувати людей щодо конкретного референтного критерію і водночас вимагати окремих доказів того, що його бали підтримують ширшу психологічну інтерпретацію.
LR не показує клінічну або практичну корисність. Навіть точний тест може бути невигідним, недоступним, шкідливим, надто складним або не змінювати подальше рішення.
LR не є універсальним доказом справедливості. Однакове загальне LR не виключає різниць між мовними, віковими, гендерними, культурними або клінічними підгрупами. Для важливих рішень потрібні перевірки релевантних підгруп і контекстів.
Як оцінювати LR у статті або звіті: практичний алгоритм
1. Чітко визначте цільовий стан і референтний стандарт. Питайте, що саме вважали D+ і D− та наскільки надійно це встановлено.
2. Перевірте популяцію. Вік, місце рекрутингу, тяжкість, супутні стани, мова й умови тестування мають відповідати intended use.
3. Подивіться на поріг. LR для конкретного cutoff не переноситься автоматично на інший cutoff або іншу версію шкали.
4. Читайте LR+ і LR− разом. Тест може бути сильним для підтвердження і слабким для виключення — або навпаки.
5. Перевірте 95 % довірчі інтервали. Широкі інтервали означають, що практична сила результату невизначена.
6. Знайдіть передтестову ймовірність, релевантну саме вашій популяції. Не підміняйте її поширеністю з випадкової вибірки.
7. Переведіть передтестову ймовірність у шанси, помножте на LR і поверніться до ймовірності. Не множте відсоток безпосередньо на LR.
8. Поставте післятестове число в контекст рішення: чи достатньо його для додаткової оцінки, спостереження, іншого тесту або зміни дії. Межа дії залежить від наслідків помилок і не є універсальною.
9. Для кількох тестів перевірте, чи є підстави вважати їх інформацію умовно незалежною. Якщо ні, просте перемноження LR може перебільшити впевненість.
10. Для психологічних інструментів перевірте окремо психометричні докази, культурно-мовну адаптацію, ліцензійний статус і intended use. Право використовувати тест і якість його вимірювання — різні питання.
Типові помилки інтерпретації
Помилка 1: «LR+ = 6 означає 60 % імовірності». Ні. LR є множником шансів; післятестова ймовірність залежить від передтестової.
Помилка 2: «LR не залежить від prevalence, тому він однаковий скрізь». Формула не містить prevalence, але реальні оцінки LR можуть змінюватися між популяціями через spectrum effect, пороги й дизайн.
Помилка 3: «LR+ > 10 автоматично ставить діагноз». Ні. Це лише сильна зміна шансів у багатьох контекстах; остаточне рішення залежить від стартової ймовірності, точності оцінки, клінічних критеріїв та наслідків помилок.
Помилка 4: «Негативний тест із LR− = 0,2 виключає розлад». Він зменшує шанси приблизно у п’ять разів, але абсолютна післятестова ймовірність залежить від стартової.
Помилка 5: «PPV і LR+ — те саме». PPV питає про P(D+ | T+), а LR+ — про P(T+ | D+) / P(T+ | D−).
Помилка 6: «Можна просто перемножити LR усіх опитувальників». Лише якщо модель послідовного оновлення та залежності між тестами це дозволяє.
Помилка 7: «Український переклад має ті самі LR, що й оригінал». Це потребує окремих даних для мовної версії та intended population.
Помилка 8: «Статистично значущий результат доводить хороший LR». p-value та діагностичний LR відповідають на різні питання. Для тестової точності потрібні оцінки чутливості, специфічності, LR і їх невизначеності в належному дизайні.
Науковий статус і доказовість
Формули LR+, LR− і баєсівського оновлення є усталеними елементами методології діагностичної точності. Доказовість конкретного LR для конкретного психологічного інструмента залежить від якості первинних досліджень, узгодженості результатів між вибірками, релевантності популяції, правильності референтного стандарту та точності оцінок.
Публікація показника в одній статті не робить його універсальним. STARD 2015 допомагає оцінювати повноту звітування первинного дослідження, QUADAS-3 — ризик упередження й застосовність, а Cochrane DTA Handbook — методологію синтезу діагностичної точності.
Систематичний огляд не тотожний метааналізу, а метааналіз не гарантує високої певності. Об’єднане число може приховувати різні пороги, популяції, дизайни й reference standards. Для психологічних рішень важлива не лише статистична точність, а відповідність конкретному intended use.
FAQ
Що таке LR+ простими словами?
LR+ показує, наскільки позитивний результат характерніший для людей із цільовим станом, ніж для людей без нього. Він множить передтестові шанси й допомагає отримати післятестову ймовірність.
Що таке LR− простими словами?
LR− показує, наскільки негативний результат трапляється серед людей із цільовим станом порівняно з людьми без нього. Чим ближче LR− до нуля, тим сильніше негативний результат зменшує шанси стану.
Чи є LR ймовірністю?
Ні. LR — відношення двох умовних імовірностей і множник шансів. Значення LR+ = 6 не означає 60 % імовірності стану.
Чи можна отримати післятестову ймовірність без передтестової?
Ні, не з одного LR. Потрібна стартова ймовірність або шанси. Без неї LR описує силу результату, але не дає абсолютного післятестового відсотка.
Яке LR вважається хорошим?
Чим далі LR від 1 у правильному напрямку, тим сильніше результат змінює шанси. Орієнтири LR+ > 10 і LR− < 0,1 часто описують як сильні, але їх не слід використовувати як універсальну межу для діагнозу чи рішення.
Чи залежить LR від поширеності?
У формулі LR немає prevalence. Проте оцінені в дослідженні чутливість, специфічність і LR можуть відрізнятися між популяціями через spectrum effect, тяжкість, добір, пороги й референтний стандарт.
Чи можна перемножити LR двох тестів?
Іноді так, але просте послідовне множення передбачає належну модель залежності. Для корельованих тестів або опитувальників із перекривними ознаками воно може завищити доказову силу.
Чи означає позитивний результат психологічного скринінгу з високим LR+, що є діагноз?
Ні. Скринінг оновлює оцінку ризику або ймовірності. Клінічний діагноз потребує комплексного оцінювання за відповідними критеріями та контекстом.
Чи можна використовувати LR оригінального тесту для українського перекладу?
Лише за наявності доказів, що така інтерпретація підтримується для конкретної української версії, популяції, порога й intended use. Сам переклад не переносить психометричні та діагностичні характеристики автоматично.
Пов’язані статті
Чутливість діагностичного тесту: що вона показує і чому висока sensitivity не означає точний діагноз
Джерела
American Educational Research Association, American Psychological Association, & National Council on Measurement in Education. (2014). Standards for Educational and Psychological Testing.
Bossuyt, P. M., Reitsma, J. B., Bruns, D. E., et al. (2015). STARD 2015: an updated list of essential items for reporting diagnostic accuracy studies. BMJ, 351, h5527.
Brown, M. D., & Reeves, M. J. (2003). Interval likelihood ratios: another advantage for the evidence-based diagnostician. Annals of Emergency Medicine, 42(2), 292–297.
Chang, S. M., Matchar, D. B., Smetana, G. W., & Umscheid, C. A. (ред.). (2012). Methods Guide for Medical Test Reviews. Agency for Healthcare Research and Quality.
Deeks, J. J., & Altman, D. G. (2004). Diagnostic tests 4: likelihood ratios. BMJ, 329, 168–169.
Deeks, J. J., Bossuyt, P. M., Leeflang, M. M., & Takwoingi, Y. (ред.). (2023). Cochrane Handbook for Systematic Reviews of Diagnostic Test Accuracy, Version 2.0. Cochrane.
Holleman, D. R., & Simel, D. L. (1997). Quantitative assessments from the clinical examination: how should clinicians integrate the numerous results?. Journal of General Internal Medicine, 12(3), 165–171.
Leeflang, M. M. G., Bossuyt, P. M. M., & Irwig, L. (2009). Diagnostic test accuracy may vary with prevalence: implications for evidence-based diagnosis. Journal of Clinical Epidemiology, 62(1), 5–12.
McGee, S. (2002). Simplifying likelihood ratios. Journal of General Internal Medicine, 17(8), 646–649.
Whiting, P. F., Tomlinson, E., Rutjes, A. W. S., et al. (2026). QUADAS-3: A revised tool for the quality assessment of diagnostic test accuracy studies. Annals of Internal Medicine, 179(4).
