top of page

Психологічна енкциклопедія

Порогове значення тесту: як обирають cutoff і чому одна межа не підходить для всіх популяцій та цілей

6 днів тому
Читати 13 хв

Автор: Український психологічний ХАБ · Опубліковано: 23 вересня 2026 · Редакційна політика


Коротка відповідь


Порогове значення тесту, або cutoff, — це заздалегідь визначене правило, за яким числовий результат переводять у категорію або дію: наприклад, «нижче порога» і «вище порога», «скринінг негативний» і «скринінг позитивний», «потрібне додаткове оцінювання» і «додаткове оцінювання не показане». Сам по собі cutoff не створює природної межі між двома типами людей. Він створює операційне рішення щодо безперервного або порядкового результату.


Сучасні стандарти психологічного тестування вимагають обґрунтовувати інтерпретацію балів і наслідки рішень, особливо коли рішення залежить від порогового значення. Standards for Educational and Psychological Testing розглядають валідність, точність вимірювання, справедливість і використання результатів як частини одного аргументу про допустимість конкретного застосування тесту.


Тому запитання «який cutoff правильний?» не має універсальної відповіді без уточнення: для якого інструмента, якої версії, якої популяції, якої мети, якого еталона, якої ціни хибнопозитивних і хибнонегативних рішень та якого подальшого маршруту допомоги обирають поріг.


Що таке cutoff у психологічному тестуванні


Багато психологічних шкал спочатку дають числовий результат: суму балів, стандартизований бал, оцінку латентної риси або інший показник. Цей результат може описувати ступінь прояву конструкта без жодної категорії. Cutoff додає до шкали правило рішення.


Наприклад, шкала може вимірювати вираженість депресивних симптомів від низької до високої. Якщо дослідники встановлюють правило «10 балів і більше — позитивний скринінг», число 10 стає порогом для конкретного застосування. Воно не означає, що людина з 9 балами належить до принципово іншого психологічного класу, ніж людина з 10 балами. Різкий стрибок виникає в правилі рішення, тоді як вимірювана ознака може змінюватися поступово.


У діагностичній точності така дихотомізація безперервного результату є звичайною процедурою. Пояснення STARD 2015 прямо вимагає повідомляти поріг, обґрунтування його вибору та те, чи був він визначений наперед або знайдений після перегляду даних.


Поріг — це правило рішення, а не доказ діагнозу


Для психологічних і психіатричних скринінгів позитивний результат означає, що за заданим правилом людина потрапила до групи, для якої передбачено наступний крок. Цим кроком може бути повторний тест, клінічне інтерв’ю, оцінювання функціонування, уточнення симптомів, диференційна діагностика або інший процес.


Український Центр громадського здоров’я МОЗ України у матеріалі про скринінг депресії також описує скринінг як спосіб виявити ймовірні симптоми та потребу в подальшому зверненні, а не як самодостатній клінічний діагноз.


Отже, «бал ≥ cutoff» і «розлад наявний» — різні твердження. Cutoff належить до інструмента і сценарію його використання. Діагноз належить до ширшого клінічного оцінювання за відповідними критеріями.


Як cutoff змінює чутливість і специфічність


Коли вища оцінка означає більшу ймовірність цільового стану, зниження порога зазвичай робить правило більш чутливим: більше людей із цільовим станом отримують позитивний результат. Одночасно до позитивної групи потрапляє більше людей без цільового стану, тому специфічність зазвичай зменшується.


Підвищення порога зазвичай робить протилежне: зменшує кількість хибнопозитивних результатів і підвищує специфічність, але збільшує ризик пропустити частину людей із цільовим станом, тобто знижує чутливість.


Цей компроміс лежить в основі ROC-аналізу. Akobeng показує, що чутливість і специфічність залежать від обраного порога, а ROC-крива відображає їхні поєднання для різних можливих cutoff.


Чутливість можна записати як TP/(TP+FN), де TP — істинно позитивні, FN — хибнонегативні результати. Специфічність — TN/(TN+FP), де TN — істинно негативні, FP — хибнопозитивні. Зміна cutoff змінює те, які спостереження потрапляють у ці чотири клітини.


Що означає «оптимальний cutoff»


Слово «оптимальний» має сенс тільки після визначення критерію оптимальності. Один і той самий набір даних може давати різні найкращі пороги залежно від того, чи ми хочемо максимізувати сумарну класифікаційну точність, мінімізувати пропущені випадки, мінімізувати зайві направлення, максимізувати очікувану користь або дотриматися зовнішнього стандарту.


Тому наукова стаття має пояснювати не лише число cutoff, а й функцію, за якою це число обрали. Без цього «найкращий поріг» є неповним твердженням.


Основні способи вибору порогового значення


1. Попередньо встановлений cutoff із незалежних даних


Найсильніша ситуація виникає тоді, коли поріг визначено до аналізу поточної вибірки на основі попередніх валідних досліджень, керівництв або заздалегідь сформульованого рішення. Це зменшує ризик того, що cutoff випадково підлаштують під шум конкретної вибірки.


У поясненні STARD попередньо визначені пороги прямо відрізняються від дослідницьких, знайдених після перегляду даних; спосіб вибору треба повідомляти прозоро.


2. ROC-крива та індекс Youden J


Поширений статистичний підхід — обрати точку, що максимізує індекс Youden J = чутливість + специфічність − 1. Цей критерій знаходить поріг, який найбільше віддаляє пару «чутливість/специфічність» від випадкової класифікації за заданих даних.


Однак Smits показує, що Youden J не є нейтральним універсальним правилом: його використання пов’язане з певним співвідношенням вартості помилок та поширеності. Тому максимум J не слід автоматично називати клінічно оптимальним cutoff.


3. Поріг за наслідками хибнопозитивних і хибнонегативних рішень


У багатьох реальних задачах дві помилки несиметричні. Якщо пропустити небезпечний стан набагато гірше, ніж направити частину людей на додаткове безпечне оцінювання, критерій може свідомо віддавати перевагу чутливості. Якщо подальша процедура дорога, інвазивна або має власні суттєві ризики, специфічність може отримати більшу вагу.


Decision-theoretic підхід до скринінгу описує Longford: вибір правила має враховувати наслідки рішень, а не лише геометрію ROC-кривої. Подібну логіку очікуваної корисності для діагностичних порогів розглядають Irwin та Irwin.


4. Поріг для конкретного маршруту допомоги


Cutoff має сенс у ланцюжку дій. Для короткого первинного скринінгу в масовій популяції позитивний результат може означати лише «перейти до другого етапу». Для спеціалізованої клініки той самий інструмент може використовуватися як одна з багатьох складових оцінювання. Критерій вибору порога має відповідати тому, що реально відбувається після результату.


Саме тому cutoff без опису intended use — цілі використання — є неповним. Не можна відокремити порогове число від рішення, яке воно запускає.


5. Порогові стандарти у відборі та освіті


У тестуванні досягнень, ліцензуванні або професійному відборі cut score може встановлюватися не через ROC із клінічним референтним стандартом, а через процедуру standard setting: експертне визначення мінімально прийнятної компетентності, аналіз завдань, емпіричні дані та документований процес ухвалення рішення.


Загальні Standards for Educational and Psychological Testing вимагають, щоб інтерпретація порогових рішень відповідала заявленій меті, а процедура встановлення і точність оцінок були достатньо обґрунтовані.


Чому одна межа не підходить для всіх популяцій


Навіть якщо тест однаковий, його робота може змінюватися між популяціями. Причина не зводиться до однієї демографічної характеристики. Важливі спектр тяжкості, частота супутніх станів, шлях потрапляння людини до вибірки, setting, мова, культура, спосіб адміністрування, референтний стандарт і те, наскільки нова популяція схожа на вибірку, де cutoff було отримано.


Огляд Usher-Smith, Sharp і Griffin описує spectrum effect: чутливість, специфічність і відношення правдоподібності можуть змінюватися між популяціями через відмінності у складі випадків і невипадків. Отже, числа з однієї валідаційної вибірки не слід механічно переносити в іншу.


Це не означає, що кожна група обов’язково потребує власного cutoff. Воно означає, що перенесення порога є емпіричним питанням. Потрібні дані, які показують, що обране правило зберігає прийнятні властивості у новій цільовій групі та для нового застосування.


Роль поширеності та базової частоти


Поширеність цільового стану особливо сильно змінює те, що означає позитивний або негативний результат. Навіть якщо чутливість і специфічність умовно залишити однаковими, позитивна прогностична цінність різко падає, коли стан рідкісний, бо велика група людей без стану породжує абсолютну кількість хибнопозитивних результатів.


Детальний розбір цієї логіки дивіться у статті «Базова частота і поширеність». Для переходу від передтестової до післятестової ймовірності також корисні відношення правдоподібності LR+ і LR−.


Водночас важливо не змішувати два твердження. PPV і NPV математично залежать від prevalence. Чутливість і специфічність формально визначаються умовно щодо наявності або відсутності цільового стану, але в реальних даних вони теж можуть змінюватися між популяціями через spectrum effect, різний референтний стандарт та інші умови.


Приклад: той самий cutoff, різне значення позитивного результату


Уявімо скринінг із чутливістю 80% і специфічністю 90% при вже зафіксованому cutoff. Це навчальний приклад, а не характеристика конкретного психологічного тесту.


Якщо стан має поширеність 10% у групі з 1000 людей, очікуємо 100 людей зі станом і 900 без нього. За чутливості 80% буде приблизно 80 істинно позитивних і 20 хибнонегативних результатів. За специфічності 90% серед 900 людей без стану буде приблизно 810 істинно негативних і 90 хибнопозитивних результатів. PPV = 80/(80+90) ≈ 47%.


Якщо той самий тест із тим самим cutoff застосувати в групі, де поширеність 1%, із 1000 людей лише близько 10 матимуть стан. Очікуємо приблизно 8 істинно позитивних, 2 хибнонегативних, 891 істинно негативний і 99 хибнопозитивних результатів. PPV = 8/(8+99) ≈ 7,5%.


Порогове правило не змінилося, але практичне значення позитивного результату змінилося радикально. Це одна з причин, чому фраза «вище cutoff — стан є» є статистично й клінічно некоректною.


Чи може prevalence впливати і на вибір самого cutoff


Так, якщо критерій оптимальності включає очікувані наслідки рішень. Коли частота стану змінюється, змінюється очікувана кількість істинних і хибних результатів, а разом із нею — сумарна користь або шкода конкретного порога.


Саме це робить важливим застереження Smits щодо механічного використання Youden J: правило, яке виглядає нейтральним, фактично може відповідати певному співвідношенню вартості помилок і поширеності.


Проте prevalence не означає, що треба довільно змінювати cutoff після кожного коливання статистики. Поріг має бути заздалегідь обґрунтований, валідуватися у цільовому setting і бути частиною стабільного протоколу, якщо протокол цього вимагає.


Чому ROC/AUC не визначає клінічну корисність


AUC узагальнює здатність тесту розрізняти дві групи в діапазоні можливих порогів. Він корисний як характеристика дискримінації, але не відповідає на питання, який саме cutoff слід використовувати в конкретному маршруті, скільки буде хибнопозитивних результатів за певної поширеності, які наслідки мають помилки і чи покращує тест рішення для людей.


Cochrane Handbook for Diagnostic Test Accuracy розглядає порогові ефекти як центральну частину аналізу діагностичної точності. ROC/AUC і вибір конкретного порога — пов’язані, але не тотожні задачі.


Тому твердження «AUC висока, отже cutoff клінічно хороший» пропускає кілька рівнів доказів: калібрування, поширеність, рішення після тесту, наслідки помилок, зовнішню валідацію та реальну клінічну користь.


Референтний стандарт змінює оцінку cutoff


Щоб оцінити чутливість і специфічність, потрібне незалежне правило, яке визначає, хто вважається таким, що має цільовий стан, а хто — ні. Його називають референтним стандартом. Якщо він змінюється, можуть змінитися і оцінки точності, і поріг, який виглядає найкращим у даних.


В індивідуальному метааналізі Negeri та співавторів для PHQ-9 cutoff із найкращим поєднанням чутливості та специфічності відрізнявся залежно від категорії діагностичного інтерв’ю. Це конкретний приклад того, що навіть відомий бал не існує поза дизайном валідації.


Цей приклад не означає, що поріг PHQ-9 треба самостійно змінювати. Він показує загальний методологічний принцип: cutoff має сенс разом із референтним стандартом, популяцією, мовною версією та способом застосування.


Дані, знайдені після перегляду вибірки, потребують незалежної перевірки


Якщо дослідник перебирає десятки можливих cutoff і публікує тільки той, де показники виявилися найкращими, отримана точність буде оптимістичною. Частина «переваги» може бути випадковим пристосуванням до конкретної вибірки.


STARD вимагає повідомляти, чи був поріг визначений наперед чи дослідницьки. Дослідження селективного повідомлення cutoff для PHQ-9 та EPDS показує, чому прозорість щодо всіх проаналізованих порогів важлива для оцінки ризику упередженого представлення точності.


Найсильніший шлях — визначити правило на одних даних, а потім перевірити його на незалежній вибірці, бажано в setting, де тест реально планують використовувати.


Похибка вимірювання біля порога


Будь-який спостережуваний бал має невизначеність. Особливо важливо це біля cutoff: невелика випадкова зміна відповіді, умов проведення або оцінювання може перевести результат через формальну межу, хоча реальний рівень конструкта майже не змінився.


У Standards for Educational and Psychological Testing точність і надійність результатів розглядаються відносно конкретної інтерпретації та рішення; для категоріальних рішень важлива точність саме там, де відбувається класифікація.


Тому різницю «на один бал нижче» і «на один бал вище» не слід автоматично трактувати як велику психологічну відмінність. Cutoff може бути адміністративно чітким, тоді як вимірювана ознака і похибка залишаються безперервними.


Похибка вимірювання також не тотожна standard error of the mean. Перша стосується невизначеності індивідуального вимірювання за моделлю тесту; друга — невизначеності оцінки середнього в статистичній вибірці.


Одна межа чи «сіра зона»


Іноді замість жорсткої дихотомії доцільно дослідити три зони: нижче порога для виключення, проміжну невизначену зону та вище порога для підтверджувального маршруту. Така архітектура визнає, що тест не завжди може надійно вирішити всі випадки одним числом.


Coste і Pouchot запропонували формальний підхід «grey zone» для кількісних діагностичних і скринінгових тестів, у якому ширина невизначеної області залежить від розподілів результатів, варіабельності та допустимих ризиків хибних рішень.


Це не універсальна вимога і не автоматично краща модель для кожного психологічного тесту. Її потрібно валідовувати так само, як і один cutoff, та пов’язувати з конкретними наступними діями.


Cutoff і культурно-мовна адаптація


Переклад опитувальника українською не переносить автоматично порогове значення з іншої мови. Навіть якісний переклад може змінити розуміння окремих пунктів, розподіл відповідей, базову частоту позитивних відповідей і зв’язок шкали з референтним стандартом.


Саме тому адаптація і переклад психологічних тестів потребують перевірки змісту, надійності, валідності, структури, інваріантності або DIF там, де це релевантно, а для скринінгового cutoff — окремих даних про точність у цільовій популяції.


Наявність українського тексту шкали не є доказом валідованої української адаптації. Наявність валідованої шкали теж не означає, що кожен історичний cutoff однаково придатний для будь-якого українського setting.


Cutoff, інваріантність і справедливість


Якщо групи по-різному відповідають на окремі пункти або мають різну структуру вимірювання, однакова числова межа може мати різні наслідки. Але сам факт різних частот позитивного результату ще не доводить bias. Так само measurement invariance не є автоматичним доказом повної справедливості, а DIF не є автоматичним доказом несправедливості.


Оцінювання fairness потребує причинного й контекстного аналізу: що саме вимірює тест, чи однаково інтерпретується score, чи однакові наслідки рішення, чи є релевантні групові відмінності в цільовому стані, і чи виправдане конкретне застосування.


Cutoff і стандартизація процедури


Порогове значення має сенс лише за стабільної процедури. Якщо різні адміністратори дають різні інструкції, допускають різний час, по-різному обробляють пропущені відповіді або використовують інший алгоритм підрахунку, один і той самий числовий cutoff може застосовуватися до фактично різних вимірювань.


Про цю частину якості тесту окремо: «Стандартизація психологічного тесту».


Cutoff у процесі розробки тесту


Поріг не повинен бути декоративним фінальним числом, доданим після створення шкали. Якщо інструмент призначений для класифікаційного рішення, питання про цільову популяцію, референтний стандарт, наслідки помилок, точність біля межі та зовнішню валідацію мають бути закладені в дизайн.


Повний маршрут від конструкта й специфікації до фінальної інтерпретації описаний у статті «Розробка психологічного тесту».


Що треба вказувати в дослідженні cutoff


Для відтворюваної інтерпретації недостатньо написати «cutoff = 10». Потрібно описати сам інструмент і версію, мову, спосіб підрахунку, правило включення самої межі — наприклад ≥10 чи >10, цільову популяцію, setting, референтний стандарт, поширеність стану, спосіб вибору порога та його статус як prespecified чи exploratory.


Для кожного ключового cutoff доцільно повідомляти чутливість і специфічність із невизначеністю, кількість істинно та хибно позитивних і негативних класифікацій, PPV/NPV у досліджуваній популяції, а за потреби — LR+ і LR−. Якщо застосування має рішення з різною ціною помилок, цей компроміс також треба зробити явним.


Такі принципи узгоджуються з STARD і методологією Cochrane DTA Handbook.


Типові помилки інтерпретації


«Cutoff знайдений у статті, отже він універсальний»


Дослідження підтверджує поріг лише в межах конкретного дизайну та доказів. Перенесення на іншу мову, setting, вік, клінічний спектр або мету потребує окремого обґрунтування.


«Найвищий Youden J означає найкращий клінічний поріг»


Youden J оптимізує конкретний математичний критерій. Він не містить повної моделі ресурсів, шкоди, користі, маршруту після тесту або цінностей людини.


«Високий AUC гарантує хороший cutoff»


AUC описує дискримінацію в діапазоні порогів. Конкретний cutoff має власні sensitivity/specificity та наслідки, а клінічна корисність потребує додаткового аналізу.


«Позитивний скринінг дорівнює діагнозу»


Скринінговий результат лише змінює оцінку ризику або запускає наступний етап. Діагноз потребує клінічного оцінювання відповідно до критеріїв і контексту.


«Негативний результат завжди виключає стан»


Жоден cutoff із чутливістю нижче 100% не усуває хибнонегативні результати. Навіть за дуже високої чутливості післятестове значення залежить від передтестової ймовірності та всього діагностичного контексту.


«Той самий переклад — той самий cutoff»


Мовна форма, культурний контекст і психометричні властивості можуть змінити роботу шкали. Переклад без валідації не переносить доказовість порога.


«Одна точка по обидва боки cutoff означає реальну зміну стану»


Перетин порогу може відбутися через похибку вимірювання. Для моніторингу змін треба окремо оцінювати measurement error, надійність і критерії зміни; cutoff для класифікації не замінює MDC, MIC/MID або RCI.


Практична перевірка перед використанням порога


Перед тим як застосовувати cutoff до конкретної людини або групи, перевірте: чи це саме та версія тесту; чи валідована вона для потрібної мови й популяції; яку мету мав поріг у первинному дослідженні; як визначали цільовий стан; чи був cutoff попередньо заданий; яка була поширеність; які чутливість і специфічність; які наслідки хибнопозитивного і хибнонегативного рішення; що відбувається після позитивного результату.


Якщо на ці питання немає відповідей, краще трактувати результат як обмежений сигнал, а не як точний кордон. Загальний контекст якості інструмента описує стаття «Психологічний тест», а ширший методологічний контекст — «Психометрія».


Приклад із PHQ-9: чому навіть відомий cutoff потребує контексту


PHQ-9 часто наводять як приклад шкали з відомим порогом 10 балів. Великий індивідуальний метааналіз підтвердив, що для певних референтних стандартів cutoff ≥10 давав сильне поєднання чутливості та специфічності. Водночас оцінки точності та поріг із максимальним поєднанням показників відрізнялися залежно від типу діагностичного інтерв’ю.


Джерело: Negeri et al., BMJ, 2021.


Правильний висновок із цього прикладу: відомий cutoff може мати добру емпіричну підтримку, але його значення все одно визначається версією шкали, референтним стандартом, популяцією і intended use. Неправильний висновок: кожна людина з 10 балами має депресивний розлад, а кожна з 9 — не має.


Scientific status: що встановлено надійно, а що залежить від моделі


Добре встановлено: cutoff переводить результат у рішення; зміна порога змінює компроміс між чутливістю та специфічністю; PPV/NPV залежать від базової частоти; точність може відрізнятися між популяціями; дослідницьки підібраний cutoff потребує незалежної перевірки; скринінговий поріг не є самодостатнім діагнозом.


Методологічним вибором є критерій оптимальності: Youden J, задана мінімальна чутливість, задана мінімальна специфічність, мінімізація очікуваної втрати, експертне standard setting або інший заздалегідь обґрунтований метод.


Контекстно залежним є рішення, чи потрібен один поріг, два пороги із сірою зоною або безперервна інтерпретація без дихотомізації. Це визначається intended use та доказами, а не універсальним правилом.


Попереднім або слабким слід вважати cutoff, який отримано на малій або нерепрезентативній вибірці, без належного референтного стандарту, без незалежної валідації, із вибором найкращого числа після перегляду результатів або без підтвердження для мовної версії й цільової популяції.


Запитання і відповіді


Що таке cutoff у психологічному тесті?


Це порогове правило, за яким числовий результат переводять у категорію або наступну дію. Cutoff не є природною межею між двома типами людей.


Чи означає бал вище cutoff, що в людини є розлад?


Ні. Для скринінгового інструмента це означає позитивний скринінговий результат за конкретним правилом. Клінічний діагноз потребує ширшого оцінювання.


Чи є один найкращий cutoff для всіх?


Зазвичай таке твердження потребує перевірки. Придатність порога залежить від цілі, популяції, setting, референтного стандарту, наслідків помилок і валідованої версії інструмента.


Що відбувається, якщо знизити cutoff?


Коли вищий бал означає більшу ймовірність стану, нижчий поріг зазвичай підвищує чутливість, але зменшує специфічність і збільшує кількість хибнопозитивних результатів.


Що відбувається, якщо підвищити cutoff?


Зазвичай підвищується специфічність і зменшується кількість хибнопозитивних результатів, але зростає ризик хибнонегативних результатів і може знижуватися чутливість.


Чи достатньо вибрати cutoff за максимальним Youden J?


Ні. Youden J є корисним статистичним критерієм, але не враховує повністю клінічні наслідки, ресурси, downstream-рішення та цінність різних типів помилок.


Чи переноситься cutoff після перекладу тесту українською?


Не автоматично. Переклад не дорівнює валідованій культурно-мовній адаптації, а застосування порога потребує даних для відповідної версії та цільової популяції.


Чому люди з балами 9 і 10 не обов’язково принципово різні?


Бо психологічна ознака і похибка вимірювання часто безперервні. Категоріальний розрив між 9 і 10 створює правило рішення, а не обов’язково природа конструкта.


Чи може тест мати два cutoff?


Так, у деяких сценаріях досліджують нижній поріг для виключення, верхній для підтверджувального маршруту і проміжну сіру зону. Така схема також потребує валідації.


Чи залежить значення позитивного результату від поширеності?


Так. За однакових чутливості та специфічності позитивна прогностична цінність може різко відрізнятися в популяціях із різною базовою частотою стану.


Пов’язані статті









Джерела













 
 
bottom of page