top of page

Психологічна енкциклопедія

Нехтування базовою частотою: чому ми ігноруємо статистичний базовий рівень

15 лип. 2023 р.
Читати 10 хв

Оновлено: 1 день тому

Автор: Український психологічний ХАБ · Опубліковано: 15 липня 2023 · Редакційна політика


Нехтування базовою частотою — це систематична помилка ймовірнісного судження, за якої людина надає замало ваги тому, наскільки часто подія, ознака або категорія трапляється у відповідній популяції, і надто сильно покладається на інформацію про конкретний випадок. Англійською явище називають base-rate neglect або base-rate fallacy. У старій україномовній літературі та популярних матеріалах можна зустріти назву «помилка базового відсотка», але базова частота не обов’язково виражається саме у відсотках: це може бути частка, частота, апріорна ймовірність або інша статистична характеристика відповідного класу випадків.


Цей феномен належить до традиції досліджень когнітивних упереджень у судженнях і прийнятті рішень. Класичні праці Деніела Канемана та Амоса Тверскі показали, що під час оцінювання ймовірності люди часто орієнтуються на схожість конкретного опису з прототипом категорії, тобто на евристику репрезентативності. Сучасна картина складніша: базові частоти далеко не завжди ігноруються повністю, а ступінь їхнього недовикористання сильно залежить від формату задачі, якості інформації та індивідуальної стратегії міркування.


Що таке базова частота


Базова частота — це частота або ймовірність події до врахування інформації про конкретний випадок. Якщо в певній популяції 1 зі 100 людей має певний стан, базова частота становить 1%. Якщо 30% заявок певного типу схвалюються, базова частота схвалення дорівнює 30%. Якщо один вид поломки трапляється в 4 випадках із 1000, саме ця величина є вихідною статистичною інформацією для оцінки нового випадку.


У байєсівському міркуванні базова частота відповідає апріорній імовірності: вона задає початкову правдоподібність гіпотези до отримання нових даних. Після появи додаткової ознаки, тесту, опису або сигналу апріорну ймовірність потрібно оновити з урахуванням того, наскільки такий сигнал характерний для випадків, де гіпотеза істинна, і для випадків, де вона хибна. Саме пропуск або сильне недооцінювання першої частини цього процесу утворює ядро нехтування базовою частотою.


Тут важлива правильна референтна група. Для запитання «наскільки ймовірно, що ця людина належить до категорії X?» базовою частотою має бути частота X серед релевантної популяції, а не будь-яке число, яке випадково є під рукою. Тому хороше статистичне міркування починається не з механічного застосування формули, а з визначення того, який клас порівняння справді відповідає задачі.


Класичне відкриття: коли опис людини перемагає статистику


У ранніх дослідженнях Канеман і Тверскі давали учасникам інформацію про співвідношення представників двох професій у вибірці, а потім — короткий опис конкретної людини. Інтуїтивні оцінки часто наближалися до того, наскільки опис здавався «типовим» для професії, хоча статистична частка цієї професії у вибірці мала істотно змінювати початкову ймовірність. У статті Kahneman & Tversky (1973) автори пов’язали такий патерн із репрезентативністю: подія здається ймовірною, коли вона добре відповідає уявному прототипу, навіть якщо цей прототип відволікає від апріорної ймовірності.


Наступна програмна праця Tversky & Kahneman (1974) описала репрезентативність разом із доступністю та якорінням як евристики судження за невизначеності. Важливий сучасний висновок полягає в тому, що евристика не є «дефектом мислення» сама по собі: швидкі правила часто корисні. Проблема виникає в тих задачах, де характеристика, що здається переконливою або типовою, має слабшу діагностичну цінність, ніж вихідна статистика.


Як працює Байєс і чому базовий рівень змінює висновок


Теорема Байєса формалізує оновлення ймовірності після появи нових даних. У спрощеному записі: P(H|E) = P(E|H) × P(H) / P(E), де H — гіпотеза, E — спостереження, P(H) — її апріорна ймовірність, а P(H|E) — ймовірність гіпотези після врахування спостереження. Для практичних задач особливо важливо, що один і той самий позитивний сигнал може означати зовсім різні речі, якщо вихідна поширеність події різна.


Приклад із діагностичним тестом


Уявімо суто навчальну ситуацію. У популяції з 10 000 людей певний стан мають 1%, тобто 100 людей. Тест має чутливість 90%, тому серед цих 100 людей приблизно 90 отримають позитивний результат. Специфічність становить 95%, отже серед 9900 людей без стану близько 5% — приблизно 495 — теж отримають позитивний результат. Загалом буде близько 585 позитивних результатів, але лише 90 із них припадатимуть на людей зі станом. Імовірність стану серед усіх позитивних результатів у такому прикладі становить приблизно 15,4%, а не 90% чи 95%.


Цей приклад показує, чому поширеність стану в релевантній групі не можна відкидати під час інтерпретації тесту. Він також показує різницю між чутливістю тесту та ймовірністю стану після позитивного результату. У реальній медицині конкретна інтерпретація залежить від клінічного контексту, характеристик тесту, популяції та передтестової ймовірності; окремий тестовий результат сам по собі не встановлює діагноз.


Чому натуральні частоти допомагають


Формат «90 із 100 хворих» і «495 із 9900 людей без стану» часто легше інтегрувати, ніж набір абстрактних умовних відсотків. Метааналіз McDowell & Jacobs (2017) узагальнив 35 статей і 226 оцінок результативності та підтвердив стійку перевагу подання байєсівських задач у натуральних частотах. На успішність впливали також структура задачі, візуальні підказки, числова грамотність і методичні особливості досліджень.


В експериментах Hoffrage та співавт. (2015) натуральні частоти поліпшували байєсівські висновки навіть у складніших задачах із кількома гіпотезами або кількома сигналами. У медичних студентів перевага частотного формату в складних умовах становила в середньому 37 процентних пунктів. Це не робить натуральні частоти універсальним способом усунення помилок, але показує, наскільки сильно саме представлення інформації змінює статистичне міркування.


Чому ми недооцінюємо базовий рівень


Репрезентативність: конкретний випадок здається переконливішим


Людина легко порівнює опис конкретного випадку з уявним прототипом. Якщо ознаки «схожі на» типовий образ шахрайства, хвороби, професії або ризикової поведінки, ця схожість створює сильне відчуття правдоподібності. Базова частота, навпаки, часто виглядає абстрактною і психологічно блідою. Класична інтерпретація Канемана і Тверскі саме так пояснювала нечутливість до апріорних імовірностей у багатьох задачах прогнозування.


Специфічність і суб’єктивна релевантність інформації


Мая Бар-Гіллел запропонувала інше важливе пояснення: люди ранжують інформацію за тим, наскільки безпосередньо вона стосується конкретного випадку. У роботі Bar-Hillel (1980) базові частоти використовувалися активніше, коли вони сприймалися як релевантні й специфічні для цільового випадку. Це означає, що конфлікт між «статистикою» та «історією про конкретну людину» частково є конфліктом між різними відчуттями релевантності.


Структура множин і формат задачі


Одна й та сама математична інформація може бути когнітивно різною залежно від того, як її подано. Огляд Barbey & Sloman (2007) пов’язує зменшення нехтування базовою частотою з форматами, які роблять видимою вкладену структуру множин: скільки людей входить до всієї групи, скільки мають ознаку, скільки дають позитивний сигнал. Коли відношення між множинами стають прозорими, інтегрувати базову частоту простіше.


Надійність джерела і вибір референтного класу


У реальному світі базові частоти можуть бути застарілими, приблизними, отриманими на іншій популяції або зібраними за методикою, яка не відповідає поточній задачі. Раціональний агент має оцінювати надійність апріорних даних, а не просто надавати їм максимальну вагу. Тому корисніше говорити про адекватне зважування базової частоти, ніж про автоматичну вимогу завжди «довіряти статистиці більше».


Індивідуальні відмінності в стратегіях міркування


Сучасне дослідження Stengård та співавт. (2022) перевірило явище в ширшому просторі задач і виявило значні індивідуальні відмінності. В одній групі учасники майже повністю ігнорували базову частоту, в іншій — майже повністю її враховували; моделювання також вказало на різні стратегії обробки інформації. Отже, середній груповий ефект може приховувати якісно різні способи міркування окремих людей.


Чи справді люди «ігнорують» базові частоти


Фраза «люди ігнорують базові частоти» стала популярним підручниковим скороченням, але буквально вона надто сильна. У критичному огляді Koehler (1996) показав, що в багатьох дослідженнях учасники все ж використовували базові частоти, просто надавали їм меншу вагу, ніж передбачала конкретна нормативна модель. Ступінь використання змінювався залежно від формулювання задачі, способу навчання, надійності статистики та частотного представлення.


Тому сучасний термін «нехтування базовою частотою» найкраще читати як континуум: від слабкого недозважування до майже повного ігнорування. Саме так формулюють явище Stengård та співавт. (2022): це схильність недооцінювати або інколи ігнорувати апріорну інформацію під час оцінки апостеріорної ймовірності. Така формула краще відповідає сукупності даних, ніж уявлення про один універсальний «збій», однаковий для всіх людей і всіх задач.


Ця сучасна оцінка важлива і для ширшого розуміння обмеженої раціональності. Людські рішення формуються під обмеженнями часу, уваги, доступної інформації та способу представлення задачі. Статистичне судження тому варто аналізувати як взаємодію даних, задачі та стратегії, а не як простий перелік «ірраціональних помилок».


Де нехтування базовою частотою має практичне значення


Медицина і скринінг


У скринінгових задачах рідкісна подія створює особливо сильний ефект базової частоти. Навіть достатньо точний тест може породжувати багато хибнопозитивних результатів, якщо стан дуже рідкісний у тестованій популяції. Для клінічного висновку тому потрібні передтестова ймовірність, характеристики тесту та контекст пацієнта. Інформаційна стаття про базові частоти допомагає розуміти статистику, але не замінює медичну інтерпретацію конкретного результату.


Право, експертиза і оцінювання доказів


У правових та експертних задачах яскрава індивідуальна ознака може здаватися сильнішою за інформацію про поширеність події. Однак базові частоти мають сенс лише тоді, коли обраний коректний клас порівняння і статистика справді стосується справи. Саме тому рання література про base-rate fallacy була важливою для обговорень доказової ваги, а пізніша критика наголосила на проблемі релевантності та референтного класу.


Відбір кандидатів і прогнозування поведінки


Під час найму або оцінювання ризику персональний опис легко створює відчуття, що конкретний кандидат «схожий» на успішного працівника або що певна історія «типова» для майбутньої невдачі. Без базової частоти успіху, валідності предиктора і частоти хибних сигналів таке враження може бути статистично слабким. Корисна перевірка — запитати, як часто подібний результат виникає в усій релевантній групі, а не лише наскільки переконливо виглядає окремий кейс.


Кібербезпека, шахрайство та автоматизовані сигнали


У системах виявлення рідкісних подій базова частота визначає, скільки тривог виявляться справжніми. Якщо шахрайські операції становлять дуже малу частку всіх транзакцій, навіть високі чутливість і специфічність класифікатора не гарантують високої частки справжніх випадків серед усіх спрацювань. Тому оцінка алгоритмічного сигналу має включати поширеність цільової події, структуру помилок і вартість хибнопозитивних та хибнонегативних рішень.


Це безпосередньо пов’язує тему з ширшою психологією прийняття рішень: якість рішення залежить не лише від сили окремого сигналу, а й від початкової ймовірності, цінності наслідків, доступних альтернатив та правил оновлення переконань.


Нехтування базовою частотою і суміжні поняття


Евристика репрезентативності


Евристика репрезентативності — це оцінювання ймовірності через схожість із прототипом або типовим образом. Нехтування базовою частотою може бути одним із наслідків такого способу судження, але ці поняття не тотожні. Репрезентативність охоплює ширший спектр ефектів, включно з помилкою кон’юнкції, нечутливістю до розміру вибірки та надмірною довірою до «типовості» опису.


Нехтування ймовірністю


Нехтування ймовірністю стосується слабкої чутливості до величини ймовірності як такої, особливо коли емоційна цінність наслідку дуже висока. Нехтування базовою частотою має іншу логічну структуру: людина має загальну апріорну інформацію і конкретний сигнал, але зважує їх невідповідно. У реальній поведінці обидва ефекти можуть співіснувати.


Когнітивні упередження і когнітивні спотворення


У judgment and decision science «когнітивні упередження» описують систематичні патерни судження та вибору, які досліджують експериментально. «Когнітивні спотворення» в клінічній і КПТ-традиції — це інший термінологічний пласт, пов’язаний із характерними способами інтерпретації досвіду в емоційних і клінічних контекстах. Для нехтування базовою частотою коректним основним контекстом є психологія судження, ймовірнісне міркування та прийняття рішень.


Як зменшити нехтування базовою частотою


Найнадійніша стратегія — зробити базову частоту явною ще до аналізу конкретного випадку. Спочатку визначте гіпотезу і референтний клас, потім запишіть початкову частоту події, і лише після цього оцінюйте новий сигнал. Така послідовність зменшує ризик того, що яскравий опис повністю задасть рамку міркування.


Перетворюйте умовні відсотки на натуральні частоти. Замість «чутливість 90%, специфічність 95%, поширеність 1%» побудуйте уявну групу з 1000 або 10 000 людей і порахуйте, скільки буде справжніх позитивних і хибнопозитивних результатів. Метааналіз 2017 року показує, що такий формат систематично полегшує байєсівське міркування.


Використовуйте таблицю 2 × 2, дерево частот або іншу візуалізацію множин. Вона робить видимими чотири групи: подія є і сигнал позитивний; подія є і сигнал негативний; події немає і сигнал позитивний; події немає і сигнал негативний. Саме ця структура часто губиться, коли задача подана лише мовою відсотків.


Перевіряйте якість базової частоти. Запитайте, з якої популяції вона походить, коли була виміряна, наскільки велика вибірка, чи відповідають умови поточному випадку. Хороше використання priors означає критичний вибір релевантної статистики, а не механічне підставляння будь-якого доступного числа.


Розділяйте силу сигналу і поширеність події. Фраза «цей тест точний на 95%» або «алгоритм має 95% accuracy» сама по собі не відповідає на запитання «яка ймовірність, що конкретне позитивне спрацювання є істинним?». Для відповіді потрібна повна матриця помилок і базова частота цільової події.


Для важливих рішень варто виконати явне байєсівське оновлення або скористатися перевіреним калькулятором, якщо відомі необхідні параметри. У побутових задачах часто достатньо простішого правила: «Якою була б моя оцінка до того, як я побачив цей конкретний опис, і наскільки нова інформація справді має змінити її?»


Коли базова частота сама може ввести в оману


Базова частота корисна лише настільки, наскільки правильний референтний клас і надійні дані. Середня частота для всієї країни може погано описувати конкретну вікову групу; показник минулого десятиліття може застаріти; статистика для однієї системи відбору може не переноситися на іншу. У таких випадках коректне міркування потребує більш локального або актуального prior.


Коефіцієнти також можуть змінюватися після втручання. Якщо система безпеки стала іншою, ринок перебудувався або критерії діагностики змінилися, історична базова частота вже описує інший процес. Саме тому критика Koehler (1996) наголошувала: реальні задачі часто не мають одного безсумнівного числа, яке можна просто оголосити «правильним prior». Нормативна якість рішення залежить і від того, наскільки адекватно сформульована сама модель.


Науковий статус феномену сьогодні


Нехтування базовою частотою — добре задокументований феномен у психології судження та ймовірнісного міркування. Водночас сучасна наука відмовляється від максимально простої версії твердження, ніби «люди завжди ігнорують статистику». Дані підтримують більш точну картину: базові частоти часто недозважуються, але ефект залежить від задачі, форми подання, надійності інформації та стратегії конкретної людини.


Дослідження Stengård et al. (2022) показує, що патерн узагальнюється за межі вузького набору класичних задач, але водночас демонструє сильну неоднорідність між учасниками. McDowell & Jacobs (2017) показують, що зміна репрезентації інформації істотно поліпшує байєсівське міркування. Разом ці результати зміщують фокус від ярлика «ірраціональність» до аналізу того, які представлення і когнітивні стратегії допомагають інтегрувати апріорну та нову інформацію.


FAQ


Нехтування базовою частотою і помилка базового відсотка — це одне й те саме?


У більшості популярних контекстів ці назви позначають один і той самий феномен. «Нехтування базовою частотою» точніше передає англійське base-rate neglect і не прив’язує поняття до відсоткової форми. «Помилка базового відсотка» залишається корисним синонімом для пошуку старих матеріалів і пояснення legacy-термінології.


Чи означає base-rate neglect повне ігнорування статистики?


Ні. У багатьох задачах люди враховують базову частоту, але надають їй меншу вагу, ніж передбачає нормативна модель. Повне ігнорування — крайній випадок континууму, а не обов’язкова ознака феномену.


Чи завжди правильна відповідь — застосувати теорему Байєса?


Коли задача чітко задає взаємовиключні гіпотези, надійні базові частоти та умовні ймовірності, байєсівське оновлення є природним нормативним стандартом. У реальному світі спочатку треба переконатися, що референтний клас, вимірювання і припущення моделі справді відповідають ситуації.


Чому натуральні частоти часто кращі за відсотки?


Вони роблять спільні події та вкладені множини видимими: наприклад, одразу показують, скільки позитивних результатів припадає на людей зі станом і скільки — на людей без нього. Це зменшує кількість прихованих обчислювальних кроків і полегшує порівняння груп.


Як швидко перевірити себе на нехтування базовою частотою?


Перед остаточним висновком поставте три запитання: яка початкова частота події в релевантній групі; наскільки новий сигнал відрізняє випадки з подією від випадків без неї; чи змінився б мій висновок, якби конкретний опис був менш яскравим. Якщо перше запитання взагалі не входило до міркування, базова частота, ймовірно, отримала замалу вагу.


Пов’язані статті









Джерела / References


Barbey, A. K., & Sloman, S. A. (2007). Base-rate respect: From ecological rationality to dual processes. Behavioral and Brain Sciences, 30(3), 241–254. https://doi.org/10.1017/S0140525X07001653


Bar-Hillel, M. (1980). The base-rate fallacy in probability judgments. Acta Psychologica, 44(3), 211–233. https://doi.org/10.1016/0001-6918(80)90046-3


Hoffrage, U., Krauss, S., Martignon, L., & Gigerenzer, G. (2015). Natural frequencies improve Bayesian reasoning in simple and complex inference tasks. Frontiers in Psychology, 6, 1473. https://doi.org/10.3389/fpsyg.2015.01473


Kahneman, D., & Tversky, A. (1973). On the psychology of prediction. Psychological Review, 80(4), 237–251. https://doi.org/10.1037/h0034747


Koehler, J. J. (1996). The base rate fallacy reconsidered: Descriptive, normative, and methodological challenges. Behavioral and Brain Sciences, 19(1), 1–17. https://doi.org/10.1017/S0140525X00041157


McDowell, M., & Jacobs, P. (2017). Meta-analysis of the effect of natural frequencies on Bayesian reasoning. Psychological Bulletin, 143(12), 1273–1312. https://doi.org/10.1037/bul0000126


Stengård, E., Juslin, P., Hahn, U., & van den Berg, R. (2022). On the generality and cognitive basis of base-rate neglect. Cognition, 226, 105160. https://doi.org/10.1016/j.cognition.2022.105160


Tversky, A., & Kahneman, D. (1974). Judgment under uncertainty: Heuristics and biases. Science, 185(4157), 1124–1131. https://doi.org/10.1126/science.185.4157.1124

bottom of page