top of page

Психологічна енкциклопедія

Довірчий інтервал: що означає 95% CI і як він показує невизначеність оцінки

23 вер.
Читати 16 хв

Автор: Український психологічний ХАБ · Опубліковано: 23 вересня 2026 · Редакційна політика


Довірчий інтервал (confidence interval, CI; укр. ДІ) — це інтервальна статистична оцінка невідомого параметра, побудована за процедурою з визначеною частотою покриття в повторних вибірках. Для 95% довірчого інтервалу ключове число «95%» характеризує саме процедуру: якби ми багато разів повторювали вибірку й щоразу будували інтервал тим самим способом, приблизно 95% таких інтервалів містили б істинне значення параметра за виконання припущень методу. Саме так рівень довіри пояснює NIST/SEMATECH.


Це означає важливе правило: для вже обчисленого конкретного частотного 95% CI некоректно буквально говорити «є 95% імовірність, що істинний параметр лежить між нижньою та верхньою межею». Після того як дані отримано й інтервал зафіксовано, параметр або належить цьому інтервалу, або ні; 95% стосується довгострокової властивості методу. NIST прямо підкреслює це розрізнення, а детальний огляд типових статистичних помилок Greenland та співавторів пояснює, чому перенесення ймовірності з процедури на конкретний інтервал є хибним.


У психології довірчі інтервали потрібні не для декоративного доповнення до p-value. Вони допомагають бачити невизначеність навколо середніх, різниць між групами, кореляцій, коефіцієнтів регресії, стандартизованих розмірів ефекту, пропорцій, відношень шансів, відносних ризиків та інших оцінок. APA Journal Article Reporting Standards підтримують повніше статистичне звітування, у якому оцінки ефекту та їхня невизначеність розглядаються разом, а не зводяться до дихотомії «значуще / незначуще».


На PSYKHOLOH.COM ця сторінка належить до гілки статистичної інтерпретації. Для інтервалів навколо індивідуального тестового бала, які будують із похибки психометричного вимірювання, діє інша задача: її пояснюють статті про похибку вимірювання та стандартну похибку вимірювання (SEM).


Коротка відповідь: що означає 95% CI


Якщо дослідження повідомляє оцінку 4,2 та 95% CI [1,1; 7,3], це означає, що за використаної моделі й процедури інтервального оцінювання отримано межі від 1,1 до 7,3, а сама процедура має номінальне 95-відсоткове покриття в повторних вибірках. Інтервал показує масштаб статистичної невизначеності навколо точкової оцінки 4,2.


Коректна частотна інтерпретація: «цей інтервал отримано процедурою, яка за повторення дослідження за тих самих умов охоплювала б істинний параметр приблизно у 95% випадків». Практично його читають разом із точковою оцінкою, шириною інтервалу, одиницями вимірювання, дизайном, припущеннями моделі та величинами, що мають предметне значення.


Некоректне буквальне формулювання: «є 95% шансів, що істинне значення саме зараз лежить у цьому конкретному інтервалі». Для такого ймовірнісного твердження про параметр потрібна інша інференційна рамка, наприклад байєсівська, де ймовірність визначається умовно на моделі, даних і апріорному розподілі.


Що саме оцінює довірчий інтервал


Статистичне дослідження зазвичай має невідомий параметр: середнє значення в популяції, різницю середніх, кореляцію, коефіцієнт регресії, частку людей із певною характеристикою, відношення шансів або іншу величину. Вибірка дає точкову оцінку цього параметра. Якби взяти іншу вибірку з тієї самої популяції, точкова оцінка трохи змінилася б. Ця вибіркова мінливість є однією з центральних причин статистичної невизначеності.


Довірчий інтервал додає до точки дві межі — нижню та верхню. У простих регулярних задачах ширина інтервалу тісно пов’язана зі стандартною похибкою оцінки: що більше інформації в даних і що менша вибіркова варіабельність оцінювача, то, за інших рівних умов, вужчим стає інтервал. NIST описує довірчі межі для середнього саме як спосіб показати, скільки невизначеності містить оцінка популяційного середнього.


Водночас CI не є повним каталогом усіх невідомих. Він не виправляє селекційне зміщення, неуспішну рандомізацію, конфаундинг, погану операціоналізацію конструкта, ненадійний інструмент, систематичну похибку вимірювання, неправильно задану модель, невраховану кластеризацію чи вибіркове звітування. Можна отримати дуже вузький інтервал навколо систематично зміщеної оцінки.


Чому 95% належить процедурі, а не конкретному інтервалу


Уявімо популяцію з фіксованим, але невідомим середнім μ. Ми випадково беремо вибірку, обчислюємо середнє та 95% CI. Потім повертаємося на початок, беремо нову вибірку такого самого розміру й повторюємо процедуру тисячі разів. Межі інтервалу щоразу будуть іншими, бо дані змінюються від вибірки до вибірки. Сам μ у цій частотній моделі залишається фіксованим.


Якщо процедура відкалібрована правильно, приблизно 95% отриманих інтервалів накриють μ, а приблизно 5% — ні. Саме це є частотою покриття. NIST формулює 95% рівень довіри через багаторазове вибирання з тієї самої популяції.


Коли ми вже побачили один інтервал, наприклад [1,1; 7,3], випадковість меж реалізувалася. У класичній частотній логіці немає розподілу ймовірності для фіксованого істинного параметра тільки через те, що інтервал має мітку 95%. Огляд Morey та співавторів називає змішування довгострокової властивості процедури з ймовірністю конкретного інтервалу фундаментальною помилкою інтерпретації CI.


Що означає «невизначеність оцінки»


Невизначеність оцінки — це не сумнів у тому, чи правильно калькулятор виконав арифметику. Це відображення того, що обмежені дані не визначають невідомий параметр з нескінченною точністю. Дві випадкові вибірки з однієї популяції не дають абсолютно однакових середніх, кореляцій або коефіцієнтів регресії.


У звичайних гладких моделях ширший CI сигналізує про більшу статистичну невизначеність процедури, а вужчий — про більшу точність оцінювання за цією моделлю. Але межі не треба перетворювати на шкалу постфактумної «правдоподібності»: частотний CI сам по собі не каже, що значення в центрі інтервалу «ймовірніше» за значення біля краю або що всі значення всередині однаково правдоподібні. На цю пастку окремо вказує Morey та співавтори.


Тому найкраще читати інтервал як властивість конкретної статистичної процедури та як діапазон оцінок, який допомагає побачити масштаб невизначеності, не приписуючи йому значень, яких метод не гарантує. У прикладній роботі корисно запитувати не тільки «чи входить нуль», а й «які розміри ефекту охоплює інтервал і чи змінюють вони практичний висновок?»


Як будують довірчий інтервал: оцінка ± критичне значення × стандартна похибка


Для багатьох знайомих симетричних інтервалів корисна загальна схема: точкова оцінка ± критичне значення × стандартна похибка. Але це схема, а не універсальна формула для всіх параметрів. Критичне значення, спосіб оцінки стандартної похибки та навіть форма інтервалу залежать від моделі, розподілу, параметра й методу.


Для середнього нормальної популяції з невідомим стандартним відхиленням класичний двобічний інтервал має вигляд x̄ ± t × s/√n. Тут x̄ — вибіркове середнє, s — вибіркове стандартне відхилення, n — розмір вибірки, а t — критичне значення розподілу Стьюдента з відповідними ступенями свободи. Формулу й логіку такого інтервалу наводить NIST.


Число 1,96 часто бачимо у великих вибірках або формулах, що спираються на стандартний нормальний розподіл для 95% двобічного інтервалу. Воно не є універсальною магічною константою CI. Для малого n при оцінюванні середнього з невідомою дисперсією t-критичне значення більше за 1,96; для пропорцій, логістичних моделей, відношень ризиків, кореляцій, складних дизайнів або bootstrap-процедур межі обчислюють інакше.


Стандартна похибка не дорівнює стандартній похибці вимірювання


Абревіатура SE у статистичному CI зазвичай означає standard error — стандартну похибку оцінювача, тобто масштаб вибіркової мінливості статистики. Вона відповідає на запитання: наскільки змінювалася б наша оцінка параметра між повторними вибірками за моделлю.


SEM у психометрії — standard error of measurement, стандартна похибка вимірювання — відповідає на інше запитання: наскільки неточним може бути індивідуальний тестовий бал через похибку вимірювання. Це принципово різні джерела невизначеності. Детально це розібрано у статті «Стандартна похибка вимірювання (SEM)».


Українське професійне поле справді використовує словосполучення «довірчий інтервал» і для інтервалів навколо індивідуальних тестових результатів; такий приклад містить глосарій Всеукраїнської психодіагностичної асоціації. У цій статті канонічний intent інший: частотний confidence interval для статистичної оцінки параметра. Змішувати ці дві задачі не варто.


Від чого залежить ширина 95% CI


Розмір вибірки. У простому випадку середнього стандартна похибка має компонент s/√n, тому зі зростанням n інтервал зазвичай звужується. Подвоєння вибірки не означає подвоєння точності: щоб приблизно вдвічі зменшити стандартну похибку за інших рівних умов, часто потрібно приблизно вчетверо збільшити n. NIST показує залежність ширини CI середнього від √n.


Варіабельність даних. За однакового n більш мінливі дані дають більшу стандартну похибку й ширший інтервал. Для середнього NIST прямо показує: більший вибірковий SD розширює CI. Але для інших оцінювачів залежність може бути складнішою.


Рівень довіри. За тих самих даних 99% CI ширший за 95% CI, а 90% CI вужчий. Вищий рівень довіри вимагає процедури, яка в довгому повторенні рідше пропускає істинний параметр, і це зазвичай оплачується ширшими межами.


Дизайн та ефективна кількість інформації. Сто незалежних спостережень і сто сильно залежних повторних вимірювань не містять однакової статистичної інформації. Кластеризація, серійна кореляція, повторні вимірювання, ваги, стратифікація та складний дизайн можуть змінити стандартну похибку. Ігнорування залежності часто робить CI штучно вузьким.


Модель і метод обчислення. Wald-інтервал, профільний likelihood CI, bootstrap CI, exact/score-інтервал або інтервал на трансформованій шкалі можуть мати різні межі на тих самих даних. Саме тому недостатньо написати лише «95% CI» у складному аналізі — метод його отримання має бути зрозумілим і відтворюваним.


Чому 95%, а не 90% або 99%


95% стало науковою конвенцією, а не природним законом. Воно відповідає α = 0,05 для пов’язаного двобічного частотного тесту в стандартних умовах, але інший рівень довіри може бути доречним залежно від задачі. NIST зазначає, що на практиці часто використовують 90%, 95% і 99% інтервали, причому 95% — найпоширеніший.


Вибір рівня довіри має бути пов’язаний із ціною помилки й дослідницькою метою, а не з бажанням «отримати значущість». Якщо рівень змінюють після перегляду результатів, щоб інтервал перестав перетинати нуль або одиницю, це перетворює інтервальний аналіз на ще одну форму результат-залежного рішення.


Як читати CI для різних типів ефектів


Середнє та різниця середніх


Для середнього CI оцінює невизначеність навколо популяційного середнього, а не розкид індивідуальних спостережень. Для різниці середніх нуль зазвичай є точкою відсутності різниці. Наприклад, різниця 3,0 бала з 95% CI [1,2; 4,8] не лише вказує, що нуль не входить до стандартного двобічного інтервалу, а й показує діапазон величин ефекту, який треба порівняти з предметно важливою величиною.


Кореляція


Для коефіцієнта кореляції нуль означає відсутність лінійної кореляції, але CI кореляції не завжди коректно будувати просто як r ± 1,96 × SE на сирій шкалі. Оскільки r обмежений від −1 до +1 і його вибірковий розподіл може бути асиметричним, часто застосовують перетворення Фішера або інші спеціалізовані методи.


Відношення шансів і відносний ризик


Для odds ratio та risk ratio точкою відсутності асоціації є 1, а не 0. Наприклад, OR = 1,8 з 95% CI [1,2; 2,7] читають зовсім інакше, ніж різницю середніх 1,8 [1,2; 2,7]. Масштаб і нульова точка параметра мають значення.


Пропорція


Для частки або ймовірності межі мають поважати природний діапазон від 0 до 1. Простий Wald-інтервал p̂ ± 1,96 × SE може мати погане покриття, особливо за малого n або коли p близьке до 0 чи 1. NIST описує Wilson та інші інтервали для пропорцій і прямо застерігає, що проста нормальна апроксимація має слабші властивості покриття в проблемних режимах.


Довірчий інтервал і p-value


Для узгодженого двобічного тесту одного параметра на рівні α = 0,05 і відповідного 95% CI існує тісний зв’язок: якщо нульове значення параметра лежить поза інтервалом, відповідний тест зазвичай відхиляє точкову нульову гіпотезу на рівні 0,05; якщо нульове значення всередині, не відхиляє. Для середнього це показано в NIST.


Це не універсальна ліцензія замінити будь-який p-value оглядом будь-якого CI. Однобічні й двобічні процедури, поправки на множинні порівняння, складні моделі, різні оцінювачі дисперсії, профільні або bootstrap-інтервали можуть не збігатися з тестом, якщо вони побудовані за іншими правилами.


Головне — не зводити CI до нового способу полювання на поріг 0,05. Greenland та співавтори показують, що дихотомізація статистичної інформації створює ті самі помилки інтерпретації, які виникають при механічному читанні p-value.


Статистична значущість не дорівнює практичній або клінічній важливості


Уявімо, що дуже велике дослідження оцінює різницю 0,20 бала з 95% CI [0,05; 0,35]. Нуль не входить до інтервалу, але це ще не робить ефект важливим. Якщо зміна, яка має практичне значення, починається лише з 2 балів, увесь інтервал може лежати в зоні тривіальних ефектів.


Зворотна ситуація: оцінка 2,5 бала з 95% CI [−0,4; 5,4] не дає стандартної двобічної «статистичної значущості» на рівні 0,05, але інтервал охоплює як майже нульовий, так і потенційно важливий ефект. Тут коректний висновок — дані ще недостатньо точні, щоб розрізнити ці можливості, а не «ефекту немає».


У психології це особливо важливо: шкала може мати одиниці, для яких один пункт практично нічого не означає або, навпаки, невелика зміна є суттєвою. CI треба співвідносити з визначеною предметною межею важливості, а її обґрунтування має бути незалежним від того, де опинився статистичний інтервал.


CI не показує, де лежать 95% індивідуальних спостережень


95% CI для середнього і 95-відсотковий діапазон індивідуальних значень — різні речі. Якщо середній показник оцінено дуже точно, CI середнього може бути вузьким навіть тоді, коли індивідуальні значення розкидані дуже широко. Довірчий інтервал відповідає на запитання про невизначеність параметра; розподіл даних відповідає на запитання про варіативність спостережень.


Наприклад, у великій вибірці середній час реакції може бути 500 мс з 95% CI [496; 504], хоча більшість індивідуальних реакцій розташована в набагато ширшому діапазоні. Інтервал у 8 мс не означає, що 95% людей реагують між 496 і 504 мс.


Довірчий інтервал не дорівнює prediction interval


Confidence interval навколо середнього або іншого параметра оцінює невизначеність параметра. Prediction interval прогнозує, де може опинитися нове майбутнє спостереження або майбутній результат. У простих моделях прогностичний інтервал зазвичай ширший, бо враховує не тільки невизначеність оцінки середнього, а й природну варіабельність індивідуальних спостережень.


Це розрізнення критичне в практичній психології. Вузький CI для середнього ефекту групи не означає, що результат кожної конкретної людини буде близьким до середнього. Групова точність оцінки не перетворюється автоматично на точний індивідуальний прогноз.


Довірчий інтервал не дорівнює інтервалу невизначеності індивідуального тестового бала


Психологічний тест створює ще один рівень невизначеності: сам індивідуальний бал виміряний з похибкою. Інтервал навколо такого бала може будуватися на основі стандартної похибки вимірювання, conditional SEM або іншої психометричної моделі. Це не той самий об’єкт, що 95% CI навколо середнього групи чи коефіцієнта регресії.


Тому фраза «результат тесту 70, 95% CI 62–78» вимагає пояснення, який саме інтервал мається на увазі, яка модель похибки використана й що є цільовою величиною. Без цього однакова назва «довірчий інтервал» приховує різні статистичні задачі.


Частотний CI і байєсівський credible interval — різні інтервали


Байєсівський credible interval будується в іншій логіці. Після поєднання апріорного розподілу з функцією правдоподібності даних отримують апостеріорний розподіл параметра. 95% credible interval може бути визначений так, щоб апостеріорна ймовірність параметра всередині інтервалу дорівнювала 95% — за конкретної моделі та prior.


Саме тут ймовірнісне твердження про параметр є частиною математичної рамки. Огляд Hespanhol та співавторів детально порівнює frequentist confidence intervals і Bayesian credible intervals. Їх не слід називати взаємозамінними лише тому, що обидва можуть мати межі та число 95%.


Припущення: коли номінальний 95% CI може мати не 95% фактичного покриття


Позначка «95%» є гарантією лише настільки, наскільки процедура справді має потрібні властивості в умовах, де її застосовано. Якщо метод виведено для незалежних нормально розподілених помилок, а дані мають сильну залежність, важкі хвости, неправильну моделі дисперсії або складний відбір, фактичне покриття може відрізнятися від номінального.


Випадкова вибірка і репрезентативність — також не одне й те саме. CI може коректно описувати вибіркову невизначеність у межах моделі, але не компенсувати систематичну помилку охоплення популяції. Якщо онлайн-опитування добровольців систематично пропускає важливі групи, збільшення n може зробити інтервал дуже вузьким навколо зміщеної оцінки.


У причинних дослідженнях CI для коефіцієнта моделі не доводить причинність. Він описує невизначеність оцінки за заданою моделлю. Конфундинг, зворотна причинність, селекція та зміщення вимірювання залишаються окремими загрозами.


Тому хороша практика — читати CI разом із дизайном, контролем якості, пропущеними даними, способом обчислення SE, моделлю, перевірками припущень та аналізами чутливості. Сам інтервал не може бути сильнішим за дослідницьку конструкцію, з якої він отриманий.


Bootstrap CI: корисний інструмент, але не одна універсальна процедура


Bootstrap оцінює вибіркову невизначеність через повторне ресемплювання спостережених даних. Це особливо корисно для статистик, аналітичний розподіл яких складно отримати. NIST прямо вказує bootstrap як один зі способів побудови інтервалів для оцінювачів, де класичні формули складні.


Однак «bootstrap CI» не є одним-єдиним методом. Percentile, basic, studentized та BCa-інтервали мають різні властивості. За малого n, сильного зміщення, залежних даних або невдалого ресемплювання bootstrap може давати погане покриття. У звіті варто називати конкретну bootstrap-процедуру, кількість ресемплів і спосіб урахування структури даних.


Чому перетин двох 95% CI не є тестом різниці


Ще одна популярна помилка — дивитися на два окремі 95% CI й робити висновок про статистичну різницю лише за їхнім перекриттям. Два 95% інтервали можуть частково перекриватися, а безпосередній тест різниці між оцінками все одно давати p < 0,05. Greenland та співавтори наводять це як окрему типову помилку.


Для порівняння двох груп або двох ефектів треба оцінювати саму різницю між ними та її SE/CI з урахуванням коваріації й дизайну. Візуальний зазор між двома окремими інтервалами не замінює такого аналізу.


Чому значення всередині CI не є однаково ймовірними


Частотний CI не є апостеріорний розподілом. Він не присвоює значенням усередині інтервалу ймовірності. Тому з 95% CI [1; 9] не випливає, що 5 «найімовірніше» лише через те, що воно в центрі, що 1 і 9 мають однакову підтримку або що 0,99 неможливе, бо лежить на соту поза межею.


У регулярних моделях профіль likelihood, p-value function, Bayesian posterior або інші повніші представлення можуть дати більше інформації про те, як дані розрізняють різні значення параметра. Звичайний CI — стисле інтервальне представлення, а не повна карта невизначеності.


Приклад: як читати 95% CI без дихотомії


Припустімо, у дослідженні середня різниця часу виконання когнітивного завдання між двома умовами становить −24 мс, 95% CI [−41; −7]. Точкова оцінка каже, що за вибіркою друга умова пов’язана з коротшим часом приблизно на 24 мс. Інтервал показує масштаб невизначеності цієї оцінки за використаної моделі.


Оскільки 0 не входить до цього 95% CI, відповідний узгоджений двобічний тест нульової різниці за стандартних умов дав би p < 0,05. Але змістовий висновок на цьому не закінчується. Треба запитати, чи 7 мс, 24 мс і 41 мс мають практичне значення; чи дизайн дозволяє причинну інтерпретацію; чи немає систематичного bias; чи обґрунтована модель; чи ефект відтворюється.


Якби оцінка була −24 мс, 95% CI [−55; 7], правильний опис був би не «різниці немає». Дані сумісні з широким діапазоном, що включає і невелику зміну протилежного знака, і помітне скорочення часу. Це сигнал недостатньої точності для вузького висновку.


Як повідомляти довірчий інтервал у психологічному дослідженні


Мінімально корисне повідомлення містить точкову оцінку, рівень довіри, нижню й верхню межі та одиниці або шкалу. Наприклад: «середня різниця = 3,4 бала, 95% ДІ [1,2; 5,6]» або «r = 0,31, 95% ДІ [0,18; 0,43]».


Для складнішого аналізу слід також вказати метод побудови CI: робастні стандартні похибки, кластер-робастні SE, profile likelihood, bootstrap BCa, Fisher z для кореляції, Wilson для пропорції тощо. Sawada, Huang і Koryakov звертають увагу, що навіть навчальні джерела з психології можуть описувати різні способи обчислення CI, тому прозоре зазначення методу полегшує відтворення й порівняння результатів.


Сучасні рекомендації зі статистичного звітування в психології також наголошують на потребі уникати механічних інтерпретацій. Schubert та співавтори у 2025 році окремо назвали твердження про «95% імовірність параметра в конкретному frequentist CI» однією з поширених помилок.


Найтиповіші помилки інтерпретації


1. «95% CI означає 95% імовірність, що істинне значення всередині». Для класичного frequentist CI — ні. 95% описує довгострокове покриття процедури.


2. «95% спостережень лежать усередині CI». Ні. CI для параметра не є інтервалом розсіювання індивідуальних даних.


3. «Усі значення всередині CI однаково ймовірні». Ні. Звичайний frequentist CI не задає ймовірності параметрів.


4. «Значення одразу за межею CI неможливе, а значення одразу всередині — прийнятне». Межа не є онтологічним розривом. Це результат обраної процедури й рівня довіри.


5. «Якщо CI включає нуль, ефекту немає». Ні. Це означає, що відповідна точкова нульова величина не виключена цією процедурою на заданому рівні; інтервал може також включати ефекти, які були б практично важливими.


6. «Якщо CI не включає нуль, ефект важливий». Ні. Статистичне виключення нуля не встановлює клінічної, практичної або теоретичної значущості.


7. «Якщо два 95% CI перекриваються, між групами немає статистично значущої різниці». Ні. Потрібен CI або тест саме для різниці між оцінками.


8. «Чим вужчий CI, тим дослідження кращої якості». Ні. Вузькість описує один аспект статистичної процедури; великий систематичний bias може залишити інтервал вузьким.


9. «Будь-який 95% CI має однакове фактичне покриття». Ні. Coverage залежить від методу, вибірки, моделі й виконання припущень; деякі наближення працюють погано в окремих режимах.


10. «CI замінює аналіз дизайну». Ні. Інтервал не виправляє нерандомний відбір, confounding, пропущені дані, невдалий інструмент чи селективне звітування.


Довірчий інтервал у метааналізі


У метааналізі 95% CI навколо об’єднаного ефекту описує невизначеність оцінки середнього об’єднаного ефекту за конкретною метааналітичною моделлю. Він не відповідає автоматично на запитання, який ефект очікувати в новому дослідженні, особливо за істотної міждослідницької гетерогенності.


Для питання про діапазон можливих істинних ефектів у нових подібних дослідженнях може бути потрібен прогностичний інтервал (prediction interval). Тому вузький CI об’єднаного ефекту не слід читати як доказ однакового ефекту в усіх популяціях, умовах і реалізаціях втручання.


Довірчі інтервали й психологічне вимірювання


У психометрії числа виникають на кількох рівнях: індивідуальні тестові бали, нормативні перетворення, оцінки надійності, параметри факторних моделей, коефіцієнти валідності, групові середні, розміри ефекту. На кожному рівні «невизначеність» може мати інше джерело й інший математичний інструмент.


Наприклад, CI для коефіцієнта надійності оцінює вибіркову невизначеність самого коефіцієнта. SEM індивідуального бала оцінює похибку вимірювання в одиницях шкали. CI навколо середньої різниці між групами оцінює невизначеність ефекту. Ці величини пов’язані, але не взаємозамінні.


FAQ


Що означає запис «95% CI [2,1; 5,7]»?


Це означає, що нижня межа інтервалу дорівнює 2,1, верхня — 5,7, а інтервал побудовано процедурою з номінальним 95-відсотковим покриттям. Для коректної інтерпретації треба знати, який параметр оцінюється, яким методом побудовано CI і які припущення застосовано.


Чому не можна просто сказати «95% шансів, що істина всередині»?


Тому що у частотній статистичній рамці невідомий параметр вважають фіксованим, а випадковими до спостереження є дані та межі інтервалу. Ймовірність 95% належить до довгострокової роботи процедури. Якщо потрібна апостеріорна ймовірність параметра в інтервалі, це інша, байєсівська постановка.


Що краще: 95% чи 99% CI?


Немає універсально «кращого» рівня. 99% інтервал зазвичай ширший і має вище номінальне покриття; 90% — вужчий і має нижче. Рівень обирають відповідно до планом статистичного висновування і ціни помилок, бажано до перегляду результатів.


Чи залежить CI від розміру вибірки?


Так. За інших рівних умов більша вибірка зазвичай зменшує стандартну похибку й звужує CI. Але n не усуває систематичний bias і не робить автоматично коректними припущення моделі.


Чи може 95% CI бути асиметричним?


Так. Симетрія навколо точкової оцінки властива не всім методам. Інтервали для пропорцій, odds ratio, variance components, профільного likelihood, bootstrap або параметрів після нелінійного перетворення часто асиметричні на шкалі, яку бачить читач.


Що означає, якщо 95% CI містить нуль?


Для параметра, де нуль є точкою відсутності ефекту, це означає, що нуль не виключений відповідною двобічною 95% процедурою. Це не доводить відсутність ефекту. Треба подивитися, які ще значення містить інтервал і чи включає він предметно важливі ефекти.


Що означає, якщо 95% CI для OR або RR містить 1?


Для відношення шансів і відносного ризику нейтральне значення — 1. Якщо відповідний 95% CI містить 1, стандартний узгоджений двобічний тест не виключає відсутність відносної асоціації на рівні 0,05.


Чи можна визначити статистичну значущість за перекриттям двох 95% CI?


Не надійно. Часткове перекриття двох окремих 95% CI може співіснувати зі статистично значущою різницею між оцінками. Потрібен аналіз самої різниці.


Чим CI відрізняється від margin of error?


Margin of error зазвичай означає відстань від точкової оцінки до межі симетричного інтервалу, наприклад критичне значення × SE. У записі 50 ± 3 число 3 є margin of error, а сам CI — [47; 53]. Для асиметричних інтервалів одна спільна «похибка ±» може бути непридатною.


Чи може CI бути дуже вузьким і водночас неправильним?


Так. Якщо оцінка систематично зміщена або стандартна похибка занижена через неправильну модель, порушення незалежності чи селекцію, вузький CI може створювати хибне відчуття точності. Якість дизайну й адекватність моделі залишаються окремою частиною доказовості.


Головне, що варто запам’ятати


95% довірчий інтервал — це не «95% шансів, що істина лежить між двома числами» у буквальному frequentist сенсі. Це інтервал, створений процедурою з приблизно 95-відсотковим довгостроковим покриттям за заданих припущень. Він додає до точкової оцінки інформацію про статистичну невизначеність і допомагає бачити не лише знак ефекту, а й діапазон його можливих масштабів.


Сильна інтерпретація CI завжди тримає разом п’ять речей: що саме є параметром; як отримано точкову оцінку; яким методом побудовано інтервал; які припущення підтримують потрібну частоту покриття; які величини мають реальне психологічне, практичне або клінічне значення. Саме тоді CI стає інструментом доказовості, а не ще одним числом поруч із p-value.


Пов’язані статті


Психометрія: що це, що вона вимірює і як оцінюють якість психологічних тестів — ширший контекст психологічного вимірювання, надійності, валідності та інтерпретації числових результатів.


Похибка вимірювання в психології: випадкова, систематична і чому один бал не є абсолютно точним — про джерела вимірювальної невизначеності та відмінність випадкової похибки від систематичного зміщення.


Стандартна похибка вимірювання (SEM): як оцінити невизначеність індивідуального тестового бала — про інтервали навколо індивідуального тестового бала й принципову відмінність psychometric SEM від standard error статистичної оцінки.


Статистична потужність: що це, як залежить від розміру ефекту, вибірки й рівня значущості — як планують здатність дослідження виявляти задані ефекти та чому після отримання даних power не замінює оцінку ефекту й довірчий інтервал.


Джерела


Appelbaum, M., Cooper, H., Kline, R. B., Mayo-Wilson, E., Nezu, A. M., & Rao, S. M. (2018). Journal Article Reporting Standards for Quantitative Research in Psychology: The APA Publications and Communications Board Task Force Report. American Psychologist, 73(1), 3–25.


Greenland, S., Senn, S. J., Rothman, K. J., Carlin, J. B., Poole, C., Goodman, S. N., & Altman, D. G. (2016). Statistical tests, P values, confidence intervals, and power: a guide to misinterpretations. European Journal of Epidemiology, 31, 337–350.


Hespanhol, L., Vallio, C. S., Costa, L. M., & Saragiotto, B. T. (2019). Understanding and interpreting confidence and credible intervals around effect estimates. Brazilian Journal of Physical Therapy, 23(4), 290–301.


Morey, R. D., Hoekstra, R., Rouder, J. N., Lee, M. D., & Wagenmakers, E.-J. (2016). The fallacy of placing confidence in confidence intervals. Psychonomic Bulletin & Review, 23, 103–123.


NIST/SEMATECH. 1.3.5.2. Confidence Limits for the Mean. e-Handbook of Statistical Methods.


NIST/SEMATECH. 7.1.4. What are confidence intervals?. e-Handbook of Statistical Methods.


NIST/SEMATECH. 7.2.4.1. Confidence intervals. e-Handbook of Statistical Methods.


Sawada, T., Huang, L., & Koryakov, O. Y. (2022). Some misunderstandings in psychology about confidence intervals. Frontiers in Psychology, 13, 948423.


Schubert, A.-L., Steinhilber, M., Kang, H., & Quintana, D. S. (2025). Improving statistical reporting in psychology. Communications Psychology, 3, 156.

 
 
bottom of page