top of page

Психологічна енкциклопедія

Ризик упередження в дослідженнях: як оцінюють систематичні помилки дизайну, проведення й звітування

23 вер.
Читати 17 хв

Автор: Український психологічний ХАБ · Опубліковано: 23 вересня 2026 · Редакційна політика


Ризик упередження в дослідженнях, або risk of bias, — це ймовірність того, що систематичні особливості дизайну, проведення, вимірювання, аналізу чи вибору результату змістили оцінку ефекту або інший дослідницький результат від того значення, яке ми хотіли оцінити. У сучасній методології упередження розуміють як систематичну помилку, а не як випадковий шум. Саме тому невелика вибірка може дати дуже неточний, але відносно неупереджений результат, тоді як велике дослідження здатне бути статистично точним і водночас систематично зміщеним. Cochrane Handbook прямо розділяє bias і imprecision та наголошує, що оцінюють саме ризик: у конкретному дослідженні зазвичай неможливо знати точну величину зміщення.


Українською в академічних і клінічних текстах трапляються форми «ризик упередження», «ризик упередженості» та «ризик систематичної помилки». У цій статті основним терміном є «ризик упередження», а «систематична помилка» використовується для пояснення статистичного змісту поняття. Йдеться не про особисту нечесність дослідника і не про когнітивне упередження окремої людини. Дослідження може мати високий risk of bias навіть тоді, коли команда діяла добросовісно, якщо сам спосіб формування груп, втрати даних, вимірювання або вибору аналізу створює передбачуване зміщення.


Ключова ідея сучасних інструментів полягає в тому, що risk of bias — характеристика не «репутації статті» і навіть не завжди дослідження загалом. У RoB 2 та ROBINS-I оцінювання прив’язують до конкретного результату: певного outcome, часу вимірювання, порівняння та оцінки ефекту. Одне й те саме випробування може мати низький ризик упередження для одного результату й високий для іншого. Cochrane Chapter 8 формулює RoB 2 саме як рамку для оцінювання risk of bias в одному конкретному результаті рандомізованого випробування.


Що означає «систематична помилка»


Систематична помилка виникає тоді, коли механізм дослідження послідовно тягне результат у певний бік або змінює його розподіл не лише через випадкове коливання вибірки. Уявімо ідеальну серію повторень одного дослідження. За чистої випадкової помилки окремі оцінки коливатимуться навколо правильного значення: одні будуть завищені, інші занижені. За систематичного упередження середнє цих повторень теж буде зміщене. Саме це відрізняє bias від sampling error.


Джерело зміщення може з’явитися ще до першого вимірювання. Якщо розподіл учасників між групами можна передбачити, дослідники або учасники можуть несвідомо впливати на те, хто потрапляє до якої групи. У нерандомізованому дослідженні групи можуть від початку різнитися за прогнозом, мотивацією, тяжкістю стану чи доступом до допомоги. Після початку втручання виникають інші шляхи: додаткові процедури, різне очікування учасників, нерівномірні втрати зі спостереження, знання оцінювачем групи учасника, вибір одного з кількох допустимих аналізів.


Емпіричні метаепідеміологічні роботи показують, що такі ознаки справді пов’язані з відмінностями в оцінках ефекту. У великому ROBES-дослідженні 2443 рандомізованих випробувань у 228 метааналізах високий або незрозумілий ризик за окремими доменами рандомізації, приховування розподілу та засліплення в середньому асоціювався з більш вираженими оцінками ефекту. Savović та співавт., 2018. Це не означає, що будь-яке незасліплене чи недосконало описане дослідження обов’язково помиляється в одному напрямку; це означає, що відповідний механізм зміщення достатньо правдоподібний, щоб впливати на довіру до результату.


Risk of bias — це не загальна «оцінка якості статті»


Старі підходи часто намагалися підсумувати методологічну якість одним балом: додати пункти чекліста і назвати дослідження «високоякісним» або «низькоякісним». Сучасні domain-based інструменти відходять від такої логіки. Причина проста: різні недоліки мають різний причинний зв’язок із результатом. Відсутність розрахунку розміру вибірки може впливати на точність, але сама по собі не створює того самого виду systematic bias, що передбачуваний розподіл або вибір результату після перегляду даних.


Тому Cochrane рекомендує оцінювати конкретні домени, відповідати на signalling questions і давати аргументоване судження, а не просто складати очки. Розділ 7 Cochrane Handbook окремо застерігає від змішування внутрішньої валідності з ширшим поняттям methodological quality. Високий risk of bias означає проблему з довірою до конкретного результату через можливе систематичне зміщення; він не є універсальним рейтингом усього дослідницького проєкту.


Що risk of bias не означає


Risk of bias ≠ неточність


Неточність, або imprecision, стосується випадкової невизначеності оцінки й зазвичай проявляється широким довірчим інтервалом. Її часто зменшує більша кількість учасників або подій. Bias так не виправляється: тисяча додаткових спостережень може зробити систематично зміщену оцінку ще точнішою навколо неправильного значення. У GRADE risk of bias і imprecision тому є окремими доменами певності доказів. Cochrane Chapter 14 розглядає їх незалежно разом із inconsistency, indirectness і publication bias.


Risk of bias ≠ погане звітування


Неповний опис методів у статті ускладнює оцінювання і може змусити рецензента залишити занепокоєння, але reporting quality та risk of bias не тотожні. Добре описане дослідження може чесно повідомити серйозний ризик зміщення; погано описане може бути проведене краще, ніж це видно з публікації. Саме тому оцінювачі шукають не тільки журнальну статтю, а й протокол, реєстраційний запис, план статистичного аналізу, додатки та інші доступні матеріали.


Risk of bias ≠ зовнішня валідність


Внутрішня валідність питає, чи правдоподібно результат оцінює заявлений ефект у дослідженій ситуації. Зовнішня валідність або applicability питає, наскільки цей результат переноситься на інші групи, контексти чи практичні умови. Дослідження може бути майже без систематичної помилки всередині дуже вузької вибірки, але мати обмежену застосовність. І навпаки, «реалістична» вибірка не компенсує серйозне внутрішнє зміщення.



Ризик упередження окремого результату і bias через missing evidence діють на різних рівнях. RoB 2 має домен «вибір повідомленого результату»: дослідження виміряло кілька варіантів outcome, часових точок або аналізів і подало лише один. Але якщо весь результат або все дослідження взагалі не стало доступним через характер знахідок, проблема переходить на рівень синтезу. Cochrane Chapter 13 описує risk of bias due to missing evidence, куди входять механізми, близькі до publication bias.


Risk of bias ≠ статистична значущість


p-value не говорить, чи дослідження систематично зміщене. Статистично значущий результат може походити з дослідження з високим risk of bias, а статистично незначущий — з добре спланованого, але неточного дослідження. Сам факт перетину порога p < 0,05 не підтверджує причинність, валідність вимірювання, відсутність selective reporting або практичну важливість ефекту.


На якому рівні оцінюють ризик упередження


Для сучасного оцінювання важливо точно назвати «об’єкт судження». У рандомізованому випробуванні це часто не стаття і не випробування в цілому, а оцінка ефекту певного втручання порівняно з певним компаратором для конкретного outcome у конкретній часовій точці. Якщо депресивні симптоми оцінювали через 8 і 24 тижні двома шкалами та кількома способами аналізу, risk of bias для цих результатів може різнитися.


Це особливо важливо для психології, де один проєкт нерідко має багато самозвітних шкал, підшкал, повторних вимірювань і альтернативних аналітичних рішень. Чим більше допустимих способів визначити outcome або модель, тим важливіше зіставити публікацію з протоколом і пререєстрованим планом. Пререєстрація дослідження може зменшити неоднозначність щодо того, що планувалося заздалегідь, але сама по собі не робить вимірювання валідним і не гарантує низького risk of bias.


RoB 2: як оцінюють рандомізовані випробування


Для рандомізованих випробувань Cochrane використовує revised Risk of Bias tool — RoB 2. Поточна основна версія для індивідуально рандомізованих паралельних випробувань датована 22 серпня 2019 року; окремі версії існують для cluster-randomized і crossover designs. Офіційна сторінка RoB 2 і методологічна стаття Sterne та співавт., 2019 описують інструмент як оцінювання конкретного результату, а не загального «рейтингу дослідження».


1. Упередження, що виникає з процесу рандомізації


Перший домен перевіряє, чи справді послідовність розподілу була випадковою, чи була вона прихована до включення учасника і чи є базові дисбаланси, які натякають на проблему з рандомізацією. Слово «рандомізоване» в заголовку недостатнє. Наприклад, чергування, дата народження або день тижня є передбачуваними правилами й не дають того самого захисту від selection bias, що коректно прихована випадкова послідовність.


2. Упередження через відхилення від запланованих втручань


Другий домен стосується того, що сталося після розподілу: чи знання про групу спричинило відхилення від запланованого лікування, чи ці відхилення були збалансованими, і чи аналіз відповідає ефекту, який дослідження прагне оцінити. Тут важливо розрізняти estimand: ефект призначення на втручання та ефект фактичного дотримання можуть вимагати різної логіки оцінювання.


3. Упередження через відсутні дані про результат


Третій домен не зводиться до простого порога «менше 20% втрат — нормально». Значення має механізм missingness: чому даних немає, чи пов’язана відсутність із істинним outcome, чи відрізняються причини між групами, наскільки результати чутливі до правдоподібних припущень. Навіть невелика частка відсутніх даних може бути проблемною, якщо вона концентрується серед учасників із певним прогнозом.


Для психологічних втручань це не теоретична дрібниця. Огляд 182 рандомізованих клінічних випробувань психологічних втручань, опублікований у 2024 році, оцінив 206 із 233 первинних outcomes як такі, що мали високий ризик упередження через missing outcome data за застосованою процедурою. Автори наголосили, що відсутні результати залишаються значущою проблемою. Цю цифру не варто переносити на всю психологію, але вона добре показує, чому сам відсоток attrition не можна ігнорувати.


4. Упередження у вимірюванні результату


Четвертий домен питає, чи метод вимірювання був доречним, чи застосовувався однаково в групах і чи знання про призначене втручання могло впливати на оцінку. Для об’єктивного лабораторного показника й суб’єктивного клінічного рейтингу наслідки відсутності засліплення різні. У психології повне засліплення учасника або терапевта часто неможливе, але це не скасовує можливість засліплювати незалежного outcome assessor там, де результат визначається інтерв’ю або спостереженням.


У 2026 році Sally O’Keeffe проаналізувала 52 RCT психологічних втручань із провідних журналів: 44 повідомляли про засліплених оцінювачів результату, але лише 27 із цих 44 описували процедури підтримання засліплення. Огляд має обмежену вибірку журналів і не оцінює всю психологічну науку, проте демонструє важливу різницю між фразою «assessor was blinded» і достатньою інформацією для судження, чи засліплення могло реально зберігатися.


5. Упередження у виборі повідомленого результату


П’ятий домен перевіряє, чи опублікований результат був обраний із кількох доступних outcome measures, часових точок або статистичних аналізів на підставі того, що виглядало найбільш сприятливо. Тут особливо важливі протокол, registry та statistical analysis plan. Якщо автори мали кілька валідних способів порахувати результат і повідомили лише один без попередньої специфікації, виникає ризик data-dependent selection.


У психотерапевтичній літературі історично знаходили значні проблеми з проспективною реєстрацією і selective outcome reporting. Систематичний огляд Bradley, Rucklidge & Mulder включив 112 RCT 2010–2014 років і виявив, що лише невелика частина була коректно зареєстрована та звітована без ознак selective reporting за критеріями авторів. Bradley et al., 2017. Це історична вибірка, а не оцінка сучасного стану всієї галузі, проте вона пояснює, чому порівняння публікації з планом дослідження стало центральним елементом risk-of-bias appraisal.


RoB 2 формує доменні судження «low risk», «some concerns» або «high risk». Загальне судження не є середнім балом: high risk в одному критичному домені може визначити overall judgment для конкретного результату. Cochrane Chapter 8 також дозволяє оцінювачу відступити від запропонованого алгоритмом судження, але таке рішення потребує явного обґрунтування.


ROBINS-I: нерандомізовані дослідження втручань


Для нерандомізованих досліджень ефектів втручань застосовують іншу причинну логіку. ROBINS-I розглядає спостережуване дослідження як спробу емулювати добре спроєктоване «target trial» — гіпотетичне прагматичне рандомізоване випробування того самого питання. Sterne та співавт., 2016 описали сім доменів класичного ROBINS-I: confounding; selection of participants; classification of interventions; deviations from intended interventions; missing data; measurement of outcomes; selection of the reported result.


Особливість тут у тому, що confounding є не другорядною технічною деталлю, а центральним джерелом упередження. Якщо люди самі обирають терапію або лікар призначає її залежно від тяжкості стану, мотивації чи прогнозу, ці самі фактори можуть впливати на outcome. Статистичне «коригування за коваріатами» допомагає лише тоді, коли важливі confounders правильно визначені, виміряні та адекватно змодельовані; воно не перетворює спостережне дослідження на рандомізоване.


Cochrane рекомендує ще на стадії протоколу визначати важливі confounding domains і co-interventions, а оцінювання проводити для конкретного результату. Chapter 25 підкреслює, що ROBINS-I потребує і методологічної, і предметної експертизи: без знання клінічного чи психологічного контексту неможливо вирішити, які прогностичні фактори реально визначають вибір втручання та результат.


Станом на 23 вересня 2026 року на офіційному сайті доступний ROBINS-I V2 у статусі revised draft, оприлюднений у листопаді 2025 року. Сторінка ROBINS-I V2 прямо зазначає, що версія залишається чернетковою і може змінюватися; серед нововведень є алгоритми, що пов’язують відповіді на signalling questions із запропонованими доменними судженнями. Тому в актуальному матеріалі слід розрізняти established framework ROBINS-I та поточну draft-еволюцію V2.


QUADAS-3: ризик упередження в дослідженнях діагностичної точності


Дослідження діагностичних і скринінгових тестів мають іншу структуру помилок, тому RoB 2 або ROBINS-I не слід механічно переносити на diagnostic accuracy. У лютому 2026 року опубліковано QUADAS-3 — оновлений інструмент для systematic reviews діагностичної точності, який замінив QUADAS-2 як рекомендовану актуальну версію. Whiting та співавт., 2026 описують шість фаз оцінювання і чотири домени risk of bias: Participants, Index Test, Target Condition та Analysis.


QUADAS-3 також окремо оцінює applicability для перших трьох доменів. Це показове розділення: внутрішнє зміщення і відповідність дослідження питанню огляду пов’язані, але не тотожні. Для психологічних screening tools це особливо важливо. Висока diagnostic accuracy в специфічній спеціалізованій клініці не означає автоматично таку саму точність у первинній ланці чи загальній популяції; так само хороший AUC не робить тест універсальним діагностичним інструментом.


Risk of bias у diagnostic accuracy також не треба змішувати з психометричною валідністю шкали. Надійність, construct validity, measurement invariance, культурна адаптація та похибка вимірювання відповідають на інші питання. Скринінгова чутливість і специфічність залежать від reference standard, spectrum of participants, threshold і дизайну дослідження; вони не замінюють доказів того, що інструмент коректно вимірює психологічний конструкт.


Чому не існує одного універсального risk-of-bias чекліста


Механізми упередження залежать від дизайну та causal question. Для RCT вирішальним є, чи захистила рандомізація від систематичних базових відмінностей і що сталося після allocation. Для observational intervention study центральним стає confounding. Для diagnostic accuracy виникають проблеми patient selection, index test, target condition/reference logic та analysis. Для прогнозу, поширеності, exposure studies, qualitative evidence або вимірювальних властивостей потрібні інші design-specific frameworks.


Тому фраза «ми використали один загальний чекліст для всіх включених досліджень» не завжди є перевагою. У сильному систематичному огляді спочатку визначають типи запитань і дизайнів, а вже потім обирають інструмент, який відповідає механізмам можливого зміщення. Якщо огляд включає кілька принципово різних дизайнів, може знадобитися кілька інструментів і окремі правила інтерпретації.


Як проводять якісне оцінювання risk of bias


Крок 1. Визначити точний результат і causal question


Перед чеклістом потрібно сформулювати, який саме ефект або параметр оцінюється. Для втручання це означає population, intervention, comparator, outcome, time point та estimand. Для діагностичного тесту — intended use, population, index test, target condition/reference standard і threshold logic. Невизначене питання робить навіть технічно бездоганний checklist механічною вправою.


Крок 2. Обрати інструмент за дизайном


RoB 2 відповідає на питання про результати рандомізованих випробувань; ROBINS-I — про нерандомізовані ефекти втручань; QUADAS-3 — про diagnostic accuracy. Назва дизайну в статті не завжди достатня: потрібно перевірити, як саме формували групи, коли визначали exposure/intervention, як збирали outcomes і яку causal contrast намагаються оцінити.


Крок 3. Зібрати всі доступні джерела інформації


Оцінювання не повинно обмежуватися PDF статті. Корисні registry entry, protocol, statistical analysis plan, supplementary appendix, попередні звіти, dissertation, regulatory documents або відповіді авторів. Це особливо важливо для домену selective reporting: без документа, створеного до або незалежно від результатів, важко встановити, які outcomes і аналізи були справді заплановані.


Крок 4. Відповісти на signalling questions і записати підставу


Signalling questions не є тестом із магічною правильною сумою балів. Вони дисциплінують причинне міркування: який механізм bias можливий, які факти на нього вказують, чи міг він суттєво вплинути на конкретний result. Якісна таблиця risk of bias містить не лише кольорову позначку, а коротке обґрунтування, яке дозволяє іншому читачеві зрозуміти логіку судження.


Крок 5. Працювати незалежно й калібрувати оцінювачів


Risk-of-bias appraisal містить професійні судження, тому оцінювачі можуть розходитися. Практика незалежного подвійного оцінювання, попереднього calibration exercise та консенсусу з третім рецензентом зменшує випадкову суб’єктивність процедури. Проте високий inter-rater agreement сам по собі ще не гарантує правильності: двоє оцінювачів можуть однаково неправильно трактувати інструмент, якщо не володіють дизайном або предметною областю.


Крок 6. Не перетворювати домени на довільний total score


Складання «1 бал за рандомізацію + 1 за засліплення + 1 за повні дані» створює ілюзію вимірювання єдиної латентної якості. Домени не обов’язково рівноважні й можуть взаємодіяти. Один сильний механізм selection bias здатен бути важливішим для causal estimate, ніж кілька акуратно виконаних другорядних процедур. Сучасні інструменти тому вимагають domain-level judgments та логічного overall judgment, а не арифметики.


Як risk of bias впливає на метааналіз і висновок огляду


Оцінювання risk of bias має сенс лише тоді, коли воно впливає на інтерпретацію. В систематичному огляді автори можуть проводити sensitivity analyses, порівнювати результати досліджень із різним risk of bias, обмежувати певні аналізи більш надійними результатами або пояснювати, чому висновок залишається невизначеним. Не існує універсального правила «просто виключити все high risk»: таке виключення може бути доречним для одного питання й створювати інше selection problem для іншого.


Важливо також не плутати статистичну вагу і методологічну довіру. Стандартний inverse-variance meta-analysis часто дає більшу математичну вагу точнішим результатам, але велике, дуже точне дослідження з серйозним systematic bias не стає методологічно надійним лише через вузький confidence interval. Risk of bias потребує окремого судження та може впливати на аналіз і certainty assessment незалежно від числової ваги.


У GRADE ризик упередження є лише одним із доменів певності сукупності доказів. Після оцінювання окремих результатів оглядач запитує, яка частка інформації для конкретного outcome походить із результатів із низьким risk, some concerns або high risk, і наскільки правдоподібне зміщення може змінити висновок. Поруч окремо оцінюються inconsistency, indirectness, imprecision та missing/publication bias.


PRISMA і risk of bias: різні завдання


PRISMA 2020 — настанова зі звітування систематичних оглядів. Вона вимагає прозоро повідомити, як оцінювали risk of bias і як ці оцінки використовували в синтезі, але PRISMA не є інструментом, який сам оцінює bias первинного дослідження. Page та співавт., 2021 описують 27-item reporting guideline, а не шкалу methodological quality.


Тому формула «огляд відповідає PRISMA, отже дослідження всередині мають низький risk of bias» логічно хибна. Огляд може бути прозоро й повно описаний за PRISMA і водночас чесно показати, що більшість доступних первинних досліджень має серйозні методологічні обмеження. Навпаки, слабке звітування PRISMA ускладнює перевірку огляду, але не дає автоматичного числового висновку про величину bias кожного primary study.


Особливості risk of bias у психологічних дослідженнях


Психологія часто працює з outcomes, які залежать від самозвіту, клінічного інтерв’ю, поведінкової оцінки або інтерпретації спостерігача. Це не робить такі outcomes «поганими»: суб’єктивний досвід може бути саме тим конструктом, який потрібно виміряти. Але джерела bias стають іншими. Очікування учасника, знання про отримане втручання, demand characteristics, взаємодія з терапевтом або знання оцінювача про групу можуть впливати на відповідь сильніше, ніж на автоматичний лабораторний показник.


Метаепідеміологічний systematic review 2016 року показав, що деякі недосконалі характеристики рандомізованих випробувань у середньому асоціювалися із завищенням оцінок втручання, причому для частини механізмів ефект був помітнішим на subjective outcomes. Page/Savović та колеги. Це групове емпіричне спостереження: воно не дозволяє передбачити точний напрямок зміщення в конкретному психологічному RCT, але підтримує причинну увагу до засліплення, allocation та measurement.


У психотерапії учасник зазвичай знає, яку терапію отримує, а терапевт знає, що проводить. Неможливість такого blinding не означає, що дослідження «невалідне». RoB 2 просить розглянути, як знання могло реально впливати на поведінку, co-interventions, deviations або measurement, і які альтернативні safeguards були використані. Саме механізм і конкретний outcome важливіші за формальну галочку «double blind».


Вимірювання теж потребує окремого рівня критики. Низький risk of bias у процедурі RCT не доводить construct validity психологічної шкали. Якщо outcome instrument погано відповідає конструкту, має невідому надійність у цій популяції або невдалу культурну адаптацію, це створює проблему measurement validity, яку не слід ховати під загальним ярликом risk of bias. В окремих дизайнах властивості measurement method можуть входити до bias domain, але психометрична доказовість має власну логіку.


Типові помилки інтерпретації


«Велика вибірка означає низький risk of bias». Ні. Велика вибірка переважно підвищує precision. Якщо assignment, measurement або selection of reported result систематично зміщені, більший N не усуває проблему.


«Randomized controlled trial автоматично має низький risk of bias». Ні. Рандомізація захищає лише за умови належної генерації та приховування послідовності, а після allocation залишаються missing data, deviations, outcome measurement і selective reporting.


«Якщо дослідження не можна засліпити, воно марне». Ні. Важливо оцінити конкретний механізм зміщення, тип outcome та можливі safeguards. Для психотерапії відсутність participant blinding часто неминуча, але blinding independent assessors, стандартизовані процедури або об’єктивні outcomes можуть зменшувати окремі ризики.


«Менше певного відсотка missing data — безпечно». Ні. Не існує універсальної магічної межі. Навіть мала кількість втрат може сильно зміщувати результат, якщо missingness залежить від невиміряного outcome або відрізняється між групами.


«Пререєстрація гарантує відсутність selective reporting». Ні. Вона створює часовий слід плану, але план може бути нечітким, зареєстрованим запізно або зміненим. Потрібно порівняти registry, protocol, analysis plan і publication. Те саме стосується HARKing та p-hacking: open-science practices зменшують простір для прихованих рішень, але не перетворюють дизайн на автоматично безпомилковий.


«PRISMA = low risk of bias». Ні. PRISMA допомагає звітувати systematic review. Risk-of-bias tool оцінює конкретні механізми зміщення в evidence. Це різні рівні методології.


«High risk означає, що результат точно хибний». Ні. Risk of bias — не детектор істини. Судження означає, що існує достатньо правдоподібний механізм systematic error, щоб довіра до оцінки була суттєво знижена. Іноді biased estimate випадково близька до істини; appraisal не може цього знати наперед.


«Low risk означає, що результат істинний і важливий». Ні. Low risk стосується конкретних відомих механізмів внутрішнього bias. Результат може залишатися дуже неточним, непрямим, невідтвореним, клінічно неважливим або залежним від measurement limitations.


Як читачеві швидко перевірити дослідження без повного RoB-інструмента


Повноцінний risk-of-bias assessment потребує навчання та design-specific guidance, але для критичного читання корисно пройти причинний маршрут. Спочатку запитайте: яке точне питання дослідження і який результат я зараз читаю? Хто потрапив до порівнюваних груп і чому? Чи могла процедура розподілу або selection створити систематичні відмінності? Що сталося з учасниками після включення? Скільки outcome data відсутні і чому? Хто вимірював результат і що він знав? Скільки outcome definitions та analyses були доступні? Чи видно план, створений до перегляду результатів?


Далі відокремте чотири запитання, які часто змішують. Перше: чи може estimate бути systematically biased? Друге: наскільки він precise? Третє: чи вимірює outcome те, що нас цікавить? Четверте: чи переноситься результат на потрібну популяцію та практику? Відповіді можуть бути різними. Саме це розділення захищає від спрощеної формули «гарне/погане дослідження».


Нарешті дивіться, як автори синтезу поводяться з оцінками bias. Якщо systematic review намалював traffic-light plot, але не пояснив, як high-risk results вплинули на sensitivity analysis, certainty або conclusion, appraisal може залишитися декоративним. Сильний огляд з’єднує risk-of-bias judgments із реальною інтерпретацією доказів.


Scientific status: що встановлено, а що потребує судження


Встановленим є саме існування систематичних механізмів, через які design і conduct можуть зміщувати estimates, а також потреба оцінювати їх за design-specific domains. RoB 2, ROBINS-I та QUADAS належать до розвинених методологічних frameworks із детальними guidance documents, signalling questions та логікою judgments. Емпіричні meta-epidemiological studies підтримують зв’язок частини design flaws із відмінностями в effect estimates.


Judgment залишається невід’ємною частиною appraisal. Немає алгоритму, який із PDF автоматично обчислює «істинний bias у відсотках». Оцінювач інтерпретує факти з урахуванням causal question, outcome і предметної області. Через це важливі прозорі reasons, незалежне оцінювання та sensitivity analyses. Різниця між structured judgment і довільною думкою полягає саме в тому, що перше підпорядковане явним правилам і доказам.


Preliminary або evolving status потрібно зазначати для конкретних версій інструментів. Наприклад, ROBINS-I V2 станом на вересень 2026 року залишається draft. QUADAS-3, навпаки, вже опублікований у 2026 році як revised tool. Така версійність має значення: у методологічній статті недостатньо просто написати назву інструмента без уточнення, яку версію застосовували.


FAQ


Чи є risk of bias синонімом «систематичної помилки»?


Bias — це систематичне відхилення результату від цільової величини. Risk of bias — оцінка того, наскільки правдоподібно, що такий механізм зміщення вплинув на конкретний результат. Українська формула «ризик систематичної помилки» передає зміст, але в міжнародній літературі стандартним терміном залишається risk of bias.


Чи можна визначити risk of bias одним числом?


Для RoB 2 та ROBINS-I стандартний підхід є domain-based, а не total score. Одне число приховує різні механізми й припускає довільну вагу пунктів. Доменні judgments із обґрунтуванням методологічно інформативніші.


Чи завжди незасліплене психологічне дослідження має high risk?


Ні. Оцінка залежить від того, хто не був засліплений, який outcome вимірюється, чи знання про group allocation могло змінити поведінку або measurement і які safeguards застосовано. У психотерапії participant/therapist blinding часто неможливе, тому механізм оцінюють конкретно.


Чи є selective reporting тим самим, що publication bias?


Ні. Selective reporting може означати вибір одного outcome, time point або analysis серед кількох виміряних у тому самому дослідженні. Publication або non-reporting bias на рівні синтезу виникає, коли результати чи цілі дослідження стають недоступними залежно від їхнього змісту. Механізми можуть бути пов’язані, але рівні оцінювання різні.


Чи PRISMA оцінює risk of bias?


PRISMA вимагає повідомити, як risk of bias оцінювали, але сама є reporting guideline для systematic reviews. Для конкретних study designs використовують design-specific risk-of-bias instruments.


Чи high risk of bias означає, що дослідження треба виключити з метааналізу?


Не автоматично. Рішення залежить від review question, protocol і способу synthesis. Часто корисні sensitivity analyses або окреме представлення результатів. Автоматичне виключення без заздалегідь визначеної логіки теж може створити selective decision-making.


Чи low risk of bias означає високу певність доказів?


Не обов’язково. Певність сукупності evidence залежить також від inconsistency, indirectness, imprecision і missing/publication bias, а іноді й від інших design-specific міркувань. Low risk — важлива, але не єдина умова.


Який інструмент використовувати для діагностичного або скринінгового тесту?


Для systematic reviews diagnostic test accuracy актуальним framework є QUADAS-3, опублікований у 2026 році. Водночас psychometric properties тесту — reliability, construct validity, measurement invariance, cultural adaptation — потребують окремої доказової оцінки й не випливають автоматично з QUADAS-3.


Чи можна оцінити risk of bias лише за анотацією статті?


Надійно — ні. Для багатьох доменів потрібні деталі методів, protocol, registry, analysis plan та supplementary materials. Анотація створена для стислого повідомлення результатів і майже ніколи не містить достатньої інформації для повного domain-based appraisal.


Пов’язані статті


Систематичний огляд: як шукають і оцінюють дослідження — повна логіка evidence synthesis від питання й пошуку до appraisal та висновку.


GRADE: як оцінюють впевненість у сукупності доказів — як risk of bias переходить із рівня окремих результатів на рівень certainty of evidence.


PRISMA 2020 — правила прозорого звітування systematic reviews і відмінність reporting guideline від quality/risk-of-bias tool.


Пререєстрація дослідження — що фіксують до збору або аналізу даних і чому preregistration зменшує неоднозначність, але не гарантує валідності.


HARKing та p-hacking — окремі форми аналітичної та звітної гнучкості, які допомагають зрозуміти ризик data-dependent selection.


Джерела

















 
 
bottom of page