top of page

Психологічна енкциклопедія

Ієрархія доказів у психології: чому «піраміда досліджень» корисна лише як спрощена карта, а не універсальний рейтинг істини

23 вер.
Читати 14 хв

Ієрархія доказів — це спосіб упорядкувати типи досліджень за тим, наскільки певний дизайн зазвичай захищає висновок від конкретних систематичних помилок. Її найвідоміша форма — «піраміда доказів», де систематичні огляди й метааналізи часто малюють угорі, рандомізовані контрольовані дослідження нижче, а спостережні дизайни, серії випадків і експертні судження — ще нижче. Така схема корисна як швидка карта пошуку, але стає хибною, коли її читають як універсальний рейтинг істини.


Сучасні методологічні рамки формулюють це обережніше. Oxford Centre for Evidence-Based Medicine прямо називає свої рівні «ієрархією ймовірно найкращих доказів» і підкреслює, що жодну систему ранжування не можна застосовувати без судження. Американська психологічна асоціація визначає доказову практику в психології через інтеграцію найкращих доступних досліджень із професійною експертизою та характеристиками, культурою і перевагами людини, а не через механічне читання однієї піраміди.


Головний принцип цієї статті простий: сила доказу залежить не лише від назви дизайну. Вона залежить від запитання, якості виконання, ризику упередження, прямоти даних, узгодженості результатів, точності оцінок, повноти оприлюднення та того, наскільки дослідження відповідає реальній популяції й рішенню.


Коротко: як правильно читати «піраміду доказів»


Піраміда корисна, коли допомагає швидко вирішити, де почати пошук. Для питання про середній причинний ефект психологічного втручання добре виконаний систематичний огляд якісних рандомізованих досліджень зазвичай буде інформативнішим за один неконтрольований опис випадку.


Піраміда перестає бути корисною, коли з неї роблять правило «верхнє завжди істинніше за нижнє». Погано проведений систематичний огляд може бути менш надійним за сильне первинне дослідження. Рандомізоване дослідження може мати високий ризик упередження. Спостережні дані можуть бути найкращим доступним джерелом для рідкісної шкоди, довготривалих наслідків, прогнозу або питань, які неможливо чи неетично рандомізувати.


Найважливіше питання перед оцінюванням доказів звучить не «на якому поверсі піраміди це дослідження?», а «яке саме запитання ми ставимо і який дизайн найкраще здатен на нього відповісти?»


Що таке ієрархія доказів


Ієрархія доказів — це евристика: спрощений порядок, який допомагає оцінити, які дизайни зазвичай краще контролюють певні джерела систематичної помилки для певного типу запитання. Вона не вимірює «істинність» статті, не присвоює дослідженню універсальну якість і не замінює критичну оцінку.


OCEBM побудував рівні доказів не як одну вертикаль для всього, а як таблицю для різних клінічних запитань: поширеність, точність діагностичного тесту, прогноз, користь лікування, шкода і скринінг мають різні оптимальні дизайни. Це важливе нагадування і для психології: дизайн, сильний для оцінки ефекту втручання, не обов’язково є найкращим для вимірювання поширеності, валідності шкали або суб’єктивного досвіду.


Чому з’явилася піраміда досліджень


Ідея піраміди відповідає реальній потребі: не всі способи отримання даних однаково добре захищають від помилкових причинних висновків. Якщо психолог хоче знати, чи саме втручання спричинило зміну, рандомізація за належного виконання зменшує ризик того, що групи відрізнялися ще до початку лікування. Якщо є багато досліджень, систематичний огляд може зібрати їх за наперед визначеним протоколом і показати всю доступну картину.


Саме тому традиційна піраміда стала хорошим навчальним інструментом. Вона нагадує, що особисте враження, окремий яскравий випадок і неконтрольована серія спостережень зазвичай дають слабші підстави для твердження про середній причинний ефект, ніж належно проведене порівняльне дослідження.


Проблема починається тоді, коли навчальний малюнок перетворюють на онтологію науки: начебто достатньо назвати дизайн, щоб автоматично знати силу висновку.


Чому універсальної «піраміди істини» не існує


У 2016 році Мохаммад Хассан Мурад і співавтори запропонували оновлену модель піраміди доказів. Їхня ключова думка: систематичні огляди та метааналізи краще розуміти не як окремий «найвищий поверх», а як спосіб бачити, критично оцінювати й синтезувати сукупність первинних досліджень. Якість синтезу залежить від якості запитання, пошуку, включених даних, оцінки ризику упередження та методу об’єднання.


Тому формула «метааналіз вище РКД, отже метааналіз завжди сильніший» некоректна. Метааналіз слабких, неоднорідних або систематично відібраних досліджень може дати дуже точне число для ненадійної сукупності даних. І навпаки, велике, добре сплановане первинне дослідження може суттєво змінити висновок старого огляду.


Ієрархія — це карта ймовірної вразливості до певних помилок, а не автоматичний конвертер дизайну в істину.


Спочатку запитання, потім дизайн


Найсильніший дизайн визначається типом висновку, який ми хочемо зробити. Нижче — не універсальний рейтинг, а орієнтир для вибору відповідного джерела даних.


Ефективність психологічного втручання


Для питання «чи змінює втручання результат порівняно з альтернативою?» рандомізовані контрольовані дослідження часто мають перевагу, бо рандомізація допомагає контролювати змішування. Якщо є кілька придатних досліджень, добре проведений систематичний огляд може оцінити їх разом, а метааналіз — статистично об’єднати сумісні оцінки.


Прогноз і природний перебіг


Для питання «що зазвичай відбувається з людьми з певною ознакою або станом у часі?» потрібні добре сформовані поздовжні когорти. Рандомізація тут часто не є центральним механізмом, бо дослідник не призначає людині її вік, темперамент, ранній досвід або багато інших факторів ризику.


Поширеність


Для питання «скільки людей у популяції має певну ознаку або стан?» вирішальними стають репрезентативність вибірки, коректне визначення випадку та якість вимірювання. Велике поперечне дослідження з імовірнісною вибіркою може бути саме тим дизайном, який потрібен.


Точність скринінгу або діагностичного інструменту


Для питання про чутливість, специфічність, прогностичні значення чи ROC/AUC потрібне дослідження діагностичної точності з доречним референтним стандартом і відповідною популяцією. РКД не стає «кращим» лише через місце у традиційній піраміді.


Психометричні властивості


Для надійності, валідності, похибки вимірювання, responsiveness, факторної структури або інваріантності потрібні спеціальні психометричні дизайни й аналізи. COSMIN прямо зазначає, що різні властивості вимірювання потребують різних вимог до дизайну та статистики. Вибір інструменту має спиратися на сукупність доказів про його надійність, валідність і здатність виявляти зміни, а не на місце в клінічній піраміді. Детальніше про це — у статті «Психометрія».


Досвід, значення і контекст


Якщо запитання звучить «як люди переживають терапію?», «що для них означає стигма?» або «чому втручання не впроваджується в певному середовищі?», якісне дослідження може бути безпосередньо релевантним. JBI використовує окремі інструменти критичної оцінки для якісних, діагностичних, когортних, поперечних та інших дизайнів. Це краще відображає різноманітність наукових запитань, ніж одна вертикальна драбина.


Рідкісна або віддалена шкода


Cochrane Handbook підкреслює, що рандомізовані випробування часто недостатні для виявлення рідкісних або віддалених небажаних наслідків: вони можуть бути замалими або мати надто коротке спостереження. У таких ситуаціях великі нерандомізовані масиви даних можуть бути необхідними, хоча потребують особливо уважного контролю змішування й інших упереджень.


Систематичний огляд не дорівнює метааналізу


Систематичний огляд — це методичний процес формулювання запитання, пошуку, відбору, критичної оцінки та синтезу досліджень. Метааналіз — статистична процедура об’єднання числових оцінок. Систематичний огляд може не містити метааналізу, якщо дослідження занадто різні або даних недостатньо. Метааналіз, своєю чергою, може бути проведений на погано відібраному наборі досліджень.


Тому фраза «це метааналіз, отже це найвищий рівень доказів» пропускає найважливіші питання: чи був пошук повним, чи підходили критерії включення, чи оцінено ризик упередження, чи сумісні дослідження, наскільки велика гетерогенність, чи є ознаки публікаційного упередження і наскільки точними є оцінки.


PRISMA не є знаком якості


PRISMA 2020 — це настанова щодо прозорого звітування систематичних оглядів. Її чекліст допомагає авторам повідомити, що і як вони зробили, але сам факт наявності PRISMA-діаграми не доводить низький ризик упередження, правильність метааналізу або високу впевненість у висновках.


Добре звітування робить роботу перевірюванішою. Методологічна якість і достовірність висновку потребують окремої оцінки.


Дизайн дослідження не дорівнює якості виконання


Два РКД можуть мати однакову етикетку дизайну й дуже різну доказову силу. В одному може бути справді випадковий розподіл, приховування послідовності, низькі втрати учасників, наперед визначені результати та коректний аналіз. В іншому — проблемна рандомізація, багато вибулих учасників, зміна первинних результатів після аналізу та неповне звітування.


Те саме стосується когорт, досліджень випадок-контроль, поперечних і якісних досліджень. JBI Critical Appraisal Tools має окремі чеклісти для різних дизайнів саме тому, що ризики помилки залежать від структури дослідження.


Отже, «тип дослідження» — лише початок оцінки. Далі потрібна критична перевірка того, як цей дизайн було реалізовано.


Що таке ризик упередження і чому він важливіший за красиву етикетку


Ризик упередження — це ймовірність того, що особливості дизайну, проведення, аналізу або звітування систематично змістили результат. Він відрізняється від випадкової похибки: велика вибірка може зробити оцінку дуже точною, але не виправить систематичне зміщення.


Саме тому маленький p-value не перетворює упереджене дослідження на сильний доказ, а вузький довірчий інтервал не гарантує правильності оцінки, якщо сам дизайн систематично веде в хибний бік.


Рандомізоване дослідження: сильний інструмент, а не печатка істини


Для причинного ефекту втручання якісна рандомізація є одним із найсильніших засобів контролю змішування. Але статус РКД не скасовує інших проблем: вибіркове вибуття, невдале маскування там, де воно можливе, зміна результатів після перегляду даних, неповне звітування, мала вибірка, невалідне вимірювання результату або популяція, дуже далека від реальної практики.


Тому сучасна оцінка запитує не просто «це РКД?», а «наскільки добре це РКД відповідає конкретному запитанню і наскільки його результат захищений від упереджень?»


Спостережні дослідження: не «слабкі за визначенням»


Спостережний дизайн частіше вразливий до змішування, бо дослідник не розподіляє експозицію випадково. Це реальна причина обережності, особливо коли роблять причинні висновки. Водночас спостережні дані незамінні для багатьох питань: прогнозу, поширеності, факторів ризику, рідкісної шкоди, довготривалих наслідків та ситуацій, де рандомізація неможлива.


Cochrane рекомендує оцінювати конкретні особливості дизайну нерандомізованих досліджень і ризик упередження, а не покладатися лише на ярлик «когортне» чи «випадок-контроль». Це переводить дискусію з «який тип завжди кращий?» до «які припущення потрібні для цього висновку і наскільки вони правдоподібні?»


Кореляція, асоціація і причинність


Навіть сильна статистична асоціація не доводить, що одна змінна спричинила іншу. Причинний висновок потребує дизайну й аналізу, які враховують альтернативні пояснення, часовий порядок, змішування, селекцію та інші джерела систематичної помилки. Тому окрема стаття ХАБу про кореляцію і причинність розглядає цей розрив детальніше.


Що змінює GRADE


GRADE робить важливий крок від простого ранжування дизайнів до оцінювання впевненості в сукупності доказів для конкретного результату. У Cochrane Handbook для цього розглядають п’ять основних доменів: ризик упередження, неузгодженість результатів, непрямість доказів, неточність і публікаційне упередження.


Це означає, що метааналіз кількох РКД не отримує автоматично «високу доказовість». Якщо дослідження мають серйозні методологічні проблеми, суперечать одне одному, стосуються іншої популяції, дають дуже широкі довірчі інтервали або підозріло неповну картину оприлюднених результатів, впевненість знижується.


І навпаки, GRADE допускає підвищення впевненості для певних нерандомізованих даних за визначених умов. Саме тому GRADE — не рейтинг журналів і не «оцінка статті з чотирьох зірок», а структурована оцінка сукупності доказів.


Чому психологія особливо погано вкладається в одну піраміду


Психологія одночасно ставить причинні, описові, прогностичні, вимірювальні, розвиткові, соціальні, нейрокогнітивні та феноменологічні запитання. Один малюнок не може коректно ранжувати всі ці задачі.


APA прямо говорить про «найкращі доступні дослідження» з різних дизайнів і методологій. Для психологічної практики важлива не лише наявність середнього ефекту, а також його величина, статистична й клінічна значущість, сукупність підтримувальних даних, застосовність до конкретної людини та контексту.


Наприклад, РКД може добре відповісти на питання про середній ефект терапії, але не встановлює автоматично надійність опитувальника, культурну валідність перекладу, точність скринінгового порога, поширеність явища або переживання учасників. Кожен із цих висновків потребує власної доказової логіки.


Психометрія має власну ієрархію запитань


У психологічному вимірюванні універсальна клінічна піраміда особливо небезпечна. Надійність, структурна валідність, конвергентні й дискримінантні зв’язки, інваріантність, похибка вимірювання та чутливість до змін — різні властивості, і кожна потребує своїх даних.


COSMIN рекомендує оцінювати інструменти за доказами щодо надійності, валідності й responsiveness, а також за практичною придатністю. Добре виконаний систематичний огляд психометричних властивостей може бути дуже цінним, але він синтезує інший тип доказів, ніж огляд РКД ефективності лікування.


Тому твердження «цей тест доказовий, бо його використовували в РКД» є недостатнім. Використання тесту у сильному експерименті не замінює доказів того, що його бали надійні, валідно інтерпретуються в потрібній популяції й культурно-мовній версії.


Якісні дослідження не є «нижчою версією РКД»


Якісні методи відповідають на інші питання: як люди переживають явище, як формують значення, чому приймають або відкидають втручання, які бар’єри виникають у реальній практиці. Для таких питань критерії сили доказу пов’язані з доречністю вибірки, глибиною даних, прозорістю аналітичного процесу, рефлексивністю та обґрунтованістю інтерпретації.


JBI Levels of Evidence навіть має окремі рівні для meaningfulness, де систематичний огляд якісних або змішаних досліджень оцінюється у власній логіці. Це показує фундаментальний принцип: різні запитання потребують різних доказових архітектур.


Велика вибірка не означає сильний доказ


Розмір вибірки впливає на статистичну точність, але не лікує систематичні помилки. Дослідження на десятках тисяч людей може дуже точно оцінити упереджену величину, якщо експозицію чи результат вимірювали проблемно, групи систематично відрізнялися або аналіз обирався після перегляду даних.


Точність — лише один компонент. Сильний висновок потребує і відповідного дизайну, і якісного вимірювання, і контрольованих упереджень, і коректної інтерпретації.


Статистична значущість не є рівнем доказовості


p-value не показує ймовірність того, що гіпотеза істинна, і не вимірює практичну важливість ефекту. Два дослідження з однаковим p-value можуть відрізнятися за величиною ефекту, точністю, ризиком упередження, правдоподібністю моделі та зовнішньою валідністю.


Тому при читанні доказів потрібно дивитися на розмір ефекту, довірчий інтервал, ризик упередження, множинність аналізів, узгодженість з іншими дослідженнями та клінічне або практичне значення, а не на символічну межу p < 0,05.


Реплікація і відкритість змінюють вагу доказу


Окреме відоме дослідження, навіть методологічно сильне, не дорівнює стійкому знанню. Незалежні реплікації, прозорі дані й код, наперед визначені гіпотези та аналізи, зареєстровані звіти й повніше повідомлення нульових результатів допомагають перевірити, наскільки ефект відтворюється.


Саме тому сучасну оцінку доказів варто читати разом із темами реплікаційної кризи в психології та пререєстрації дослідження. Вони не створюють істину автоматично, але зменшують простір для вибіркового аналізу й ретроспективного підлаштування історії під отримані дані.


Як оцінювати психологічне твердження: практичний алгоритм


1. Сформулюйте точне запитання


Що саме стверджується: причинний ефект, асоціація, прогноз, поширеність, точність тесту, психометрична властивість, переживання людей чи практична здійсненність? Без цього неможливо визначити доречний дизайн.


2. Перевірте, чи відповідає дизайн запитанню


РКД сильне для багатьох питань про ефект втручання. Когорта — для прогнозу й багатьох експозицій. Репрезентативне поперечне дослідження — для поширеності. Дослідження діагностичної точності — для скринінгу. Психометричний дизайн — для властивостей вимірювання. Якісний дизайн — для значень і досвіду.


3. Шукайте сукупність доказів, а не одну улюблену статтю


Якщо є сучасний систематичний огляд, почніть з нього, але оцініть його методи. Якщо огляд застарілий, вузький або має серйозні обмеження, перевірте нові первинні дослідження.


4. Оцініть ризик упередження


Запитайте, що могло систематично змістити результат: селекція, змішування, відсутні дані, спосіб вимірювання, відхилення від втручання, вибіркове звітування чи аналітичні рішення.


5. Подивіться на величину ефекту і невизначеність


Чи великий ефект? Наскільки широкий довірчий інтервал? Які значення сумісні з даними? Статистично значущий, але крихітний ефект може мати мало практичного значення; широкий інтервал може одночасно допускати користь, відсутність важливого ефекту й шкоду.


6. Перевірте узгодженість


Чи результати різних досліджень подібні? Якщо ні, чи пояснюється гетерогенність популяціями, методами, дозою, контекстом або якістю вимірювання? Середнє число не повинно приховувати структурно різні результати.


7. Перевірте прямоту


Чи досліджували саме ту популяцію, втручання, порівняння і результат, про які ви хочете зробити висновок? Дані про студентів не автоматично переносяться на дітей, клінічну популяцію чи людей іншої культурно-мовної групи.


8. Перевірте повноту видимої літератури


Чи могли нульові, негативні або незручні результати залишитися неопублікованими? Чи збігаються зареєстровані результати з опублікованими? Публікаційне й інше non-reporting bias може спотворити навіть дуже красивий метааналіз.


9. Оцініть впевненість у сукупності доказів


Якщо для питання застосовний GRADE або інша формалізована рамка, дивіться не лише на дизайн, а на всі релевантні домени впевненості. Не змішуйте «якість одного дослідження», «ризик упередження» і «впевненість у сукупності доказів».


10. Відокремте науковий висновок від рішення


Навіть висока впевненість у середньому ефекті не визначає автоматично, що слід робити конкретній людині. Практичне рішення може залежати від величини користі й шкоди, альтернатив, ресурсів, цінностей, доступності, культурного контексту та індивідуальних обставин.


Типові помилки при читанні ієрархії доказів


Помилка 1: «систематичний огляд завжди сильніший за первинне дослідження». Ні. Потрібно оцінити якість огляду, актуальність пошуку, включені дослідження і синтез.


Помилка 2: «метааналіз — вершина доказовості». Метааналіз є статистичним інструментом. Він може дуже добре синтезувати сильні дані або дуже точно підсумувати слабкі.


Помилка 3: «РКД доводить істину». Рандомізація захищає від частини упереджень, але не від усіх проблем дизайну, вимірювання, вибуття, звітування чи непрямості.


Помилка 4: «спостережні дослідження нічого не доводять». Вони можуть бути найдоречнішим дизайном для прогнозу, поширеності, багатьох факторів ризику, рідкісної шкоди і довготривалих наслідків.


Помилка 5: «якісні дослідження стоять унизу, отже вони слабкі». Вони відповідають на інший клас запитань. Їх не слід оцінювати як невдалу спробу провести РКД.


Помилка 6: «велика вибірка = висока якість». Велике n зменшує випадкову невизначеність, але не усуває систематичне зміщення.


Помилка 7: «p < 0,05 = сильний доказ». Статистична значущість не дорівнює величині ефекту, достовірності дизайну, практичній важливості чи впевненості у всій сукупності даних.


Помилка 8: «PRISMA = знак якісного огляду». PRISMA покращує звітування, але не замінює оцінювання методів і ризику упередження.


Помилка 9: «GRADE оцінює журнал або окрему статтю». GRADE оцінює впевненість у сукупності доказів для конкретного результату й не є рейтингом престижу.


Помилка 10: «експертне судження не має цінності». Воно слабке як самостійна підстава для універсального емпіричного твердження, але експертиза потрібна для постановки питання, інтерпретації, оцінки застосовності, виявлення методологічних проблем і переходу від даних до рішення. Важливо не плутати експертизу з емпіричним доказом.


Коли піраміда справді корисна


Піраміда працює добре як навчальна мнемоніка і як порядок первинного пошуку. Якщо питання стосується ефекту втручання, логічно спочатку перевірити, чи є якісний сучасний систематичний огляд, потім — ключові рандомізовані дослідження, а за потреби — нерандомізовані джерела.


Вона також корисна, коли нагадує про різну вразливість дизайнів до певних упереджень. Опис випадку може породити гіпотезу, але зазвичай не встановлює середній ефект для популяції. Неконтрольоване «до–після» не відділяє втручання від природної зміни, регресії до середнього чи супутніх подій.


Але після першої орієнтації піраміду треба відкласти й перейти до конкретного запитання, конкретних методів і конкретних обмежень.


Науковий статус ієрархій доказів


Ієрархії доказів залишаються усталеним інструментом доказової практики, особливо для швидкого пошуку й навчання. Водночас сучасна методологія відмовляється від трактування їх як універсального рейтингу істини. Oxford CEBM прямо називає рівні скороченим шляхом до «ймовірно найкращих» доказів, а JBI застерігає, що рівні не скасовують уважного читання, критичної оцінки й професійного міркування.


Тому найбільш точна сучасна позиція така: ієрархія корисна для орієнтації, але сила висновку формується на перетині доречності дизайну, якості виконання, ризику упередження, узгодженості, точності, прямоти, повноти даних і контексту застосування.


FAQ


Що стоїть на вершині піраміди доказів?


У класичній схемі для питань про ефективність втручань угорі часто розміщують систематичні огляди й метааналізи рандомізованих досліджень. Але це не універсальна вершина для всіх наукових запитань і не гарантія високої впевненості.


Чи завжди метааналіз сильніший за РКД?


Ні. Сила метааналізу залежить від якості включених досліджень, повноти пошуку, сумісності даних, ризику упередження, гетерогенності й правильності статистичної моделі. Нове велике РКД може бути інформативнішим за старий або слабко проведений метааналіз.


Чи є РКД найкращим дизайном у психології?


Для багатьох причинних питань про ефекти втручань — часто так. Для поширеності, прогнозу, психометричних властивостей, діагностичної точності, рідкісної шкоди або переживань людей потрібні інші дизайни.


Чи можна вважати спостережне дослідження сильним доказом?


Так, якщо воно відповідає запитанню і добре контролює ключові джерела упередження. Для деяких запитань спостережний дизайн є основним або єдиним реалістичним джерелом даних. Для причинного ефекту втручання він зазвичай потребує більшої обережності через змішування.


Чи означає систематичний огляд високу доказовість?


Ні автоматично. Систематичність описує метод пошуку й синтезу. Впевненість у висновку залежить від методів самого огляду, якості первинних досліджень, ризику упередження, узгодженості, точності, прямоти й відсутності суттєвої проблеми неповних доказів.


Чим GRADE відрізняється від піраміди доказів?


Піраміда переважно ранжує дизайни як швидкий орієнтир. GRADE оцінює впевненість у сукупності доказів для конкретного результату, враховуючи не лише дизайн, а ризик упередження, неузгодженість, непрямість, неточність і публікаційне упередження.


Чи є якісні дослідження «слабкими доказами»?


Таке формулювання некоректне без запитання. Якісні дослідження не призначені для оцінювання середнього причинного ефекту так, як РКД. Вони можуть бути найрелевантнішими для розуміння досвіду, значень, бар’єрів і контексту.


Чи можна визначити доказовість психологічного тесту за пірамідою?


Ні. Потрібно окремо оцінювати докази валідності, різні види надійності, похибку вимірювання, факторну структуру, інваріантність, культурну адаптацію, responsiveness та відповідність конкретному використанню.


Чи робить великий розмір вибірки дослідження надійним?


Велика вибірка зазвичай підвищує статистичну точність, але не усуває систематичні помилки дизайну, вимірювання, селекції або аналізу. Дуже точний упереджений результат залишається упередженим.


Як швидко перевірити сильне психологічне твердження?


Спершу уточніть тип запитання, знайдіть найдоречнішу сучасну сукупність доказів, перевірте ризик упередження, величину ефекту й довірчі інтервали, узгодженість, прямоту, публікаційне упередження та застосовність. Назва дизайну — лише перший фільтр.


Пов’язані статті


Систематичний огляд: що це і як його читати — як формують запитання, шукають дослідження, оцінюють ризик упередження й синтезують результати.


Метааналіз: як об’єднують результати досліджень — статистичний синтез, ваги, моделі, гетерогенність і межі середнього ефекту.


GRADE: як оцінюють впевненість у сукупності доказів — чому дизайн є лише стартовою точкою і як оцінюють certainty.


Ризик упередження в дослідженнях — систематичні помилки дизайну, проведення, аналізу й звітування.


Публікаційне упередження — як невидимі результати можуть спотворити сукупність доказів.


Гетерогенність у метааналізі — що означають відмінності між дослідженнями і як читати I² та τ².


Реплікаційна криза в психології — чому відтворюваність стала центральною частиною сучасної оцінки психологічних результатів.


Пререєстрація дослідження — що фіксують до збору або аналізу даних і чого preregistration не гарантує.


Психометрія — як оцінюють якість психологічного вимірювання і чому РКД не замінює валідність та надійність.


Джерела


American Psychological Association. Policy Statement on Evidence-Based Practice in Psychology. APA визначає доказову психологічну практику як інтеграцію найкращих доступних досліджень, професійної експертизи та характеристик, культури й переваг людини.


Centre for Evidence-Based Medicine, University of Oxford. Levels of Evidence: An introduction. Офіційне пояснення рівнів як ієрархії ймовірно найкращих доказів і швидкої евристики, яка потребує судження.


Centre for Evidence-Based Medicine, University of Oxford. Explanation of the 2011 OCEBM Levels of Evidence. Пояснення question-specific ієрархій для поширеності, діагностики, прогнозу, лікування, шкоди та скринінгу.


Cochrane. Handbook for Systematic Reviews of Interventions. Chapter 14: Completing ‘Summary of findings’ tables and grading the certainty of the evidence. Актуальна рамка GRADE для ризику упередження, неузгодженості, непрямості, неточності та публікаційного упередження.


Cochrane. Handbook for Systematic Reviews of Interventions. Chapter 24: Including non-randomized studies on intervention effects. Роль нерандомізованих даних, змішування, ризику упередження та ситуацій, де РКД недостатні.


COSMIN. I’m conducting a study on measurement properties. Вимоги до дизайну й аналізу різних психометричних властивостей.


COSMIN. I want to select the most suitable outcome measurement instrument. Вибір інструменту на основі доказів про надійність, валідність, responsiveness і практичну придатність.


JBI. Critical Appraisal Tools. Окремі інструменти критичної оцінки для різних дизайнів досліджень.


JBI. Levels of Evidence and Grades of Recommendation. Рівні доказів для різних типів запитань та застереження, що ієрархія не замінює критичне оцінювання.


Murad, M. H., Asi, N., Alsawas, M., & Alahdab, F. (2016). New evidence pyramid. Evidence Based Medicine, 21(4), 125–127. Модель, у якій систематичні огляди й метааналізи розглядаються як інструменти оцінювання й синтезу, а не автоматичний верхній поверх істини.


PRISMA. PRISMA 2020 statement. Чинна настанова щодо прозорого звітування систематичних оглядів.

 
 
bottom of page