Гетерогенність у метааналізі: що означають відмінності між дослідженнями і як тлумачити I² та τ²
Автор: Український психологічний ХАБ · Опубліковано: 23 вересня 2026 · Редакційна політика
Гетерогенність у метааналізі — це відмінності між результатами включених досліджень, які не зводяться лише до випадкової вибіркової похибки. Вона може відображати реальні відмінності між популяціями, втручаннями, способами вимірювання, дизайнами та умовами проведення досліджень. Cochrane Handbook прямо розрізняє клінічну різноманітність, методологічну різноманітність і статистичну гетерогенність та наголошує, що варіацію між дослідженнями потрібно враховувати під час інтерпретації метааналізу.
Найважливіший принцип: жодне окреме число не відповідає на запитання «чи можна довіряти цьому метааналізу?». I² не є універсальним індикатором якості, τ² не має одного нормативного порога, а статистично значущий Q-тест не доводить, що відмінності практично важливі. Гетерогенність потрібно читати разом із лісовою діаграмою (forest plot), напрямом і величиною ефектів, невизначеністю, контекстом досліджень, ризиком упередження та тим, яке рішення має підтримати синтез.
Саме тому твердження на кшталт «I² = 60%, отже метааналіз поганий» або «I² < 50%, отже результати однорідні» методологічно слабкі. Higgins і Thompson запровадили I² як показник впливу гетерогенності на варіабельність оцінок, а подальші роботи показали, що I² не є абсолютною мірою розкиду істинних ефектів і залежить, зокрема, від точності включених досліджень.
Що таке гетерогенність у метааналізі
Метааналіз об’єднує числові оцінки з різних досліджень. Навіть якщо всі вони формально відповідають одному дослідницькому питанню, їхні результати майже ніколи не будуть ідентичними. Частина розбіжностей виникає через випадкову похибку вибірки: дві вибірки з однієї й тієї самої популяції дадуть трохи різні оцінки. Інша частина може виникати тому, що дослідження насправді оцінюють різні, хоча й споріднені, ефекти.
У статистичному сенсі гетерогенність означає міждослідницьку варіабельність ефектів понад ту, яку очікували б лише через вибіркову похибку. У змістовному сенсі важливіше запитати, чому ефекти відрізняються і чи змінює ця відмінність висновок, прогноз або практичне рішення.
Клінічна або змістова різноманітність
Дослідження можуть відрізнятися за віком учасників, тяжкістю стану, супутніми станами, країною, культурним контекстом, дозою або інтенсивністю втручання, тривалістю лікування, форматом психотерапії, кваліфікацією терапевтів, умовами набору та базовим ризиком. У психології додатково мають значення спосіб визначення конструкта, діагностичні критерії, скринінгові пороги, тип контрольної групи та контекст отримання допомоги.
Методологічна різноманітність
Результати можуть відрізнятися через дизайн дослідження, ризик упередження, тривалість спостереження, спосіб поводження з пропущеними даними, статистичну модель, вибір показника результату, якість засліплення, способи набору або через те, що різні дослідження вимірюють близькі, але не тотожні явища.
Статистична гетерогенність
Статистична гетерогенність проявляється як більша розбіжність оцінок ефекту, ніж очікується від випадкової похибки. Її оцінюють за допомогою лісової діаграми, Q-статистики Кохрана, I², міждослідницької дисперсії τ² та, коли це доречно, предиктивний інтервал (prediction interval). Cochrane рекомендує не зводити оцінювання гетерогенності до одного тесту або одного порога.
Чому гетерогенність не є автоматично помилкою
Варіативність результатів часто є науково змістовною. Якщо психологічне втручання дає більший ефект у людей із тяжчими симптомами, менший ефект у профілактичних вибірках і майже нульовий ефект у певному контексті, метааналіз може показати істотну гетерогенність саме тому, що ефект залежить від умов. Усунути цю варіативність математично означало б втратити інформацію про реальну неоднорідність світу.
Проблема виникає тоді, коли різні ефекти настільки відрізняються за величиною або напрямом, що одна середня оцінка починає погано представляти сукупність досліджень. Тоді центральним питанням стає не «чи є гетерогенність?», а «який діапазон ефектів правдоподібний, чим він пояснюється і чи має сенс повідомляти один усереднений ефект?».
Лісова діаграма (forest plot): перший крок до розуміння гетерогенності
Перед читанням I² варто подивитися на лісову діаграму. Вона показує розміри ефекту окремих досліджень і їхні довірчі інтервали. Якщо оцінки лежать близько одна до одної і вказують в одному напрямі, гетерогенність може бути мало значущою для практичного висновку навіть за неідеальним I². Якщо ж частина досліджень демонструє користь, частина — відсутність ефекту, а частина — можливу шкоду, сама структура результатів важливіша за механічний відсотковий ярлик.
Cochrane Handbook зазначає: слабке перекриття довірчих інтервалів окремих досліджень зазвичай вказує на статистичну гетерогенність. Водночас візуальна оцінка не замінює статистичні показники, а статистичні показники не замінюють змістовне читання графіка.
Q-статистика Кохрана: чи сумісні відмінності лише з випадковістю
Q-тест Кохрана перевіряє нульову гіпотезу про те, що відмінності між оцінками досліджень узгоджуються з моделлю спільного ефекту. У класичному вигляді Q є зваженою сумою квадратів відхилень оцінок окремих досліджень від спільної оцінки; за нульової гіпотези статистику порівнюють із χ²-розподілом із k − 1 ступенями свободи, де k — кількість досліджень.
Q-тест має принципове обмеження: його здатність виявляти гетерогенність залежить від кількості та точності досліджень. Cochrane застерігає, що за малої кількості або малих вибірок тест має низьку потужність, тому незначуще p-значення не є доказом відсутності гетерогенності. За дуже великої кількості досліджень, навпаки, тест може виявити статистично переконливу, але практично неважливу неоднорідність.
Отже, p-значення Q-тесту відповідає на вузьке питання про сумісність даних із відсутністю міждослідницької варіації. Він не вимірює величину цієї варіації і не повідомляє, чи вона важлива. Це ще один приклад того, чому статистична значущість не дорівнює практичній значущості.
I²: що саме показує цей відсоток
I² — показник, який описує частку спостережуваної варіабельності оцінок ефекту, пов’язану з гетерогенністю, а не з вибірковою похибкою. Класична формула має вигляд I² = max(0, (Q − df) / Q) × 100%. Показник був розроблений як більш інформативний спосіб описувати неузгодженість, ніж сам тест на гетерогенність. Його властивості детально описані в роботах Higgins і Thompson (2002) та Higgins та співавторів (2003).
Чи існують пороги I²
У Cochrane наведено лише орієнтовний, перекривний довідник: 0–40% може бути неважливим; 30–60% може відповідати помірній гетерогенності; 50–90% — істотній; 75–100% — значній. Ці інтервали навмисно перекриваються. Cochrane Handbook прямо попереджає, що пороги можуть вводити в оману, а значення I² треба тлумачити з урахуванням величини і напряму ефектів, сили доказів гетерогенності та невизначеності самого I².
Тому 49% і 51% не утворюють дві якісно різні наукові реальності. Немає універсальної межі, після якої метааналіз раптом стає «гетерогенним», «поганим» або непридатним до об’єднання.
Що I² не означає
I² = 70% не означає, що 70% досліджень «неправильні». Це не частка учасників, не частка упереджених робіт, не відсоток похибки метааналізу і не ймовірність того, що об’єднаний ефект хибний. Показник також не повідомляє, наскільки далеко один від одного розташовані істинні ефекти в клінічно або психологічно зрозумілих одиницях.
Borenstein та співавтори показують ключову проблему: однакове I² може відповідати дуже вузькому або дуже широкому діапазону істинних ефектів. Якщо потрібно зрозуміти, наскільки ефекти реально варіюють, корисніше розглядати τ², τ і предиктивний інтервал.
Чому I² залежить від точності досліджень
I² є відносною мірою: він порівнює міждослідницьку варіацію з загальною спостережуваною варіацією, яка включає вибіркову похибку. Коли дослідження стають дуже точними, вибіркова похибка зменшується, і та сама абсолютна міждослідницька варіація може давати більше I². Rücker та співавтори у симуляціях показали, що зі збільшенням точності I² може швидко наближатися до 100%, тоді як τ² у середньому залишається стабільним.
τ² і τ: абсолютна міждослідницька варіабельність
У моделі випадкових ефектів припускається, що дослідження можуть оцінювати різні, але споріднені істинні ефекти. τ² (tau-squared) — оцінка дисперсії цих істинних ефектів між дослідженнями. τ — квадратний корінь із τ² і, на відміну від дисперсії, має ті самі одиниці, що й шкала метааналітичного ефекту. Cochrane описує τ як оцінене стандартне відхилення розподілу істинних ефектів.
Для різниці середніх (mean difference) τ вимірюється в одиницях вихідної шкали. Для стандартизованої різниці середніх (standardized mean difference) — в одиницях стандартизованої різниці. Для відношення ризиків (risk ratio) або відношення шансів (odds ratio) моделювання зазвичай відбувається на логарифмічній шкалі, тому τ² стосується саме логарифма ефекту. Через це одна й та сама числова величина τ² не має універсального змісту для різних метрик.
Саме тут τ² доповнює I². I² зручний як відносна характеристика неузгодженості, але τ² безпосередньо описує міждослідницьку дисперсію на шкалі ефекту. Класична робота Higgins і Thompson прямо зазначає, що інтерпретація міждослідницької дисперсії прив’язана до конкретної метрики ефекту.
Оцінка τ² залежить від методу
τ² не є «відомим параметром», який просто читають із даних: його оцінюють. Існують різні оцінювачі, серед них DerSimonian–Laird, REML, Paule–Mandel та інші. Veroniki та співавтори оглянули 16 методів оцінювання міждослідницької дисперсії та показали, що методи мають різні статистичні властивості; традиційний DerSimonian–Laird не є автоматично найкращим вибором.
Отже, у якісному звіті бажано вказувати не лише τ², а й спосіб його оцінювання. Особливо це важливо за малої кількості досліджень, коли невизначеність щодо міждослідницької дисперсії може бути великою.
Предиктивний інтервал (prediction interval): який ефект можна очікувати в подібному новому дослідженні
Довірчий інтервал навколо об’єднаного ефекту і предиктивний інтервал відповідають на різні запитання. Довірчий інтервал навколо середнього ефекту показує невизначеність щодо середнього. Предиктивний інтервал намагається відобразити діапазон істинних ефектів, який можна очікувати в подібному новому дослідженні за припущень моделі випадкових ефектів.
Cochrane Handbook називає предиктивний інтервал способом подати τ у більш інтерпретованій формі. IntHout та співавтори аргументували на користь рутиннішого використання предиктивних інтервалів, оскільки сам середній об’єднаний ефект може приховувати важливу варіабельність між контекстами.
Наприклад, середній ефект може бути сприятливим і мати вузький 95% CI, але предиктивний інтервал може охоплювати від нульового ефекту до великої користі або навіть перетинати межу потенційної шкоди. У такій ситуації фраза «метааналіз показав користь у середньому» є формально правильною, але недостатньою для розуміння переносимості результату.
Предиктивний інтервал також не слід читати механічно. Він залежить від моделі розподілу ефектів і від оцінки τ²; за малої кількості досліджень може бути нестабільним. Cochrane заохочує використання предиктивного інтервалу, коли кількість досліджень достатня, наводячи як орієнтир приблизно п’ять або більше, і коли немає явної асиметрії воронкоподібної діаграми (funnel plot).
Фіксований ефект і випадкові ефекти: гетерогенність не обирає модель за вас
У метааналізі за моделлю фіксованого ефекту (fixed-effect) дослідження в базовій моделі трактуються як такі, що оцінюють спільну величину ефекту. У метааналізі за моделлю випадкових ефектів (random-effects) допускається розподіл різних істинних ефектів, а міждослідницька варіація входить у ваги та невизначеність об’єднаної оцінки.
Популярне правило «I² високий — обираємо модель випадкових ефектів; I² низький — модель фіксованого ефекту» є поганою практикою. Cochrane Handbook прямо зазначає, що вибір між моделлю фіксованого ефекту і моделлю випадкових ефектів не має робитися на підставі статистичного тесту гетерогенності.
Random-effects model не «виправляє» гетерогенність і не пояснює її. Він моделює існування міждослідницької варіації за певних припущень. Якщо дослідження настільки різні, що спільний середній ефект не має змістовної інтерпретації, зміна моделі не робить їх автоматично сумісними.
Також зважування за моделлю випадкових ефектів відносно збільшує вагу менших досліджень порівняно зі зважуванням за моделлю фіксованого ефекту. Якщо менші дослідження систематично дають інші результати через методологічні відмінності або ефекти малих досліджень, об’єднана оцінка за моделлю випадкових ефектів може зміститися в їхній бік. Тому вибір моделі потребує змістовного обґрунтування.
Як читати Q, I², τ² та предиктивний інтервал разом
Сильна інтерпретація починається не з класифікації одного числа, а з послідовності запитань.
1. Чи справді дослідження відповідають достатньо близькому питанню, щоб їхнє кількісне об’єднання мало зміст? Це питання популяції, втручання або експозиції, порівняння, результату, часу та дизайну.
2. Що видно на лісовій діаграмі? Важливі напрям ефектів, їхня величина, довірчі інтервали, наявність окремих дуже відмінних досліджень і те, чи середній об’єднаний ефект візуально представляє більшість результатів.
3. Що показує Q? Значущий тест підтримує наявність варіації понад випадкову, але не вимірює її практичну величину. Незначущий тест за малого k не виключає гетерогенність.
4. Що показує I²? Він допомагає оцінити частку спостережуваної варіабельності, яку пов’язують із міждослідницькою гетерогенністю, але не показує абсолютний діапазон ефектів.
5. Яке τ² або τ? Це дає оцінку абсолютної міждослідницької варіації на відповідній шкалі ефекту. Число треба тлумачити в одиницях конкретної метрики.
6. Що показує предиктивний інтервал? Якщо він доступний і модель придатна, він допомагає побачити, наскільки різними можуть бути істинні ефекти у контекстах, подібних до включених досліджень.
7. Чи змінює варіабельність рішення? Розкид, який статистично очевидний, але весь лежить у діапазоні однаково тривіальних ефектів, може бути менш важливим, ніж розкид, що перетинає пороги клінічно або практично важливої користі та шкоди.
Три умовні приклади, де однакове I² вводить в оману
Приклад 1: дуже точні дослідження
Уявімо десяток великих досліджень із дуже вузькими довірчими інтервалами. Їхні істинні ефекти відрізняються лише трохи, але через високу точність похибка вибірки мала. I² може бути високим, хоча абсолютний розкид ефектів залишається невеликим. У такій ситуації τ і предиктивний інтервал можуть показати, що практична варіація обмежена.
Приклад 2: мало невеликих досліджень
Уявімо чотири невеликі дослідження з широкими довірчими інтервалами. I² може бути невисоким, бо значну частину загальної варіабельності становить похибка вибірки. Це не доводить однорідність: невизначеність просто занадто велика, щоб чітко відокремити міждослідницьку варіацію від випадкової.
Приклад 3: середній ефект приховує різні контексти
Уявімо метааналіз за моделлю випадкових ефектів, у якому середній ефект свідчить про помірну користь. Якщо предиктивний інтервал простягається від потенційної шкоди до великої користі, головний висновок полягає не лише в середньому значенні. Для майбутнього пацієнта, школи, клініки або популяції контекст може визначати, в якій частині цього діапазону опиниться реальний ефект.
Особливості гетерогенності у психологічних метааналізах
Психологічні дослідження особливо чутливі до змістовної неоднорідності, тому що один і той самий номінальний конструкт може операціоналізуватися різними шкалами, інтерв’ю, поведінковими показниками або композитами. Навіть коли результати переводять у standardized mean difference, статистична стандартизація не робить вимірювання концептуально тотожними.
Важливими джерелами відмінностей є популяція і спосіб відбору. Результати студентських, клінічних, шкільних, онлайн- і загальнопопуляційних вибірок можуть відрізнятися через базовий ризик, вік, тяжкість симптомів, доступ до допомоги та супутні характеристики.
У психотерапевтичних метааналізах варіацію можуть створювати різні протоколи, кількість сесій, інтенсивність, формат індивідуальної або групової роботи, контрольна умова, досвід терапевта, дотримання протоколу, тривалість подальшого спостереження та спосіб оцінювання результату.
У метааналізах психометричних властивостей джерелом гетерогенності можуть бути мовна версія інструмента, культурна адаптація, вікова група, клінічний статус, метод оцінювання reliability або validity, модель факторної структури та спосіб формування вибірки. Простий переклад шкали не створює еквівалентності вимірювання між мовами й культурами.
Ризик упередження також може породжувати або підсилювати гетерогенність. Якщо дослідження з більшою методологічною вразливістю систематично демонструють більші ефекти, змішувати їх із надійнішими роботами без аналізу причин варіації небезпечно.
Як досліджувати джерела гетерогенності
Гетерогенність може підказувати, що ефект модифікується певною характеристикою. Для цього застосовують підгрупові аналізи і метарегресія. Але Cochrane Handbook наголошує, що обидва підходи мають суттєві пастки.
Підгруповий аналіз
Порівнювати підгрупи потрібно безпосередньо. Помилка — сказати, що ефект «є» в одній підгрупі і «немає» в іншій лише тому, що p < .05 в першій і p > .05 у другій. Різниця між двома p-значеннями не є тестом різниці між ефектами.
Підгрупові гіпотези бажано формулювати до перегляду результатів і обмежувати невеликою кількістю змістовно обґрунтованих модераторів. Масове перебування десятків поділів після отримання даних створює високий ризик випадкових «пояснень».
Мета-регресія
Мета-регресія дозволяє перевіряти асоціацію між характеристиками досліджень і величиною ефекту. За рекомендаціями Cochrane її зазвичай не варто розглядати, коли в метааналізі менше десяти досліджень; навіть десяти може бути замало, якщо модератор розподілений нерівномірно.
Ключове обмеження — екологічна помилка. Мета-регресія часто працює з характеристиками на рівні дослідження. Якщо дослідження з вищим середнім віком мають більший ефект, це не доводить, що всередині кожного дослідження старші учасники відповідають краще. Міждослідницька асоціація може відрізнятися від індивідуального ефекту.
Аналіз чутливості
Sensitivity analysis перевіряє, чи залишається висновок стійким до обґрунтованих аналітичних рішень: виключення досліджень із високим ризиком упередження, альтернативного оцінювача τ², іншої коректної моделі, видалення явно впливового дослідження або іншого наперед визначеного сценарію. Мета не полягає в тому, щоб знайти варіант, який дає бажаний результат, а в тому, щоб перевірити залежність висновку від припущень.
Коли висока гетерогенність означає, що результати не слід об’єднувати
Універсальної межі I² для заборони кількісного об’єднання немає. Рішення залежить від змістовної сумісності досліджень і від того, чи має об’єднаний параметр чітке значення. Якщо дослідження відповідають різним питанням, змішують несумісні результати або популяції, які не утворюють осмисленої сукупності, статистичне усереднення може створити число без корисного референта.
Інколи об’єднання залишається корисним навіть за істотної гетерогенності, якщо середній ефект має чітку інтерпретацію, джерела варіації описані, предиктивний інтервал показує розкид, а автори не приховують контекстну залежність. В інших ситуаціях кращим результатом є структурований опис без однієї об’єднаної оцінки.
Це пов’язує тему гетерогенності з ширшою логікою систематичного огляду: метааналіз є методом кількісного синтезу, а не обов’язковим фіналом кожного огляду.
Гетерогенність і GRADE: неузгодженість (inconsistency) як домен певності доказів
У GRADE неузгодженість є одним із доменів, які можуть зменшувати певність у сукупності доказів. Але оцінювання не зводиться до автоматичного штрафу за I². Cochrane Handbook Chapter 14 рекомендує враховувати I², χ²/ Q, τ, перекриття довірчих інтервалів і схожість точкових оцінок, а також шукати пояснення неоднорідності.
Сучасний GRADE Book формулює ще сильніше: I² і Q є попередніми статистичними індикаторами, тоді як головне судження стосується того, чи потрапляють ефекти окремих досліджень у однакові або різні змістовні діапазони відносно заздалегідь визначених порогів.
Класичне керівництво Guyatt та співавторів також розглядає неузгодженість як окремий домен певності. Якщо важливу неоднорідність не вдається правдоподібно пояснити і вона змінює інтерпретацію ефекту, певність у висновку може знижуватися.
Поширені помилки інтерпретації
Помилка 1. «I² вище 50% означає, що метааналіз недостовірний». I² не є рейтингом якості і не має універсального порогового значення.
Помилка 2. «I² = 0% доводить, що всі істинні ефекти однакові». Особливо за малого числа досліджень даних може бути недостатньо, щоб виявити гетерогенність.
Помилка 3. «Значущий Q означає велику гетерогенність». Q тестує статистичну сумісність із відсутністю гетерогенності; за великої кількості точних досліджень він може виявити дуже малу абсолютну варіацію.
Помилка 4. «Незначущий Q означає однорідність». За малого k Q має низьку потужність.
Помилка 5. «Модель випадкових ефектів вирішує проблему гетерогенності». Модель ураховує міждослідницьку варіацію, але не робить несумісні дослідження сумісними і не пояснює джерела відмінностей.
Помилка 6. «Високий I² означає великий розкид істинних ефектів». I² не є абсолютною мірою розкиду; для цього важливі τ, τ² і предиктивний інтервал.
Помилка 7. «Низький I² означає, що об’єднаний ефект переноситься на всіх». Переносимість залежить від популяції, умов, дизайну та діапазону істинних ефектів.
Помилка 8. «Якщо дві підгрупи мають різну статистичну значущість, вони відрізняються». Потрібен прямий тест взаємодії або різниці між підгрупами.
Помилка 9. «Достатньо знайти модератор, який робить I² нижчим». Постфактум підбір підгруп може дати випадкове пояснення; потрібні попередні гіпотези, обмежена кількість аналізів і зовнішня правдоподібність.
Помилка 10. «Гетерогенність — те саме, що publication bias». Асиметрія, ефекти малих досліджень, risk of bias і міждослідницька варіація можуть взаємодіяти, але це різні поняття.
Що має бути у якісному звіті про гетерогенність
Для повної інтерпретації бажано подавати лісову діаграму і числові оцінки ефектів окремих досліджень; Q і його p-значення; I² із розумінням його невизначеності; τ² і метод його оцінювання; за можливості τ та предиктивний інтервал; обґрунтування вибору моделі фіксованого ефекту або моделі випадкових ефектів; наперед визначені аналізи модераторів; аналізи чутливості; вплив гетерогенності на певність у доказах.
Не менш важливо описати, що саме могло породити відмінності: популяції, способи вимірювання, дизайн, тривалість, умови, ризик упередження, дотримання протоколу втручання, різні контрольні умови або інші змістовні фактори. Самі числа не замінюють це пояснення.
Як читачеві швидко перевірити метааналіз
Почніть із питання, чи об’єднані дослідження справді відповідають одному достатньо вузькому питанню. Далі подивіться на лісову діаграму, а вже потім на I². Знайдіть τ² або предиктивний інтервал, якщо вони повідомлені. Перевірте, чи пояснюють автори джерела відмінностей і чи не обирають модель лише за порогом I². Подивіться, чи були підгрупи наперед визначені, чи це пошук пояснення після отримання результатів. Нарешті, перевірте, чи враховано неузгодженість в оцінці певності доказів.
Для прозорості самого звіту про систематичний огляд корисно окремо дивитися на PRISMA 2020. PRISMA допомагає зрозуміти, що автори повідомили про методи та результати, але не є автоматичним сертифікатом якості або правильності статистичної моделі.
FAQ
Що означає I² = 0%?
Це означає, що за наявними даними оцінена частка варіабельності, приписувана гетерогенності, дорівнює нулю. Це не доводить, що істинні ефекти абсолютно однакові. За малого числа або низької точності досліджень невизначеність може бути великою.
Що означає I² = 100%?
Це означає, що майже вся спостережувана варіабельність оцінок відносно похибки вибірки приписується гетерогенності. Але число не показує абсолютний розкид ефектів і саме по собі не говорить, наскільки відмінності клінічно або психологічно важливі.
Чи є I² = 50% універсальною межею високої гетерогенності?
Ні. Орієнтовні діапазони I² є контекстними підказками, а не нормативними пороговими значеннями. Важливість залежить від величини й напряму ефектів, кількості досліджень, точності, τ², предиктивного інтервалу та змісту питання.
Чим I² відрізняється від τ²?
I² є відносною характеристикою того, яку частку спостережуваної варіабельності пов’язують із гетерогенністю. τ² є оцінкою абсолютної міждослідницької дисперсії істинних ефектів на шкалі метааналітичного ефекту.
Чим τ відрізняється від τ²?
τ — квадратний корінь із τ². Якщо τ² є дисперсією між дослідженнями, то τ є стандартним відхиленням істинних ефектів і має ті самі одиниці, що й шкала ефекту.
Чи потрібно переходити на модель випадкових ефектів, якщо I² високий?
Не автоматично. Модель обирають за змістом дослідницького питання і припущеннями про істинні ефекти. Високе I² є інформацією про неузгодженість, але не алгоритмом вибору моделі.
Чи можна робити метааналіз за високої гетерогенності?
Іноді так, якщо дослідження змістовно сумісні, середній об’єднаний ефект має чітке значення, а варіацію прозоро описано. Інколи об’єднання недоречне, якщо один середній ефект не має змістовного референта. Рішення не повинно залежати від одного порогового значення I².
Що важливіше: I² чи предиктивний інтервал?
Вони відповідають на різні питання. I² характеризує відносний внесок гетерогенності у спостережувану варіабельність; предиктивний інтервал показує очікуваний діапазон істинних ефектів за моделлю. Для практичної інтерпретації розкиду предиктивний інтервал часто безпосередніший.
Чи високий I² знижує GRADE автоматично?
Ні. GRADE оцінює неузгодженість через сукупність ознак: напрям і величину точкових оцінок, перекриття інтервалів, статистичні показники та те, чи перетинають ефекти важливі пороги. Потрібне аргументоване судження, а не автоматичний штраф.
Чи може гетерогенність бути корисною?
Так. Вона може вказувати на модифікацію ефекту, відмінності між популяціями, контекстами або способами вимірювання. За правильної інтерпретації це не статистичний шум, а джерело наукової інформації.
Пов’язані статті
Джерела
Borenstein M, Higgins JPT, Hedges LV, Rothstein HR. Basics of meta-analysis: I² is not an absolute measure of heterogeneity. Research Synthesis Methods. 2017;8(1):5–18. doi:10.1002/jrsm.1230
Deeks JJ, Higgins JPT, Altman DG, McKenzie JE, Veroniki AA. Chapter 10: Analysing data and undertaking meta-analyses. Cochrane Handbook for Systematic Reviews of Interventions, version 6.5, updated November 2024. Cochrane
GRADE Working Group. Inconsistency. GRADE Book. GRADEpro
Guyatt GH, Oxman AD, Kunz R, et al. GRADE guidelines: 7. Rating the quality of evidence—Inconsistency. Journal of Clinical Epidemiology. 2011;64(12):1294–1302. doi:10.1016/j.jclinepi.2011.03.017
Higgins JPT, Thompson SG. Quantifying heterogeneity in a meta-analysis. Statistics in Medicine. 2002;21(11):1539–1558. doi:10.1002/sim.1186
Higgins JPT, Thompson SG, Deeks JJ, Altman DG. Measuring inconsistency in meta-analyses. BMJ. 2003;327:557–560. doi:10.1136/bmj.327.7414.557
IntHout J, Ioannidis JPA, Rovers MM, Goeman JJ. Plea for routinely presenting prediction intervals in meta-analysis. BMJ Open. 2016;6:e010247. doi:10.1136/bmjopen-2015-010247
Rücker G, Schwarzer G, Carpenter JR, Schumacher M. Undue reliance on I² in assessing heterogeneity may mislead. BMC Medical Research Methodology. 2008;8:79. doi:10.1186/1471-2288-8-79
Schünemann HJ, Higgins JPT, Vist GE, et al. Chapter 14: Completing ‘Summary of findings’ tables and grading the certainty of the evidence. Cochrane Handbook for Systematic Reviews of Interventions, version 6.5. Cochrane
Veroniki AA, Jackson D, Viechtbauer W, et al. Methods to estimate the between-study variance and its uncertainty in meta-analysis. Research Synthesis Methods. 2016;7(1):55–79. doi:10.1002/jrsm.1164
