Внутрішньокласовий коефіцієнт кореляції (ICC): як оцінюють надійність повторних і міжоцінювальних вимірювань
Оновлено: 6 днів тому
Український психологічний ХАБ · Опубліковано: 23 вересня 2026 · Редакційна політика
Коротка відповідь
Внутрішньокласовий коефіцієнт кореляції, або ICC (intraclass correlation coefficient), — це сімейство коефіцієнтів для оцінювання надійності кількісних вимірювань, коли одна й та сама характеристика вимірюється повторно, різними оцінювачами, приладами або за кількома умовами. ICC показує, наскільки добре вимірювання розрізняє об’єкти, людей чи інші одиниці на тлі варіації, яку створюють повторення, оцінювачі та похибка.
Головне правило: «ICC = 0,84» саме по собі є неповним результатом. Треба знати, яку модель ICC використано, чи оцінювали absolute agreement або consistency, чи стосується коефіцієнт одного вимірювання або середнього з кількох, скільки було повторів чи оцінювачів і який 95% довірчий інтервал. Класичні роботи Shrout і Fleiss та McGraw і Wong показують, що під назвою ICC існує кілька статистично різних коефіцієнтів. Практичний посібник Koo і Li окремо наголошує на необхідності називати обрану форму ICC повністю.
У психометрії ICC належить до доказів надійності/точності вимірювання, а не валідності. Надійний бал може відтворюватися стабільно й водночас не вимірювати той психологічний конструкт, який йому приписують. Сучасні Standards for Educational and Psychological Testing розглядають reliability/precision як характеристику результатів у конкретних умовах повторення процедури, а не як вічну властивість тесту.
Що саме вимірює ICC
Інтуїтивно ICC порівнює два джерела варіації. Перше — реальні відмінності між людьми, об’єктами або іншими «мішенями» вимірювання. Друге — відмінності, що виникають усередині тієї самої мішені через повторні вимірювання, оцінювачів, умови та випадкову похибку. Чим більша міжіндивідуальна або міжоб’єктна варіація відносно похибки, тим вищим зазвичай є ICC.
У найпростішій ідеї ICC нагадує відношення «варіація між мішенями / загальна релевантна варіація». Але універсальної однієї формули ICC немає. Залежно від дизайну в знаменник потрапляють різні компоненти: залишкова похибка, систематичні відмінності між оцінювачами або умовами, взаємодія «мішень × оцінювач» та інші складові. Саме тому правильний вибір форми ICC є частиною дослідницького питання, а не технічною дрібницею.
ICC є відносним показником надійності: він залежить не тільки від помилки вимірювання, а й від того, наскільки неоднорідна досліджувана вибірка. У дуже однорідній групі люди мало відрізняються одна від одної, тому навіть невелика похибка може займати велику частку загальної варіації й знижувати ICC. У різнорідній групі той самий абсолютний розкид помилок може дати значно вищий ICC. Цю властивість важливо враховувати при порівнянні досліджень.
Коли ICC доречний
ICC найчастіше застосовують до кількісних або квазікількісних підсумкових балів, коли одна й та сама величина оцінюється кілька разів. Типові задачі такі:
• тест-ретест надійність — той самий тест або шкалу проходять повторно за умов, коли цільовий конструкт має залишатися достатньо стабільним;
• міжоцінювальна надійність — кілька оцінювачів дають числові бали тим самим людям, записам, поведінковим епізодам або об’єктам;
• внутрішньооцінювальна надійність — той самий оцінювач повторює оцінювання;
• повторюваність приладу або процедури — ту саму кількісну характеристику вимірюють кілька разів;
• надійність середнього бала кількох оцінювачів — коли у практиці рішення справді ґрунтується на середньому з k незалежних оцінок.
Для категоріальних рішень на кшталт «так/ні», діагностичних категорій або номінальних класів ICC зазвичай не є природним вибором. Там доречні коефіцієнти узгодженості для категоріальних даних, зокрема κ Коена або інші κ-подібні статистики залежно від дизайну. ICC і κ Коена відповідають на споріднені питання про відтворюваність, але працюють з різними типами результатів і не є взаємозамінними.
Чому звичайна кореляція не замінює ICC
Коефіцієнт кореляції Пірсона або коефіцієнт Спірмена може бути дуже високим навіть тоді, коли два оцінювачі систематично дають різні абсолютні бали. Якщо другий оцінювач щоразу додає приблизно 10 балів до оцінки першого, ранжування людей може майже не змінитися, а кореляція залишиться близькою до 1. Для питання «чи отримує та сама людина той самий бал?» цього недостатньо.
Це класичне розрізнення між association і agreement. Bland і Altman показали, чому кореляція сама по собі не доводить взаємозамінність двох способів вимірювання. Для надійності кількісних повторних оцінок ICC може враховувати структуру похибки, а для аналізу величини абсолютних розбіжностей корисно додатково дивитися на різниці між вимірюваннями, зокрема за підходом Bland–Altman.
Отже, висока кореляція означає, що два набори балів змінюються разом. Висока абсолютна узгодженість означає сильнішу вимогу: ті самі об’єкти мають отримувати близькі числові значення.
ICC — це сімейство коефіцієнтів, а не одне число
Найпоширеніша логіка вибору ICC має три незалежні осі: статистична модель, визначення узгодженості та тип результату. Їх треба визначити до того, як число ICC стане інтерпретованим.
1. Модель: one-way, two-way random або two-way mixed
One-way random-effects model використовують у дизайнах, де для різних мішеней можуть діяти різні випадково вибрані оцінювачі або повтори, а окремий систематичний ефект конкретного оцінювача не моделюється як окрема загальна складова. Класичне позначення Shrout–Fleiss для одиничного вимірювання — ICC(1,1).
Two-way random-effects model відповідає дизайну, де ті самі оцінювачі або умови застосовані до всіх мішеней, а оцінювачів концептуально розглядають як вибірку з ширшої популяції подібних оцінювачів. Це дозволяє формулювати висновок ширше, ніж про конкретних людей, які брали участь у дослідженні. Для absolute agreement і одного вимірювання поширене позначення ICC(2,1).
Two-way mixed-effects model використовують, коли мішені розглядаються як випадкова вибірка, а конкретні оцінювачі або умови є фіксованими й висновок стосується саме їх. У системі Shrout–Fleiss ICC(3,1) традиційно відповідає двофакторній mixed-моделі для consistency одного вимірювання. Водночас система McGraw–Wong охоплює ширший набір форм, тому коротке позначення без словесного опису моделі може бути двозначним між програмами та статтями.
Практичне правило: у звіті краще писати не лише «ICC(2,1)», а повну форму, наприклад «two-way random-effects, absolute-agreement, single-measure ICC, 95% ДІ …». Це суттєво зменшує ризик неправильної інтерпретації.
2. Absolute agreement чи consistency
Absolute agreement вимагає близькості самих числових значень. Якщо один оцінювач систематично ставить вищі бали за іншого, це погіршує абсолютну узгодженість. Такий варіант природний, коли оцінювачі або повторні вимірювання мають бути взаємозамінними й той самий об’єкт повинен отримувати приблизно той самий бал.
Consistency ставить м’якшу вимогу: головне, щоб відносний порядок мішеней зберігався. Систематичний зсув середнього між оцінювачами може не каратися так само, як при absolute agreement. Тому consistency може бути високим навіть тоді, коли один оцінювач стабільно ставить усім вищі бали.
Для клінічного або іншого індивідуального вимірювання часто важлива саме абсолютна узгодженість. Для задачі, де значення має стабільне ранжування, consistency може відповідати меті краще. Вибір визначає питання дослідження, а не те, який варіант дає красивіше число.
3. Single measure чи average measure
Single-measure ICC оцінює надійність одного окремого вимірювання або одного оцінювача. Він потрібен, якщо в реальній практиці рішення прийматиметься за одним вимірюванням.
Average-measure ICC оцінює надійність середнього з k вимірювань або оцінювачів. Усереднення часто підвищує надійність, бо випадкові помилки частково взаємно компенсуються. Але таке число можна використовувати лише тоді, коли практичний результат справді буде середнім саме з відповідної кількості оцінок. Високий ICC(2,k) не доводить, що один окремий оцінювач надійний.
Найуживаніші позначення ICC
Позначення Shrout–Fleiss допомагає швидко прочитати модель і тип результату. Найчастіше зустрічаються такі форми:
• ICC(1,1): one-way random-effects, один вимір;
• ICC(1,k): one-way random-effects, середнє з k вимірювань;
• ICC(2,1): two-way random-effects, у класичному записі — absolute agreement для одного вимірювання;
• ICC(2,k): two-way random-effects, absolute agreement для середнього з k вимірювань;
• ICC(3,1): two-way mixed-effects, у класичному записі — consistency для одного вимірювання;
• ICC(3,k): two-way mixed-effects, consistency для середнього з k вимірювань.
McGraw і Wong описали десять комбінацій моделі, типу та визначення, включно з варіантами two-way random і two-way mixed для consistency та absolute agreement. Через це програмні пакети можуть показувати назви, які не повністю збігаються з короткою системою ICC(1/2/3, 1/k). Надійний звіт завжди дублює цифровий код словесним описом. До оригінальної роботи McGraw–Wong опубліковано також офіційне виправлення.
Формула ICC: що стоїть за коефіцієнтом
Усі класичні ICC можна зрозуміти як коефіцієнти, побудовані з компонентів дисперсії. У позначеннях ANOVA часто використовують MSR — mean square between rows/targets, MSC — mean square between columns/raters or conditions, MSE — residual error mean square, MSW — within-target mean square, n — кількість мішеней, k — кількість оцінювачів або повторів. Точні назви залежать від конкретної моделі.
Для one-way random, single-measure моделі поширена форма: ICC(1,1) = (MSR − MSW) / [MSR + (k − 1)MSW]. Вона порівнює варіацію між мішенями з варіацією всередині мішені.
Для two-way random, absolute-agreement, single-measure моделі: ICC(2,1) = (MSR − MSE) / [MSR + (k − 1)MSE + k(MSC − MSE)/n]. Додатковий компонент, пов’язаний з оцінювачами або умовами, означає, що систематична різниця між ними погіршує absolute agreement.
Для two-way mixed, consistency, single-measure моделі: ICC(3,1) = (MSR − MSE) / [MSR + (k − 1)MSE]. У цій формі систематичний головний ефект оцінювача не входить до знаменника так, як у absolute-agreement варіанті, тому стабільний зсув рівня може залишати consistency високою. Формули й відповідність позначень узагальнені в Koo і Li.
Ці формули не слід перетворювати на універсальний рецепт для будь-яких даних. У складних або незбалансованих дизайнах ICC часто оцінюють через компоненти дисперсії змішаних моделей; головним залишається відповідність моделі реальному джерелу повторюваності.
Простий приклад: висока consistency не гарантує absolute agreement
Уявімо, що оцінювач A ставить п’ятьом учасникам бали 10, 20, 30, 40 і 50, а оцінювач B — 20, 30, 40, 50 і 60. Порядок учасників повністю однаковий: той, хто має найнижчий бал у A, має найнижчий і в B; те саме для всіх інших. З погляду consistency це майже ідеальна ситуація.
Але кожен бал B систематично на 10 пунктів вищий. Якщо оцінювачі мають бути взаємозамінними й 30 балів повинні означати приблизно те саме незалежно від того, хто оцінював, така різниця є реальною проблемою agreement. Саме тому перед аналізом треба вирішити, чи дослідження захищає порядок людей або абсолютні значення.
Передумови та діагностика даних
ICC успадковує припущення статистичної моделі, з якої його обчислюють. Для класичних ANOVA-підходів важливі незалежність мішеней, коректна структура повторних вимірювань, адекватне представлення джерел варіації та відсутність грубих помилок даних. При побудові класичних довірчих інтервалів додаткового значення набувають розподільчі припущення моделі.
Викиди можуть істотно змінювати компоненти дисперсії і, відповідно, ICC. Автоматичне видалення «незручних» спостережень після перегляду коефіцієнта створює іншу проблему — аналітичну упередженість. Правильніше перевірити первинні дані, задокументувати правила обробки викидів, провести обґрунтований sensitivity analysis і показати, наскільки висновок залежить від окремих випадків.
Так само високий ICC не підтверджує, що між повтореннями немає систематичного тренду. Перед reliability-аналізом або разом із ним варто оглянути розподіл різниць, середні за сесіями чи оцінювачами та графіки парних вимірювань. Це допомагає відрізнити випадкову похибку від стабільного зсуву.
ICC у системі інших показників
Різні статистики відповідають на різні питання, тому корисно тримати їх в одній карті:
• Pearson r — наскільки два кількісні показники пов’язані лінійно; не є показником absolute agreement.
• Spearman ρ — наскільки стабільний монотонний ранговий зв’язок; також не доводить absolute agreement.
• ICC — наскільки надійно кількісні повторні або міжоцінювальні вимірювання розрізняють мішені в заданій моделі.
• Cohen’s κ та споріднені κ — узгодженість категоріальних оцінок з поправкою на очікуваний випадковий збіг; це інша шкала даних і інша модель.
• Bland–Altman — величина й структура розбіжностей між двома способами або повтореннями вимірювання в одиницях самої шкали.
• SEM — типова абсолютна похибка вимірювання в одиницях шкали за визначеної моделі.
• MDC — величина зміни, що має перевищити очікувану похибку, щоб її можна було інтерпретувати як статистично відмінну від measurement error за заданим рівнем впевненості.
Сильне дослідження reliability часто використовує не один «улюблений» коефіцієнт, а набір показників, кожен із яких закриває власне питання: відносну здатність розрізняти людей, абсолютну похибку, систематичний bias і невизначеність оцінки.
Як обрати правильний ICC: практичний алгоритм
Вибір можна пройти як послідовність запитань.
• Крок 1. Який тип результату? Якщо це кількісний бал або інша числова величина, ICC може бути доречним. Для номінальної категорії зазвичай потрібна інша статистика узгодженості.
• Крок 2. Хто або що є мішенню? Визначте одиницю, яку треба надійно розрізняти: людину, відеозапис, клінічний випадок, тестовий протокол, зразок тощо.
• Крок 3. Чи всі мішені оцінювалися тими самими оцінювачами або умовами? Це впливає на one-way чи two-way модель.
• Крок 4. Чи потрібно узагальнювати результат на ширшу популяцію оцінювачів? Якщо так, random-effects формулювання часто природніше. Якщо ці конкретні оцінювачі є єдиними, хто цікавить дослідника, може відповідати mixed-effects модель.
• Крок 5. Чи мають збігатися абсолютні значення? Якщо так, обирайте absolute agreement. Якщо дослідницька мета допускає систематичні відмінності рівня й потребує лише стабільного порядку, розглядайте consistency.
• Крок 6. На практиці буде одна оцінка чи середнє з k оцінок? Від цього залежить single або average measure.
• Крок 7. Яка невизначеність оцінки? Заздалегідь плануйте 95% довірчий інтервал і розмір вибірки, а не лише точкове значення ICC.
Цей алгоритм важливіший за запам’ятовування «правильної» цифри в дужках. Один і той самий набір даних може дати різні ICC залежно від обраної моделі й того, яке практичне питання ви ставите.
ICC у тест-ретест дослідженні
У тест-ретест дизайні той самий інструмент застосовують повторно до тих самих людей. Ідея полягає в тому, щоб оцінити відтворюваність балів за умови, що сам конструкт між вимірюваннями суттєво не змінився. Якщо люди реально змінилися, ICC змішує нестабільність інструмента зі справжньою зміною конструкта.
Інтервал між тестуваннями не має універсально «правильної» тривалості. Він повинен бути достатнім, щоб зменшити ефект запам’ятовування відповідей, і водночас достатньо коротким, щоб цільова характеристика залишалася стабільною. Для настрою, гострих симптомів, навичок після тренування і стійких рис цей компроміс буде різним. Умови адміністрації також мають бути максимально порівнюваними.
У COSMIN Manual v2.0 для безперервних балів ICC рекомендовано як основний коефіцієнт reliability; для test-retest у ситуації, де важливо врахувати систематичну зміну, перевага надається agreement-ICC, а не простій кореляції чи consistency-коефіцієнту. Це відображає ключову ідею: якщо повторне вимірювання систематично стало вищим, це може бути проблемою відтворюваності абсолютних балів, навіть коли порядок людей зберігся.
Якщо між сесіями можлива навчальна дія, терапевтичний ефект, сезонність або реальна клінічна зміна, це треба враховувати в дизайні. Висновок «тест ненадійний» може бути неправильним, якщо змінився сам вимірюваний стан. І навпаки, висока кореляція не виправдовує ігнорування систематичного зсуву.
ICC у міжоцінювальній надійності
У міжоцінювальному дизайні кілька людей оцінюють ті самі об’єкти. Для кількісного бала ICC дозволяє оцінити, наскільки варіація між мішенями перевищує варіацію через оцінювачів та похибку. Тут особливо важливо заздалегідь вирішити, чи оцінювачі є взаємозамінними представниками ширшої популяції, чи саме ці конкретні експерти становлять систему, яка буде використовуватися надалі.
Приклад: якщо у клінічній службі будь-який підготовлений фахівець має давати взаємозамінний числовий бал, логічно перевіряти модель, що дозволяє узагальнення на подібних оцінювачів і штрафує систематичні відмінності. Якщо дослідження цікавиться лише узгодженістю конкретної фіксованої групи експертів, модель може бути іншою.
Перед обчисленням ICC також варто стандартизувати інструкції, навчання оцінювачів, порядок оцінювання й доступну їм інформацію. Високий коефіцієнт після інтенсивного спільного тренування описує надійність саме такого режиму роботи; його не можна автоматично переносити на непідготовлених оцінювачів.
Надійність і похибка вимірювання: чому ICC недостатньо
ICC відповідає на питання, наскільки надійно можна розрізняти мішені в конкретній популяції. Він не показує безпосередньо, скільки балів становить типова абсолютна похибка. Тому ICC не слід ототожнювати з measurement error.
Для абсолютної похибки використовують інші показники, зокрема стандартну похибку вимірювання (SEM) та похідні від неї межі мінімально виявлюваної зміни (MDC). SEM тут означає standard error of measurement, а не standard error of the mean. Це різні статистичні поняття.
У повторних вимірюваннях два інструменти або два оцінювачі можуть мати високий ICC у дуже різнорідній вибірці й водночас давати розбіжності, які практично неприйнятні для індивідуального рішення. Тому для задач абсолютної взаємозамінності корисно доповнювати ICC аналізом величини розбіжностей, наприклад графіком і межами узгодженості Bland–Altman, а також показниками measurement error.
Так само MDC не дорівнює мінімально важливій зміні MIC/MID. MDC описує поріг, за яким зміна з достатньою статистичною впевненістю перевищує очікувану похибку вимірювання; MIC/MID стосується важливості зміни для людини або клінічного контексту. Надійний інструмент ще не гарантує, що зафіксована зміна є важливою.
Як тлумачити значення ICC
Чим ближчий ICC до 1, тим більша частка релевантної варіації пов’язана з реальними відмінностями між мішенями порівняно з помилкою, визначеною конкретною моделлю. Але універсального порогу «хорошого ICC» не існує.
Koo і Li запропонували часто цитовану евристику: нижче 0,50 — poor, 0,50–0,75 — moderate, 0,75–0,90 — good, вище 0,90 — excellent. Це зручний описовий орієнтир, а не універсальний стандарт придатності. Schober, Mascha і Vetter підкреслюють, що пороги для статистичних показників залежать від наукового та клінічного контексту і мають застосовуватися обережно.
Для високоризикового індивідуального рішення вимоги до точності можуть бути значно жорсткішими, ніж для описового групового дослідження. Вимірювання, достатнє для порівняння середніх у дослідженні, може бути недостатнім для рішення щодо конкретної людини. Критерій прийнятності треба обґрунтовувати наслідками помилки, метою вимірювання, популяцією і доступними альтернативами.
Чому треба дивитися на 95% довірчий інтервал
Точковий ICC — це оцінка за вибіркою, а не відоме безпомилкове число. У невеликому дослідженні ICC 0,82 може мати широкий 95% довірчий інтервал, який охоплює як слабку, так і високу надійність. Тоді саме невизначеність є центральною частиною результату.
У звіті слід подавати ICC разом із 95% довірчим інтервалом і зазначати, як його обчислено. Якщо нижня межа інтервалу падає нижче за попередньо визначений прийнятний рівень, висновок «надійність достатня» може бути занадто сильним, навіть коли точкова оцінка виглядає високою.
Для планування дослідження немає універсального правила «30 учасників достатньо». Огляд Mondal та співавторів показує, що потрібний розмір вибірки залежить від очікуваного ICC, кількості повторів або оцінювачів, бажаної точності чи ширини довірчого інтервалу та обраного методу. Якщо reliability є основною кінцевою точкою, розмір вибірки доцільно планувати формально.
Чому ICC може бути низьким у «хорошого» інструмента
Низький ICC не завжди означає, що прилад або тест дає великі абсолютні помилки. Найвідоміший випадок — однорідна вибірка. Якщо всі учасники дуже схожі за цільовою характеристикою, між ними мало справжньої варіації, тому навіть невеликий шум займає велику частку загальної дисперсії. ICC знижується.
Зворотна ситуація також можлива: дуже різнорідна вибірка створює великий міжіндивідуальний розкид і підвищує ICC, хоча абсолютна похибка окремого вимірювання залишається помітною. Саме тому порівнювати ICC двох досліджень без урахування діапазону та складу вибірок небезпечно.
Сучасний оглядовий праймер 2026 року також нагадує, що ICC залежить від гетерогенності вибірки та може бути оманливо низьким у вузькому діапазоні балів. Надійність слід описувати для конкретної популяції й умов, а не переносити механічно на всіх можливих користувачів тесту.
Чи може ICC бути від’ємним
Так, вибіркова оцінка ICC може бути від’ємною. Це трапляється, коли оцінені внутрішньомішеневі або залишкові компоненти варіації настільки великі відносно міжмішеневої варіації, що математичний оцінювач виходить нижче нуля. Це сигнал дуже слабкої відтворюваності, нестабільної оцінки або проблем дизайну, а не «мінусова надійність» у побутовому сенсі.
Деякі практичні інтерпретації прирівнюють негативний ICC до нульової корисної надійності, але сам факт негативної оцінки варто повідомляти, а не приховувати. Потрібно перевірити дані, модель, розмір вибірки, структуру повторів і можливі систематичні проблеми.
ICC, α Кронбаха і внутрішня узгодженість
ICC не слід автоматично ототожнювати з α Кронбаха. Альфа описує внутрішню узгодженість набору пунктів за певних припущень, тоді як ICC у reliability-дизайнах часто оцінює повторюваність у часі або між оцінювачами. Деякі математичні форми мають зв’язки між собою, але це не робить показники концептуально взаємозамінними.
Висока внутрішня узгодженість не доводить тест-ретест стабільність, так само як високий тест-ретест ICC не доводить одновимірність шкали, конструктну валідність або коректність інтерпретації балів. Кожна властивість потребує власних доказів.
ICC не є валідністю, діагностичною точністю або клінічною корисністю
ICC оцінює reliability у визначеному дизайні. Він не відповідає на питання, чи вимірює тест задуманий конструкт, чи правильно встановлено діагностичний cutoff, чи тест відрізняє людей зі станом від людей без нього, і чи його застосування покращує рішення або результати.
Тому високий ICC не можна подавати як доказ «валідності тесту взагалі». Валідність стосується обґрунтованості інтерпретацій і використань балів. Діагностичні sensitivity та specificity оцінюють інше питання. Responsiveness до змін також є окремою властивістю. Один коефіцієнт не замінює всю систему психометричних доказів.
Типові помилки під час використання ICC
• Повідомляти лише «ICC = 0,87» без моделі, agreement/consistency, single/average та 95% ДІ.
• Обирати форму ICC після перегляду результатів, щоб отримати найбільше число.
• Використовувати consistency, коли практична задача вимагає абсолютної взаємозамінності оцінювачів.
• Звітувати average-measure ICC, хоча в реальній практиці рішення приймає один оцінювач.
• Використовувати кореляцію Пірсона або Спірмена як єдиний доказ agreement.
• Застосовувати ICC до категоріального результату без обґрунтування шкали й моделі.
• Вважати поріг 0,75 або 0,90 універсальним «прохідним балом» для будь-якого тесту.
• Ігнорувати ширину 95% довірчого інтервалу.
• Порівнювати ICC між вибірками з різною гетерогенністю так, наче це чиста властивість інструмента.
• Ігнорувати систематичний зсув між повторними вимірюваннями, ефект навчання або реальну зміну стану.
• Плутати високий ICC із малою абсолютною похибкою, валідністю або клінічною важливістю.
Як правильно звітувати ICC
Мінімально повний звіт про ICC повинен дозволити іншому досліднику зрозуміти, що саме було оцінено й відтворити аналіз. Практично варто вказати:
• який об’єкт або бал оцінювали та в якій популяції;
• кількість учасників, оцінювачів і повторних вимірювань;
• дизайн: test-retest, inter-rater, intra-rater, device repeatability тощо;
• модель: one-way random, two-way random або two-way mixed;
• визначення: absolute agreement або consistency;
• тип: single measure або average measure і точне k для усереднення;
• точковий ICC та 95% довірчий інтервал;
• метод роботи з пропущеними або незбалансованими даними;
• статистичне програмне забезпечення і, бажано, конкретну процедуру/пакет;
• будь-які систематичні відмінності між повтореннями або оцінювачами;
• додатковий показник абсолютної похибки або agreement, якщо він потрібен для практичного рішення.
Приклад коректного формулювання: «Міжоцінювальну надійність оцінено за two-way random-effects, absolute-agreement, single-measure ICC; ICC = 0,82, 95% ДІ [0,70; 0,90]». Таке речення набагато інформативніше за «між оцінювачами була висока кореляція».
Що робити з пропущеними та незбалансованими даними
Класичні ANOVA-формули ICC найпростіше працюють у збалансованому дизайні, де кожна мішень має однакову кількість оцінок від заданого набору оцінювачів. Реальні дані часто містять пропуски, різну кількість повторів або вкладені структури.
У таких ситуаціях механічне видалення всіх неповних випадків може змінити вибірку і зменшити точність. Варіант на основі змішаних моделей може бути доречнішим, бо дозволяє безпосередньо оцінювати компоненти дисперсії за складнішої структури даних. Але тоді дослідник повинен чітко описати модель, оцінювані компоненти та те, як із них побудовано коефіцієнт reliability.
Якщо дизайн має кілька джерел похибки — наприклад, оцінювачі, дні, завдання і їхні взаємодії — одного традиційного ICC може бути замало. Теорія генералізованості дозволяє розкладати кілька «фасетів» варіації окремо й оцінювати, як зміниться надійність за іншої кількості завдань, оцінювачів або сесій.
Практичні наслідки для психологічних тестів
Для психологічного вимірювання ICC особливо корисний там, де бал має відтворюватися між часовими точками або оцінювачами. Але якісний висновок завжди стосується конкретної версії інструмента, мови, популяції, умов проведення і способу підрахунку бала.
Якщо україномовна адаптація шкали демонструє високий ICC у певній вибірці, це є доказом reliability у цьому дизайні. Це не означає автоматично, що переклад має повну кроскультурну валідність, що норми репрезентативні для України або що клінічний cutoff переноситься без окремої перевірки. Translation і validated cultural adaptation — різні речі.
Для рішень щодо окремої людини корисно поєднувати відносну reliability з абсолютною похибкою, релевантними нормами, валідністю інтерпретації та контекстом застосування. Один ICC не перетворює скринінговий бал на діагноз і не встановлює клінічної значущості зміни.
FAQ
Який ICC вважається хорошим?
Універсальної межі немає. Часто цитують евристику Koo–Li: <0,50 poor, 0,50–0,75 moderate, 0,75–0,90 good, >0,90 excellent, але ці категорії не є універсальним стандартом придатності. Потрібні контекст, 95% ДІ, наслідки помилки і мета вимірювання.
Що краще: ICC(2,1) чи ICC(3,1)?
Жоден не є «кращим взагалі». ICC(2,1) у класичному Shrout–Fleiss записі відповідає two-way random, absolute agreement для одного вимірювання; ICC(3,1) — two-way mixed, consistency для одного вимірювання. Вибір залежить від того, чи треба узагальнювати на інших оцінювачів і чи важлива абсолютна рівність балів.
Чи достатньо високого ICC для доказу agreement?
Ні, якщо практично важлива величина розбіжності в одиницях шкали. ICC корисно доповнювати показниками absolute measurement error і, за потреби, аналізом Bland–Altman.
Чому два дослідження того самого тесту мають різні ICC?
Через різний склад і гетерогенність вибірок, різний інтервал test-retest, кількість оцінювачів, інструкції, навчання, модель ICC, спосіб усереднення, пропущені дані та реальні відмінності умов. ICC не є незмінною паспортною характеристикою тесту.
Чи можна використовувати ICC для шкали Лайкерта?
Для підсумкового багатопунктового бала, який аналізують як приблизно кількісний, ICC часто застосовують, якщо це відповідає моделі даних і меті. Для одного порядкового пункту з малою кількістю категорій часто природнішими є статистики для ordinal/categorical agreement, наприклад зважена κ.
Чи може consistency ICC бути високим при систематичній різниці між оцінювачами?
Так. Якщо один оцінювач стабільно ставить усім вищі бали, порядок мішеней може зберігатися, тому consistency залишається високим. Absolute-agreement ICC сильніше штрафує такий систематичний зсув.
Чи треба повідомляти p-value для ICC?
Для оцінювання reliability ключовішими є точкова оцінка, 95% довірчий інтервал і наперед обґрунтований критерій практичної достатності. Тест нульової гіпотези ICC = 0 може стати статистично значущим навіть для коефіцієнта, який практично недостатній.
Чи означає ICC 0,90, що похибка становить 10%?
Ні. ICC — це відношення компонентів варіації, а не відсоток абсолютної помилки шкали. Для величини похибки в одиницях вимірювання потрібні SEM, межі agreement або інші відповідні показники.
Чи ICC показує, що зміна в однієї людини є реальною?
Сам ICC — ні. Для цього потрібен показник measurement error і поріг на кшталт MDC або інша модель індивідуальної зміни. Навіть зміна, що перевищує похибку, ще не обов’язково є clinically або personally important.
Пов’язані статті
Каппа Коена: як оцінюють узгодженість категоріальних оцінок і чому κ може вводити в оману — коефіцієнт для категоріальних рішень; корисний для розрізнення κ та ICC.
Міжоцінювальна надійність: як оцінюють узгодженість між експертами, спостерігачами або клініцистами — ширша measurement property, для якої ICC є одним з основних коефіцієнтів у кількісних даних.
Коефіцієнт кореляції Спірмена: що показує ρ, коли застосовувати і як інтерпретувати — корисно для розуміння різниці між асоціацією/ранговим зв’язком і reliability або absolute agreement.
Надійність психологічного тесту: що це, які бувають види і чому надійність не дорівнює валідності — ширша рамка, у якій ICC є одним зі способів оцінювання надійності повторних або міжоцінювальних вимірювань.
