Міжоцінювальна надійність: як оцінюють узгодженість між експертами, спостерігачами або клініцистами
Автор: Український психологічний ХАБ · Опубліковано: 23 вересня 2026 · Редакційна політика
Коли двоє клініцистів незалежно оцінюють те саме інтерв’ю, кілька експертів кодують одну й ту саму поведінку або спостерігачі виставляють бали за спільною шкалою, важливо знати, наскільки результат залежить від того, хто саме оцінював. Міжоцінювальна надійність описує відтворюваність оцінок між різними оцінювачами, які працюють з тим самим об’єктом, випадком або матеріалом.
Американська психологічна асоціація визначає interrater reliability як ступінь, до якого незалежні оцінювачі дають подібні оцінки тим самим характеристикам того самого об’єкта. APA Dictionary of Psychology також наводить близькі назви: intercoder, interjudge, interobserver та interscorer reliability. У сучасній українській професійній мові трапляються назви «міжекспертна надійність», «надійність між оцінювачами», «надійність взаємного оцінювання» та «узгодженість між спостерігачами». У цій статті «міжоцінювальна надійність» використовується як узагальнювальна назва.
Це не один універсальний коефіцієнт. Спосіб оцінювання залежить від типу даних, кількості оцінювачів, дизайну дослідження, того, чи цікавить абсолютний збіг або лише послідовність, і від того, на який рівень — окремого оцінювача чи середнє кількох оцінювачів — планують поширювати висновок.
Що таке міжоцінювальна надійність
Міжоцінювальна надійність — це властивість результатів вимірювання, яка показує, наскільки стабільно різні оцінювачі розрізняють об’єкти оцінювання за умови, що оцінюють той самий феномен за порівнюваною процедурою. Вона потрібна там, де частина вимірювання залежить від людського судження: клінічного інтерв’ю, поведінкового кодування, оцінювання виконання завдання, експертної класифікації, аналізу тексту або відео, суддівського бала.
У термінології COSMIN надійність охоплює повторне вимірювання за різних умов; одна з таких умов — оцінювання різними людьми в той самий момент. Важливе уточнення: надійність і agreement — узгодженість або збіг — пов’язані, але відповідають на різні статистичні запитання.
Міжоцінювальна надійність є established measurement property: це усталена частина психометрії, клінічних вимірювань, поведінкових досліджень і досліджень діагностичної відтворюваності. Вона не є діагнозом, клінічним критерієм або окремою характеристикою людини.
Надійність і узгодженість — близькі, але не тотожні поняття
Робота de Vet та співавторів розводить два запитання. Показники agreement оцінюють, наскільки близькими є повторні результати — тобто абсолютну величину розбіжності та похибки. Показники reliability оцінюють, чи можна за наявної похибки розрізняти людей або інші об’єкти між собою. De Vet et al., 2006 підкреслюють, що коефіцієнт надійності залежить також від неоднорідності вибірки.
Це пояснює парадоксальну на перший погляд ситуацію: два оцінювачі можуть мати невеликі абсолютні розбіжності, але невисокий коефіцієнт надійності в дуже однорідній вибірці, де люди майже не відрізняються між собою. І навпаки, у дуже різнорідній вибірці високий коефіцієнт може співіснувати з розбіжностями, які для клінічного рішення вже є небажаними.
Тому в дослідженні потрібно заздалегідь визначити, що є головним: відтворюване розрізнення між об’єктами, абсолютний збіг значень чи обидва аспекти. Один показник не завжди закриває обидва запитання.
Коли міжоцінювальна надійність справді потрібна
Клінічні інтерв’ю та діагностичні класифікації, якщо різні фахівці незалежно визначають наявність, категорію або тяжкість ознак.
Поведінкове спостереження, коли дослідники кодують частоту, тривалість або категорію поведінкових подій.
Експертні шкали, де фахівці присвоюють ступінь вираженості, якість виконання або рівень ризику.
Контент-аналіз, коли кодери класифікують фрагменти тексту, аудіо, зображень чи відео.
Освітнє та професійне оцінювання, якщо відповіді, есе, портфоліо або поведінку оцінюють кілька екзаменаторів.
Наукові огляди та експертні процедури, якщо рішення потребує незалежного кодування за правилами.
Якщо результат формується повністю автоматизованим алгоритмом і в процедурі немає оцінювача, питання міжоцінювальної надійності може не виникати. Але якщо алгоритм порівнюють із людськими оцінювачами, це вже окремий дизайн agreement/reliability study, а не автоматичне підтвердження валідності алгоритму.
Що саме може створювати розбіжності між оцінювачами
Розбіжність не зводиться до «неуважності експертів». Вона може відображати нечітке операціональне визначення, неоднозначні категорії, різний доступ до інформації, відмінні пороги рішення, різний рівень підготовки, втому, складність випадку або нестандартні умови спостереження.
Неоднозначна інструкція: різні люди по-різному трактують, що саме слід зараховувати до категорії.
Різні пороги: один клініцист ставить категорію при слабшому прояві, інший — лише при виразному.
Різна шкала суворості: один оцінювач систематично ставить вищі або нижчі бали.
Різний контекст: оцінювачі бачать різні епізоди поведінки або мають неоднаковий обсяг інформації.
Дрейф оцінювання: після тривалої роботи критерії поступово змінюються, навіть якщо початкове навчання було однаковим.
Зміна самого об’єкта: якщо людина або ситуація реально змінюється між оцінюваннями, це вже не чисте порівняння оцінювачів.
Як планують дослідження міжоцінювальної надійності
Надійність неможливо коректно оцінити лише вибором формули наприкінці. GRRAS та методичні роботи з цієї теми наголошують, що дизайн, добір об’єктів, добір оцінювачів і статистичний аналіз мають бути узгоджені ще до збирання даних.
Визначити об’єкт оцінювання: люди, записи інтерв’ю, відео, клінічні випадки, тексти, зображення або інші одиниці.
Визначити шкалу даних: номінальні категорії, порядкові категорії, кількісний бал або безперервне значення.
Визначити, скільки оцінювачів працюватиме і чи ті самі оцінювачі оцінюватимуть усі об’єкти.
Заздалегідь вирішити, чи оцінювачі становлять фіксовану групу інтересу або вибірку з ширшої популяції потенційних оцінювачів.
Визначити, чи потрібен абсолютний збіг, чи достатня послідовність у ранжуванні.
Вирішити, чи майбутнє рішення ґрунтуватиметься на одному оцінювачі або на середньому кількох оцінювачів.
Забезпечити незалежність оцінювання: оцінювач не повинен бачити рішення іншого до завершення первинного кодування.
Запланувати довірчий інтервал і достатню точність оцінки, а не лише отримання одного коефіцієнта.
Для досліджень діагностичної відтворюваності корисно також оцінювати ризик упереджень: репрезентативність випадків та оцінювачів, засліплення, порядок оцінювання, інтервал між повторними оцінками й придатність статистики. Ці домени лежать в основі QAREL.
Який коефіцієнт обрати: спочатку тип даних, потім формула
Одна з найпоширеніших помилок — шукати «найкращий коефіцієнт міжоцінювальної надійності» без опису даних. Hallgren, 2012 показує, що вибір залежить від рівня вимірювання, дизайну, кількості оцінювачів і того, який саме висновок потрібен.
Відсоток збігу
Найпростіший опис — частка випадків, у яких оцінювачі дали однакову категорію. Він прозорий і часто корисний як доповнення. Проте сам по собі відсоток збігу не враховує структуру розподілу категорій і випадковий очікуваний збіг. Тому для категоріальних даних його часто подають разом із коефіцієнтом, що коригує або моделює очікуваний збіг.
Відсоток збігу не варто перетворювати на універсальну заміну каппі, ICC або іншим коефіцієнтам. Він відповідає на просте запитання «скільки рішень збіглося», але не розв’язує всі задачі надійності.
Каппа Коена для двох оцінювачів і номінальних категорій
Для двох оцінювачів, які незалежно відносять ті самі об’єкти до номінальних категорій, класичним показником є каппа Коена. Вона порівнює спостережуваний збіг із рівнем збігу, очікуваним за заданими маргінальними розподілами категорій.
Каппа Коена не є кореляцією і не описує валідність діагностичної категорії. Вона характеризує узгодженість двох оцінювачів у конкретному дизайні. Значення каппи потрібно інтерпретувати разом із частотами категорій, відсотком спостережуваного збігу та довірчим інтервалом.
Зважена каппа для порядкових категорій
Якщо категорії мають природний порядок — наприклад «немає», «легкий», «помірний», «виражений» — повна незгода між сусідніми категоріями може бути менш суттєвою, ніж незгода між крайніми. Зважена каппа Коена дозволяє призначати різну вагу різним ступеням розбіжності.
Вибір схеми ваг є частиною статистичного рішення і має бути вказаний у звіті. Не можна просто написати «weighted κ» без пояснення, як саме були зважені відмінності.
Каппа Флейса для кількох оцінювачів
Для номінальних категорій за участю кількох оцінювачів одним із класичних підходів є каппа Флейса. Її дизайн і припущення відрізняються від каппи Коена, тому назва «каппа» сама по собі ще не описує статистичну модель.
Внутрішньокласовий коефіцієнт кореляції — ICC
Для кількісних оцінок одним із головних інструментів є внутрішньокласовий коефіцієнт кореляції — ICC. Класична робота Shrout & Fleiss, 1979 показує, що існує кілька форм ICC, а вибір залежить від моделі та майбутнього застосування результату.
Сучасний практичний огляд Koo & Li, 2016 радить завжди називати конкретну форму ICC, а не повідомляти лише «ICC = ...». Для одного й того самого набору даних різні форми ICC можуть дати різні значення.
ICC не тотожний коефіцієнту Пірсона. Двоє оцінювачів можуть мати майже ідеальну кореляцію, якщо один завжди ставить на 10 балів більше за іншого. Ранжування людей збережеться, але абсолютного збігу оцінок не буде.
Альфа Кріппендорфа
Для кодування даних, особливо коли є більше двох оцінювачів, пропущені оцінки або різні рівні вимірювання, може бути корисною альфа Кріппендорфа. Матеріали Клауса Кріппендорфа і огляд Hallgren описують її як гнучкий показник для аналізу надійності кодування. Водночас вибір альфи має випливати з дизайну, а не з її універсальності.
AC1/AC2 Гвета та інші альтернативи
Каппа може поводитися контрінтуїтивно, коли одна категорія різко домінує або маргінальні розподіли оцінювачів суттєво різняться. Gwet, 2008 запропонував AC1 як альтернативний коефіцієнт для номінальних даних у ситуаціях високого збігу, де каппа може бути нестабільною. Для порядкових даних використовують споріднені зважені варіанти, зокрема AC2.
Це не означає, що при «низькій каппі» її слід автоматично замінити коефіцієнтом, який дасть більше число. Правильний підхід — показати розподіл категорій, спостережуваний збіг, пояснити властивості обраної статистики й за потреби провести обґрунтований аналіз чутливості.
Як обирають форму ICC
У системах Shrout–Fleiss і McGraw–Wong ICC є сімейством коефіцієнтів. McGraw & Wong, 1996 формалізують різні моделі та способи інференції. Для практичного читача важливі чотири рішення.
1. Однофакторна чи двофакторна модель
Однофакторна модель доречна, коли для різних об’єктів можуть використовуватися різні випадково вибрані оцінювачі і конкретний ефект кожного оцінювача неможливо відокремити. Двофакторна модель застосовується у повністю перехресному дизайні, коли ті самі оцінювачі оцінюють усі об’єкти.
2. Фіксовані чи випадкові оцінювачі
Якщо висновок має поширюватися на ширшу популяцію підготовлених оцінювачів, оцінювачів концептуально розглядають як випадковий фактор. Якщо цікавить лише конкретна фіксована група фахівців, інтерпретація інша. Це визначає межі узагальнення.
3. Absolute agreement чи consistency
Absolute agreement вимагає близькості самих чисел. Consistency допускає систематичний зсув між оцінювачами, якщо вони послідовно розташовують об’єкти в однаковому порядку. Для клінічних балів, які мають безпосередньо впливати на рішення, абсолютний збіг часто є змістовно важливішим.
4. Окремий оцінювач чи середнє кількох
Single-measures ICC відповідає на запитання про надійність одного оцінювача. Average-measures ICC — про надійність середнього бала кількох оцінювачів. Середнє кількох оцінок зазвичай може бути надійнішим, але його не можна використовувати як доказ того, що один окремий оцінювач працює так само надійно.
Отже, запис «ICC = 0,86» без моделі, типу, одиниці та довірчого інтервалу є неповним. Правильний звіт має дозволяти читачеві зрозуміти, що саме було оцінено.
Чому кореляція між оцінювачами не дорівнює узгодженості
Кореляція Пірсона вимірює силу лінійного зв’язку, а не близькість значень. Класична робота Bland & Altman, 1986 показала, чому кореляція може вводити в оману при оцінюванні agreement.
Уявімо, що два експерти оцінюють 20 випадків за шкалою 0–100. Другий експерт щоразу ставить рівно на 15 балів більше за першого. Кореляція може бути практично ідеальною, бо порядок випадків збережено. Але якщо поріг клінічного рішення дорівнює 60, ці 15 балів здатні змінити рішення для конкретної людини.
Тому питання «чи рухаються оцінки разом?» і «чи дають оцінювачі однакові значення?» потрібно розрізняти.
Каппа, поширеність категорій і так званий парадокс каппи
Каппа залежить не тільки від кількості збігів, а й від маргінальних розподілів категорій. Byrt, Bishop & Carlin, 1993 показали, що на значення κ можуть суттєво впливати поширеність категорій і систематична різниця між оцінювачами.
Наприклад, якщо майже всі випадки належать до однієї категорії, відсоток збігу може бути дуже високим, а каппа — значно нижчою, ніж інтуїтивно очікується. Це не арифметична помилка. Коефіцієнт відповідає на інше запитання, ніж простий відсоток збігу.
Практичний висновок: для категоріальних даних бажано повідомляти не лише κ, а й таблицю рішень або частоти категорій, спостережуваний збіг, довірчий інтервал та за потреби додатковий показник. Так читач бачить, чому коефіцієнт має саме таке значення.
Як інтерпретувати значення коефіцієнта
Для міжоцінювальної надійності немає універсальної магічної межі, після якої інструмент стає «надійним». Прийнятність залежить від того, що вимірюється, наскільки високі ставки рішення, які наслідки помилки і чи використовується оцінка для групових досліджень або індивідуальних клінічних рішень.
Для ICC часто цитують орієнтовні категорії з Koo & Li, 2016, але самі автори наголошують, що стандартного універсального порога прийнятності немає. Такі словесні категорії — практичні орієнтири, а не природні межі якості.
Замість того щоб читати лише точкове значення, перевірте щонайменше: 95% довірчий інтервал, розмір і різнорідність вибірки, кількість оцінювачів, дизайн, тип коефіцієнта, розподіл категорій або балів, а також те, для якого рішення потрібна надійність.
Чому ширина довірчого інтервалу має значення
Коефіцієнт 0,80 може виглядати переконливо, але якщо 95% довірчий інтервал простягається, наприклад, від низької до дуже високої надійності, дані ще не дають точного висновку. Невелика кількість випадків або оцінювачів робить оцінку нестабільнішою.
Тому планування розміру вибірки для reliability study має виходити з бажаної точності, очікуваного коефіцієнта, кількості оцінювачів і статистичної моделі. Правило «достатньо 30 людей» не є універсальним законом.
Міжоцінювальна надійність не дорівнює валідності
Надійність і валідність відповідають на різні запитання. Standards for Educational and Psychological Testing розглядають надійність/точність та валідність як окремі складові обґрунтованого використання результатів.
Двоє клініцистів можуть майже завжди погоджуватися і водночас однаково застосовувати хибне правило. Висока міжоцінювальна надійність свідчить про відтворюваність між оцінювачами, але сама по собі не доводить, що оцінюється потрібний конструкт, що класифікація правильна або що рішення корисне.
Так само низька надійність може робити сильні інтерпретації нестійкими, але не пояснює автоматично причину: проблема може бути в інструкції, підготовці оцінювачів, нечітких категоріях, складній популяції або невдалому дизайні дослідження.
Міжоцінювальна надійність у психодіагностиці
У клінічній практиці оцінювачами можуть бути психологи, психіатри, інші клініцисти або підготовлені дослідники. Надійність особливо важлива для структурованих і напівструктурованих інтерв’ю, клінічних рейтингових шкал та категоріальних рішень.
Висока узгодженість між клініцистами означає, що процедура дає відтворювані рішення за певних умов. Вона не перетворює окремий бал або категорію на діагноз. Діагностичне рішення потребує визначених критеріїв, професійної компетенції, релевантної інформації та клінічного контексту.
Скринінг, case-finding, клінічне оцінювання, діагноз, моніторинг і outcome measurement мають різні цілі. Коефіцієнт міжоцінювальної надійності не замінює чутливість, специфічність, прогностичні значення, валідність або клінічну корисність.
Мова, культура і fairness
Одна й та сама інструкція може працювати по-різному в різних мовних і культурних контекстах, особливо якщо оцінювачі інтерпретують поведінкові прояви, соціальні сигнали або відкриті відповіді. Тому міжоцінювальну надійність бажано перевіряти в цільовій популяції та в умовах, близьких до реального використання.
Переклад інструкції не є доказом валідованої культурної адаптації. Так само високий коефіцієнт між оцінювачами не доводить відсутність bias або справедливість процедури. Fairness потребує окремих доказів щодо змісту, інтерпретації, наслідків і можливих систематичних відмінностей між групами.
Measurement invariance, DIF і міжоцінювальна надійність — різні аналітичні питання. Один показник не можна використовувати як автоматичний доказ іншого.
Як підвищувати надійність оцінювання
Підвищення надійності починається не зі статистичного коефіцієнта, а зі стандартизації процесу. Мета полягає не в тому, щоб змусити експертів погодитися будь-якою ціною, а в тому, щоб зменшити небажану варіативність, яка не належить до самого об’єкта вимірювання.
Сформулювати операціональні визначення так, щоб оцінювачі однаково розуміли одиницю спостереження і межі категорій.
Підготувати кодбук або посібник з прикладами типових і межових випадків.
Провести навчання й калібрування на окремому наборі матеріалів, який не входить до основного аналізу.
Забезпечити незалежне первинне оцінювання, якщо мета — оцінити реальну міжоцінювальну надійність.
Періодично перевіряти дрейф оцінювачів у довгих дослідженнях.
Не приховувати складні випадки: саме вони часто показують, де правила потребують уточнення.
Документувати зміни інструкції та повторно перевіряти надійність після суттєвих змін.
Якщо оцінювачі обговорили кожен випадок і дійшли консенсусу, отриманий консенсус уже не є незалежною оцінкою міжоцінювальної надійності. Консенсус може бути корисним для фінального датасету або клінічного рішення, але первинний reliability analysis має спиратися на незалежні рішення.
Навчання оцінювачів і узагальнюваність
Ретельне навчання зазвичай зменшує випадкові розбіжності. Проте дуже інтенсивне навчання вузької групи експертів може обмежити узагальнюваність: показник описує саме цю підготовлену систему, а не будь-яких майбутніх користувачів.
Тому у звіті важливо описувати кваліфікацію оцінювачів, їхню підготовку, кількість тренувальних випадків і те, чи були вони типовими представниками майбутньої групи користувачів.
Типові статистичні помилки
Використовувати просту кореляцію Пірсона як доказ абсолютної узгодженості.
Писати «ICC» без зазначення моделі, типу та одиниці вимірювання.
Застосовувати каппу Коена до дизайну з кількома оцінювачами без пояснення процедури агрегування.
Застосовувати незважену каппу до порядкових категорій, не обґрунтувавши, чому всі розбіжності мають однакову вагу.
Повідомляти лише коефіцієнт без довірчого інтервалу.
Не показувати розподіл категорій, коли κ може залежати від сильної нерівномірності.
Розв’язувати всі незгоди консенсусом до розрахунку коефіцієнта і потім повідомляти штучно ідеальний збіг.
Оцінювати частину вибірки з явною зручністю, а потім без застережень переносити надійність на всі випадки.
Змішувати міжоцінювальну надійність із внутрішньою узгодженістю, ретестовою надійністю або надійністю паралельних форм.
Трактувати високий коефіцієнт як доказ валідності, точності діагнозу або справедливості процедури.
Міжоцінювальна надійність та інші види надійності
Внутрішня узгодженість відповідає на питання про взаємозв’язок пунктів усередині шкали. Ретестова надійність — про стабільність результатів у часі. Надійність паралельних форм — про відтворюваність між еквівалентними версіями інструменту. Міжоцінювальна надійність — про варіативність, пов’язану з різними оцінювачами.
Ці джерела похибки можуть існувати одночасно. Інструмент може мати високу внутрішню узгодженість і низьку міжоцінювальну надійність, якщо правила експертного оцінювання нечіткі. Або навпаки: оцінювачі можуть чудово погоджуватися щодо бала, але сама шкала не мати достатніх доказів валідності.
Для іншої задачі надійності — прогнозу, як зміниться reliability при зміні довжини тесту, — використовується формула Спірмена–Брауна. Вона не є показником міжоцінювальної узгодженості.
Три приклади вибору статистики
Приклад 1. Два клініцисти та категорія «так/ні»
Два клініцисти незалежно оцінюють ті самі 120 інтерв’ю і визначають наявність або відсутність конкретної ознаки. Дані номінальні, оцінювачів двоє. Базовий звіт може містити таблицю 2×2, відсоток збігу, каппу Коена та її довірчий інтервал. Якщо одна категорія дуже рідкісна, варто окремо показати розподіл рішень і не інтерпретувати κ без контексту.
Приклад 2. Двоє експертів і порядкова шкала 0–3
Двоє експертів оцінюють вираженість поведінки від 0 до 3. Категорії мають порядок, і різниця 0 проти 3 суттєвіша, ніж 2 проти 3. Тут природним кандидатом є зважена каппа. Якщо шкалу трактують як рейтингову шкалу з кількісною інтерпретацією, можна розглядати й ICC, але це рішення потребує обґрунтування властивостей даних.
Приклад 3. Три клініцисти і бал 0–100
Три клініцисти незалежно виставляють кількісний бал кожному пацієнтові. Якщо в реальній практиці рішення робитиме один випадково обраний підготовлений клініцист і потрібні близькі абсолютні бали, доречний ICC для single measures із моделлю, що відповідає дизайну, та absolute agreement. Якщо рішення завжди ґрунтується на середньому трьох фахівців, потрібно оцінювати average-measures reliability.
Як читати результат у науковій статті
Знайдіть, хто були оцінювачі і чи відповідають вони майбутнім користувачам інструменту.
Перевірте, чи всі оцінювали ті самі об’єкти і чи були рішення незалежними.
Визначте тип даних: номінальні, порядкові чи кількісні.
Перевірте точну назву коефіцієнта і його варіант.
Шукайте 95% довірчий інтервал, а не лише точкове значення.
Для категорій подивіться частоти і відсоток збігу; для числових оцінок — розподіл і можливі систематичні зсуви.
Перевірте, чи дослідження оцінювало reliability, agreement або обидва аспекти.
Не переносіть результат на іншу мову, культуру, професійну групу або умови без додаткових доказів.
Що рекомендують стандарти звітування
Guidelines for Reporting Reliability and Agreement Studies — GRRAS — були створені через те, що reliability/agreement studies часто недостатньо описували вибірку, дизайн і статистичний аналіз. Рекомендації охоплюють ключові елементи, які дають змогу зрозуміти, відтворити й критично оцінити дослідження.
Мету дослідження та те, чи йдеться про reliability, agreement, inter-rater або intra-rater design.
Характеристики об’єктів і спосіб їх добору.
Характеристики оцінювачів, їх добір і підготовку.
Процедуру оцінювання, засліплення та незалежність рішень.
Кількість повторних оцінок і часовий інтервал, якщо він є.
Обґрунтування статистичного коефіцієнта.
Точкову оцінку разом із показником статистичної невизначеності.
Обмеження і межі узагальнення.
Дотримання reporting guideline не робить дослідження автоматично якісним. Воно робить його прозорішим. Методологічну якість і ризик упереджень потрібно оцінювати окремо.
Практичний алгоритм вибору
Якщо дані номінальні та оцінювачів двоє: розгляньте Cohen’s κ плюс спостережуваний збіг і таблицю категорій.
Якщо дані порядкові та оцінювачів двоє: розгляньте weighted κ з наперед визначеною схемою ваг.
Якщо номінальні дані оцінюють кілька людей: розгляньте multi-rater κ, зокрема Fleiss’ κ, або інший метод, що відповідає дизайну.
Якщо оцінки кількісні: оберіть конкретний ICC відповідно до моделі, absolute agreement/consistency та single/average measures.
Якщо дизайн має пропуски, різну кількість кодерів або складні типи даних: розгляньте методи на кшталт Krippendorff’s α, якщо його припущення відповідають задачі.
Якщо κ суперечить високому спостережуваному збігу через дисбаланс категорій: проаналізуйте маргінальні розподіли, покажіть сирий agreement і лише потім обґрунтовуйте альтернативний коефіцієнт, наприклад AC1/AC2.
Якщо головне — абсолютна величина різниці між числовими оцінками, додайте показники agreement і аналіз систематичного зсуву; одного reliability coefficient може бути недостатньо.
Коротко: що можна і чого не можна висновувати
Висока міжоцінювальна надійність підтримує висновок, що результат відтворюється між оцінювачами в досліджених умовах.
Вона не доводить construct validity, diagnostic validity, fairness або clinical utility.
Низький коефіцієнт не завжди означає «поганий тест»: він може залежати від неоднорідності вибірки, дисбалансу категорій, дизайну або невідповідного коефіцієнта.
Жоден універсальний cutoff не робить процедуру придатною для всіх рішень.
Надійність потрібно описувати для конкретної популяції, типу оцінювача, процедури та intended use.
Поширені запитання
Міжоцінювальна надійність і міжекспертна надійність — це одне й те саме?
У більшості українських контекстів ці назви використовують для одного класу задач: наскільки різні люди узгоджено оцінюють той самий матеріал. «Міжекспертна» доречна, коли оцінювачі справді є експертами; «міжоцінювальна» ширша і охоплює також кодерів, спостерігачів, екзаменаторів і клініцистів.
Чи достатньо відсотка збігу?
Відсоток збігу корисний як прозорий опис, але для багатьох категоріальних задач його недостатньо. Він не враховує структуру очікуваного збігу й не показує повної статистичної невизначеності.
Що краще: каппа Коена чи ICC?
Вони призначені для різних типів даних і моделей. Каппа Коена — класичний вибір для двох оцінювачів і номінальних категорій. ICC — сімейство коефіцієнтів для кількісних оцінок та відповідних дизайнів. Вибирати між ними без опису даних некоректно.
Чим ICC відрізняється від Cohen’s kappa?
ICC працює з дисперсією кількісних оцінок і має різні моделі для способу добору оцінювачів, типу agreement/consistency та одиниці single/average. Каппа Коена працює з категоріями двох оцінювачів і враховує очікуваний збіг за маргінальними розподілами.
Чи можна використовувати кореляцію Пірсона між двома експертами?
Вона може описати лінійний зв’язок, але сама по собі не є доказом узгодженості. Систематично завищені оцінки можуть мати високу кореляцію з іншими оцінками і водночас суттєво відрізнятися за абсолютним значенням.
Яке значення міжоцінювальної надійності вважається хорошим?
Універсальної межі немає. Орієнтири залежать від коефіцієнта, точності оцінки, наслідків помилки та intended use. Для високоставкових індивідуальних рішень вимоги зазвичай жорсткіші, ніж для дослідницького аналізу групових тенденцій.
Чому κ може бути невисокою при 90–95% збігу?
Коли одна категорія сильно домінує, очікуваний збіг за маргінальними розподілами теж стає високим. Каппа коригує спостережуваний збіг на цей компонент, тому її значення може виявитися нижчим за інтуїтивне враження від самого відсотка.
Чи висока міжоцінювальна надійність доводить правильність діагнозу?
Ні. Вона показує відтворюваність рішення між оцінювачами, а не істинність або валідність діагностичного висновку. Кілька фахівців можуть послідовно застосовувати однакове, але недостатньо валідне правило.
Чи треба оцінювати надійність для кожної нової мовної версії?
Якщо переклад змінює інструкцію, критерії або інтерпретацію поведінки, нові дані про надійність у цільовій мовній і культурній популяції стають важливими. Сам факт перекладу не переносить автоматично всі психометричні властивості оригіналу.
Чи може один і той самий інструмент мати різну міжоцінювальну надійність у різних вибірках?
Так. Reliability coefficients залежать від дизайну й варіативності між об’єктами. Тому результат не слід трактувати як незмінну «властивість тесту», що однаково діє в будь-якій популяції.
Чи треба включати випадки, де оцінювачі не погодилися?
Саме ці випадки і є критично важливими для оцінки надійності. Видалення складних випадків після того, як стала відома незгода, штучно завищує показник.
Чи можна після навчання оцінювачів перерахувати надійність?
Так. Якщо навчання є частиною реального протоколу, логічно оцінювати надійність після стандартизованої підготовки. Водночас потрібно описати навчання і не змішувати тренувальні приклади з незалежною фінальною оцінкою.
Чи є міжоцінювальна надійність те саме, що діагностична чутливість і специфічність?
Ні. Чутливість і специфічність порівнюють результат із референтним стандартом і стосуються діагностичної точності. Міжоцінювальна надійність порівнює рішення оцінювачів між собою. Висока agreement не гарантує високої diagnostic accuracy.
Пов’язані статті
Внутрішньокласовий коефіцієнт кореляції (ICC): як оцінюють надійність повторних і міжоцінювальних вимірювань — вибір моделі ICC, absolute agreement чи consistency та single/average measures для кількісних оцінок.
Психологічна оцінка й оцінювання — ширший процес, у якому дані з тестів, інтерв’ю та спостереження інтегрують для відповіді на конкретне психологічне питання.
Психологічні тести — як працюють стандартизовані інструменти та як оцінювати їхні результати.
Рейтингова шкала — формати експертного оцінювання та відмінність рейтингу від ранжування.
Формула Спірмена–Брауна — окрема задача надійності, пов’язана з довжиною тесту та методом розщеплення.
Надійність психологічного тесту: що це, які бувають види і чому надійність не дорівнює валідності — базова рамка надійності, похибки вимірювання та її відмінності від валідності.
Джерела
American Educational Research Association, American Psychological Association & National Council on Measurement in Education. 2014. Standards for Educational and Psychological Testing.
American Psychological Association. Interrater reliability — APA Dictionary of Psychology.
Bland, J. M., & Altman, D. G. 1986. Statistical methods for assessing agreement between two methods of clinical measurement. The Lancet, 1(8476), 307–310.
Byrt, T., Bishop, J., & Carlin, J. B. 1993. Bias, prevalence and kappa. Journal of Clinical Epidemiology, 46(5), 423–429.
Cohen, J. 1960. A coefficient of agreement for nominal scales. Educational and Psychological Measurement, 20(1), 37–46.
Cohen, J. 1968. Weighted kappa: Nominal scale agreement provision for scaled disagreement or partial credit. Psychological Bulletin, 70(4), 213–220.
COSMIN. 2026. COSMIN Manual, version 2.0.
de Vet, H. C. W., Terwee, C. B., Knol, D. L., & Bouter, L. M. 2006. When to use agreement versus reliability measures. Journal of Clinical Epidemiology, 59(10), 1033–1039.
Fleiss, J. L. 1971. Measuring nominal scale agreement among many raters. Psychological Bulletin, 76(5), 378–382.
Gwet, K. L. 2008. Computing inter-rater reliability and its variance in the presence of high agreement. British Journal of Mathematical and Statistical Psychology, 61(1), 29–48.
Hallgren, K. A. 2012. Computing Inter-Rater Reliability for Observational Data: An Overview and Tutorial. Tutorials in Quantitative Methods for Psychology, 8(1), 23–34.
Koo, T. K., & Li, M. Y. 2016. A Guideline of Selecting and Reporting Intraclass Correlation Coefficients for Reliability Research. Journal of Chiropractic Medicine, 15(2), 155–163.
Kottner, J., Audigé, L., Brorson, S., et al. 2011. Guidelines for Reporting Reliability and Agreement Studies (GRRAS) were proposed. Journal of Clinical Epidemiology, 64(1), 96–106.
Lucas, N. P., Macaskill, P., Irwig, L., & Bogduk, N. 2010. The development of a quality appraisal tool for studies of diagnostic reliability (QAREL). Journal of Clinical Epidemiology, 63(8), 854–861.
McGraw, K. O., & Wong, S. P. 1996. Forming inferences about some intraclass correlation coefficients. Psychological Methods, 1(1), 30–46.
Shrout, P. E., & Fleiss, J. L. 1979. Intraclass correlations: uses in assessing rater reliability. Psychological Bulletin, 86(2), 420–428.
