top of page

Психологічна енкциклопедія

Каппа Коена: як оцінюють узгодженість категоріальних оцінок і чому κ може вводити в оману

6 днів тому
Читати 18 хв

Оновлено: 6 днів тому

Автор: Український психологічний ХАБ · Опубліковано: 23 вересня 2026 р. · Редакційна політика


Каппа Коена (κ) — коефіцієнт, який описує, наскільки двоє оцінювачів збігаються у категоріальній класифікації понад рівень збігу, очікуваний із їхніх власних частот використання категорій. Її часто називають «узгодженістю з поправкою на випадковість», але це формулювання потребує точності: очікуваний компонент у κ не спостерігає реальний процес випадкового вгадування, а обчислюється математично з маргінальних, тобто крайових, часток категорій.


Коефіцієнт був запропонований Джейкобом Коеном для двох оцінювачів і номінальних категорій у 1960 році. Оригінальна стаття Коена закріпила формулу, яка й сьогодні лежить в основі класичної κ. Для впорядкованих категорій Коен пізніше запропонував зважений варіант, де різним типам розбіжностей можна надати різну вагу.


Найважливіше практичне правило: κ не можна читати ізольовано. Два дослідження можуть мати однаковий відсоток збігів і різну κ, якщо в них різні частоти категорій. І навпаки, висока κ не доводить, що класифікація валідна, клінічно правильна або справедлива. Вона відповідає на набагато вужче питання про відтворюваність категоріальних оцінок за конкретного дизайну, конкретних оцінювачів і конкретної вибірки.


Коротко: що показує каппа Коена


Каппа Коена порівнює фактичну частку збігів двох оцінювачів із часткою збігів, яку очікують за незалежності їхніх оцінок, якщо зберегти те, як часто кожен із них використовує кожну категорію. Її класична формула має вигляд:


κ = (Pₒ − Pₑ) / (1 − Pₑ)


Тут Pₒ — спостережувана частка повних збігів, а Pₑ — очікувана частка збігів, обчислена з маргінальних часток категорій. Чисельник показує, скільки узгодженості залишилося після віднімання очікуваного компонента. Знаменник масштабує цей надлишок відносно максимально можливої узгодженості понад Pₑ.


Це визначення відповідає класичній конструкції Коена й сучасним оглядам використання κ. Sim і Wright підкреслюють, що величина κ залежить не лише від фактичних збігів, а й від розподілу категорій, відмінностей у стилі оцінювання, незалежності оцінок і дизайну дослідження.


Що означають значення κ


κ = 1 означає повний збіг оцінок у вибірці. κ = 0 означає, що спостережувана узгодженість дорівнює математично очікуваній за незалежності оцінок з такими самими маргінальними частками. Це не означає, що оцінювачі «взагалі не погоджуються»: сирий відсоток збігів може бути високим.


Від’ємна κ означає, що повних збігів менше, ніж передбачає цей маргінальний компаратор. Це може сигналізувати про систематичне розходження, різне розуміння категорій або особливості даних, але сам знак не встановлює причину. Верхня межа κ дорівнює 1; мінімально можливе значення залежить від маргінальних розподілів, тому для конкретної таблиці воно не обов’язково досягає −1.


Коли каппа Коена доречна


Класична κ Коена насамперед призначена для ситуації, де два оцінювачі незалежно класифікують ті самі об’єкти, випадки або людей за одним набором взаємовиключних категорій. Типові приклади — два клініцисти кодують наявність або відсутність певної ознаки, два дослідники класифікують поведінкові епізоди, два експерти кодують відповіді інтерв’ю або два редактори відносять матеріали до категорій.


У ширшому контексті міжоцінювальна надійність охоплює весь клас задач, де потрібно оцінити відтворюваність рішень між експертами, спостерігачами або клініцистами; каппа Коена є одним із коефіцієнтів для категоріальних результатів у такому дизайні.


Ключове слово тут — категорії. Якщо результат є неперервним числовим балом, наприклад час реакції, кількісний показник симптомів або числова оцінка, для міжоцінювальної чи повторної надійності часто потрібен внутрішньокласовий коефіцієнт кореляції (ICC), а не κ. Для порядкових категорій на кшталт «немає / легкий / помірний / тяжкий» може бути доречна зважена κ.


Сучасний документ COSMIN Reporting Guideline 2.0 формулює це розрізнення дуже чітко у своєму контексті оцінювання властивостей вимірювальних інструментів: для неперервних балів перевага надається ICC, для порядкових — зваженій κ із описом схеми ваг, а для дихотомічних і номінальних результатів — незваженій κ.


Ці рекомендації COSMIN створені насамперед для досліджень властивостей вимірювання, зокрема результатів, про які повідомляють пацієнти. У ширших психологічних і поведінкових дослідженнях вибір коефіцієнта так само має випливати з типу даних, кількості оцінювачів, дослідницького питання та того, що саме вважається суттєвою розбіжністю.


Як обчислюється κ: приклад, у якому 90% збігів дають лише близько 0,49


Уявімо, що два оцінювачі незалежно класифікують 100 випадків як «так» або «ні». Результати розподілилися так:


Оцінювач А «так» / оцінювач Б «так»: 84 випадки.


Оцінювач А «так» / оцінювач Б «ні»: 6 випадків.


Оцінювач А «ні» / оцінювач Б «так»: 4 випадки.


Оцінювач А «ні» / оцінювач Б «ні»: 6 випадків.


Повний збіг є у 84 + 6 = 90 випадках, тому Pₒ = 0,90. На перший погляд це виглядає як дуже висока узгодженість.


Але оцінювач А використовує категорію «так» у 90% випадків, а оцінювач Б — у 88%. Відповідно, очікуваний збіг у категорії «так» за незалежності дорівнює 0,90 × 0,88 = 0,792. Для «ні» це 0,10 × 0,12 = 0,012. Разом Pₑ = 0,804.


Тоді κ = (0,90 − 0,804) / (1 − 0,804) = 0,096 / 0,196 ≈ 0,49.


Отже, ті самі 90% сирої узгодженості після врахування маргінальних розподілів перетворюються приблизно на κ = 0,49. Це не математична помилка. Обидва оцінювачі майже завжди вибирають домінантну категорію «так», тому велика частина збігів уже очікується з їхнього способу використання категорій.


Саме такі ситуації лежать в основі того, що часто називають «парадоксом каппа». Сучасне коротке пояснення цього феномену дає, зокрема, Derksen та співавтори: високий абсолютний відсоток збігів може співіснувати з відносно низьким значенням κ.


Чому κ залежить від поширеності категорій і маргінальних розподілів


Залежність κ від частот категорій — математичний факт. Якщо майже всі об’єкти належать до однієї категорії, два оцінювачі можуть часто збігатися вже тому, що обидва майже завжди вибирають цю категорію. Pₑ зростає, а простір для «додаткової» узгодженості понад Pₑ стискається.


Класична робота Byrt, Bishop і Carlin 1993 року показала, що κ складно залежить від нерівномірності розподілу категорій і від відмінностей у маргінальних оцінках двох оцінювачів. Автори прямо застерігали від звітування однієї κ без показників спостережуваної узгодженості та структури розподілів.


У прикладній літературі це часто називають «ефектом поширеності» або «парадоксом поширеності». Термін зручний, але його легко спростити до хибної формули «κ погана, бо залежить від поширеності». Насправді методологічна дискусія тонша.


Vach у 2005 році розрізнив залежність від спостережуваних маргінальних часток і залежність від гіпотетичної латентної поширеності «істинного» стану. Він аргументував, що частина критики κ перебільшує проблему: залежність від складу вибірки частково випливає із самої логіки коефіцієнта, а порівнювати κ між популяціями з різною структурою без контексту справді небезпечно.


Тому науково точне формулювання таке: нерівномірні категорії можуть сильно змінювати κ навіть за однакового Pₒ; це обмежує прямі порівняння між вибірками і вимагає показувати маргінальні розподіли та сирий збіг. Чи вважати таку залежність «дефектом» самого коефіцієнта, залежить від того, який статистичний компаратор і яке дослідницьке питання вважають змістовними.


Надійність і абсолютна узгодженість — не одне й те саме


У повсякденній мові κ часто називають коефіцієнтом узгодженості. У сучасній теорії вимірювання важливо розрізняти абсолютну узгодженість і надійність. Абсолютна узгодженість питає, наскільки близькі або однакові повторні оцінки. Надійність питає, наскільки вимірювання здатне стабільно розрізняти об’єкти або людей у конкретній популяції попри похибку.


Vanbelle, Hernandez Engelhart і Blix у 2024 році наголошують, що узгодженість і надійність — різні поняття і що reliability залежить від гетерогенності популяції. Через це коефіцієнт, який добре працює як показник відносної надійності, не замінює опис фактичних розбіжностей.


У методології COSMIN κ розглядається як показник надійності для категоріальних результатів, тоді як частка специфічного збігу може доповнювати її як опис абсолютної узгодженості. Для читача це означає просте правило: якщо нас цікавить, як часто експерти реально дають однакову відповідь, відсоток збігів не треба приховувати за однією κ.


Зважена каппа: коли сусідні категорії відрізняються від далеких помилок


Незважена κ вважає всі незбіги однаково «неправильними». Для номінальних категорій це логічно: якщо категорії не мають порядку, немає природної причини вважати одну помилку ближчою до правильної, ніж іншу.


Для порядкових шкал ситуація інша. Якщо оцінювач А ставить «помірний», а оцінювач Б — «тяжкий», така розбіжність може мати інший зміст, ніж «немає» проти «тяжкий». Зважена κ дозволяє призначити різним відстаням між категоріями різну вагу.


Коен запропонував зважену κ у 1968 році саме для ситуацій, де розбіжність може бути частковою, а не суто «збіг / незбіг». Сьогодні поширені лінійні й квадратичні схеми ваг.


Вибір ваг не є косметичним. Різні схеми можуть дати різні числові результати, тому у статті або звіті треба вказати, що саме було використано і чому. Квадратичні ваги не слід застосовувати автоматично тільки тому, що вони дають вищий коефіцієнт. Метод має відповідати змісту шкали й наслідкам різних помилок.


Актуальний документ COSMIN прямо вимагає описувати схему ваг для порядкових результатів і обґрунтовувати вибір формули.


Каппа Коена та ICC: чому це не взаємозамінні коефіцієнти


Каппа Коена й внутрішньокласовий коефіцієнт кореляції часто стоять поруч у розділах про міжоцінювальну надійність, але відповідають різним типам даних і різним моделям.


κ зазвичай застосовують до категоріальних результатів. Незважена κ природна для дихотомічних або номінальних категорій; зважена κ — для порядкових категорій, коли ступінь розбіжності має значення.


ICC застосовують до кількісних неперервних або квазінеперервних результатів і він має кілька моделей, що відрізняються за тим, чи оцінюють абсолютну узгодженість або консистентність, чи вважають оцінювачів випадковою або фіксованою вибіркою та чи аналізують один вимір або середнє кількох.


Саме тому сучасні методологічні рекомендації вимагають називати конкретну формулу ICC або κ, а не писати у методах просто «надійність була високою».


Іноді зважена κ і певні ICC мають математичні зв’язки за спеціальних умов, але це не робить їх універсальними замінами один одного. Спершу визначають шкалу вимірювання й дослідницький дизайн, а вже потім коефіцієнт.


Каппа не вимірює валідність, точність діагнозу або «якість тесту» загалом


Двоє оцінювачів можуть майже ідеально погоджуватися і водночас систематично помилятися щодо зовнішнього критерію. Каппа не порівнює їхні оцінки з «істиною», еталонним діагнозом або золотим стандартом; вона порівнює оцінювачів між собою.


Тому висока κ не є доказом конструктної валідності, критеріальної валідності, діагностичної чутливості, специфічності, прогностичної цінності або клінічної корисності. Це різні властивості й різні питання.


Загальні стандарти освітнього і психологічного тестування AERA, APA та NCME розглядають надійність, валідність і справедливість як окремі, взаємопов’язані елементи належного використання тестів. Узгодженість оцінювачів може бути частиною доказової бази, але не замінює аргументу про те, що конкретний бал або категорія коректно інтерпретується для конкретної мети й популяції.


У контексті психологічної оцінки це особливо важливо: однаковий висновок двох фахівців ще не робить його автоматично діагнозом і не скасовує вимог до клінічного інтерв’ю, анамнезу, диференційної оцінки, валідованих методик і професійного судження.


Чому універсальні словесні пороги для κ слабкі


У підручниках часто наводять готові діапазони на кшталт «слабка», «помірна», «суттєва» або «майже ідеальна» узгодженість. Вони зручні для орієнтації, але не є природними межами, закладеними в математику κ.


Sim і Wright радять інтерпретувати величину κ разом із контекстом, довірчим інтервалом, розподілом категорій і метою дослідження. GRRAS так само виходить із того, що дизайн, статистичний метод і спосіб звітування мають бути достатньо прозорими, щоб читач міг оцінити надійність і узгодженість, а не лише побачити один ярлик.


Одна й та сама κ може бути достатньою для дослідницького кодування з низькими наслідками помилки і неприйнятною для рішення, від якого залежить лікування, правовий статус або доступ до послуги. Чим вищі наслідки помилкової класифікації, тим важливіше аналізувати не лише загальну κ, а й конкретні типи незгоди, специфічну узгодженість за категоріями та наслідки помилок.


Що обов’язково звітувати разом із κ


Одна цифра κ майже ніколи не дає достатньої картини. Якісний звіт дозволяє відновити, як саме виник результат.


• Кількість об’єктів і кількість оцінювачів, а також хто ці оцінювачі й за якою процедурою вони працювали.


• Чи були оцінки незалежними: оцінювач не мав бачити відповідь іншого й не повинен був коригувати власне рішення після обговорення до первинного кодування.


• Повний набір категорій і їхній зміст. Для порядкових шкал — порядок категорій.


• Спостережувану частку повних збігів Pₒ, а для дихотомічних або важливих категорій — за можливості позитивну й негативну специфічну узгодженість.


• Маргінальні частки або таблицю перехресної класифікації, щоб було видно дисбаланс категорій і систематичні відмінності між оцінювачами.


• Точний тип κ: незважена чи зважена. Для зваженої — схему ваг.


• Оцінку невизначеності, зазвичай довірчий інтервал, а не лише точкове значення.


• Наперед визначене правило, що робили з пропущеними або невизначеними оцінками.


• Обґрунтування вибору статистики відповідно до типу даних і дизайну.


Ці принципи узгоджуються з рекомендаціями GRRAS і сучасними оглядами методології міжоцінювальної надійності. Їхня мета — зробити результат відтворюваним і не дозволити одній «гарній» або «поганій» κ приховати структуру даних.


Що робити, коли категорія дуже рідкісна


Якщо одна категорія трапляється рідко, низька або середня κ за високого загального Pₒ не обов’язково означає, що оцінювачі працюють хаотично. Спершу треба подивитися на таблицю збігів: можливо, майже всі випадки належать до домінантної категорії, а ключова невизначеність зосереджена у кількох рідкісних випадках.


Для дихотомічних даних корисно окремо показувати позитивну і негативну узгодженість. Наприклад, два клініцисти можуть майже завжди збігатися щодо відсутності рідкісної ознаки, але набагато слабше — щодо її наявності. Один загальний відсоток і одна κ усереднюють ці різні практичні ситуації.


Byrt та співавтори рекомендували не залишати κ без контексту маргінальних розподілів. Пізніші дослідження «парадоксу κ» розвинули цю саму ідею: важлива не лише величина коефіцієнта, а те, де саме виникає згода і незгода.


Чи краще замінити κ на AC1 Ґвета


Коефіцієнт AC1 Ґвета (Gwet’s AC1) часто пропонують як альтернативу, менш чутливу до дисбалансу категорій. Він справді може поводитися інакше, коли одна категорія домінує. Але з цього не випливає, що AC1 є «виправленою каппа» або автоматично кращою версією κ.


Vach і Gerke у 2023 році показали, що κ і AC1 використовують концептуально різні компаратори й по-різному реагують на поширеність категорій. Автори роблять важливий висновок: AC1 не слід трактувати як просту взаємозаміну κ, а словесні пороги, створені для κ, не можна механічно переносити на AC1.


Практичне рішення залежить від дослідницького питання. Якщо маргінальний дисбаланс є центральною проблемою, можна провести аналіз чутливості й показати кілька доповнювальних індексів, але треба пояснити, що вони оцінюють. Заміна одного числа іншим без зміни інтерпретації лише переносить проблему.


Більше двох оцінювачів: чому каппа Коена вже не описує весь дизайн


Класична каппа Коена створена для двох оцінювачів. Якщо один і той самий матеріал кодують троє, п’ятеро або десятки експертів, парні κ можуть бути корисними, але вони вже не дають одного повного опису всього багатооцінювального дизайну.


Для таких ситуацій існують багатооцінювальні коефіцієнти й узагальнення, зокрема варіанти каппа для кількох оцінювачів, а для порядкових даних — спеціальні багатооцінювальні методи. Вибір залежить від того, чи всі оцінювачі оцінюють усі об’єкти, чи оцінювачі взаємозамінні, чи є порядок категорій і яке саме поняття — абсолютна узгодженість чи надійність — цікавить дослідника.


Сучасний методологічний огляд Vanbelle та співавторів 2024 року окремо показує, що для порядкових даних із кількома спостерігачами вибір і інтерпретація коефіцієнта потребують явного обґрунтування, а фіксовані словесні пороги й ігнорування довірчих інтервалів залишаються типовими помилками.


Типові помилки під час використання каппа Коена


Помилка 1. Звітувати тільки κ


Без Pₒ, маргінальних часток і таблиці класифікації читач не бачить, чи низька κ виникла через реальні розбіжності, дисбаланс категорій або різний стиль використання категорій. Саме тому одна κ не повинна бути єдиним результатом.


Помилка 2. Називати κ «відсотком правильності»


κ не є відсотком правильних відповідей. Для цього потрібен зовнішній критерій правильності. В κ два оцінювачі симетричні: один не є автоматично еталоном для іншого.


Помилка 3. Плутати κ з чутливістю і специфічністю


Чутливість і специфічність описують класифікацію відносно референтного стану або стандарту. κ описує узгодженість між класифікаціями. Це різні задачі, і одна не замінює іншу.


Помилка 4. Використовувати незважену κ для порядкової шкали без обґрунтування


Якщо розбіжність на одну категорію реально менш суттєва, ніж розбіжність на три, незважена κ втрачає цю інформацію. Якщо ж будь-який незбіг однаково критичний, незважена κ може бути цілком свідомим вибором. Важливе саме обґрунтування.


Помилка 5. Порівнювати κ між популяціями як чисту властивість оцінювача


Надійність залежить від складу й гетерогенності вибірки. Зміна частоти категорій може змінити κ навіть без очевидної зміни професійної компетентності оцінювачів. Тому міждослідницьке порівняння потребує контексту.


Помилка 6. Вважати високий κ доказом валідності


Оцінювачі можуть стабільно використовувати помилкове правило. Висока міжоцінювальна надійність є необхідною для багатьох задач, але сама по собі не доводить, що категорії вимірюють потрібний конструкт або ведуть до правильного клінічного рішення.


Помилка 7. Плутати каппа Коена з d Коена


Попри спільне прізвище, це різні статистики. Каппа Коена κ стосується категоріальної узгодженості. d Коена — стандартизована величина різниці між середніми. Застосування і тлумачення в них різні.


Каппа Коена у психології та психодіагностиці


У психології κ корисна там, де значущим джерелом похибки є людське категоріальне судження: кодування поведінки, розмітка інтерв’ю, класифікація відповідей, оцінка дотримання протоколу, експертне віднесення кейсів до категорій або дослідницьке кодування клінічних ознак.


Але κ не перетворює експертне судження на об’єктивну істину. Якщо категорії нечітко визначені, інструкція погано стандартизована або оцінювачі навчені на одних і тих самих упереджених прикладах, вони можуть бути послідовними й водночас систематично помилятися.


Так само κ не встановлює справедливість щодо мовних, культурних або соціальних груп. Хороша узгодженість показує, що правило застосовується подібно, але не доводить, що саме правило справедливе або культурно валідне. Питання адаптації, валідності, інваріантності й потенційного упередження потребують окремих доказів.


Якщо категорії отримують із рейтингової шкали, треба окремо вирішити, чи шкала справді порядкова, чи відстані між категоріями мають зміст і чи є зважування розбіжностей концептуально виправданим.


Як спланувати дослідження міжоцінювальної надійності


Якість κ починається не з кнопки у статистичній програмі, а з дизайну. До збору даних варто визначити одиницю оцінювання, набір категорій, критерії кожної категорії, процедуру навчання оцінювачів, правила для невизначених випадків і спосіб забезпечення незалежності первинних оцінок.


Вибірка має містити достатню кількість об’єктів і достатню варіативність. Якщо майже всі випадки належать до однієї категорії, коефіцієнт стає складним для інтерпретації, а довірчий інтервал може бути широким. Планування обсягу вибірки має враховувати очікувані частоти категорій, бажану точність і число оцінювачів.


Sim і Wright окремо розглядають вимоги до обсягу вибірки для κ, а GRRAS наголошує, що слід описувати дизайн, популяцію, оцінювачів, процедури, статистичний аналіз і невизначеність достатньо повно для відтворення дослідження.


Практичний алгоритм вибору коефіцієнта


1. Спочатку визначте тип результату. Для номінальних або дихотомічних категорій розглядайте незважену κ; для порядкових — зважену κ, якщо відстань між помилками має сенс; для неперервних балів зазвичай потрібен ICC або інший метод, що відповідає дизайну.


2. Уточніть кількість оцінювачів. Класична κ Коена — двооцінювальна статистика. Для більшої кількості оцінювачів потрібен коефіцієнт, який явно підтримує багатооцінювальний дизайн.


3. Вирішіть, що вас цікавить: абсолютна узгодженість, відносна надійність чи обидві. Часто найкращий звіт містить і κ, і прості описові показники збігів.


4. До аналізу подивіться на частоти категорій. Сильний дисбаланс не є автоматичною забороною на κ, але він змінює інтерпретацію й робить особливо важливими Pₒ, маргінальні частки та специфічну узгодженість.


5. Не встановлюйте універсальний «прохідний бал» κ без прив’язки до наслідків помилки, популяції, завдання й довірчого інтервалу.


6. Якщо розглядаєте альтернативу на кшталт AC1, поясніть, чому її компаратор краще відповідає вашій задачі, і не тлумачте значення за шкалою, створеною для іншого коефіцієнта.


Як читати κ у науковій статті: п’ять запитань


Перше запитання: що саме класифікували і чи відповідає κ типу даних? Якщо результат неперервний, κ може бути невдалим вибором.


Друге: скільки було оцінювачів і чи були їхні первинні оцінки незалежними? Узгодження після консенсусної наради не є тим самим, що міжоцінювальна надійність незалежних оцінок.


Третє: який сирий відсоток збігів і як розподілені категорії? Без цього складно зрозуміти, чому κ має саме таке значення.


Четверте: якщо κ зважена, які використано ваги? Слово «зважена каппа» без опису схеми ваг залишає ключову частину методу невідомою.


П’яте: який довірчий інтервал і наскільки він широкий? Точкова κ = 0,70 за вузького інтервалу і κ = 0,70 за дуже широкого інтервалу несуть різний рівень невизначеності.


Що насправді означає «очікувана випадково» узгодженість у κ


Фраза «поправка на випадковість» зручна, але може створити хибну картину, ніби формула знає, скільки разів оцінювачі справді вгадували навмання. Вона цього не знає. Pₑ — це математичний рівень збігів, який випливає з припущення про незалежність двох наборів оцінок за збереження їхніх маргінальних часток.


Для двох категорій це легко побачити. Якщо оцінювач А використовує «так» у 90% випадків, а оцінювач Б — у 88%, модель незалежності дає 0,90 × 0,88 очікуваного збігу на «так». Те саме робиться для «ні», після чого очікувані частки збігів додаються.


Для більшої кількості категорій принцип той самий: Pₑ дорівнює сумі добутків маргінальних часток відповідних категорій двох оцінювачів. Тобто κ порівнює реальні збіги з конкретною статистичною нульовою моделлю, а не з психологічним твердженням про мотиви або спосіб мислення оцінювачів.


Саме тому Sim і Wright радять інтерпретувати κ як коефіцієнт із власними припущеннями та залежністю від маргінальних розподілів, а не як універсально «очищений» від випадковості відсоток збігів.


Коли κ стає невизначеною або дуже нестабільною


Є граничні ситуації, у яких κ взагалі не можна обчислити змістовно. Якщо обидва оцінювачі віднесли всі випадки до однієї й тієї самої категорії, спостережувана узгодженість Pₒ дорівнює 1. Але Pₑ також дорівнює 1. У формулі виникає 0/0, тому κ математично невизначена, хоча сирий відсоток збігів становить 100%.


Цей приклад особливо добре показує, чому κ і відсоток збігів відповідають на різні питання. Сирий показник каже: оцінювачі дали однакову відповідь у кожному випадку. κ намагається оцінити узгодженість понад маргінальний компаратор, але коли варіативності категорій немає зовсім, для такого порівняння не залишається інформації.


Інша проблема виникає за дуже малої вибірки або дуже рідкісних категорій. Тоді одна чи дві перекласифікації можуть помітно змінити κ, а довірчий інтервал стає широким. Точкове число без інтервалу створює ілюзію більшої точності, ніж реально дають дані.


Огляд Sim і Wright окремо розглядає невизначеність і планування розміру вибірки для κ. Практичний висновок простий: якщо категорії майже не варіюють або даних мало, проблема не вирішується красивою інтерпретаційною етикеткою.


Позитивна і негативна специфічна узгодженість


Для дихотомічної класифікації загальний відсоток збігів може приховати важливу асиметрію. Двоє оцінювачів можуть майже завжди погоджуватися, коли ознаки немає, але часто розходитися саме у випадках, де один із них вважає ознаку наявною.


Тому поряд із κ корисно показувати позитивну й негативну специфічну узгодженість. Якщо таблиця 2 × 2 має клітини a = обидва «так», b і c = два типи незгоди, d = обидва «ні», позитивну специфічну узгодженість можна подати як 2a / (2a + b + c), а негативну — як 2d / (2d + b + c).


Ці показники не є чутливістю і специфічністю. У них немає зовнішнього еталона, який визначає, хто «правий». Вони симетрично описують, наскільки добре двоє оцінювачів збігаються щодо позитивної або негативної категорії.


Класична робота Byrt, Bishop і Carlin була однією з причин ширшого використання такого доповнення: автори показували, що κ корисно читати разом зі спостережуваною структурою збігів, особливо коли категорії нерівномірні.


У клінічному або високоризиковому контексті це може бути важливіше за один глобальний коефіцієнт. Якщо рідкісна категорія є тією, від якої залежить подальше обстеження або рішення, висока загальна узгодженість через масу негативних випадків не повинна приховувати слабку узгодженість саме щодо позитивних випадків.


Довірчий інтервал і розмір вибірки: чому точкова κ недостатня


κ, обчислена у вибірці, є оцінкою, а не точною властивістю всіх майбутніх оцінювань. Інша вибірка випадків або інший набір оцінювачів можуть дати інше значення. Довірчий інтервал показує статистичну невизначеність навколо точкової оцінки.


Ширина інтервалу залежить від кількості спостережень, структури категорій і самого дизайну. Малий масив даних, рідкісні категорії та сильний дисбаланс можуть зробити оцінку нестабільною навіть тоді, коли точкова κ виглядає переконливо.


Тому питання «скільки випадків потрібно?» не має одного числа для всіх досліджень. Планування залежить від очікуваної κ, бажаної точності, числа категорій, очікуваних маргінальних часток і того, наскільки вузький інтервал потрібен для рішення.


Sim і Wright розглядають підходи до планування вибірки для досліджень κ, а GRRAS вимагає прозоро описувати невизначеність та статистичні методи. У якісній публікації читач має бачити не тільки «κ = 0,72», а й наскільки точно оцінено це число.


Навчання оцінювачів, калібрування і незалежність первинних оцінок


Міжоцінювальна надійність залежить не лише від статистики. Якщо категорії описані розмито, різні оцінювачі створюють власні неформальні правила. Попереднє навчання, приклади, кодова книга й калібрувальні вправи допомагають зробити критерії спільними.


Водночас калібрування не повинно перетворювати саме оцінювання на спільне рішення. Якщо два фахівці бачать відповіді один одного, обговорюють кожен випадок до фіксації результату або один коригує іншого в процесі, висока «узгодженість» уже не описує незалежну відтворюваність.


Корисно розділяти два етапи. На етапі підготовки оцінювачі можуть разом уточнювати правила, обговорювати приклади й перевіряти, чи однаково розуміють категорії. На етапі формального дослідження первинні оцінки фіксують незалежно, а консенсус, якщо він потрібен для кінцевої бази даних, проводять уже після збереження вихідних оцінок.


Рекомендації GRRAS саме тому просять описувати підготовку оцінювачів, процедуру оцінювання, засліплення або незалежність, а також спосіб розв’язання розбіжностей. Без цього сама κ не дозволяє зрозуміти, що саме було відтворюваним.


Як κ може підказати, що проблема в самій системі категорій


Низька або нестабільна κ не завжди означає, що оцінювачі «погані». Іноді вона виявляє слабке місце інструмента: межі між категоріями сформульовані нечітко, кілька категорій семантично перекриваються або критерій вимагає інформації, якої в матеріалі немає.


Тому корисно дивитися не лише на підсумковий коефіцієнт, а на матрицю незгод. Якщо майже всі помилки концентруються між двома сусідніми категоріями, це може вказувати на нечітку межу між ними. Якщо один оцінювач систематично використовує певну категорію частіше за іншого, варто перевірити інструкцію, навчання й інтерпретаційні правила.


Після перегляду категорій не слід просто повторно рахувати κ на тих самих даних і оголошувати інструмент «виправленим». Зміна правил є частиною розробки системи кодування; її відтворюваність краще перевіряти на новому або принаймні незалежно оціненому матеріалі.


У цьому сенсі κ корисна не як фінальна печатка якості, а як діагностичний інструмент для процесу вимірювання. Вона допомагає побачити, де категоріальна система відтворюється, а де потребує уточнення — але причину розбіжностей завжди треба встановлювати з даних і дизайну, а не вгадувати з одного числа.


Часті запитання


Що таке каппа Коена простими словами?


Це коефіцієнт для двох оцінювачів, які розподіляють ті самі випадки за категоріями. Він показує, наскільки їхня фактична узгодженість перевищує рівень, очікуваний із того, як часто кожен використовує ці категорії.


Яке значення κ вважається хорошим?


Універсального порога немає. Значення треба читати разом із довірчим інтервалом, сирим відсотком збігів, частотами категорій, наслідками помилки й метою дослідження. Готові словесні шкали можуть бути орієнтиром, але не замінюють контекст.


Чому може бути 90% збігів і κ близько 0,5?


Коли одна категорія домінує, великий відсоток збігів уже очікується з маргінальних часток оцінювачів. У такій ситуації Pₑ високе, тому частка узгодженості понад очікуваний рівень може бути значно меншою за сирі 90%.


Чим κ відрізняється від ICC?


κ призначена насамперед для категоріальних оцінок. ICC використовують для кількісних результатів і він потребує вибору конкретної моделі. Вони належать до однієї ширшої теми надійності, але не є взаємозамінними.


Коли потрібна зважена κ?


Коли категорії мають порядок і розбіжності різної величини справді мають різну важливість. Тоді сусіднім і далеким розбіжностям можна задати різні ваги. Схему ваг треба описати.


Що означає від’ємна κ?


Спостережуваних збігів менше, ніж очікується за маргінальним компаратором κ. Це привід перевірити таблицю класифікації, інструкції, систематичні відмінності між оцінювачами і можливі помилки кодування, а не автоматичний доказ свідомої протилежної оцінки.


Чи можна використати κ для трьох або більше оцінювачів?


Класична каппа Коена розрахована на двох оцінювачів. Для більшої кількості потрібен метод, який підтримує багатооцінювальний дизайн; парні κ можна показувати як додаткову інформацію, але вони не замінюють загального аналізу.


Чи доводить висока κ, що діагноз правильний?


Ні. Висока κ показує, що оцінювачі класифікують подібно. Правильність діагнозу, валідність критерію, чутливість, специфічність і клінічна корисність потребують інших доказів.


Висновок


Каппа Коена корисна саме тоді, коли її не змушують відповідати на запитання, для яких вона не створена. Вона дає компактний показник категоріальної надійності двох оцінювачів із поправкою на очікуваний за маргінальними частками збіг. Її сила — у чіткій математичній логіці. Її головне обмеження — та сама логіка: значення залежить від того, як розподілені категорії в конкретній вибірці.


Тому професійна інтерпретація κ завжди багатокомпонентна: сама κ, спостережувана узгодженість, маргінальні розподіли, типи незгоди, довірчий інтервал, схема ваг, дизайн дослідження і наслідки помилкової класифікації. Коли ці елементи показані разом, «парадокс каппа» перестає бути загадкою і стає властивістю, яку можна зрозуміти й коректно врахувати.


Пов’язані статті


Внутрішньокласовий коефіцієнт кореляції (ICC): як оцінюють надійність повторних і міжоцінювальних вимірювань — надійність кількісних повторних і міжоцінювальних вимірювань та відмінність ICC від κ.





Джерела












 
 
bottom of page