Пояснюваність ШІ і довіра: чи роблять пояснення алгоритм зрозумілішим і надійнішим для людини
Автор: Український психологічний ХАБ · Опубліковано: 21 вересня 2026 року · Редакційна політика
Пояснення від штучного інтелекту часто сприймається як міст між «чорною скринькою» алгоритму та людиною: якщо система може пояснити, чому вона видала певну рекомендацію, начебто стає легше її зрозуміти, перевірити й вирішити, чи варто на неї покладатися. Саме на цій інтуїції виросла велика частина досліджень explainable artificial intelligence, або XAI. Проте психологічні дослідження взаємодії людини з ШІ показують складнішу картину. Пояснення іноді покращують розуміння, іноді підвищують довіру, іноді допомагають помітити помилку, а іноді майже нічого не змінюють або створюють зайву впевненість.
Тому головне питання полягає не в тому, чи «добре мати пояснення», а в тому, що саме пояснюється, кому, для якого завдання і чи дає це пояснення людині можливість оцінити правильність або межі системи. У систематичному огляді 107 експериментальних досліджень людської взаємодії з XAI, опублікованому у 2026 році, Philipp Reinhard та колеги показують, що ефекти пояснень залежать від дизайну пояснення, типу системи, завдання та психологічних реакцій користувача; єдиного універсального ланцюжка «пояснення → розуміння → довіра → кращий результат» наявна література не підтверджує. Систематичний огляд Reinhard et al., 2026.
Коротка відповідь така: пояснення можуть зробити взаємодію з ШІ зрозумілішою, але саме по собі пояснення не робить алгоритм точнішим, валіднішим або безпечнішим. Підвищення довіри також не є автоматично корисним результатом. Корисна мета — не максимальна довіра, а доречне покладання на систему: людина має приймати сильну рекомендацію тоді, коли система справді надійна для конкретного завдання, і зберігати здатність відхилити її, коли є підстави сумніватися.
Що таке пояснюваність ШІ
Пояснюваність ШІ — це сукупність властивостей, методів і способів подання інформації, які допомагають людині зрозуміти, як система отримала результат, які чинники вплинули на прогноз або рекомендацію, у яких умовах результат слід тлумачити обережно і що може змінити рішення. У науковій та технічній літературі часто використовують термін explainable AI (XAI), а в українському пошуку трапляються форми «пояснюваний ШІ», «пояснюваний штучний інтелект» і «пояснюваність ШІ».
Важливо, що XAI не є одним алгоритмом або одним типом пояснення. Це поле, у якому використовують різні підходи: глобальні описи роботи моделі, локальні пояснення окремого прогнозу, важливість ознак, приклади схожих випадків, контрфактичні пояснення на кшталт «що мало б змінитися, щоб результат був іншим», візуалізації, правила, природномовні обґрунтування та інші форми.
Національний інститут стандартів і технологій США (NIST) розрізняє пояснюваність та інтерпретованість. Пояснюваність стосується представлення механізмів, що лежать в основі роботи системи, тоді як інтерпретованість — значення її результату у контексті призначення. NIST окремо підкреслює, що пояснення мають відповідати ролі, знанням і навичкам користувача. NIST AI RMF: Explainable and Interpretable.
Пояснюваність, прозорість, зрозумілість і надійність — різні речі
У повсякденній мові ці поняття легко зливаються. Якщо інтерфейс показує причини рішення, він здається прозорішим; якщо пояснення звучить просто, система здається зрозумілішою; якщо все виглядає послідовно, виникає відчуття надійності. Однак ці враження не є одним і тим самим.
Прозорість описує доступність інформації про систему, її дані, процеси, обмеження, розробку або використання. Пояснюваність стосується того, як представлено механізм або підстави певного результату. Зрозумілість — це вже властивість взаємодії між поясненням і конкретною людиною: той самий графік може бути корисним фахівцеві з машинного навчання і майже нічого не означати для користувача без відповідної підготовки.
Надійність належить до іншого рівня. Система може бути добре поясненою, але неточною; може мати високу точність на тестовій вибірці, але погано переноситися на іншу популяцію; може давати зрозумілі пояснення й водночас бути вразливою до зсуву даних. У NIST AI Risk Management Framework валідність і надійність, безпека, захищеність, підзвітність, прозорість, пояснюваність, приватність і справедливість розглядаються як окремі характеристики довіреного ШІ. Жодна з них сама по собі не гарантує загальної надійності системи. NIST AI Risk Management Framework.
Ширший психологічний і суспільний контекст відкритості алгоритмічних систем розглянуто окремо в статті «Алгоритмічна прозорість: що вона дає користувачу і чому сама прозорість не гарантує довіри».
Довіра до ШІ, надійність ШІ та покладання на ШІ
Для психології пояснюваності критично важливо розвести три рівні: реальну надійність системи, суб’єктивну довіру людини та поведінку, коли людина фактично приймає рекомендацію ШІ.
Огляд у Nature Reviews Psychology 2026 року формулює це особливо чітко: надійність системи (trustworthiness), суб’єктивна довіра (trust) і поведінкове покладання на систему (trusting behaviour) є різними конструкціями. Система може бути об’єктивно надійною для певного завдання, але користувач може їй не довіряти. Людина може повідомляти про високу довіру, але не користуватися рекомендаціями. І навпаки, вона може приймати поради алгоритму з прагматичних причин, не переживаючи виразного відчуття довіри. Everett et al., 2026.
Це розрізнення пояснює, чому дослідження XAI іноді дають різні результати. Одне дослідження вимірює самооцінку довіри, друге — частоту погодження з алгоритмом, третє — точність спільного рішення, четверте — суб’єктивну зрозумілість. Якщо всі ці показники назвати одним словом «довіра», суперечності здаватимуться більшими, ніж вони є.
У межах цього кластера ширший феномен готовності надавати алгоритмічній пораді більшу вагу розглядається в статті про алгоритмічне схвалення, а різке зниження готовності користуватися алгоритмом після помилки — у матеріалі про алгоритмічну відразу. Пояснюваність перетинається з цими явищами, але не зводиться до них: її окремий фокус — те, як пояснення змінює розуміння, довіру та поведінку людини у взаємодії із системою.
Що показують дослідження: пояснення не мають універсального ефекту
Найстійкіший висновок сучасної літератури полягає в тому, що ефект пояснення контекстний. Систематичний огляд Reinhard та колег 2026 року охопив 107 експериментальних робіт і показав, що дослідження оцінюють цілий ланцюг реакцій: сприйняту якість пояснення, розуміння, прозорість, довіру, когнітивне навантаження, намір користуватися системою, фактичне покладання на неї, здатність виявляти помилки та підсумкову якість виконання завдання. Вплив пояснень змінюється залежно від форми пояснення, типу ШІ та конкретного рішення. Reinhard et al., 2026.
Систематичний огляд Jenia Kim, Henry Maathuis і Danielle Sent 2024 року про людиноцентричну оцінку XAI проаналізував 73 роботи. Автори виокремили 30 компонентів того, що робить пояснення значущим для користувача, і згрупували їх навколо якості самого пояснення, внеску в людсько-ШІ взаємодію та внеску в результативність. Водночас лише 19 з 73 робіт застосовували рамку оцінювання, яку використовувало хоча б ще одне дослідження. Це означає, що поле досі має суттєву методологічну неоднорідність. Kim et al., 2024.
Особливо показова медична сфера, де помилкова довіра має реальні наслідки. Систематичний огляд Rikard Rosenbacke та колег включив 10 емпіричних досліджень XAI в клінічних рішеннях. У п’яти пояснення підвищували довіру, у трьох не давали значущої додаткової користі, а у двох могли як підвищувати, так і знижувати довіру залежно від якості, складності та узгодженості пояснення. Автори також відзначили помірний або високий ризик упередження в наявних дослідженнях. Тобто навіть у вузькому професійному домені не можна сказати, що пояснення автоматично «створює правильну довіру». Rosenbacke et al., 2024.
Експеримент Ping Wang і Heng Ding 2024 року добре демонструє розбіжність між показниками. Пояснення підвищило точність учасників у завданні, але не дало значущого загального зростання самооцінки довіри до ШІ. Для окремої групи раціонально побудоване пояснення посилило поведінкову узгодженість з алгоритмом. Отже, людина може працювати з системою інакше, навіть коли її заявлене відчуття довіри майже не змінюється. Wang & Ding, 2024.
Метааналіз Alexandra Kaplan та колег, присвячений довірі до ШІ загалом, показує, що довіра формується не однією характеристикою інтерфейсу. На неї впливають характеристики людини, самої системи та контексту взаємодії. Пояснення слід розглядати як один із сигналів усередині ширшої системи людського судження. Kaplan et al., 2023.
Коли пояснення справді допомагає
Пояснення має найбільшу психологічну цінність тоді, коли воно не просто робить відповідь приємнішою або переконливішою, а дає користувачеві нову можливість діяти: перевірити результат, побачити межу застосовності, помітити конфлікт із даними, порівняти альтернативи або зрозуміти, яка зміна вхідних умов змінює висновок.
Коли пояснення дає можливість перевірки
Raymond Fok і Daniel Weld запропонували корисну рамку verifiability: у рішенні з порадою ШІ пояснення особливо цінне, якщо воно допомагає людині перевірити правильність рекомендації, а не лише описує, як система нібито міркувала. Їхній аналіз літератури показує, що багато популярних пояснень важливості ознак або природномовних обґрунтувань не дають такої перевірки і тому рідко приводять до комплементарної продуктивності, коли команда «людина + ШІ» перевершує обох окремо. Fok & Weld, 2024.
Наприклад, якщо система показує не просто оцінку ризику, а конкретні дані, які можна звірити з первинним джерелом, пояснення дає людині опору для перевірки. Якщо ж система лише повідомляє, що «ознака A мала вагу 0,37», користувач може отримати відчуття технічної деталізації, не отримавши відповіді на головне питання: чи правильний висновок у цьому випадку.
Коли пояснення відповідає знанням користувача
Для експерта і для неспеціаліста корисними можуть бути різні пояснення. Фахівець здатен працювати з розподілами ймовірностей, межами довірчих інтервалів, впливом ознак і характеристиками вибірки. Іншій людині потрібне контекстне пояснення природною мовою, приклад або просте порівняння альтернатив. NIST прямо рекомендує підлаштовувати опис функціонування системи до ролі, знань і навичок людини. NIST AI RMF.
Коли пояснення показує невизначеність і межі
Корисне пояснення не повинно створювати враження абсолютної визначеності там, де її немає. Для рішення важливо знати не лише «чому система обрала X», а й наскільки стабільний висновок, які альтернативи були близькими, за яких умов модель працює гірше, чи відповідає поточний випадок даним, на яких систему перевіряли. Інформація про межі застосування може бути психологічно важливішою за красиву історію про механізм рішення.
Коли людина може оскаржити або змінити результат
Контрфактичне пояснення, яке показує, що зміна певної умови могла б змінити рішення, іноді допомагає краще зрозуміти межу класифікації. Але і тут потрібна обережність: технічна змінність результату не завжди означає, що запропонована зміна є реально можливою, справедливою або причинною. Пояснення має відповідати завданню, а не просто демонструвати математично близький шлях до іншої відповіді.
Коли пояснення може не допомогти або навіть зашкодити
Психологічна проблема XAI полягає в тому, що люди оцінюють не лише інформацію, а й форму. Структуроване, конкретне й технічно оформлене пояснення може справляти враження компетентності навіть тоді, коли воно не допомагає перевірити правильність результату.
Ілюзія розуміння
Зрозуміле пояснення може підвищити відчуття, що людина «бачить логіку» системи. Але суб’єктивна зрозумілість не тотожна правильній ментальній моделі. Коротке й переконливе пояснення іноді спрощує механізм настільки, що користувач отримує впевненість без достатньої інформації про обмеження.
Надмірне покладання на автоматизацію
Якщо пояснення посилює переконливість неправильної рекомендації, користувач може частіше погоджуватися з нею. Це перетинається з автоматизаційним упередженням: проблемою стає не факт використання автоматизації, а зменшення незалежної перевірки там, де вона потрібна. Rosenbacke та колеги прямо застерігають, що пояснення в клінічних системах не є безвідмовним методом виявлення помилок і може сприяти надмірній довірі. Rosenbacke et al., 2024.
Когнітивне перевантаження
Більше деталей не завжди означає більше розуміння. Якщо система показує десятки ознак, технічні графіки та кілька альтернативних пояснень, користувач може витрачати ресурси на декодування інтерфейсу замість самого завдання. У систематичному огляді Kim та колег когнітивне навантаження входить до компонентів, які потрібно оцінювати в людиноцентричному XAI. Kim et al., 2024.
Підтвердження вже наявної думки
Пояснення, яке збігається з очікуванням користувача, легко сприйняти як доказ правильності системи. Але збіг із людською інтуїцією не є незалежною верифікацією. Якщо і людина, і модель систематично помиляються в одному напрямку, «інтуїтивне» пояснення може лише зробити спільну помилку переконливішою.
Пояснення після факту
Деякі методи XAI створюють постфактум-пояснення складної моделі: вони наближено описують, які чинники могли бути важливими для конкретного прогнозу, але самі не є повним записом внутрішнього обчислення. У таких випадках необхідно розрізняти правдоподібність пояснення для людини і його відповідність реальному механізму моделі (faithfulness).
Зрозуміле пояснення ще не є правдивим поясненням механізму
Одна з найважливіших відмінностей у XAI — між правдоподібністю (plausibility) та відповідністю механізму (faithfulness). Правдоподібне пояснення звучить переконливо для людини. Пояснення з високою відповідністю механізму має коректно відображати ті чинники або механізми, які справді визначили результат моделі. Ці якості можуть збігатися, але збіг не гарантований.
Огляд Qing Lyu, Marianna Apidianaki та Chris Callison-Burch 2024 року систематизує понад 110 методів пояснення в NLP саме через проблему faithfulness. Автори показують, що оцінювання пояснюваності потребує окремої перевірки того, чи відображає пояснення реальний процес, відповідальний за прогноз, а не лише є зручною інтерпретацією для читача. Lyu et al., 2024.
Це особливо важливо для генеративного ШІ. Велика мовна модель може створити граматично точне, послідовне й переконливе пояснення власної відповіді. Такий текст є новим згенерованим виходом моделі, і його не слід автоматично трактувати як прямий журнал внутрішнього причинного процесу, що породив попередню відповідь.
Letitia Parcalabescu і Anette Frank показують, що великі мовні моделі можуть генерувати природномовні пояснення, які звучать обґрунтовано, але не обов’язково є faithful щодо внутрішнього процесу. Автори також застерігають, що частина популярних тестів фактично вимірює узгодженість виходів моделі, а не прямий доступ до її внутрішніх механізмів. Parcalabescu & Frank, 2024.
Для користувача це означає просте правило: відповідь чатбота на запит «поясни, як ти дійшов цього висновку» може бути корисною для навчання, перевірки аргументів або пошуку помилки, але сама по собі не є доказом того, що система достовірно розкрила власний внутрішній механізм. У генеративному ШІ слід оцінювати окремо якість відповіді, якість пояснення та можливість незалежної перевірки фактів.
П’ять типів пояснень і що вони реально дають людині
1. Глобальне пояснення моделі
Глобальне пояснення намагається показати загальну логіку системи: які типи даних вона використовує, які закономірності зазвичай мають значення, які відомі обмеження та для яких випадків модель перевіряли. Воно допомагає сформувати загальну ментальну модель системи, але не обов’язково пояснює конкретне рішення.
2. Локальне пояснення конкретного прогнозу
Локальне пояснення відповідає на запитання «чому система видала цей результат саме тут?». Воно може показати важливість окремих ознак або найближчі приклади. Його цінність залежить від точності методу пояснення та того, чи може користувач пов’язати показані чинники з реальною перевіркою.
3. Контрфактичне пояснення
Контрфактична форма відповідає на запитання «що мало б бути інакшим, щоб рішення змінилося?». Вона може бути інтуїтивною та корисною для розуміння меж рішення. Але вона не доводить причинності: те, що зміна ознаки математично змінює вихід моделі, не означає, що ця ознака є реальною причиною явища у світі.
4. Пояснення природною мовою
Текстові пояснення зручні, бо їх легко читати без спеціальних інструментів. Їхня слабка сторона — висока переконливість форми. Для генеративних моделей природномовне обґрунтування особливо важливо відділяти від доведеного опису, що достовірно відображає внутрішній механізм.
Пов’язані статті
Джерела
Everett, J. A. C., Claessens, S., Knöchel, T.-D., & Reinecke, M. G. (2026). Principles for understanding trust in artificial intelligence. Nature Reviews Psychology, 5, 388–401. https://www.nature.com/articles/s44159-026-00562-1
Fok, R., & Weld, D. S. (2024). In search of verifiability: Explanations rarely enable complementary performance in AI-advised decision making. AI Magazine, 45(3), 317–332. https://onlinelibrary.wiley.com/doi/10.1002/aaai.12182
Kaplan, A. D., Kessler, T. T., Brill, J. C., & Hancock, P. A. (2023). Trust in Artificial Intelligence: Meta-Analytic Findings. Human Factors, 65(2), 337–359. https://pubmed.ncbi.nlm.nih.gov/34048287/
Kim, J., Maathuis, H., & Sent, D. (2024). Human-centered evaluation of explainable AI applications: a systematic review. Frontiers in Artificial Intelligence, 7, 1456486. https://pubmed.ncbi.nlm.nih.gov/39484154/
Lyu, Q., Apidianaki, M., & Callison-Burch, C. (2024). Towards Faithful Model Explanation in NLP: A Survey. Computational Linguistics, 50(2), 657–723. https://aclanthology.org/2024.cl-2.6/
National Institute of Standards and Technology. (2023). Artificial Intelligence Risk Management Framework (AI RMF 1.0): AI Risks and Trustworthiness. https://airc.nist.gov/airmf-resources/airmf/3-sec-characteristics/
Parcalabescu, L., & Frank, A. (2024). On Measuring Faithfulness or Self-consistency of Natural Language Explanations. Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics. https://aclanthology.org/2024.acl-long.329/
Reinhard, P., Li, M. M., Peters, C., et al. (2026). Effects of Explanations in Human-AI Interaction: A Systematic Review and Framework for Future Research on Explainable AI. Information Systems Frontiers, 28, 1233–1266. https://link.springer.com/article/10.1007/s10796-026-10716-4
Rosenbacke, R., Melhus, Å., McKee, M., & Stuckler, D. (2024). How Explainable Artificial Intelligence Can Increase or Decrease Clinicians’ Trust in AI Applications in Health Care: Systematic Review. JMIR AI, 3, e53207. https://ai.jmir.org/2024/1/e53207
Visser, R., Peters, T. M., Scharlau, I., & Hammer, B. (2025). Trust, distrust, and appropriate reliance in (X)AI: A conceptual clarification of user trust and survey of its empirical evaluation. Cognitive Systems Research, 91, 101357. https://www.sciencedirect.com/science/article/pii/S1389041725000373
Wang, P., & Ding, H. (2024). The rationality of explanation or human capacity? Understanding the impact of explainable artificial intelligence on human-AI trust and decision performance. Information Processing & Management, 61(4), 103732. https://www.sciencedirect.com/science/article/pii/S030645732400092X
