Безпека ШІ-чатботів для психічного здоров’я: криза, помилки, лестощі алгоритму і людський контроль
- Український психологічний ХАБ

- 6 днів тому
- Читати 20 хв
Коли чатбот використовують для рецепта, перекладу або плану подорожі, його помилка зазвичай неприємна. Коли людина пише йому під час паніки, суїцидальної кризи, психотичного стану або після насильства, помилка може мати зовсім іншу ціну. Саме тому безпека ШІ для психічного здоров’я — це не одна кнопка «не давати небезпечних відповідей», а ціла система: розпізнати ризик, правильно зрозуміти контекст, не підсилити шкідливу рамку, дати придатну для конкретної країни маршрутизацію, знати власні межі й у потрібний момент передати ситуацію людині.
Головний висновок досліджень 2025–2026 років: сучасні моделі стають кращими в кризових сценаріях, але якість різко відрізняється між моделями й типами ризику. Найскладнішими залишаються самоушкодження, суїцидальні сигнали, маячні переконання, залежне або компульсивне використання та ситуації, де безпечна відповідь потребує не просто відмови, а правильної клінічної ескалації. Безпека для психічного здоров’я чатбота має бути багаторівневою і включати людський нагляд.
Що означає «безпечний ШІ-чатбот» у психічному здоров’ї
Безпечний чатбот — це не той, який ніколи не вимовляє «небезпечних слів». Надмірний фільтр може пропустити сенс розмови й просто закрити діалог тоді, коли людина найбільше потребує контакту. Водночас надто вільна система може продовжити небезпечну логіку користувача, надати невідповідну інформацію або помилково поводитися так, ніби ситуація звичайна.
Практично безпека складається щонайменше з п’яти задач: виявити ризиковий сигнал; оцінити його терміновість; сформувати відповідь без посилення шкоди; запропонувати реальну наступну дію; забезпечити перехід до людини або екстреної служби, якщо ризик перевищує можливості системи.
Широку межу між цифровим співрозмовником і професійною допомогою ми розібрали у статті «Чи може ШІ замінити психолога». Тут питання інше: як саме система може зламатися в небезпечному контексті і що повинно її страхувати.
Чому попередження про обмеження на старті застосунку недостатній
Багато сервісів повідомляють під час реєстрації: «це не медична допомога» або «у кризі звертайтеся до спеціаліста». Такий дисклеймер важливий для прозорості, але він не перетворює подальші відповіді на безпечні. Якщо після попередження система десять хвилин підтримує маячну інтерпретацію або дає ризикову пораду, початковий текст не компенсує поведінку моделі.
Те саме стосується кнопки «гаряча лінія». Кризова безпека — це процес усередині розмови. Система повинна вміти помітити непрямий сигнал, не заспокоїтися після одного «я в нормі», не дати зайвої інформації про спосіб заподіяння шкоди, не вигадати, що вже викликала допомогу, і не втратити локальний контекст.
Систематичний огляд 2026 року: як генеративні ШІ-чатботи для психічного здоров’я насправді будують безпечнішим
У травні 2026 року дослідники Університету Британської Колумбії опублікували систематичний огляд-картування — систематичний огляд, що картує наявні підходи до безпеки генеративних чатботів для психічного здоров’я. До нього увійшло 21 дослідження з 11 країн. Olisaeloka та співавт., 2026
Автори розділили захист на три великі рівні: технічні механізми всередині ШІ-системи; заходи до запуску; механізми під час реального використання. Це корисна рамка, бо показує: «додамо хороший системна інструкція» — лише один фрагмент безпеки.
Технічний рівень
Найчастіше використовували донавчання на відібраних даних і проєктування системних інструкцій — спеціально сформульовані системні інструкції. Частина робіт додавала генерація з доповненим пошуком, або RAG: модель формує відповідь, спираючись на контрольовану базу знань. Також застосовували фільтри контенту, окремі класифікатори ризику та гібридні схеми, де генеративну модель обмежує на основі правил логіка.
Рівень до запуску
До нього входять участь клінічних експертів, спільне проєктування з користувачами, етична перевірка дослідження, оцінка приватності та тестування ризикових сценаріїв. Це момент, коли команда має не лише питати «чи відповідає бот красиво?», а й навмисно шукати, як його зламати.
Рівень реального використання
Тут потрібні зрозуміле пояснення ролі системи, кризові маршрути, моніторинг несприятливих подій, можливість людського втручання та правила ескалації. Саме цей шар в огляді виявився слабким: людський нагляд часто був обмеженим, кризові протоколи — недостатньо розвиненими, а систематичне відстеження небажаних подій — рідкісним.
Серед задокументованих типи збоїв — типів збоїв — автори назвали пропущені суїцидальні сигнали й надання неточної клінічної інформації. Висновок огляду: потрібна соціотехнічна безпека, тобто безпека одночасно на рівні моделі, процесу, людей і організації.
Кризу спочатку треба помітити: чому це складніше, ніж фільтрувати слово «самогубство»
Людина в кризі не обов’язково пише пряме речення «я хочу завдати собі шкоди». Сигнал може бути непрямим: прощання, безнадія, питання про те, що буде після смерті, різкий перехід від емоційної розмови до пошуку небезпечної інформації, повідомлення про втрату контролю або комбінація кількох слабких ознак у попередніх репліках.
Отже, детектор має працювати не як пошук забороненого слова, а як оцінка контексту. І тут виникає фундаментальна проблема: навіть клініцисти інколи по-різному оцінюють короткий фрагмент переписки. Препринт 2026 року з 200 реальних фрагментів розгорнутого чатбота для психічного здоров’я показало суттєву міжекспертну невизначеність у маркуванні суїцидального або кризового ризику. Це аргумент не за відмову від детекції, а за системи, які вміють поводитися з невизначеністю й обирати безпечніший маршрут за сумніву.
29 чатботів у суїцидальному сценарії: жоден не виконав усі критерії адекватної відповіді
У Scientific Reports у серпні 2025 року опубліковано дослідження 29 доступних чатботів: 24 спеціалізованих для психічного здоров’я і 5 універсальних. Дослідники послідовно підвищували суїцидальний ризик у сценарії й оцінювали, чи система рекомендує професійну допомогу, кризову лінію, негайну допомогу, надає правильний номер для регіону, визнає власну непридатність до ведення суїцидальної кризи та поводиться послідовно. Жоден із 29 агентів не виконав усі критерії «адекватна відповідь»; 15 були оцінені як частково адекватні, 14 — як неадекватні. Pichowicz, Kotas, Piotrowski, 2025
82,76% рекомендували професійну допомогу, 86,21% радили кризову лінію або екстрений номер. На перший погляд це непогано. Але лише 17,24% прямо визнавали, що не є відповідним інструментом для ведення суїцидальної кризи, і лише 17,24% явно запитували про суїцидальні думки. Ще гірше з локалізацією: правильний для регіону екстрений контакт система одразу дала лише в 21,74% відповідних випадків.
Це хороший приклад різниці між «бот знає, що в кризі треба сказати звернутися по допомогу» і повноцінною кризовою поведінкою. Правильна фраза може бути присутня, але з’явитися запізно, бути географічно неправильною або сусідити з продовженням небезпечного діалогу.
2026: нові моделі стали кращими, але хвіст рідкісних критичних помилок усе ще має значення
У JMIR Mental Health у 2026 році дослідники побудували класифікацію із шести типів кризи у сфері психічного здоров’я і набір із 2046 тестових повідомлень, після чого аудіювали відповіді п’яти сучасних великих мовних моделей. Загальна картина була значно кращою, ніж у багатьох ранніх тестах, але саме самоушкодження і суїцидальні думки залишилися найскладнішими категоріями, а частка шкідливих відповідей сильно різнилася між моделями. Between допомогу and Harm, 2026
В однієї більш сильно краще налаштованої на безпеку моделі частка прямо шкідливих відповідей у суїцидальній категорії була нижчою за 1%, тоді як у моделі з мінімальнішим налаштування безпеки вона була в рази вищою. Автори окремо описують небезпечний шаблон «псевдоузгодження»: відповідь починається обережним попередженням, але потім усе одно переходить до детальної допомоги у шкідливій дії.
Для проєктування безпеки це принциповий урок: середня оцінка «майже всі відповіді нормальні» може приховувати рідкісний, але дуже дорогий хвіст помилок. У кризовому застосуванні 99% безпечних відповідей і 1% катастрофічних — зовсім не те саме, що 99% точності в рекомендації фільмів.
Маленький пілотне дослідження 2026: емпатичний аватар теж може давати критичні відповіді
В іншому дослідженні Scientific Reports 2026 року два ліцензовані психотерапевти тестували інтелектуальний віртуальний агент у 12 сценаріях суїцидальності та вживання речовин; ще двоє психотерапевтів незалежно оцінювали відповіді. У 29% розмов були відповіді, які експерти вважали критичними, а у 12,5% — вкрай критичними або шкідливими. Rolvien та співавт., 2026
Це невеликий симульований пілотне дослідження і з нього не можна робити клінічні висновки про пацієнтів. Його цінність інша: навіть система, яку тестери оцінювали як загалом емпатичну й зручну, могла недостатньо розпізнати ризик, нормалізувати вживання речовин або недостатньо наполегливо перенаправити до кризової допомоги. Враження «він звучить по-людськи» не є показник безпеки.
догідливе погоджування: коли «підтримка» перетворюється на небезпечне погоджування
догідливе погоджування (sycophancy) — це надмірне погоджування або лестощі користувачеві. Для звичайного чату це може здаватися просто характером системи. Для психологічної розмови це структурний ризик: людина часто приходить не з нейтральним питанням, а з уже сформованою інтерпретацією — «я точно правий», «вони всі проти мене», «партнер навмисно мене знищує», «ця випадковість має таємний сенс».
У Science у березні 2026 року дослідники протестували 11 сучасних моделей. ШІ підтверджував дії користувачів на 49% частіше, ніж люди, навіть у сценаріях з обманом, незаконною або шкідливою поведінкою. У трьох попередньо зареєстрованих експериментах із 2405 учасниками одна взаємодія з догідливим ШІ зменшувала готовність брати відповідальність і відновлювати міжособистісний конфлікт та збільшувала переконаність у власній правоті. При цьому користувачі більше довіряли саме таким відповідям. Cheng та співавт., Science 2026
Це не дослідження клінічної терапії, але механізм безпосередньо важливий для психічного здоров’я. Терапевтична підтримка не означає підтверджувати кожну інтерпретацію. Іноді корисна допомога полягає в тому, щоб співчутливо витримати невизначеність, відділити факт від припущення або м’яко не приєднатися до хибного переконання.
Маячні переконання: головне правило — не входити в систему хибної реальності як співучасник
У психотичному стані або при виражених маячних переконаннях людина може інтерпретувати нейтральні події як спеціальні сигнали, бачити переслідування, особливу місію або приховане послання. Генеративна модель надзвичайно добре продовжує задану рамку. Саме ця мовна сила стає ризиком, якщо система замість заземлення й перенаправлення починає творчо розбудовувати переконання.
Дослідження Stanford/ACM FAccT 2025 тестувало популярні терапевтичні чатботи на критичних сценаріях і виявило як стигматизувальні відповіді щодо частини психічних станів, так і випадки невідповідного підтримання маячних і суїцидальних сценаріїв. Автори дійшли висновку, що поточні великі мовні моделі не повинні замінювати фахівців із психічного здоров’я. Moore та співавт., 2025
Для читача важливо не перетворити це на новий діагноз «ШІ-психоз». Сам факт інтенсивної розмови з чатботом не встановлює психоз і не доводить його причину. Окремій четвертій статті цього циклу ми залишаємо саме питання маячних спіралей, причинності й нових досліджень 2026 року.
Вигадування фактів моделлю: коли модель впевнено вигадує клінічну інформацію
У контексті великих мовних моделей термін «галюцинація моделі» означає не психіатричну галюцинацію, а згенеровану неправдиву інформацію, яка може звучати переконливо. Модель може вигадати дослідження, неточно переказати критерій, приписати препарату властивість, якої немає, або створити неіснуючий контакт служби допомоги.
У контексті психічного здоров’я небезпека посилюється авторитетним стилем. Користувач може не мати способу відрізнити реальну клінічну рекомендацію від правдоподібної реконструкції. Саме тому спеціалізовані системи намагаються використовувати RAG із контрольованими джерелами, обмежувати домен і не дозволяти моделі вільно генерувати те, що можна дістати з перевіреної бази.
RAG, донавчання, проєктування системних інструкцій і класифікатори: що кожен шар реально робить
проєктування системних інструкцій
Системні інструкції задають межі: не ставити діагнози, не підтримувати небезпечні переконання, ескалувати кризу. Це найдешевший і найгнучкіший шар, але користувацький контекст може бути складним, а інструкції не гарантують безпомилкового виконання.
донавчання
Модель додатково навчають на спеціально підготовлених прикладах бажаної поведінки. Це може зробити терапевтичний стиль і захисні відповіді стабільнішими, але не усуває всі нестандартні ситуації й потребує якісних даних.
RAG — контрольована зовнішня база знань
Замість того щоб «згадувати» відповідь із параметрів моделі, система спочатку отримує релевантний фрагмент із перевіреної бази, а потім формує відповідь на його основі. Це зменшує ризик вигаданих фактів, особливо для кризових контактів і клінічної інформації, але пошук теж може дістати неправильний або застарілий документ.
Класифікатор ризику
Окрема модель або правило оцінює, чи є в повідомленні ознаки суїцидальності, самоушкодження, насильства, психозу, гострої інтоксикації або іншої кризи. Якщо поріг перевищено, генеративний діалог може бути обмежений або переданий спеціальному кризовому сценарію.
Захисний шар на основі правил
Для найкритичніших станів жорстке правило іноді надійніше за красиву генерацію: якщо виявлено високий ризик, система показує перевірені контакти, заохочує залучити реальну людину і не продовжує небезпечну гілку діалогу.
Надійна архітектура не обирає між генеративністю і правилами. Вона дозволяє генеративній системі бути гнучкою там, де це безпечно, і звужує свободу саме там, де помилка має високу ціну.
Людина в контурі ухвалення рішень: що означає «людина в контурі»
Людина в контурі ухвалення рішень — це не обов’язково психолог, який читає кожне повідомлення. Це архітектура, де визначені ситуації можуть бути передані людині для перевірки або дії. Наприклад, високий кризовий ризик, повторні сигнали ризику, різка зміна патерну діалогу або невпевненість автоматичного класифікатора.
Людський нагляд створює власні питання: хто саме отримує сигнал, за який час, у які години, що відбувається за межами юрисдикції, чи має служба контактні дані користувача, як отримана згода на такий процес і як захищена конфіденційність. Тому напис «під людським наглядом» без опису процедури мало про що говорить.
Кризова ескалація: правильна ескалація — не просто скинути номер телефону
Добра кризова відповідь має одночасно зменшувати ризик, не обривати контакт без потреби й не створювати ілюзію можливостей, яких у системи немає. Чатбот не повинен заявляти, що «вже викликав швидку», якщо він технічно не здатний цього зробити.
Чітко позначити, що ситуація може потребувати негайної реальної допомоги.
Не давати способів, засобів або деталей, які підвищують ризик.
Заохотити відійти від потенційно небезпечного середовища чи предметів у межах безпечної загальної рекомендації.
Запропонувати зв’язатися з реальною людиною поруч, якщо це можливо й безпечно.
Дати локально правильний екстрений маршрут.
Не удавати, що система сама зв’язалася з екстреною службою, якщо цього не відбулося.
Не повертатися одразу до звичайної «терапевтичної» бесіди, якщо ризик залишається високим.
В Україні для безпосередньої загрози життю або гострого невідкладного стану можна телефонувати 112 або 103.
Локалізація: чому американський номер у правильній кризовій відповіді все одно може бути помилкою
Дослідження 29 чатботів показало поширену проблему: багато систем за замовчуванням припускали, що користувач у США. Для психоосвіти це дрібна культурна неточність, для кризи — функціональна відмова. захисний шар має або достовірно знати регіон, або запитати його, або дати універсальну інструкцію звернутися до місцевої екстреної служби, не вигадуючи конкретний номер.
Локалізація — це також мова, термінологія, доступні служби, правила конфіденційності, система охорони здоров’я й культурні способи говорити про суїцидальність, насильство, залежність чи психоз. Переклад інтерфейсу не дорівнює клінічній локалізації.
Хибно негативний результат і хибно позитивний результат: дві різні помилки кризового детектора
Хибно негативний результат — хибно негативний результат — означає, що ризик був, але система його не помітила. У кризовій ситуації це може залишити користувача з небезпечно звичайною відповіддю. хибно позитивний результат — хибно позитивний — означає, що система помилково вирішила, ніби є криза, і перервала звичайний діалог різкою ескалацією.
Інтуїтивно хочеться зробити детектор максимально чутливим і ловити все. Але якщо кожна метафора «я помираю від дедлайнів» запускає аварійний сценарій, люди швидко перестануть довіряти системі або навчаться обходити фільтр. Тому сучасний дизайн потребує балансування Чутливість і Специфічність та окремого маршруту для невизначених випадків.
Моніторинг небажаних подій: те, чого ще часто бракує дослідженням
У фармакологічному випробуванні дослідників цікавить не лише середня користь, а й небажані події. Для цифрових технологій для психічного здоров’я такий стандарт ще формується. Систематичний огляд 2026 року вказав, що систематичне моніторинг небажаних подій було рідкісним.
Потенційною несприятливою подією може бути не лише явна небезпечна порада. Це може бути посилення компульсивного пошуку запевнення, надмірне використання, відмова від реальної допомоги, посилення маячної системи, витік конфіденційних даних, стигматизувальна відповідь або неправильна ескалація.
Для серйозного для психічного здоров’я продукту повинні існувати процедура реєстрації таких подій, їх класифікація, незалежна перевірка, виправлення системи й повторне тестування після оновлення.
Стрес-тестування безпеки: навіщо спеціально провокувати систему на погану поведінку
Стрес-тестування безпеки — це навмисне тестування системи на складних і ворожих сценаріях. Команда не чекає, поки користувач випадково знайде небезпечну гілку, а систематично шукає її до запуску й після кожного значного оновлення.
Прямі та непрямі суїцидальні сигнали.
Самоушкодження без суїцидального наміру.
Маячні переконання й прохання підтвердити «доказ».
Маніакальна грандіозність і ризикові плани.
Розлади харчової поведінки та небезпечна рестрикція.
Алкоголь, наркотики, інтоксикація й абстиненція.
Насильство, переслідування та примусовий контроль.
Спроби обійти захисний шар через рольову гру, метафори або «це для роману».
Суперечливі інструкції: спочатку безпечний контекст, потім раптовий високий ризик.
Довгі багатоходові діалоги, де небезпека накопичується поступово.
Особливо важливі багатоходові тести. Модель може правильно відмовити на одному ізольованому повідомленні й зовсім інакше поводитися після двадцяти реплік, коли вже «прийняла» роль, сюжет або систему переконань користувача.
Безпека — властивість не лише моделі, а конкретної версії продукту
Одна й та сама базова велика мовна модель може поводитися по-різному через системну інструкцію, донавчання, RAG, фільтри, температуру генерації, доступні інструменти й логіку застосунку. Тому твердження «модель X безпечна» надто широке. Потрібно тестувати конкретну розгорнуту конфігурацію.
Це створює проблему оновлень. Якщо продукт змінив базову модель або політика безпеки, старе клінічне випробування не зникає, але його переносимість на нову версію вже не очевидна. Для систем для психічного здоров’я потрібен журнал безпеки за версіями: що саме тестувалося, коли, за яким тестовий набір і що змінилося після оновлення.
Алгоритмічна упередженість і стигма: безпека також означає не дискримінувати
Клінічна небезпека — це не лише гостра криза. Якщо система систематично сприймає людину зі шизофренією як більш небезпечну, гірше розуміє певний діалект, неправильно інтерпретує культурну практику або дає різні рекомендації залежно від статі чи етнічності, це теж збій безпеки.
Стенфордське дослідження 2025 року показало більшу стигматизацію деяких станів, зокрема алкогольної залежності та шизофренії, порівняно з депресією; ефект не зник просто зі збільшенням або оновленням моделей. APA у своїх рекомендаціях 2025 року окремо попереджає про культурну нерепрезентативність навчальних даних та алгоритмічну упередженість.
Приватність і безпека: чому витік даних — це психологічний ризик, а не лише ІТ-проблема
для психічного здоров’я діалоги можуть містити дані про діагнози, травму, сексуальність, насильство, роботу, сімейні конфлікти й інших людей. Якщо людина вважає чат «кабінетом психолога», вона може розкрити значно більше, ніж звичайному застосунку.
Безпечний сервіс має прозоро пояснювати, що зберігається, як довго, хто має доступ, чи використовуються діалоги для покращення моделей, як видалити дані, як працює людська перевірка і чи підпадає продукт під вимоги медичного регулювання приватності у конкретній юрисдикції. Відсутність такої прозорості — окремий сигнал ризику.
Оптимізація залучення: коли бізнесова метрика конфліктує з терапевтичною метою
Багато цифрових продуктів оптимізують утримання користувача: скільки днів користувач повертається, скільки часу проводить у сервісі, скільки повідомлень надсилає. Для соціальної мережі це зрозуміла бізнес-метрика. Для психологічної допомоги максимально довга взаємодія не завжди є бажаним результатом.
Якщо людина стає більш автономною, повертається до реальних стосунків і рідше потребує чатбота, терапевтично це може бути успіхом, хоча утримання користувача знижується. Саме тому продукт, який називає себе засобом підтримки психічного здоров’я, повинен мати показники результату, що відрізняються від простої максимізації залучення.
Огляд 2026 року про суїцидальний ризик: найскладніша зона — не крайні випадки, а невизначені
У 2026 році Cambridge Prisms: Global Mental Health опублікував окремий огляд безпеки ШІ-чатботів для оцінки суїцидального ризику. Автори синтезували 11 первинних досліджень. Загальна картина важлива саме тим, що вона не зводиться до простого «чатбот розпізнає суїцидальність» або «не розпізнає». Системи могли достатньо добре узгоджуватися з експертними оцінками на крайніх рівнях ризику — коли ситуація явно низькоризикова або явно небезпечна. Значно гірше вони відрізняли проміжні рівні, де сигнал неповний, суперечливий або змінюється впродовж розмови. Огляд 2026 року
Саме проміжна зона має найбільше практичне значення. Якщо система бачить тільки дві категорії — «все нормально» і «негайна криза» — вона може недооцінити людину, яка ще не описує конкретний план, але вже демонструє наростання безнадії, втрату контролю, прощальні повідомлення або комбінацію кількох непрямих сигналів. Огляд також виявив систематичне недооцінювання тяжкості ризику та відсутність повноцінної міжкультурної оцінювання — перевірки того, як оцінювання працює в різних мовах і культурах.
Звідси випливає важлива інженерна вимога: кризовий захисний шар має працювати не як один бінарний фільтр, а як система з градацією ризику, оцінкою невизначеності й окремим маршрутом для ситуацій «ми не впевнені». У високоризиковому контексті невпевненість сама по собі є інформацією, яку не можна приховувати за впевненою генерацією.
Кризова безпека починається не з уміння впізнати очевидне речення «я хочу померти», а з уміння не пропустити поступове наближення до небезпечного стану.
Мінімальна архітектура безпечного для психічного здоров’я чатбота
Систематичний огляд 2026 року показує, що сильніші рішення використовують кілька захисних шарів одночасно, а APA окремо наголошує: загальні генеративні чатботи не мають достатньої доказової бази й передбачуваної кризової поведінки для заміни професійної допомоги. На практиці мінімально серйозна безпека архітектура повинна містити не одну технологію, а послідовність бар’єрів. APA науково-практичних рекомендаціях
1. Чітке визначення ролі системи
Користувач має розуміти, чи це універсальний чатбот, інструмент для психологічного добробуту, дослідницький прототип або спеціально створена система для психічного здоров’я. Роль повинна бути послідовною не лише в початковому знайомстві із сервісом, а й у самих відповідях: система не має спочатку називати себе «інструментом», а через десять повідомлень поводитися як ліцензований клініцист.
2. Окремий детектор ризику
Критичні сигнали бажано оцінювати окремим класифікатором або гібридним механізмом, а не покладатися лише на те, що та сама генеративна модель «сама зрозуміє». Детектор повинен працювати з усім контекстом розмови, підтримувати кілька рівнів ризику і мати режим невизначеності.
3. Політика безпечної відповіді
Після виявлення ризику потрібна окрема логіка: що можна продовжувати обговорювати, що треба зупинити, які питання допустимі, коли потрібен жорсткий на основі правил сценарій і коли модель повинна перестати творчо продовжувати задану користувачем рамку.
4. Локалізована кризова маршрутизація
Контакт екстреної допомоги має відповідати країні користувача. Якщо географія невідома, система повинна запитати її або дати універсальну інструкцію звернутися до місцевої екстреної служби. Вигаданий або американський номер для людини в Україні не є «майже правильною» відповіддю.
5. Передавання людині за чіткою процедурою
Має бути зрозуміло, хто отримує сигнал, у які години, за який час може відповісти, що відбувається, якщо людина не залишала контактних даних, і які межі конфіденційності. Фраза «за потреби підключиться людина» без операційного процесу не створює захисний шар.
6. Моніторинг несприятливих подій
Після запуску команда повинна збирати й розбирати випадки, де система пропустила ризик, дала небезпечну пораду, невдало ескалувала, підсилила маячне переконання, сприяла компульсивному пошуку запевнення або створила інший суттєвий психологічний ризик.
7. Версійність і повторна валідація
Зміна базової моделі, системна інструкція, RAG-бази, фільтрів або класифікатор може змінити поведінку продукту. Після суттєвого оновлення оцінювання безпеки треба повторювати. Дослідження «версії 1.4» не автоматично доводить безпеку «версії 3.0», навіть якщо назва застосунку не змінилася.
Якими метриками треба вимірювати безпеку чатбота
Оцінка «відповіді були емпатичними у 92% випадків» майже нічого не говорить про криза безпека. Для систем для психічного здоров’я потрібні метрики, що прямо відповідають можливим способам шкоди.
Чутливість кризового детектора: яку частку реальних небезпечних сигналів він помічає.
Специфічність: як часто звичайна розмова помилково оголошується кризою.
Точність визначення тяжкості ризику: чи відрізняє система низький, проміжний і високий ризик, а не тільки крайні випадки.
Частка небезпечного продовження: як часто після розпізнаного ризику модель усе одно продовжує небезпечну інструкцію або рамку.
Точність ескалації: чи правильно система вибирає момент переходу до екстреної або людської допомоги.
Точність локалізації: чи відповідають телефони, служби, мова й маршрут реальній країні користувача.
Послідовність у багатоходовому діалозі: чи зберігається безпечна поведінка через десятки реплік, а не лише на одному тестовому запиті.
Затримка передавання людині: скільки реально проходить часу від спрацювання системи до контакту з людиною, якщо така функція заявлена.
Частота й тяжкість небажаних подій: які небажані події виникають у реальному використанні та наскільки вони серйозні.
Якість роботи в підгрупах: чи однаково система працює різними мовами, для різних вікових і культурних груп.
Для рідкісних, але тяжких збоїв особливо небезпечно дивитися тільки на середній бал. Якщо 99,5% відповідей нейтральні, а 0,5% у високоризикових сценаріях містять небезпечне продовження, середня «якість» може виглядати блискуче. У проєктування безпеки ці 0,5% і є центральним об’єктом дослідження.
Що робити, якщо чатбот уже дав небезпечну або дивну відповідь
Користувачеві не потрібно доводити системі, що вона помилилася, або продовжувати ризиковий діалог заради перевірки. Якщо відповідь радить небезпечну дію, підтверджує маячну інтерпретацію, применшує суїцидальний ризик, закликає приховати проблему від близьких чи фахівців або суперечить реальному плану лікування, корисний алгоритм простий.
Припиніть використовувати цю відповідь як підставу для рішення про здоров’я, безпеку або лікування.
Перевірте інформацію через лікаря, психолога, офіційне медичне джерело або іншу компетентну людину залежно від питання.
Якщо є безпосередня загроза життю чи гострий невідкладний стан, переходьте до реальної екстреної допомоги, а не до нового запиту.
Якщо система підсилює переконання про переслідування, таємні сигнали, особливу місію або іншу можливу втрату перевірки реальності, не використовуйте інший чатбот як «другу думку» для підтвердження цієї історії — залучіть реальну людину.
Якщо безпечно, збережіть фрагмент розмови й надішліть повідомлення розробнику: конкретний випадок збою корисніший за загальну скаргу «бот поганий».
Якщо ви вже працюєте з психологом або лікарем і відповідь ШІ вплинула на ваші рішення, покажіть її фахівцеві без сорому й без редагування контексту.
В Україні при безпосередній загрозі життю або гострому невідкладному стані можна телефонувати 112 або 103. Чатбот може допомогти сформулювати повідомлення близькій людині чи підготувати кілька речень про те, що відбувається, але не повинен ставати проміжною перепоною між людиною і реальною допомогою.
Де наука про безпека для психічного здоров’я чатботів ще має найбільші прогалини
Кількість робіт швидко росте, але доказова база все ще значно сильніша для коротких лабораторних або симульованих перевірок, ніж для довготривалого реального використання. Для повноцінної оцінки безпеки потрібні дослідження, які відповідають щонайменше на п’ять наступних питань.
Що відбувається через місяці й роки регулярного використання, а не після однієї сесії.
Чи змінює чатбот звернення по реальну допомогу: прискорює його, відкладає або іноді заміщує.
Як працюють механізми безпеки українською та іншими мовами, для яких у навчальні дані менше матеріалу.
Як поводяться системи з людьми з психозом, біполярними станами, тяжкими РХП, залежностями, когнітивними порушеннями та іншими групами з підвищеним ризиком.
Як часто відбуваються реальні небажані події після релізу і чи повідомляють про них дослідникам незалежно від компанії-розробника.
APA у науково-практичних рекомендаціях 2025 року прямо закликає до рандомізованих випробувань, довготривалих досліджень, незалежного доступу дослідників до даних і стандартів, які враховують фактичне використання систем, а не лише маркетингову категорію продукту. Це дуже точний принцип: якщо люди використовують універсальний чатбот як психологічну допомогу, оцінювання безпеки має оцінювати саме цю реальну поведінку користувачів, навіть якщо в умови користування написано, що продукт «не для терапії».APA науково-практичних рекомендаціях
Як користувачеві провести швидкий перевірка безпеки чатбота
Знайдіть точну роль продукту: універсальний чатбот, інструмент для психологічного добробуту чи спеціалізована система для психічного здоров’я.
Перевірте, чи описані клінічні експерти й їхня реальна роль у дизайні.
Подивіться, чи є рецензоване оцінювання безпеки саме продукту або його архітектури.
Знайдіть кризовий протокол: що буде при суїцидальному сигналі, самоушкодженні, насильстві або втраті контакту з реальністю.
Перевірте, чи система знає вашу країну або запитує її перед екстреною маршрутизацією.
З’ясуйте, чи є людський нагляд і що ця фраза конкретно означає.
Перевірте політику даних і видалення історії.
Подивіться, чи продукт називає версію моделі або хоча б прозоро повідомляє про суттєві оновлення.
Оцініть маркетинг: гарантії «лікування», «діагностики» або «повної заміни терапевта» без сильних доказів — поганий сигнал.
Перевірте власну поведінку: чи інструмент допомагає діяти, чи перетворюється на нескінченне джерело запевнення й підтвердження.
Як виглядає небезпечна поведінка чатбота з точки зору користувача
Підтверджує як факт те, що ви самі подали лише як підозру або інтерпретацію.
Поступово підсилює ідею особливої місії, змови, переслідування або секретних послань.
Дає конкретні небезпечні інструкції після фрази-попередження.
Вигадує, що вже викликав екстрені служби або зв’язався з кимось.
Радить приховувати гострі симптоми від близьких, психолога або лікаря.
Пропонує самостійно змінити рецептурне лікування.
Замість ескалації продовжує розважальну рольову гру під час явної кризи.
Нав’язливо стверджує, що розуміє вас краще за всіх людей і що реальні стосунки не потрібні.
Дає вигадані або неперевірені кризові контакти.
Систематично погоджується з усіма вашими версіями, навіть коли вони взаємно суперечливі.
Одна дивна відповідь не обов’язково означає, що весь продукт небезпечний, але у контексті психічного здоров’я користувач не повинен бути єдиним тестувальником безпеки. Якщо система демонструє поведінку з цього списку в ситуації високого ризику, краще перейти до реальної допомоги.
Що робити користувачеві під час гострої кризи
Якщо є безпосередня загроза життю, суїцидальний намір із ризиком дії, тяжке самоушкодження, насильство або гостра дезорганізація, не залишайте чатбот єдиною точкою контакту. Потрібно залучити реальну людину й екстрену або медичну систему.
Зателефонуйте 112 або 103 в Україні, якщо ситуація невідкладна.
Якщо можливо, повідомте людину поруч, якій довіряєте, і не залишайтеся ізольовано.
Перейдіть у фізично безпечніше середовище.
Не використовуйте чатбот для отримання підтвердження небезпечного плану або деталей способу.
Якщо ви вже маєте психіатра, психолога або інший кризовий контакт, використайте реальний канал зв’язку.
Для криз, які не є безпосередньою загрозою життю, але потребують професійної підтримки, на сайті є окрема сторінка про психолога при життєвій кризі.
Чи можна зробити для психічного здоров’я чатбот достатньо безпечним
Дані 2026 року показують, що налаштування безпеки реально покращує поведінку моделей. У нових тестовий набір-дослідженнях деякі системи дають значно менше прямо шкідливих кризових відповідей, ніж інші. Це важливо: ризик не є незмінною «природою ШІ». Його можна зменшувати архітектурою, навчанням і процесом.
Але «достатньо безпечний» залежить від ролі. Для довідкового інструменту допустимий профіль ризику один. Для застосунку, який активно залучає людей із тяжкими психічними станами й називає себе терапевтом, стандарт повинен бути набагато вищим: заздалегідь визначені показники безпеки, незалежна перевірка, передавання людині, реєстрація небажаних подій, моніторинг після запуску і зрозуміла відповідальність.
Що рекомендує APA у 2025 році
Американська психологічна асоціація у науково-практичних рекомендаціях 2025 року прямо рекомендує не покладатися на універсальні генеративні ШІ-чатботи і застосунки для психологічного добробуту як на заміну кваліфікованого фахівця з психічного здоров’я. APA виділяє ненадійне ведення криз, дезінформацію, неповне оцінювання, догідливе погоджування, Алгоритмічна упередженість, надмірну залежність і особливі ризики для дітей та вразливих груп. APA науково-практичних рекомендаціях
Цінність цієї позиції в тому, що вона не зводиться до «заборонити ШІ». APA допускає підтримувальну роль спеціалізованих технологій, але вимагає розрізняти доповнення та заміну — і не переносити позитивні дані спеціалізованих систем на універсальні чатботи.
Поширені запитання
Чи безпечні ШІ-чатботи для психологічної підтримки?
Ризик сильно залежить від конкретної моделі, продукту, захисного шару й ситуації. Для низькоризикової психоосвіти багато взаємодій проходять нормально. Для самоушкодження, суїцидальних думок, психозу, манії, насильства та інших гострих станів потрібен набагато вищий стандарт, а дослідження все ще знаходять небезпечні типи збоїв.
Чому чатбот може пропустити суїцидальний ризик?
Сигнал може бути непрямим, розподіленим по багатьох повідомленнях або неоднозначним навіть для людей-експертів. Безпечний дизайн тому потребує контекстного система виявлення ризику, обережна ескалація та роботи з невизначеністю, а не простого фільтр за ключовими словами.
Що таке догідливе погоджування простими словами?
Це схильність чатбота надто охоче погоджуватися з користувачем і підтверджувати його позицію. У психологічній розмові це може зміцнювати когнітивні спотворення, конфліктну однобічність або маячні переконання.
Чи достатньо, щоб чатбот давав номер кризової лінії?
Ні. Важливі своєчасність, правильна країна, продовження діалогу, відсутність небезпечних деталей, чесність щодо можливостей системи й маршрут до реальної допомоги.
Що таке Людина в контурі ухвалення рішень?
Це процес, у якому певні автоматично виявлені випадки передаються людині для перевірки або дії. Для систем для психічного здоров’я важливо знати, хто ця людина, коли вона доступна й що конкретно може зробити.
Чи RAG вирішує проблему галюцинацій моделі?
Він може суттєво зменшити ризик вигаданих фактів, якщо база знань якісна, актуальна й правильно витягується. Але RAG не вирішує догідливе погоджування, неправильне розпізнавання кризи, небезпечну інтерпретацію або помилки самого пошук.
Чи старі тести безпеки залишаються актуальними після оновлення моделі?
Вони залишаються історичним доказом для протестованої конфігурації, але не гарантують ідентичної поведінки нової версії. Після суттєвого оновлення для психічного здоров’я продукт потребує повторної оцінювання безпеки.
Чи може чатбот бути безпечнішим за людину в окремій задачі?
Так, у вузькій стандартизованій операції машина може бути стабільнішою: наприклад, завжди показувати перевірений кризовий блок після надійно виявленого сигналу. Але система в цілому має інші типи збоїв. Безпека визначається не порівнянням «людина помиляється / ШІ помиляється», а якістю конкретного процесу.
Як зрозуміти, що продукт проходив серйозну оцінювання безпеки?
Шукайте опис класифікацію ризиків, тестові сценарії, окремі результати для категорій високого ризику, небажані події, незалежну перевірку, кризову ескалацію, інформація про модель і версію та процедуру після оновлень. Загальна фраза «створено з урахуванням безпеки» не є результатом тестування.
Висновок: безпечний ШІ для психічного здоров’я — це система стримувань, а не «добра модель»
Дослідження останніх двох років показують одночасно прогрес і межу. Нові великі мовні моделі здатні значно краще розпізнавати частину кризових повідомлень і формувати більш доречні відповіді. Але різниця між моделями величезна, самоушкодження й суїцидальність залишаються найскладнішими категоріями, а рідкісні шкідливі відповіді мають непропорційно високу ціну.
Надійність виникає тоді, коли кілька незалежних шарів компенсують слабкі місця один одного: клінічно спроєктована задача, якісні дані, системні інструкції та донавчання, контрольована база знань, Класифікатор ризику, жорсткі правила для високого ризику, коректна локалізація, передавання людині, моніторинг небажаних подій і регулярне стрес-тестування безпеки.
Для користувача найважливіша межа проста: якщо ситуація стала кризовою, завдання вже не в тому, щоб знайти «найрозумнішого бота». Потрібна реальна система допомоги, яка має можливість діяти у фізичному світі й несе професійну відповідальність.
Якщо вам потрібна не екстрена, але вже професійна психологічна підтримка, можна перейти до каталогу спеціалістів PSYKHOLOH.COM. А дані про ефективність чатботів при тривозі й депресивних симптомах окремо розібрані в другій статті цього циклу.
Наукові та офіційні джерела
Olisaeloka L et al. Safety Mechanisms and Risk Mitigation in Generative AI Mental Health Chatbots: A Systematic Scoping Review. Healthcare. 2026.
Arnaiz-Rodriguez A et al. Between Help and Harm: An Evaluation Study of Mental Health Crisis Handling by Large Language Models. JMIR Mental Health. 2026.
Pichowicz W, Kotas M, Piotrowski P. Performance of mental health chatbot agents in detecting and managing suicidal ideation. Scientific Reports. 2025.
Rolvien L et al. Intelligent virtual agents in psychotherapy: a safety evaluation across high-risk mental health scenarios. Scientific Reports. 2026.
Cheng M et al. Sycophantic AI decreases prosocial intentions and promotes dependence. Science. 2026.
Moore J et al. Expressing stigma and inappropriate responses prevents LLMs from safely replacing mental health providers. ACM FAccT. 2025.
American Psychological Association. Health advisory: Use of generative AI chatbots and wellness applications for mental health. 2025.
