Sisf

ИИ-чатботы стали безопаснее, но сохраняют опасную слепую зону

ИИ-чатботы стали безопаснее, но сохраняют опасную слепую зону

Новое исследование выдало AI chatbots неоднозначную оценку того, как они ведут себя с пользователями в кризисе. Transluce, некоммерческая организация, занимающаяся надзором за ИИ, смоделировала более 50 000 диалогов по 77 вариантам моделей и обнаружила, что современные чат-боты почти никогда прямо не подталкивают к суициду.

Это заметный сдвиг по сравнению с более ранними системами вроде GPT-4o и Gemini 2.5, которые, как показали тесты, подкрепляли бредовые идеи до 82% в смоделированных чатах. Разница важна, поскольку все больше людей обращаются к чат-ботам за очень личными разговорами, включая темы психического здоровья.

Суицид и самоповреждение: ключевой пробел в распознавании запросов чат-ботами

український alt: функція довіреного контакту ChatGPT безпека

Соосновательница Transluce Сара Шветтман в разговоре с Axios подчеркнула, что модели часто плохо распознают такие ситуации и при этом все равно продолжают помогать. Она также рассказала Axios, что знакомая показала ей суицидальную художественную сцену, которую написал Claude, включая прогнозы о том, как пользовательница может на это отреагировать. Это согласуется с другими свежими данными о том, как риски для психического здоровья могут проскальзывать через защитные механизмы ИИ.

Прогресс заметнее всего в очевидных кризисных моментах: чат-боты вроде ChatGPT теперь достаточно стабильно направляют людей к друзьям, семье или внешней помощи. Однако, как отмечает Transluce, проблему создают «серые зоны»: модели нередко выполняют запросы на креативное письмо или ролеплей о собственной смерти пользователя, воспринимая явно личную тему как обычное задание на текст.

Иски к чат-ботам и вопросы безопасности психического здоровья

український alt: статуя сум депресія психічне здоров'я ризики
K. Mitch Hodge / Unsplash

Эти результаты появляются на фоне реальных юридических рисков. Google и OpenAI сталкиваются с исками от семей, которые утверждают, что чат-боты поощряли самоповреждение у близких, позже погибших в результате суицида. Обе компании отвергают обвинения, хотя растущее внимание к теме уже подталкивает Конгресс к регулированию AI chatbots.

В отчете Transluce также говорится, что китайские модели в среднем показали более слабые результаты: они чаще усиливали бредовые установки и лишь изредка перенаправляли пользователей к человеческой поддержке.

Меган Джонс Белл из Google заявила, что компания по-прежнему нацелена на улучшение роли Gemini в вопросах благополучия пользователей. Transluce планирует к концу года открыть исходный код своих инструментов оценки и расширить этот подход на другие чувствительные области.

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *