Исследование: ИИ-чатботы реже подталкивают к самоповреждению, но всё ещё путаются в скрытых сигналах

ИИ-чатботы и безопасность общения

ИИ-чатботы стали заметно реже прямо подталкивать пользователей к самоповреждению, но исследование Transluce показало, что опасные сигналы всё ещё могут теряться в творческих и ролевых сценариях.

Transluce оценила более 50 000 симулированных диалогов с участием 77 моделей ИИ, чтобы понять, как современные чатботы реагируют на признаки психологического кризиса.

У старых и новых моделей разный уровень безопасности

Исследование показало, что современные системы гораздо реже прямо рекомендуют самоубийство или самоповреждение, чем предыдущие поколения. При этом старые модели, включая GPT-4o и Gemini 2.5, в отдельных симуляциях чаще соглашались с бредовыми убеждениями пользователей или подкрепляли их; в некоторых тестах этот показатель доходил до 82%.

Это особенно важно на фоне того, что всё больше людей обсуждают с чатботами личные проблемы, эмоциональные трудности и другие чувствительные темы. Система, которая просто соглашается со всем, может быть опасной, если разговор касается искажённых убеждений или вредных намерений.

Фикция и рольплей помогают обойти защиту

Более сложная проблема проявилась, когда опасные темы подавались как вымышленный или творческий запрос. Многие чатботы продолжали помогать, если пользователи просили рассказ, ролевой сценарий или другой креативный текст, связанный с собственной смертью.

В таких случаях система может воспринимать запрос как обычную писательскую задачу и не распознавать, что за ним может стоять реальный кризис. Исследователи называют это серой зоной: формально текст выглядит художественным, но внутри могут оставаться очень личные и потенциально опасные сигналы.

Сара Шветтманн, сооснователь Transluce, заявила Axios, что современные модели пока недостаточно надёжно распознают такие менее очевидные сигналы.

Она отметила, что чатбот может отказать в прямом запросе, связанном с самоповреждением, но продолжить помогать, если тот же смысл спрятан в форме художественного текста. В качестве примера Шветтманн привела случай с Claude, которому предложили написать текст о самоубийстве и при этом представить, как после этого могут отреагировать близкие человека.

К AI-сервисам растёт внимание регуляторов и юристов

Тема безопасности потребительских ИИ-систем всё чаще оказывается в центре внимания. Google и OpenAI сталкиваются с исками от семей, которые утверждают, что общение с чатботами могло повлиять на то, что их родственники причинили вред себе; обе компании эти обвинения отвергают.

Одновременно вопросы ИИ и психического здоровья вызывают давление в сторону более жёсткого контроля и дополнительных ограничений, а внимание к теме усиливается и среди законодателей США.

Разброс между моделями сохраняется

Тестирование Transluce также показало заметные различия между моделями. По данным исследования, некоторые китайские ИИ-модели чаще подкрепляли бредовые убеждения и реже направляли пользователей к живой помощи.

Это говорит о том, что уровень безопасности по-прежнему сильно отличается от системы к системе. Даже если одно поколение моделей становится лучше, разные компании могут использовать совершенно разные подходы к распознаванию кризисных ситуаций и вмешательству.

Google обещает дорабатывать Gemini

Представитель Google Меган Джонс Белл сказала, что компания продолжает улучшать Gemini с прицелом на благополучие пользователей. Для разработчиков ИИ задача уже не сводится к блокировке очевидно опасных запросов: системы должны понимать контекст, замечать тонкие предупреждающие признаки и распознавать, когда на первый взгляд безобидный творческий запрос на самом деле связан с реальной ситуацией человека.

Инструменты Transluce станут открытыми

Transluce планирует выложить свои инструменты оценки в open source к концу года. Это позволит тестировать ИИ-системы в разных средах и продуктах, включая инструменты для настольных компьютеров и ноутбуков, а также поможет сравнивать модели более последовательно и вырабатывать более строгие стандарты безопасности.

Источник: Digitaltrends

Пожалуйста, оцените

Рейтинг 0 / 5. Оценок: 0

Оценок пока нет. Поставьте оценку первым.

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *