Jailbreak-атаки на ИИ: понимание и противодействие

В последние годы исследователи и злоумышленники активно выявляют уязвимости в моделях искусственного интеллекта, позволяющие обходить их внутренние ограничения. Эти методы, известные как Jailbreak-атаки, используют различные техники, чтобы заставить ИИ нарушать свои правила, зачастую с целью извлечения конфиденциальной информации или выполнения нежелательных действий. Андрей Якунин, инженер по информационной безопасности в Selectel, отмечает, что для «взлома» нейросети иногда достаточно правильно составленного текстового запроса, который может заставить модель обойти собственные ограничения из «лучших побуждений» — стремления помочь пользователю.

Механизмы Jailbreak-атак

Существует несколько распространенных методов Jailbreak-атак:

  • DAN (Do Anything Now): Заставляет модель «играть» роль персонажа без правил.
  • «Бабушка»: Апеллирует к эмоциональной составляющей, например, просит модель «вспомнить» несуществующего родственника для получения информации.
  • Crescendo: Разбивает опасный вопрос на цепочку безобидных запросов, постепенно подводя модель к выдаче запрещенного контента.
  • Кодирование и стеганография: Использование техник кодирования (например, Base64) или скрытой передачи данных для обхода фильтров безопасности.

Эти приемы отличаются от промпт-инъекций тем, что Jailbreak направлен на полное отключение или модификацию внутренних ограничений модели, тогда как промпт-инъекция стремится манипулировать поведением модели в рамках ее существующих правил.

Защита от атак: опыт Just AI

Команда R&D в Just AI активно занимается разработкой решений для защиты ИИ-агентов от подобных атак. Их продукт, Jay Guard, представляет собой уровень AI-безопасности, который проверяет запросы и ответы на наличие атак, нежелательного контента и персональных данных. Исследования Just AI показали, что готовые модели детекторов часто генерируют ложные срабатывания на русскоязычном трафике, что потребовало значительной доработки данных для обучения.

Обнаружение Jailbreak-атак имеет решающее значение, поскольку они могут привести к серьезным утечкам данных, как это произошло с данными тенантов Microsoft 365 или содержимым приватных каналов Slack. Эти атаки часто используют методы социальной инженерии, применяемые к людям десятилетиями, но теперь их жертвами становятся ИИ-модели. Разработчики продуктов на базе LLM и специалисты по информационной безопасности должны понимать эти угрозы для эффективной защиты систем.