Jailbreak-атаки на ИИ: понимание и противодействие
В последние годы исследователи и злоумышленники активно выявляют уязвимости в моделях искусственного интеллекта, позволяющие обходить их внутренние ограничения. Эти методы, известные как Jailbreak-атаки, используют различные техники, чтобы заставить ИИ нарушать свои правила, зачастую с целью извлечения конфиденциальной информации или выполнения нежелательных действий. Андрей Якунин, инженер по информационной безопасности в Selectel, отмечает, что для «взлома» нейросети иногда достаточно правильно составленного текстового запроса, который может заставить модель обойти собственные ограничения из «лучших побуждений» — стремления помочь пользователю.
Механизмы Jailbreak-атак
Существует несколько распространенных методов Jailbreak-атак:
- DAN (Do Anything Now): Заставляет модель «играть» роль персонажа без правил.
- «Бабушка»: Апеллирует к эмоциональной составляющей, например, просит модель «вспомнить» несуществующего родственника для получения информации.
- Crescendo: Разбивает опасный вопрос на цепочку безобидных запросов, постепенно подводя модель к выдаче запрещенного контента.
- Кодирование и стеганография: Использование техник кодирования (например, Base64) или скрытой передачи данных для обхода фильтров безопасности.
Эти приемы отличаются от промпт-инъекций тем, что Jailbreak направлен на полное отключение или модификацию внутренних ограничений модели, тогда как промпт-инъекция стремится манипулировать поведением модели в рамках ее существующих правил.
Защита от атак: опыт Just AI
Команда R&D в Just AI активно занимается разработкой решений для защиты ИИ-агентов от подобных атак. Их продукт, Jay Guard, представляет собой уровень AI-безопасности, который проверяет запросы и ответы на наличие атак, нежелательного контента и персональных данных. Исследования Just AI показали, что готовые модели детекторов часто генерируют ложные срабатывания на русскоязычном трафике, что потребовало значительной доработки данных для обучения.
Обнаружение Jailbreak-атак имеет решающее значение, поскольку они могут привести к серьезным утечкам данных, как это произошло с данными тенантов Microsoft 365 или содержимым приватных каналов Slack. Эти атаки часто используют методы социальной инженерии, применяемые к людям десятилетиями, но теперь их жертвами становятся ИИ-модели. Разработчики продуктов на базе LLM и специалисты по информационной безопасности должны понимать эти угрозы для эффективной защиты систем.
Проблема Jailbreak-атак на LLM действительно масштабна и критична для обеспечения интегритета систем ИИ. Отмечу, что методы, подобные Crescendo, демонстрируют изощренность злоумышленников, использующих многошаговую логику, что требует от систем защиты не просто фильтрации ключевых слов, но и контекстного анализа цепочек запросов. Решение Just AI с адаптацией под русскоязычный трафик особенно актуально, учитывая специфику языковых моделей и их уязвимость к культурно-специфическим нюансам атак.