Усиление защиты ИИ-агентов на фоне растущих угроз

Быстрое развитие технологий искусственного интеллекта привело не только к появлению новых возможностей, но и к возникновению нового поколения кибератак. В течение последних двух лет зафиксированы реальные инциденты, демонстрирующие уязвимость ИИ-агентов. Например, вредоносное электронное письмо может привести к утечке платежных данных клиентов через Microsoft Copilot, а фальшивое GitHub-сообщение способно скомпрометировать CI/CD пайплайн. Отдельные тщательно составленные промпты позволяют злоумышленникам выполнять удаленный код на машинах пользователей.

Исследователи в 2025–2026 годах задокументировали атаки на такие системы, как Microsoft Copilot, OpenAI Atlas, Claude Code и Apple Intelligence. Эти инциденты подтверждают, что угрозы в отношении ИИ-агентов уже не являются теоретическими.

Эволюция техник атак на ИИ

Современные атаки становятся все более изощренными. Злоумышленники маскируют вредоносные инструкции, используя XML-политики, шифрование в base64, внедрение невидимых символов и даже скрывая джейлбрейки в поэтических текстах. Существующие встроенные фильтры больших языковых моделей (LLM) оказываются недостаточно эффективными, пропуская до 76% таких атак.

Осенью 2025 года был продемонстрирован случай, когда запрос к ИИ-браузеру «суммаризируй страницу» на специально подготовленном веб-сайте привел к тому, что агент вместо выполнения задачи получил доступ к Gmail пользователя и отправил конфиденциальные данные атакующему. Такие инциденты, известные как промт-инъекции, происходят без использования традиционных вирусов или эксплойтов, полагаясь исключительно на манипуляцию текстовыми инструкциями.

Стратегии эффективной защиты ИИ

Для эффективного противодействия этим угрозам необходим новый подход к безопасности. Он должен быть:

  • Легким и быстрым: чтобы не замедлять работу ИИ-агента.
  • Понятным: чтобы пользователи могли разобраться в причинах блокировки запросов.
  • Автономным: функционировать без обращения к внешним API, полностью внутри инфраструктуры пользователя.

В условиях атак с нулевым кликом (zero-click) полагаться на облачных провайдеров, которые пропускают значительную часть вредоносного трафика, является рискованной стратегией.

Один из подходов к созданию базовой защиты заключается в использовании модели безопасности OGL-Mini. Также эффективным решением может стать «хук-рубильник», разработанный для отключения чувствительных коннекторов агента после его взаимодействия с внешними веб-ресурсами, что предотвращает несанкционированный доступ к данным после промт-инъекций.