ИИ-агенты под реальным огнём: почему встроенные фильтры проваливаются и что делать
Исследователи фиксируют изощрённые атаки на популярных ИИ-агентов, включая Copilot и Atlas, которые обходят стандартные защиты, требуя нового подхода к безопасности.
ИИ-агенты, такие как Microsoft Copilot и OpenAI Atlas, стали мишенями для кибератак. Исследователи фиксируют конкретные инциденты: вредоносный email заставлял Copilot раскрывать платежные данные, а поддельный GitHub issue компрометировал CI/CD пайплайны. Это задокументированные атаки на продукты крупных компаний. Злоумышленники эксплуатируют слабые места в цепочках автоматизации, где один скомпрометированный агент ведет к серьезному инциденту.
Атаки обходят встроенные в языковые модели фильтры. Зловреды маскируют инструкции под XML-политики, шифруют команды в base64, используют невидимые символы и прячут джейлбрейк-промпты в стихи. Многослойная маскировка делает угрозы невидимыми для стандартных систем защиты, которые пропускают до 76% подобных атак. Возникает разрыв между предполагаемой и реальной безопасностью агентов.
Необходим новый подход к защите. Традиционная модель, основанная на доверии к облачным API провайдера, недостаточна, особенно в эпоху атак, не требующих взаимодействия с пользователем. Нужно решение, которое было бы легким и быстрым, чтобы не замедлять работу агента, прозрачным, чтобы разработчики понимали причину блокировки, и локальным.
Работа без вызовов внешних API внутри собственной инфраструктуры минимизирует риски и дает полный контроль. Таким решением может стать использование специализированных моделей безопасности для выстраивания многоуровневой защиты. Например, модель OGL-Mini, обученная на 2544 вредоносных и 535 безопасных промптах, демонстрирует эффективность. Она имеет 6 слоев, 33 миллиона параметров и размер около 64 мегабайт. При тестировании на 94 вредоносных промптах она показала точность в 95%, что близко к результатам более крупных моделей, имеющих 3 и 5 миллиардов параметров. Такая модель может обработать промпт за 6 миллисекунд, что делает ее пригодной для реального использования.
Безопасность ИИ-агентов - не данность от поставщика модели. Разработчикам и компаниям необходимо анализировать векторы атак, внедрять дополнительные, локальные слои проверки входящих промптов и контекста, а также постоянно мониторить новые техники взлома. Надежная работа с ИИ-агентами будет требовать не только промпт-инжиниринга, но и компетенций в области ИИ-безопасности. Внедрение легких и эффективных моделей, подобных OGL-Mini, может стать первым шагом для создания базового защитного периметра вокруг автоматизированных рабочих процессов, обеспечивая необходимый контроль без зависимости от внешних сервисов.


