Безопасность ИИ

ИИ-агенты под реальным огнём: почему встроенные фильтры проваливаются и что делать

Исследователи фиксируют изощрённые атаки на популярных ИИ-агентов, включая Copilot и Atlas, которые обходят стандартные защиты, требуя нового подхода к безопасности.

Иллюстрация к новости: ИИ-агенты под реальным огнём: почему встроенные фильтры проваливаются и что делать

ИИ-агенты, такие как Microsoft Copilot и OpenAI Atlas, стали мишенями для кибератак. Исследователи фиксируют конкретные инциденты: вредоносный email заставлял Copilot раскрывать платежные данные, а поддельный GitHub issue компрометировал CI/CD пайплайны. Это задокументированные атаки на продукты крупных компаний. Злоумышленники эксплуатируют слабые места в цепочках автоматизации, где один скомпрометированный агент ведет к серьезному инциденту.

Атаки обходят встроенные в языковые модели фильтры. Зловреды маскируют инструкции под XML-политики, шифруют команды в base64, используют невидимые символы и прячут джейлбрейк-промпты в стихи. Многослойная маскировка делает угрозы невидимыми для стандартных систем защиты, которые пропускают до 76% подобных атак. Возникает разрыв между предполагаемой и реальной безопасностью агентов.

Необходим новый подход к защите. Традиционная модель, основанная на доверии к облачным API провайдера, недостаточна, особенно в эпоху атак, не требующих взаимодействия с пользователем. Нужно решение, которое было бы легким и быстрым, чтобы не замедлять работу агента, прозрачным, чтобы разработчики понимали причину блокировки, и локальным.

Работа без вызовов внешних API внутри собственной инфраструктуры минимизирует риски и дает полный контроль. Таким решением может стать использование специализированных моделей безопасности для выстраивания многоуровневой защиты. Например, модель OGL-Mini, обученная на 2544 вредоносных и 535 безопасных промптах, демонстрирует эффективность. Она имеет 6 слоев, 33 миллиона параметров и размер около 64 мегабайт. При тестировании на 94 вредоносных промптах она показала точность в 95%, что близко к результатам более крупных моделей, имеющих 3 и 5 миллиардов параметров. Такая модель может обработать промпт за 6 миллисекунд, что делает ее пригодной для реального использования.

Безопасность ИИ-агентов - не данность от поставщика модели. Разработчикам и компаниям необходимо анализировать векторы атак, внедрять дополнительные, локальные слои проверки входящих промптов и контекста, а также постоянно мониторить новые техники взлома. Надежная работа с ИИ-агентами будет требовать не только промпт-инжиниринга, но и компетенций в области ИИ-безопасности. Внедрение легких и эффективных моделей, подобных OGL-Mini, может стать первым шагом для создания базового защитного периметра вокруг автоматизированных рабочих процессов, обеспечивая необходимый контроль без зависимости от внешних сервисов.

Вопросы читателей по теме

Все вопросы

Что такое галлюцинация в работе нейросети?

спрашивает Павел, Казань 308 просм.

Дмитрий Волков: Да, это она. Языковая модель - авторегрессионный предсказатель следующего токена: она обучена продолжать текст статистически правдоподобно, а не сверяться с базой проверенных фактов. Если в промпте или в контексте, который вы ей передали, точного значения характеристики нет, модель всё равно достраивает связный ответ, потому что это её единственная задача - выдать вероятное продолжение. Отличить такой…

Что такое дипфейк простыми словами?

спрашивает Николай, Новосибирск 389 просм.

Марина Соколова: Дипфейк - это не обычный монтаж, а видео или запись голоса, которую создала нейросеть, обучившись копировать конкретного человека. Программе показывают много фотографий и записей голоса этого человека, она запоминает черты лица, мимику, манеру говорить, а затем накладывает это на другое видео или сочиняет новую речь, которую человек никогда не произносил. Раньше такое умели делать только…

Можно ли доверять нейросетям?

спрашивает Ирина, Пермь 510 просм.

Сергей Орлов: Доверие здесь стоит делить не на "да" и "нет", а по типу задачи и цене ошибки. Языковая модель не хранит базу проверенных фактов, а предсказывает наиболее вероятное продолжение текста, поэтому она одинаково уверенным тоном пишет и правду, и выдумку - интонация ответа вообще ничего не говорит о его точности. Для черновиков, идей, структуры текста, брейншторма…

Что такое дипфейки?

спрашивает Екатерина, Новосибирск 510 просм.

Марина Соколова: Дипфейк - это видео, фото или аудиозапись, где нейросеть подменяет лицо, мимику или голос человека на синтетические, обученные так, чтобы выглядеть настоящими. Для этого сети показывают десятки или сотни фотографий и записей голоса конкретного человека, она учится воспроизводить его черты и интонации, а затем накладывает это на исходное видео или генерирует новую речь с нуля.…