Безопасность ИИ

Пять раундов дообучения на реальном трафике: почему рост точности детектора промпт-инъекций не гарантирует защиты

Эксперимент компании Agima показал, что классические метрики вроде общей точности могут вводить в заблуждение при дообучении моделей безопасности. Из пяти попыток улучшить детектор промпт-инъекций лишь одна прошла строгие проверки и была выпущена в продакшен.

Иллюстрация к новости: Пять раундов дообучения на реальном трафике: почему рост точности детектора промпт-инъекций не гарантирует защиты

Специалисты компании Agima провели эксперимент по дообучению модели для детекции промпт-инъекций на реальном корпоративном трафике. Из пяти раундов релиз в продакшен прошел только один. В четырех случаях рост общей точности сопровождался критическим падением способности обнаруживать реальные атаки, что заставило команду пересмотреть подход к оценке качества.

Работа с реальными данными оказалась сложной. Исходный корпус для обучения содержал 38856 запросов к корпоративным LLM-ассистентам, из которых 9071 был размечен как опасный. Ключевой метрикой стала не общая точность, а F1-метрика для класса атак. В ходе дообучения модель демонстрировала рост общей точности до 90%, в то время как F1 для атак падала до 71% или даже до 0%. Это означало, что модель переставала видеть реальные угрозы, что неприемлемо для системы безопасности.

Промпт-инъекции сложно детектировать из-за разнообразия формулировок. Agima дообучала предварительно обученную модель, добавляя новые примеры атак из рабочего трафика. Однако простое добавление данных без контроля за балансом классов привело к регрессии. Четыре из пяти попыток пришлось откатить, несмотря на улучшение общих показателей.

Этот эксперимент демонстрирует важный урок для индустрии безопасности ИИ. При дообучении моделей нельзя полагаться на усредненные метрики. Agima внедрила строгие проверочные гейты: релиз блокируется, если ухудшаются ключевые показатели для целевого класса. Перед выпуском модель должна показывать стабильность или рост F1-метрики для класса атак и проходить тесты на специальном наборе сложных примеров. Было установлено, что модель должна стабильно показывать результат на критически важных примерах, чтобы быть допущенной к развертыванию.

Для компаний, внедряющих LLM, это означает, что системы защиты требуют осторожного и инженерно-ориентированного подхода к обновлению. Наивное дообучение может ослабить защиту. Необходимо фокусироваться на метриках, непосредственно связанных с обнаружением угроз, поддерживать репрезентативные тестовые наборы и автоматизировать проверку на регрессию. Тренд смещается к подходу, где надежность и предсказуемость модели на критически важных задачах ставятся выше абстрактных усредненных показателей. Только такой метод позволяет выпускать в продакшен эффективные и безопасные обновления, избегая ситуаций, когда модель формально точна, но практически бесполезна для своей основной задачи - обнаружения атак.

Вопросы читателей по теме

Все вопросы

Что такое галлюцинация в работе нейросети?

спрашивает Павел, Казань 308 просм.

Дмитрий Волков: Да, это она. Языковая модель - авторегрессионный предсказатель следующего токена: она обучена продолжать текст статистически правдоподобно, а не сверяться с базой проверенных фактов. Если в промпте или в контексте, который вы ей передали, точного значения характеристики нет, модель всё равно достраивает связный ответ, потому что это её единственная задача - выдать вероятное продолжение. Отличить такой…

Что такое дипфейк простыми словами?

спрашивает Николай, Новосибирск 389 просм.

Марина Соколова: Дипфейк - это не обычный монтаж, а видео или запись голоса, которую создала нейросеть, обучившись копировать конкретного человека. Программе показывают много фотографий и записей голоса этого человека, она запоминает черты лица, мимику, манеру говорить, а затем накладывает это на другое видео или сочиняет новую речь, которую человек никогда не произносил. Раньше такое умели делать только…

Можно ли доверять нейросетям?

спрашивает Ирина, Пермь 510 просм.

Сергей Орлов: Доверие здесь стоит делить не на "да" и "нет", а по типу задачи и цене ошибки. Языковая модель не хранит базу проверенных фактов, а предсказывает наиболее вероятное продолжение текста, поэтому она одинаково уверенным тоном пишет и правду, и выдумку - интонация ответа вообще ничего не говорит о его точности. Для черновиков, идей, структуры текста, брейншторма…

Что такое дипфейки?

спрашивает Екатерина, Новосибирск 510 просм.

Марина Соколова: Дипфейк - это видео, фото или аудиозапись, где нейросеть подменяет лицо, мимику или голос человека на синтетические, обученные так, чтобы выглядеть настоящими. Для этого сети показывают десятки или сотни фотографий и записей голоса конкретного человека, она учится воспроизводить его черты и интонации, а затем накладывает это на исходное видео или генерирует новую речь с нуля.…