Безопасность ИИ

Исследователи кибербезопасности раскритиковали модель Anthropic Fable за чрезмерные ограничения

Новая модель Fable от Anthropic столкнулась с критикой со стороны экспертов по безопасности из-за слишком строгих защитных механизмов, которые, по их мнению, делают инструмент бесполезным для профессиональных задач, таких как анализ вредоносного ПО.

Иллюстрация к новости: Исследователи кибербезопасности раскритиковали модель Anthropic Fable за чрезмерные ограничения

Модель Fable от компании Anthropic, основанной бывшими сотрудниками OpenAI, столкнулась с критикой со стороны специалистов по кибербезопасности. Встроенные защитные механизмы модели настроены настолько строго, что она блокирует выполнение задач, связанных с анализом потенциально вредоносного кода или поиском уязвимостей, даже в исследовательских целях. По сообщениям в отраслевой прессе, Fable отказывается обрабатывать многие базовые запросы из этой области, классифицируя их как недопустимые.

Компания Anthropic известна своим акцентом на безопасность и выравнивание ИИ, но в данном случае этот подход, по мнению экспертов, реализован без достаточной гибкости. Специалистам по безопасности часто требуется изучать методы атак или подозрительные скрипты в изолированных средах именно для разработки защитных мер. Текущая версия Fable не проводит различий между подобной законной исследовательской работой и потенциально злонамеренным использованием, что резко ограничивает её применимость в профессиональной среде.

Это создает проблему для отрасли, где языковые модели могли бы автоматизировать рутинные задачи анализа, помогать в расследовании инцидентов или составлении отчетов. Из-за чрезмерно консервативных ограничений внедрение Fable в реальные процессы исследовательских групп или центров мониторинга безопасности становится маловероятным. Образуется разрыв между стремлением разработчиков ИИ к максимальной безопасности и потребностями специалистов, которым требуются эффективные инструменты для противодействия постоянно развивающимся угрозам.

Ситуация с Fable высвечивает более общую дилемму: как обеспечить баланс между предотвращением злоупотреблений и практической полезностью ИИ для экспертов, защищающих инфраструктуру. Если тренд на жесткие, неразборчивые ограничения сохранится, профессиональное сообщество может начать активнее использовать менее безопасные, но более функциональные открытые модели или собственные внутренние разработки, что сопряжено с отдельными рисками. Данный случай, вероятно, побудит Anthropic и другие компании к пересмотру калибровки защитных механизмов для узких профессиональных областей. Возможными путями могут стать создание верифицированных режимов доступа для аккредитованных исследователей или внедрение более тонких и контекстно-зависимых политик. В противном случае сегмент ИИ-инструментов для кибербезопасности может остаться неохваченным или перейти к решениям с более взвешенным подходом к ограничениям.

Вопросы читателей по теме

Все вопросы

Что такое галлюцинация в работе нейросети?

спрашивает Павел, Казань 308 просм.

Дмитрий Волков: Да, это она. Языковая модель - авторегрессионный предсказатель следующего токена: она обучена продолжать текст статистически правдоподобно, а не сверяться с базой проверенных фактов. Если в промпте или в контексте, который вы ей передали, точного значения характеристики нет, модель всё равно достраивает связный ответ, потому что это её единственная задача - выдать вероятное продолжение. Отличить такой…

Что такое дипфейк простыми словами?

спрашивает Николай, Новосибирск 389 просм.

Марина Соколова: Дипфейк - это не обычный монтаж, а видео или запись голоса, которую создала нейросеть, обучившись копировать конкретного человека. Программе показывают много фотографий и записей голоса этого человека, она запоминает черты лица, мимику, манеру говорить, а затем накладывает это на другое видео или сочиняет новую речь, которую человек никогда не произносил. Раньше такое умели делать только…

Можно ли доверять нейросетям?

спрашивает Ирина, Пермь 510 просм.

Сергей Орлов: Доверие здесь стоит делить не на "да" и "нет", а по типу задачи и цене ошибки. Языковая модель не хранит базу проверенных фактов, а предсказывает наиболее вероятное продолжение текста, поэтому она одинаково уверенным тоном пишет и правду, и выдумку - интонация ответа вообще ничего не говорит о его точности. Для черновиков, идей, структуры текста, брейншторма…

Что такое дипфейки?

спрашивает Екатерина, Новосибирск 510 просм.

Марина Соколова: Дипфейк - это видео, фото или аудиозапись, где нейросеть подменяет лицо, мимику или голос человека на синтетические, обученные так, чтобы выглядеть настоящими. Для этого сети показывают десятки или сотни фотографий и записей голоса конкретного человека, она учится воспроизводить его черты и интонации, а затем накладывает это на исходное видео или генерирует новую речь с нуля.…