Безопасность ИИ

Открытая модель GLM-5.2 догоняет фронтирные ИИ, но отстаёт по безопасности

Новый отчёт SaferAI предупреждает, что открытая модель GLM-5.2 от Z.ai демонстрирует способности, близкие к передовым закрытым системам, однако в ней отсутствуют ключевые механизмы безопасности, что создаёт серьёзные риски.

Иллюстрация к новости: Открытая модель GLM-5.2 догоняет фронтирные ИИ, но отстаёт по безопасности

Открытые весовые модели ИИ быстро развиваются, сокращая разрыв с передовыми закрытыми системами. Однако отчёт SaferAI показывает тревожную тенденцию: рост производительности часто сопровождается отставанием по безопасности. Пример - модель GLM-5.2 от китайской Z.ai. Исследование отмечает её конкурентоспособную производительность в тестах на понимание языка, рассуждение и генерацию кода. Но в модели отсутствуют ключевые защитные механизмы: фильтрация вредоносных запросов, системы против дезинформации, ограничения на создание вредоносного кода или инструкций для атак. Это делает её потенциально опасной при неконтролируемом использовании.

Проблема в том, что гонка за производительностью и открытостью идёт в ущерб безопасности. Интеграция комплексных защитных систем требует дополнительных ресурсов, экспертизы и может замедлить вывод продукта на рынок. В итоге сообщество получает мощный, но небезопасный инструмент. После публикации весов модели контролировать её использование почти невозможно.

Отчёт - это предупреждение для отрасли. Разработчикам, которые интегрируют такие модели в свои сервисы, придётся самостоятельно создавать дополнительные слои безопасности. Компаниям следует учитывать не только открытость и мощность модели, но и её защищённость. Регуляторам этот случай даёт аргумент для введения обязательных стандартов безопасности для открытых моделей, превышающих определённый порог возможностей.

Ситуация обостряет дискуссию о балансе между открытостью и безопасностью. Сообществу нужно либо замедлить публикацию мощных моделей до внедрения адекватной защиты, либо смириться с растущими рисками, которые могут привести к жёсткому регулированию. Отчёт по GLM-5.2 - сигнал, что разрыв между возможностями и безопасностью открытых ИИ стал критическим.

Вопросы читателей по теме

Все вопросы

Что такое галлюцинация в работе нейросети?

спрашивает Павел, Казань 308 просм.

Дмитрий Волков: Да, это она. Языковая модель - авторегрессионный предсказатель следующего токена: она обучена продолжать текст статистически правдоподобно, а не сверяться с базой проверенных фактов. Если в промпте или в контексте, который вы ей передали, точного значения характеристики нет, модель всё равно достраивает связный ответ, потому что это её единственная задача - выдать вероятное продолжение. Отличить такой…

Что такое дипфейк простыми словами?

спрашивает Николай, Новосибирск 389 просм.

Марина Соколова: Дипфейк - это не обычный монтаж, а видео или запись голоса, которую создала нейросеть, обучившись копировать конкретного человека. Программе показывают много фотографий и записей голоса этого человека, она запоминает черты лица, мимику, манеру говорить, а затем накладывает это на другое видео или сочиняет новую речь, которую человек никогда не произносил. Раньше такое умели делать только…

Можно ли доверять нейросетям?

спрашивает Ирина, Пермь 510 просм.

Сергей Орлов: Доверие здесь стоит делить не на "да" и "нет", а по типу задачи и цене ошибки. Языковая модель не хранит базу проверенных фактов, а предсказывает наиболее вероятное продолжение текста, поэтому она одинаково уверенным тоном пишет и правду, и выдумку - интонация ответа вообще ничего не говорит о его точности. Для черновиков, идей, структуры текста, брейншторма…

Что такое дипфейки?

спрашивает Екатерина, Новосибирск 510 просм.

Марина Соколова: Дипфейк - это видео, фото или аудиозапись, где нейросеть подменяет лицо, мимику или голос человека на синтетические, обученные так, чтобы выглядеть настоящими. Для этого сети показывают десятки или сотни фотографий и записей голоса конкретного человека, она учится воспроизводить его черты и интонации, а затем накладывает это на исходное видео или генерирует новую речь с нуля.…