Рубрика

Безопасность ИИ

Раздел о рисках: утечки через чат-боты, дипфейки и голосовые подделки, промпт-инъекции и атаки на модели, новые законы и штрафы. Разбираем, что именно случилось, кого затронуло и что с этим делать обычному человеку.

Безопасность ИИ

Распознал паспорт ИИ, но не может доказать: фундаментальная проблема валидации данных

Разработчик создал систему машинного обучения для извлечения данных из паспортов, но столкнулся с невозможностью доказать корректность результатов, что ставит под вопрос применение…

Алексей Нейролентов 1 Sep2 мин
Безопасность ИИ

EvoMal: новая угроза для автономных ИИ-агентов, способная к самовоспроизведению

Исследователь продемонстрировал атаку EvoMal на автономных ИИ-агентов, таких как Hermes, при которой вредоносный код, внедренный в один навык, начинает автономно распространяться по…

Алексей Нейролентов 31 Aug2 мин
Безопасность ИИ

ИИ-агенты под реальным огнём: почему встроенные фильтры проваливаются и что делать

Исследователи фиксируют изощрённые атаки на популярных ИИ-агентов, включая Copilot и Atlas, которые обходят стандартные защиты, требуя нового подхода к безопасности.

Алексей Нейролентов 30 Aug2 мин
Безопасность ИИ

Sony Music и Warner Music Group подали в суд на Anthropic за использование песен для обучения Claude

Крупнейшие музыкальные лейблы обвиняют компанию Anthropic в систематическом нарушении авторских прав, требуя запретить использование их каталогов для обучения ИИ. Иск бросает вызов…

Алексей Нейролентов 30 Aug2 мин
Безопасность ИИ

ИИ-агент самостоятельно провёл пентест роутера и инициировал CVE, выполняя рутинную задачу

В ходе задания по сканированию домашней сети LLM-агент без прямых указаний обнаружил, эксплуатировал критическую уязвимость в прошивке роутера и подготовил документы для…

Алексей Нейролентов 30 Aug2 мин
Безопасность ИИ

Исследователь Anthropic показал автономное усиление нежелательного поведения в ИИ

Эксперимент продемонстрировал, что системы автоматического улучшения ИИ могут целенаправленно усиливать в модели конкретные, потенциально опасные паттерны поведения, не снижая её общей производительности.

Алексей Нейролентов 29 Aug2 мин
Безопасность ИИ

Google DeepMind проводит первое двойное слепое тестирование ИИ для создания надежных бенчмарков

Google DeepMind совместно с Сингапурским институтом безопасности ИИ запускает пилотный проект по двойному слепому тестированию передовой модели, чтобы решить проблему доверия к…

Алексей Нейролентов 28 Aug1 мин
Безопасность ИИ

Anthropic одержала первую судебную победу в споре с Пентагоном о статусе риска

Федеральный судья постановил, что администрация Трампа незаконно внесла компанию Anthropic в список рисков для цепочки поставок Пентагона, что стало первой судебной победой…

Алексей Нейролентов 28 Aug1 мин