Безопасность ИИ

Google DeepMind проводит первое двойное слепое тестирование ИИ для создания надежных бенчмарков

Google DeepMind совместно с Сингапурским институтом безопасности ИИ запускает пилотный проект по двойному слепому тестированию передовой модели, чтобы решить проблему доверия к оценкам возможностей искусственного интеллекта.

Иллюстрация к новости: Google DeepMind проводит первое двойное слепое тестирование ИИ для создания надежных бенчмарков

Google DeepMind и Сингапурский институт безопасности ИИ (AISIS) запустили пилотный проект по двойному слепому тестированию ИИ. Суть метода в том, что разработчик не видит конкретных вопросов теста, а оценщики не имеют доступа к параметрам модели. Это исключает подгонку модели под тесты и манипуляции с условиями оценки. Для защиты данных используется криптографическая система Confidential Space.

Проблема назрела давно. Компаний часто критикуют за неполную прозрачность тестов или оптимизацию моделей под известные публичные бенчмарки. Это ставит под сомнение результаты и мешает объективному сравнению технологий. Например, в 2026 году ожидается появление более 10 тысяч новых моделей ИИ, что делает вопрос надежной оценки особенно острым.

Успех пилота может задать новый стандарт для оценки ИИ, особенно для мощных пограничных моделей. Надежные стандарты тестирования важны для регуляторов, инвесторов и общества, создавая основу для ответственного развития ИИ. Для разработчиков это означает переход к более честной конкуренции, где преимущество будут иметь действительно передовые технологии, а не умелая оптимизация под тесты. Пользователи смогут больше доверять заявлениям компаний о возможностях их продуктов.

Если подход окажется эффективным, другие лаборатории и регуляторы могут перенять эту практику. Двойное слепое тестирование с криптографической защитой данных способно стать новым отраслевым стандартом. Это особенно актуально в контексте того, что, по некоторым оценкам, только 07 процентов моделей проходят полный цикл аудита, а число исследовательских работ по ИИ за последние годы выросло с 1376 до более чем 768, что усложняет задачу объективного сравнения.

Вопросы читателей по теме

Все вопросы

Что такое галлюцинация в работе нейросети?

спрашивает Павел, Казань 308 просм.

Дмитрий Волков: Да, это она. Языковая модель - авторегрессионный предсказатель следующего токена: она обучена продолжать текст статистически правдоподобно, а не сверяться с базой проверенных фактов. Если в промпте или в контексте, который вы ей передали, точного значения характеристики нет, модель всё равно достраивает связный ответ, потому что это её единственная задача - выдать вероятное продолжение. Отличить такой…

Что такое дипфейк простыми словами?

спрашивает Николай, Новосибирск 389 просм.

Марина Соколова: Дипфейк - это не обычный монтаж, а видео или запись голоса, которую создала нейросеть, обучившись копировать конкретного человека. Программе показывают много фотографий и записей голоса этого человека, она запоминает черты лица, мимику, манеру говорить, а затем накладывает это на другое видео или сочиняет новую речь, которую человек никогда не произносил. Раньше такое умели делать только…

Можно ли доверять нейросетям?

спрашивает Ирина, Пермь 510 просм.

Сергей Орлов: Доверие здесь стоит делить не на "да" и "нет", а по типу задачи и цене ошибки. Языковая модель не хранит базу проверенных фактов, а предсказывает наиболее вероятное продолжение текста, поэтому она одинаково уверенным тоном пишет и правду, и выдумку - интонация ответа вообще ничего не говорит о его точности. Для черновиков, идей, структуры текста, брейншторма…

Что такое дипфейки?

спрашивает Екатерина, Новосибирск 510 просм.

Марина Соколова: Дипфейк - это видео, фото или аудиозапись, где нейросеть подменяет лицо, мимику или голос человека на синтетические, обученные так, чтобы выглядеть настоящими. Для этого сети показывают десятки или сотни фотографий и записей голоса конкретного человека, она учится воспроизводить его черты и интонации, а затем накладывает это на исходное видео или генерирует новую речь с нуля.…