Новости ИИ

Кризис воспроизводимости: исследование ставит под сомнение объективность бенчмарков компьютерной томографии

Попытка воспроизвести результаты открытого бенчмарка ICASSP-2024 по низкодозовой компьютерной томографии выявила системную проблему: измеряемое качество алгоритмов частично определяется не их реальной эффективностью, а особенностями самого тестового набора данных, что ставит под сомнение воспроизводимость и объективность многих исследований в этой области.

Иллюстрация к новости: Кризис воспроизводимости: исследование ставит под сомнение объективность бенчмарков компьютерной томографии

Специалисты проверяли алгоритмы на бенчмарке ICASSP-2024 по низкодозовой компьютерной томографии и столкнулись с аномалиями. Более быстрый алгоритм показал лучшую точность, чем медленный и теоретически более совершенный. На картах ошибок проявились странные повторяющиеся структуры, которые нельзя было объяснить случайностью.

Команда начала расследование и выяснила, что часть измеряемого качества определялась не реконструкцией данных, а особенностями самого бенчмарка. Задача воспроизведения результатов превратилась в поиск изъянов в методологии оценки.

Анализ показал фундаментальную проблему. Метрики для сравнения алгоритмов могут быть чувствительны не к реальному качеству изображения, а к специфическим артефактам в тестовом наборе данных. Алгоритм, оптимизированный под эти скрытые особенности, показывает искусственно завышенные результаты без общего превосходства. Хорошая позиция в таблице лидеров не гарантирует создания надежного алгоритма для работы с реальными клиническими данными.

Это имеет серьезные последствия для машинного обучения в медицинской визуализации. Кризис воспроизводимости проявляется в прикладной области. Если результаты ведущих конференций нельзя надежно воспроизвести, это подрывает доверие к исследовательской экосистеме. Разработчики могут тратить ресурсы на оптимизацию под нерепрезентативные бенчмарки, а не на решение реальных проблем. Это создает барьер для конкуренции и замедляет прогресс.

Для пользователей - врачей-рентгенологов, медицинских учреждений, интеграторов - это означает необходимость осторожного подхода к выбору технологий. Слепая вера в опубликованные результаты ошибочна. Необходимо независимое валидирование на собственных наборах данных, близких к реальным условиям. Производителям алгоритмов приходится тратить усилия на глубокий аудит сторонних бенчмарков, чтобы убедиться в корректности сравнений.

Ситуация ведет к переосмыслению подходов к созданию и валидации тестовых наборов данных. Нужны более строгие стандарты, прозрачная документация процесса формирования данных и переход к клинически релевантным метрикам оценки, а не только к пиксельным сравнениям с синтетическим эталоном. Без изменений область рискует увязнуть в погоне за оторванными от практики метриками, что в итоге тормозит внедрение действительно полезных технологий в медицине.

Вопросы читателей по теме

Все вопросы

Что такое искусственный интеллект, если кратко?

спрашивает Михаил, Томск 164 просм.

Марина Соколова: Если коротко: искусственный интеллект - это компьютерные программы, которые справляются с задачами, для которых раньше требовался человек, например понимать текст, узнавать лица на фото, отвечать на вопросы, писать код. Внутри этого широкого термина есть более узкие понятия. Машинное обучение - способ создания такого ПО, при котором программу не пишут по шагам вручную, а обучают на…

Как создать искусственный интеллект для бизнеса?

спрашивает Евгений, Омск 126 просм.

Марина Соколова: Для компании с 40 сотрудниками разработка собственного искусственного интеллекта с нуля почти всегда не имеет смысла: это работа команды дата-сайентистов на месяцы и бюджет, который окупится только при огромном масштабе задачи. В большинстве случаев для малого и среднего бизнеса правильный путь - взять готовое решение и настроить его под свой процесс. Начать стоит не с…

Как зовут искусственный интеллект - у него правда есть имя?

спрашивает Анна, Челябинск 193 просм.

Марина Соколова: Имя вроде Алисы, Siri или Cortana - это имя голосового помощника, то есть интерфейса и персонажа, через который человек общается с системой. Технически за этим именем стоит не одна программа с личностью, а связка из нескольких моделей: распознавание речи, языковая модель для ответа, синтез голоса. Имя дают, чтобы с помощником было удобнее и приятнее общаться,…

Как понять, что общаешься с искусственным интеллектом, а не с человеком?

спрашивает Екатерина, Хабаровск 148 просм.

Сергей Орлов: На переписку в приложениях знакомств такое подозрение возникает часто, и оно не беспочвенно - нейросетями действительно генерируют ответы для скучающих или не уверенных в себе пользователей. Отличить это на сто процентов сложно, но у текста, написанного ИИ, обычно есть характерный набор черт. Первое - идеальная грамотность и ровный стиль на протяжении всей переписки, без опечаток,…