Безопасность ИИ

Точность 99,2% и ни одной опухоли: почему классические метрики ИИ опасны в медицине

Исследование MASAI по скринингу рака молочной железы наглядно показало, как простая модель, всегда выдающая результат "норма", достигает точности 99,2%, но при этом полностью бесполезна, так как не обнаруживает ни одного реального случая болезни.

Иллюстрация к новости: Точность 99,2% и ни одной опухоли: почему классические метрики ИИ опасны в медицине

Внедрение ИИ в медицину, особенно в онкологический скрининг, сталкивается с фундаментальной проблемой оценки качества. Яркий пример - анализ исследования по скринингу рака молочной железы.

В группе, где маммограммы анализировал ИИ, участвовали 53 043 женщины. Рак выявили у 420 из них. В таких условиях простая модель, которая на любой снимок всегда отвечает "норма", покажет точность (accuracy) 99,21%. Эта цифра формально удовлетворяет запросу на "точность в 98-99%". Но такая модель не обнаружит ни одной опухоли, что делает ее абсолютно бесполезной и опасной на практике.

Парадокс возникает из-за сильного дисбаланса классов: здоровых пациентов всегда значительно больше, чем больных. Accuracy в таких условиях теряет всякий смысл. Модель, предсказывающая мажоритарный класс, получает высший балл по этой метрике, но полностью проваливает главную задачу - найти патологию. Это важнейший урок для разработчиков: слепое следование абстрактным метрикам без учета специфики медицины ведет к созданию фиктивных решений.

Проблема, однако, гораздо шире простого выбора метрики. Внедрение медицинского ИИ упирается в ряд сложных и дорогостоящих этапов. Во-первых, создание эталонного набора данных (ground truth) осложнено тем, что мнения опытных рентгенологов по одному снимку могут расходиться, что ставит под вопрос саму возможность создания "чистых" данных для обучения. Во-вторых, существует серьезный риск переобучения модели не на медицинские признаки, а на артефакты конкретного оборудования или больницы, где собрали обучающую выборку. В-третьих, процесс разметки данных крайне ресурсоемок, так как его могут выполнять только высококвалифицированные и дорогие специалисты. Наконец, любая система для клиник должна проходить строгую валидацию и соответствовать жестким регуляторным требованиям, что добавляет слои сложности.

Этот конкретный случай требует кардинального пересмотра подходов к оценке медицинского ИИ. Вместо accuracy необходимо использовать клинически релевантные метрики. Ключевыми становятся чувствительность (способность находить больных), специфичность (способность правильно идентифицировать здоровых) и положительная прогностическая ценность (вероятность, что пациент с положительным результатом теста действительно болен). При низкой распространенности болезни последняя метрика может быть низкой даже при высокой чувствительности модели, что критически важно понимать.

Для успеха разработчикам необходимо тесно и непрерывно работать с врачами-экспертами на всех этапах: от сбора данных и формулировки задачи до выбора конечных критериев успеха. Систему нужно оценивать не по абстрактным цифрам, а по реальному влиянию на исходы лечения: снижает ли она смертность, повышает ли выявляемость на ранних, излечимых стадиях.

Таким образом, успешное внедрение ИИ в медицину - это в первую очередь междисциплинарная проблема, а не чисто инженерный вызов. Требуется глубокая интеграция медицинских знаний в процесс разработки, честная оценка ограничений данных и безусловный фокус на практической пользе для пациента. Без этого даже самые сложные алгоритмы рискуют стать дорогостоящими игрушками, создающими лишь иллюзию прогресса. В худшем сценарии они могут ввести врачей в заблуждение. Доверие к ИИ в медицине строится на трех китах: прозрачности работы алгоритма, его тщательной валидации в реальных клинических условиях и четком понимании, что алгоритм - это лишь инструмент в руках специалиста, а не его замена.

Вопросы читателей по теме

Все вопросы

Что такое галлюцинация в работе нейросети?

спрашивает Павел, Казань 308 просм.

Дмитрий Волков: Да, это она. Языковая модель - авторегрессионный предсказатель следующего токена: она обучена продолжать текст статистически правдоподобно, а не сверяться с базой проверенных фактов. Если в промпте или в контексте, который вы ей передали, точного значения характеристики нет, модель всё равно достраивает связный ответ, потому что это её единственная задача - выдать вероятное продолжение. Отличить такой…

Что такое дипфейк простыми словами?

спрашивает Николай, Новосибирск 389 просм.

Марина Соколова: Дипфейк - это не обычный монтаж, а видео или запись голоса, которую создала нейросеть, обучившись копировать конкретного человека. Программе показывают много фотографий и записей голоса этого человека, она запоминает черты лица, мимику, манеру говорить, а затем накладывает это на другое видео или сочиняет новую речь, которую человек никогда не произносил. Раньше такое умели делать только…

Можно ли доверять нейросетям?

спрашивает Ирина, Пермь 510 просм.

Сергей Орлов: Доверие здесь стоит делить не на "да" и "нет", а по типу задачи и цене ошибки. Языковая модель не хранит базу проверенных фактов, а предсказывает наиболее вероятное продолжение текста, поэтому она одинаково уверенным тоном пишет и правду, и выдумку - интонация ответа вообще ничего не говорит о его точности. Для черновиков, идей, структуры текста, брейншторма…

Что такое дипфейки?

спрашивает Екатерина, Новосибирск 510 просм.

Марина Соколова: Дипфейк - это видео, фото или аудиозапись, где нейросеть подменяет лицо, мимику или голос человека на синтетические, обученные так, чтобы выглядеть настоящими. Для этого сети показывают десятки или сотни фотографий и записей голоса конкретного человека, она учится воспроизводить его черты и интонации, а затем накладывает это на исходное видео или генерирует новую речь с нуля.…