Исследование затронуло модели MAIRA-2, MedGemma-4B, LLaVA-Med-1.5 и LLaVA-1.5. Эксперты сравнивали тепловые карты внимания алгоритмов с разметками радиологов на трех открытых датасетах и выборке пациентов с пневмотораксом. Хотя MAIRA-2 показала лучшие результаты среди конкурентов, эффективность всех систем оказалась сомнительной: на типичных снимках ИИ не смог превзойти примитивные статистические модели.
Только в редких, нетипичных случаях нейросети начинали действительно анализировать изображение, а не опираться на усредненные данные. Это расхождение подтвердил эксперимент с участием живых врачей. Выяснилось, что специалисты оценивают правдоподобность тепловых карт иначе, чем математические метрики: для радиолога клиническая логика важнее, чем попадание в формальные статистические окна. Авторы работы настаивают, что внедрение подобных инструментов в клиниках требует обязательного участия врачей и новых способов оценки, учитывающих анатомические особенности каждого случая.
Комментарии (0)
Пока нет комментариев. Будьте первым!