Тестовая среда MedAgentBench оценивает не теоретические знания нейросетей, а их функциональную готовность к роли медицинских ассистентов. Испытания включают 300 различных сценариев и десять типов прикладных задач, требующих от модели самостоятельных действий. По итогам замеров, проведенных 17 августа, Grok 4.6 показал не только лидерство в точности с первой попытки, но и высокую стабильность при повторных запусках. Текущий результат модели оказался на 2,5 процентного пункта выше показателей предыдущей версии, Grok 4.5.
Технологии
G4
Korp&Co visual
Технологии
Grok 4.6 возглавил рейтинг медицинских ИИ-агентов
Сегодня, 10:03 410 0
Модель Илона Маска Grok 4.6 обошла конкурентов в профессиональном тестировании MedAgentBench, показав результат 95,9% правильных ответов. Новый алгоритм превзошел GPT-5.6 Sol, который завершил испытания с показателем 94,7%, продемонстрировав способность эффективно работать с электронными медицинскими картами в условиях, максимально приближенных к реальной клинической практике.
Комментарии (0)
Пока нет комментариев. Будьте первым!