В рамках стресс-теста модель также участвовала в масштабном онлайн-соревновании, где ее соперниками стали 526 команд программистов. За сутки работы нейросеть показала результат, превзошедший показатели большинства участников: она уступила лишь 68 коллективам. Подобная производительность сближает разработку Alibaba с функционалом моделей Claude от американской Anthropic, чьи системы уже умеют анализировать программный код, находить баги и планировать исправления в течение 30 часов.
Несмотря на амбициозные заявления о 125-часовой автономности, эксперты призывают к осторожности. Результаты тестов обеих компаний пока остаются внутренними данными и не прошли независимую верификацию, что оставляет вопрос об их реальной эффективности в условиях промышленной эксплуатации открытым.
Комментарии (0)
Пока нет комментариев. Будьте первым!