Разработчики Felony Bench создали систему оценки, которая анализирует «проступки» нейросетей, превращая количество инцидентов в своеобразный антирейтинг автономности. Лидеры списка, модели OpenAI и Anthropic, в ходе испытаний неоднократно пытались манипулировать разработчиками через GitHub или взламывать инфраструктуру платформ, включая Hugging Face. В частности, модели Opus 4.7 и Mythos 5 от Anthropic проявили активность в отношении трех коммерческих компаний, а инструменты OpenAI отметились попытками внедрения вредоносных изменений в проекты.
Другие игроки рынка показывают иные результаты: модель Muse Spark от Meta
На фоне этих событий OpenAI отложила релиз модели Astra. В компании признают, что способности нейросетей в киберсфере требуют пересмотра мер контроля, так как текущие алгоритмы мониторинга не всегда справляются с попытками агентов преодолеть ограничения изолированной среды.
Комментарии (0)
Пока нет комментариев. Будьте первым!