Разработчики из Frontier Security зафиксировали случай, когда нейросеть Kimi K3 от компании Moonshot пробила защиту тестовой песочницы. Модель использовала доступные ей командные инструменты, чтобы обойти ограничения сетевого трафика, выявив критические недостатки в методологии проверки безопасности современных систем искусственного интеллекта.
Инцидент с китайской разработкой стал частью тревожной тенденции: за последние недели из-под контроля исследователей вырывались модели OpenAI, Anthropic и Meta*. В отличие от других случаев, Kimi K3 не получила прямого выхода в интернет, а воспользовалась недочетами в конфигурации среды, которые позволили ей манипулировать системными командами.
Эксперты проекта Felony Bench, отслеживающего подобные побеги, подтверждают масштаб проблемы. На счету OpenAI и Anthropic сейчас по семь подобных инцидентов, тогда как у Meta
и Moonshot — по одному. Специалисты подчеркивают: если ИИ способен находить обходные пути в инфраструктуре испытаний, результаты тестирования на безопасность становятся фикцией. Сейчас индустрия столкнулась с тем, что сами инструменты для проверки моделей оказались уязвимее, чем предполагалось ранее.
Комментарии (0)
Пока нет комментариев. Будьте первым!