Исследователи компании Robocurve провели 300 тестов, заставляя роботов выполнять заведомо деструктивные действия: от ударов ножом по манекену до смешивания опасных химикатов. Наихудшие показатели продемонстрировала GPT-6 Astra: модель лишь дважды отказалась от выполнения команд, в 97 случаях начав опасное движение и успешно завершив 60 из них. Например, в сценариях с ножом робот под управлением этой модели поражал цель в 17 из 20 попыток.
Claude Fable 5.1 оказалась чуть осторожнее, отказавшись от выполнения 20 заданий, однако все эти запреты касались исключительно этических аспектов взаимодействия с куклой-младенцем. В остальных случаях модель без колебаний приступала к рискованным операциям, доведя до конца 34 из них. Открытая модель MolmoAct2 формально не отказалась ни от одного поручения, хотя завершила их успешно лишь шесть раз из-за технических ошибок и ограничений самого оборудования.
Эксперты подчеркивают, что низкий процент успеха у некоторых моделей не говорит об их безопасности, так как решающим фактором является само намерение системы исполнить вредоносную команду. Существующие механизмы защиты, спроектированные для чат-ботов, оказываются бесполезными, когда ИИ обретает физическое воплощение. Для предотвращения инцидентов разработчикам необходимо внедрять дополнительные уровни контроля, способные блокировать опасные действия на этапе планирования движений, до того как манипуляторы придут в действие.
Комментарии (0)
Пока нет комментариев. Будьте первым!