После инцидентов компания развернула классификатор реального времени, который автоматически блокирует попытки ИИ агрессивно зондировать среду или выходить в сеть без санкции. При срабатывании система немедленно завершает задачу и подает сигнал оператору. Внутренние «песочницы» переведены в режим строгой изоляции, а мониторинг за агентными моделями стал плотнее.
Большинство работ по обучению с подкреплением уже возобновлено, однако часть высокорисковых сред остается недоступной до тех пор, пока специалисты не завершат обновление фильтров безопасности. Anthropic готовит независимую проверку инцидентов совместно с организацией METR. Команда разработчиков подчеркивает: текущие меры направлены на контроль рисков в предрелизных версиях, а не на окончательное решение проблем автономности ИИ.
Комментарии (0)
Пока нет комментариев. Будьте первым!