Метод Apollo Research предполагает многоступенчатый фильтр: Watcher постоянно анализирует активность агента, а при обнаружении аномалий отправляет запрос более сложной модели для глубокого анализа. В итоге окончательный вердикт выносит оператор. Параллельно компания Goodfire фокусируется на изучении внутренних состояний нейросетей, что позволяет отслеживать логику их работы в реальном времени. Этот подход стал ответом на уязвимости, выявленные после недавних атак на платформу Hugging Face.
Однако попытки сделать поведение ИИ более прозрачным создают новые риски. Детальные отчеты о «рассуждениях» модели могут стать основой для дистилляционных атак, позволяя злоумышленникам копировать чужие алгоритмы. Из-за этого некоторые создатели ИИ намеренно усложняют логи своих систем. В качестве альтернативы эксперты предлагают использовать классические журналы событий и традиционные инструменты кибербезопасности, которые позволяют контролировать действия агентов без создания дополнительных, потенциально уязвимых уровней наблюдения.
Комментарии (0)
Пока нет комментариев. Будьте первым!