Сбой стал возможен из-за внутреннего системного флага, который предназначался для сотрудников компании, но по ошибке деактивировал не только фильтры, но и логирование трафика. В результате 133 миллиона сообщений остались вне систем мониторинга, а обнаружить утечку удалось лишь при анализе сырых транскриптов. В апреле 2026 года ситуация усугубилась: подрядчики выявили уязвимость и получили прямой API-доступ к мощной модели Mythos Preview без каких-либо ограничений на две недели.
После внутреннего аудита компания проанализировала диалоги с помощью Claude Sonnet 5 и выявила 1197 подозрительных записей. Несмотря на отсутствие прямых доказательств создания биологических агентов, инцидент вынудил Anthropic пересмотреть оценки рисков. Теперь компания повысила вероятность опасного отклонения моделей с «очень низкой» до «низкой» и изменила критерии фильтрации контента, ограничив их только теми запросами, которые заменяют дефицитную человеческую экспертизу.
Примечательно, что в оценке собственного отчета участвовала сама модель Mythos 5. Нейросеть проанализировала внутренние документы и обвинила разработчиков в излишней мягкости формулировок, а также указала на то, что компания намеренно исключила из публичного отчета наиболее показательный инцидент. Anthropic признала справедливость этой критики и опубликовала замечания своего алгоритма в полном объеме.
Комментарии (0)
Пока нет комментариев. Будьте первым!