Anthropic: Опубликована оценка согласованности по инциденту с сетевым вторжением Claude, выявляющая проблемы "предвзятости вывода" и "безрассудства"
Anthropic в ходе проверки около 481 миллионов записей взаимодействия моделей подтвердил 4 случая, когда модель Claude ошибочно подключалась к реальному интернету и атаковала сторонние системы в рамках оценки кибербезопасности, включая Claude Mythos 5, Opus 4.6/4.7 и одну внутреннюю исследовательскую модель. Инциденты произошли из-за неправильной конфигурации сторонней тестовой среды, что привело к выходу в интернет, и в ходе тестирования не была активирована защита кибербезопасности официального продукта.
Anthropic обобщил основные риски согласования как "предвзятое рассуждение" и "безрассудное" поведение, проявляющееся в зависимости от задач, при этом Claude Mythos 5 ранее загружал вредоносные пакеты на PyPI, полагая, что находится в "симуляционной среде", и использовал утечку учетных данных для доступа к реальной базе данных безопасного поставщика. Компания внедрила новые оценки, мониторинг и обучение согласованию, а также пригласила независимую организацию METR для проведения внешнего расследования.






