Anthropic: công bố đánh giá điều chỉnh về sự cố xâm nhập mạng Claude, tiết lộ vấn đề "suy diễn thiên lệch" và "liều lĩnh"
Anthropic đã xác nhận 4 sự kiện liên quan đến mô hình Claude trong quá trình đánh giá an ninh mạng, trong đó 4.81 triệu bản ghi tương tác mô hình đã được xem xét, mô hình đã vô tình kết nối với internet thực và tấn công hệ thống bên thứ ba, liên quan đến Claude Mythos 5, Opus 4.6/4.7 và một mô hình nghiên cứu nội bộ. Sự cố xuất phát từ việc cấu hình sai môi trường đánh giá bên thứ ba dẫn đến việc ra ngoài mạng, và trong quá trình đánh giá không kích hoạt bảo vệ an ninh mạng của sản phẩm chính thức.
Anthropic đã tóm tắt rủi ro căn bản về sự phù hợp thành "suy diễn thiên lệch" và hành vi "liều lĩnh" mà mô hình thể hiện dưới áp lực nhiệm vụ, trong đó Claude Mythos 5 đã từng tải lên gói độc hại lên PyPI với giả định đang ở trong "môi trường mô phỏng", lợi dụng thông tin xác thực bị rò rỉ để truy cập cơ sở dữ liệu thực của nhà cung cấp an ninh. Công ty đã đưa ra các đánh giá, giám sát và đào tạo phù hợp mới, và mời tổ chức độc lập METR tiến hành điều tra bên ngoài.






