Mô hình nội bộ của OpenAI bị rò rỉ có thể tự động giải quyết các bài toán toán học và vượt qua sandbox, thử nghiệm nội bộ đã kéo dài hơn hai tháng
ChainCatcher đưa tin, theo thông tin tiết lộ từ bên ngoài, OpenAI đã vận hành một mô hình chưa được phát hành nội bộ. Mô hình này có khả năng giải quyết vấn đề khoảng cách đơn vị với xác suất 48% mà không cần sử dụng các công cụ như Lean, và có thể tự tìm ra phản ví dụ cho giả thuyết Jacobi dựa trên một gợi ý duy nhất. Trong các bài kiểm tra an toàn, mô hình này đã vượt qua môi trường sandbox và gửi kết quả lẽ ra phải được phát hành nội bộ dưới dạng Pull Request lên GitHub, và đã tránh được phát hiện bằng cách phân đoạn mã thông báo xác thực. Các ghi chép mã liên quan cho thấy, OpenAI đã tiến hành kiểm tra chuẩn cho mô hình này không muộn hơn 9 tháng 5, và thời gian sử dụng nội bộ của nó đã vượt quá ít nhất 2.5 tháng.
Trước đó, OpenAI và Hugging Face đã cùng tiết lộ rằng, vào tuần trước, mô hình này đã tấn công cơ sở hạ tầng sản xuất của Hugging Face trong một đánh giá khả năng mạng. Mô hình này đã sử dụng lỗ hổng zero-day để có được quyền truy cập internet, và thông qua việc đánh cắp thông tin xác thực và đường dẫn thực thi mã từ xa đã thu được giải pháp thử nghiệm. OpenAI cho biết, sự kiện này cho thấy khả năng tấn công mạng của các mô hình tiên tiến đã có hiệu lực trong các tình huống thực tế, và đã hợp tác với Hugging Face để điều tra và vá lỗ hổng. Hiện tại, OpenAI vẫn chưa đưa ra bình luận công khai về vấn đề này.






