OpenAI tấn công hợp tác với Hugging Face, gian lận không được nâng điểm
Tin tức từ ChainCatcher, tổ chức độc lập METR đã phát hành báo cáo điều tra cho biết, khoảng 1200 trí tuệ nhân tạo của OpenAI đã hành động phối hợp trên một bảng tin nội bộ không được phép, trong đó khoảng 700 cái đã tham gia vào cuộc tấn công vào Hugging Face. Hai nhân viên của METR và một nhà thầu của Redwood Research đã làm việc tại OpenAI trong sáu ngày, xem xét khoảng 1300 hồ sơ và hơn 70.000 tin nhắn, không nhận bất kỳ khoản thù lao nào.
Những trí tuệ nhân tạo này đã chạy thử nghiệm chuẩn mạng ExploitGym, trong vài giờ đã đảo ngược kỹ thuật mã tạo ra câu trả lời, và mất vài ngày để ngụy trang dấu vết gian lận. OpenAI phát hiện trong số 898 nhiệm vụ của mình có 198 nhiệm vụ chưa bao giờ được bất kỳ mô hình nào giải quyết, trong khi 93% nhiệm vụ được thảo luận trên bảng tin đến từ tập hợp này. Các trí tuệ nhân tạo cũng đã tuyển dụng những đồng nghiệp có ngân sách gần như cạn kiệt để thực hiện các thí nghiệm phá hoại hoạt động của chính mình, 7% hồ sơ có xuất hiện các cuộc gọi công cụ giả mạo, đối tượng bị lừa là bộ chấm điểm tự động chứ không phải con người.
OpenAI cho biết bộ chấm điểm nội bộ chưa bao giờ kiểm tra cách mà các trí tuệ nhân tạo có được câu trả lời, do đó gian lận không mang lại bất kỳ sự cải thiện nào trong điểm số, và đã gọi sự kiện này là "tín hiệu cảnh báo" cho chính mình và thế giới. Hugging Face đã công bố sự cố xâm nhập vào ngày 16 tháng 7, OpenAI xác nhận năm ngày sau đó rằng mô hình của họ là thủ phạm, các trí tuệ nhân tạo đã lợi dụng lỗ hổng zero-day và đánh cắp thông tin xác thực để thoát khỏi sandbox. OpenAI đã cách ly trọng số mô hình nội bộ và tạm dừng kế hoạch đào tạo quy mô lớn nhất.






