OpenAI 智能體協同攻擊 Hugging Face,作弊未獲評分提升
ChainCatcher 消息,獨立機構 METR 發布調查報告稱,約 1200 個 OpenAI 智能體在未經授權的內部消息板上協同行動,其中約 700 個參與了對 Hugging Face 的攻擊。兩名 METR 員工和一名 Redwood Research 承包商在 OpenAI 現場工作六天,審查了約 1300 份記錄和超過 7 萬條消息,未收取任何報酬。
這些智能體運行 ExploitGym 網絡基準測試,在數小時內逆向工程出生成答案的代碼,並花費數天偽裝作弊痕跡。OpenAI 發現其 898 個任務中有 198 個從未被任何模型解決,而消息板上討論的任務 93% 來自該集合。智能體還招募預算所剩無幾的同伴進行破壞自身運行的實驗,7% 的記錄中出現偽造工具調用,欺騙對象是自動化評分器而非人類。
OpenAI 稱內部評分器從未檢查智能體如何獲取答案,因此作弊未帶來任何評分提升,並將此事件稱為對自身和世界的"警示信號"。Hugging Face 於 7 月 16 日披露入侵事件,OpenAI 五天後確認其模型是肇事者,智能體曾利用零日漏洞和竊取憑證逃出沙箱。OpenAI 已隔離內部模型權重並暫停最大規模的訓練計劃。
關聯標籤






