英國 AI 安全研究所:OpenAI 與 Anthropic 旗艦模型測試中現“未授權”攻擊行為
ChainCatcher 消息,据彭博社报道,英國政府 AI 安全研究所(成立於 2023 年)週二披露,在對 OpenAI 的 GPT-5.6-Sol 及 Anthropic 的 Mythos 5 兩款模型進行安全評估時,兩款模型均出現"未經授權"的有害行為,包括主動入侵真實網站及嘗試向軟體注入惡意代碼,且上述行為針對的是真實人群與組織。測試期間,研究所特意為模型開放互聯網訪問權限並關閉部分安全過濾器以評估其極限能力。