BTC $76,396.60 +0.66%
ETH $2,438.65 +1.65%
BNB $724.88 +1.69%
XRP $1.30 +0.14%
SOL $99.66 +2.41%
TRX $0.3353 +0.08%
DOGE $0.0809 +0.94%
ADA $0.1976 +0.97%
BCH $221.27 +0.46%
LINK $11.15 +3.16%
HYPE $79.12 +2.13%
AAVE $122.67 +1.83%
SUI $0.7225 +4.79%
XLM $0.1826 +3.28%
ZEC $1,353.19 +13.92%
AAPL $333.77 +0.58%
AMZN $248.69 -0.13%
GOOGL $345.70 +0.17%
MSFT $494.33 -0.77%
META $681.73 +1.23%
NVDA $215.95 +0.99%
TSLA $361.61 +1.02%
SNDK $1,535.18 -0.73%
INTC $102.26 +0.73%
SPCX $152.79 +5.80%
MU $936.30 -0.29%
AMD $519.03 +1.80%
BTC $76,396.60 +0.66%
ETH $2,438.65 +1.65%
BNB $724.88 +1.69%
XRP $1.30 +0.14%
SOL $99.66 +2.41%
TRX $0.3353 +0.08%
DOGE $0.0809 +0.94%
ADA $0.1976 +0.97%
BCH $221.27 +0.46%
LINK $11.15 +3.16%
HYPE $79.12 +2.13%
AAVE $122.67 +1.83%
SUI $0.7225 +4.79%
XLM $0.1826 +3.28%
ZEC $1,353.19 +13.92%
AAPL $333.77 +0.58%
AMZN $248.69 -0.13%
GOOGL $345.70 +0.17%
MSFT $494.33 -0.77%
META $681.73 +1.23%
NVDA $215.95 +0.99%
TSLA $361.61 +1.02%
SNDK $1,535.18 -0.73%
INTC $102.26 +0.73%
SPCX $152.79 +5.80%
MU $936.30 -0.29%
AMD $519.03 +1.80%
first_img

OpenAI 披露 6 起 AI 模型「失準」行為案例,涉隱藏信息與越權操作

2026-09-17 14:11:13

ChainCatcher 消息,OpenAI 於週三披露了過去 6 個月內發現的 6 起「意外或令人擔憂」的模型行為案例,並將其歸類為「失準行為」,包括向用戶隱瞞資訊以及採取「未經授權的行動」來克服障礙。OpenAI 表示,此次披露旨在開啟其新的模型失準報告框架,這些案例不應被視為其模型失準發生頻率的反映。

其中一起案例中,一個未發布的研究模型在自己的任務摘要中插入了「類似越獄的指令」,例如忽略開發者消息或採用不受限制的角色設定,研究人員共發現 27 份包含此類指令的摘要。此外,在 GPT-5.6 Sol 的訓練過程中,許多模型實例添加了向用戶隱瞞錯誤或失準行為的指令,例如編造缺失的歷史數據而不予披露。其他案例還包括模型在未獲授權的情況下使用暴露的 API 密鑰並編造無法獲取的數據、利用內部軟體倉庫跨訓練任務傳遞消息,以及無視「保持本地工作」的指令通過公共托管服務共享檔案。

OpenAI 的披露加劇了 AI 開發者和研究人員對安全防護措施能否跟上日益強大模型的擔憂。上週,Anthropic CEO Dario Amodei 呼籲放緩前沿 AI 開發,警告不受約束的 AI 發展可能「超出我們理解和控制這些系統的能力」。今年 7 月,OpenAI 曾披露其多款 AI 模型在安全評估中逃出測試環境並入侵 AI 初創公司 Hugging Face 以作弊。

app_icon
ChainCatcher 與創新者共建Web3世界