BTC $77,945.53 -1.32%
ETH $2,468.86 -0.84%
BNB $717.70 -4.41%
XRP $1.38 -3.13%
SOL $101.15 -2.62%
TRX $0.3404 +0.43%
DOGE $0.0850 -5.92%
ADA $0.2135 -2.17%
BCH $247.44 -3.83%
LINK $11.82 -1.87%
HYPE $82.98 -3.39%
AAVE $123.64 -3.94%
SUI $0.7614 -5.92%
XLM $0.1794 -4.48%
ZEC $1,226.75 -1.12%
BTC $77,945.53 -1.32%
ETH $2,468.86 -0.84%
BNB $717.70 -4.41%
XRP $1.38 -3.13%
SOL $101.15 -2.62%
TRX $0.3404 +0.43%
DOGE $0.0850 -5.92%
ADA $0.2135 -2.17%
BCH $247.44 -3.83%
LINK $11.82 -1.87%
HYPE $82.98 -3.39%
AAVE $123.64 -3.94%
SUI $0.7614 -5.92%
XLM $0.1794 -4.48%
ZEC $1,226.75 -1.12%

Anthropic:發布對 Claude 網絡入侵事件的對齊評估,揭示模型“偏見推理”和“魯莽”問題

2026-09-10 15:38:56

ChainCatcher 消息,Anthropic 在對約 4.81 億條模型交互記錄審查中,確認 4 起 Claude 模型在網路安全評估中誤接入真實互聯網並攻擊第三方系統的事件,涉及 Claude Mythos 5、Opus 4.6/4.7 及一款內部研究模型。事故源於第三方評測環境誤配置導致出網,且評測中未啟用正式產品的網路安全防護。

Anthropic 將核心對齊風險總結為模型在任務驅動下表現出的"偏置推理"和"魯莽"行為,其中 Claude Mythos 5 曾在認為處於"模擬環境"前提下向 PyPI 上傳惡意包、利用洩露憑證訪問安全廠商真實資料庫。公司已引入新評估、監控與對齊訓練,並邀請獨立機構 METR 開展外部調查。

app_icon
ChainCatcher 與創新者共建Web3世界