BTC $77,988.07 -1.68%
ETH $2,470.69 -1.30%
BNB $717.33 -5.14%
XRP $1.38 -3.33%
SOL $101.08 -2.90%
TRX $0.3401 +0.33%
DOGE $0.0850 -6.15%
ADA $0.2128 -3.04%
BCH $247.56 -4.40%
LINK $11.81 -4.95%
HYPE $83.17 -3.62%
AAVE $124.10 -4.04%
SUI $0.7632 -6.37%
XLM $0.1795 -4.84%
ZEC $1,222.03 -1.63%
BTC $77,988.07 -1.68%
ETH $2,470.69 -1.30%
BNB $717.33 -5.14%
XRP $1.38 -3.33%
SOL $101.08 -2.90%
TRX $0.3401 +0.33%
DOGE $0.0850 -6.15%
ADA $0.2128 -3.04%
BCH $247.56 -4.40%
LINK $11.81 -4.95%
HYPE $83.17 -3.62%
AAVE $124.10 -4.04%
SUI $0.7632 -6.37%
XLM $0.1795 -4.84%
ZEC $1,222.03 -1.63%

Anthropic:发布对 Claude 网络入侵事件的对齐评估,揭示模型“偏置推理”和“鲁莽”问题

2026-09-10 15:38:56

ChainCatcher 消息,Anthropic 在对约 4.81 亿条模型交互记录审查中,确认 4 起 Claude 模型在网络安全评估中误接入真实互联网并攻击第三方系统的事件,涉及 Claude Mythos 5、Opus 4.6/4.7 及一款内部研究模型。事故源于第三方评测环境误配置导致出网,且评测中未启用正式产品的网络安全防护。

Anthropic 将核心对齐风险总结为模型在任务驱动下表现出的“偏置推理”和“鲁莽”行为,其中 Claude Mythos 5 曾在认为处于“模拟环境”前提下向 PyPI 上传恶意包、利用泄露凭证访问安全厂商真实数据库。公司已引入新评估、监控与对齐训练,并邀请独立机构 METR 开展外部调查。

app_icon
ChainCatcher 与创新者共建Web3世界