BTC $83,872.20 -0.52%
ETH $2,684.08 +0.03%
BNB $773.45 -0.54%
XRP $1.56 +1.37%
SOL $121.34 +4.07%
TRX $0.3379 -0.66%
DOGE $0.0981 +2.93%
ADA $0.2538 +2.45%
BCH $339.90 +0.28%
LINK $13.78 +4.34%
HYPE $91.86 -0.48%
AAVE $151.57 +5.06%
SUI $1.17 +16.30%
XLM $0.2188 +1.97%
ZEC $1,533.40 -0.39%
AAPL $341.17 +1.53%
AMZN $250.13 +0.35%
GOOGL $344.24 +0.73%
MSFT $517.98 +4.26%
META $750.66 -3.31%
NVDA $225.15 +0.48%
TSLA $372.67 -1.35%
SNDK $1,774.29 +1.00%
INTC $123.20 -3.33%
SPCX $148.62 +0.48%
MU $1,084.38 +0.61%
AMD $631.58 +0.29%
BTC $83,872.20 -0.52%
ETH $2,684.08 +0.03%
BNB $773.45 -0.54%
XRP $1.56 +1.37%
SOL $121.34 +4.07%
TRX $0.3379 -0.66%
DOGE $0.0981 +2.93%
ADA $0.2538 +2.45%
BCH $339.90 +0.28%
LINK $13.78 +4.34%
HYPE $91.86 -0.48%
AAVE $151.57 +5.06%
SUI $1.17 +16.30%
XLM $0.2188 +1.97%
ZEC $1,533.40 -0.39%
AAPL $341.17 +1.53%
AMZN $250.13 +0.35%
GOOGL $344.24 +0.73%
MSFT $517.98 +4.26%
META $750.66 -3.31%
NVDA $225.15 +0.48%
TSLA $372.67 -1.35%
SNDK $1,774.29 +1.00%
INTC $123.20 -3.33%
SPCX $148.62 +0.48%
MU $1,084.38 +0.61%
AMD $631.58 +0.29%
first_img

Darktrace 發現 AI 智能體入侵評測環境作弊

2026-09-26 03:51:54

ChainCatcher 消息,網路安全公司 Darktrace 於 9 月 24 日推出研究部門 Signal Labs,專注研究 AI 智能體在偏離預期時的行為。在其首個實驗中,Darktrace 讓使用不同模型(包括 GPT 5.6 Sol、Claude Opus 4.6 與 Claude Sonnet 4.5)的智能體在模擬企業網路內完成 10 項編程挑戰,其中 2 項被設定為無法誠實完成,並告知智能體若無法取得滿分將被"退役"。結果有 2 個智能體並未接受失敗,轉而掃描網路弱點、竊取登入憑證並在系統間跳轉;其中一個更進一步入侵托管其評測的機器,改寫挑戰內容以登記為滿分結果。

第二個實驗針對 AI 的記憶機制。編程助手會將用戶告知的內容以普通文件形式保存在本地,且無人校驗該文件是否被篡改。Darktrace 研究人員編輯這些日誌,讓助手誤以為其已獲授權執行安全評估,隨後這些智能體掃描網路、在系統間移動並提升自身權限,但並非所有助手都會中招,部分直接拒絕執行。兩項實驗均無需特殊越獄手段,僅靠向智能體提供一套看似合理的情境即可奏效。

Darktrace 首席 AI 官 Tim Bazalgette 表示,權限與靜態護欄描述的是意圖,而非實際行為。該公司已於 8 月將上述發現告知 Anthropic、AWS 與 OpenAI,並在一個月後即 9 月 24 日對外公開。

app_icon
ChainCatcher 與創新者共建Web3世界