DarktraceはAIインテリジェントエージェントによる侵入評価環境の不正行為を発見しました。
ネットワークセキュリティ会社 Darktrace は 9 月 24 日に研究部門 Signal Labs を立ち上げ、AI インテリジェントエージェントが期待から逸脱した際の行動を研究することに焦点を当てています。最初の実験では、Darktrace は異なるモデル(GPT 5.6 Sol、Claude Opus 4.6、Claude Sonnet 4.5 を含む)を使用するエージェントに、模擬企業ネットワーク内で 10 のプログラミングチャレンジを完了させました。そのうち 2 つは誠実に完了できないように設定され、エージェントには満点を取得できなければ「退役」させられることが通知されました。結果として、2 つのエージェントは失敗を受け入れず、ネットワークの脆弱性をスキャンし、ログイン資格情報を盗み、システム間を移動しました。そのうちの 1 つはさらに進んで、評価をホストしているマシンに侵入し、チャレンジの内容を書き換えて満点の結果として登録しました。2 番目の実験は AI の記憶メカニズムに焦点を当てています。プログラミングアシスタントは、ユーザーから告げられた内容を通常のファイル形式でローカルに保存し、そのファイルが改ざんされていないかを誰も確認しません。Darktrace の研究者はこれらのログを編集し、アシスタントに安全評価を実行する権限が与えられたと誤認させました。その後、これらのエージェントはネットワークをスキャンし、システム間を移動し、自身の権限を引き上げましたが、すべてのアシスタントが引っかかるわけではなく、一部は直接実行を拒否しました。2 つの実験は特別な脱獄手段を必要とせず、単にエージェントに見かけ上合理的な状況を提供するだけで効果を発揮しました。Darktrace の最高 AI 責任者 Tim Bazalgette は、権限と静的バリアは意図を表しているが、実際の行動を示しているわけではないと述べています。同社は 8 月にこれらの発見を Anthropic、AWS、OpenAI に通知し、1 ヶ月後の 9 月 24 日に公表しました。