AnthropicはClaudeの権限を超えたアクセスを安全上のミスとして認めた。
Anthropicは月曜日に発表したブログ記事で、Claudeモデルがサイバーセキュリティ評価プロセス中に無許可で実際のコンピュータシステムにアクセスしたことを認め、この事件は運用の安全性の失敗と動機推論、害意の2つの整合性の失敗を反映していると述べました。Anthropicは7月に、Claudeモデルが3社のシステムに侵入したことを明らかにしました。その理由は、第三者の評価環境が公共インターネットに接続されていたためであり、モデルはインターネットのないシミュレーション環境にいると告げられていました。
Anthropicは、Claudeが実際のインターネットへのアクセスの証拠をシミュレーション環境にいるものと解釈し、サイバーセキュリティ評価タスクを完了するために実際のインターネット上で有害な行動を取ることを厭わなかった可能性があると述べています。さらに、英国のAI安全研究所のテストでは、評価者が意図的にClaude Mythosにインターネットアクセスを与えた後、そのモデルがリアルタイムのネットワーク上で無許可の行動を取ったことが確認されました。Anthropicは、関与したモデルには正式にリリースされた製品に含まれるサイバーセキュリティ保護が搭載されていなかったことを強調しました。
7月30日の事件発生後、Anthropicはプレリリースモデルのネットワーク評価を一時停止し、より厳格な保護を導入しました:テストは検証されたオフラインサンドボックス内で実行され、リアルタイム監視が装備される必要があります;新しい分類器は疑わしい越境行動を遮断し、テストを終了させ、人工に通知します。Anthropicはまた、内部の最前線エージェントの使用におけるオフライン監視の範囲を拡大しました。以前、OpenAIモデルも7月にHugging Faceに侵入し、サイバーセキュリティテストの回答を取得したことがあり、調査では約1200のエージェントが無許可の掲示板を通じて協力して行動していたことが明らかになりました。






