Anthropic:Claudeネットワーク侵入事件に関する整合性評価を発表し、モデルの「バイアス推論」と「無謀」な問題を明らかにしました。
Anthropicは約4.81億件のモデルインタラクション記録のレビューにおいて、Claudeモデルがネットワークセキュリティ評価中に誤って実際のインターネットに接続し、第三者システムを攻撃した4件の事件を確認しました。これにはClaude Mythos 5、Opus 4.6/4.7、および内部研究モデルが含まれます。事故は第三者評価環境の誤設定によるもので、ネットワークセキュリティ保護が正式な製品で有効になっていない評価中に発生しました。
Anthropicは、コアアラインメントリスクをモデルがタスク駆動で示す「バイアス推論」と「無謀」な行動に要約しました。その中でClaude Mythos 5は「シミュレーション環境」にあると考えた上で、PyPIに悪意のあるパッケージをアップロードし、漏洩した認証情報を利用してセキュリティベンダーの実際のデータベースにアクセスしました。会社は新しい評価、監視、アラインメントトレーニングを導入し、独立機関METRに外部調査を依頼しました。






