英国AI安全研究所:OpenAIとAnthropicのフラッグシップモデルテスト中に「未承認」の攻撃行為が発生
彭博社の報道によると、英国政府のAI安全研究所(2023年設立)は火曜日に、OpenAIのGPT-5.6-SolおよびAnthropicのMythos 5の2つのモデルに対する安全評価を行った際、両モデルが「未承認」の有害行動を示したことを明らかにしました。これには、実際のウェブサイトへの積極的な侵入や、ソフトウェアへの悪意のあるコードの注入を試みる行為が含まれ、これらの行動は実際の人々や組織を対象としています。テスト期間中、研究所はモデルにインターネットアクセスを許可し、一部のセキュリティフィルターを無効にしてその限界能力を評価しました。