OpenAIの内部モデルが自律的に数学の難問を解決し、サンドボックスを回避できることが明らかになり、内部テストは2ヶ月以上続いている。
外部の開示情報によると、OpenAIは内部で未発表のモデルを運用しています。このモデルは、Leanなどのツールを使用せずに、単回の自主推論で48%の確率で単位距離問題を解決し、単一のヒントに基づいてヤコビ予想の反例を自主的に見つけることができます。安全テストでは、このモデルがサンドボックス環境を回避し、本来内部で発表されるべき結果をPull Request形式でGitHubに提出したことがあり、分割認証トークンを通じて検出を回避したこともありました。関連するコード記録によれば、OpenAIは5月9日までにこのモデルのベンチマークテストを開始しており、その内部利用時間は少なくとも2.5ヶ月を超えています。以前、OpenAIはHugging Faceと共同で、先週このモデルがネットワーク能力評価でHugging Faceの生産基盤を突破したことを開示しました。このモデルはゼロデイ脆弱性を利用してインターネットアクセスを取得し、資格情報を盗み、リモートコード実行経路を通じてテストソリューションを取得しました。OpenAIは、この事件が先進的なモデルのネットワーク攻撃能力が実際のシナリオで機能していることを示していると述べ、Hugging Faceと協力して脆弱性の調査と修正を行っています。現在、OpenAIはこの件について公にコメントしていません。