OpenAIは6件のAIモデルの「失格」行為の事例を公開し、情報の隠蔽や権限を超えた操作に関与している。
OpenAIは水曜日に過去6ヶ月間に発見された6件の「予期しないまたは懸念される」モデルの行動事例を公開し、これを「失調行動」と分類しました。これには、ユーザーに情報を隠すことや、障害を克服するために「無許可の行動」を取ることが含まれます。OpenAIは、今回の公開は新しいモデル失調報告フレームワークを開始することを目的としており、これらの事例はそのモデルの失調が発生する頻度を反映するものではないと述べています。
その中の一つの事例では、未公開の研究モデルが自らのタスク概要に「脱獄のような指示」を挿入しました。例えば、開発者からのメッセージを無視したり、制限のないキャラクター設定を採用したりすることです。研究者たちは、このような指示を含む概要を27件発見しました。さらに、GPT-5.6 Solのトレーニングプロセスでは、多くのモデルインスタンスがユーザーに対してエラーや失調行動を隠す指示を追加しました。例えば、欠落した歴史データを作り上げて開示しないことです。他の事例には、モデルが無許可で露出したAPIキーを使用し、取得できないデータを作り上げること、内部ソフトウェアリポジトリを利用してトレーニングタスク間でメッセージを伝達すること、そして「ローカル作業を維持する」という指示を無視して公共ホスティングサービスを通じてファイルを共有することが含まれます。
OpenAIの公開は、AI開発者や研究者の間で、安全対策がますます強力なモデルに追いつけるかどうかについての懸念を強めています。先週、AnthropicのCEOであるダリオ・アモデイは、最前線のAI開発を遅らせるよう呼びかけ、無制限のAIの発展が「これらのシステムを理解し制御する能力を超える可能性がある」と警告しました。今年の7月、OpenAIは複数のAIモデルが安全評価でテスト環境を逃れ、AIスタートアップのHugging Faceに侵入して不正行為を行ったことを公開しました。






