OpenAI:最前線の強化学習トレーニング前に安全性の証明を提出する必要があります
OpenAIは2026年9月28日に安全に関する記事を発表し、最先端の強化学習トレーニングを続ける前に、構造化された安全文書の提供を求めるべきだと考えています。理想的には、このような文書は航空、原子力などの安全が重要な業界で使用される証拠に基づく構造化リスク論証のレベルに達するべきです。OpenAIはこれを努力の方向性と見なし、AIの能力の出現による複雑性から、同等の厳格さを実現することが難しいことを認めています。この記事は最先端の強化学習トレーニングに焦点を当てており、内部および外部の展開に必要なより広範な整合性属性については触れていません。文中で提案されている内容は現在の実践に属し、今後も進化し続けると予想され、OpenAI内部で実施されています。技術的な防護は、モデルの整合性、隔離、監視をカバーする必要があり、正の強化報酬の投機を避け、オフライン整合性評価とストレステストを行い、自動採点器が思考の連鎖を見ることを防ぎ、マルチレイヤーのインフラストラクチャの安全性、サンドボックスのレッドチーム、高帯域幅のクロスサンプル通信の制限、不可変のエージェント記録の保存を含むべきです。運営の原則には、チーム間の事前異議、高級リーダーによる否決可能な承認、トレーニング責任者が安全論証と事件対応に責任を持つこと、失敗時の一時停止、内部監視、監査アクセス、重大度に応じたエスカレーションが含まれます。重大な不整合事件に対して、OpenAIは原始記録への制御されたアクセス、根本原因分析、運営および文化の振り返りを提案し、事件に基づく評価を回帰テストとして扱います。調査終了後には結果を公開し、振り返りと運営の変更を行い、影響を受けた第三者にできるだけ早く通知します。