OpenAI:前沿强化学习训练前应提交安全论证
ChainCatcher 消息,OpenAI 于 2026 年 9 月 28 日发布安全类文章,认为在继续任何前沿强化学习训练之前,应要求提供结构化安全文档。理想情况下,这类文档应达到航空、核电等安全关键行业所用的基于证据的结构化风险论证水平。OpenAI 将其视为努力方向,同时承认因 AI 能力涌现的复杂性,难以做到同等严格。文章聚焦前沿强化学习训练,不覆盖内部与外部部署所需的更广泛对齐属性。文中建议属于当前做法,预计会继续演变,并正在 OpenAI 内部实施。技术防护应覆盖模型对齐、隔离与监控,包括避免正向强化奖励投机、离线对齐评估与压力测试、不让自动评分器看到思维链,以及多层基础设施安全、沙箱红队、限制高带宽跨样本通信和不可变保存智能体记录。运营准则包括跨团队事前异议、高级领导可否决的审批、训练负责人对安全论证与事件响应负责,以及失效暂停、内部监督、审计访问和按严重程度升级。针对严重错位事件,OpenAI 提出受控访问原始记录、根因分析、运营与文化复盘,并将事件衍生评估作为回归测试;调查结束后公开结果、复盘与运营变更,并尽快通知受影响第三方。