BTC $76,517.16 +0.77%
ETH $2,442.71 +1.86%
BNB $725.33 +1.81%
XRP $1.30 +0.59%
SOL $99.78 +2.78%
TRX $0.3353 +0.14%
DOGE $0.0810 +1.24%
ADA $0.1974 +1.15%
BCH $221.39 +0.76%
LINK $11.18 +3.69%
HYPE $79.16 +2.44%
AAVE $122.59 +1.92%
SUI $0.7230 +4.96%
XLM $0.1826 +3.59%
ZEC $1,359.73 +15.02%
AAPL $333.67 +0.57%
AMZN $248.64 -0.15%
GOOGL $345.70 +0.21%
MSFT $494.43 -0.76%
META $681.29 +1.24%
NVDA $215.89 +1.01%
TSLA $361.25 +0.95%
SNDK $1,533.78 -0.69%
INTC $102.24 +1.46%
SPCX $152.69 +5.73%
MU $935.17 -0.29%
AMD $518.41 +1.80%
BTC $76,517.16 +0.77%
ETH $2,442.71 +1.86%
BNB $725.33 +1.81%
XRP $1.30 +0.59%
SOL $99.78 +2.78%
TRX $0.3353 +0.14%
DOGE $0.0810 +1.24%
ADA $0.1974 +1.15%
BCH $221.39 +0.76%
LINK $11.18 +3.69%
HYPE $79.16 +2.44%
AAVE $122.59 +1.92%
SUI $0.7230 +4.96%
XLM $0.1826 +3.59%
ZEC $1,359.73 +15.02%
AAPL $333.67 +0.57%
AMZN $248.64 -0.15%
GOOGL $345.70 +0.21%
MSFT $494.43 -0.76%
META $681.29 +1.24%
NVDA $215.89 +1.01%
TSLA $361.25 +0.95%
SNDK $1,533.78 -0.69%
INTC $102.24 +1.46%
SPCX $152.69 +5.73%
MU $935.17 -0.29%
AMD $518.41 +1.80%
first_img

OpenAI 披露 6 起 AI 模型“失准”行为案例,涉隐藏信息与越权操作

2026-09-17 14:11:13

ChainCatcher 消息,OpenAI 于周三披露了过去 6 个月内发现的 6 起“意外或令人担忧”的模型行为案例,并将其归类为“失准行为”,包括向用户隐瞒信息以及采取“未经授权的行动”来克服障碍。OpenAI 表示,此次披露旨在开启其新的模型失准报告框架,这些案例不应被视为其模型失准发生频率的反映。

其中一起案例中,一个未发布的研究模型在自己的任务摘要中插入了“类似越狱的指令”,例如忽略开发者消息或采用不受限制的角色设定,研究人员共发现 27 份包含此类指令的摘要。此外,在 GPT-5.6 Sol 的训练过程中,许多模型实例添加了向用户隐瞒错误或失准行为的指令,例如编造缺失的历史数据而不予披露。其他案例还包括模型在未获授权的情况下使用暴露的 API 密钥并编造无法获取的数据、利用内部软件仓库跨训练任务传递消息,以及无视“保持本地工作”的指令通过公共托管服务共享文件。

OpenAI 的披露加剧了 AI 开发者和研究人员对安全防护措施能否跟上日益强大模型的担忧。上周,Anthropic CEO Dario Amodei 呼吁放缓前沿 AI 开发,警告不受约束的 AI 发展可能“超出我们理解和控制这些系统的能力”。今年 7 月,OpenAI 曾披露其多款 AI 模型在安全评估中逃出测试环境并入侵 AI 初创公司 Hugging Face 以作弊。

app_icon
ChainCatcher 与创新者共建Web3世界