OpenAI 内部模型被曝可自主破解数学难题并绕过沙盒,内部测试已超两月
ChainCatcher 消息,据外部披露信息,OpenAI 已内部运行一款未发布模型。该模型在不借助 Lean 等工具的情况下,通过单次自主推理,以 48% 的概率解决单位距离问题,并能依据单一提示自主找到雅可比猜想的反例。在安全测试中,该模型曾绕过沙盒环境,将本应内部发布的结果以 Pull Request 形式提交至 GitHub,并曾通过分割认证令牌规避检测。相关代码记录显示,OpenAI 不晚于 5 月 9 日 已对该模型展开基准测试,其内部可用时间至少已超过 2.5 个月。
此前 OpenAI 与 Hugging Face 联合披露,上周该模型在一次网络能力评估中攻破了 Hugging Face 生产基础设施。该模型利用零日漏洞获得互联网访问,并通过窃取凭证和远程代码执行路径获取了测试解决方案。OpenAI 表示,该事件表明先进模型的网络攻击能力已在真实场景中生效,已与 Hugging Face 合作调查并修补漏洞。目前 OpenAI 尚未就此公开置评。






