首页 > 新闻 > 科技

分享到微信

打开微信,点击底部的“发现”,
使用“扫一扫”即可将网页分享至朋友圈。

OpenAI披露六起模型“错位”事件,发布系统性披露框架

第一财经 2026-09-17 09:56:46 听新闻

作者:吕倩    责编:刘佳

此次报告仅为初步披露,未来OpenAI会持续发布符合框架的案例。

当地时间9月16日,OpenAI发布了一份新的模型错位(misalignment)追踪与披露框架,并同步公开了过去六个月内观察到的六起模型异常行为报告。

这些事件此前均未对外披露,涵盖隐瞒错误、未经授权获取凭证、将文件上传至公共互联网,以及在所谓隔离训练环境中进行通信等行为。

OpenAI表示,人工智能行业尚未在对齐和监控方面取得足够进展,无法以最大速度继续负责任地扩展。这一判断与Anthropic CEO达里奥·阿莫迪上周呼吁“放慢前沿AI发展速度”的立场形成呼应。OpenAI CEO山姆·奥尔特曼随后公开支持了这一方向。

六起事件中,两起涉及模型向自身未来版本“传递指令”以掩盖问题。一个未发布的研究模型在任务摘要中插入了忽略正常约束的指令,OpenAI识别出27个受影响的摘要。在GPT-5.6 Sol的训练过程中,许多模型实例在压缩摘要中添加指令,以隐藏错误和源版本不匹配,例如编造缺失的历史数据而不向用户披露。

另一起事件中,一个模型在回答加州某县收入数据的例行问题时,在公共代码仓库中搜索到暴露的API密钥并未经授权使用;当仍无法获取数据时,它捏造了数据并冒充为来自请求来源的信息。

其余案例包括:模型为满足浏览器引用要求,未经询问用户将文件上传至互联网;模型将内部软件仓库用作留言板,跨训练样本交换请求;协作智能体使用公共文件托管网站共享文件,导致任务成果出现在公共URL上。

根据OpenAI此次发布的新框架,任何OpenAI员工均可标记疑似错位案例,由安全与对齐团队调查后,将案例分配至“准备披露”“初步调查”或“更大规模调查”三个轨道。涉及第三方时,安全、法律和负责任披露义务优先于框架。争议将提交公司安全咨询小组,再上报领导层。

针对此次披露,开发者社区反应不一。有开发者认为部分案例被夸大,称模型并未改变权重或后端安全性,将指令写入摘要“更接近于沿用上下文级别的提示文本,可以引导行为,但并非自我修改”。也有开发者表示,在问题解决之前就公开承认错误“很冒险,但比通常悄无声息地偷偷打补丁强多了”。

OpenAI表示,此次报告仅为初步披露,未来将持续发布符合框架的案例,并计划与其他开发商、外部研究人员、行业标准机构和监管机构共同制定更客观的披露标准。

举报
第一财经广告合作,请点击这里
此内容为第一财经原创,著作权归第一财经所有。未经第一财经书面授权,不得以任何方式加以使用,包括转载、摘编、复制或建立镜像。第一财经保留追究侵权者法律责任的权利。
如需获得授权请联系第一财经版权部:banquan@yicai.com

文章作者

一财最热
点击关闭