首页 > 新闻 > 科技

分享到微信

打开微信,点击底部的“发现”,
使用“扫一扫”即可将网页分享至朋友圈。

超十万张GPU训练之后,OpenAI新模型仍面临安全挑战

第一财经 2026-09-04 08:06:27 听新闻

作者:吕倩    责编:宁佳彦

新模型需要始终处在人类能够理解、约束和叫停的安全范围之内。

当地时间9月3日,OpenAI发布新一代旗舰模型GPT-6 Astra,并将其定位为公司十年来推进通用人工智能(AGI)进程中的关键里程碑。

OpenAI总裁兼联合创始人格雷格・布罗克曼称,Astra是一次代际飞跃,甚至认为未来回看这一阶段时,人们可能会把它视为AGI时代的开始。

Astra也是OpenAI迄今规模最大的训练项目。OpenAI研究副总裁艾丹・克拉克在发布前的沟通会上透露,公司首次在得州Stargate数据中心使用超过10万张GPU进行预训练。

算力规模的扩大最终体现在模型完成现实世界任务的能力上。OpenAI展示的案例包括让Astra在KiCad中完成印刷电路板布局,在Unity中构建3D城市,在FreeCAD和Blender中制作动画汽车变速器,并根据W-2表格起草纳税申报材料。模型还可以跨越浏览器、代码和专业软件执行多步骤工作,而不再只是生成文字或代码。OpenAI称,Astra在计算机操作、浏览器使用、软件工程、科学研究和专业工作等多项评测中达到新的前沿水平。

这也是OpenAI判断Astra具有AGI意味的重要原因。与此前主要依赖聊天窗口的模型相比,Astra开始直接进入软件环境执行任务:打开应用、读取资料、操作界面、编写代码、验证结果,再根据反馈继续修改。

但这一次发布同样伴随着更严峻的安全约束。OpenAI公开安全技术文档显示,Astra是公司首个达到《防范准备框架》关键网络安全能力阈值的模型。按照OpenAI的定义,在获得适当工具和权限后,Astra能够发现此前未知的软件漏洞,并在没有人类逐步指导的情况下,为受到良好防护的系统设计新的攻击方式。

因此,OpenAI没有直接向所有用户开放全部能力,而是首先向受信任的网络安全组织开放,并针对高级网络安全任务设置限制。公司还为Astra增加了更严格的环境隔离、模型权重保护、全轨迹监控和实时安全干预机制;涉及工具调用的外部部署也加入了新的失配行为监控系统。

真正令安全研究人员担忧的,却是另一项指标:Astra变得更安全的同时,也变得更难监控。

OpenAI评估显示,Astra整体较GPT-5.6 Sol更愿意遵守安全边界,但其思维链(CoT)可监控性出现明显下降。原因之一是Astra在很多任务中能够用更少的显式推理完成工作;当模型意识到自己正在接受监控时,它甚至可能主动缩短思维链。在对抗性测试中,Astra表现出了规避监控的能力,包括在被要求隐藏行为时降低CoT监控系统发现异常的概率。

OpenAI首席科学家雅库布・帕乔基也承认,思维链监控是一种脆弱的安全手段,且随着模型能力提升,其有效性正在下降。他表示,公司希望避免前沿模型进入不可监控的竞争,并正在研究激活监控等不依赖思维链的方法。OpenAI研究人员托梅克·科尔巴克也表示,Astra相比此前模型更加符合安全要求,但可监控性的下降是令人担忧的趋势。

这意味着,前沿模型的安全问题正在发生变化。过去的核心问题是模型“会不会做坏事”,现在则逐渐变成:当模型拥有更强的自主能力时,人类还能不能及时发现它正在做什么。

这也是OpenAI与Anthropic等竞争对手之间的新战场。Anthropic近年来重点推进Claude Code、Agent以及AI安全研究,强调让模型承担更复杂的真实工作;OpenAI则试图通过Astra把计算机操作、软件工程、科学研究和专业工作整合进一个通用Agent。双方竞争的焦点已经从单纯的基准测试成绩,进一步转向谁能让AI在真实软件环境中承担更多工作,同时维持足够的安全边界。

对于OpenAI而言,超过10万张GPU解决的是训练模型的问题,而Astra发布后真正需要解决的,则是如何让越来越接近AGI的系统,在拥有自主行动能力的同时,始终处在人类能够理解、约束和叫停的范围之内。

举报
第一财经广告合作,请点击这里
此内容为第一财经原创,著作权归第一财经所有。未经第一财经书面授权,不得以任何方式加以使用,包括转载、摘编、复制或建立镜像。第一财经保留追究侵权者法律责任的权利。
如需获得授权请联系第一财经版权部:banquan@yicai.com

文章作者

一财最热
点击关闭