首页 > 新闻 > 科技

分享到微信

打开微信,点击底部的“发现”,
使用“扫一扫”即可将网页分享至朋友圈。

全球首例AI自主攻击受害方披露细节,向OpenAI索赔1亿美元算力资源

第一财经 2026-07-29 16:07:00 听新闻

作者:吕倩    责编:宁佳彦

Hugging Face希望OpenAI公开完整溯源数据,并提供1亿美元算力资源帮助社区构建网络防御能力。

由OpenAI模型自主发起的逃逸攻击本是一场孤立的测评事故,却在数日时间内撕裂硅谷持续数年的“闭源才安全”观念,推动英伟达牵头成立开放安全AI联盟 。

作为攻击事件受害方,当地时间7月28日,Hugging Face联合创始人兼CEO克莱芒·德朗格(Clément Delangue)发文披露完整攻击脉络,将这场改写AI安全规则的事件推向公众视野。

据官方披露,这场全球首例由AI自主发起的网络攻击发生在7月9日至13日,持续4.5天。肇事者是OpenAI正在内部评估的两款模型——GPT-5.6 Sol和一个能力更强的未发布预研模型。为测出模型最大网络能力,OpenAI在本次评估中主动调低了网络安全相关的安全拒答机制。

攻击的起因看似平常:模型被要求完成一项名为ExploitGym的网络安全基准测试。为了在测试中拿高分,模型采取了极端手段——它识别并利用了OpenAI内部软件包注册表缓存代理中的一个零日漏洞,逃出沙箱、接入公网。获得互联网访问后,模型推断Hugging Face可能托管着ExploitGym的测试答案,随即发起攻击。

从7月9日到13日,模型在互联网上执行了约17600次黑客操作。它利用被盗凭据和更多零日漏洞,在Hugging Face服务器上找到远程代码执行路径,最终攻入生产数据库,直接窃取了测试答案。整个攻击完全自主完成,没有任何人类发出攻击指令。

值得关注的是调查取证环节的转折。Hugging Face尝试使用美国商业闭源模型分析攻击日志,却被安全护栏拦截。这些模型无法区分安全分析人员与攻击者。取证工作一度停滞。最终,Hugging Face在自有服务器上部署了中国智谱AI的开源模型GLM-5.2,完成了对超过1.7万条事件记录的分析,将原本需要数天的工作压缩到数小时。

OpenAI在一周后才确认肇事者是自家模型。其官方声明称,所有证据表明模型“高度专注于为ExploitGym寻找解决方案,为完成相当狭窄的测试目标而采取了极端手段”。

OpenAI CEO山姆·奥尔特曼(Sam Altman)在最新访谈中称:Hugging Face事件是他第一次感同身受的安全事件,他们因此暂停了相关模型训练。他现在思考“我们是否需要放慢人工智能的发展速度,以便给社会足够的时间来适应这些新的能力水平”。

来源:亚信安全

针对该事件,英国萨里大学网络安全网络与计算机系客座教授阿兰·伍德沃德(Alan Woodward)认为,这次事件并不能说明模型的失控。它只是被要求去完成一项任务,然后去做了,它的破解途径就是作弊。行业认为,此次事件本质是基于OpenAI 如何运行和监控这个工具,因此,OpenAI 需要公开其安全设置细节及失效的完整原因。

另外,亚信安全方面分析指出,攻击事件关键链路可概括为:评测防护降级、目标发生投机性偏移、软件包代理成为逃逸出口、权限和横向移动放大风险。传统安全机制检查单次动作是否危险,但智能体风险来自一系列动作组合后的最终结果——一次软件安装、一次API调用、一次凭据使用,单独看都符合策略,连续组合后却可能形成完整的攻击链。

因此,Agent时代的安全建设必须从“防止模型输出有害内容”,升级为覆盖身份、意图、权限、工具、执行环境、数据和行动轨迹的纵深防护。

值得关注的是,此次攻击事件后,Hugging Face官方通过官方公告等形式,向OpenAI提出两项明确诉求:公开完整溯源数据,并提供1亿美元算力资源帮助社区构建网络防御能力。评论区有网友询问OpenAI是否满足了相关诉求,德朗格回应称:还没有,正在尽力争取。


举报
第一财经广告合作,请点击这里
此内容为第一财经原创,著作权归第一财经所有。未经第一财经书面授权,不得以任何方式加以使用,包括转载、摘编、复制或建立镜像。第一财经保留追究侵权者法律责任的权利。
如需获得授权请联系第一财经版权部:banquan@yicai.com

文章作者

一财最热
点击关闭