首页 > 视听 > 有料

分享到微信

打开微信,点击底部的“发现”,
使用“扫一扫”即可将网页分享至朋友圈。

超节点·解锁人工智能的底层新基建丨【懂行·国产算力】第二集

懂行2026-09-30 12:40:30

责编:杨恺宁

本期节目邀请中国信息通信研究院人工智能研究所副所长巫彤宁、中科曙光高端计算总工程师李建军、以及阿里云加速计算集群产品负责人陈祎,一起聊聊超节点是啥、难在哪、将来怎么走。

2026世界人工智能大会上,算力展区那一排排黑机柜格外显眼,几乎所有算力厂商都把 “超节点” 摆在了 C 位。大会发布了《超节点定义与实践白皮书》,说白了,超节点,物理上是多个计算节点靠高效互联协议紧紧连在一起,能跨节点统一内存编址,用起来就像一台大电脑。

本期节目邀请中国信息通信研究院人工智能研究所副所长巫彤宁、中科曙光高端计算总工程师李建军、以及阿里云加速计算集群产品负责人陈祎,一起聊聊超节点是啥、难在哪、将来怎么走。

 

·超节点是啥?嘉宾用这些比喻讲明白

一上来,中科曙光高端计算总工程师李建军先打了个比方:“就跟团队干活似的,人要是分散在好几个地方,光协调就会很繁琐。超节点,就是把人都集中到一块办公,效率一下就上来了。”

阿里云加速计算集群产品负责人陈祎接着分享了超节点和普通集群的区别:“节点就是一台服务器,超节点是很多节点攒一块,但它有普通集群没有的本事 —— 统一内存编址。普通集群一般8卡、16卡,超节点能扩到64卡,在这范围里,任意一张GPU看别的GPU的显存,就跟看自己的一样。”他还强调,别光看卡数,卡多不代表技术牛。“就好比建高铁,目的是让更多人又快又便宜地到地方,里程建多长都行,但没必要盖成三四层楼。现在工业级大模型训推,超节点真正管用的也就是几十到一百多卡这个区间。衡量它有没有价值,一看域内GPU之间通信是不是高效对等,二看交付到能用起来快不快,三看token成本到底降没降。”

中国信息通信研究院人工智能研究所副所长巫彤宁从专业角度补充解释:“超节点就是用大带宽、低时延的技术,把几十、几百甚至上千颗芯片连进一个物理空间,统一内存编址。用户根本不用管里面怎么组装的,感觉就像在使一台电脑。它跟以前的分布式计算、单纯堆硬件集群都不是一回事,属于底层系统级的创新。”记者拿快递打比方——以前是在平房之间来回送,现在装上了电梯,速度又快送得又多。巫彤宁表示这个比喻贴切:“有了超节点,不光电梯能上下,楼道之间那堵墙也打通了,哪儿都能送到。”

为啥现在非要超节点?巫彤宁解释:“大模型参数越做越大,动不动上万亿,老办法几十卡、上百卡根本跑不动训练。这几年单卡算力涨得猛,可带宽、内存带宽没跟上,集群一拼起来,实际效率远不如预期。所以得靠超节点撑住更大集群的训推。”传统集群跨服务器取显存,得拷贝数据、软件同步,开销巨大;超节点用专用高速互联,把几百上千颗芯片放进一个地址空间,互相直接读显存,不用搬来搬去——从 “堆算力” 变成了 “聚合算力”。

 

·技术难在哪?散热、互联、生态一个都跑不掉

中科曙光高端计算总工程师李建军介绍,一套超节点核心就是计算、网络加配套基础设施。“靠高速网络把卡间带宽拉大、延迟压低,再用统一编址简化数据流动,训推效率自然就上来了。加网络硬件,成本确实会涨,但性能能翻好几倍,算总账绝对划算,说到底还是为了把token的价格打下来。”

最大的坎是散热。“GPU算力越高功耗越大,散热躲不开。我们的相变浸没液冷技术做了好多年,商业落地已经成熟,能把PUE压得很低、电费省下来。我们还做了正交无线缆设计,开箱即用,运维特别省事。冷板液冷那些微流道、两相冷板的路子,未来空间也很大。”聊到最核心的赛道,他觉得还得看网络 ——“将来带宽要求越来越高,光互连大概率是个大方向。”

阿里云加速计算集群产品负责人陈祎表示,8 月上线的超节点首批就在乌兰察布开售了:“核心还是解决通信。统一内存编址就像大家看同一块白板,显存互相看得见,信息传得快。很多企业买硬件容易,可真要用起来,网络适配、故障运维、配套生态一堆隐性成本。”他给企业提了个实在的建议:“先问自己到底需不需要超节点。小模型一两张卡就够,没必要上这么大个家伙。真要跑万亿参数的大模型,直接上云最省事——分钟级开通、开箱即用、用完就释放,弹性好,回本压力也小。”

 

·落地啥情况?推理是主力,标准要统一

说到真实落地,阿里云加速计算集群产品负责人陈祎最清楚:“现在推理是超节点用得最多的场景。我们的64卡超节点,已经跟 Minimax、Kimi 这类万亿级模型适配好了,视频生成、AI 数字人这些场景都在用。训练相对少一些,多是后训练、世界模型仿真,集中在自动驾驶和具身智能。小模型根本不用超节点,几块卡就够了。”按赛道看,最早跑起来的一定是基础模型训练推理、世界模型仿真这些,互联网公司、科研机构、模型服务商,还有视频生成、自动驾驶、具身智能这些行业会冲在前面。

信通院人工智能研究所副所长巫彤宁点出行业最大的问题在于碎片化:“超节点正处爆发期,可各家对它的理解都不一样。国内芯片又各用各的架构、各用各的算子,生态比较碎。所以特别需要从能达成共识的地方,定一些基础技术指标,让标准跟着技术一起走,把大家拧成一股绳。技术、标准、生态得同步往前推,后端用出来的新问题反过来带动基础研究。要是生态各自为战、越分越散,后面就不好办了。”

数据也佐证了热度:到6月底,我国智能算力规模已经到2185EFLOPS。工信部下一步还要按 “点、链、网、面” 的思路,把算力资源布得更合理,建算力互通节点,提升利用率。业内普遍觉得,超节点的出现,意味着国产算力正式进入系统升级的新阶段。

 

·往后看:能不能让每个人用上便宜算力

未来一两年,中科曙光高端计算总工程师李建军觉得硬件会一直往好用方向迭代:“设计上会更多朝着推理负载去,优化KV-Cache卸载等,解决显存不够的麻烦。供电、散热也会不断进化。超节点现在已经是行业共识里的 AI 基础设施基本单元,大家都在围着它优化,以后肯定是越来越好用、越来越便宜。”

阿里云加速计算集群产品负责人陈祎更关注“普惠”这俩字:“超节点商用成不成,就看两点:每一度电能不能产出更多有价值的token,token成本能不能真降下来。算力就是AI时代的水电气——水电气最大的特点就是好拿、便宜、方便。我们就是想让超节点落地时,真真切切给每个token降本、给每个客户带来方便。”

信通院人工智能研究所副所长巫彤宁聊到中国超节点的家底,很有底气:“咱们应用场景多,国家一直在建东数西算,攒下大量网络调度和工程落地的经验,这些都是超节点往前冲的硬底气。”他最后总结:“超节点肯定是未来大模型训推的核心底座,前景光明。但技术一路演进,一定得把技术、标准、成本这三者的关系平衡好,普及率才能提上去,路才走得稳。”

 

策划:吴煜

作者:赵新艳

举报
相关视频
28'10''

国产芯片•硬核自研的攻坚力量丨【懂行•国产算力】第一集

芯片是AI和数字经济的底座,也是高端制造的命脉。在外部技术壁垒加剧、全球供应链重构的背景下,国产芯片已经告别概念阶段,进入真落地、能量产、建生态的新阶段。本期节目邀请到 “国产GPU四小龙” 中的沐曦股份和壁仞科技,以及中关村数智人工智能产业联盟的三位嘉宾,一起拆解国产GPU的突破与未来。

9 4051 昨天 13:38
00'28''

超节点•解锁人工智能的底层新基建丨【懂行•国产算力】第二集即将上线

算力产业当下的热词,莫过于“超节点”。什么是超节点?它的技术难点在哪里?落地应用发展到了哪一步?我们又该如何定义它对AI发展的核心价值与战略意义?完整节目即将上线,欢迎关注!

8 3524 09-28 17:21
00'26''

国产芯片•硬核自研的攻坚力量丨【懂行•国产算力】第一集即将上线

芯片是数字经济与人工智能的核心底座,更是高端制造的核心命脉。当前全球半导体供应链持续重构,外部技术壁垒加剧,国内芯片产业彻底告别概念阶段,进入技术落地、规模量产、生态完善的自主可控发展阶段。本期节目聚焦国产通用GPU与半导体产业发展,深度拆解国产芯片的突破与未来。完整节目即将上线,欢迎关注!

9 2997 09-28 12:29
10'23''

懂行丨从模型训练到终端落地 联想集团CFO首谈千亿美元AI蓝图

联想集团交出了一份“史上最好财年”成绩单:全年营收突破5000亿大关,达到5899亿元,净利润增速达42.1%,两倍于营收增速。AI收入同比暴涨105%,第四财季AI营收占比已攀升至38%。当全球巨头都在锚定AI,混合式AI战略能否支撑联想两年内跃升为千亿美元规模企业的雄心?在AI从“模型竞争”转向“系统竞争”的新赛道上,联想从液冷技术到混合式AI平台又布下了怎样一盘棋?第一财经独家专访联想集团首席财务官郑孝明,结合历史最佳财年的关键数据,拆解联想的千亿美元AI路线图。

3555 05-22 13:46
00'56''

懂行丨1000亿美元不是梦!联想CFO:因为对手做不到这件事

IDG(智能设备业务集团)份额世界第一仍在增长,ISG(基础设施方案业务集团)业务已跻身全球前三,手握全球180多个市场。这样的家底,能否撑起1000亿美元营收目标?第一财经专访联想集团首席财务官郑孝明,拆解联想从PC巨头到“AI原生公司”的坚定目标。

1726 05-22 13:44
一财最热
点击关闭