首页 > 新闻 > 科技

分享到微信

打开微信,点击底部的“发现”,
使用“扫一扫”即可将网页分享至朋友圈。

怎么让AI真正“下地干活”?中国厂商加速探索世界模型

第一财经 2026-07-21 21:26:36 听新闻

作者:陈杨园    责编:李娜

围绕世界模型的探索方向正呈现出多元化趋势。

物理AI何时会迎来ChatGPT 时刻?刚刚过去的2026WAIC上,世界模型备受关注。

“2026年是‘世界模型元年’。”昆仑万维董事长兼CEO方汉在大会期间抛出了这样的论断。他认为,2026年AI的核心命题将转向“理解”与“交互”,让AI真正理解物理世界的运行规律,并能与真实环境进行闭环互动。

世界模型被视为让AI理解世界、能在物理世界自主行动的关键技术底座之一,大会上,昆仑万维发布Matrix-Game 3.5世界模型,蚂蚁灵波推出具身原生世界动作模型LingBot-VA 2.0,智元、大晓机器人、极佳视界、它石智航、戴盟机器人等均展出了自家的世界模型方案,许多厂商将世界模型作为下一阶段AI竞争重点。尽管世界模型仍处于产业探索期,但在具身智能落地的浪潮中,世界模型正站上舞台中央。

世界模型很“热”

从本届WAIC观察,中国企业的世界模型研发明显加速。

昆仑万维发布了Matrix-Game 3.5世界模型,聚焦可交互世界模型技术,创新实现Patch级(将图像或视频帧切割为‌带空间坐标的微小局部块)记忆注入,实现长期一致性的空间记忆。模型构建了自动化数据生产管线,覆盖1200余个游戏场景,为训练提供更多样本,并宣布核心架构开源。

蚂蚁灵波则推出具身原生世界动作模型 LingBot-VA 2.0,做出具身智能发展的新路线选择:让机器人“大脑”不再依托数字世界模型能力的“嫁接”,而是从动态建模、因果预测、实时执行等与环境交互的原始需求出发,进行原生设计。

此外,极佳视界首次展示“通用世界模型”全系列产品,覆盖从生成到行动,从本体到场景;​智元展出世界模型GE-2,让机器人不仅能够模拟环境,还能够通过环境变化不断学习,为机器人迭代提供闭环环境;大晓机器人发布开悟世界模型 3.1,走向融合生成智能、物理智能与认知智能的行动一体化世界模型。

与此同时,在解决如何渲染世界和模拟世界方面,3D生成企业也在加速入局。影眸科技的世界生成模型Hyper3D WorldGen也在WAIC首次亮相,意味着3D生成开始从单体迈向“场景级”,更多3D物品开始可被用于仿真训练,实现了从真实影像到可训练场景的端到端转化。

世界模型的“篮子”很大,各家技术路线并不相同,在产业链中的位置也有差异。尽管“世界模型元年”来到,行业有许多共识尚未形成。但从本届大会来看,不同公司开始押注不同的技术路径或解决方案。

方汉的判断是:先Scaling(缩放定律,模型能力随数据量、算力、参数量增加而提升),技术会走向收敛。在他看来,世界模型所有路径最后一定会收敛,就像自动驾驶曾经历过多技术路线角逐,最终收敛到端到端模型一样,但收敛需要时间,至少要做到1000万小时数据,模型能力才有可能出现质变拐点,多的话可能需要1亿小时。昆仑万维的方向之一是利用异构数据来降低数据成本,方汉看好异构数据作为世界模型或具身模型预训练的主要数据来源,实现“Scaling才是王道。”

它石智航创始人兼CEO陈亦伦则表示,当前世界模型最大的挑战,并非生成“看起来真实”的世界,而是真正理解物理世界的运行规律。“仅依靠视频数据,无法学习完整的世界规律。”视觉能够提供几何和语义信息,却无法直接获得力、接触等关键物理信息。对于需要操作和交互的机器人而言,触觉、力觉等多模态数据不可或缺。

总体来看,围绕世界模型的探索方向正呈现出多元化趋势。

世界模型的下一站

方汉认为,游戏行业将率先被世界模型改变。随着世界模型的发展,开放世界游戏将不再依赖数百人团队数年的手工搭建,可让虚拟世界随玩家行动实时生长、持续演化。未来三到五年,世界模型将成为游戏行业的基础设施,彻底刷新内容生产方式,而国产模型已在这一赛道领跑全球。

而在被认为是世界模型更长期、更具想象空间的应用方向——具身智能领域,行业仍在加速进化。

陈亦伦强调,世界模型的发展最终取决于高质量真实数据的持续积累。这类数据不仅需要包含完整模态,还需要同时记录机器人动作与环境状态的持续变化,本质上是真实世界中“干活的数据”。

而世界模型的技术收敛会按什么样的时间点到来?“谁先造出1000万小时的数据是关键”,方汉表示,目前行业模型训练普遍在10万小时数据量级,昆仑万维这次的发布花了20多万小时数据。谁会先实现就要看:谁先到达100万小时?500万小时?1000万小时?以及,到了1000万小时能不能出现拐点?

“中国是所有数据采集设备的硬件产地,也就是说,世界模型的数据生产方面,中国在数据采集工具包括家政等服务场景上都有优势,我认为数据最大的产能地是中国。”方汉认为,在世界模型引领具身智能认识世界方面,中国厂商存在着优势。他预测,今年底有厂商能到百万小时,明年底可能有厂商到千万小时,亿小时级别则需要至少3到5年。

机器人进入物理世界、加速“能干活”的趋势中,AI进入物理世界必然要解决理解世界、知道如何行动的问题,世界模型也因此被认为可能成为具身智能重要基础能力,但一个现实是,在模型路线上,物理 AI 的终局是端到端 VLA(视觉语言动作模型)、世界模型、世界动作模型、还是更复杂的 Agent 系统,行业仍存在争议,许多厂商押注也在押注多个路线。

伴随着世界模型的热潮,具身智能“ChatGPT 时刻”的到来还需要多久?WAIC上,多位行业人士对这个时间作出预判,预判时间从两年到五年不等。但行业形成的一个共识是:物理 AI 的智能涌现不会来自单一模型、单一数据源或单一路线,而取决于数据规模、模型架构、仿真评测、真机反馈、部署场景与硬件系统共同构成的持续进化飞轮。


举报
第一财经广告合作,请点击这里
此内容为第一财经原创,著作权归第一财经所有。未经第一财经书面授权,不得以任何方式加以使用,包括转载、摘编、复制或建立镜像。第一财经保留追究侵权者法律责任的权利。
如需获得授权请联系第一财经版权部:banquan@yicai.com

文章作者

一财最热
点击关闭