首页 > 新闻 > 大政

分享到微信

打开微信,点击底部的“发现”,
使用“扫一扫”即可将网页分享至朋友圈。

重磅|对话强化学习之父萨顿:关于AI下一步突破方向,他说了这些干货

第一财经 2026-07-19 22:17:20 听新闻

作者:金叶子    责编:胥会云

年轻人最具价值的自我投资,是坚持基于第一性原理进行独立思考。

大语言模型与基座模型的爆发,正将全球人工智能产业推向技术路径分化与商业化落地底层逻辑重构的十字路口。

在19日下午的2026WAIC现场,2024年图灵奖得主、“强化学习之父”理查德·萨顿(Richard Sutton)接受了第一财经在内的媒体采访。在近40分钟的访谈中,他围绕为何选择此时创业、未来AI将如何发展、具身智能的前景作出了解答,并给年轻一代的科研工作者提出自己的建议。以下为第一财经整理的采访实录:

关于创业

Q:您为什么选择在这个特定时刻创办一家新公司?

萨顿:Oak Lab 是一家营利性公司,但我认为它与我在Openmind Research Institute的非营利活动是互补的。我此前曾参与过另一家深耕核心技术的营利性公司并工作了三年,那段积极的经历让我意识到,成立一个独立的组织能让我们在研究方向上更加专注。我非常欣慰能将精力同时投入到营利与非营利两项事业中。

尽管两者的运作模式不同,但核心愿景高度一致,即“理解智能是如何运作的,然后与世界分享”。坚持向全球开源,在于我相信知识的传播范围与技术普惠的效果呈正相关。此外,提升前沿知识的透明度,能有效降低技术被滥用的潜在风险。因此,像Openmind这样的机构在分享与传播信息方面扮演着不可或缺的角色。

然而,前沿研究需要庞大的资源支撑,这正是营利性公司的价值所在。两者的引入与互补至关重要。必须承认,某些核心技术信息需要作为专利进行短期保护。虽然长期来看没有任何技术秘密可以永远封锁,但在短期内,将有价值的创新构想进行商业化变现,是持续反哺科研投入的必然路径。

金叶子/摄

告别“人类数据”,走向“经验时代”

Q:您曾说过,您的长期目标是建立一个仅用约20瓦功率就能进行实时学习和规划的万亿参数模型。实现这种高效水平的核心思路是什么?

萨顿:实现极高的计算效率或许并无单一路径,但我确信,目前大语言模型和基座模型在能源与计算资源的利用上存在显著的低效问题。

人类大脑仅需约60瓦的功率即可处理极其复杂的任务,这证明数字计算存在巨大的优化空间。相比之下,传统的数字计算受制于冯·诺依曼架构,数据在存储与处理器之间频繁迁移,导致能效极低。如果转而采用并行架构,让数据留存在原处,避免其在CPU之间来回传输,就能带来极其巨大的功耗效率飞跃。

简而言之,我们正致力于构建一种更趋向生物学的类脑计算策略,其核心在于更彻底的分布式与并行化。基于此,我们对未来智能体行为的愿景是:它们不再依赖于大量可复现的数据进行学习,而是能在有限样本的简短场景中,通过自主塑造来动态调整自身行为。

Q:当您回顾这8年时,您如何评价AI技术的进步?您现在的感受是怎样的?

萨顿:审视过去八年的产业轨迹,我对此感到一定程度的失望。这一时期见证了行业过度聚焦于“人类数据”的浪潮。

事实上,在此前的AlphaGo 和 AlphaZero 时代,行业已经证实了通过模拟经验进行自学习的巨大潜力。然而在过去这个周期中,整个行业被卷入了依赖人类数据的红利期,从而忽视了从经验中学习这一本质路径。这一路径的偏离令人遗憾。所幸的是,行业正迎来新的拐点——智能体的引入,让我们得以重新探索这一技术路线。

Q:您对未来十年的预测是什么?

萨顿:我相信“从经验中学习”的路径正逐步获得行业共识,并在未来的技术权重中占据主导地位。去年已有数家专注于经验学习的头部企业相继成立,包括杨立昆(Yann LeCun)的公司以及Openmind本身。

目前,我正为这家专注于经验学习的公司(Oak Lab)募集资金,进展相当顺利。尽管相关合作尚未最终敲定,但资本与产业界对“经验学习”的渴求已显露无遗。在大语言模型和基座模型爆发之后,市场正急切寻找下一步的突破方向。

作为一个纯粹的科学家,我坚信行业正加速迈向“经验时代”。如果将时间线拉长至八年,我相信这一路径在业界的认可度,将不亚于如今的大语言模型。

如何看待具身智能的社会刚需

Q:您参与的“机器人幼儿园”项目主要聚焦哪些?

萨顿:这是Openmind与他山科技在北京的一个合作项目。该项目旨在构建一个专属的机器人实验空间。

这是为了解决传统机器人因不耐受试错而容易损坏的痛点。传统机器人设计的初衷是精准执行既定指令,而非探索未知的实验,这导致其演示往往缺乏长效性。我们研发的核心在于打造能够承受长期、高强度物理试错的机器人体系,探索周期将从数天延伸至数月。这类似于人类幼儿耗费数年时间去攻克行走和物体抓取等底层技能。一旦机器人能够全面通过强化学习与试错积累经验,机器人产业必将迎来颠覆性的变革。

Q:您形容像婴儿爬来爬去检查玩具这样的行为,是在做一些任何AI都做不到的事情。我们为何没能成功构建出这样的能力?

萨顿:婴儿展现出了一种基于自身认知水平来驱动下一步决策的自适应机制。它在自主拆解并尝试解决一系列底层的子问题。在这个过程中,它们会动态评估自身的边际学习效应。一旦发现某项事物无法再提供新的认知输入(即产生“枯燥感”),便会主动切换至下一个未解问题。

这种机制确保了其持续学习效率的最大化。我的核心主张是“学习带来正向反馈”。如果能赋予智能体衡量自身学习进展的能力,并将其转化为内部的隐性奖励机制,那将是极具变革性的架构设计。这也契合了中国古人“学而时习之,不亦乐乎”的认知哲学。

Q:未来机器人或人工智能会解决老年人照顾和教师短缺的问题吗?

萨顿:尽管无法给出具有绝对权威性的断言,但我确信这已纳入业界的战略蓝图。机器人在养老护理等高劳动力需求的领域中将发挥关键作用。尤其是在未来可能面临劳动力红利消退的背景下,人工智能填补劳动力缺口将成为必然趋势。

“机器人幼儿园”的愿景在于构建一种新型的社会化共生关系:将机器人视为具备成长潜能的个体,通过悉心培育促使其心智成熟,最终引导其融入并服务于人类社会。

建议年轻人专注自己

Q:您会对中国的年轻研究人员提出什么建议?另外,对于那些不是AI研究人员、但未来深受AI影响的年轻人,您又会给出什么建议?

萨顿:过去几十年间计算力的指数级增长(每18个月翻一番)已经重塑了所有行业,熟练驾驭计算资源已成为各行各业的基准能力。

然而必须强调的是,“智能”与“计算”在底层逻辑上应当被明确区分。计算红利属于工程延展,而通用智能的降临则是升维颠覆。目前产业界预估这一技术奇点到来的中位数年份为2040年(距离现在还有14年),但其上下波动的技术不确定性依然极大(可能提前10年或推迟20年)。

在“变动越多,本质越是不变”的周期律面前,年轻人最具价值的自我投资,是构建并逐步拓展一个自己能够深度解构的认知壁垒,坚持基于第一性原理进行独立思考。

作为年轻人,不应盲从权威,坚持用可量化的方式进行自主验证,拒绝接受被直接灌输的现成答案。科学界没有绝对的权威——即便是以所谓的“权威身份”发声,我也必须重申这一点。每个人都是自身认知结论的最终责任人,必须具备独立评估的批判性思维。

此外,一个行之有效的具体方法是保持日常写作——例如每天撰写一页笔记,系统性地梳理、质疑并重塑自己的思维。这需要高强度的思维自律与时间沉淀,通常需要坚持一年以上才能显现复利效应。如果希望你的观点赢得别人的尊重,前提是你要对自己的思考付出足够的诚意,将其落于笔端,并在文字提炼中优化逻辑表达。

举报
第一财经广告合作,请点击这里
此内容为第一财经原创,著作权归第一财经所有。未经第一财经书面授权,不得以任何方式加以使用,包括转载、摘编、复制或建立镜像。第一财经保留追究侵权者法律责任的权利。
如需获得授权请联系第一财经版权部:banquan@yicai.com

文章作者

一财最热
点击关闭