动态2026 年 7 月

对话姜旭:通用机器人的答案,藏在 100 亿小时互联网视频里

模型公司为什么在此刻集体涌向具身智能?困住整个行业的「数据稀缺」,究竟该怎么破?姜旭认为,具身智能不过是多模态大模型的延伸,而通用机器人的数据金矿,藏在互联网的 100 亿小时视频里。

WAIC 2026 现场

在范式突破的过程中,它是充满反共识的。所以在你真的把大模型训练出来之前,大多数人是不会相信的。

—— 姜旭

2026 世界人工智能大会(WAIC 2026)期间,在上海国投先导主办的「解码世界·创新发展论坛」上,ChatGPT 核心贡献者姜旭分享了他对具身智能的判断。

从 2019 年加入 OpenAI、参与 RLHF 等核心算法的研发,到 2023 年离开、回国创立亮源新创,姜旭这次把话题落在两个问题上:模型公司为什么在此刻集体涌向具身智能?以及,困住整个行业的「数据稀缺」,究竟该怎么破?

以下为现场对谈实录整理,全文约 2400 字,读完约 6 分钟。

核心观点
  • 具身智能,其实不过是多模态大模型的延伸——在文本、语音、视频、图像的基础上,再增加一个「运动控制」模块。
  • 在范式突破的过程中,它是充满反共识的,充满了意外和意想不到的。
  • 训练强人工智能背后的算法其实很简单:规模化地做一次模仿学习(预训练),再规模化地做一次强化学习。
  • 唯一有可能实现通用机器人的数据源,是全互联网的视频,它有 100 亿小时,比数据采集能拿到的多了 1 万倍。

我们看到国内外一些头部公司,都明确表示近期要进入具身智能这个行业。在您看来,这些模型公司看到了什么样的趋势和信号,让他们现在开始布局这个方向?

我先分享一下我自己的经历。我比较有幸在 2019 年加入了 OpenAI,2023 年离开。这四年里,我参与了一系列核心模型和算法的研发。23 年我离开 OpenAI,一个很重要的原因,是我看到大模型在那个时间点已经进入了一个「强共识」的状态。大语言模型以及相关技术在多模态领域接下来几年会怎么发展,在我看来已经比较显然了——比如过去几年出现的 reasoning 推理模型这个新范式,也没有特别超出我的预期。但在那个时间点,还很少有人关注具身智能。很显然,具身智能、或者说通用机器人,如果能够实现突破,它的影响力肯定不会比 ChatGPT 小。

我们的经济,一半在数字世界,另一半在物理世界。

我相信这一点,所有大公司也都能看到、也都深刻认同。

不过,这只能说明这件事的必要性。另一个非常重要的方面是它的可能性——到底如何实现具身智能。23 到 24 年,我差不多花了小半年时间去思考和研究具身智能这个方向,最终得出一个非常严谨的结论:具身智能其实不过是多模态大模型的延伸。在原有的多模态(文本、语音、视频、图像等)基础上,再增加一个「运动控制」模块。

一旦认识到这一点,你就会意识到:解决这些问题所需要的底层方法论、宏观框架和范式,事实上在过去几年都已经研究得非常透彻了。剩下的问题,就是如何把这些范式正确地提升能力,并通过类似大模型 scaling 的、可规模化的方式来解决它。

具身智能到现在也火了两三年,已经有了非常多的进展。在我看来,接下来它要往哪个方向发展,也相对比较明确了。我相信那些头部公司也有类似的发现和观察——所以一方面看到了巨大的机会和市场,另一方面也看到了这件事情的可能性。

今天具身智能有个很难的问题,就是数据的匮乏。您觉得有什么办法来解决?在数据这一块,您现在有什么样的观察和对策?

非常好的问题。今天具身智能领域大家遇到的最大困惑、最大的挑战,就是数据稀缺。

大家通常会说,对大语言模型来说这件事比较显然:把全部文本数据拿来做预训练,再做强化学习,然后在模型基础上做一个很简单的用户界面,就是 ChatGPT——说起来好像水到渠成、非常简单。但我觉得,很多创新和发现,永远是你回头看的时候,才好像一路走来一目了然、顺其自然。

我从 2019 年加入 OpenAI 的这四年,恰恰是 OpenAI 一个接一个实现范式突破的过程。我可以跟大家分享的是:在范式突破的过程中,它是充满了反共识的,充满了意外和意想不到的。

比如当年 OpenAI 做预训练——在全互联网文本数据上训练一个模型——在当时就是一个极大的反常识。2019 年 10 月我刚加入时,Scaling Laws(缩放定律)实际上已经被发现,但还没发表。我花了两周时间去理解和消化这篇当时还是草稿的文章,读完之后大受震撼,那时我就很确信自己赶上了一次技术革命。但即便把这个结论放在你一个人面前,也不是每个人都会认可它——在你真的把大模型训练出来之前,大多数人是不会相信的。所以 Scaling Laws 虽然在 20 年初就发表了,却并没有引起那么广泛的关注。

再比如 GPT-3,20 年三四月份训练完成、发表出来。大家知道,GPT-3 已经在传统 NLP 的所有榜单上饱和了,它用一个通用方法,就能做到比所有传统专用 NLP 方法效果都好。但 NLP 圈里仍然大部分人不相信,直到 GPT-3.5 出来,才真正说服了所有人。

而这还仅仅是预训练。在「对齐」这个环节上,我主要推动的一个工作是 RLHF。对齐、强化学习这件事,早期在语言模型上做的时候,仍然非常有争议。今天我们在机器人上做强化学习,有人会说「强化学习是用在语言模型上的」;但很有意思的是,我们差不多在 21 年在语言模型上做强化学习时,这件事也同样非常有争议——当时大家会说「强化学习是用在机器人、用在打游戏上的」。最终它被证明是走得通的,并且在一个预训练模型的基础上带来了巨大的提升。这是训练 ChatGPT、或训练任何强人工智能都必须经历的一步。

事实上,训练强人工智能背后的算法也很简单:你要规模化地做一次模仿学习(也就是预训练),再规模化地做一次强化学习。在大语言模型上是 RLHF,在 code 模型上是 RLVR。

到 ChatGPT 发布的时候——事实上,ChatGPT 这个项目在 OpenAI 内部并不是那么受重视。所以它后面爆火,对当时还在 OpenAI 的人来说,其实蛮出乎意料的。现在回头看,一项颠覆式的技术和创新,在它发展的过程中,一定会经历非常多的阻力。我觉得今天的机器人应该也是类似的。

回到您刚才的问题:在我看来,要实现强人工智能,第一步要回答的问题,就是如何实现一个规模化的预训练。过去几年,很多不同的团队和公司提出了不一样的路径——有遥操作采集的数据、有录屏、有第一人称视角视频等等。但经过几年发展,现状是它仍然没有突破。核心原因在我看来是:所有通过数采的方式,都无法形成规模化。

而我们亮源押注的方向,是用全互联网的视频数据。我认为这是唯一有可能实现通用机器人的数据源。

互联网视频约有 100 亿小时,而数据采集能拿到的大约是 100 万小时——中间差了 1 万倍。

而且可以问一个非常简单的问题:你能想到的人、在任何场景下做的任何工作,在互联网视频里都可以搜索到;但这件事,对采集数据是不成立的。所以从数据量和数据多样性的角度看,只有一个可能,就是互联网数据。

而今天核心的问题,就是如何把这么一个巨大的金矿挖掘出来,把其中最有用的信息提炼出来,完成训练。