通过 Real2Sim2Real 拓展人形机器人的跑酷技能

LightParkour 以人形机器人跑酷为切入点,探索机器人如何学会涉及复杂接触的动作。我们先在物理仿真中修正简短的人类动作片段,让它们适应不同地形。随后通过蒸馏,将行走与全身运动技能整合到同一个深度视觉策略中,部署到机器人上。

图 01

同一策略,完成行走与跑酷。 Lightbot 0 的机载策略既能控制行走,也能完成涉及复杂接触的跑酷动作。

动作示范不仅要记录动作,还要记录障碍物。

跑酷集中体现了复杂接触动作的难点:机器人需要借助环境支撑身体。动作能否成功,不只取决于身体怎么动,还取决于接触的位置、承重的时机,以及地形变化后能否相应调整动作。

动作跟踪策略能复现丰富的全身运动,但往往只能在示范对应的场景中执行。通过奖励学习的行走策略能适应地形,却通常主要依靠双腿。单独使用其中任何一种方法,都难以让机器人根据障碍物的形状,找到合适的接触位置并借力支撑身体。

动作捕捉和普通视频记录了人怎么动,却很少完整保留让这些动作得以完成的场景信息。直接把人类动作映射到机器人上,可能导致手部悬空、肢体穿过障碍物,或整段轨迹超出机器人的执行能力。

为每种障碍物重新采集示范,能补上动作与场景的对应关系,但采集成本也会随技能、接触方式和地形种类线性增长。LightParkour 的做法是:每项技能只需还原一段简短的初始动作,再用仿真生成适应不同条件的动作。

在仿真中还原交互,让动作适应不同地形。

Real2Sim2Real 让一段初始动作发展为适应多种地形、可在真机上执行的技能。我们先在物理仿真中修正接触,再以成功执行的轨迹为基础,逐步拓展可应对的地形,最后通过蒸馏得到一个带记忆的深度视觉策略。

  1. 真实世界 还原动作与接触

    从原始片段中还原全身动作的时序,确定动作需要的接触位置。

  2. 仿真 让动作符合物理约束

    根据障碍物形状、接触力和执行器限制修正动作,再让动作适应不同障碍物。

  3. 真实世界 依靠感知在真机上执行

    深度视觉策略直接控制机器人,运行时不需要参考轨迹。

图 02

快速撑越。 从人类动作出发,经物理仿真修正后,由机载策略在真机上执行。

图 03

转身撑越。 从人类动作出发,经物理仿真修正后,由机载策略在真机上执行。

用物理仿真修正动作迁移中的偏差。

我们先把人类动作映射到机器人上,再根据动作中需要借力支撑的位置摆放障碍物。初始动作还不符合物理约束:手部可能陷入障碍物,膝盖可能穿过表面,动作也可能超出机器人的动力学能力。我们在完整物理仿真中训练动作跟踪策略,约束预期接触位置,并从随机参考帧开始练习,让关键阶段得到充分训练。这样既保留了原有的动作意图,也得到了机器人能够实际执行的轨迹。

图 04

逐步修正参考轨迹。 起初,动作与障碍物并不匹配;经过迭代,动作既能适应地形,也满足机器人的动力学约束。

每成功一次,就把障碍物再升高一点。

成功执行的轨迹已经满足仿真中的动力学和执行器约束,因此可以直接用作下一轮训练的参考轨迹。随后,我们将参考轨迹与障碍物一同抬高 5–10 cm,再次训练。如此迭代,最初攀上 45 cm 障碍物的动作就能逐步适应更高的障碍物,最高达到 75 cm,相当于这台 90 cm 高机器人身高的 83%。

45 cm 初始障碍物
45–75 cm 参考轨迹覆盖范围
0.83H 障碍物与身高之比

只有最初的动作与障碍物需要人工对齐。之后由物理仿真和逐步提高难度的课程学习,自动扩展参考轨迹。

将多种动作蒸馏为同一个策略。

初始动作告诉我们要完成怎样的交互,却不能直接用于真机。仿真将它扩展为一组可行的动作,由教师策略分别学习。教师可以使用精确的环境信息,这类训练时才可用的信息称为特权信息。我们先用多专家蒸馏整合这些能力,再将它们蒸馏到同一个带记忆的深度视觉策略中,供机器人直接运行。

图 05

LightParkour 完整训练流程。 生成与不同地形匹配的参考轨迹,通过多专家蒸馏整合技能,再仅用奖励信号训练技能切换。最后,将教师策略蒸馏为带记忆的深度视觉策略,以 50 Hz 在机器人上运行。

多专家蒸馏先将不同专家的技能整合到同一个策略中。随后,我们仅用奖励信号训练技能切换,让策略学会何时结束行走、开始全身动作,以及何时恢复行走。部署后,这些决定都由策略根据深度观测和速度指令做出,不需要指定技能标签,也不需要人工编写切换规则。

撑越时,机器人刚开始借助障碍物承重,胸前相机就可能看不到它了。为此,我们通过重建地形高度扫描来训练循环网络,让它记住近期观测到的地形,在遮挡时仍能利用这些信息。训练还模拟了相机噪声、丢帧、27–33 Hz 的帧率和 30–60 ms 的延迟。

能否部署,要通过四项检验。

我们从四个方面检验这些技能能否用于真机:动作是否满足物理约束,能否适应地形变化,能否衔接不同接触方式的动作,以及能否依靠机载感知执行。所有定量结果均来自仿真,真机视频则展示了无需实机微调的迁移效果。

任务微调与记忆,让策略应对更高的障碍物。

比较四种障碍物高度下的攀爬跨上成功率。每种设置均进行 500 次随机仿真测试。

90.0% 70 cm 高度 · 0.77H
  • LightParkour 完整版
  • 未做最终任务微调
  • 无记忆模块
  • 特权教师 · 高度扫描
特权教师 99.9%
LightParkour 完整版 99.2%
未做最终任务微调 88.4%
无记忆模块 54.0%

60 cm

0.66H

特权教师 99.2%
LightParkour 完整版 98.8%
未做最终任务微调 89.8%
无记忆模块 56.6%

65 cm

0.72H

特权教师 99.2%
LightParkour 完整版 90.0%
未做最终任务微调 76.4%
无记忆模块 34.2%

70 cm

0.77H

特权教师 98.6%
LightParkour 完整版 33.4%
未做最终任务微调 17.0%
无记忆模块 0.0%

75 cm

0.83H · 能力边界

图 06 从针对 45 cm 障碍物的初始动作出发,可以生成适应不同地形的参考轨迹,将高度范围扩展至 75 cm。但在 75 cm 高度下,部署策略的成功率降至 33.4%,使用精确地形高度扫描的教师策略则仍有 98.6%,表明在机载感知与控制条件下,策略的表现仍有差距。H 表示机器人 90 cm 的站立身高。

学会技能切换,才能连贯完成动作。

+65 个百分点
独立技能 无切换训练
33.0%
统一策略 有切换训练
98.0%
图 07 100 次随机测试中的端到端成功率。只有在正确切换技能后,继续完成相应动作,才计为一次成功。

切换训练连接了两种行为。

让同一个网络掌握多项技能,不代表它就能把这些技能连起来。经过切换训练,当地形要求机器人从行走转为跑酷时,网络的隐状态会相应地从行走区域出发,经过过渡区域,进入跑酷区域;没有这项训练,轨迹就停留在行走区域。下方交互图可以联动查看隐状态和对应的重建姿态。阅读这张图时,应关注轨迹随时间的变化和邻近点的关系,而不是用不同点簇之间的距离做定量比较。

图 08

策略记忆如何随技能切换而变化。 图中展示了技能切换时的 GRU 隐状态轨迹,三种颜色分别表示行走、过渡和跑酷。连线按执行顺序连接各状态,选中数据点即可查看对应的重建姿态。这张定性分析图与上方 100 次测试的切换成功率消融实验相互补充。

真机上只运行最终策略。

Lightbot 0 是我们自研的人形机器人,身高 90 cm,重 18.9 kg,拥有 21 个驱动关节。最终的带记忆策略以 50 Hz 在机器人上运行,根据胸前深度相机的图像、本体感知信息和速度指令控制动作,无需参考轨迹、技能标签、外部跟踪或机外状态估计。

1 可部署策略
50 Hz 机载控制
0 运行时参考轨迹

自主决定切换时机。

面对包含多种障碍物的路线,策略自行判断何时继续行走、何时改用全身动作,以及何时恢复行走。运行中无需指定技能标签,也不依赖人工编写的切换规则。

图 09

技能间切换。 两项全身动作直接衔接。

图 10

恢复行走。 完成全身动作后,直接按速度指令继续行走。

图 11

上下楼梯。 Lightbot 0 根据机载深度观测完成动作,使用的仍是控制全身技能的同一个策略。

障碍物之间的行走也由同一个策略完成。当可落脚的位置很少时,机器人迈步前,支撑面可能已经离开相机视野。策略需要利用循环网络记住的地形信息,确定每一步落在哪里。

从跑酷出发,让机器人自主应对复杂接触。

我们也开始将这套流程用于跑酷之外的任务,训练了一个独立的移动操作策略,让机器人边走边搬运物体。训练时用的是刚性箱子,这个策略也能搬运训练中未见过的柔性球体。这一初步结果表明,策略有望适应物体形状、质量和接触动力学的变化。

图 14

用箱子训练,也能搬球。 无需针对新物体重新训练。

跑酷是这套方法的起点。更长远的目标是:机器人观察一次涉及复杂接触的交互后,就能在仿真中改变几何和动力学条件反复练习,最终在真实世界中运用学到的技能。

研究资料

技术报告

视频

引用

查看 BibTeX
@article{chen2026light,
  title={Light-Loco-Parkour: Versatile Perceptive Whole-Body Locomotion via Multi-Skill Distillation},
  author={Chen, Hongming and Li, Zhuoran and Wang, Hongxi and Hu, Jiangpeng and Li, Ziliang and Liu, Peize and Zhao, QingRui and Liu, Xuhao and Pan, Liang and Lyu, Ximin and others},
  journal={arXiv preprint arXiv:2608.02653},
  year={2026}
}