LightParkour · 全身智能 ·
通过 Real2Sim2Real 拓展人形机器人的跑酷技能
LightParkour 以人形机器人跑酷为切入点,探索机器人如何学会涉及复杂接触的动作。我们先在物理仿真中修正简短的人类动作片段,让它们适应不同地形。随后通过蒸馏,将行走与全身运动技能整合到同一个深度视觉策略中,部署到机器人上。
同一策略,完成行走与跑酷。 Lightbot 0 的机载策略既能控制行走,也能完成涉及复杂接触的跑酷动作。
数据缺了什么
动作示范不仅要记录动作,还要记录障碍物。
跑酷集中体现了复杂接触动作的难点:机器人需要借助环境支撑身体。动作能否成功,不只取决于身体怎么动,还取决于接触的位置、承重的时机,以及地形变化后能否相应调整动作。
动作跟踪策略能复现丰富的全身运动,但往往只能在示范对应的场景中执行。通过奖励学习的行走策略能适应地形,却通常主要依靠双腿。单独使用其中任何一种方法,都难以让机器人根据障碍物的形状,找到合适的接触位置并借力支撑身体。
动作捕捉和普通视频记录了人怎么动,却很少完整保留让这些动作得以完成的场景信息。直接把人类动作映射到机器人上,可能导致手部悬空、肢体穿过障碍物,或整段轨迹超出机器人的执行能力。
为每种障碍物重新采集示范,能补上动作与场景的对应关系,但采集成本也会随技能、接触方式和地形种类线性增长。LightParkour 的做法是:每项技能只需还原一段简短的初始动作,再用仿真生成适应不同条件的动作。
Real2Sim2Real
在仿真中还原交互,让动作适应不同地形。
Real2Sim2Real 让一段初始动作发展为适应多种地形、可在真机上执行的技能。我们先在物理仿真中修正接触,再以成功执行的轨迹为基础,逐步拓展可应对的地形,最后通过蒸馏得到一个带记忆的深度视觉策略。
-
真实世界
还原动作与接触
从原始片段中还原全身动作的时序,确定动作需要的接触位置。
-
仿真
让动作符合物理约束
根据障碍物形状、接触力和执行器限制修正动作,再让动作适应不同障碍物。
-
真实世界
依靠感知在真机上执行
深度视觉策略直接控制机器人,运行时不需要参考轨迹。
快速撑越。 从人类动作出发,经物理仿真修正后,由机载策略在真机上执行。
转身撑越。 从人类动作出发,经物理仿真修正后,由机载策略在真机上执行。
用物理仿真修正动作迁移中的偏差。
我们先把人类动作映射到机器人上,再根据动作中需要借力支撑的位置摆放障碍物。初始动作还不符合物理约束:手部可能陷入障碍物,膝盖可能穿过表面,动作也可能超出机器人的动力学能力。我们在完整物理仿真中训练动作跟踪策略,约束预期接触位置,并从随机参考帧开始练习,让关键阶段得到充分训练。这样既保留了原有的动作意图,也得到了机器人能够实际执行的轨迹。
逐步修正参考轨迹。 起初,动作与障碍物并不匹配;经过迭代,动作既能适应地形,也满足机器人的动力学约束。
每成功一次,就把障碍物再升高一点。
成功执行的轨迹已经满足仿真中的动力学和执行器约束,因此可以直接用作下一轮训练的参考轨迹。随后,我们将参考轨迹与障碍物一同抬高 5–10 cm,再次训练。如此迭代,最初攀上 45 cm 障碍物的动作就能逐步适应更高的障碍物,最高达到 75 cm,相当于这台 90 cm 高机器人身高的 83%。
只有最初的动作与障碍物需要人工对齐。之后由物理仿真和逐步提高难度的课程学习,自动扩展参考轨迹。
将多种动作蒸馏为同一个策略。
初始动作告诉我们要完成怎样的交互,却不能直接用于真机。仿真将它扩展为一组可行的动作,由教师策略分别学习。教师可以使用精确的环境信息,这类训练时才可用的信息称为特权信息。我们先用多专家蒸馏整合这些能力,再将它们蒸馏到同一个带记忆的深度视觉策略中,供机器人直接运行。
LightParkour / 系统
完整的训练流程。
让一段动作适应多种地形。
分别训练行走和三项复杂接触技能,在完整物理仿真中跟踪参考轨迹。
将成功执行的轨迹用作下一轮参考轨迹,再把障碍物升高 5–10 cm。
统一技能,学会切换。
多专家 DAgger
行走和全身技能共享同一个动作空间。
将教师能力迁移到深度视觉策略。
深度图像 · 本体感知 · 控制指令
LightParkour 完整训练流程。 生成与不同地形匹配的参考轨迹,通过多专家蒸馏整合技能,再仅用奖励信号训练技能切换。最后,将教师策略蒸馏为带记忆的深度视觉策略,以 50 Hz 在机器人上运行。
多专家蒸馏先将不同专家的技能整合到同一个策略中。随后,我们仅用奖励信号训练技能切换,让策略学会何时结束行走、开始全身动作,以及何时恢复行走。部署后,这些决定都由策略根据深度观测和速度指令做出,不需要指定技能标签,也不需要人工编写切换规则。
撑越时,机器人刚开始借助障碍物承重,胸前相机就可能看不到它了。为此,我们通过重建地形高度扫描来训练循环网络,让它记住近期观测到的地形,在遮挡时仍能利用这些信息。训练还模拟了相机噪声、丢帧、27–33 Hz 的帧率和 30–60 ms 的延迟。
实验结果
能否部署,要通过四项检验。
我们从四个方面检验这些技能能否用于真机:动作是否满足物理约束,能否适应地形变化,能否衔接不同接触方式的动作,以及能否依靠机载感知执行。所有定量结果均来自仿真,真机视频则展示了无需实机微调的迁移效果。
能力范围 · 消融实验
任务微调与记忆,让策略应对更高的障碍物。
比较四种障碍物高度下的攀爬跨上成功率。每种设置均进行 500 次随机仿真测试。
- LightParkour 完整版
- 未做最终任务微调
- 无记忆模块
- 特权教师 · 高度扫描
60 cm
0.66H
65 cm
0.72H
70 cm
0.77H
75 cm
0.83H · 能力边界
自主技能组合 · 消融实验
学会技能切换,才能连贯完成动作。
技能如何切换 · 策略记忆
切换训练连接了两种行为。
让同一个网络掌握多项技能,不代表它就能把这些技能连起来。经过切换训练,当地形要求机器人从行走转为跑酷时,网络的隐状态会相应地从行走区域出发,经过过渡区域,进入跑酷区域;没有这项训练,轨迹就停留在行走区域。下方交互图可以联动查看隐状态和对应的重建姿态。阅读这张图时,应关注轨迹随时间的变化和邻近点的关系,而不是用不同点簇之间的距离做定量比较。
策略记忆如何随技能切换而变化。 图中展示了技能切换时的 GRU 隐状态轨迹,三种颜色分别表示行走、过渡和跑酷。连线按执行顺序连接各状态,选中数据点即可查看对应的重建姿态。这张定性分析图与上方 100 次测试的切换成功率消融实验相互补充。
仿真 → 真实
真机上只运行最终策略。
Lightbot 0 是我们自研的人形机器人,身高 90 cm,重 18.9 kg,拥有 21 个驱动关节。最终的带记忆策略以 50 Hz 在机器人上运行,根据胸前深度相机的图像、本体感知信息和速度指令控制动作,无需参考轨迹、技能标签、外部跟踪或机外状态估计。
自主切换
自主决定切换时机。
面对包含多种障碍物的路线,策略自行判断何时继续行走、何时改用全身动作,以及何时恢复行走。运行中无需指定技能标签,也不依赖人工编写的切换规则。
技能间切换。 两项全身动作直接衔接。
恢复行走。 完成全身动作后,直接按速度指令继续行走。
上下楼梯。 Lightbot 0 根据机载深度观测完成动作,使用的仍是控制全身技能的同一个策略。
障碍物之间的行走也由同一个策略完成。当可落脚的位置很少时,机器人迈步前,支撑面可能已经离开相机视野。策略需要利用循环网络记住的地形信息,确定每一步落在哪里。
狭窄木板桥。 在宽度受限的支撑面上精确落脚。
踏石。 即使只能看到部分环境,也能根据机载深度观测选择落脚点。
不止于跑酷
从跑酷出发,让机器人自主应对复杂接触。
我们也开始将这套流程用于跑酷之外的任务,训练了一个独立的移动操作策略,让机器人边走边搬运物体。训练时用的是刚性箱子,这个策略也能搬运训练中未见过的柔性球体。这一初步结果表明,策略有望适应物体形状、质量和接触动力学的变化。
用箱子训练,也能搬球。 无需针对新物体重新训练。
跑酷是这套方法的起点。更长远的目标是:机器人观察一次涉及复杂接触的交互后,就能在仿真中改变几何和动力学条件反复练习,最终在真实世界中运用学到的技能。
进一步阅读
研究资料
查看 BibTeX
@article{chen2026light,
title={Light-Loco-Parkour: Versatile Perceptive Whole-Body Locomotion via Multi-Skill Distillation},
author={Chen, Hongming and Li, Zhuoran and Wang, Hongxi and Hu, Jiangpeng and Li, Ziliang and Liu, Peize and Zhao, QingRui and Liu, Xuhao and Pan, Liang and Lyu, Ximin and others},
journal={arXiv preprint arXiv:2608.02653},
year={2026}
}