LightNav-0

以规模化 Real2Sim2Real 实现零样本通用导航

LightNav-0 是我们的首个通用导航大脑,展现了跨机器人本体、任务与场景的零样本泛化能力。

要让具身基础模型在不同机器人本体任务场景间实现零样本泛化,需要用大规模真实世界经验进行后训练(或对齐)。遥操作是采集这类经验的主要方式之一,但要达到零样本泛化所需的规模和多样性,仍然很困难。

我们构建了 Real2Sim2Real 数据引擎,在仿真中大规模合成训练经验,替代成本高昂的真实交互采集。引擎将从互联网搜集的 2,000+ 个真实场景转化为可反复使用的仿真环境,生成 4,000+ 小时多样化的视觉—语言—动作经验,用于导航后训练。

我们用这些数据完成三个阶段的训练:具身推理(ER)中期训练、具身监督微调(SFT)和在线强化学习(RL)。由此得到的通用导航模型 LightNav-0,在涵盖指令跟随、物体目标导航和具身视觉跟踪的 10 项仿真评测中达到领先水平,并能零样本迁移至人形、四足、飞行和轮式机器人。

在 Light Origins,我们认为,通往物理世界通用人工智能(Physical AGI)的路径包括规模化预训练、规模化对齐和规模化部署。LightNav-0 是我们以 Real2Sim2Real 探索规模化对齐的第一步。它的结果表明,规模化对齐是实现物理世界零样本泛化的关键。

01 · 解决具身后训练的冷启动问题

从真实场景中规模化生成交互经验。

具身后训练首先面临数据生产的难题。真机经验需要机器人在具体环境中一次次尝试才能积累,而泛化要求经验覆盖丰富的本体、场景和任务组合。仅靠真实世界采集,不仅成本高,速度也难以满足模型训练快速迭代的需要。

Scalable Alignment(规模化对齐)从互联网上搜集的 2,000+ 个真实场景出发。数据引擎将不同格式的场景接入统一仿真接口,让同一个场景可以用于生成多种目标、路线、视角和指令表达。生成交互数据时,相机参数也随之变化,使训练数据覆盖不同的视场角、安装高度和机器人本体。

每次仿真交互都形成一组相互对应的数据:模型看到的画面、指令所指的目标、需要关注的位置,以及应当执行的动作。让大量场景真正用于后训练的关键,是这些信息彼此对齐,而不只是渲染数量的增加。目前,引擎已生成 4,000+ 小时视觉—语言—动作经验。随后,真机部署帮助我们发现下一轮还需补充哪些场景、任务和交互。

图 01 在真实场景的仿真环境中生成导航经验。 仿真导航片段 · 第一视角 RGB · 8 fps
02 · 后训练方案

后训练的三个阶段。

具身基础模型的后训练逐渐形成了常见的三阶段流程:领域中期训练、监督微调和强化学习。三个阶段依次推进:中期训练打好表征基础,SFT 学习如何行动,RL 再根据模型实际采取的行动及其结果改进策略。LightNav-0 将这一流程用于导航,依次进行 ER 中期训练具身 SFT在线 RL

02A · 第一阶段——为动作学习建立空间理解

先理解空间,再学习行动。

导航轨迹数据的采集成本很高,因为每条轨迹都需要与场景、指令和动作序列对齐。不过,行动前所需的许多能力,例如在图像中定位语言描述的目标、识别可通行空间、理解空间关系和追踪变化,都可以从更大规模的图像与视频中学习。第一阶段通过中期训练建立这些空间先验,第二阶段再用轨迹数据把它们转化为动作。

Gemini Robotics1 以 Gemini Robotics-ER 为基础;MolmoAct22 则使用 MolmoER 作为视觉语言模型骨干。这两个例子都以具身推理为动作学习打下基础。LightNav-ER 在 LightNav-0 中也承担这一作用,为第二阶段提供具备空间理解能力的初始模型。在动作学习之前,它已在我们报告的八项具身推理基准评测3中取得四项第一、四项第二,八项得分的平均值为 67.4。

能力类别训练采样
图像点定位
35.14%
单图视觉问答
25.05%
通用视觉与抽象推理
20.00%
视频推理
19.81%
第一阶段 · ER 中期训练36 个数据源

35.14%点定位是占比最高的
专项训练数据

图 02 第一阶段训练数据构成。 点定位数据占 35.14%,视觉、抽象和时序推理数据合计占 64.86%。
LIGHTNAV-ER MOLMOER QWEN3-VL 初始化
Point-BenchRefSpatialRoboSpatial-POIRoboSpatial-VQAWhere2PlaceCV-BenchERQAEmbSpatial 64.557.456.571.976.688.443.879.8

67.4 平均分

4 第一

4 第二

+4.3 较初始模型的提升

图 03 第一阶段在动作训练前强化空间推理。 LightNav-ER 平均得分为 67.4,四项基准评测排名第一,另四项排名第二。

定位图像中的实体

文字中的目标与图像中的定位点一一对应。

02B · 第二阶段——构建具身 SFT 数据

从场景中生成视觉、语言与动作对齐的经验。

第一阶段让模型学会理解空间,第二阶段则要让它据此行动。仅靠真机采集,很难覆盖后训练所需的场景、目标、路线和视角组合。Real2Sim2Real 让一个已经采集的场景可以反复使用,从中生成大量可执行的交互,持续扩充训练数据。

01 · 目标标注MOLMO2
标牌 横幅 花卉 窗户 拱廊 店面 推车 遮阳篷 雕像 木箱 雕塑 拱窗 立柱 开放集点定位 场景 1 / 2,000+ 开放词汇提示 雕像 · 物体实例 目标库 雕像 拱门 标牌 木箱 窗户 ≥2 个视角 / 实例 位置离散度 < 0.6 米 三维目标库 RGB + 度量深度 · 4 个朝向 ≥2 个视角 → 1 个实例 多视角三维合并

Molmo2 标注开放集目标。

无论场景来自哪里,引擎都利用带有实际尺度的深度信息,将图像中的点还原为三维位置,汇入统一目标库。

图像点深度反投影三维合并
02 · 导航片段合成自动生成
1 · 采样目标 2 · 可见起点 3 · 导航网格规划 × 一个场景,多条路线 确定停止位置 一个场景 → 多个导航片段 前进前进前进停止 ✓4 · 第一视角视频 + 动作标注

仿真器生成可执行的导航片段。

引擎批量采样目标与起点,规划路线、确定停止位置,并渲染第一视角视频。

目标起点路线仿真交互
03 · 指令标注VLM
模板 · 目标方位 方位 → 扇区 → 指令 “Turn {sector} and go to the {target} and stop.” “Turn left and go to the red sign and stop.” 视频 VLM · SEED2.0 关键帧 → 路线摘要 → 指令 “Go past the arcade, turn left,and stop at the red sign.” LLM 改写 + 语义检查 “Take a left across the plaza and pull up at the red sign。” 规则或 VLM 初稿 · 保持目标与方向 视觉到达验证 终点画面 · 停止位姿 存疑 → 复核

VLM 生成并验证导航指令。

先由模板或视频 VLM 生成指令初稿,再进行语义检查与改写,最后用终点画面验证。

初稿重写验证
对齐训练样本指令 · 历史 RGB 画面 · 目标点 · 可通行点 · 动作轨迹

一次仿真交互一组相互对应的多模态数据

图 04 自动生成数据并完成指令标注。 所有已采集的场景都通过同一流程,依次生成目标、轨迹、视频和指令。

场景素材还不能直接用于监督训练。引擎先识别可到达的目标,生成可执行路线,从不同第一视角渲染视频,再根据完整交互过程生成指令。先有路线、再有指令,可以确保语言描述对应的是场景中能够实际执行的行为。

经过对齐检查和数据配比检查,每段导航过程都形成一组同步数据,包含指令、历史画面、图像空间点和动作。第二阶段扩充的正是这样的训练记录。它们提供了对齐的具身经验,而不仅是场景或视频。

从互联网搜集的场景素材通常没有现成的导航目标。对于未标注的高斯泼溅(Gaussian Splatting)场景,Molmo24 先在渲染图像中标出候选物体。引擎再将这些点还原为三维位置,保留多视角观测一致的目标。已有三维包围框标注的场景可以直接接入。确定目标后,引擎规划路线、渲染视频,再由 Seed2.05 描述这段行程。路线在指令生成前就已确定,确保文字对应的是场景中可以实际执行的路径。

真实场景 → 目标库

不同重建格式采用各自适用的标注方式,最终转换为统一的目标表示。

无标注 · HABITATGS 通过多视角识别目标。
  1. 在可通行区域采样视点。
  2. 朝四个方向渲染 RGB 图像与带有实际尺度的深度图。
  3. 用 Molmo2 定位开放词汇目标。
  4. 将图像点还原为三维位置,并合并多视角结果。
有标注 · INTERIORGS 导入官方三维包围框。

已有三维包围框标注的场景无需重新检测物体,可直接转换为统一的目标表示。

统一目标库 统一的空间目标分布。

将目标的三维位置投影到当前视图,得到目标点;在可通行空间中选取可通行点。

2+ 支持该目标的观测 2+ 不同视点 < 0.6 m 三维定位离散度
预标注依靠多视角一致性检查。 仅在单个视角中出现的检测结果,以及三维位置不稳定的匹配结果,都会在路线生成前剔除。

目标通过筛选后,引擎依据场景几何规划路线,再渲染沿途视频作为观测历史。相比之下,语言描述更容易出错,因此引擎采用两种指令生成方式,并进行两轮验证,确保视频、动作与指令彼此对应。

目标库 → 验证后的导航片段

先生成动作轨迹,再配上语言指令;指令必须与既定目标和路线一致。

01采样目标从筛选后的目标库中选取
02采样起点确保停止位置能看到目标
03规划并确定终点在导航网格上生成路线
04渲染第一视角 RGB + 动作标注
几何路径目标像素 + 相对起点的方位

将方位分为八个扇区,据此生成包含目标信息的模板指令。

视频路径有序路线帧 + 路线摘要

Seed2.0 生成基于视频的指令初稿。

统一重写Seed2.0

统一两种来源的指令表达。

语义筛选目标对象与转向信息保持不变。
视觉筛选终点画面须显示已到达指定目标。
指令+第一视角视频+动作轨迹
只有语言、观测与动作描述同一次交互,导航片段才会进入训练集。

INSIGHT-Bench 提供了这套引擎中一部分可复现的数据:来自 1,683 个场景的 53,090 段训练片段,以及固定用于评测的 210 个场景、1,097 段片段。场景包含传统网格和高斯泼溅重建,导航片段覆盖五类场景与五种目标指代方式。

渲染器还通过改变相机参数增加数据多样性。在同一场景中,视场角的采样范围为 90–130° ,相机高度为 0.5–1.5 米,俯仰角为 −15° 到 15°。这样,模型在训练中就能接触不同本体尺度带来的视角变化,而不会只适应某一种相机配置。

INSIGHT-BENCH 数据覆盖

不同数据源丰富画面外观;不同评测类别则检验指令中的不同空间推理要求。

1,683训练场景
53,090训练片段
210评测场景
1,097评测片段
训练片段按场景来源
HM3D / MP3D
34,531 65.0%
InteriorGS
8,534 16.1%
HabitatGS
5,776 10.9%
VLNVerse
4,249 8.0%
评测分类导航片段数
基础指代方向指代空间关系极值指代顺序指代
公寓5050505039
住宅5050315035
商业空间4240305033
机构空间5049325038
室外4550505033

场景按功能与布局分类。指令类型由确定目标时所用的几何规则决定,而非根据生成后的关键词判断。

视场角 90°–130° 相机高度 0.5–1.5 m 俯仰角 −15°–15° 停止样本 ≤ 2% 轨迹聚类上限 ≤ 5%
INSIGHT-Bench 同时覆盖视觉和语言变化。 这个矩阵按场景布局和指代方式拆分评测结果,帮助分析失败与哪些因素或因素组合有关。
02C · 第二阶段——用对齐数据训练模型

让空间理解转化为行动。

借助这些对齐数据,第一阶段学到的空间理解开始转化为导航行为。面对同一个语言目标和历史画面,模型同时学习判断:指令指的是哪个目标、哪里可以通行,以及沿哪条轨迹能够到达。这三个决策都由同一次交互提供监督,让感知与动作在训练中紧密联系。

训练以导航与动作样本为主,同时保留一部分推理数据,以维持第一阶段学到的空间能力。在第二阶段数据相同的情况下,以 LightNav-ER 为起点训练的模型在全部评测设置中都有提升(图 05–06)。空间理解通过简洁的输出形式转化为行动:Point CoT 用图像中的点表达空间意图,RVQ 动作 token 则编码接下来的轨迹。

完整的第二阶段训练还使用了更多数据,包括 16 个导航数据源和 33 个推理数据源。R2R6RxR7ScaleVLN8SRDF9与跟踪数据、室外场景和高斯泼溅场景一起用于训练。指令以较长的描述为主:总计 742K 条,其中不重复的指令有 474K 条,长度中位数为 20 个词。图 05 展示训练数据的采样配比;下一节介绍如何利用导航片段中已有的几何信息,自动生成点标注。

第二阶段训练数据构成。

可用数据样本总数
VQA
5.2M
ObjectNav
4.7M
SRDF
4.7M
ScaleVLN
2.8M
跟踪
2.8M
VLN-CE · RxR
1.8M
VLN-CE · R2R
642K
INSIGHT-Bench
454K
05.2M
训练数据占比占比
导航与动作样本
77.6%
视觉问答
22.4%
图 05 可用数据与实际训练采样。 柱状图展示完整数据池。第二阶段训练采样中,77.6% 用于学习导航与动作,其余 22.4% 为 VQA。

ER 初始化使八项评测全部提升。

LIGHTNAV-ER QWEN3-VL
40 50 60 70 80 R2R+2.7 RxR+1.0 HM3D v1+3.1 HM3D v2+1.5 MP3D+4.2 OVON 已见类别+1.6 OVON 同义词+0.8 OVON 未见类别+4.0
图 06 ER 初始化使八项评测全部提升。 第二阶段数据相同时,ER 初始化使平均 SR 从 60.8 提升至 63.1,平均 SPL 从 39.0 提升至 40.0。
02D · 从轨迹数据到点 token

从路线中学习目标定位与通行方向。

Real2Sim2Real 引擎为每帧保留目标、相机位姿和路线信息,因此可以在生成导航片段的同时自动生成点标注。将前方可到达的路径点投影到图像中,就得到可通行点;当目标进入视野时,将其三维位置投影到图像中,就得到目标点。轨迹数据增加,点监督也随之增加,无需单独的标注流程。

01 · 可通行点

在可通行空间中选出的点。

用于标注可通行点的仿真室内 RGB 图像
标有所选可通行点的深度图
<apos_i> · 可通行空间目标切换视图 · 3D → 2D
02 · 目标点

在图像中定位指令所指的物体。

包含被指代扶手椅的仿真室内 RGB 图像 三维包围框
标有被指代目标点的深度图
<opos_i> · 指令所指目标切换视图 · 3D → 2D
图 07 将仿真几何投影到图像中,自动生成点标注。 点击卡片可切换原始 RGB 与投影深度视图。目标点和可通行点始终与生成它们的画面及路线对应。

机器人每一步决策都要进行推理,因此推理过程需要足够简短,训练标注也要便于批量生成。我们首先考虑过文本 CoT:它表达力强,但长度不固定、解码开销大,难以稳定合成;动作失败时,也很难客观判断推理是否正确。我们还考虑过带有实际尺度的三维目标,但这类标注依赖深度、位姿、相机标定和重建质量,也需要不同本体间统一的坐标系。

图像空间中的点提供了更直接的选择。每次决策只增加两个点 token:目标可见时,目标点标出指令所指的物体;可通行点则指出前进方向上的自由空间。两种标注都可以利用仿真几何批量生成。部署时,模型根据 RGB 和语言直接预测这些点,无需输入深度、定位、标定或地图信息。固定的输出格式使推理序列保持简短。

图 08 检验了这种表示是否有助于导航。在其余条件不变时,加入 Point CoT 使八项评测全部提升,平均 SR 增加 8.4,平均 SPL 增加 5.7。

POINT COT 消融 · 单视角 RGB · 成功率

Point CoT 使八项评测全部提升。

使用 POINT COT 不使用点监督
40 50 60 70 80 R2R+9.0 RxR+2.8 HM3D v1+13.5 HM3D v2+11.6 MP3D+12.0 OVON 已见类别+7.1 OVON 同义词+7.5 OVON 未见类别+3.9
平均 SR
+8.4
平均 SPL
+5.7
提升设置数
8 / 8
图 08 Point CoT 在全部八项设置中同时提升 SR 与 SPL。 其余训练设置保持不变 · 纵轴范围:40–80 SR。
02E · 从实际尺度轨迹到动作 token
RVQ 动作编码器

用 token 表达动作。

模型学习预测的是一条由十个路径点(waypoint)组成、带有实际尺度的 SE(2) 轨迹。为了让轨迹与语言、图像空间点都能以 token 形式自回归生成,我们用第二阶段的轨迹数据训练残差向量量化器(RVQ),将整条轨迹编码为三个动作 token。

RVQ 采用三级码本,每级包含 256 个条目。L0 给出粗轨迹,L1 和 L2 依次编码剩余误差,逐步修正轨迹。三个 token 解码后的路径点平均位移误差为 0.72 厘米。消融实验表明,三级是满足精度要求的最小配置:减至两级,重建误差会明显增大;增加层级或扩大码本,精度提升则很有限。解码可以在任一级结束:仅用 L0 就能恢复一条完整的粗轨迹,加上后续 token 后再逐步细化。

动作轨迹码本 逐级选择动作轨迹:L0 给出粗轨迹,L1 与 L2 依次修正剩余误差。
交互式码本 · 依次点击 L0 → L1 → L2颜色表示使用频率
图 09 将对齐的导航片段转化为按顺序生成的预测目标。 LightNav-0 先输出目标点与可通行点作为图像空间 CoT,再输出三个 RVQ 动作 token。解码后得到由十个路径点组成的轨迹;右图使用固定 1.5 米的前向范围展示。

在预测接口和第二阶段训练方案不变的基础上,我们分别增加训练环境、对齐 SFT 样本和模型参数,比较哪一种扩展方式能更稳定地提升导航能力。

第二阶段 · SFT 规模化

增加训练环境,收益仍在持续。

在测试范围内,增加训练环境最能稳定地提升导航表现。每次扩大环境覆盖,四项指标都会提高。增大模型则有得有失;在同一批场景中继续增加 SFT 片段,提升幅度也逐渐减小。这说明,在当前规模下,引入新环境可能比在已有环境中生成更多样本更有价值。

R2R RxR SR SPL
环境规模训练环境比例
1/81/41/2全部 73.6 SR68.5 SR64.5 SPL62.8 SPL
数据规模训练数据比例
1/161/81/41/2全部 73.6 SR68.5 SR64.5 SPL62.8 SPL
模型规模纵轴范围 · 45–75
2B4B8B 73.1 SR66.9 SR66.5 SPL62.3 SPL
图 10 在测试范围内,增加环境覆盖带来的提升最稳定。 在相同比例的扩展实验中,扩大环境覆盖带来的提升最大,且各项指标持续上升。增加数据总量也能提升全部四项指标,但接近完整规模时增益减小;模型超过 4B 后,部分指标提升,部分下降。

Real2Sim2Real 让这样的扩展可以实现。真实场景完成一次重建后,就能反复生成相互对齐的目标、路线、指令和相机画面。增加算力可以提高导航片段的生成速度,增加场景素材则能丰富数据中的视觉外观与空间结构。

SFT 数据即使覆盖广泛,仍有局限:它展示了如何成功导航,却很少涵盖模型自身犯错后的恢复过程。转弯过晚、走过目标或跟丢目标,都会让模型遇到示范数据中少见的状态。第三阶段沿用相同的点与动作接口,但开始从另一类经验中学习:模型自行生成的轨迹及其执行结果。

02G · 第三阶段——强化学习

在自主尝试中继续学习。

第三阶段仍完全在仿真中进行。模型自行生成完整规划,由仿真器评估执行结果。模型实际经历的状态和执行中出现的错误,共同提供训练信号。

GRPO11 通过比较这些规划的执行结果来更新策略。RL 沿用 SFT 阶段的 RVQ 动作 token,动作词表不变,但训练不再只依赖成功路线的示范,而是根据模型自主决策的结果改进策略。

EVT-Bench12 的干扰跟踪评测中,可以看到这一过程:性能在 SFT 模型的基础上继续提升,随后趋于稳定(图 11)。

在线 RL 过程中的跟踪成功率

EVT-Bench 干扰跟踪(DT)评测,覆盖 101 个场景中的 1,392 段导航片段。

成功率(%) — 纵轴范围 70–84
在线强化学习过程中的跟踪成功率 成功率从 SFT 阶段的 74.4 提升至第 120 步时的 82.6,为观测到的最高值。 趋于稳定 74.4 82.6
图 11 在线 RL 进一步提升 SFT 模型的跟踪成功率。 成功率从 SFT 阶段的 74.4 提升至第 120 步时的 82.6,为观测到的最高值。

三个阶段分别利用空间推理数据、对齐的仿真交互数据,以及模型自主决策的仿真结果进行训练。接下来,我们检验这些训练带来的能力能否迁移。评测覆盖公开基准、真机本体和陌生的视觉环境。

03 · 公开基准与真机验证

跨任务、跨场景、跨本体泛化。

我们首先在公开基准上检验迁移能力。使用同一个模型,评测十项设置中的指令跟随、物体目标导航、开放词汇搜索和目标跟踪能力,所用基准包括 VLN-CE13Matterport3D14HM3D10HM3D-OVON15EVT-Bench12

LightNav-0 仅使用一个第一视角 RGB 画面,每一时刻只能看到相机当前视野内的内容。全景和多相机方法则可以同时观察多个方向。因此,各图将这两种输入配置分开展示:先比较单目方法,再列出视野更广的方法。

LightNav-0 在十项单目评测中均排名第一;将全景和多相机方法一并纳入比较后,仍有四项排名第一(图 12)。

LIGHTNAV-0 · 单视角 RGB 单目方法 全景 / 多相机方法
01 · 指令跟随VLN-CE · 未见场景验证集 · SR ↑ · 各项独立设置纵轴

R2R

SR ↑ · 60–80
全部已报告方法11 单目 · 17 全景 / 多相机
单目方法
  1. LightNav-068.5单目
  2. Qwen-RobotNav-4B66.9单目
  3. Qwen-RobotNav-8B65.7单目
  4. CorrectNav65.1单目
  5. DualVLN64.3单目
  6. InternVLA-N158.2单目
  7. Qwen-VLA57.3单目
  8. StreamVLN56.9单目
  9. NaVILA54.0单目
  10. Uni-NaVid47.0单目
  11. NaVid37.0单目
全景 / 多相机
  1. Qwen-RobotNav-8B72.1全景 / 多相机
  2. Qwen-RobotNav-4B69.5全景 / 多相机
  3. ABot-N168.3全景 / 多相机
  4. ABot-N066.4全景 / 多相机
  5. SPAN-Nav66.3全景 / 多相机
  6. NavForesee66.2全景 / 多相机
  7. NavFoM61.7全景 / 多相机
  8. HNR61.0全景 / 多相机
  9. ETPNav57.0全景 / 多相机
  10. Reborn50.0全景 / 多相机
  11. GridMM49.0全景 / 多相机
  12. DreamWalker49.0全景 / 多相机
  13. AO-Planner47.0全景 / 多相机
  14. Sim2Sim43.0全景 / 多相机
  15. CMA41.0全景 / 多相机
  16. HPN+DN36.0全景 / 多相机
  17. InstructNav31.0全景 / 多相机

RxR

SR ↑ · 60–80
全部已报告方法10 单目 · 12 全景 / 多相机
单目方法
  1. LightNav-073.6单目
  2. Qwen-RobotNav-8B73.4单目
  3. Qwen-RobotNav-4B71.3单目
  4. CorrectNav69.3单目
  5. DualVLN61.4单目
  6. Qwen-VLA59.6单目
  7. InternVLA-N153.5单目
  8. StreamVLN52.9单目
  9. NaVILA49.3单目
  10. Uni-NaVid48.7单目
全景 / 多相机
  1. Qwen-RobotNav-8B76.5全景 / 多相机
  2. Qwen-RobotNav-4B75.2全景 / 多相机
  3. ABot-N170.9全景 / 多相机
  4. SPAN-Nav69.7全景 / 多相机
  5. ABot-N069.3全景 / 多相机
  6. NavForesee66.3全景 / 多相机
  7. NavFoM64.4全景 / 多相机
  8. HNR56.3全景 / 多相机
  9. ETPNav54.7全景 / 多相机
  10. Reborn48.6全景 / 多相机
  11. CMA26.5全景 / 多相机
  12. Sim2Sim26.5全景 / 多相机
02 · 目标导航OBJECTNAV · SR ↑ · 各项独立设置纵轴

MP3D

SR ↑ · 40–60
全部已报告方法5 单目 · 3 全景 / 多相机
单目方法
  1. LightNav-053.3单目
  2. CogNav46.6单目
  3. SG-Nav40.2单目
  4. OpenFMNav37.2单目
  5. VLFM36.4单目
全景 / 多相机
  1. Qwen-RobotNav-4B52.2全景 / 多相机
  2. Qwen-RobotNav-8B48.8全景 / 多相机
  3. WMNav45.4全景 / 多相机

HM3D v1

SR ↑ · 50–80
全部已报告方法8 单目 · 1 全景 / 多相机
单目方法
  1. LightNav-074.5单目
  2. Uni-NaVid73.7单目
  3. CogNav72.5单目
  4. FiLM-Nav61.7单目
  5. TriHelper56.5单目
  6. SG-Nav54.0单目
  7. VLFM52.5单目
  8. OpenFMNav52.5单目
全景 / 多相机
  1. WMNav58.1全景 / 多相机

HM3D v2

SR ↑ · 60–85
全部已报告方法4 单目 · 2 全景 / 多相机
单目方法
  1. LightNav-079.5单目
  2. FiLM-Nav77.0单目
  3. VLFM63.6单目
  4. SG-Nav49.6单目
全景 / 多相机
  1. Qwen-RobotNav-4B75.6全景 / 多相机
  2. Qwen-RobotNav-8B71.2全景 / 多相机
03 · 开放词汇导航HM3D-OVON · SR ↑ · 各项独立设置纵轴

已见类别

SR ↑ · 40–65
全部已报告方法5 单目 · 4 全景 / 多相机
单目方法
  1. LightNav-055.3单目
  2. MTU3D55.0单目
  3. Uni-NaVid41.3单目
  4. DAgRL+OD38.5单目
  5. VLFM35.2单目
全景 / 多相机
  1. Qwen-RobotNav-4B57.7全景 / 多相机
  2. Qwen-RobotNav-8B56.1全景 / 多相机
  3. ABot-N055.3全景 / 多相机
  4. NavFoM37.7全景 / 多相机

同义词

SR ↑ · 40–65
全部已报告方法5 单目 · 4 全景 / 多相机
单目方法
  1. LightNav-053.3单目
  2. MTU3D45.0单目
  3. Uni-NaVid43.9单目
  4. DAgRL+OD39.0单目
  5. VLFM32.4单目
全景 / 多相机
  1. Qwen-RobotNav-4B60.1全景 / 多相机
  2. Qwen-RobotNav-8B57.8全景 / 多相机
  3. ABot-N055.4全景 / 多相机
  4. NavFoM43.3全景 / 多相机

未见类别

SR ↑ · 35–60
全部已报告方法5 单目 · 4 全景 / 多相机
单目方法
  1. LightNav-047.0单目
  2. MTU3D40.8单目
  3. Uni-NaVid39.5单目
  4. DAgRL+OD37.1单目
  5. VLFM35.2单目
全景 / 多相机
  1. ABot-N054.0全景 / 多相机
  2. Qwen-RobotNav-4B53.1全景 / 多相机
  3. Qwen-RobotNav-8B51.2全景 / 多相机
  4. NavFoM43.6全景 / 多相机
04 · 视觉跟踪EVT-BENCH · SR ↑ · 各项独立设置纵轴

单目标

SR ↑ · 85–95
全部已报告方法5 单目 · 7 全景 / 多相机
单目方法
  1. LightNav-091.7单目
  2. ReferTrack89.4单目
  3. VLingNav88.4单目
  4. TrackVLA85.1单目
  5. Uni-NaVid53.3单目
全景 / 多相机
  1. CoMaTrack92.1全景 / 多相机
  2. ABot-N187.0全景 / 多相机
  3. ABot-N086.9全景 / 多相机
  4. TrackVLA++86.0全景 / 多相机
  5. NavFoM86.0全景 / 多相机
  6. Qwen-RobotNav-8B78.6全景 / 多相机
  7. Qwen-RobotNav-4B77.4全景 / 多相机

干扰跟踪

SR ↑ · 65–85
全部已报告方法5 单目 · 5 全景 / 多相机
单目方法
  1. LightNav-082.6单目
  2. ReferTrack73.3单目
  3. VLingNav67.6单目
  4. TrackVLA57.6单目
  5. Uni-NaVid31.9单目
全景 / 多相机
  1. CoMaTrack74.2全景 / 多相机
  2. ABot-N066.7全景 / 多相机
  3. TrackVLA++66.5全景 / 多相机
  4. ABot-N165.2全景 / 多相机
  5. NavFoM61.4全景 / 多相机
图 12 十项基准评测的成功率。 每张图展示 LightNav-0 与已报告的最强单目及更宽视野方法,并为每根柱标明输入配置和具体得分。
INSIGHT-BENCH · 1,097 段导航片段 · 210 个场景

重新思考导航评测。

多数导航基准用一个成功率综合衡量多种能力,场景又主要集中在 Habitat 一类平台使用的室内扫描环境中,指令往往是较长的路线描述。因此,当导航失败时,单一分数很难说明问题出在哪里:模型没有理解目标、没有识别空间关系,还是无法通过当前场景。

我们自建了 INSIGHT-Bench,用于分别检验这些能力。它围绕五种基本目标指代方式设计任务:基础指代、方向指代、空间关系、极值指代和顺序指代。评测覆盖公寓、住宅、商业空间、机构空间和室外环境。评测集包含 210 个未参与训练的场景,共 1,097 段导航片段。在统一使用前向 RGB 的评测条件下,LightNav-0 与其他六个开源策略相比,在每类指令和每类场景中都取得了最高成功率。

场景类型:公寓、住宅、商业空间、机构空间和室外。每类均展示示例图及简短的布局说明。 指令类型:基础指代、方向指代、空间关系、极值指代和顺序指代。每类均展示示例图和指令,并高亮用于区分目标的线索。
图 13 INSIGHT-Bench 的两个评测维度。 五类场景与五种基本目标指代方式交叉组合。

按指令类型

成功率 · 统一 0–70 刻度
JanusVLN: 基础指代 32.5, 方向指代 28.5, 空间关系 28.5, 极值指代 22.0, 顺序指代 25.8 NaVid: 基础指代 37.6, 方向指代 29.7, 空间关系 18.7, 极值指代 22.4, 顺序指代 24.2 Uni-NaVid: 基础指代 32.9, 方向指代 29.3, 空间关系 21.8, 极值指代 16.8, 顺序指代 19.7 TAMP-Nav: 基础指代 18.1, 方向指代 14.2, 空间关系 17.6, 极值指代 10.8, 顺序指代 20.8 InternVLA-N1: 基础指代 18.1, 方向指代 13.0, 空间关系 9.8, 极值指代 8.4, 顺序指代 7.9 StreamVLN: 基础指代 15.6, 方向指代 9.6, 空间关系 14.5, 极值指代 8.0, 顺序指代 10.7 LightNav-0: 基础指代 45.1, 方向指代 57.7, 空间关系 37.8, 极值指代 37.2, 顺序指代 38.2

按场景类型

成功率 · 统一 0–70 刻度
JanusVLN: 公寓 39.7, 住宅 35.2, 商业空间 26.7, 机构空间 18.3, 室外 16.7 NaVid: 公寓 37.7, 住宅 39.8, 商业空间 24.6, 机构空间 18.3, 室外 13.6 Uni-NaVid: 公寓 39.3, 住宅 28.7, 商业空间 23.1, 机构空间 15.5, 室外 14.0 TAMP-Nav: 公寓 26.8, 住宅 18.5, 商业空间 15.9, 机构空间 9.6, 室外 8.3 InternVLA-N1: 公寓 12.1, 住宅 19.0, 商业空间 12.3, 机构空间 7.8, 室外 7.5 StreamVLN: 公寓 19.7, 住宅 15.7, 商业空间 12.8, 机构空间 4.1, 室外 5.3 LightNav-0: 公寓 61.1, 住宅 50.5, 商业空间 42.1, 机构空间 29.2, 室外 34.2
LightNav-0
图 14 INSIGHT-Bench 上的原子导航能力。 在统一使用前向 RGB 的条件下,分别统计五种指代方式与五类场景中的成功率。
零样本部署

用零样本迁移检验具身后训练。

策略在一种机器人上有效之后,更严格的检验是:换了本体、场景或任务,学到的能力是否依然有效。我们从这三个方面评测 LightNav-0:四种真实机器人本体、未见过的室内外环境,以及长程指令跟随、开放词汇物体导航和目标跟踪三类任务。

图 15 拥挤街道中的跨本体跟踪。三种机器人本体 · 行人与移动干扰目标
图 16 在室外跟随移动目标。LightBot-0 · 公共公园
图 17 室内目标跟踪。宇树 Go2 · 办公环境
图 18 办公室指令跟随。LightBot-0 · 多种语言目标
图 19 开放词汇目标导航。LimX TRON 1 · 公共公园
图 20 跨本体目标跟踪。三种机器人本体 · 公共街道
04 · 零样本泛化

超越机器人导航。

数据规模扩大的价值,要看模型能否适应训练环境之外的世界。为此,我们将同一个模型用于与机器人训练数据视觉风格显著不同的环境:先在交互式虚拟世界中进行闭环控制,再对真实场景视频进行开环预测。

两种测试关注不同能力。在交互世界中,模型的动作会改变下一次观测,错误也可能不断累积,检验的是完整的闭环策略。在预录视频中,模型无法改变后续画面,因此可以单独观察目标定位、可通行空间判断和轨迹预测能否适应不同的相机、运动方式与视觉风格。

04A · 闭环泛化

在陌生世界中闭环控制。

不同环境带来不同挑战。体素世界的几何与纹理截然不同;驾驶世界要求在高速运动中持续转向,纠正偏移的时间更短;第一人称世界采用复古画面,最后一段还使用低分辨率的 4:3 画面,同时改变了图像分辨率和宽高比。

图 21 导航并跟踪目标。体素世界 · 目标导航 + 跟踪
图 22 沿长距离曲折路线行驶。驾驶世界 · 连续转向
图 23 按长程路线指令导航。第一人称世界 · 复古纹理
图 24 导航至指定目标。第一人称世界 · 风格化光照
04B · 开环泛化

视频中的开环泛化。

山地骑行、速度滑冰、自由式滑雪和越野跑的视频,带来了后训练数据中未覆盖的快速视角运动、遮挡、目标尺度变化,以及不同于机器人视角的相机运动。面对这些画面,LightNav-0 仍能逐帧定位目标并预测可行的运动轨迹。

粉色 · 目标定位 薄荷色 · 可通行点 蓝色 · 预测轨迹
图 25 在变化的地形中预测路径。山地骑行
图 26 在周围干扰目标中持续跟踪。速度滑冰
图 27 在腾空与目标尺度变化中预测运动。自由式滑雪
图 28 随着小径转弯更新路径。越野跑
05 · 开放发布

LightNav-0 正式开放。

本次发布包含 LightNav-0 的模型、代码、技术报告及 INSIGHT-Bench 评测工具。

致谢

感谢我们的合作伙伴逐际动力群核科技在真机部署与仿真方面给予的支持。

交互演示 · RVQ 动作编码器先用 L0 选择粗轨迹,再用 L1 和 L2 逐级细化。