GeekHub

从旁观视频到可执行动作:基于第三人称数据的机器人操作学习——技术路线与展望

摘要

机器人操作策略学习的核心瓶颈是数据规模:遥操作演示的成本与多样性约束,使通用操作策略难以扩展到开放世界。人类视频——尤其是互联网上规模庞大、以第三人称(exocentric,下称 exo)视角为主的视频——被视为突破该瓶颈的关键数据源。然而 exo 视频与机器人执行之间存在三重差距:观察分布差异、动作标签缺失、任务目标不可观测。本文梳理 exo 数据驱动机器人学习的技术路线,重点讨论 2025–2026 年以自监督视频预训练 + 动作条件化后训练(以 V-JEPA 2 为代表)、隐动作模型(以 Genie 系列为代表)、以及逆动力学世界-动作模型(World-Action Model)为代表的三条前沿路径,分析其各自如何弥合 exo 视频与机器人动作空间之间的鸿沟,并讨论当前方法的边界与未来方向。相对第一视角(egocentric,下称 ego)数据,exo 路线的优势在于数据规模与被动可得性,劣势在于手部接触细节的可见性;本文认为,exo 数据更适合承载”通用世界理解”这一层能力,而精细操作的最后一段对齐仍需依赖少量本体数据。

V-JEPA 2 整体架构

1. 问题定义

机器人操作策略学习的目标是从观测 ot 与环境指令 g 生成动作序列 a1:T,使机器人完成任务。传统范式依赖真实机器人采集的遥操作演示 (ot,at) 对,通过模仿学习(imitation learning)或强化学习(reinforcement learning)训练策略 π(at|ot)。该范式面临两个结构性限制:其一,数据采集成本高(遥操作需要受训操作者、专用硬件、受控环境),同样一小时的产出效率,人类演示约为遥操作机器人的 10 倍;其二,数据多样性受限于可布置的操作者、任务种类与环境,难以覆盖开放世界的长尾场景。

人类视频在理论上可以绕过这两个限制。互联网上存在海量人类活动视频,其中绝大多数为 exo 视角——由外部固定机位、移动摄像机或监控设备拍摄,旁观者记录操作过程。这类数据具有以下属性:规模极大(互联网视频总量以数十亿小时计)、被动可得(无需机器人参与即可采集)、场景多样(覆盖几乎所有日常操作环境)。

但 exo 视频不能直接作为模仿学习的监督信号。设机器人策略学习的最小目标函数为

Φ=argminΦobs(Φ)+act(Φ)+obj(Φ)

其中 Φ 为将人类视频映射到机器人可执行表征的桥梁函数(bridging function),三项分别对应:

  • 观察差 obs:人类视频(尤其 exo)的视觉分布与机器人部署相机的视觉分布不一致。exo 视频中手处于远处、小尺度、易被遮挡;机器人头部/腕部相机看到的是近处、大尺度、接触清晰。策略网络从 exo 视频学到的视觉表征,部署时输入分布发生偏移。
  • 动作差 act:exo 视频不包含机器人可执行的动作序列(末端位姿、关节角、夹爪开合、力矩)。从像素反推动作需经手姿态估计→指尖轨迹→运动学重定向(retargeting),且人手约 27 自由度与机器人夹爪 1–2 自由度之间的形态差异使重定向必然有损。
  • 目标差 obj:exo 视频无 reward、无成功/失败标签、无任务标注,操作者做到哪一步算完成、动作为何成功均不可观测。

本文聚焦的学术问题即:在 exo 数据占主导的现实下,如何设计 Φ 使其同时最小化三项差距,且随数据规模扩展?

2. exo 数据的结构性特征

2.1 与 ego 数据的对照

ego 数据(第一视角,来自 Aria 眼镜、Vision Pro 等头戴设备)与 exo 数据在信息结构上互补:

属性 exo ego
场景布局 完整、稳定 局部、随头部运动
手部细节 远、小、易遮挡 近、大、接触清晰
任务时序 全局可分解 局部时序强、全局弱
与机器人视角对齐
采集成本 低(普通摄像机) 高(专用头戴设备 + 受训操作者)
互联网现成规模 极大 极小(最大开源 ego 数据集 Ego4D 约 3670h)
主动操作占比 低(多为旁观) 高(操作者本人动手)

最后一行揭示了 exo 路线的一个内在张力:互联网 exo 视频的”旁观”属性意味着其中大量片段是观看他人操作,而非操作者视角下的主动执行。V-JEPA 2 等工作的预训练数据虽以互联网 exo 视频为主,但其 action-conditioned 后训练阶段使用的是 DROID 数据集——机器人本体采集的数据,而非纯互联网 exo。这一事实对”exo 视频能否单独支撑操作学习”构成一个尚待解决的实证缺口。

2.2 exo 数据的可扩展性优势

exo 路线的核心学术价值在于:它把”数据规模”这一语言模型时代验证过的核心扩展轴,搬到了物理世界。互联网 exo 视频具备三个语言语料不具备但同样关键的属性:

  1. 被动性:无需机器人参与、无需操作者配合、无需标注即可采集。
  2. 多样性:覆盖光照、背景、物体种类、任务类型的全长尾分布。
  3. 规模上限高:理论上互联网视频总量是开放的,不存在”采集设备数量有限”的工程瓶颈。

这三点使 exo 数据成为”通用世界理解”层最现实的数据源。2025–2026 年的前沿工作正是围绕”如何用 exo 数据学到物理一致的世界模型,再如何把世界模型翻译成机器人动作”展开。

3. exo 路线的三条前沿技术路径

3.1 自监督视频预训练 + 动作条件化后训练:V-JEPA 2

V-JEPA 2(Assran et al., 2025, arXiv:2506.09985)是目前 exo 路线最完整的实证案例。其架构分两阶段:

阶段一:无动作自监督预训练。 编码器 Eθ 将视频映射到表征空间,预测器 Pϕ 预测被 mask 的视频片段的表征(而非像素级重建)。损失函数为

minθ,ϕPϕ(Δ,Eθ(x))sg(Eθ(y))1

其中 x 为 mask 后的视频、y 为完整视频、Δ 为 mask 位置、sg() 为 stop-gradient、EθEθ 的指数滑动平均。这一”预测表征”而非”重建像素”的目标,使模型学到的是物理世界的动态规律(物体运动、遮挡变化、因果关系),而非像素纹理。V-JEPA 2 阶段一:自监督预训练架构

预训练数据为 100 万+ 小时互联网视频(以 exo 旁观视角为主)+ 100 万图像,无任何动作标签。

阶段二:动作条件化后训练(V-JEPA 2-AC)。 冻结预训练编码器 Eθ,训练一个新的动作条件化预测器。输入为时序交错的三元组 (ak,sk,zk)(动作、本体感知、当前帧表征),预测下一时步表征 zˆk+1。损失含两项:teacher-forcing 损失(单步预测)与 rollout 损失(多步自回归展开)。预测器为约 300M 参数的 24 层 Transformer,使用 3D-RoPE 位置编码。V-JEPA 2-AC 阶段二:动作条件化后训练

该阶段仅需 62 小时无标注机器人视频(DROID 数据集)。

部署:模型预测控制(MPC)。 给定当前状态表征 zk 与目标表征 zg(由编码器对目标图像编码得到),规划器通过交叉熵法(cross-entropy method)最小化能量函数

(aˆ1:T;zk,sk,zg)=P(aˆ1:T;sk,zk)zg1

V-JEPA 2 MPC 规划

在潜空间中展开候选动作序列、评估其与目标的接近程度,执行评分最高的动作,每时步重规划。部署时无需环境特定数据、无需任务特定训练、无需标定。

V-JEPA 2 zero-shot 部署可视化

实证结果。 在两个实验室的 Franka 机械臂上 zero-shot 部署,pick-and-place 任务成功率 65–80%,目标为图像(短horizon)或视觉子目标序列(长horizon)。

学术意义。 V-JEPA 2 验证了一个关键解耦:exo 视频承载”世界怎么动”的通用知识,少量机器人数据承载”我怎么动”的本体对齐。exo 部分可扩展到互联网规模,机器人数据部分规模需求小(62h)。这一解耦是 exo 路线相对 ego 路线的根本优势——ego 数据同时承载世界理解与动作细节,规模上不去;exo 数据把世界理解抽离出来独立扩展,动作对齐交给小而精的本体数据。

局限。 (a) 62h 机器人数据是 DROID(机器人本体采集),非纯互联网 exo,”exo 视频能否替代本体数据”未验证;(b) 任务为 pick-and-place 等粗粒度操作,精细力控、接触富集任务未覆盖;(c) MPC 每时步重规划的推理延迟(约 16s/动作)限制实时性;(d) 潜空间能量函数对动作的敏感度、以及大动作(out-of-distribution)下的预测可靠性,尚缺乏系统分析。

3.2 隐动作模型:Genie 系列

Genie(Bruce et al., 2024, arXiv:2402.15391)与 Genie 3(DeepMind, 2025)提出另一条 exo 路线:从无标签视频中无监督地学出”隐动作空间”(latent action space)

Genie 架构含三组件:

  1. 隐动作模型(LAM):从相邻帧的时序变化中推断隐动作 a~t,完全无监督(无动作标签、无文本标签)。通过因果时间掩码,从整段视频 x1:T 推断帧间隐动作 a~1:T1
  2. 视频 tokenizer:将原始帧离散化为 token zt
  3. 动力学模型:给定隐动作与历史帧 token,预测下一帧 token。LAM 与动力学模型联合训练。

Genie 3(2025)将这一范式推进到实时、高分辨率(720p @ 24 FPS)、分钟级一致性,从文本 prompt 生成可交互的 3D 世界。其训练数据为 200,000+ 小时公开互联网游戏视频(exo 视角为主),无任何动作或文本标注。

学术意义。 Genie 系列证明了:exo 视频中”动作”并非不可学,只是需要一种不依赖显式标签的表征形式。隐动作空间是”视频里发生的状态变化”的压缩编码,它不要求知道动作的物理量(力矩、末端速度),只要求能区分”发生了什么”。这把 exo 视频从”纯被动观看数据”提升为”可推断动作结构的交互式数据源”。

局限。 (a) 隐动作是相对的、离散化的,无法直接映射到机器人连续动作空间——仍需一个”隐动作→机器人动作”的翻译层;(b) 训练数据是游戏视频(2D 渲染、规则世界),与真实物理世界的接触动力学、摩擦、形变存在 domain gap;(c) Genie 3 生成的世界是 2D 帧序列而非 3D 几何,无法直接用于需要 3D 空间推理的任务。

3.3 逆动力学世界-动作模型:从视频生成到动作提取

2025–2026 年兴起的 World-Action Model(WAM)范式,将视频生成模型与逆动力学模型组合,形成”先想象未来、再反推动作”的管线:

  1. 视频生成阶段:预训练视频模型(Wan、Cosmos 等)从当前观测 + 语言指令生成未来帧序列或潜表征。
  2. 逆动力学阶段:逆动力学头(inverse dynamics head)从预测的状态转移中推断动作序列。

NVIDIA 2026 年 6 月的综述性博客将 WAM 分为三类:

  • 逆动力学 WAM(UniPi、LingBot-VA、DVA 等):视频模型先产出未来,逆动力学头再提取动作。UniPi(Du et al., NeurIPS 2023)是最早的实例;LingBot-VA(Li et al., 2026)将其推进到基础模型规模,用 Wan 2.2-5B 做视频 backbone,经 16000 小时跨本体预训练,采用 Mixture-of-Transformers 架构分离视频专家与动作专家。
  • 联合预测 WAM(DreamZero 等):单一模型同时输出动作序列与未来状态,无独立逆动力学模块。
  • 潜表征/计划 WAM(Being-H0.7 等):用 prior/posterior 潜变量结构压缩行为窗口为潜计划,推理时仅 prior 分支运行。

学术意义。 WAM 范式的核心贡献是:把”语言 grounding”问题(把指令翻译成视觉变化)转移给视频预训练阶段,让动作头专注于逆动力学本身。视频预训练已在 exo 视频上学到了”指令→视觉变化”的部分映射,动作头不需要从机器人演示里学全部。

局限。 (a) 逆动力学 WAM 通常需要配对的视频-动作数据来学习”视觉转移→电机指令”的映射,纯 exo 视频(无动作标签)仍无法单独训练逆动力学头;(b) 视频生成的物理一致性不足(生成视频里物体可能穿透、形变不合理),逆动力学从非物理的视频里提取的动作可能不可执行;(c) 计算成本高,16k 小时跨本体预训练的工程门槛限制复现性。

4. 三条路径的对比与互补

维度 V-JEPA 2 Genie 3 逆动力学 WAM
动作来源 显式机器人动作(62h DROID) 隐动作(无监督从视频推断) 逆动力学头从视频转移反推
exo 数据角色 世界理解预训练 交互式环境生成 视频 backbone 预训练
本体数据需求 62h 无标注机器人视频 少量(用于隐动作→本体动作翻译) 配对视频-动作数据
物理一致性 潜空间能量函数,无显式物理约束 2D 帧,无 3D 几何 依赖视频生成的物理真实性
实时性 MPC 每步重规划,~16s/动作 24 FPS 实时 取决于视频生成速度
部署形态 zero-shot(新环境、新物体) 可交互世界(非真实机器人) 跨本体(LingBot-VA 16k h 预训练)
关键未解问题 exo 视频能否替代本体数据 隐动作→机器人动作映射 视频生成的物理一致性

三条路径并非互斥,而是互补:V-JEPA 2 证明 exo 视频能学到可用的世界模型(潜空间能量函数 + MPC 即可 zero-shot 部署);Genie 3 证明 exo 视频能学到隐动作结构(无需显式标签);逆动力学 WAM 证明 exo 视频能作为视频 backbone 支撑跨本体动作生成。三者的交集指向一个更完整的范式:exo 视频做大规模自监督预训练,学到”世界怎么动 + 动作结构”;少量本体数据做动作对齐;逆动力学或显式动作头做最后翻译

5. 当前方法的边界

exo 路线的上限虽高于 ego 路线(数据规模、被动可得性),但存在四条硬边界:

边界一:力/触觉信号在像素中不可观测。 无论 V-JEPA 2、Genie 3 还是 WAM,输入均为 RGB(+ 可选深度)。抓握力、接触滑移、材料形变等触觉信号,exo 视频里根本不存在。这是所有纯视觉路线的共同天花板,exo 不例外。精细力控任务(拧螺丝、倒水不洒、布料操作)无法仅靠 exo 视频学到。

边界二:exo 视频的”旁观”属性。 互联网 exo 视频多数是旁观者拍摄(看别人操作),非操作者主动执行。V-JEPA 2 的后训练用的是机器人本体数据而非互联网 exo,说明”exo 视频学到多少操作先验”目前仍缺乏纯 exo 的端到端验证。纯互联网 exo 视频能学到”世界怎么动”(物理规律),但”手该怎么动”(操作技巧)需要操作者视角或机器人本体数据补充。

边界三:视频生成的物理一致性。 WAM 范式依赖视频生成模型的未来帧质量。当前生成视频在接触密集、形变、流体等场景下物理不一致(物体穿透、形变不连续),逆动力学从非物理视频里提取的动作可能不可执行。这是”合成数据工厂”路线的核心技术风险。

边界四:隐动作到本体动作的映射。 Genie 3 的隐动作是无监督的相对编码,无法直接映射到机器人连续动作空间。需要额外的翻译层(逆动力学头、行为克隆),而翻译层本身需要配对数据。这一”翻译”环节是隐动作路线从”可交互视频生成”到”可执行机器人控制”的关键跨越,目前尚未完全解决。

6. 展望

基于 2025–2026 年的前沿进展,exo 路线的未来方向可归纳为四点:

方向一:exo 世界模型与本体数据的最小化耦合。 V-JEPA 2 的 62h 是一个起点而非终点。一个开放问题是:exo 视频预训练的世界模型,能否把本体数据需求压到更低(10h、1h)?如果 exo 视频学到的”世界动力学”足够强,本体数据可能只需承担”动作空间校准”这一最小功能。这一方向的进展将直接决定 exo 路线相对 ego 路线的扩展性优势能否兑现。

方向二:物理一致的视频生成。 WAM 路线的瓶颈在视频生成的物理真实性。下一代世界模型需要在潜空间引入物理约束(碰撞、摩擦、刚体动力学),使生成的未来帧不仅是视觉合理,更是物理可执行。NVIDIA Cosmos、Genie 3 等已在朝此方向推进,但”物理一致”与”视觉高质量”之间的权衡尚未解决。

方向三:多模态信号的补充。 力/触觉缺口无法靠视觉路线内部弥补,必须引入多模态数据。但多模态数据(IMU、深度、力矩、触觉)的采集成本与 ego 数据同样高,规模上不去。一个可能的折中:exo 视频做大规模预训练,多模态数据做小规模精调——类似 V-JEPA 2 的”exo 预训练 + 机器人后训练”结构,但后训练数据从”无标注 RGB”扩展为”多模态配对数据”。

方向四:ego 与 exo 的融合预训练。 2024 年后 Ego-Exo4D 等双视角同步数据集出现,混合视角工作占比上升(2026 综述统计约 22%)。一个开放方向:ego 和 exo 是否在同一个世界模型里联合预训练?exo 提供规模与场景多样性,ego 提供手部细节与部署视角对齐——如果两者能在统一的潜表征空间里融合,exo 路线的”手部细节短板”可能被 ego 数据补上,而不必放弃 exo 的规模优势。这一方向目前缺乏被广泛接受的统一范式。

7. 结语

exo 路线的学术贡献,在于把语言模型时代的”规模定律”迁移到物理世界:互联网 exo 视频的被动性、多样性、规模上限,使”通用世界理解”层第一次具备了可扩展的数据基础。V-JEPA 2、Genie 3、逆动力学 WAM 三条路径分别从不同角度验证了这一基础的可学习性。

但 exo 路线不是一劳永逸的方案。它的边界——力/触觉不可观测、旁观属性、视频生成物理一致性、隐动作映射——决定了它必须与本体数据、多模态数据、ego 数据协同。一个可能的终态是:exo 视频做预训练的”世界基础”,ego 视频做精调的”操作细节”,本体数据做闭环的”动作对齐”,多模态信号补”触觉缺口”。在这一分工下,exo 路线的技术上限确实最高——它决定了机器人能否”看视频就会动手”的通用基础,而 ego 与本体数据决定最后一段精度。


参考文献

  1. Assran, M., et al. V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning. arXiv:2506.09985, 2025.
  2. Bruce, J., et al. Genie: Generative Interactive Environments. ICML 2024. arXiv:2402.15391.
  3. Google DeepMind. Genie 3: A New Frontier for World Models. 2025.
  4. Du, Y., et al. Learning to Act from Actionless Videos through Discrete Diffusion Modeling (UniPi). NeurIPS 2023.
  5. Li, Y., et al. LingBot-VA: Inverse Dynamics Action Prediction with Video Rollouts. arXiv:2601.21998, 2026.
  6. Ma, J., et al. Robot Learning from Human Videos: A Survey. arXiv:2604.27621, 2026.
  7. NVIDIA. Pretrained to Imagine, Fine-Tuned to Act: The Rise of World-Action Models. Developer Blog, 2026.
  8. Liao, Y., et al. Genie Envisioner: A Unified World Foundation Platform for Robotic Manipulation. arXiv:2508.05635, 2025.
  9. Jang, J., et al. DreamGen: Unlocking Generalization in Robot Learning through Video World Models. CoRL 2025. arXiv:2505.12705.
  10. Gao, S., et al. DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos. arXiv:2602.06949, 2026.
  11. Agarwal, N., et al. Cosmos World Foundation Model Platform for Physical AI. arXiv:2501.03575, 2025.
  12. Grauman, M., et al. Ego4D: Around the World in 3,000 Hours of Egocentric Video. CVPR 2022.
  13. Grauman, M., et al. Ego-Exo4D: Understanding Skilled Human Activity from First- and Third-Person Perspectives. ICCV 2024. arXiv:2311.18259.
  14. Du, Y., et al. Video Generation Models as World Simulators. OpenAI, 2024.
  15. Liang, J., et al. Video Generators are Robot Policies. arXiv:2508.00795, 2025.

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注