
Masked Visual Actions for Unified World Modeling论文Masked Visual Actions for Unified World Modeling机构斯坦福大学链接https://masked-visual-actions.github.io1. 介绍核心问题与痛点机器人交互的本质技能行为需要同时具备前向执行动作预测状态和逆向由目标状态反推动作推理能力。理想的世界模型应该在一个框架内同时支持这两种推理。现有视频模型的局限性虽然视频模型从海量数据中学到了丰富的物体运动、接触、形变等物理先验但它们大多只是被动的观察者无法作为干预工具即控制器。现存方法的不足为了让视频模型“能动起来”现有方法通常使用文本、轨迹、力、关键点、电机指令作为条件。但这些信号往往是稀疏的、特定于机器人本体的、或者与视频模型预训练时的视觉经验不匹配的。这导致模型无法直接复用其强大的视觉先验。核心方案掩码视觉动作核心思路提出掩码视觉动作直接把机器人的运动当成像素空间中被部分揭示的时空轨迹掩码视频输入给预训练的大视频模型。这种方式像素对齐Pixel-aligned、与机器人本体无关Embodiment-agnostic非常适合大模型理解且只需极少的微调15小时数据即可高效适配。提供“机械臂的运动掩码”时模型就自动变成了正向建模告诉背景会怎么变。当提供“物体的运动掩码”时模型就自动变成了逆向建模推导出机械臂需要怎么动。论文核心贡献接口创新提出了像素空间的控制接口Masked Visual Actions并给出了极高效的微调方法仅15个小时的真实视频和模拟的掩蔽样本进行微调。理论统一证明了可以将前向和逆向问题转化为同一个视频模型的互补条件预测问题。工程验证在真实世界和仿真中完成了机器人操作任务的三种实际应用评估、规划、逆向将现有研究方法按照“控制信号的形式”进行了清晰的分类对比A可控视频生成作为机器人接口 (Controllable video generation as a robotic interface)现有做法在视频模型中加入控制信号使其变成能够预测物理效果的模拟器。常用的控制信号包括物理力、光流、手势、轨迹点、目标图像。缺点这些信号都不是密集的sparse、没有与像素对齐not pixel-aligned并且无法在不同的机器人本体embodiment之间通用B以像素为基础的动作条件生成 (Pixel-grounded action conditioning)现有做法很多工作如 BridgeV2W, Action Images, ORV 等通过渲染 URDF、生成高斯热力图、预测掩码等方式把动作转换到了像素空间缺点只在训练时揭示机器人运动只能做“前向forward”预测即机器人动场景变。C统一视频-动作模型 (Unified video-action models)现有做法像 UVA, UWM, Cosmos, Genie 等大模型在一个模型中统一前向动力学、逆向动力学和策略。缺点通常是模态掩码Modality masking——即在动作向量低维坐标和视频帧这两个不同维度的数据通道之间进行掩码切换。这种在“特征向量”上的掩码无法实现跨本体的迁移因为动作向量天生是特定于某个机器人的。2. 方法2.1 数据集构建视频模型的输入和输出格式Reference frame (参考帧)任务刚开始的静态背景图。Masked visual actions (掩码动作)这是一个序列帧。画面中除了机器人移动的那一块区域外全部都被涂白或隐去。模型看到的是一个“带着运动残影的纯白背景”。Target video (目标视频)真实的、完整的发展过程视频Ground Truth训练目标模型接收“参考帧”和“掩码动作”然后必须“脑补”出完整的“目标视频”即预测出物理世界对这一动作的反馈真实世界视频 (Real-world videos)来自DROID数据集。特点是场景极其丰富厨房、桌子等包含真实的物理接触。作者强调同时使用了“成功”和“失败”的轨迹这对于训练世界模型至关重要模型不仅要看到正确的动作还得学会“如果动作不当会有什么后果”这对逆向推导和规划非常关键。仿真数据 (Simulation data)来自Robocasa。特点是精准完全可控。方法1基于分割的数据集做法利用分割模型SegmentAnything (SAM)输入提示词A robotic arm一个机械臂让AI自动从DROID的真实视频中抠出机械臂的区域。无需相机标定甚至不需要知道视频里是哪款机器人缺点推理时不好用在测试时为用户提供一个精确的实体分割掩模是一个挑战信息泄露机器人中的任何遮挡区域都将隐含地泄漏来自原始视频的关于场景动态的信息方法2基于渲染的数据集做法利用 DROID 提供的机器人状态Joint States和相机标定参数Camera extrinsics对齐机器人 URDF 与输入轨迹将机器人精准渲染到视频画面中。在 Robocasa 仿真环境中仅渲染机器人本身排除场景中其他物体以生成掩码条件输入仿真环境下的优化半透明渲染Translucent rendering为了让模型看到完整的机器人而不自遮挡半透明渲染机器把夹爪染红Gripper fingers set to bright red将抓取器手指设置为亮红色以便视频模型可以轻松观察动作2.3 核心应用正向预测给定初始帧策略生成动作之后通过3d mesh渲染成masked visual actions再利用视频模型生成视频可以用来进行规划和评估逆向预测给定初始帧和目标物体的运动轨迹可以反推出机械臂的运动轨迹。实际推理场景不需要依赖外部的 SAM而是采用渲染的方法利用已知的机器人模型和相机参数在极短时间内通过“物理渲染Rendering”直接生成完美且连续的动作掩码保证了实时性和物理一致性。VLM的评估标准明确要求 VLM 必须能识别并扣分Penalize以下三种世界模型的作弊/幻觉现象Ghost/weak contact机械臂末端靠近但是没有接触到物体。Post-disengagement coasting若抓取器发生脱离回缩、停止或移开而物体随后仍自行向目标方向移动。这是不合理的Frame-jump glitches帧跳跃故障画面突然跳帧比如前一刻物体在桌面上下一帧突然出现在目标位置。这是视频模型常见的“偷懒”做法。为了强迫 VLM 遵照严格的逻辑打分作者设计了必须按顺序输出的JSON 结构robot_caused_outcome是否由机器人导致表示因果关系细化到 机器人推、机器人抓、物体瞬移、物体消失、物体自行移动、夹爪穿模物体、没尝试 、其他。task_success任务是否成功布尔值附带置信度。“成功 终极目标达成 物理因果成立 接触期间达成”。即便最后一帧物体到达了终点但如果发现是transported瞬移、autonomous自主动或者post-disengagement脱手滑行success立刻被强制判定为FALSE。end-effector_contact末端是否接触目标物体布尔值必须“可见的物理接触”。physics_realism物理真实性1~5 分的主观打分。明确要求惩罚瞬移Teleporting、形变Morphing、穿模Passing through solids、消失/复制物体Vanishing/duplicating、帧跳动如何从 N 个视频中选出“最好的一个”用复合键κ (1[success], realism, confidence, 1[contact], -r)按优先级从高到低依次比较首先最重要看success任务是否成功。优先选择标有“成功”标志的 rollout其次看realism物理真实性得分。优先选择物理真实性较高的第三看confidence置信度。优先选择置信度较高的第四看contact是否接触了目标。有接触的比没接触的优先保证了动作的真实介入。第五保底看-r即 rollouts 的负索引。如果以上都一样选随机采样的更靠后的那一条打破平局避免重复陷入某种特定失败模式。IDM模型架构与训练基于Transformer架构。使用AdamW 优化器训练300 个 Epoch。动作空间RoboCasa 的原生 12-D 动作空间与场景一相同2.2 数据和模型训练数据仅15个小时的真实的视频和模拟的掩蔽样本进行微调。使用了大约1,000个带有两个外部摄像头的DROID演示并使用基于分割和基于渲染的管道来处理每个演示同时保留了DROID的失败案例此外还包括Robocasa的4,000个示例机器人数据采集使用Franka Panda配了一个定制的 3D 打印柔性夹爪相机包括腕部相机和第三人称相机基座视频模型Base ModelWan-Fun-Control 2.2 14B机器人策略扩散模型条件注入方式Concatenation因为掩码动作和预测目标在空间上是逐像素对齐的所以不需要复杂的 Cross-Attention交叉注意力机制。直接把掩码视频拼接到输入上即可Concatenation缺失部分处理对于在掩码中被“挖空”的区域空白处统一填上灰色背景训练采用了 LoRA秩为 256批量大小为4使用8个NVIDIA H200 GPU在4天内训练模型约10000步。3. Masked Visual Actions作者把一个场景视作一组实体 e1,e2,…,en的集合。因为视频本质上就是在展示这些实体的时空轨迹Spatiotemporal trajectory所以视频的分布 p(V)完全等价于所有实体轨迹的联合分布通过一个统一的掩码Masking操作实现了“同一个模型回答不同问题”的目标。如果我们把场景中的一部分实体集合 SS作为揭示给模型的条件那么模型的目标就是预测其余实体的轨迹。 其中I0是初始参考帧是初始参考帧前向模型设置S A我们以主动实体为条件预测被动实体逆向模型设定S P我们以被动实体为条件预测主动实体4. 实验和结果测试目标验证掩码视觉动作作为世界模型控制信号的有效性验证核心优势重点突出对训练中未见过的机器人本体Unseen embodiments的泛化能力。验证应用价值证明该模型能真正用于规划Planning、策略评估Policy evaluation以及逆向策略Inverse modeling本身。3.1 基于条件的视频生成本文的“掩码视觉动作”与基线方法评估不同控制信号对视频生成的影响。基线方法如下纯图像生成只给模型一张初始场景的静态图片无动作信号依赖纯视觉先验猜测Wan-move额外提供稀疏的像素轨迹线但是物理载体的几何和接触信息需脑补实体Ctrl-world额外提供末端执行器状态但严重过拟合于特定机器人本体无法跨本体泛化掩码视觉动作提供实体的密集像素掩码直接将“动作”融入了视频模型的本体语言像素中让模型直接理解“物理对象在时空中的交互”结果对比在已见机器人DROID上本文与Ctrl-world表现相当但在面对未见过的双臂本体BEHAVIOR时基线方法彻底崩溃画面扭曲或静态而本文方法能完美泛化。为什么稀疏信号会失效稀疏信号如骨架、末端坐标缺乏物理形态信息容易引发模型**“幻觉”强行扭曲新机器人去匹配训练见过的形态。而本文的密集像素掩码**直接包含完整物理外观模型只需专注“像素交互”因此能优雅地跨越不同机器人本体。3.2 机器人应用规划核心策略先想象后执行面对同一个任务模型让基础策略Diffusion Policy随机生成10条不同的候选动作轨迹然后利用本文的世界模型将这些动作在脑海中模拟成视频最后引入大语言模型Gemini 3.1 Pro作为裁判从这10个想象视频中挑出物理最合理、成功率最高的最佳动作去真实执行。策略评估在仿真RoboCasa和真实世界中分别跑一个策略Diffusion Policy然后对比在真实世界里的成功率和在视频模型‘想象’出来的视频里的成功率。结果表明模型生成的视频和真实世界的物理结果高度线性相关。同时模型在“想象”时往往会产生乐观偏差Positive bias—脑补出的成功率会比实际真实场景略高一点点。意味着可以用视频模型替代昂贵的真实物理试错在虚拟空间中低成本且精准地评估策略的优劣动作提取可以利用Masked Visual Actions来制定一个逆建模问题而不是为模型提供机器人动作来执行给定期望的对象运动促使视频模型合成一个机器人实现该结果的视频。动作提取可以转换为逆动力学问题给定合成的机器人视频使用学习的逆动力学模型生成可执行的低级动作序列。实验方法和结果基线方法DP, ACT, SmolVLA为了让它们能完成任务作者给了它们100个该抓取任务的真实演示数据去训练本文方法Ours零样本Zero-shot视频模型本身从未看过这个“抓取咖啡杯”的具体任务。完全靠“常识”生成视频再生成动作。5. 总结本文核心贡献在于通过将动作对齐到像素空间仅用少量数据微调即可让预训练视频模型同时具备前向建模与逆向建模的统一世界建模能力可以很好地泛化到未见过的实体局限与现有的生成模型类似我们的模型学习对象交互之间的相关性而不是因果关系。并且性能受限于基础视频模型能力。进行动作规划时涉及多轨迹生成和VLM 打分评估延迟高不适合高频闭环控制它更适合用作“离线的策略评估器”或“数据生成器”而非“实时控制器”。