
摘要本文解读 ICLR 2025 论文《HAMSTER: Hierarchical Action Models For Open-World Robot Manipulation》。该论文提出分层视觉语言动作模型 HAMSTER通过融合高层 VLM 的二维路径预测、低层三维策略的精确执行与多源离线数据的统一表示解决机器人操作中泛化能力与操作精度长期对立的问题其特别之处在于把视觉语言模型的输出从关节动作换成一条画在图像上的二维末端轨迹使仿真数据、其他机器人的真机数据甚至人手草图都能成为监督信号。实验表明在真实机器人上HAMSTER 相对 OpenVLA 在七个泛化轴上平均提升 20 个百分点相对增益 50%平均超过单体 VLA 约 2 倍、超过纯 3D 模仿学习策略约 3 倍为具身智能如何低成本利用跨域数据提供了重要借鉴。视频讲解点击观看 B 站视频摘要论文基本信息背景与动机研究主线从问题到结论基准/方法设计分类全景方法细节高层 VLM 与离线数据低层策略与路径条件化训练细节实验设计与结果评测协议真机主结果提升来自分层不是数据量换相机角度也不塌高层 VLM 本身的路径质量通用能力与路径表示消融失败模式两种低层策略的瓶颈完全不同结果对比总结关键发现局限性常见问题FAQHAMSTER 和 RT-Trajectory 有什么区别为什么一定要分层直接把 VLM 微调成输出动作不行吗二维路径这种中间表示会不会信息量太少高层 VLM 需要域内的真机数据吗这套方法能配不同的低层策略吗模型规模有多大推理成本如何参考链接论文基本信息项目内容标题英文HAMSTER: Hierarchical Action Models For Open-World Robot Manipulation标题中文HAMSTER用分层动作模型打通开放世界机器人操作作者Yi Li、Yuquan Deng、Jesse Zhang、Joel Jang、Marius Memmel、Raymond Yu、Caelan Reed Garrett、Fabio Ramos、Dieter Fox、Anqi Li、Abhishek Gupta、Ankit Goyal前三位为共同一作Anqi Li、Abhishek Gupta、Ankit Goyal 为共同指导Yi Li 为项目负责人机构NVIDIA · University of Washington · University of Southern California会议ICLR 2025PosterarXivarXiv:2502.05485项目网站hamster-robot.github.io背景与动机机器人操作长期被一个矛盾卡住想要开放世界的语义泛化就得用大的视觉语言模型VLM想要毫秒级的精确控制就得用小的三维策略模型。二者在单体 VLA 模型里被强行绑在一起——RT-2、Octo、OpenVLA、$\pi_0$ 都是把预训练 VLM 直接微调成动作预测器。这条路线有两个代价。第一它必须依赖昂贵的真机「观测-语言-动作」三元组因为动作标签只能在真机上采集论文用一句话点破问题的本质机器人数据typically obtained through expensive on-robot operation。第二推理频率被大模型锁死——OpenVLA 的 70 亿参数模型在 RTX 4090 上只有 6 Hz而精细操作往往需要远高于此的控制频率。另一条路线的代表是三维模仿学习策略例如 PerAct、RVT-2、Act3D 与 3D Diffuser Actor。它们数据高效、几何鲁棒、能完成接触丰富的灵巧任务但对语义描述与环境外观的变化非常脆弱而且很难利用仿真数据——仿真与真机在外观和动力学上的差距太大。论文由此提出一个设问能不能把大模型的泛化能力与小策略模型的效率、局部鲁棒性和灵巧性结合起来答案是引入一条中间接口。VLM 不再直接输出动作而是输出一条粗略的二维路径低层三维策略跟着这条路径走。这条路径恰好满足三个条件能从图像序列廉价获得、基本与本体无关、对动力学细节不敏感——因此仿真轨迹、其他机器人的真机轨迹、乃至人手绘制的草图都可以变成训练信号。值得注意的是轨迹条件化本身并不新鲜。RT-Trajectory 最早提出用轨迹草图作为任务规格来条件化策略但它关心的是怎么用轨迹来指定任务而且只轻量尝试过让预训练 VLM 直接生成轨迹零样本提示。HAMSTER 关心的是一个不同的问题轨迹由谁生成、吃什么数据训练。这一转向把中间表示的选择变成了一个跨域数据可用性问题——也是全文真正的贡献所在。研究主线从问题到结论基准/方法设计HAMSTER 的全称是HierarchicalActionModels withSeparaTEd PathRepresentations。它的核心判断是接口选得越窄能被便宜数据监督的部分就越大。系统的两半各司其职。高层 VLM 以 VILA-1.5-13B 为基座微调输入一张单目 RGB 图像与语言指令输出一条二维路径低层策略以这条路径为条件同时接收深度图、点云与本体感受——这些模态恰恰是高层 VLM 无法消化的。因为路径只在回合开始生成一次高层模型规模与低层控制频率彻底解耦。分类全景方法细节高层 VLM 与离线数据高层 VLM 预测的二维路径 $p[(x_t,y_t,\mathrm{gripper}_t)]_t$其中 $x_t,y_t\in[0,1]$ 是末端执行器或人手在图像上的归一化像素坐标$\mathrm{gripper}_t$ 是夹爪开合的语言标记。形式上即 $\hat{p}\sim \mathrm{VLM}(\mathrm{img},z)$。训练数据被统一成同一种「图像 指令 → 点序列」的问答形式共四类来源RoboPoint 的77 万条像素点预测回答物体在哪、RLBench 的约32 万条仿真机械臂轨迹回答做什么、怎么做、Bridge 与 DROID 的约11 万条真机轨迹回答在真机上怎么做另加66 万条通用视觉问答做共训以保留世界知识。四类数据等权混采训练目标是最大化答案的对数似然 $\log \mathrm{VLM}(\mathrm{ans}\mid \mathrm{img},z)$。一个容易忽略但很关键的工程细节是路径简化。仿真与真机提取出的路径常常超过 100 步直接用会让 VLM 陷在低层尺度上。作者用 Ramer–Douglas–Peucker 算法容差 $\epsilon0.05$把路径压到2–5 个点使模型把注意力集中在夹爪开合点的定位上。消融显示在 VILA1.5-3B 这类小模型上RDP 简化显著优于固定 20 点采样放大到 130 亿参数后两种表示都能做对。低层策略与路径条件化低层策略的形式是 $\pi_\theta(a\mid s,o,z,p)$。路径进入策略的方式非常直接把每个 $(x_t,y_t)$ 用颜色渐变连成折线渐变色表示时间推进夹爪状态变化用圆圈标记绿圆表示闭合、蓝圆表示张开随后把这条折线叠加到策略看到的所有帧上。训练细节论文选用 RVT-2 与 3D Diffuser Actor3D-DA两种架构作为低层策略保持原有架构与超参不变。低层策略在域内用真机遥操作数据训练路径标签由本体感受投影得到为了让策略对 VLM 的预测误差鲁棒训练时给路径坐标叠加 $\mathcal{N}(0,0.01)$ 的高斯噪声夹爪开合标记不加噪。高层 VLM 的训练规模是8 张 A100每卡约 65 GB 显存有效批大小 256学习率 $1\times10^{-5}$约 30 小时完成视觉编码器一并更新。实验设计与结果评测协议真机实验使用 Franka Panda 机械臂全部数据由人类遥操作采集抓取放置220个回合10 个玩具物体、按按钮50个回合4 色按钮、击倒物体50个回合。评测覆盖74个真实任务、共222次试验。评分按子动作累加抓放按到达-抓取-移动-放置每步 0.25 分按钮与击倒每步 0.5 分。仿真实验在 RLBench 上训练、在 Colosseum 上评测涵盖 14 类任务与多种视觉变体每个配置跑 5 个随机种子。泛化被拆成七个轴分别打分物体-目标组合、视觉桌面纹理 / 光照 / 干扰物 / 杂乱 / 混合、语言把糖果改写成甜的东西、空间关系、新物体、多重组合再加上非抓取任务。真机主结果任务类型RVT-23D-DAOpenVLAHAMSTERRVT-2HAMSTER3D-DA抓取放置0.280.190.460.790.78按压按钮0.130.160.250.500.63击倒物体0.170.030.410.470.66总体来看在考虑显著视觉与语义变化的测试条件下HAMSTER 平均超过单体 VLA 约2 倍、超过纯 3D 模仿学习策略约3 倍按七个泛化轴平均是20 个百分点即50%的相对增益。提升来自分层不是数据量这是全文最重要的一组控制变量实验。作者把同一份RLBench 仿真数据喂给 OpenVLA结果真机均分反而从0.58 掉到 0.54——单体 VLA 拿不到跨域数据的收益。换成分层 VLM同一份数据却能把路径质量与真机泛化同时拉起来。换句话说收益的来源是架构而非数据规模。仿真侧的受控对照给出同样的结论。在 Colosseum 上跑 5 个种子取平均HAMSTER3D-DA 拿到0.46±0.04纯 3D-DA 只有0.35±0.04平均提升31%。作者认为机制在于用路径绘制图训练让策略盯住路径本身而不是去拟合无关的视觉特征。演示效率也翻了一倍只用50%数据HAMSTER3D-DA 就达到0.36±0.04已经是 3D-DA0.18±0.10的两倍用满数据到0.43±0.05。换相机角度也不塌视觉空间推理能力通过更换相机角度来检验。OpenVLA 换视角后成功率从0.60 掉到 0.23HAMSTERRVT2 只从0.83 掉到 0.73。方法原相机成功率 / 完全成功新相机成功率 / 完全成功OpenVLA0.60 / 0.300.23 / 0.00HAMSTERRVT20.83 / 0.700.73 / 0.40HAMSTERRVT2拼接1.00 / 1.000.98 / 0.90一个有意思的发现是如果把路径作为独立通道与 RGB 拼接六通道输入而不是画在图上成绩会更好——因为 RVT-2 的虚拟重投影会把画在图上的路径切碎。但这个方案要求策略能接受额外通道而使用预训练 CLIP 图像编码器的 3D-DA 只有三通道只能用绘制方案。这是通用性与峰值性能之间的真实取舍。高层 VLM 本身的路径质量为了评估路径质量作者请5 位机器人学习研究者对48 组图文对做盲评排名1 最好、4 最差数字越低越好方法VLM微调数据平均人类排名越低越好RT-Trajectory零样本 GPT-4o无3.47RT-TrajectoryCode-as-Policies GPT-4o无3.41HAMSTERVILA离线数据不含 RLBench 仿真2.13HAMSTERVILA离线数据全量1.40两个结论很关键其一零样本路径生成哪怕用闭源 GPT-4o 并叠加代码即策略显著不如用跨域数据微调过的开源 VLM其二仅仅把低保真的 RLBench 仿真路径加进微调集真机路径质量排名就从 2.13 提升到 1.40——跨外观域的知识确实被 VLM 吸收了。通用能力与路径表示消融微调没有让 VLM 变成只会画线的专用模型。在15 个视觉问答与多模态推理基准上HAMSTER 与基座 VILA1.5-13B 基本持平VQA-v2 是82.9 vs 82.8、GQA 是64.9 vs 64.3、MMB 是75.3 vs 74.9、MM-Vet 是44.4 vs 44.3MME 则是1588.4 vs 1569.6。失败模式两种低层策略的瓶颈完全不同按 VLM 路径是否预测正确分类统计后两种低层策略呈现出截然不同的失败结构低层策略未跟随路径导致的失败动作执行导致的失败RVT-272%28%3D-DA10%90%RVT-2 的失败主要来自跟不住路径因为它包含虚拟重投影步骤会把画在图上的路径切碎3D-DA 的视觉塔直接处理原始二维图像路径更容易被读懂因此失败集中在抓取角度等执行环节。这正好解释了为什么 RVT-2 换成独立路径通道拼接后收益最大——它的瓶颈本来就在路径解码上。结果对比总结关键发现分层才是跨域泛化的成因不是数据量同一份 RLBench 仿真数据喂给 OpenVLA真机均分从 0.58 掉到 0.54换成分层 VLM 则换来七轴平均 20 个百分点。窄接口换来数据自由只让 VLM 输出二维路径就使仿真数据、其他本体的真机数据、人手草图都能成为监督信号四类数据合计约 186 万条样本等权混采。覆盖全部三类任务且一致优于基线抓取放置 0.79 vs OpenVLA 0.46按压按钮 0.63 vs 0.25击倒物体 0.66 vs 0.41整体超过单体 VLA 约 2 倍、纯 3D 策略约 3 倍。演示效率翻倍仅用 50% 数据HAMSTER3D-DA 达到 0.36±0.04已是 3D-DA0.18±0.10的两倍。低保真仿真可迁移到真机把 RLBench 仿真路径加入微调集真机路径质量的人类排名从 2.13 提升到 1.40。通用能力没有退化在 15 个 VQA / 多模态推理基准上与基座 VILA1.5-13B 持平VQA-v2 82.9 vs 82.8微调没有把它变成只会画线的专用模型。局限性只有 2D没有原生 3D路径活在图像平面上VLM 并不具备真正的空间三维理解这个点在物体上方还是后方的歧义会直接造成执行错误。接口带宽受限坐标加夹爪开合无法传达力、旋转等细节长时域与接触丰富的任务需要更多次查询或更强的中间表示。执行中不重规划路径在回合开始只生成一次若场景在执行中显著变化模型既不能更新轨迹也无法重新识别最初指向的物体。离线标注仍需人工介入Bridge 数据集没有相机外参需要人工点选夹爪中心做 PnP 估计DROID 则有大量外参噪声必须按投影深度与 RGB 的对齐质量过滤。作者展望未来方向是研究可学习的中间接口并尝试直接从大规模人类视频中训练这类 VLM让便宜数据的边界继续往外扩。常见问题FAQHAMSTER 和 RT-Trajectory 有什么区别RT-Trajectory 最早提出用轨迹草图作为任务规格来条件化策略但只轻量尝试过让预训练 VLM 直接生成轨迹。HAMSTER 关心的是另一件事轨迹由谁生成、用什么数据训练。它把中间表示的选择变成了一个跨域数据可用性问题并用控制变量实验证明分层本身是泛化的成因。为什么一定要分层直接把 VLM 微调成输出动作不行吗论文用实测回答了这个问题。把同一份 RLBench 仿真数据喂给单体 VLA OpenVLA真机均分反而从 0.58 掉到 0.54——单体架构拿不到跨域数据的收益。原因在于动作输出与本体、动力学强耦合而二维路径基本与本体无关、对动力学细节不敏感。二维路径这种中间表示会不会信息量太少它确实带宽受限。作者在局限性中明确承认只有 2D 无法表达力和旋转也不具备原生三维预测上下前后的歧义会造成执行错误。但换来的是廉价可得的监督信号——路径可以从仿真、其他机器人数据、人手草图中大量获取精度则交给低层 3D 策略补齐。高层 VLM 需要域内的真机数据吗不需要。HAMSTER 的高层 VLM 完全没有见过部署环境只用 RoboPoint、RLBench、Bridge、DROID 与通用 VQA 数据微调低层策略才使用 320 个回合的域内遥操数据。高层全离线、低层全在线的分工正是泛化能力的来源。这套方法能配不同的低层策略吗可以论文验证了 RVT-2 与 3D Diffuser Actor 两种架构都成立抓取放置上分别从 0.28 和 0.19 提升到 0.79 和 0.78。此外路径的注入方式也可以更换画在图上或作为独立通道与原图拼接。拼接对 RVT-2 效果更好新视角成功率 0.98但它要求策略能接受额外通道使用 CLIP 图像编码器的 3D-DA 只能用绘制方案。模型规模有多大推理成本如何高层是 130 亿参数的 VILA-1.5-13B训练用 8 张 A100、约 30 小时。推理时 VLM 每个回合只调用一次生成路径低层策略高频跟随因此高层规模不会直接拖慢控制频率——这是相对单体 VLAOpenVLA 7B 在 RTX 4090 上仅 6 Hz的关键优势。参考链接HAMSTER: Hierarchical Action Models For Open-World Robot ManipulationarXiv 摘要页HAMSTER 项目网站含真机演示视频与提示词细节OpenVLA: An Open-Source Vision-Language-Action Model单体 VLA 代表基线RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches轨迹草图的开创工作RVT-2: Learning Precise Manipulation from Few Demonstrations本文低层策略之一RoboPoint: A Vision-Language Model for Spatial Affordance Prediction点预测数据来源给大家推荐一款自用写文献综述、无虚构文献的 AI复旦大学 FudanNLP 团队自研 切问学术官网qiewenpaper.com覆盖3.6 亿篇可溯源真实中英文文献能自动整合文献观点生成规范综述还能挖掘研究创新点、复现实验配合视频教学新手快速上手文献综述写作后记博客的关键词集中在编程、算法、机器人、人工智能、数学等等持续高质量输出中。讨论QQ群白拾的小屋 (750365700)⭐B站账号白拾的物理AI组会活跃于知识区和动画区✨GitHub主页YhbCode000工程文件