VLA落地真机:OpenDM在AgileX COBOT Magic与DOS-W1的相机架设与机型改造完全指南
【免费下载链接】opendmAn Open-World Foundation Model for General-Purpose Embodied Intelligence.项目地址: https://gitcode.com/gh_mirrors/op/opendm
OpenDM(DM0.5)是面向开放世界具身智能的视觉-语言-动作(VLA)模型,支持在 AgileX COBOT Magic 双臂机器人与 Dexmal DOS-W1 真机上部署。本指南将带你用最少改动,完成相机架设与机型适配,让 VLA 模型快速落地真机。
为什么相机架设决定 VLA 落地效果
DM0.5 通过「主视角 + 左右腕部」共 3 路图像输入来理解环境并输出动作。相机的高度、角度、视野直接决定了模型看到的信息质量,因此官方对真机的相机架设做了统一标准:
- 主视角相机安装高度:离地 177.2 cm
- 主视角相机与竖直铝型材的夹角:27.5°
这套参数在两款机型上完全一致,是复现官方效果的关键。完整改动记录见 docs/zh/robot_platforms.md。
机型对照:COBOT Magic 与 DOS-W1 如何映射到代码
在 OpenDM 代码中,两款真机分别映射为以下机型类型(定义于 opendm/constants/robot.py):
| 真机平台 | 代码机型类型 | 状态/动作维度 | 维度构成 |
|---|---|---|---|
| AgileX COBOT Magic | Aloha | 14 维 | 左臂 6 关节 + 左夹爪 + 右臂 6 关节 + 右夹爪 |
| Dexmal DOS-W1 | DOS W1 | 14 维 | 同上 |
两者的 14 维 state 描述一致(6 关节 + 夹爪 × 2 臂),这意味着同一套三路图像推理服务可以服务两种本体,只需在请求中指定对应的robot_type选择归一化 profile。
AgileX COBOT Magic 相机改造:3 处关键改动
基础机型沿用 AgileX COBOT Magic 原厂配置,OpenDM 只改了 3 处:
- 腕部相机更换:左右两条执行臂的臂上眼相机均更换为 RealSense D405 深度相机,替代原厂腕部相机。
- 定制长版支架:D405 使用项目定制的长版相机支架,3D 打印源文件(STEP 格式)已开源:realsense-d405-wrist-camera-bracket-long.step,可直接导入建模软件查看结构。
- 主视角相机调整:沿用原厂位于两条执行臂之间的铝型材相机架,仅将安装高度调整为离地
177.2 cm,相机与竖直铝型材夹角调整为27.5°。
其余硬件、配件和安装方式均沿用原厂方案,不需要额外采购或改装。
Dexmal DOS-W1 相机架设:只改 2 个数值
DOS-W1 的改造更简单——完全沿用原厂相机及相机架设方案,只需调整两个参数:
- 主视角相机安装高度调整为离地
177.2 cm; - 相机与竖直铝型材夹角调整为
27.5°。
除这两项外,腕部相机、支架、走线全部保持出厂状态,是两款机型中改造成本最低的一台。
💡 提示:两台机器的主视角参数(177.2 cm / 27.5°)保持一致,是为了让「Head 视角」在不同本体上产生可迁移的视觉分布,这正是 DM0.5 跨本体泛化能力的基础。
架设完成后:启动真机推理服务
相机架好后,用 script/dm05_launcher.sh 启动三路图像推理服务即可:
script/dm05_launcher.sh \ --exp opendm/exp/dm05_exp.py \ --task inference \ --model-config.model-name-or-path ./checkpoints/DM05 \ --model-config.chunk-size 50 \ --inference-config.output-action-dim 14 \ --inference-config.image-prompts "Head" "Left wrist" "Right wrist" \ --inference-config.port 7891关键点:
- 3 路图像按
Head→Left wrist→Right wrist顺序上传,必须与相机实际位置一致; output-action-dim设为14,对应双臂 14 维状态;- 请求中通过
observation.robot_type指定Aloha(COBOT Magic)或DOS W1(DOS-W1),服务会自动选择对应的归一化 profile。
HTTP 接口、fast backend 加速和常见问题排查见 docs/zh/dm05_inference.md。
进阶:接入 RoboChallenge 真机评测
如果目标是参加 RoboChallenge Table 30 v2 真机评测,OpenDM 内置了完整的推理客户端 third_party/robochallenge_inference/,直接支持aloha与w1两种机型配置:
cd third_party/robochallenge_inference python execute.py --config-name generalist/aloha user_id=... submission_id=... run_id=... python execute.py --config-name generalist/w1 user_id=... submission_id=... run_id=...机型级默认参数(action horizon、TensorRT engine 等)定义在 third_party/robochallenge_inference/configs/default.yaml,w1单任务配置见 third_party/robochallenge_inference/configs/generalist/w1.yaml,完整流程参考 docs/zh/dm05_robochallenge.md。
常见问题清单
| 问题 | 排查要点 |
|---|---|
| 模型表现与官方差距大 | 核对主视角高度 177.2 cm、夹角 27.5° 是否精确到位 |
| 腕部视角与训练数据不一致 | COBOT Magic 需换 D405 并安装定制长支架,勿用原厂腕部相机 |
| 动作输出抖动/偏移 | 检查robot_type是否匹配机型,归一化 profile 是否选错 |
| state 维度报错 | 双臂 14 维顺序为「左臂 6 关节 + 左夹爪 + 右臂 6 关节 + 右夹爪」,勿颠倒 |
总结:照抄官方参数即可快速复现
VLA 落地真机的门槛,很大程度上来自相机架设这一「硬件细节」。OpenDM 给出的答案非常克制:COBOT Magic 换 3 处(D405 ×2 + 主视角参数),DOS-W1 只调 2 个数值(高度 + 夹角),其余全部沿用原厂方案。按 docs/zh/robot_platforms.md 的参数逐项核对,再启动三路图像推理服务,就能让 DM0.5 在你的真机上跑起来。
【免费下载链接】opendmAn Open-World Foundation Model for General-Purpose Embodied Intelligence.项目地址: https://gitcode.com/gh_mirrors/op/opendm
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考