拓十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

VLA落地真机:OpenDM在AgileX COBOT Magic与DOS-W1的相机架设与机型改造完全指南

VLA落地真机:OpenDM在AgileX COBOT Magic与DOS-W1的相机架设与机型改造完全指南

VLA落地真机:OpenDM在AgileX COBOT Magic与DOS-W1的相机架设与机型改造完全指南

【免费下载链接】opendmAn Open-World Foundation Model for General-Purpose Embodied Intelligence.项目地址: https://gitcode.com/gh_mirrors/op/opendm

OpenDM(DM0.5)是面向开放世界具身智能的视觉-语言-动作(VLA)模型,支持在 AgileX COBOT Magic 双臂机器人与 Dexmal DOS-W1 真机上部署。本指南将带你用最少改动,完成相机架设与机型适配,让 VLA 模型快速落地真机。

为什么相机架设决定 VLA 落地效果

DM0.5 通过「主视角 + 左右腕部」共 3 路图像输入来理解环境并输出动作。相机的高度、角度、视野直接决定了模型看到的信息质量,因此官方对真机的相机架设做了统一标准:

  • 主视角相机安装高度:离地 177.2 cm
  • 主视角相机与竖直铝型材的夹角:27.5°

这套参数在两款机型上完全一致,是复现官方效果的关键。完整改动记录见 docs/zh/robot_platforms.md。

机型对照:COBOT Magic 与 DOS-W1 如何映射到代码

在 OpenDM 代码中,两款真机分别映射为以下机型类型(定义于 opendm/constants/robot.py):

真机平台代码机型类型状态/动作维度维度构成
AgileX COBOT MagicAloha14 维左臂 6 关节 + 左夹爪 + 右臂 6 关节 + 右夹爪
Dexmal DOS-W1DOS W114 维同上

两者的 14 维 state 描述一致(6 关节 + 夹爪 × 2 臂),这意味着同一套三路图像推理服务可以服务两种本体,只需在请求中指定对应的robot_type选择归一化 profile。

AgileX COBOT Magic 相机改造:3 处关键改动

基础机型沿用 AgileX COBOT Magic 原厂配置,OpenDM 只改了 3 处:

  1. 腕部相机更换:左右两条执行臂的臂上眼相机均更换为 RealSense D405 深度相机,替代原厂腕部相机。
  2. 定制长版支架:D405 使用项目定制的长版相机支架,3D 打印源文件(STEP 格式)已开源:realsense-d405-wrist-camera-bracket-long.step,可直接导入建模软件查看结构。
  3. 主视角相机调整:沿用原厂位于两条执行臂之间的铝型材相机架,仅将安装高度调整为离地177.2 cm,相机与竖直铝型材夹角调整为27.5°。

其余硬件、配件和安装方式均沿用原厂方案,不需要额外采购或改装。

Dexmal DOS-W1 相机架设:只改 2 个数值

DOS-W1 的改造更简单——完全沿用原厂相机及相机架设方案,只需调整两个参数:

  1. 主视角相机安装高度调整为离地177.2 cm;
  2. 相机与竖直铝型材夹角调整为27.5°。

除这两项外,腕部相机、支架、走线全部保持出厂状态,是两款机型中改造成本最低的一台。

💡 提示:两台机器的主视角参数(177.2 cm / 27.5°)保持一致,是为了让「Head 视角」在不同本体上产生可迁移的视觉分布,这正是 DM0.5 跨本体泛化能力的基础。

架设完成后:启动真机推理服务

相机架好后,用 script/dm05_launcher.sh 启动三路图像推理服务即可:

script/dm05_launcher.sh \ --exp opendm/exp/dm05_exp.py \ --task inference \ --model-config.model-name-or-path ./checkpoints/DM05 \ --model-config.chunk-size 50 \ --inference-config.output-action-dim 14 \ --inference-config.image-prompts "Head" "Left wrist" "Right wrist" \ --inference-config.port 7891

关键点:

  • 3 路图像按Head→Left wrist→Right wrist顺序上传,必须与相机实际位置一致;
  • output-action-dim设为14,对应双臂 14 维状态;
  • 请求中通过observation.robot_type指定Aloha(COBOT Magic)或DOS W1(DOS-W1),服务会自动选择对应的归一化 profile。

HTTP 接口、fast backend 加速和常见问题排查见 docs/zh/dm05_inference.md。

进阶:接入 RoboChallenge 真机评测

如果目标是参加 RoboChallenge Table 30 v2 真机评测,OpenDM 内置了完整的推理客户端 third_party/robochallenge_inference/,直接支持aloha与w1两种机型配置:

cd third_party/robochallenge_inference python execute.py --config-name generalist/aloha user_id=... submission_id=... run_id=... python execute.py --config-name generalist/w1 user_id=... submission_id=... run_id=...

机型级默认参数(action horizon、TensorRT engine 等)定义在 third_party/robochallenge_inference/configs/default.yaml,w1单任务配置见 third_party/robochallenge_inference/configs/generalist/w1.yaml,完整流程参考 docs/zh/dm05_robochallenge.md。

常见问题清单

问题排查要点
模型表现与官方差距大核对主视角高度 177.2 cm、夹角 27.5° 是否精确到位
腕部视角与训练数据不一致COBOT Magic 需换 D405 并安装定制长支架,勿用原厂腕部相机
动作输出抖动/偏移检查robot_type是否匹配机型,归一化 profile 是否选错
state 维度报错双臂 14 维顺序为「左臂 6 关节 + 左夹爪 + 右臂 6 关节 + 右夹爪」,勿颠倒

总结:照抄官方参数即可快速复现

VLA 落地真机的门槛,很大程度上来自相机架设这一「硬件细节」。OpenDM 给出的答案非常克制:COBOT Magic 换 3 处(D405 ×2 + 主视角参数),DOS-W1 只调 2 个数值(高度 + 夹角),其余全部沿用原厂方案。按 docs/zh/robot_platforms.md 的参数逐项核对,再启动三路图像推理服务,就能让 DM0.5 在你的真机上跑起来。

【免费下载链接】opendmAn Open-World Foundation Model for General-Purpose Embodied Intelligence.项目地址: https://gitcode.com/gh_mirrors/op/opendm

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

返回列表