十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

具身智能论文学习13:RDT-1B: A DIFFUSION FOUNDATION MODEL FORBIMANUAL MANIPULATION

具身智能论文学习13:RDT-1B: A DIFFUSION FOUNDATION MODEL FORBIMANUAL MANIPULATION 第一部分基本收录情况项目内容论文全名RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation中文译名《RDT-1B面向双臂操作的扩散基础模型》RDT全称Robotics Diffusion Transformer正式会议The Thirteenth International Conference on Learning Representations会议简称ICLR 2025正式收录ICLR 2025 Conference Proceedings展示形式ICLR 2025 Poster会议时间2025年4月24日至28日会议地点Singapore EXPO新加坡作者Songming Liu、Lingxuan Wu、Bangguo Li、Hengkai Tan、Huayu Chen、Zhengyi Wang、Ke Xu、Hang Su、Jun Zhu主要机构清华大学相关实验室与研究中心模型规模1.2B参数核心模型Diffusion TransformerDiT视觉编码器SigLIP语言编码器T5-XXL动作生成连续动作DiffusionAction Chunk64步预训练数据46个多机器人数据集1M轨迹约21TB下游双臂数据6K轨迹目标机器人ALOHA双臂机器人核心能力Zero-shot、1–5 shot、语言跟随、灵巧双臂操作第二部分解决的问题你现在已经读过的主要动作生成路线是OpenVLA→离散动作Token自回归Diffusion Policy→连续Action ChunkDiffusionOcto→小型通用TransformerDiffusion Headπ0​→VLMAction ExpertFlow MatchingFAST→DCT压缩Token自回归OpenVLA-OFT→Parallel DecodingContinuous L1​而RDT-1B走的是大规模多机器人预训练1.2B Diffusion Transformer统一物理动作空间双臂下游微调​怎样把Diffusion Policy从单任务策略扩展成十亿参数级、多机器人预训练、面向双臂操作的Foundation Model。论文明确提出利用多机器人数据预训练再使用目标双臂机器人的数据进行微调以解决双臂数据本身不足的问题。第四部分论文真正要解决的两个核心问题作者把双臂Foundation Model面临的问题归纳得非常清楚。问题一双臂动作更加多模态在同一个观测和同一条语言指令下机器人可能存在多种不同、但都合理的动作方案。也就是这个条件动作分布不是只有一个最可能的动作而可能有多个概率峰。比如任务是“把桌上的方块抓起来。”对于单臂机器人假设只有一只右臂能操作合理策略可能比较集中右臂靠近→抓取但双臂机器人就可能出现很多不同策略左手去抓右手去抓左手先固定右手抓右手先固定左手抓两只手从不同方向同时接近。这些动作轨迹彼此差异很大但都可能成功完成同一个任务。同一个状态示范者这次选左手抓下一次又可能选右手抓如果你用普通的确定性回归那么确定性回归会试图找到一个“最合适的单一答案”。模型可能试图把这两个答案“平均”。因此它实际做的不是学习完整的而是去预测一个值比如L2 常常倾向于条件均值L1 倾向于条件中位数。例如极端地理解左手抓右手抓→一个平均动作→生成一个确定动作但这个“平均动作”可能既不像左手抓也不像右手抓反而是一个根本不可执行的动作。RDT 论文也明确说如果把这种问题当成 deterministic regression模型可能学习不同 action modes 的“average”最终产生 out-of-distribution、甚至不可行动作。因此 RDT 是想学习即给定当前状态和语言后所有合理动作分别有多大可能性。然后利用 Diffusion 从这个分布中生成其中一种完整、合理的动作方案。论文中也是从高斯噪声动作开始通过多步 denoising 得到最终 clean action sample。所以假设真实分布有三个峰左手抓,右手抓,双手抓RDT 某一次运行可能生成左手抓​换一个随机噪声再运行一次可能生成右手抓​重点是它学习的是“合理动作在哪里”的整个分布结构然后从其中生成一种完整方案而不是强迫所有训练样本共用一个平均答案。Figure 2用于说明RDT的目标机器人以及双臂操作为什么比单臂操作具有更强的动作多模态性。图(a)展示实验所采用的ALOHA双臂系统包括左右机械臂、左右夹爪、两个腕部相机以及一个外部相机图(b)以抓取同一个方块为例说明即使初始状态和最终目标相同双臂机器人仍可能存在多种合理的动作模式例如由不同机械臂优先接近目标、从不同方向完成抓取或由双臂采取不同的协同方式因此对应的条件动作分布并不是单峰而可能存在多个明显的mode。由于示范数据中的操作者可能随机采用其中某一种正确策略如果使用确定性回归模型容易把不同动作模式平均成一个实际上不可执行的中间动作因此RDT选择使用Diffusion显式建模条件动作分布 p(a∣o,l)而不是只预测唯一动作。问题二双臂数据太少对于某一个具体的双臂机器人可获得的数据通常不到 10K 条 trajectory而训练一个 1B 级 Foundation Model 需要远大于这个规模的数据。因此作者不只用 ALOHA 双臂数据而是先收集大量多机器人数据进行预训练再用目标双臂机器人的数据进行微调。论文把这个过程描述为将可用数据规模扩大约三个数量级。单一双臂机器人几千条 → 多机器人预训练百万级Octo 已经用了 diffusion但 RDT 作者认为已有 diffusion robotic foundation model 的规模还比较小。论文中 Octo 最大约93M而 RDT 做到1.2B​也就是把 Diffusion Transformer 真正 scale 到 billion-parameter 级机器人 Foundation Model 基座模型。Figure 1给出了RDT-1B从数据、模型到最终能力的整体路线。左上部分表明RDT以1.2B参数的Diffusion Transformer为核心并结合T5语言编码器、SigLIP视觉编码器以及Unified Action Space统一动作空间把不同机器人的动作按照物理含义映射到统一表示中进行语言条件下的双臂动作生成图中的总体指标显示经过大规模多机器人预训练后RDT达到68.2%的综合表现而从头训练仅为34.8%即预训练带来33.4个百分点的提升同时明显高于ACT、OpenVLA和Octo等基线。右上部分展示其两阶段训练流程首先利用来自46个数据集、多个机器人平台的约1M条轨迹进行跨机器人预训练再利用作者自行采集的约6K条目标双臂机器人轨迹进行微调。下方则概括模型最终测试的四类能力包括精细双臂操作、1-shot/5-shot新技能学习、语言指令跟随以及对未见物体和未见场景的zero-shot泛化。第六部分RDT的总体结构1RDT-1B 的整体输入输出Figure 3展示了RDT从异构机器人输入到连续Action Chunk输出的完整模型结构。首先不同机器人原有的关节、末端执行器或移动底盘动作被按照物理含义映射到统一动作空间使不同embodiment能够共享同一种动作表示机器人当前本体状态、带噪动作块、控制频率以及Diffusion时间步经过MLP编码后形成主要的去噪输入。视觉方面模型同时接收外部相机、右腕相机和左腕相机在连续时刻的图像经冻结的SigLIP编码并加入能够区分时间、相机视角和patch位置的多维位置编码语言指令则经冻结的T5-XXL编码。随后视觉Token与语言Token不是在每层同时注入而是在连续Diffusion Transformer Block中通过Cross-Attention交替注入即Alternating Condition Injection从而避免大量视觉Token压制语言信息。经过多层Diffusion Transformer以及最终Norm和MLP Decoder后模型直接输出去噪后的连续动作块。2RDT的Diffusion训练过程这一部分和Diffusion Policy高度类似但RDT选择预测干净动作本身网络每次看到带噪 Action Chunk 时直接估计原始无噪声 Action Chunk而不是去预测噪声 ϵ但整个 Diffusion 推理过程仍然需要多步迭代去噪。首先真实动作加入高斯噪声其中然后模型直接预测训练损失函数均方误差损失推理时则不断最终得到合理动作。3为什么仍然要使用Action ChunkRDT不只对建模而是直接建模其中。论文实现中。理由和你前面学的Diffusion Policy、Octo、π0​、OFT一致第一可以考虑前后动作之间的时间连续性第二能够减少逐时刻重新决策造成的累积误差第三可以减少突然出现的不连续动作论文甚至特别指出Action Chunk有助于避免可能伤害机器人的突然动作变化。所以RDT本质上也是Chunk-level continuous action generation​4视觉、语言、本体状态的各自模型编码器①视觉视觉输入方面RDT 使用冻结的 SigLIP 作为视觉编码器。多视角 RGB 图像首先经过 SigLIP 提取视觉特征再映射到 RDT 的 token 空间。由于 SigLIP 在 RDT 的预训练和微调过程中都保持冻结因此它主要负责提供稳定的视觉语义表示而不是随机器人数据重新学习视觉能力。②语言语言输入方面RDT 使用冻结的 T5-XXL 编码任务指令。自然语言经过 T5-XXL 转换成 Language Tokens再作为条件通过 Cross-Attention 注入 Diffusion Transformer。与 SigLIP 一样T5-XXL 的参数也不参与 RDT 训练。③机器人低维信息机器人相关的低维物理信息则由 MLP 编码。其中包括 Proprioception、Noisy Action Chunk、Control Frequency 和 Diffusion timestep。论文使用带 Fourier Features 的 MLP 来处理这些连续物理量以增强对机器人数据中高频变化的表示能力。因此RDT 真正进行大规模训练的核心并不是 SigLIP 和 T5-XXL而是1.2B 参数的 Diffusion Transformer 主体以及相关的输入/输出适配模块。5RDT需要修改普通DiTDiffusion Transformer作者发现图像生成领域的Diffusion TransformerDiT不能直接原封不动搬到机器人动作。原因在于机器人数据具有非线性动力学高频变化接触与碰撞不稳定数值范围多模态异构输入。所以做了三个核心修改QKNorm RMSNorm​ MLP Decoder​ Alternating Condition Injection​第一QKNorm RMSNorm 用于提高大模型训练稳定性。机器人状态和动作的数值范围可能变化较大容易造成 attention 数值不稳定甚至梯度爆炸。因此 RDT 在 Attention 中加入 QKNorm并用 RMSNorm 替代原始 DiT 的 LayerNorm使 1.2B 参数模型能够更稳定地进行大规模训练。论文的消融实验也显示移除这些归一化设计后训练容易变得不稳定。第二MLP Decoder 用于建模机器人动作的非线性。普通 DiT 最后通常使用线性层输出而机器人动作受到动力学、接触和约束等因素影响往往具有明显的非线性。RDT 因此使用 nonlinear MLP Decoder将 Transformer 的隐藏表示映射回连续动作空间以增强对精细动作的表达能力。第三Alternating Condition InjectionACI用于平衡视觉与语言条件。RDT 的视觉 Token 数量通常远多于语言 Token如果每一层都同时注入二者视觉信息容易压制语言信息。作者因此让 Image Tokens 和 Language Tokens 在连续的 DiT Blocks 中通过 Cross-Attention交替注入以增强 instruction following。这个思想其实与你刚读完OpenVLA-OFT中的FiLM非常类似两篇论文都发现真实机器人模型很容易“看图不听话”所以都必须专门增强Language Grounding。Figure 4 对 RDT 的三项 DiT 改造进行了消融验证。去掉QKNorm RMSNorm后训练 Loss 会出现明显尖峰甚至数值爆炸说明二者对 1B 级模型的训练稳定性十分关键去掉MLP Decoder后Robot Dog 精细操作成功率由32% 降至 12%而去掉Alternating Condition InjectionACI后语言跟随成功率由62.5% 降至 12.5%。这分别验证了 MLP Decoder 对非线性精细动作建模、ACI 对平衡视觉与语言条件的重要作用。6最重要的数据创新——Physically Interpretable Unified Action Space统一动作空间Unified Action Space 的关键是“让不同机器人的相同物理量落到相同语义位置”。RDT 希望利用46 个不同机器人的数据集进行统一预训练但不同机器人的动作空间差异很大有的使用关节位置有的使用末端执行器位姿有的还包含移动底盘。如果直接把这些动作向量拼到一起训练不同维度之间没有统一含义模型很难学习跨机器人的共享规律。例如机器人A机器人B机器人C还可能有mobile base为此RDT 设计了一个128 维 Physically Interpretable Unified Action Space。其中 0−49 维对应右臂50−99 维对应左臂100−102 维对应移动底盘其余位置保留左右臂内部又按照 Joint Position、Gripper Position、Joint Velocity、EEF Position、EEF 6D Pose、EEF Velocity 和 Angular Velocity 等物理量进一步划分。不同机器人的原始动作按照物理意义填入对应位置不存在的维度再进行 padding。例如一个 6-DoF 单臂机器人的关节位置会被放到对应的 joint-position 槽位而不是随意占据前 6 个维度单臂机器人则统一映射到 right-arm 区域。这样不同 embodiment 的数据虽然原始动作格式不同但相同物理量最终会落在相同位置从而让 RDT 能够利用跨机器人数据学习可迁移的物理规律。7RDT预训练和后训练Pre-training → Fine-tuningRDT-1B 采用典型的“大规模预训练 目标机器人微调”流程。原因是单一双臂机器人通常只有不到 10K 条轨迹难以直接支撑 1.2B 参数 Foundation Model 的训练因此作者先利用多机器人数据学习通用机器人知识再适配到目标双臂平台。第一阶段Multi-Robot Pre-training。作者首先在46 个多机器人数据集、共 1M trajectories约 21TB上预训练 RDT。不同机器人的动作空间通过 Unified Action Space 统一表示使模型能够利用单臂、双臂以及不同控制形式的数据共同学习可迁移的视觉、语言和机器人控制知识。46 Datasets 1M Multi-Robot Trajectories → Pre-trained RDT-1B​第二阶段Target-Robot Fine-tuning。完成大规模预训练后作者再使用自己收集的6K 双臂 trajectories对 RDT 进行微调使其适配目标双臂机器人及具体 manipulation 任务。论文中的 RDT 主体继续训练而 T5-XXL 和 SigLIP 编码器保持冻结。Pre-trained RDT-1B6K Bimanual Trajectories → RDT for Target Bimanual Robot​这套设计的核心思想就是先用百万级跨机器人数据学习通用机器人先验再用少量目标双臂数据完成 embodiment adaptation而不是让 1.2B 参数模型仅依靠几千条双臂轨迹从零开始学习。第七部分实验效果1模型规模、训练成本和实时推理RDT-1B 由28 层 Transformer、2048 hidden size、32 个 attention heads构成总参数量约1.2B。模型使用 48 张 H100 80GB GPU 进行大规模训练预训练约1M steps、持续一个月随后在双臂数据上微调130K steps、约 3 天。虽然 RDT 使用 Diffusion 生成动作需要迭代去噪但推理阶段采用DPM-Solver将 Action Chunk 的采样从约 100 步压缩到5 步。在目标机器人的 RTX 4090 上可达到约6 Action Chunks/s、381 actions/s因此仍能够满足实时机器人控制需求。2真实机器人实验RDT 测试哪些能力作者设计了 7 项真实双臂任务并不是单纯测试训练任务的成功率而是分别考察Zero-shot 泛化、语言指令跟随、Few-shot 新技能学习和精细操作能力。Figure 5 展示了具体任务过程Table 1 则给出了每项任务对应的评测维度。任务主要考察能力关键设置Wash CupUnseen Object测试未见过的杯子Pour WaterUnseen Scene部署到未见过的房间Pour Water-L-1/3 / R-2/3Instruction Following根据语言选择左右手和目标水位Handover5-Shot Learning仅 5 条相关技能示范Fold Shorts1-Shot Learning仅 1 条相关技能示范Robot DogDexterity精确推动摇杆测试精细控制其中Handover 和 Fold Shorts 分别只有5 条和 1 条技能示范语言跟随任务在训练时只出现little / half / full等水位描述而测试时要求理解one-third / two-thirds因此也包含语言组合泛化。Figure 5具体展示了RDT真实机器人实验中七项任务的初始状态、动作过程和成功判据。Wash Cup要求机器人拿起杯子、打开水龙头、接水、倒水并重新放回杯子同时比较训练中见过与未见过的杯子Pour Water要求完成拿瓶、倒水和放回并将机器人部署到三个训练中完全未见过的房间Pour Water-L-1/3和Pour Water-R-2/3要求模型不仅理解应使用左手还是右手还需要按照语言要求将水分别倒至约三分之一和三分之二的位置Handover要求机器人先抓取远处的记号笔再完成双手之间的交接并最终放入包装盒Fold Shorts要求双臂协同将随机摆放且褶皱状态不同的短裤折叠成矩形Robot Dog则要求机器人抓住遥控器并精确推动摇杆使机器狗沿直线前进。通过这些任务作者并不是简单测试训练内动作复现而是分别测试未见物体、未见场景、语言组合泛化、极少样本技能学习以及精细双臂控制能力。Table 1将七项真实机器人任务与论文希望回答的四类研究问题一一对应。Wash Cup用于测试未见物体泛化机器人需要在一个训练见过的杯子和两个完全未见杯子上执行完整洗杯流程Pour Water用于测试未见场景泛化要求同一策略直接部署到三个训练中未出现的房间Pour Water-L-1/3和Pour Water-R-2/3用于测试语言指令跟随其中训练指令只包含little、half和full等水位表达而测试要求模型理解one-third和two-thirds以及左右手约束因此实际测试的是新的语言组合能否正确ground到动作上Handover和Fold Shorts分别只提供5条和1条相关技能示范用来测试5-shot和1-shot新技能学习Robot Dog则要求极精确地推动摇杆因为很小的角度误差都会导致机器狗走偏因此用于测量RDT的Dexterity。通过这种实验设计论文将泛化能力进一步拆成Unseen Object、Unseen Scene、Instruction Following、Few-Shot Learning和Dexterity而不是只报告一个整体成功率。3Main ResultRDT 的真实机器人泛化能力Table 3 是 RDT-1B 的核心真实机器人结果。完整的预训练 RDT 在七项任务上整体优于 ACT、OpenVLA、Octo 和 RDT from scratch优势主要体现在泛化能力上在三个未见房间的 Pour Water 中成功率分别达到62.5%、100% 和 62.5%在 1-shot Fold Shorts 和 5-shot Handover 中分别达到68% 和 40%在 Robot Dog 精细控制任务中最终直线行走成功率达到48%。同时RDT 能根据未直接见过的one-third / two-thirds指令正确选择左右手并控制倒水量。这些结果说明RDT 的主要优势并不是记住训练任务而是通过大规模预训练获得了对未见物体、未见场景、新语言组合、Few-shot 新技能和精细双臂操作的泛化能力。Table 3是RDT-1B最核心的真实机器人定量结果系统比较ACT、OpenVLA、Octo、未预训练的RDT-scratch和完整预训练RDT在七项任务上的表现。在未见物体Wash Cup中完整RDT在一个已见杯子和两个未见杯子上的完整成功率分别达到50%、75%和50%而主要基线几乎无法完成完整任务在语言指令测试中RDT面对训练中未直接出现的“左手倒至三分之一”和“右手倒至三分之二”指令分别取得100%和87.5%的完整任务成功率并能够正确选择机械臂和控制水量在三个完全未见房间的Pour Water任务中完整成功率达到62.5%、100%和62.5%在仅有1条示范的Fold Shorts任务中取得68%在仅有5条示范的Handover任务中取得40%明显高于主要基线在要求精确推动遥控器摇杆的Robot Dog任务中RDT最终使机器狗直线行走的成功率达到48%。这些结果共同表明RDT的优势不仅体现在训练任务成功率而主要体现在未见物体、未见场景、未见语言组合、1–5 shot新技能学习以及精细双臂控制等泛化能力上。4AblationDiffusion、大模型和预训练谁最重要Table 2 分别移除了 Diffusion、模型规模和多机器人预训练。将 Diffusion 换成确定性回归后Instruction Following 从100% 降至 12.5%将模型从 1.2B 缩小后降至25%而保留 1.2B Diffusion、但取消预训练的 RDT-scratch在 Unseen Object 和 Unseen Scene 上仅为0% 和 25%。完整 RDT 则达到50%、62.5% 和 100%。这组消融实验支持论文最核心的结论RDT能力Diffusion Action ModelingLarge ModelLarge-Scale Multi-Robot Pre-training​Table 2通过三个RDT变体分析Diffusion动作建模、模型规模以及大规模多机器人预训练分别对泛化能力的贡献。将Diffusion替换为确定性动作回归后的RDT-regress在未见物体、未见场景和指令跟随上的成功率仅为12.5%、50%和12.5%明显低于完整RDT的50%、62.5%和100%说明直接回归难以充分处理高维双臂动作的多模态分布将模型从约1.2B缩小至约166M后未见物体和指令跟随分别下降到37.5%和25%表明较大的模型容量尤其有助于复杂条件理解和泛化但未见场景任务上两者均为62.5%说明规模并非所有指标的唯一决定因素最关键的是保留完整大模型和Diffusion但取消多机器人预训练的RDT-scratch在未见物体和未见场景上仅取得0%和25%说明1.2B参数本身并不会自动产生Foundation Model能力大规模跨机器人预训练是获得zero-shot泛化的重要来源。因此该消融实验支持论文的核心结论RDT-1B的最终能力来自Diffusion动作分布建模、大模型容量与多机器人预训练三者的共同作用。第八部分论文创新和局限性1论文创新第一提出面向双臂操作的1.2B Robotics Diffusion Transformer。把Diffusion Policy从“较小的任务策略”真正扩展到十亿参数Robot Foundation Model​。第二提出Physically Interpretable Unified Action Space。不是简单统一维度而是按照关节、末端位姿、速度、夹爪、移动底盘等物理语义统一动作​从而能够利用46个不同机器人数据集。第三针对机器人数据重新设计DiT。包括QKNormRMSNormMLP DecoderACI​分别解决训练稳定性、非线性动作和多模态条件融合问题。2局限性①训练成本很高48×H100 80GB×约1个月说明这种1B级Robot Foundation Model仍然属于高计算资源路线。②复杂的迭代去噪Diffusion虽然能够建模多模态动作但推理仍需要迭代去噪论文依靠DPM-Solver将其压缩为5步才能满足实时应用因此推理架构仍比OFT式一次性L1​回归复杂。3RDT-1B → π0.5RDT-1B 把“动作怎么生成”这件事推进得很深到 π0.5你的学习路线开始换问题了——不再主要研究 action representation而开始研究机器人如何在陌生真实世界中泛化。4π0 → π0.5π0 本身就已经用了多种机器人数据包括单臂、双臂、mobile manipulator而且使用 flow matching 生成连续动作。会做很多动作 ≠ 能在陌生真实世界里独立完成复杂任务。π0 很擅长“Fold this shirt.” ↓ 观察衣服 ↓ 生成连续动作 ↓ 叠衣服或者“Put this bowl in the sink.” ↓ 连续操作这些说明它的低层操作能力low-level manipulation capability 很强。但真正进入一个训练时从未见过的家庭用户可能说“把厨房收拾干净。”这就完全不是一个动作技能了。机器人首先得自己理解厨房现在很乱 ↓ 哪些东西需要处理 ↓ 杯子 → 放洗碗机 垃圾 → 扔垃圾桶 毛巾 → 挂起来 台面 → 擦干净 抽屉 → 关上 ↓ 然后一个一个执行所以这个任务里同时包含两层智能。π0.5真正要解决的就是这个问题π0.5: a Vision-Language-Action Model with Open-World Generalization它问的是一个 VLA 能不能离开训练实验室进入完全陌生的真实家庭完成长时程、多阶段的操作任务论文明确说π0.5 是基于 π0构建的并使用 异构任务联合训练heterogeneous task co-training 来提高 广泛的泛化能力broad generalization实验目标就是让机器人在训练中从未出现过的家庭执行清理厨房、清理卧室、铺床、挂毛巾等长时程任务。
返回列表