拓十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

From π*0.6

From π*0.6

回顾

先看看他们各自的网络结构
pi0


pi0.5

pi0.6

这三个模型代表了机器人基础模型(VLA,Vision-Language-Action)的演进路线,核心区别在于训练数据、模型架构和泛化能力。

第一阶段:pi 0

在网络结构上,是一个VLA典型结构,由视觉编码器(siglip)和LLM(paligemma), 最后通过一个动作头(Action Head)输出控制指令

  • 训练数据:主要基于静态数据集(如 Open X-Embodiment),即预先录好的机器人操作视频和对应的动作标签。
  • 训练方式:纯粹的 SFT (监督微调)。它看人类怎么做,它就怎么学。
  • 局限性:
    • 泛化能力有限:由于数据是静态的,模型难以应对未见过的物体、场景或任务变体, 本质上是离线模仿学习。
    • 缺乏自我纠错:无法从自身的失败中学习,执行过程中一旦出错,很难自行修正,特别是遇到采集数据没有出现过的错误。
  • 改进动机:需要让模型具备更强的适应性和鲁棒性,能够处理真实世界中动态、多变的环境。
    就像是死记硬背的“好学生”

2. Pi0.5( 引入反馈与初步修正)

  • 网络结构上,和pi0相似,不过有两个关键改进点:
    一是时间步的注入方式,与Pi0使用MLP将时间嵌入和动作token拼接后混合不同的是, pi0.5使用adaRMSNorm(自适应RMS归一化)将时间步信息注入到Action Expert的每一层;
    二是在状态输入方式:Pi0的状态输入在后缀,作为连续点token, 这是为了将状态和动作放在一起,而
    Pi0.5
    则是作为前缀,特别的是需要进行离散化后作为语言token,目的是未来状态和语义一起处理,使得语义更统一。引入了自监督学习和数据增强策略,在数据上,对任务进行划分,像subtask,使用仿真数据, 图像上引入bounding box,图像增强等。
    • 训练方式:动作专家的网络的权重不转递到vlm. 采用KI知识隔离(Knowledge insulating vision-language-action models: Train fast, run fast, generalize better),停止梯度来避免流匹配动作专家影响模型的VLM,还会使用FAST tokenizer,预测动作片段a t : t + H a_{t:t+H}at:t+H​的分词表示。
  • 效果:在物体识别和基础操作上有所提升,但动作的精细度和成功率仍有瓶颈。
  • 改进动机:Pi0 的静态数据训练方式导致模型“死记硬背”,Pi0.5 试图通过数据多样性和自监督预训练来提升模型的表征能力,但尚未解决“从经验中学习”的根本问题,简而言之无法超越人类。

3. Pi*0.6

  • 核心突破:从经验中学习(Learning from Experience),即引入了强化学习(RL)和在线数据收集。
  • 具体改进:
    • 在线交互:模型在真实环境中执行任务,收集成功和失败的轨迹数据。
    • 网络结构: 这里只说主策略网络,首先是VLA使用了Gemma(4B)模型,使得模型在语言理解,图像理解生成,跨模态对齐方面有了更强的能力,另外动作专家的参数量增加到860M,这些改进使得在VLA模型面对复杂语言指令,长序列任务上变得更稳健。在prompt设计上,除了任务指令 / 子任务指令输入外,还引入了元数据(metadata),本质上是任务结构化的文本,如房间类型,位置物理先验,(as well as additional language inputs s providing metadata that further modulates how the task is performed),
    • 奖励驱动:通过一个奖励模型(Reward Model)对动作结果进行评分,利用强化学习(如 PPO)优化策略。
    • 失败数据利用:关键创新——不仅从成功中学习,还从失败中学习。模型会分析失败原因(如抓取位置偏差、力度不足),并调整策略。
  • 效果:
    • 泛化能力大幅提升:能处理更复杂的任务(如叠衣服、开抽屉),且对物体位置、光照变化不敏感。
    • 自我纠错:在执行过程中,如果第一次尝试失败,模型会尝试调整姿态或策略,而不是直接放弃。
  • 改进动机:Pi0.5 虽然数据多了,但模型仍然是被动的“模仿者”。Pi0.6 的核心理念是:真正的智能来自于与环境的主动交互和试错学习。通过让模型“动手做”并“从结果中反思”,才能突破模仿学习的上限。

为何要做出这些改进?

  1. 从“看”到“做”:Pi0 只是学会了“看视频模仿”,Pi0.5 学会了“更好地看”,而 Pi0.6 学会了“边做边学”。这是从感知智能到具身智能的关键一步。
  2. 解决数据瓶颈:真实世界的机器人数据昂贵且难以获取。Pi0.5 用仿真数据缓解了数据量问题,Pi0.6 则通过在线交互自动生成高质量数据,打破了数据依赖。
  3. 迈向通用机器人:只有具备从经验中持续学习的能力,机器人才能像人类一样适应各种新任务。Pi0.6 的 RL 框架为未来实现“通用机器人大脑”奠定了基础。

总结对比

特性Pi0Pi0.5Pi0.6
训练范式静态模仿学习静态 + 自监督在线强化学习
数据来源预录数据集预录 + 仿真数据预录 + 仿真 + 真实交互
失败学习无无有(核心创新)
泛化能力弱中等强
自我纠错无无有
适用场景固定环境、固定任务轻度变化环境复杂、动态、开放环境

2 π∗0.6


对于每个任务,作者部署模型以收集自主执行的轨迹,同时获取在线的人类纠正数据。随后,作者在这些在线数据上对价值函数进行微调。基于更新后的优势估计进一步微调VLA,则能够反过来改进策略行为。

2.1 RECAP: RL with Experience and Corrections via Advantage-conditioned Policies

用“真实经验 + 人类纠正 + advantage 条件化策略”来训练一个可以不断改进的 VLA。

这套方法的结构,可以拆成四步:

  1. 先有一个预训练 VLA 底座
  2. 在真实任务里部署它,采集 autonomous rollouts 和 human corrections
  3. 训练一个 value function,估计每个状态/动作到底有多“接近成功”
  4. 把这个优势信息再喂回 VLA,让策略朝“更可能成功”的动作分布靠拢

这四步看起来像 offline RL,但真正难的地方是:
它要兼容机器人领域里非常异构的数据来源。

论文里明确利用了三类数据:

  • demonstration data
  • on-policy collected autonomous data
  • expert teleoperated intervention data

也就是说,它不是把人类示范和自主尝试割裂开,而是把它们放进同一个改进循环里。

这正是它比“纯行为克隆”和“纯在线 RL”更有现实意义的地方。

蓝色方框和pi0.6相同;绿色方框表示优势指示器把优势函数的输出转化为离散的文本格式,加入到VLA的prefix 输入中;
红色方框的价值函数网络与VLA主干网络一致,不过使用更小的gemma backbone.
为什么要引入 value function,而不是直接 PPO 到底

论文其实已经给了一个很清晰的方向:
对大规模 VLA 来说,直接做传统 policy gradient 并不一定是最合适的。

原因至少有三层:

  1. 连续动作大模型的 policy gradient 很难稳定
    机器人 VLA 的动作不是简单离散 token,而是:

    • 连续控制量
    • 多步 horizon
    • flow matching / diffusion 风格的动作建模,在这种情况下,直接套 PPO、REINFORCE 之类方法,训练稳定性和计算效率都容易出问题。
  2. 真实世界在线 RL 数据非常贵
    每一条机器人 rollout 都不是廉价仿真数据。
    如果算法要求非常强的 on-policy 性质,那数据利用率会很差。
    而RECAP的设计更接近:

    • 尽可能复用已有数据
    • 用 value function 来重估行为质量
    • 再通过 advantage-conditioned extraction 把改进信号蒸馏回策略
  3. advantage conditioning 更适合和 VLA 现有训练方式兼容
    没有强行将VLA作为一个RL actor 去优化,而是算出动作相对于策略是好是坏,再去打标签,以文本方式输入给策略,这像是利用RL带来的偏好方向去引导策略优化,同时保持训练的稳定!

2.2 HIL

在对任务进行SFT微调后,会得到初始策略π_l^0,这份策略用于开始收集新一轮的数据

  1. Autonomous Rollouts(自主执行)
    机器人遵循当前策略独立完成整个episode,系统完整记录动作、观测和奖励。这部分数据反映当前策略的真实失败模式。
    2)Expert-Monitored Rollouts(人工纠正)
    当模型出现重大错误或探索困难时,人类专家可实时介入纠正

2.3 Advantage Indicator(优势指示器

1.即时奖励:对于每个标签,用于指示该episode是否成功,且从其每个episode的成功标签中获取奖励。

T对应于episode的最后一步,C f a i l C_{fail}Cfail​是一个较大的常数,失败的回合价值较低。核心在于训练价值函数成功预测成功episode中“直到成功还剩的步数的负数”,不过会把预测值归一化到 (−1,0)区间,因为不同任务完成的时间不一样。但是这么设计就是最好吗?

2.轨迹从 t 开始的累积奖励计算:

  1. 价值函数V^π_ref的预测:

    离散化为 B=201 个 bins(记作R t B R_t^BRtB​,然后在当前数据集 D 上最小化交叉熵 H 来训练

问题来了,为什么使用201bin去表示,原因有以下几点

  • 架构的统一,value function 本质上是VLM模型,V,L都是离散的token,价值离散为bin后,就是词表中的普通token,不需要架构的改动
  • 训练目标统一,离散bin的loss是交叉熵,和VLM主干道next-token prediction 是同一个loss家族,可以加权联合训练,梯度的尺度统一
  • 对噪声鲁棒,本身对于价值的估计就存在着噪声,分类损失对个别标签错误宽容度高

那么为什么是201个呢
这是分辨率和词表开销的 trade-off:

  • 太少(比如 2 个 bin = 只分好坏):价值函数的分辨率不够,无法区分"马上要成功了"和"刚开始",advantage 排序退化,RL 加权失去区分度。
  • 太多(比如 10000 个):词表膨胀、每个 bin 的训练样本变稀疏,token embedding 学不充分;而且价值判断本质是序数信息(这个状态比那个好),不是精密测量——精度收益快速递减。
  • 201 的量级:把评分区间离散到约 0.5% 的分辨率(比如 [-1, 1] 分 200 段),足以支撑 advantage 排序;同时 201 个 token 对词表的开销可以忽略(对比 VLM 几万的基础词表)。类比:LLM 处理数字时也常用类似量级的 digit/bin 离散化。

“离散化会不会损失精度,影响控制?”

“不会影响控制精度,因为价值信号只负责’引导方向’,不直接输出动作。动作的连续精度由 Action Expert 的 Flow Matching 头保证——那是专门的连续动作生成模块。bin 离散化的是价值评分,它只需要序数分辨率(哪个状态更好),201 个 bin 的分辨率绰绰有余。这本质是一个分层设计:语义层用离散 token 交互,动作层用连续向量场生成。”

  1. 优势函数的计算:
    动作的 advantage 可按 n 步估计定义为:
    其中o t + N \mathbf{o}_{t+N}ot+N​是在同一路径上向前N 步采样得到的观测

  2. 优势指示器的计算:

  3. 人类干预下的优势指示器的计算:
    I_t = True (e.g. positive) if human corrections

最终优势指示器True/False的结果以文本的形式(e.g. “Advantage: positive/negative”)输入给VLA prefix,为什么?
因为对于一个大模型而言,prefix 里加入一个结构清楚的语言标签,通常比硬加一个浮点数更自然,也更稳定;
另一方面则是因为真实世界的价值估计存在误差,进而容易引入噪声到策略中;
最后也是最重要的,更容易和原有多行为克隆目标拼接。

2.4 损失函数

损失函数由两部分组成:
1. 分布式价值函数损失;


这是数据集D \mathcal{D}D所代表的行为策略π ref \pi_{\text{ref}}πref​的价值函数的蒙特卡洛估计器。
训练目标是把模型预测的回报分布和轨迹上观测到的离散化经验回报对齐, 最小化交叉熵损失。
而分布式价值函数的信息量更丰富更稳定,这使得我们能够从学得的价值分布中提取连续价值函数,怎么做呢求期望。


其中v ( b ) v(b)v(b)表示第 b 个区间对应的价值。数据集D对应人工示范数据,价值函数学习任务在给定条件下单期望回报;后续加入了当前策略经验数据,进而计算 advantage

2. 基于优势条件的策略提取损失;
简单来说就是用我们上一步计算得到的价值函数训练出改进后的策略!
第一项-log ⁡ π θ ( a t ∣ o t , ℓ ) \log \pi_{\theta}\left(\mathbf{a}_{t} \mid \mathbf{o}_{t}, \ell\right)logπθ​(at​∣ot​,ℓ),是标准的行为克隆BC, 在只看当前画面和语言指令l的情况下,模型预测动作a_t的概率。
第二项α log ⁡ π θ ( a t ∣ I t , o t , ℓ ) \alpha \log \pi_{\theta}\left(\mathbf{a}_{t} \mid I_{t}, \mathbf{o}_{t}, \ell\right)αlogπθ​(at​∣It​,ot​,ℓ)是优势条件项,在已知画面o_t、指令l 和优势标签I_t的情况下,预测动作a_t的概率,
最小化以下负对数似然

由于真实的连续数据分布极其复杂,深度学习模型很难直接给出一个解析表达式来计算它在某一点的精确概率密度(Precise probability density)。因此,连续动作的对数似然无法精确计算。而在概率生成模型的理论中,扩散模型(Diffusion)的训练目标(通常是去噪分数匹配)可以被严格推导为数据真实分布的 变分下界(VLB, Variational Lower Bound) 或证据下界(ELBO)。
这意味着:最小化 Diffusion 损失≈ \approx≈最大化对数似然的下界。你虽然求不出精确的 100 分,但你能求出一个保底的 80 分,你只要努力把这个 80 分的下界往上提,真实的得分也会跟着提高。
a t : t + H η , ω = η a t : t + H + ( 1 − η ) ω a _ { t : t + H } ^ { \eta , \omega } = \eta a _ { t : t + H } + ( 1 - \eta ) \omegaat:t+Hη,ω​=ηat:t+H​+(1−η)ω是加噪后的动作,η ∈ [ 0 , 1 ] η∈[0,1]η∈[0,1]是 flow-matching 的时间索引,f θ f_{\theta}fθ​表示diffusion/expert在连续域的输出, α_η是损失加权项(可以设置为与噪声相关的权重),
将其分解为离散的对数似然和连续的动作流匹配项,表达为公式,使用替代损失来进行训练。

2.5 算法流程图


采集数据后根据公式1训练价值函数,有了价值函数V ( o t ) V(o_t)V(ot​)便可以计算某个动作a_t的优势。
A π ( o t , a t ) ≈ r t + V π ( o t + 1 ) − V π ( o t ) A ^ { \pi } \left( o _ { t } , a _ { t } \right) \approx r _ { t } + V ^ { \pi } \left( o _ { t + 1 } \right) - V ^ { \pi } \left( o _ { t } \right)Aπ(ot​,at​)≈rt​+Vπ(ot+1​)−Vπ(ot​)
如果A > 0 A>0A>0,说明动作a t a_{t}at​比平均水平好;如果A < 0 A<0A<0,说明动作a t a_{t}at​较差,策略目标对应于最小化以下负对数似然,价值函数和策略都是从预训练的检查点π p r e \pi_{pre}πpre​开始微调,而不是从上一轮迭代得到的策略和价值函数开始

2.6实验

吞吐量:不同任务上的每小时成功完成的任务数量,

包括:洗衣(简单版与多样版)、制作咖啡、以及纸箱组装。误差棒表示标准误差,这个指标同时衡量了成功率和执行速度。在所有场景中,将 RECAP 应用于 π0.6 都带来了显著的吞吐量提升。特别是在洗衣任务(多样版)和咖啡制作任务中,RECAP 的影响最大,使得每小时成功完成的任务数量提高了一倍以上。

图:各任务的绝对成功率,并附带标准误差。RECAP 的每一个阶段都能提升任务性能,其中具有挑战性的多样化洗衣任务和浓缩咖啡制作任务的提升幅度最大,成功率显著提高,相当于将失败率减少了超过 2 倍。对于纸箱组装任务,RECAP 使得所有子任务的成功率更加稳定且整体最高。

迭代


多次迭代后的吞吐量提升:随着 RECAP 迭代次数的增加,这两个任务的吞吐量都得到了显著提升。其中,纸箱组装任务在最初阶段的吞吐量会出现一次下降,但随后又获得了大幅度的提升,这是因为模型在进行探索,特别对于这种长序列复杂的任务,recap迭代的步数会更长。


多次迭代后的成功率提升。在多轮 RECAP 迭代中,洗衣任务的成功率会非常快速地达到最高水平(但其吞吐量仍会继续提升,如左图所示);而纸箱组装任务的成功率则会持续不断地提升。

不同策略提取方法对比

图:不同策略提取方法的对比:在洗衣任务中,将 RECAP 应用于 π*_0.6 的方法,其吞吐量显著高于 AWR 和 PPO,是目前表现最好的策略提取方式。

在洗衣任务中,将 RECAP 应用于 π*_0.6 的方法,其吞吐量显著高于 AWR 和 PPO,是目前表现最好的策略提取方式。

失败模式的消除:作者将 RECAP 应用于一个洗衣任务的变体:任务中只有一个物品,但成功判定标准非常严格。在这种更苛刻的评判条件下,RECAP 尤其擅长消除那些在严格标准下会被判定为失败的行为模式。

ref

  • 具身智能之心
  • https://blog.csdn.net/v_JULY_v/article/details/154989166
  • π*0.6: 从实践中学习
  • paper地址:π∗0.6: a VLA That Learns From Experience
  • 页面地址:pi.website/blog/pistar06
返回列表