拓十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

超越单纯的任务执行:Axis 正在构建一个可组合的机器人能力库

超越单纯的任务执行:Axis 正在构建一个可组合的机器人能力库

26年9月来自Axis Robotics创业公司的博客文章“Beyond More Tasks: Axis Is Building a Composable Library of Robotic Capabilities“:https://axisrobotics.ai/blogs/blog/beyond-more-tasks-axis-is-building-a-composable-library-of-robotic-capabilities。

这篇博客的核心思想是:把“可靠、可复用的技能”作为机器人学习的扩展单位,让技能既能组合执行复杂任务,也能持续产生训练数据。 这个方向有工程价值,但文章展示的实验结果,还不足以证明它已经解决了通用化和规模化问题。

主要提出三项进展:

它进一步设想:将专家积累为技能库,一方面交由上层智能体调度,另一方面为统一的视觉—语言—动作模型(VLA)提供训练数据,使专门能力逐步转化为通用能力。

最有价值的思想,是把数据生产和能力建设联系起来。

一个可靠技能有双重价值:它可以直接完成工作,也可以成为产生新训练样本的工具。因此,评价体系可以从“收集了多少轨迹”推进到“增加了哪些可靠能力,这些能力又降低了多少后续学习成本”。

但这里有一个关键条件:新技能必须带来可迁移的能力。如果每个任务都需要重新建模、调参和验证,任务库扩大只是工程项目数量增加,未必形成累积优势。

沿着这条逻辑,文章有五个值得深入追问的问题。

1.自我改进成立到什么程度?

让策略在实际执行中产生新数据,再用这些数据改进策略,是合理的学习闭环。机器人自己的行为会改变它后续遇到的状态,这也是 DAgger 等交互式模仿学习方法关注的问题;不过,DAgger 通常依赖专家对访问状态提供监督,不能直接等同于本文的方法。

这里的结果理解为部署反馈驱动的策略迭代。要进一步支持“递归自我改进”的强主张,需要回答:
连续多轮迭代后,性能是否持续上升,还是很快进入平台期?
谁判断执行成功、重置环境、处理失败?人工参与了多少?
改善来自增加真实数据,还是其闭环采集方式特别有效?

尤其要注意,只学习成功轨迹可能偏向原本就容易完成的场景。如果某类情况始终失败,就无法靠收集成功样本自然补齐。系统还需要探索、纠错或针对性补数据的机制。

2.数据筛选的关键,是能否保留“现在难、未来有用”的数据。

代理模型筛选数据有实际意义:重复数据未必提供新信息,部分样本也可能包含噪声。但小模型认为没用的数据,大模型未必用不上。
例如,复杂接触和失败恢复轨迹可能很难学习,却对部署非常重要。如果筛选过程偏爱简单、稳定的成功动作,平均指标可能提高,能力覆盖反而收窄。

希望看到三种对照:相同数据量下与随机采样比较、相同训练算力下与全量数据比较,以及在未参与筛选的新任务上比较。这样才能区分,收益究竟来自更好的数据选择、减少噪声,还是训练预算分配的变化。

3.“可组合”是全文最重要、也最难成立的一环。

两个技能各自可靠,不代表它们接起来也可靠。举例说,“抓住杯子”已经成功,但杯子的朝向和抓握位置可能不适合下一步“倒水”。

真正的组合能力需要明确:
什么状态下可以调用这个技能?
执行结束后,能保证哪些条件成立?
当前状态不适合下一步时,如何调整或恢复?

也就是说,需要保证前一个技能的输出状态,落在后一个技能能够处理的范围内。

长任务还会累积失败风险。作为简化示例,假设每一步在前面都成功的条件下,成功率均为 99%,且没有重试,连续 50 步全部成功的概率只有约 61%。因此,恢复机制、完成检测和重规划,可能比单个技能再提高一点成功率更重要。

上层语言模型也必须知道技能当前是否可执行,而不能只生成逻辑上合理的步骤。SayCan 已经研究过用技能的可执行性约束语言模型规划,说明这一架构有研究基础;Axis 需要证明的是规模、可靠性和成本上的进一步优势。

4.专家库扩大,与通用能力形成,是两个需要分别验证的目标。

这条路线至少涉及三种不同能力:

把很多专家的行为训练进一个模型,可能只是让它记住更多任务。要证明形成了通用能力,需要预先留出新物体、新布局和新任务组合,并检查是否仍需额外示范或微调。

此外还有一个工程取舍:分别保留专家,便于局部验证和更新,但调度复杂;统一模型便于共享能力,却可能出现任务之间互相干扰。两条路线可以并行探索,不能假定蒸馏后会自然兼得全部优点。

5.成本和成功率,需要统一评价口径。

判断经济价值时,问问“交付一个真实环境可用技能的总成本”。除了训练算力,还应包含仿真资产、任务定义、示范、失败训练、真机测试、环境重置和后续维护。

成功率同样需要知道测试环境、试验次数、任务分布和人工干预情况。特别是,不能把真机迁移实验与专家训练实验的数字直接拼接成一个结论:必须先确认它们是否对应相同任务、相同观测条件和相同测试标准。


这是一条值得验证的机器人能力生产路线,目前更适合作为技术路线声明来阅读。 最有说服力的下一步证据,是在统一的真机测试下,展示技能库扩大后,未见任务的完成率提高、人工介入减少、新技能交付成本下降。三者如果同时成立,才能说明“更多技能”确实正在转化为“更强的通用能力”。

返回列表