十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

基于长短期反思优化的可演化具身智能体在机器人操作中的应用

基于长短期反思优化的可演化具身智能体在机器人操作中的应用 26年4月来自平安集团技术公司的论文“Evolvable Embodied Agent for Robotic Manipulation via Long Short-Term Reflection and Optimization”。实现通用机器人需要赋予机器人根据环境和反馈进行适应和进化的能力。传统方法面临诸多局限性例如训练量大、跨任务泛化困难以及缺乏可解释性。提示学习为无需大量训练、仅需反思过往经验即可实现机器人自我进化提供了新的机遇。然而如何从任务的成功和失败中提取有意义的见解仍然是一个挑战。为此提出可进化具身智能体EEAgent框架该框架利用大型视觉-语言模型VLM来更好地理解环境和进行策略规划。为了增强对过往经验的反思提出一种长短期反思优化LSTRO机制该机制能够根据过往经验和新近学习的教训动态地改进提示从而促进持续的自我进化最终提高任务的整体成功率。如图 1 所示受人类学习过程的启发特别是记忆在反思和适应中的作用该方法将长期记忆和短期记忆作为 VLM 中的可解释提示结合起来。长期记忆积累通用知识以实现稳健的任务执行而短期记忆则捕获最近的特定任务经验以动态改进性能。通过不断更新和整合这些记忆智能体逐步提高任务成功率以最少的试验实现定性的自我进化。可演化具身智能体概述可演化具身智能体EEAgent框架旨在使机器人能够理解其环境并根据人类指令和通过机器人光学模块获取的环境信息协调一系列物理操作。EEAgent 利用大型视觉-语言模型VLM来促进视觉反思这对于高级自演化至关重要。如图 2 所示EEAgent 由两个核心模块组成1环境解释器 F_ei负责解释当前环境与所提供指令之间的关系。2策略规划器 F_pp负责根据环境信息和指令生成动作序列 A。为了解决记忆提取的挑战引入长短期反思与优化LSTRO算法。环境解释器理解环境是机器人操作的关键步骤。在本研究中利用ChatGPT-4o [5]一种复杂的视觉语言模型来实现环境解释器F_ei。如图2所示首先利用LLM的函数调用能力生成一系列函数工具。具体来说本研究定义四种类型的函数工具1extract env entities()使用SAM[22]实现从当前环境中提取物体实体。2image match()当指令中指定视觉实体图像时该函数使用VLM识别环境中最佳匹配的实体最相似的物体。如图2所示提示信息将存储记忆。此外VLM还会生成目标图像的特征描述以进行自我进化。 3语义匹配()用于指令中实体以文本形式描述的情况例如“将棋盘格圆片放入黄紫色波点盘中”。它使用VLM实现其提示结构和工作机制与图像匹配()类似。4场景匹配()此函数处理多对多实体匹配例如“重新排列到此场景”任务。它的实现方式是迭代地使用这两个匹配工具将指定场景中的每个实体与当前环境中对应的实体进行匹配。策略规划器策略规划器 F_pp 旨在生成一系列可执行操作。该模块使用LLM实现如图 2 所示。与匹配工具例如图像匹配()类似策略规划器的提示信息包含任务描述、原则、建议和输出格式。然而与 image match() 不同策略规划器利用基于任务特征的预定义动作库使 LLM 能够使用有限的可用动作集生成满足指令的动作序列。由于实验是在 VIMA-Bench [20] 上进行的可以为动作库定义两个动作PickPlace 和 PickRotate。每个动作都附带描述和参数要求。例如PickPlace 的描述是“抓取物体并将其移动到指定位置”需要参数“抓取位置”和“放置位置”。此外还提供示例来指导正确的动作序列生成并限制 LLM 以 JSON 格式输出序列。使用此策略规划器可以有效地根据环境信息和用户指令生成可执行的动作序列。长短期反思与优化总体策略为了缓解基础模型与物理机器人系统之间的差异存储包含外部知识的记忆至关重要。受人类认知中区分长期记忆和短期记忆的启发为智能体的知识提出类似的结构。长期记忆LM存储适用于各种任务的通用经验集而短期记忆SM则存储特定于任务的信息。随着时间的推移短期记忆可以逐渐整合到长期记忆中从而增强智能体的知识库。此外基于任务成功和失败的反思过程使智能体能够利用有价值的见解更新这两个记忆系统。为了通过动态更新EEAgent中的提示以自然语言描述的过去经验记忆来增强任务的自我进化能力提出一种长短期反思与优化LSTRO方法。如算法1所示环境解释器和策略规划器都整合LM和SM。LM旨在概括具有全局相似性的原则或环境。而SM仅包含针对当前指令和环境的具体建议。在本研究中假设反馈要么成功要么失败并且两者采用不同的策略。成功反思过程包括总结成功经验并将其整合到学习模型LM中。失败首先定位错误然后提取失败经验中的原则和建议同时更新长期记忆LM和短期记忆SM。长期记忆LM影响跨任务而短期记忆模型SM仅影响当前任务。通过这一过程具体的短期记忆模型SM经验逐渐整合到长期记忆LM中最终转化为能够提升整体性能的通用原则。2错误定位当系统任务失败时定位错误源至关重要。本研究提出两种检测环境解释器和策略规划器中错误的方法。a图像描述一致性环境解释器中的错误通常源于图像匹配函数image match()其中视觉-语言模型VLM可能难以识别细粒度的图像特征。为了解决这个问题提出一种图像描述一致性方法。具体来说通过在测试图像和参考图像中添加额外的描述性特征可以引导 VLM 关注更精细的细节。然后LLM评估这些描述的一致性。如果它们匹配则认为图像匹配过程成功否则此步骤中可能存在错误。本质上该方法将基于 VLM 的感知与思维链推理相结合利用额外的图像特征描述来增强错误检测。b动作到指令的一致性对于策略规划器提出了一种动作到指令的一致性方法。在此方法中LLM 根据已执行的动作重新生成指令然后将其与原始指令进行比较。如果指令匹配则原始动作很可能是正确的。如果不匹配则该动作很可能是错误的。本质上这种方法利用少样本学习来调整LLM生成的操作从而减少潜在错误。3反思EEAgent框架基于成功和失败的反馈进行反思[27]。对于成功案例系统会使用特定的提示来引导LLM总结有效的成功经验并将这些经验存储在长期记忆中以提升未来的表现。考虑到环境解释器或策略规划器可能会多次执行所有过去的对话都会被连接起来使LLM能够总结出成功经验中最简洁、最有用的方面。对于失败案例LLM会回忆相关的记忆诊断失败的根本原因并生成可操作的建议来改进任务执行。此外LLM还会生成简洁有效的经验总结以防止在未来的任务中重复出现错误。优化记忆更新本研究提出一种基于过去经验在反思过程中进行总结的洞察动态更新智能体提示信息的方法从而实现智能体的演化。本文方法更进一步解决LLM生成反思信息中固有的不确定性。反思信息可能与现有记忆存在冗余或矛盾而LLM的输出容易产生幻觉这会进一步增加不确定性。随着时间的推移这些问题可能会降低反思信息在未来类似任务中的相关性。首先利用LLM评估反思内容的通用性。一旦内容通过评估便将其与现有记忆相结合。LLM随后整合语义冗余信息并解决矛盾。这一过程最终生成一个精炼的长期记忆列表其中包含新知识和现有知识。此外为了应对视觉语言任务的复杂性将存储的记忆数量限制在一个固定的最大值。实验设置为了验证方法使用 VIMA-Bench 基准测试集 [20]该测试集提供一系列涵盖视觉理解和任务规划的多样化任务。具体来说从 VIMA-Bench 中选择六个子任务进行评估如图 3 所示。这些子任务包括1将 {object1} 放入 {object2}2将 {scene} 中具有 {texture1} 的物体放入具有 {texture2} 的物体中3将 {object1} 旋转 {angles} 度4重新排列物体以匹配指定的 {scene}5将物体重新排列成特定配置然后将其恢复到原始位置6将 {object1} 放入 {object2}然后放入 {object3}最后将它们恢复到各自的原始容器中。这些任务与 Instruct2Act [19] 中使用的评估协议一致。 VIMA-Bench 还提供一个四级泛化评估协议包括 L1位置泛化、L2组合泛化、L3新对象泛化和 L4新任务泛化。评估设置的更多细节可在 [20] 中找到。系统基于 ChatGPT-4o 接口构建并使用 SAM 的大型版。最大试验次数和最大长记忆容量分别设置为 3 和 20。值得注意的是该系统不涉及任何局部模型训练或推理。基线为了全面评估方法对三种类型的方法进行了比较1基于 LLM 规划的方法在此类别中比较 CaP [9]、Instruct2Act [19] 和 CLIN [16]。虽然 Instruct2Act 可以直接应用于 VIMA-Bench但 CaP 和 CLIN 是在 Instruct2Act 的基础上进行的特定修改。 2基于学习的方法比较几种基于学习的方法包括 VIMA-20M [20]、VIMA-Gato [28]、VIMA-Flamingo [23] 和 VIMA-GPT [13]。3提示策略为了评估提出的 LSTRO 方法对具身智能体的影响评估本文提出的具身智能体框架内的各种提示策略。这些策略包括a没有 LSTRO 的普通具身智能体Vanilla EAb思维链提示CoT-Prompt[25]c基于排序的自洽性SCd基于选择的 SCe基于反思的 SC [24]。
返回列表