拓十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

LIBERO和SimplerEnv到底评测什么?Every-Embodied具身智能Benchmark与数据集完整解读

LIBERO和SimplerEnv到底评测什么?Every-Embodied具身智能Benchmark与数据集完整解读 LIBERO和SimplerEnv到底评测什么Every-Embodied具身智能Benchmark与数据集完整解读【免费下载链接】every-embodied仅需Python基础从0构建自己的具身智能机器人从0逐步构建VLA/OpenVLA/SmolVLA/Pi0 深入理解具身智能项目地址: https://gitcode.com/gh_mirrors/ev/every-embodied 正在训练或评测一个具身智能模型却不知道该选哪个测试集开源项目Every-Embodied仅需Python基础从0构建自己的具身智能机器人从0逐步构建VLA/OpenVLA/SmolVLA/Pi0在 09-具身智能数据及评估基准benchmark 章节中系统整理了LIBERO 数据集与SimplerEnv 评测基准这两个具身智能领域最常用的 Benchmark前者回答策略学了多少东西后者回答策略在真机上到底行不行。本文带你用大白话看懂它们分别评测什么、该怎么用。先搞懂两个Benchmark各管一摊别混着看很多新手会把数据集和评测环境当成一回事其实是两类不同的东西LIBEROSimplerEnv本质机器人操作演示数据集 评测任务集闭环仿真评测环境评测目标视觉/空间/交互/长时序四维泛化能力策略在真机场景下的成功率与鲁棒性机器人本体桌面 Franka 机械臂Google Robot WidowX 双平台典型用法训练模仿学习策略或跑泛化分给已训好的策略上考场打分一句话记忆LIBERO 是教材月考SimplerEnv 是模拟真实环境的期末考。想深入源码细节可以对照项目中的两份完整教程LIBERO 数据集深度解析09-具身智能数据及评估基准benchmark/01-libero.mdSimplerEnv 基准测试详解09-具身智能数据及评估基准benchmark/02-simplerenv.mdLIBERO 到底评测什么4个套件测4种能力LIBEROLifelong Learning Benchmark for Robot Manipulation最聪明的地方是把泛化能力拆成了4 个独立维度每个维度 10 个任务变量只有一个1️⃣ LIBERO-Object换物体还能做吗动作完全一样——拿起 X 放进篮子但 X 从字母汤罐头换成番茄酱、奶油芝士。考的是物体视觉特征的鲁棒性换个颜色、形状策略会不会就抓瞎了2️⃣ LIBERO-Spatial换位置还能做吗操作对象固定通常是黑碗但它可能藏在盘子和模子之间、桌子中央、或者木柜的抽屉里。考的是空间语义理解——不能靠背坐标得真懂哪里。3️⃣ LIBERO-Goal换目标还能做吗目标不再是简单抓取而是打开抽屉把盘子推到炉子前把碗叠在盘子上。考的是多种物理交互开、合、推、放、叠一样都不能少。4️⃣ LIBERO-10Long-Horizon多步任务还能做吗最具挑战性的子集把两个物体依次放进篮子、放好碗并关上抽屉、开火然后放摩卡壶。考的是长时序推理与因果串联平均步数 267.7 步是其他子集的两倍以上。 项目里还做过一次真实的数据统计分析完整数据见 01-libero.md套件任务数Episodes平均步数评测重点libero_1010379267.7长程时序libero_goal10428121.6交互目标libero_object10454147.5物体识别libero_spatial10432122.6空间定位 一个实用的诊断技巧如果你的模型 Object 任务做得好、Spatial 任务却拉胯基本可以断定是空间注意力机制有缺陷而不是整体能力不行。SimplerEnv 到底评测什么18个场景模拟真机考场SimplerEnv 建立在 ManiSkill2 物理引擎之上核心使命是弥合Sim-to-Real 鸿沟它的纹理、光照、物体布局刻意对齐真实机器人数据集RT-1 和 Bridge Data V2让仿真评测结果能预测真机表现。它覆盖2 种机器人平台、18 个标准评估场景Google Robot 组14个场景基于 RT-1 数据模拟厨房/办公场景下的移动操作机器人重点考三大能力抓取水平/垂直/立姿可乐罐测不同姿态下的抓取规划移动接近MoveNear要求底盘协同移动、接近目标不碰撞是全身控制的试金石关节物体上/中/下三层抽屉的开关以及打开抽屉→放入物体的长程复合任务WidowX 组4个场景基于 Bridge Data V2模拟固定基座桌面机械臂的精细操作PutSpoonOnTableCloth把勺子放到毛巾上——可变形目标区域的精细放置StackGreenCubeOnYellow积木堆叠垂直对齐精度要求极高PutEggplantInBasket不规则物体入深容器考抓取点选择与防掉落关键差异为什么SimplerEnv更像真机考场SimplerEnv 的精髓在于变体聚合Variant Aggregation每个任务每次 Reset 都会随机化参数同一任务实际会产生成百上千种运行状态——视觉变体换桌布颜色、改光照、随机撒入干扰物专治死记硬背物理变体目标物体位置随机偏移、相机姿态微小扰动模拟真实标定误差它的三大评分指标也值得记住成功率N 次试验中完成任务的百分比建议 N≥100平均步数衡量策略效率做成了但磨蹭照样扣分Sim-to-Real 相关性仿真排名与真机排名的相关性——这是 SimplerEnv 独有的硬指标一个靠谱的仿真基准应该能预测哪个策略真机上更强⚠️ 新手避坑不同 Benchmark 公布的成功率不要直接横向比较。机器人本体、初始状态、最大步数、成功判定都可能不同项目里的选择基准检查表总结得很到位。顺带认识EBench 与VR数据采集项目同一章节还覆盖了两个延伸方向可按需深入EBench基于 Isaac Sim 4.1 的具身操作评估基准项目里走通了规划→轨迹生成→RGB渲染→导出视频的最小链路一张 24GB 显存的卡即可跑通 smoke test。VR 数据采集用 Quest 3 头显遥操作采集训练数据的 Python 方案是低成本获取真机数据的实用路线。对应的资料入口09-具身智能数据及评估基准benchmark/04-EBench.md、09-具身智能数据及评估基准benchmark/03-VR数据采集.md。新手选型建议3个问题定方向你在训练阶段还是评测阶段训练阶段优先用 LIBERO数据格式友好、规模适中要给已训好的策略打分选 SimplerEnv。你关心哪种泛化想知道模型短板在哪用 LIBERO 的四个套件分项诊断想知道真机上能不能用用 SimplerEnv 的变体聚合协议。你的算力与协议匹配吗对照项目中的基准检查表逐项核对任务覆盖、固定初始状态、机器人兼容性、许可证——确定后在实验记录中写明任务子集、回合数与聚合方式保证不同模型在同一协议下可比。更多开源模型与数据集的对照资料可继续浏览 06-策略抓取或抓取VLA/01VLA相关总结综述.md以及项目整体的学习路线 README.md。【免费下载链接】every-embodied仅需Python基础从0构建自己的具身智能机器人从0逐步构建VLA/OpenVLA/SmolVLA/Pi0 深入理解具身智能项目地址: https://gitcode.com/gh_mirrors/ev/every-embodied创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表