十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

STABLE: Simulation-Ready Tabletop Layout Generation via a Semantics–Physics Dual System

STABLE: Simulation-Ready Tabletop Layout Generation via a Semantics–Physics Dual System 原文链接https://arxiv.org/pdf/2605.16137项目链接https://lan555.github.io/stable/【无code】发表ICML 2026一、研究动机1. 领域背景在具身AI领域合成数据因成本低、易扩展的优势已成为机器人操作模型训练与评估的核心数据来源。其中生成与任务指令对齐的多样化桌面场景可以为机器人仿真提供丰富的环境是当前备受关注的研究方向。该任务的核心挑战在于既要准确理解高层任务指令的语义又要保证生成场景的物理合理性使其可以直接用于物理仿真即 simulation-ready。2. 现有方法的核心缺陷现有任务到场景的生成方法存在两类难以解决的问题LLM主导的生成方法存在空间推理短板无论是零样本LLM、多轮提示策略还是数据集微调的LLM都只能将高层语义转化为结构化布局但无法精准建模连续3D几何关系生成的场景普遍存在物体穿透碰撞、悬空漂浮等非物理现象无法直接用于仿真。本质原因是LLM存在幻觉问题且3D空间推理能力存在固有局限。事后物理优化存在语义漂移与鲁棒性问题现有事后优化方法虽能一定程度改善物理合理性但存在明显缺陷计算开销大且当初始布局碰撞严重时往往无法找到可行解优化会强行移动物体以消除碰撞破坏原始布局的语义关系导致场景偏离任务指令例如指令要求“苹果放在香蕉左边”优化后可能被移到右边容易产生杂乱、不符合真实分布的布局。方法间的固有权衡LLM类方法语义对齐性好但物理合理性差事后优化类方法能消除碰撞但会损失语义对齐。现有方法始终无法同时兼顾“严格符合任务指令”和“物理仿真就绪”两个目标。基于此论文受认知科学“双系统”思路启发提出STABLE语义-物理双系统框架将语义布局生成与物理位姿校正解耦在保证语义对齐的前提下实现物理可信的场景生成。二、方法概述STABLE是一个渐进式语义-物理双系统的桌面布局生成框架核心设计是交替执行“语义扩展”与“物理校正”两个步骤从任务核心物体到背景物体逐步构建完整场景。语义推理器Semantic Reasoner基于微调的大语言模型负责理解任务指令分阶段生成粗略的结构化场景布局保证场景与任务语义对齐物理校正器Physics Corrector基于几何感知的流匹配去噪模型接收粗略布局后仅通过调整物体的位置与旋转来消除碰撞、漂浮等物理问题不改变物体的身份、尺寸和语义关系。通过三轮“语义推理器添加物体 → 物理校正器修正位姿”的循环STABLE可以逐步生成任务对齐、物理合理、可直接用于仿真的桌面场景。三、方法详细说明1. 整体框架与训练流程对应图(a)STABLE采用模块化解耦设计两个模块基于同一套分级场景数据分别独立训练整体训练流程如图(a)所示。1共享输入数据三级渐进式场景标注训练数据基于MesaTask-10K数据集将每个桌面场景的物体拆分为三级形成序列化的子布局任务导向物体( O t (O^t(Ot)指令中明确指定、完成任务必需的核心物体重要背景物体( O B (O^B(OB)与任务物体有直接物理接触或距离极近的关联物体次要背景物体( O b (O^b(Ob)剩余的环境点缀物体。每一级都对应“任务prompt 已有物体集合”的输入形式用于训练模型的渐进生成能力。2语义推理器训练左侧模型基底基于Qwen3-8B大语言模型进行有监督微调SFT输入分级的prompt与物体上下文任务级仅prompt重要背景级prompt(Ot)次要背景级prompt(OtO^B)输出结构化JSON格式的布局包含每个物体的类别、包围盒尺寸、3D位置、偏航角、文本描述设计要点移除长推理链让模型直接输出结构化布局大幅减少token长度与生成延迟三级序列化训练让模型学会“先核心后背景”的渐进式构图逻辑强化任务指令的语义锚定效果。3物理校正器训练右侧物理校正器是一个以几何特征为条件的流匹配去噪模型训练目标是学习从“有物理缺陷的粗略位姿”到“物理合理位姿”的修正过程。几何条件编码根据语义布局的物体描述从3D资产库检索对应网格模型对每个物体的网格采样表面点云通过冻结的PVT-3PointVoxel Transformer v3编码器提取几何嵌入作为校正模型的条件输入。这种几何感知设计让模型可以处理堆叠、容纳等复杂空间关系而不仅依赖粗糙的包围盒信息。流匹配生成目标将所有物体的3D位置偏航角拼接为位姿向量在粗略位姿上加高斯噪声作为起点以真实合理位姿为终点用线性插值构造中间状态训练U-Net结构的速度场网络预测位姿修正的速度。这种设计让模型学习到“围绕粗略布局做局部修正”的行为不会大幅改动语义布局。物理约束损失为了严格保证仿真就绪性训练中加入了三类网格级有向距离场SDF损失物体-物体SDF损失惩罚任意两个物体之间的网格穿透物体-桌面SDF损失惩罚物体穿入桌面的现象支撑接触损失检测每个物体的支撑面桌面或其他物体约束物体底部与支撑面的距离在容差内消除漂浮现象同时保证堆叠结构的稳定性。2. 渐进式推理流程对应图(b)推理时采用三轮交替循环的渐进式生成范式时间线与模块对应关系如图(b)所示Loop 1(t 0 t_0t0​→ \to→t 1 t_1t1​)任务核心物体生成语义推理器接收任务指令与桌面规格先生成任务核心物体集合(O t O^tOt)的粗略布局检索对应3D资产后送入物理校正器修正碰撞与漂浮得到第一版物理合理的子布局。Loop 2(t 3 t_3t3​$\tot 4 t_4t4​)重要背景物体补充以上一轮校正后的布局为上下文语义推理器补充重要背景物体(O B O^BOB)再次检索资产后物理校正器对新增后的全部物体重新做位姿修正消除新增物体带来的碰撞。Loop 3(t 5 t_5t5​$\tot 6 t_6t6​)次要背景物体补充继续补充次要背景物体(O b O^bOb)最终经过物理校正后输出完整的、可直接用于仿真的桌面场景布局。这种“每加一层物体就做一次物理校正”的设计既避免了误差累积导致的严重碰撞又天然支持增量式的场景编辑与调整。同时由于两个模块解耦推理时可以采用批处理流水线调度一个场景做物理校正时其他场景可以并行做语义扩展提升整体生成吞吐量。3. 核心设计优势语义不漂移物理校正器只调整位置和旋转不改变物体身份、数量和相对语义关系保证严格对齐任务指令物理高可信网格级SDF约束流匹配连续优化相比传统迭代优化鲁棒性更强即使初始碰撞严重也能生成无碰撞、无漂浮的布局生成渐进式从核心到背景的分级生成既强化了任务关键物体的优先级又能生成丰富自然的杂乱桌面场景。
返回列表