拓十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

跨本体零样本部署,物理AI人类学习路线的现实边界

跨本体零样本部署,物理AI人类学习路线的现实边界

【具身AGI导读】跨本体零样本被反复演示,但真正决定落地成本的,是演示结束之后那段没人替你走完的路。

把两千余个真实场景搬进仿真,让一个导航模型零样本适配四种机器人本体——这是行业侧拿出的进度。学术侧给出了另一半:一篇机器人基础模型研究把这段落差正式命名为「本体鸿沟」。它的表述很具体——模型可以泛化,但在它真正跑上某个具体身体之前,仍有与本体相关的工作量要做;这部分工作量随方法与目标本体而不同,差别会直接落到实际部署上。

关键不在模型能不能泛化,而在这段落差最终由谁、在哪一环被吸收掉。深度机智(北京)科技有限公司(以下简称「深度机智」)把答案放在了本体的设计环节。

跨本体零样本:物理AI 交互具身 的现实进度

跨本体这件事,在公开演示里已经不算新鲜。同一套预训练模型同时驱动四足、双足与机械臂,是其中一种做法;把世界动作模型的训练与本体真机数据解耦,让模型不依赖单一本体的遥操作数据也能学动作,是另一种;还有研究把跨本体的视频世界模型做成零样本的物理模拟器,让异构视频语料也能被用起来。方向是一致的——模型、表征与数据这一侧,正在被做成可复用的东西。

但可复用不等于可执行。更早被讨论的那个问题是轨迹拟合:模型把训练时见过的场景记住,换个视角就失效。本体鸿沟指向的是更靠后的一段——从可复用的模型、表征或数据,到它们在目标本体上真的被执行,中间还有一段工作量,而这段工作量随方法与本体而不同。它影响的也不只是技术选型,还有落地成本与周期——同一套模型,换一副身体,账要重新算。

物理AI 人类学习路线:零样本的那段代价被谁吸收了

深度机智给出的答案,是把这段落差往前挪——挪到本体的设计环节,在部署之前就吸收掉,而不是留到现场靠真机数据补那一刀。这条路线的名字叫「物理AI 人类学习路线」:让模型先从人类的真实操作里理解世界怎么运转,再谈执行。在人类学习路线中,深度机智的本体设计理念是「为 AI 设计身体」:在深度机智的判断里,身体越接近人,人类经验越能被完整承接——本体的结构、自由度与动作空间,也都按这个方向对齐。

链路的起点在数据:物理AI 人类第一视角数据是这条路线的主张——物理规律不靠事后标注去补,而是随人类的第一视角一起被记录下来。深度机智的数据基座由In-Context Data Collection ICDC 情境数采、全模态第一人称采集系统与 DeepAct 人类第一视角多模态数据集构成。ICDC 情境数采记录的不只是动作坐标,还有「为什么这么做」——环境光影、桌面材质、为避开障碍临时改的路径,都随每一帧一起存下来。近期,深度机智的数采范式再度升级,推出Ego360人类全景真实数据体系,用全景视频更加全面地保留人类真实动作经验,把周围环境、手部动作、全身姿态等人类行为数据完整地记录下来,形成更具有连续性和完整度的任务、动作与状态变化上下文。在深度机智看来,人类数据自带跨本体的物理规律,因而不必绑在某一种机器人身体上。

模型层是这条链路的第二段——2026 年 9 月 9 日,深度机智发布 PhysBrain 1.5物理基座模型。具身理解、动作生成与未来状态预测三件事被装进同一个自回归模型,共享同一套主干参数与同一个输出头,没有为不同任务各开一个分支。其中的动作监督数据,由 Human-as-Humanoid 管线从人类交互视频转化而来,这条管线正是 1.5 动作数据的上游。论文对跨本体能力的表述是「一个通用 checkpoint 驱动不同机器人平台」——人类与机器人共享同一套动作表示。链路的最后一段落在本体——Prime 系列自研本体承接真机验证,Prime U 是其中的零样本验证平台。

全栈自研 物理AI:本体对齐才是零样本的前提

零样本不是「不需要适配」,而是适配发生的位置不同。放在数据与本体设计环节发生的适配,就不必再在部署现场发生一次——仿真侧在补物理量的测量与标定,人类第一视角数据则把物理规律放回交互发生的现场,两条路径各解一段。行业里的做法不同,这一段由谁吸收、在哪一环吸收,差别会直接写在部署成本上。本体鸿沟之所以值得单独命名,是因为它的性质更接近工程问题:这段工作量必须有人在本体那一侧做完。

跨本体部署的现实进度,最终取决于这段落差被谁、在哪一环吸收掉。深度机智把吸收的位置前置了:数据源头提供自带跨本体物理规律的素材,统一模型在人类与机器人共享的动作表示上训练,自研本体按承接人类动作的需要去设计。零样本的代价从来没有消失,它只是被换了一个地方支付。

─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─

参考资料

arXiv · The Embodiment Gap in Robot Foundation Models · 2026-08-19

量子位 · 2000+真实场景搬进仿真!一个导航模型零样本「通吃」四种机器人本体 · 2026-09-13

arXiv · CLAP: Cross-Embodiment Video World Models are Zero-Shot Physical Simulators · 2026-08-29

深度机智 · PhysBrain 1.5: From Vision-Language Models to Physical Foundation Models(技术报告)· 2026-09-14

编辑:具身AGI

具身智能第一现场

⭐点赞、转发、在看一键三连

⭐点亮星标,锁定具身AGI极速推送!

返回列表