十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

世界模型研究纷争不断,朱军团队的通用世界模型能否通向通用智能?

世界模型研究纷争不断,朱军团队的通用世界模型能否通向通用智能? 【世界模型定义混乱研究回归基础问题】2026年「世界模型」成了AI圈最缺乏共识的术语之一。一段能连续生成的视频、随键鼠操作实时变化的数字环境、在潜空间预测未来状态的系统以及直接输出机器人动作的策略都被叫做世界模型。然而这些模型虽都在处理世界信息能力边界却差异巨大。比如生成视频画面虽逼真却可能违背物理规律机器人能完成抓取却可能只熟悉实验室特定环境。仅靠Demo很难判断一个系统究竟学到了什么概念的混乱也增加了技术判断的难度。不同团队看似在同一赛道竞争实则回答的问题不同。于是世界模型研究开始回归一个基本问题模型需要具备哪些能力才能从生成内容走向理解并改变世界对此李飞飞和World Labs按功能将世界模型分为渲染器、模拟器和规划器LeCun主张在抽象潜空间中学习可预测的世界结构清华大学朱军则提出了「通用世界模型」构想并将其定位为连接数字与物理世界的基础还在论文中完善框架给出五级进化路线图。【通用世界模型核心能力与五级路线】论文将通用世界模型的核心能力归纳为理解、想象和行动。模型要从历史观测中判断当前世界推演不同选择的未来采取行动并根据新观测修正自身。这就像学自行车人会根据身体摇晃和车把偏向调整方向随着练习大脑学会预判动作结果。朱军团队将这一逻辑概括为通用世界模型的三项核心能力它们相互衔接形成闭环。为描述世界模型的演进朱军团队提出五级路线即从L1生成世界、L2交互世界、L3在世界中行动到L4自主世界智能体与L5世界组织者。以被推到桌边的玻璃杯为例不同层级的模型有不同表现。这条路线把「世界模型」变成了可逐级检验的问题现有系统已触及前三个层级L4和L5仍是开放问题评测需考察模型的多种迁移能力。【数据与架构从视频到具身的验证路径】世界模型的难点不仅在算法。互联网视频数据丰富但缺乏动作、力量和意图记录机器人轨迹能连接观测、动作和结果但采集成本高且易绑定硬件和任务。朱军团队将两类数据放入由观察走向行动的数据金字塔底层是互联网视频顶层是真实机器人交互数据。生数科技同时推进视频生成与具身智能视频提供世界知识广度机器人数据完成行动接地。在数字世界Vidu系列探索视觉世界的生成与交互在物理世界Motus与Motubrain将环境理解、状态预测与机器人动作接入同一条链路。两条产品线形成对世界模型假设的两次验证但要让两类验证共享底层能力存在挑战。朱军团队提出的MoT架构尝试平衡不同模态其目标是让通用世界模型有一个可被不同模态共同读写、持续更新的世界状态。【Motus2迈向L4的新进展】如果说Motus与Motubrain将生数的世界模型探索推进到L3那么Motus2则进一步加入结果评估与策略反馈尝试让行动闭环具备自我改进能力。Motus2以一套共享参数的视频 — 动作模型暴露出策略、模拟器和评估器三种控制接口让机器人能先预演后果再选择行动执行结果也能用于改进策略。在数据侧Motus2采用分层训练路径使用约13万小时的人类第一视角记录和超过100小时的机器人轨迹及人机对齐数据。在执行侧它通过独立的轻量触觉专家细化短动作并预测力反馈。Motus2仍处于从L3向L4延伸的阶段当前验证集中在特定机器人和操作任务自主目标形成等方面仍有待探索。【学术脉络与产业路径中国技术的探索】通用世界模型的框架延续了朱军及清华TSAIL长期积累的研究方向。朱军教授长期研究贝叶斯方法等领域TSAIL也培养和影响了一批研究者。从概率建模到生成与决策的学术脉络映照出AGI发展的两类入口从语言出发和从视觉与动态世界出发。在中国AGI产业版图中智谱与生数分别代表这两条路径。智谱从语言模型出发生数从视频生成出发两条路线正在相互渗透最终都指向对语言、世界状态和行动的共同建模。【结语世界模型竞争的关键】世界模型的竞争最终会从Demo的震撼程度转向系统经受反馈的能力。画面能制造第一印象但几何、物理和行动才是关键。朱军团队的论文虽未给出世界模型之争的最终答案但提供了可检验的问题。过去十年AI在学习语言和数据规律上取得进展下一阶段模型要面对持续变化的环境当模型能在这样的环境中不断学习世界模型才会成为通向通用智能的基础。那么世界模型距离通用智能究竟还有多远呢
返回列表