世界模型“六小龙”首次在WAIC正面交锋,谁的理解更接近“终局”?

人看过

2026-07-22

具身智能无疑是近年AI领域最受追捧的方向之一。各类具身智能机器人应用场景轮番登场,能走、能跑、能抓、能翻跟头,硬件能力不断刷新着外界的预期。同时,电机、关节模组、传感器

具身智能无疑是近年AI领域最受追捧的方向之一。各类具身智能机器人应用场景轮番登场,能走、能跑、能抓、能翻跟头,硬件能力不断刷新着外界的预期。同时,电机、关节模组、传感器供应链也已经逐渐成熟,各家在“身体素质”上越来越拉不开差距。
如今行业里真正的焦灼,不在这些看得见的硬件上,而在一个深层方面——世界模型。近几年,世界模型从学术研究的前沿命题逐步走入产业界的核心议程,大量做机器人的公司,都在搭建自己的世界模型。
2026年的世界人工智能大会(WAIC 2026)期间,大会主办方与大晓机器人联合承办了“世界模型「六小龙」圆桌”,世界模型“六小龙”——大晓机器人、蚂蚁灵波、极佳视界、无界动力、智元机器人、自变量机器人六家企业的技术负责人首次坐在同一张桌子上,进行技术分享与碰撞。

这六家企业,基本代表了中国机器人行业在世界模型这条赛道上的第一阵营。值得注意的是,六位技术负责人阐述的方向路径各自独立,呈现了世界模型领域当前最真实的状态。

世界模型,机器人通向“理解”的必经之路

要理解这场圆桌会议的分量,得先弄清楚一个问题:世界模型对机器人到底意味着什么?
传统机器人的工作方式是“感知-规划-执行”的流水线,传感器看到什么,算法分析什么,然后规划路径、执行动作。这套架构运行得很好,但有一个缺陷——机器人只能在“见过”的场景里工作。换一个环境、换一种光照、换一种物体摆放方式,就可能无所适从。
原因很简单,机器人是在执行被编程好的指令,并不“理解”自己身处怎样的世界。

到2022年,深度学习三巨头之一、AI教父——Yann LeCun(杨立昆)在论文《A Path Towards Autonomous Machine Intelligence》(《通向自主机器智能的路径》)中,系统阐述了以“世界模型(World Model)”为核心的自主智能架构,试图解决上述问题。其核心思路是让智能体拥有一个能够预测环境未来状态的内部模型,在行动之前先在内部模拟后果,而不是“看到什么就做什么”。Yann LeCun(杨立昆)

这正是它被称为“必经之路”的原因。不掌握世界模型,机器人就始终停留在“高级工具”的层面,无法真正成为能够在开放世界中自主决策的智能体。因此,世界模型这一理解物理世界的核心技术路径迅速蔓延至产业界,成为赛道内被极具关注的领域。

“六小龙”圆桌上的多元交锋

在这场圆桌会议,“六小龙”各自亮出了对世界模型的理解。每一家都在世界模型这条路上走出了自己的轨迹,带着不同的技术路线和核心产品来到了同一张桌子上。大晓机器人作为这场圆桌的发起者,虽仅成立一年,但这家商汤系公司跑出了惊人的速度。2026年3月,大晓机器人首创了以人为中心的环境式数据采集,让真人在真实场景中穿戴传感器作业,将人类行为数据直接转化为训练素材。在此基础上,开悟世界模型3.0实现了全球首个端侧部署,不依赖云端算力即可在机器人本体上实时运行具备理解、生成、预测一体化的完备路线。大晓的逻辑从数据源头到推理部署都强调“真实环境”属性。
蚂蚁集团旗下的具身智能核心平台——蚂蚁灵波发布了行业首个具身原生世界动作模型LingBot-VA 2.0,核心突破在于从控制执行的需求出发、基于自回归架构从头预训练,让模型为“边预测、边行动”而设计,而非从数字世界的视频生成模型迁移而来。值得一提的是,蚂蚁灵波机器人智慧药房还入选了本届WAIC十大“镇馆之宝”。现场的机器人在具身基座模型LingBot-VLA 2.0的驱动下自主分工,完成从接单、取货到交付的全流程闭环。
极佳视界是国内最早系统布局世界模型的企业之一,其核心路线是从海量视频数据中让模型自己“悟”出物理规律——不给规则,只给数据,相信规模效应能带来物理理解的自然涌现。
无界动力的核心路线是“隐空间世界模型+强化学习”,在抽象表征空间里直接回归物理量,规避了像素空间预测带来的噪音干扰与高算力消耗,让模型通过自主交互持续优化决策。
智元机器人走“本体-数据-模型”三位一体的全栈路线,其自研世界模型Genie Envisioner-Sim 2.0(GE 2.0)定位为全功能世界模拟器。通过构建可试错、可迭代的虚拟仿真环境,让机器人在虚拟场景中先积累经验,再迁移到真实物理世界。
自变量机器人则锚定“世界统一模型”路线,2026年4月发布的WALL-B将视觉、语言、动作、物理预测全部纳入同一网络从零联合训练,消除模块边界与数据传输损耗。
“六小龙”从不同的起点出发,对“世界模型应该做到什么”的判断标准自然出现了分化。在圆桌会议中,六家企业的技术代表人分别提出了以下几方面的不同看法:
物理理解深度方面,无界动力联合创始人兼CTO夏中谱要求模型对几何、运动、力的预测足够精准。蚂蚁灵波首席科学家沈宇军则认为物理合理性比物理精度更重要,机器人不需要算清每一条轨迹,知道哪些差异会影响动作就够了。
推理长度方面,智元的AI算法总监任广辉强调长时物理一致性是必不可少的指标。自变量联合创始人兼CTO王昊直言长程推演是“伪需求”——如果推理慢到错过决策窗口,再完整的理解也没有用。
收敛方向层面,任广辉押统一表征,王昊押融合架构,沈宇军笃定触觉将成为分水岭,陶大程则认为收敛会先发生在一把评测标尺上。
最后,Demo与部署方面,六人普遍认为Demo容易,但部署难。王昊注意到模型能力从90%提升到99.9%,成本并非线性增长。首席科学家陶大程强调,很多模型跑在云端,但机器人留给自己判断的时间只有几十毫秒,端侧能力才是落地的关键。
沈宇军还提醒,行业经常把“模型的能力”和“模型展现出来的能力”混为一谈,前者是泛化效率、可交互性等内在属性,后者是生成效果这类外在呈现。那些追逐外在呈现的投入、在基模尚未收敛时就匆忙铺开的商业化,大概率会被证明是弯路。
整场圆桌会议结束,分歧几乎是全方位的。但陶大程在最后说了一句话,把这种状态概括得很准确:“分歧是论文的素材,重叠是产业的基底。”

赛道升温,共识未至,世界模型正处于具活力的探索期

从这场圆桌来看,“六小龙”对世界模型的定义、技术路线、数据策略、最终目标各不相同。而这一现象背后有深层次的原因。
世界模型这个概念本身就足够宽泛。Yann LeCun提出它时指的是一个能预测环境未来状态的内部模型,但“预测”有无数种形态,每一种都催生了完全不同的技术路线。
与此同时,行业至今没有一个公认的评测体系。大语言模型有MMLU、GSM8K这样的基准,可以让不同模型在同一把尺子上比较。世界模型用什么来测量?是预测准确率,还是Sim-to-Real(仿真到真实)的迁移成功率,还是下游任务的完成度?更重要的是,商业场景的多元决定了技术选择的多元。蚂蚁灵波要解决物流机器人的“局部理解”,智元要解决人形机器人的“实时决策”,极佳视界要解决“从视频中学物理”。问题不同,答案自然不同。
但“没有共识”或许正是这个赛道最大的红利。如果今天世界模型已经有了统一的技术路线,那说明这个领域已经成熟,窗口期将逐渐缩窄。回想大语言模型的2020年,那时GPT-3刚刚发布,行业对“应该怎么做”同样没有共识,有人押注更大的模型,有人押注更好的数据,有人押注不同的架构,这正是入局的最佳时机。

世界模型如今的状态和大语言模型五年前的状态极其相似,正处于最具活力的探索期。没有巨头垄断,没有行业公认的“标准答案”,创业公司和巨头站在同一起跑线上,构建了一个开放竞争的格局。

结语:

“六小龙”的圆桌“争吵”没有结论,但“各走各路”的状态,展现了这个赛道此刻最真实的面貌。回到标题的问题:谁的理解更接近“终局”?或许现在还不能下结论,且“终局”很可能不会只属于某一条路。大晓的端侧部署、蚂蚁灵波的具身原生、极佳视界的数据涌现、无界动力的隐空间推理、智元的仿真闭环、自变量的统一架构,每一条路都在解决世界模型落地中不同层面的核心问题。当前的分歧,恰恰说明行业还处在探索期的早期,未到站队的时候。
真正的终局,可能在评测标尺统一后,也可能在各家路线走向融合之后。一切都正在被全球的世界模型企业所书写。
 

 

 

 

关键字:
下一篇
九成企业预增!净利润最高暴增26倍,机器人产业链2026年H1迎来业绩大爆发

九成企业预增!净利润最高暴增26倍,机器

热门品牌