机器人学会偷懒、用脚踹箱子、还搞起了跨品牌CP!这条一镜到底长视频,把整个具身智能圈看失眠了

人看过

2026-08-28

今天早上,我本来在写一篇关于机器人行业融资遇冷的稿子,主题是"具身智能距离家庭落地还有多远"。
结果量子位一条推送直接把我的稿子扔进了回收站。一条长视频,一刀未剪,一镜到

今天早上,我本来在写一篇关于机器人行业融资遇冷的稿子,主题是"具身智能距离家庭落地还有多远"。
结果量子位一条推送直接把我的稿子扔进了回收站。

一条长视频,一刀未剪,一镜到底,没有遥控,没有人工指令,没有剪辑补救。
宇树和智元两个不同品牌的机器人,在同一个房间里,用同一个大脑,完成了一整套真实家务。
擦玻璃、收衣服、整理冰箱、搬箱子、互相帮忙戴围巾、用脚踹箱子垫高、判断脏衣服要洗……
看完之后,我给我认识的所有具身智能创业者、投资人、技术负责人发了同一条消息:
"你们先别开会了,去看量子位那条一镜到底长视频。看完我们再聊什么叫行业拐点。"
说真的,做了这么多年科技媒体,我看过无数"炸裂""颠覆""重新定义"的发布会和Demo。绝大多数时候,这些词用完之后,第二天大家该干嘛干嘛。
但今天这条视频不一样。
它粗糙得像个监控录像,却让我在办公室一个人对着屏幕反复回看了二十多次,每一次都怀疑自己是不是看错了。
因为它展现出来的东西,已经不只是"机器人能干活了"这么简单。
它展现的是机器人会思考、会决策、会计算力量、会借用工具、会判断优先级、会跨硬件协作、会断点续做,甚至学会了偷懒和"体谅同伴"。
这意味着,我们一直在讨论的"机器人无痛进家做家务",可能真的不需要再等三年五年了。
今天,就是那个时刻。

而今天量子位这条视频里的机器人,干的事情简单到不起眼——擦玻璃、收衣服、放东西。但每一个动作的背后,都是自主推理、实时决策、环境交互和长期任务规划。
这才是真正难的地方。
更让行业窒息的是,这条视频的环境设计。
拍摄场地是一个15平米左右的出租屋,家具密集,过道狭窄,连人转身都费劲。这种环境,基本排除了遥操作的可能性——因为根本站不下人。
同时,一镜到底的长视频,意味着没有剪辑,没有重拍,没有"把失败的镜头剪掉"。
而且两个机器人全程在同一个空间里并行干活,没有碰撞,没有迷路,没有停滞。
如果这是提前预设的脚本,那这个脚本的复杂度会高到无法工程实现。因为任何一个小误差——比如机器人多走了两厘米,或者物品放歪了一点——都会在这条长视频的长链条里被无限放大,最终导致整个演示崩盘。
所以,这只能是一条完全自主学习、自主进化、自主决策的视频。
环境是陌生的,任务是复杂的,时长跨度长,中间还有闹钟打断、任务切换、跨本体协作这些"地狱级"难度加成。
换作市面上任何一款已知的具身模型,能撑过前两分钟就算不错了。
而这个神秘模型,不仅撑过了整条长视频,还在这个过程中展现出了至少七八个"行业首次"。
每一个单拿出来,都够一家具身智能公司开一场发布会。
但它就这么静静地出现在一条一镜到底的长视频里,好像这些能力都稀松平常。
这种"信手拈来"的轻松感,才是真正让人后背发凉的地方。

二、逐帧拆解:每一个细节都是行业名场面

接下来,我会按照量子位文章的顺序,逐段拆解这条视频的关键细节。我会尽量把每个技术点讲透,同时用生活化的语言解释清楚——为什么这些动作对机器人来说,难到不可思议。

细节一:伸手出窗擦玻璃——空间感知与自主推理的巅峰融合

视频的第一个任务,就让我坐直了。
一台宇树G1机器人拿着一把刮水器,开始擦玻璃。
这个任务的选择本身就极其"恶意"。为什么?因为刮水器是擦玻璃工具里,对力度和角度要求最高的一种。用抹布擦,力大点小点无所谓,擦不干净可以多擦几遍。但刮水器不一样——力小了,水渍刮不掉;力重了,胶条和玻璃之间会发出刺耳的异响,而且可能刮坏胶条。
用过刮水器的人都知道,人类掌握这个工具都需要一定的练习。机器人上来就拿刮水器擦玻璃,这属于"新手村直接打Boss"。
更关键的在于,擦玻璃这个动作,对机器人的力学建模能力提出了极高要求。刮水器与玻璃之间是一个动态接触面,力的传递不是简单的点对点,而是沿着胶条方向分布。机器人需要实时感知刮水器与玻璃的接触状态,调整施加的力度和角度,保证擦拭效果的同时不损坏工具。
这背后,是精确到牛顿级别的力矩控制,是毫秒级别的触觉反馈,是对刮水器形变特性的动力学建模
现有的具身模型,能把力控做到这个程度,已经是行业天花板。
但真正让我反复回看的,是接下来的一幕。
机器人擦了几下,发现有一处脏东西始终擦不干净。
注意,这里有个细节:它没有继续用更大的力气去擦同一块区域。这是绝大多数机器人的做法——重复同一个动作,直到任务超时或者被判定失败。
宇树G1没有。它停了下来。然后做出了一套我从来没有在机器人身上见过的动作序列:
侧身、后仰、探头、展臂,把拿着刮水器的手伸出了窗外。
整套动作流畅得像一个站在窗边擦玻璃的老手。
而且请注意一个关键细节:它伸出手的时候,没有碰到窗框。
这意味着什么?意味着机器人在执行这个动作之前,已经完成了对窗户开口大小的精确空间建模,知道自己的手臂穿过窗户时不会撞到边框。它对自己手部尺寸的认知、对窗户开口的感知、对两者之间空间关系的计算,是在动作执行之前就已经完成的。
这是空间感知、本体认知和动力学解算的三位一体。
但这还不是最恐怖的。最恐怖的是它的推理逻辑。
让我们还原一下这个机器人脑子里(如果它有)发生了什么:
"我擦了这块玻璃,但有一处脏东西擦不掉。脏东西在玻璃的这一面擦不掉,那它可能不在这一面,而是在另一面。窗户外面是我看不到的地方,但如果我把手伸出去,从外面擦,可能就能擦掉了。我的手臂够长吗?窗户开口够大吗?计算完毕,可行。执行。"
这个推理链条,是人类才会有的因果推理。
它不是基于训练数据里的"当擦不干净时,尝试把手伸出窗外"这种模式匹配。因为没有任何训练数据会包含这种场景。这是模型在面对一个从未见过的问题时,自主生成的解决方案。
这种能力,在具身智能领域有一个专门的名字:泛化推理。
而泛化推理,一直被认为是VLA模型最大的短板。
现有的VLA模型,本质上是"看图猜动作"。它们学到了"当看到玻璃上有一个污渍时,应该用抹布去擦"这种条件反射。但一旦场景发生微小变化——比如污渍在窗外,或者没有抹布只有刮水器——模型就会直接失效。因为它的所有能力,都被训练数据锁死了。
而这条视频里的模型,面对的是一个它从未见过的具体情境:刮水器+玻璃+污渍+窗外+手臂长度+窗户开口大小。
这个组合,几乎不可能出现在训练数据里。但它依然给出了最优解。
这就是从"条件反射"到"真正思考"的跨越。
对于具身智能行业来说,这个跨越的意义,怎么强调都不为过。
因为在此之前,行业里有一个普遍的悲观共识:VLA模型的能力上限,就是训练数据的天花板。你永远不能指望一个只见过"擦桌子"的机器人,能自主学会"擦玻璃"。
而今天这条视频,用一只伸出窗外的手,把这个共识打碎了。

 

图源:量子位

细节二:闹钟响了,任务被打断——全球第一个实现断点续做的具身模型

如果说擦玻璃展现的是"聪明",那接下来这一幕展现的,是"稳"。
视频进行到中段,一个很轻微的细节出现了。
闹钟响了。
声音不大,在视频里需要放大音量才能听清。但就是这声闹铃,让正在执行任务的两个机器人,做出了让我下巴掉下来的反应。
它们没有报警,没有卡住,没有忽略闹铃继续干活。而是同时停下了手里的活,切换到新的任务——开始收纳桌面和冰箱。
收完之后,它们又回到之前被打断的位置,继续执行原来的任务。
从头到尾,没有任何混乱。
你可能会觉得,这有什么了不起的?不就是任务切换吗?
我给你解释一下,为什么这个能力对机器人来说是"神级"。
目前市面上的具身智能模型,绝大多数只能执行单任务串行流程。什么意思?就是一个任务从开始到结束,中间不能有任何打断。一旦被打断——比如任务目标移动了,或者环境发生变化了——模型的任务状态机就会直接崩溃。轻则重新开始,重则完全死机。
这背后的技术原因,在于当前主流模型的任务表征方式。大多数VLA模型把任务编码成一个连续的动作序列:拿起杯子→走到饮水机→倒水→走回来→放下杯子。这个序列是端到端生成的一次性产物。一旦中间某一步出了偏差,后续所有步骤的参考系都会错位。就像多米诺骨牌,推倒第一张,后面全倒。
而在家庭真实环境中,打断是常态。孩子哭了要哄,快递来了要收,电话响了要接,锅里的汤要溢出来了要赶紧关火。
如果一个机器人不能被打断,那它永远无法真正进入家庭。
而这条视频里的机器人,不仅经受住了打断,还在被打断之后,准确地回到了断点继续干活。
这就是断点续做。
在具身智能领域,这被认为是长序列任务能力的"圣杯"。因为它要求模型具备全局任务调度、状态保持和动态优先级判断三个能力,缺一不可。
全局任务调度,意味着模型不是在执行一条固定的动作链,而是在维护一张任务图谱。每个子任务有自己的优先级、依赖关系和执行状态。当闹钟响起,高优先级的收纳任务插入,模型会暂停当前任务,保存状态,切换到新任务,等新任务完成后再恢复旧任务。
状态保持,意味着模型对"我刚刚在干什么、干到哪一步了、接下来要干什么"有清晰的记忆表征。这需要模型在长时序上维护一个稳定的内部状态,不会因为任务切换而丢失。
动态优先级判断,则意味着模型像人类一样,理解"闹钟响"意味着一个新的、更紧急的任务需要立即处理,而当前的任务可以稍后继续。
这三个能力,之前从来没有在任何公开的具身模型演示中出现过。
不是大家不想做,是技术真的达不到。而这条视频,用一个闹钟,轻描淡写地告诉所有人:我做出来了,而且是全球第一个。
更让人细思恐极的是,这个"断点续做"在整条长视频里,看起来如此自然,如此轻松。仿佛对这两个机器人来说,被打断一下再继续干活,是一件稀松平常的事。
但它一点都不平常。它是整个具身智能领域,从"机器"走向"员工"的分水岭。

细节三:毛巾挂肩膀、拎拖鞋挂绳——机器人开始"偷懒"了

在收纳任务中,有一个让我又惊又笑的细节。
智元机器人在整理杂物时,拿起了一条毛巾。按照标准的机器人行为逻辑,它应该把毛巾拿在手里,走到目标位置,放下。
但它没有。它拿着毛巾,试了一次,没挂上。试了第二次,又没挂上。试了第三次,终于把毛巾挂在了自己的肩膀上。然后继续去拿其他东西。
我一开始没看懂。为什么要费这么大劲把毛巾挂肩膀上?拿在手上不是更简单吗?
后来我反应过来了。因为挂肩膀上,比拿在手上省劲。
把毛巾拿在手里,意味着这只手在走到目标位置之前,都被占用了。而且手臂要保持固定的姿态,持续消耗能量。而把毛巾挂在肩膀上,双手就都空出来了,手臂也可以自然下垂,节省了大量能量。
这个机器人,在主动寻找最省力的方案。
这不是孤例。注意看它整理拖鞋的镜头。它拿拖鞋的时候,抓的是新拖鞋的挂绳,而不是鞋体本身。为什么?因为拎绳子比抓鞋底更省力,也更稳当。
每一个细节,都在指向同一个结论:这个机器人在优化自己的能量消耗。
换句话说,它在"偷懒"。
而"偷懒",在生物学和认知科学里,被认为是高级智能的重要标志。因为"偷懒"的本质,是对效率的追求。它要求行为主体意识到,同样的任务,可以有多种完成方式,而其中有一种方式,消耗的资源最少。
这是"计算最优解"的能力,是"选择策略"的能力。
现有的具身模型,在训练过程中会被优化为"尽可能精确地复现参考动作"。它们没有"省力"的概念,因为它们的目标函数里,根本不包含能量消耗这一项。
但这个模型不一样。它像人类一样,会嫌累。它会在满足任务约束的前提下,选择一个对自己来说最轻松的执行方案。这背后的技术含义,是模型的代价函数里包含了能耗惩罚项。它在规划动作时,不仅考虑"怎么做能完成任务",还考虑"怎么做最省力气"。
而且更让人佩服的是,它是自己学会的。没有任何人教它"把毛巾挂肩上比拿在手里省劲"。是模型在尝试的过程中,发现了这个规律,然后把它内化成了自己的行为策略。
这种"从经验中学习规律"的能力,正是自我进化的雏形。
当机器人开始嫌累、开始偷懒、开始寻找最优路径的时候,它就离真正的劳动者不远了。因为一个不知疲倦的机器人,你只敢把它放在工厂里。而一个知道节省力气的机器人,你才放心让它进入你的家。

细节四:用脚踹箱子垫高——自主使用工具,人类标志性行为

接下来这一幕,是我认为整条视频里最炸裂的,没有之一。
宇树G1想把围巾放到第三层柜子。但它身高只有1.3米。第三层柜子的高度,超出了它的操作范围。
如果换作市面上任何一款机器人,接下来的剧情一定是:卡住,等待人类介入,或者任务失败后继续下一个动作。
但宇树G1没有。它做了三件事。
第一,它找到了旁边的一个箱子。一个空箱子,放在房间角落。
第二,它把箱子推到了地上,企图弯腰搬起来,放到柜子边上。
第三,它发现自己弯不下腰——因为身上挂满了东西,躯干的自由度受到了限制。
然后,让我头皮发麻的一幕出现了。
它一脚把箱子踹到了柜子旁边。
不是踢飞,不是乱踹,而是控制力度和方向,把箱子推到了柜子正下方。然后它站了上去。够到了。
朋友们,请仔细想想这个动作链背后的每一个环节。
首先,它需要理解"箱子可以增加高度"。 这不是一个可以从视觉特征中直接提取的信息。它需要模型理解物体的功能属性——不是箱子看起来像什么,而是箱子可以被用来做什么。这种功能性推理,在人工智能领域被称为"工具性认知",被认为是人类智能的核心组成部分。
其次,它需要计算"箱子放哪里才能让自己够到柜子"。 这涉及空间关系推理:箱子的位置、柜子的位置、自己站在箱子上的高度、目标物品的高度,四者之间的几何关系。
再次,它需要判断"自己的本体限制"。 它尝试了弯腰搬箱子,发现自己做不到。这个"发现自己做不到"的能力,在具身智能领域叫做本体感知。它要求模型对自身的关节活动范围、姿态限制有精确的建模。知道自己"做不到什么",比知道自己"能做到什么"难得多。
最后,它生成了一个替代方案。 "我搬不了箱子,但我可以踢它。"用脚踢箱子,这是一个身体部位的功能替代。在传统的运动规划中,脚是用来走路的,手是用来操作的。但宇树G1打破了这种预设,把脚变成了操作工具。
这四个环节,每一个单独拿出来,都够发表一篇顶会论文。但在这个视频里,它们被压缩在一个不到50秒的动作序列里,连贯地完成了。
这不是一个训练过的技能。这是一个完整的推理、规划、适应和执行闭环。
而"使用工具",恰恰是远古人类和动物的分界线。从历史上看,当一个物种开始学会使用工具,它就开始了一条截然不同的进化路径。而现在,这个路径上,多了一个新的成员。
机器人在这一刻,跨过了那条线。

细节五:跨本体协作——两个不同品牌的机器人,从"竞品"到"队友"

现在我们来谈谈整条视频最具戏剧性的一点。
视频中同时出现了宇树G1智元远征A3。宇树和智元,这两家公司在国内的具身智能赛道上是直接竞品。硬件架构不同,传感器方案不同,运动学设计不同,甚至连目标客户群体都高度重叠。在行业活动上,两家的展位经常挨着,但展品之间永远隔着一道无形的墙。
而在这条视频里,它们共用同一个大脑,在同一个空间里协同完成家务。
让它们协作的模型,做到了跨本体统一建模。这意味着,这套模型对"机器人身体"的认知,是抽象化的。它在"大脑"层面有一个统一的动作表示空间。不管是宇树G1还是智元A3,不管身高是1.3米还是1.7米,不管关节数量和自由度如何不同,模型都能把它们映射到同一套认知框架里。
硬件可以随便换,大脑不用变。
这在具身智能领域,被称为"软硬件解耦"。而在计算机行业,上一次发生这件事,是微软Windows操作系统的出现。在Windows之前,每一台电脑都有自己的专属软件,软件和硬件是绑定在一起的。Windows的出现,让软件第一次可以运行在不同品牌的电脑上。
这条视频里的模型,就是具身智能的Windows。
它终结了"每个机器人本体都绑定一套算法"的时代,开启了"一个大脑驱动所有身体"的新纪元。
而跨本体带来的能力,远不止"省掉了适配成本"这么简单。因为不同本体的机器人,天然有不同的能力边界。宇树G1矮小灵活,适合在低处操作;智元A3高大有力,适合处理高处物品。它们各自有擅长的东西,也有做不到的事情。
在传统的单本体框架下,这些能力边界是固定的。矮的够不到高处,高的钻不进角落。但在跨本体协作框架下,它们可以互相弥补。
视频中最动人的一幕,是智元帮宇树取下围巾。
宇树身上挂满了东西,脖子上还挂着一条围巾。它想走到柜子边,但身高不够,放不进去。而且身上太满,动作受限。
智元走了过来。它放下了自己手里的小拉车——主动切换任务——走到宇树身边,像毕业典礼上的授勋一样,轻轻地把围巾从宇树的脖子上取下来,折了三折,放进了柜子。
全程没有语言,没有指令,没有停顿。
而真正让我细思恐极的是这些细节:
智元选择帮宇树的时候,它放下了自己的任务。 这意味着什么?意味着它判断"帮宇树取下围巾"比"继续自己的任务"优先级更高。这是社会行为的雏形——为了群体效率,牺牲个体短期的任务进度。
智元取围巾的时候,是从宇树的头顶绕过去的,不是直接拽。 这需要对围巾缠绕状态的精确空间认知,以及对力度的精细控制。如果用力过猛,可能拽倒宇树。如果角度不对,可能缠住宇树的头部。
智元把围巾折了三折,才放进柜子。 这不是任务要求的。任务只要求"放进去"。折叠围巾,是它自主判断"折起来比揉成一团更省空间、更整齐"。
这些细节的背后,是模型对同伴的状态、同伴的能力、任务的全局优化的实时推理。
两个不同品牌的机器人,因为共享一个大脑,第一次展现出了群体智能
而群体智能,被认为是机器人从"工具"变成"劳动力"的最后一步。因为在这个世界上,几乎没有哪个任务,是可以靠一个单独的个体完成的。人类之所以能建造城市、发明互联网、探索太空,靠的不是个体有多强,而是个体之间的协作
机器人终于也在向这个方向迈进了。

细节六:收尾动作的精确性——误差累积的终结者

在视频的最后阶段,两个机器人将最后几件物品归位。
宇树把刮水器放回了原位。落点精准,动作连贯,没有多余调整。
智元把最后一件衣服放进了洗衣机。注意,它判断出搭在洗衣机上的是脏衣服,于是放进去洗了。
这些收尾动作,看起来毫不起眼。但在内行眼里,这是长时序任务闭环的终极考验。
为什么长时序任务这么难?因为误差会累积。假设机器人每做一个动作,有0.5%的概率产生一个微小的位置偏差。这个偏差可能是多走了1厘米,或者物品角度偏了2度。单次看,微不足道。
但如果你让机器人连续执行50个动作——这在长时序任务中很正常——误差就会像滚雪球一样越来越大。到最后一个动作时,机器人的参考系可能已经完全漂移,导致任务失败。
这就是传统VLA模型最怕长序列任务的原因。
而这个模型在整条长视频、数十个动作的长链条中,持续纠错、稳定输出、精确归位,没有出现任何误差累积的迹象。
这意味着,模型具备了一套实时误差检测和纠偏机制。它在执行每一个动作时,都在用视觉和触觉反馈,与内部的世界模型进行比对。一旦发现偏差,立即修正。
它就像一个有经验的厨师,即使过程中切菜切歪了一点、调味料倒多了一点,也能在最后端出一道完整的菜。
这种鲁棒性,是真实家庭部署的必要条件。因为家庭环境是不完美的,地板有高低,家具会移动,光线会变化。机器人不可能永远在"标准环境"里干活。
它必须能处理不完美。 而这条视频,证明了它确实可以。

三、底层技术:它不在"猜",它在"算"

聊完了细节,我们来认真说说,这个模型为什么能做到这些。
根据量子位文章的分析,这套模型跳出了当前所有主流具身模型的技术框架。
要理解它的牛逼之处,我们先要理解现阶段主流模型的"不行之处"。
目前市面上的具身模型,大致可以分为三类:VLA模型、WAM模型、传统世界模型。
VLA(Vision-Language-Action)模型,是当前最主流的一派。它的思路是:把机器人看到的东西(视觉)和任务指令(语言)输入到一个端到端的神经网络里,然后直接输出动作。听起来很美好。但VLA的本质是"看图猜动作"。它做的所有事情,都是基于训练数据里的统计规律。看到一块玻璃上有污渍,就输出"擦"的动作。这个动作是训练数据里最常出现的对应动作。
问题在于:统计规律不是物理规律。 VLA模型不理解重力,不理解摩擦,不理解力的传导,不理解空间几何。它只是在数据里见过足够多次"玻璃+污渍→擦"的组合,所以能做出看起来合理的动作。一旦场景变了——污渍在窗外,或者没有抹布只有刮水器——VLA就废了。 因为训练数据里没有这个组合,它就"猜"不出来该做什么。
WAM(World-Action Model)和传统世界模型,走的是另一条路。它们试图先让模型理解世界,再基于对世界的理解来规划动作。听起来比VLA高级,但实际效果并不好。因为它们的"理解",本质上还是统计预测。它们预测"如果我做这个动作,画面会变成什么样"。但"预测画面"和"理解物理"之间有巨大的鸿沟。
一个机器人可以在模拟器里预测"杯子掉到地上会碎",但当它在现实中拿起一个杯子时,它依然不知道应该用多大的力握持,因为"预测画面"不包含力的维度。
VLA是"数据直觉派",WAM是"预判空想派"。 两者有一个共同的底层缺陷:数据驱动的任务拟合。所有的能力,都来自对训练数据的拟合。所有的动作,都是对数据分布的采样。这意味着,模型的能力上限,就是训练数据覆盖的空间边界。
而这条视频里的模型,据说只用了几十个小时的视频数据训练。几十个小时。不是几万小时,不是几百万条轨迹。是几十个小时。就这么点数据,它做到了那些用了几千万条数据训练的模型做不到的事情。
所以它一定不是在"拟合数据"。它是在"理解物理"。
根据量子位的分析,这套模型的三个核心技术内核是:
第一,物理约束动力学学习。 不像VLA和WAM那样纯数据驱动,它的核心是物理规则前置、动力学预测驱动。模型内部嵌入了对重力、摩擦、接触力学、刚体运动学的基本约束。在这个基础上,它再学习如何操作物体。所以它不需要"见过"刮水器擦玻璃,它只需要理解"力如何通过刮水器传导到玻璃表面",就能自主生成擦拭动作。
第二,跨本体统一建模。 通过统一的动作表示空间和本体自适应机制,让同一套模型适配不同品牌、不同架构的硬件平台。模型对"手"的理解,不局限于某个特定型号的机械手,而是抽象到了"操作末端"的层面。所以宇树的手和智元的手,在它眼里是同一个概念的不同实例。
第三,长时序鲁棒闭环。 依托全局任务调度框架,自主处理全程突发干扰、动作误差、任务切换。模型对任务的理解不是在执行一个动作链,而是在维护一个任务状态机。它知道当前整体任务的进度,知道每个子任务的状态,知道如何在必要时暂停、切换、恢复。
这三个技术内核,每一条都像是对当前具身智能行业主流技术路线的一次正面宣战。
但更重要的是,它颠覆了Scaling Law的叙事。
过去几年,整个AI行业都在被Scaling Law统治:数据越多,参数越大,能力越强。具身智能领域也不例外,大家都在拼命堆数据、堆算力。
但如果一条只用了几十小时数据的模型,就能达到甚至超越那些用了千万级数据的模型——
那Scaling Law在具身智能领域,还成立吗?
这个问题,足以让英伟达的股价抖三抖。

四、行业新时刻:机器人无痛进家,从口号变成现实

做科技媒体这些年,我见过太多"行业时刻"被提前宣布。
"自动驾驶即将普及""VR是下一个计算平台""元宇宙改变一切"……每一个都在当时看起来无限接近,但事后回看,都差了那么一口气。
所以我对"新时刻"这个词的使用,一直极度克制。
但今天,我不得不承认:具身智能的行业时刻,真的来了。
不是因为这条视频多么精致——恰恰相反,它粗糙得像监控录像。而是因为,它展现出来的能力集合,已经远远超出了"实验室演示"的范畴,开始触及真实家庭的真实需求。
我们来数一数,这条一镜到底的长视频,展示了哪些家庭生活必需的能力:
擦玻璃——不是随便擦擦,而是会判断脏东西在哪一面,会把手伸出窗外擦干净。这项能力对应的是家庭清洁中最高频也最让人头疼的场景之一。
收纳整理——把洗好的坐垫放回沙发,把玩偶放进衣柜,把衣服放回原位。这是家务中重复性最高、最消耗耐心的部分。
冰箱管理——看到冰箱上有食物,判断应该冷藏储存,主动放进去;顺便拿出应该解冻的食物。这不仅需要识别能力,还需要生活常识。冷藏、冷冻、解冻,这些概念对机器人来说,是真正的知识门槛。
衣物分拣——判断搭在洗衣机上的是脏衣服,放进去洗。这意味着机器人理解了"洗衣服"的完整闭环:脏→洗→净→收纳。
使用工具——够不到高处时,自己找箱子垫脚。这是超越"执行任务"的自主问题解决能力。
协同作业——两个不同品牌的机器人,自主分工,互相帮忙,完成一个人没法完成的任务。这对应的是家庭中那些需要"搭把手"的场景。
断点续做——被闹钟打断后,能切换任务,再恢复原任务。这对应的是家庭中永远存在的"突发事件"。
省力策略——毛巾挂肩上,拖鞋拎挂绳。这看起来像"偷懒",实际是对效率的极致追求,意味着机器人可以在家长时间自主运行而不用频繁充电。
当我把这些能力列出来的时候,我意识到一件事:
一个具备以上所有能力的机器人,已经可以在我的家里,替我完成至少70%的日常家务了。
不是未来。是现在。
这就是为什么我说"机器人无痛进家做家务真的实现了"。
"无痛"这个词,是关键。过去我们讨论机器人进家,最大的障碍不是能力,而是信任。你不放心让一个笨拙的机器人靠近你的花瓶,你不放心它在你的孩子旁边走动,你不放心它把东西打翻之后不知道怎么办。
而这条视频里的机器人,展现出的空间感知精度(手臂穿过窗户不碰边框)、力度控制能力(擦玻璃恰到好处)、环境适应能力(狭小空间无碰撞)、错误恢复能力(从摔倒的边缘自救)——都在一步一步建立人类对它的信任。
当然,目前这个模型的团队还是未知的,这段视频的真实性也需要业内的进一步验证。但即便我们保守地打一个折扣,它展现出的能力也已经远超行业的普遍认知。
这就是"行业新时刻"的定义:它不是某个技术的完美成熟,而是所有人突然意识到,"原来还可以这样"。
在这条视频之前,具身智能的创业者和投资人讨论的问题是:"怎么让机器人做好一个简单的抓取任务?"
在这条视频之后,问题变成了:"怎么追上这个神秘团队?"
问题变了,时代就变了。
原因很简单:机器人离普通人的生活太远了。 语言模型有键盘,你打开网页就能用。但机器人需要你花钱买硬件,需要你给它一个物理空间,需要你容忍它在你面前试错。
如果机器人不够好,你永远不会让它进你的家门。
而今天这条视频展示的,是一个已经足够好到让人动心的程度。好到你会想:"如果这个东西现在就能买到,我会不会买?"
我的答案是:会。
即便它有时候会犯错,即便它可能不如视频里那么完美。但它展现出的能力下限,已经超过了大多数人对家务机器人的预期上限。
当"不错"变成了"太好了,我什么时候能用上",技术就过了临界点。
而这个临界点,就是商业化的起点。
所以,我在这里做一个预测,大家可以在评论区留个记录,三年后回来看:
未来12-18个月之内,我们会看到至少3-5个中国团队,发布能在家庭环境中自主执行多任务家务的机器人产品。
未来24-36个月,机器人走进普通家庭的速度,会像当年的智能手机一样,超出所有人的预期。
而今天量子位发布的这条视频,将被追认为这条曲线的起点。
当然,前提是这段视频经受住业内的检验。但从我的直觉来看,一个能拍出这种视频的团队,不需要造假。因为他们已经把技术做出来了,现在要做的,只是让世界看到。

结语:有些视频,你看了就知道,时代变了

这篇稿子我从早上写到了下午,中间停了三次,每次都是因为看视频的某个片段看出了神。
不是因为这条视频有多震撼人心——它不精致,不华丽,甚至有些无聊。
而是因为,它太像真的了。像一个普通的家庭,一个普通的下午,两个机器人在安静地做家务。一切都那么自然,自然到让人忘记了,这背后是一整套足以改写行业格局的底层技术。
最了不起的技术,是让人感觉不到技术的存在。
而这条一镜到底的长视频,做到了。
擦玻璃的手伸出窗外,闹钟响了停下来,把毛巾挂肩膀上,用脚踹箱子,两个机器人互相配合。
这些画面的背后,是空间感知、自主推理、跨本体建模、长时序规划、工具使用、群体智能……
每一个词,都是具身智能领域的圣杯。
但在这条视频里,它们以最朴素的方式呈现。就像学霸解题,一步步写下来,你觉得理所当然。但你自己去做,才发现每一步都难如登天。
这就是王者的从容。
最后,用一句话来结束今天这篇稿子:
以前我们讨论机器人什么时候能进家。今天之后,我们该讨论的是,谁家的机器人先进家。
而那个神秘团队,可能此刻正在看着这条视频的评论区,笑而不语。
你们到底是谁?出来聊聊吧

 
关键字:
下一篇
63亿美元的高估值光环下,小鹏机器人机遇与考验同在

63亿美元的高估值光环下,小鹏机器人机

热门品牌