当前位置: 主页 > 国内新闻 >

被撞得四分五裂,两年后不再“翻车”?
时间:2026-08-28 15:33来源: 未知 点击:

8月22日晚,第二届世界人形机器人运动会在国家速滑馆“冰丝带”开幕。赛场上演了不少机器人“翻车”的名场面。在400米(大型组)预赛中,有机器人选手未跑出第一个弯道便摔倒在地;有选手疑似没有听到发令枪声,站在起点迟迟未动;还有选手完成冲线后,撞上赛场设备,身体被撞得四分五裂。现场工作人员不得不赶忙抬担架,“救完你的救你的”。

最出圈的一幕来自24日下午的自由体操比拼。一台程序异常、脱离比赛轨迹的机器人,没有摔倒,反而在赛场中央缓慢旋转、小幅摆动,动作竟如芭蕾舞般优雅连贯。工程师排查后认为,这可能是运动控制算法的临时波动,在故障中自主微调姿态,意外演绎出一段“芭蕾舞”。这恰恰说明随机应变的重要性。未来,机器人要读懂场景,在各种压力与意外中作出最优选择,显然需要比预设程序更复杂的智慧。

具身智能的竞争,正从身体转向大脑。两个月前的第八届北京智源大会上,北京智源人工智能研究院(以下简称“智源研究院”)院长王仲远宣布,AI正经历从“预测下一个词元(Token)”到“预测下一个物理状态”的重大变革。业内共识是,无论硬件如何“内卷”,大脑的好用程度将成为未来几年的行业分水岭。真正能打通机器人感知、决策、执行能力闭环的通用大脑,仍是稀缺资产。

而这个所有机器人翘首以盼的大脑,业内喜欢叫它“世界模型”。

寻找基座

如果你端着咖啡杯,问AI“我把咖啡杯松开会怎样”,普通大语言模型会回答“它会掉在地上摔碎”,因为它从训练数据里看过这个答案。

而世界模型则会观察你松手时杯子距地面的高度,结合当地重力加速度,告诉你“杯子会在0.5秒后落地”,并根据杯子材质模拟碎裂程度。它不需要读过这句话,它自己会算。

这便是世界模型,一个主攻物理环境认知和预测的系统。图灵奖得主、Meta前首席AI科学家杨立昆(Yann LeCun)将世界模型定义为能预测行动后果的内部模拟器,是机器人对世界的认知引擎。除此之外,世界模型还有许多纷繁的定义,但共同点是,承认智能体需通过学习环境的物理规则,比如杯子下落会摔碎,来构建虚拟场景,从而无须实际行动就能预判不同决策的后果。

美国斯坦福大学教授、World Labs创始人李飞飞研究空间智能,称其为AI的下一个前沿。“……AI要理解、生成、推理并与三维空间交互,构建大型世界模型,正是实现空间智能最重要的路径。”而李飞飞的学生、复旦大学通用物理智能研究院院长苏昊则专注物理智能,希望AI在物理世界里能有效完成任务,执行恰当的行动。

文章配图-1

蚂蚁灵波科技的R1机器人展示厨艺。

快思慢想研究院院长田丰认为,物理智能、空间智能、世界模型,是同一件事的三个切面。他告诉《中国新闻周刊》,空间智能关心“房间的几何结构记不记得住”,物理智能关心“抓、推、拧这些动作做不做得成”,而世界模型是这两者背后的推演能力。

“比起世界模型的定义,我们更关心真实物理世界需要怎样的模型。”陈博远告诉《中国新闻周刊》。他今年22岁,任智源研究院行为世界模型创新中心负责人,也是北京逆矩阵科技有限公司(以下简称“逆矩阵”)联合创始人,该公司专注于下一代通用世界基座模型的开发。今年6月的北京智源大会上,逆矩阵联合智源研究院发布了全球首个通用世界基座模型“悟界·Physis-v0.1”。Physis正是逆矩阵的英文名,源自Physics的希腊语词根,有“世界本源”之意。

在陈博远看来,世界模型与大语言模型早期的演化路径多有相似。在2022年前后,金融、法律等领域的垂类模型受到广泛关注;如今,通用大语言模型出现了。而对于面向真实物理世界的世界模型,行业也在思考,能否构建一种跨场景、跨本体、跨用途的通用基座模型,应用于不同真实场景。

现在,轮到世界模型经历“奥德赛时期”了。VLA是非常重要的一个尝试。VLA即视觉—语言—动作(Visual-Language-Action),是具身智能实现感知、理解和交互的核心技术体系之一,2023年左右开始火热。它的目标是让机器人像人类一样看懂周围环境,听懂任务目标,并执行操作。国内首个布局世界模型的企业极佳视界,旗下的世界模型GigaWorld便是VLA路线。

VLA已能够实现视觉输入和动作输出,但还不够“通用”。本届世界机器人大会上,许多观众发现,在有大量训练数据的精确环境中,机器人已可以做好指定任务,但如果稍微改变场景设置,任务很可能就会报错。一些机器人可以快速分拣和取用货品,但如果视野中的观众太多,它就会原地不动,无法执行任务。

宇树科技董事长王兴兴在这一届世界机器人大会上表示,如果一台机器人被带到任意陌生环境,甚至进入家庭后,能完成80%左右的任务,具身智能就接近了真正的临界点。

有人把VLA看作和世界模型并驾齐驱的路线,也有人把VLA看作世界模型的一条分支。更有可能的是,VLA 与世界模型非简单的“上下级”关系,二者在实际系统中可以互补融合。目前,世界模型还缺乏一个足够泛化的基座,这也解释了为什么具身智能的通用大脑迟迟没有出现。

文章配图-1

5月22日,广东深圳市,自变量机器人工厂内,工程师训练人形机器人做家务。

“桌子有吸引力”

“‘六小龙’吵起来了!”

在今年7月的世界人工智能大会上,有一个世界模型“六小龙”圆桌论坛,凑齐了极佳视界、无界动力、自变量机器人等六家国内企业的世界模型负责人。这场谈话仿佛几大流派掌门的“华山论剑”,直指业内对世界模型技术路线最直接的争论。

极佳视界是像素空间派,希望将模型能力精进到对每一帧画面的学习和预测。无界动力则是隐空间派,这一派的“宗师”是杨立昆,其希望构建一个虚拟空间,让AI身处其中去预测未来状态。Meta在2025年6月发布的视频模型V-JEPA 2就是这一路线。

更多企业皈依了融合派,也就是吸取两方的技术特点,不完全放弃视频生成模型的训练体系,但又结合自身技术优势,推出各自领域的理解、预测模型。自变量机器人、智元机器人、蚂蚁灵波科技都是如此。

世界模型究竟该对物理世界有多大程度的理解?无界动力希望它尽可能接近物理模拟器,提出评价世界模型要看它对几何、运动、力等状态的预测精度。也有人认为,机器人没必要先成为物理学家。蚂蚁灵波科技方面表示,物理合理性比物理精度更重要。机器人只需要明白现实中,同样重量的铁比棉花落地速度快,但到底快多少,不需要知道,只需要观察。

模型能力评价的标准也存在诸多分歧。智元机器人首推AI推理的长时物理一致性,即模型还原物理世界的稳定性,而自变量机器人则认为长程推演是“伪需求”,推理的时效性更重要。如果推理慢到错过决策窗口,再完整的理解也没用。

可以说,如何实现世界模型,目前还未出现压倒性的技术方案。观点碰撞背后,企业们捍卫的是自家模型擅长的能力。世界模型想要走出“奥德赛时期”,自然需要技术上的收敛。

逆矩阵也在走隐空间这条路。陈博远指出,这条路需要独特的训练方法。世界模型可能很难照搬“堆数据”的路径。一个很重要的原因是,人们能获得的视频和真机反馈数据,存在大量视觉冗余。“如果我们希望模型学会用一支笔,笔是蓝色还是红色、放在黑板还是白板上,对于学习物理规律本身没有作用。如何去除冗余,重新采集甚至制造数据,是一大难点。”

更关键的是如何构建因果。目前的大模型都维持着“吃掉”数据、体会相关性、给出最符合相关性的预测的运作模式,而“预测下一个物理状态”并不会如此简单。陈博远指出,状态本身可以认为是基于触觉、视频、语言数据压缩出来的一个隐空间,但模型在这一空间里可能只会学习到一个数据分布,由这个分布归纳出的结论很有可能是错的。

例如,如果所有的视频里桌上都放满了物品,那么模型可能会认为“桌子有吸引力”。如果50%的视频里物品堆在桌上,另50%的视频里物品堆在地上,那模型会认为“这个世界的东西有50%的可能性被桌子吸住”。这些结论符合统计规律,但不符合物理现实。

陈博远的判断是,模型应该学习的是“Δ (delta)”。它是物理学中一个代表变化量的符号,可以认为是一个操作、一个扰动、一个变化。比如把桌上的水杯向边缘推一下,这个推力就成为一个关键的“Δ”,它促成了杯子状态的改变。模型需要预测的,不是简单的下一帧画面,而是什么样的“Δ”导致了这样一个确定的未来。

在今年6月的北京智源大会上,智源研究院发布了一套世界模型的分级体系。就像自动驾驶根据自动化程度分为L0—L5.世界模型也根据其距离真实世界的远近,被分为W0—W5.在这一体系里,W0级的世界模型多为视频生成模型或3D重建类模型,它最终的目标是生成流畅好看的视频(谷歌推出的Veo视频生成模型),或一个可以随时进入的3D空间(李飞飞World Labs旗下的Marble)。这些模型的优化目标是更高清晰度和稳定性。

W1代表的是动作交互模型,比如谷歌的Genie系列模型。它们基于视频生成模型,但开始希望模型能响应动作输入。这一模型中,用户可能没有那么在意物理正确性,这目前也是相对容易实现的。但对W0和W1模型来说,它们解决的是像素空间中的问题,距离真实世界还有距离。

W2及以上的世界模型解决的是物理正确性。在这一级别,模型开始理解真实的物理世界,可以预测真实的物理后果,目前,达到这一能力层级的世界模型还鲜有出现。

两年后,能力跃迁

即便是目前最前沿的世界模型,在严格测试下,也会暴露出短板。它们离真正的“世界模拟器”还有不小距离。

游戏中,我们能看到球凭空消失、运动轨迹错误等不符合物理规律的现象。这只是最安全的一种“翻车”,到现实世界就没那么美妙了。一项专门针对自动驾驶世界模型的测试发现,即使是目前最好的模型,如谷歌Veo 3.1.在预测物理风险如热油溅射、金属遇水反应时仍不可靠,会错过关键风险链条或误判严重程度,远未达到安全部署的要求。

王仲远曾表示,视频生成模型可能生成一群在天上飞的猪,但物理世界不会这样运行。如果机器人装上一个不能区分真实和虚幻的大脑,它可能误以为自己是钢铁侠,这会带来严重风险。

世界模型目前仍处于早期探索阶段,其面临的挑战也比大语言模型更为复杂。田丰认为,两类模型所需数据完全不同。大语言模型学的是人类已写下来的东西,是被人加工过一遍的二手经验。世界模型学的是摄像头、传感器、机械臂直接采到的一手记录。人类写下的高质量文字总量大致到头了,而视频和传感器数据每天新增的量要高出好几个数量级。

一个直观的对照是,V-JEPA 2只有12亿参数,不到主流大语言模型的百分之一,却用了超过100万小时的视频来训练。数据稀缺和昂贵是这条路最核心的瓶颈。同时,模型生成的误差会逐帧累积,导致场景漂移、物体遗忘、逻辑崩坏。当前最强的模型也只能维持几分钟的物理一致性,而业界普遍认为,连续、可靠地模拟一小时以上的物理过程,才是工业可用的门槛。

因此,世界模型需要真实硬件。“把模型用在真实的物理场景中,去收集应用这一模型得到的反馈,比如什么时候失败,什么时候成功,什么时候需要人类重点干预,这些数据是非常珍贵的。”陈博远说,就像学习骑自行车,人会在不断尝试中感受速度和风阻,保持平衡,或者摔倒。真实世界的反馈数据是模型学会归因的基础。

当下,行业多用下游任务来间接评估世界模型对物理世界的理解程度。但模型预测得准或不准,都不能直接等同于它真的理解了物理,更不能说明它学到的规律能迁移到新的场景。陈博远指出,世界模型现在仍需两套相互衔接的系统。第一套是模型生产基础设施,包括算法、数据、训练系统等,第二套则是物理基础设施,即把模型接入真实世界。前者解决“怎样造出可扩展的世界模型”,后者解决“怎样让模型在真实世界中持续学习”。

不过,陈博远认为,无论是硬件还是软件,世界模型技术都在稳步收敛的路上。他预测,明年年底之前,数据采集方式和具身智能形态可能会收敛,18—24 个月内,世界基座模型能力会出现标志性的阶跃,36个月内,能实现多个真实场景的应用落地。这与大语言模型从GPT-3到ChatGPT的路径高度吻合。

田丰指出,自动驾驶里,世界模型已得到了正反馈。特斯拉在去年10月的国际计算机视觉大会上介绍过其神经世界模拟器,用车队回传的数据训练出一个仿真驾驶环境,并称同一套系统可迁移到人形机器人。“车在路上跑的每一公里都在自动产生反馈数据,这是其他方向短期内不具备的条件。”

相比智驾这一短期最可能落地的场景,其他世界模型产品,比如Marble,田丰认为其进入市场还为时尚早。当在虚拟世界里训练的机器人,直接搬到真实世界后的成功率,超过用同样成本采集真实数据训练出来的成功率时,拐点就到了。从那一刻起,造数据比采数据划算,这也许是世界模型带给人们的最大颠覆。

在更多从业者眼中,世界模型给了人类一个重新理解物理世界的方式。世界模型的应用也绝不限于具身智能这一个载体。在陈博远看来,它的等号右边,是整个真实物理世界,包括智能制造、工业仿真、科学探索等。未来,世界模型也许能弥补和接管人类无法实操的工作,甚至自主发现未知物理规律、提出假设并进行验证。正如归乡的奥德修斯,它能激起的火花,远超当下的所有想象。

责任编辑:admin
织梦二维码生成器
顶一下
(0)
0%
踩一下
(0)
0%
免责声明:中国民生播报网本栏目发布信息,目的在于传播更多信息,丰富网络文化,稿件仅代表作者个人观点,与中国民生播报网无关。其原创性以及中文陈述文字和文字内容未经本网证实,对本文以及其中全部或者部分内容、文字的真实性、完整性、及时性本网不做任何保证或者承诺,请读者仅作参考,并请自行核实相关内容。凡注明为其他媒体来源的信息,均为转载自其他媒体,转载并不代表本网赞同其观点,也不代表本网对其真实性负责。您若对该稿件由任何怀疑或质疑,请即中国民生播报网联系,本网将迅速给您回应并做处理。
发表评论|
验证码: 点击我更换图片
最新评论 进入详细评论页>>
财经新闻网 金融 中国财经网 美国 中国 财经资讯 中国财经报道 2018 人寿 保险 增长 趋势 财险 债券 公司 全球 财经 地方 专家 三板 净利 发行 原油 黄金 发展 上市 基金 发布 营收

热点图片

Copyright © 2002-2026 Chinamsbb. 中国民生播报网 版权所有
京ICP备:
11111111号-1
京公网安备
1101111111111号