
“有些时候,大家会对模型能力本身和模型展现出来的能力混淆。比如推理效率是一种模型能力,可交互性是一种模型能力。但展现出来,大家会更关注画质、物理准确性等”。
公司情报专家《财经涂鸦》获悉,7月19日,“世界模型‘六小龙’颠峰论坛”于WAIC2026期间举行。
该论坛由世界人工智能大会组委会举办、大晓机器人承办,以驱动物理AI从理解到执行为主题,是大会唯一聚焦世界模型与具身智能深度融合的核心论坛,旨在定义并开启物理AI的开悟时刻。
现场,蚂蚁灵波首席科学家沈宇军参加论坛圆桌讨论,就AI要进入物理世界的短板、世界模型的评测标尺、路线收敛、落地鸿沟等进行讨论。
在解释“两年后回望现在对对与错”时,沈宇军表示,如果届时回看,目前所有为模型架构本身积累的能力,应该都是对的。但对于“过度追求模型呈现出来的能力”,他认为“不好说”。
简言之,“所有为模型准备数据的过程中积累下来的数据链路,应该都是对的,但数据本身是否还会继续被用并被迭代,不好说。”
伴随AI进入物理世界正成为基础范式,针对其中“最缺失”的部分,沈宇军认为,模型本质是输入、架构到输出。模型能力由输出决定,比如奖励函数或监督函数,因为输出决定了架构设计。但其中要补齐的关键一块是数据标准。
“目前数据标准依据没有定好,比如世界模型需要哪些模态,这些模态如何对齐等等。在数据定不出标准前,行业可能就无法规模扩展。”
现场,沈宇军给出评测一个好的世界模型三个最关键的指标。
“第一个指标是它是否真正理解世界。世界模型不是给当前状态预测下一个状态,而是以当前状态加动作预测未来状态,且动作是反事实的。这是评估模型是否理解世界的核心。”
第二个指标是与人类比,模型的记忆能力。“人的大脑有恒常性表示,比如转头看东西,不看了有人移动或推倒它,你还知道是同一个。这种恒常性表示能力会考验世界模型,因为它关乎能否提取世界公共表示并形成记忆。表面上看似是评估记忆,实际上是在评估恒常表示能力”。
第三个指标是推理能力。沈宇军认为,长程预测对具身世界模型而言是伪需求,因此没有必要追求这个指标,“我们需要它快速推理,得到反馈后立即回来。所以推理时效性更重要。”
在落地层面,很多经验的演示Demo都是百里挑一,或者更加复杂,但工厂不看剪辑,而看相关损失。谈及“从Demo到Deployment踩过最深的坑”,沈宇军表示,所有技术一旦走到商业化,算的一定是经济账,所以成本一定是最核心的。
“除了成本之外,我觉得落地上比较难处理的就是随机性或突发情况。现在展台上所有能展示的Demo,都是工作人员复位的,但如果观众想互动,可能会有些奇异的想法,但这些在数据采集时根本没有考虑过。比如,有人可能会要求把一个东西放到很远的地方,然后问你还能不能拿到。”
“另外更有体感的一个例子是,在超市,如果你想让机器人帮忙找一种菜,但是那个菜可能会其他顾客拿到牛奶柜或者其他地方了,这时候他能不能处理?即便是人,面对这种情况可能也很难办。但这种看起来很突发的情况,就是我们生活中的日常。机器人究竟能否处理这种状况,现在还很不确定。”
面向“路线收敛”这一问题,沈宇军坦言,表征统一、物理因果、动作接口还是评测标准中,评测标准将是下一个阶段的收敛点。
“我相信下一个阶段行业会有共识的,一定是触觉。至少从输入的角度讲,很难证明数字世界的模型在物理世界就是不work。因此触觉一旦有了突破,我们将会明显感受到物理世界的世界模型跟所谓的视频生成就完全是两件事情,他们从模态上就会被区分开。”
他坦言,目前行业在触觉方向的进展非常快,下一步应该会率先形成共识,即触觉将是机器人不可或缺的模态。
更新时间:2026-07-24
本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828
© CopyRight All Rights Reserved.
Powered By 71396.com 闽ICP备11008920号
闽公网安备35020302034903号