2026世界机器人大会论坛于8月19日-22日在北京举办,大晓机器人董事长、商汤科技联合创始人王晓刚表示,面向具身智能的世界模型,应当具备三项核心能力:
第一项是生成智能。世界模型最基础的能力,就是推演、预测未来世界可能发生的状态,可以是视频画面的生成,也可以是对未来隐变量的预测。仅仅生成画面美观、像素效果出色的视频,并不足以支撑机器人和真实物理环境完成交互。
第二项就是物理智能,也是目前最亟待补齐的短板。其中涵盖空间感知能力、物体本身的物理属性、运动规律、空间记忆等内容。
第三项是认知智能。现阶段具身机器人大多只能完成桌面级别的简单操作。未来要走进家庭、落地复杂场景,需要拆解长链条多步骤任务,实时判断动作执行是否到位,这就要依靠认知层面的能力。
他指出,视频生成、大语言模型、多模态大模型已经在生成智能、认知智能方向积累了不少技术基础,而物理智能是当前最大的瓶颈。
“想要训练出合格的物理智能,除视频素材之外,还需要相机位姿、几何信息、物体物理属性、多视角观测等多维度数据共同支撑。”他说。