李飞飞刚发Atlas,中国开源“同款”已抢跑半年?
创始人
2026-09-03 20:22:12

henry 发自 凹非寺

量子位 | 公众号 QbitAI

20多年前,计算神经学家杰夫·霍金斯写道:“智能不只是模式识别,更是对世界的建模。”如今,世界模型正在批量迎来自己的里程碑时刻。

9月2日,由AI教母李飞飞创办的World Labs发布全球首个多模态世界模型(omni world model)——Atlas

Atlas最核心的能力,是把文字、图像、视频和3D信息放进统一的空间上下文,让模型不只是生成一张看起来合理的二维画面,还能在三维空间中理解并维持场景结构。

只需一张或几张图片,它就能重建三维场景、生成新的观察视角,并让相机沿指定轨迹在其中移动,同时保持空间结构的一致性。

鉴于震撼的视觉冲击与生成画面的一致性,Atlas一经发布便好评如潮。

不少网友将其视为空间智能的一次重要突破,就连李飞飞本人也将这一时刻称为“里程碑”。

有意思的是,早在今年3月,国内空间智能团队影溯开源的世界模型InSpatio-World也具备着类似能力。据影溯透露,该模型的升级版本也即将发布,并一如既往地开源。

只消输入一段普通视频,InSpatio-World会尝试从这些有限的时空观测中,构建一个可以继续探索的动态4D场景。

和Atlas类似,它也允许用户改变原始相机轨迹,绕到此前没有拍摄过的位置观察场景;

不过,与之不同的是,在InSpatio-World这里,时间本身也成为了模型需要显式处理的维度。

用户可以在已有事件范围内改变观察时刻,并从新的视角重新观察同一段动态过程。

换句话说,Atlas和InSpatio-World虽然技术路径和能力侧重不尽相同,但都指向了同一种变化:

世界模型正在从“生成一段看起来合理的视频”,走向“围绕一个持续存在的空间或时空状态,生成不同位置、不同视角下的观测结果”。

前者从图像出发,把相机位置变成访问空间世界的坐标;后者从视频出发,进一步把时间也纳入对动态世界的建模与探索之中。

如果非要打个比方,Atlas更像搭建了一座可以随意选择机位的AI虚拟片场,把世界造得更完整;InSpatio-World则想把一段现实录像,高效地变成一个可驱动的世界,能批量给物理AI当陪练。

而这两条世界模型技术路线在当下的相汇,也让我们把目光放到了这家此前颇为低调的国内空间智能公司,影溯身上。

登顶世界模型权威榜单

要说影溯最近最出圈的事件,当属登顶世界模型权威榜单WorldArena 2.0。

截至8月27日,在WorldArena 2.0首版阶段性公开榜单中,影溯的世界模型InSpatio-Curious以66.11分位列77个参评模型第一。

除了Track 1总分第一,它还在Physics Adherence、Trajectory Accuracy、JEPA Similarity和Depth Accuracy四项指标及维度上排名第一。

具体来看,InSpatio-Curious在Trajectory Accuracy上拿到64.89分,领先第二名3.02分;Depth Accuracy则达到99.29分。

这两项指标说明,相较榜单中的其他模型,InSpatio-Curious在生成过程中能够更准确地保持物体运动轨迹与三维空间关系。

在衡量时空表征一致性的JEPA Similarity 上,它的得分达到98.36分,意味着模型生成结果在时空特征层面与真实世界高度接近;综合考察交互质量与轨迹准确性的Physics Adherence指标,则以73.24分位居榜首。

值得注意的是,InSpatio-Curious的Image Quality只有60.64分,比综合排名第二的模型低了近9分,最后却依然拿下总分第一。

这说明,这个榜一不是靠把画面磨得更漂亮刷出来的,而是被轨迹、深度、时空表征和交互一致性这些更底层的能力直接抬了上去。

不过,要理解影溯这次成绩的含金量,还得先看看WorldArena究竟在测什么。

作为清华、上交、港大等高校联合发起的具身世界模型权威评测,WorldArena是目前衡量具身世界模型真实可用性的代表性评测之一。

迄今为止,WorldArena已经迭代至2.0版本。简单来说,相比只关注视频生成效果的传统测试,WorldArena 2.0更像是一个专门为具身世界模型准备的“机器人考场”。

它不只看画面清不清晰,还会检查机械臂的运动轨迹是否准确、场景中的深度与空间关系是否稳定,以及物体受到作用之后,是否能够按照合理的物理逻辑继续运动。

毕竟,对于具身智能来说,视频生成得再清晰,如果运动轨迹不准、空间关系错乱,甚至连基本物理规律都无法遵守,那么这样的世界模型也很难真正用于机器人的训练与决策。

因此,影溯能够在这样一张更强调真实可用性的榜单上登顶,实力可见一斑。

不过,虽然WorldArena 2.0已经比上一版本前进了一大步,但现有评测仍主要围绕标准化仿真环境和机器人操作任务展开。

相比真实世界,它对场景、物体、动态过程和交互方式的覆盖依然有限,更不用说工厂、家庭、城市和户外环境中层出不穷的长尾情况。

与此同时,InSpatio-Curious所在的Track 1,总分仍主要来自15项生成与视觉代理指标。它可以判断一次碰撞在视觉和运动上“看起来合不合理”,却不会直接测量真实世界中的力、摩擦、质量和惯性。

说白了,模型在一套固定题库里拿到高分,并不代表换一个场景、换一种机器人,或者碰上从未见过的物体时,还能继续稳定答题。

客观来讲,这并不影响WorldArena 2.0在现阶段作为评测工具的诊断价值,但这也同时意味着,它目前证明的更多是模型在特定任务和数据分布下的能力,还不是通用空间智能的“毕业证”。

也正是在这样的背景下,影溯把目光投向了更上游。

空间智能,也需要自己的“ImageNet时刻”

8月29日,在武汉举行的第二届中国空间智能大会上,影溯联合20余家高校团队和行业机构,共同启动了大规模空间智能3D数据开放计划SIDO

SIDO想做的事情并不复杂,就是把生产数据的人、训练模型的人,以及真正使用这些数据的人拉到一张桌子上。

目前,参与方已经覆盖高校、激光雷达、机器人、3D生成、数字空间以及产业应用等多个环节。

有人负责把真实世界转化为空间数据,有人负责训练模型,也有人负责把模型放进真实任务中检验,最终打通从数据生产、模型训练到应用反馈的完整链路。

而这背后真正要解决的,是空间智能长期以来缺少统一、大规模、高质量数据底座的问题。

未来两年,SIDO计划逐步建设百万级3D/4D场景数据底座,并同步推进评测基准(Benchmark)建设,围绕3D重建与生成、场景理解、空间推理、动态预测和具身规划等任务,建立更统一的任务定义与评价标准。

模型负责学习世界,数据负责提供足够丰富的世界,Benchmark则负责判断它究竟学会了多少。

可以说,当模型开始触及现有数据和评测体系的边界,下一阶段的竞争就不再只是怎样把算法做得更好,还包括怎样把数据、任务和评价标准一起向前推进。

相关内容

热门资讯

m... 本文目录导航: mes软件公司排名前十 mes软件系统厂商排名 ...
有... 本文目录导航: erp系统 有哪些 erp消费治理系统流程 ...
为... 本文目录导航: 什么是ERP系统?为什么越来越多的企业选用经常使用它? e...
e... 本文目录导航: erp蕴含哪些内容有哪些内容 erp有哪些系统 ...
一... 本文目录导航: 一套ERP治理系统大略须要多少钱 一套erp治理系统大略须...