十万小时数据开源机器人离“看懂”世界还有多远?
创始人
2026-08-22 13:52:40

中国发展改革报社记者 张守营

8月20日,北京亦创国际会展中心,2026世界机器人大会(WRC)第二天。光轮智能——这家2023年成立、仅31个人、估值却已突破150亿元的公司,在这里宣布开源10万小时全模态人类行为数据集。

同日,宇树科技创始人王兴兴在WRC论坛上表示:“纯语言大模型的输入输出完全在数字向量空间内运行,几乎不存在损失与偏差;而机器人的每一次物理输入输出都会产生偏差与信息损失——这是物理智能和数字智能的本质区别。”

普通人类视频数据,充其量是“看别人做事”——只有画面。机器人看了一百遍人拿杯子,知道杯子长什么样、手怎么伸过去,但不知道抓握时手指用多大力、手腕旋转多少度、碰到杯壁时阻力怎么变化。

光轮智能这次开源的10万小时数据集,在第一视角视频之外,还塞进了腕部近场视角、三维手部姿态、三维全身姿态、深度信息、帧级动作语义标注(V7级)、视觉惯性里程计等一系列“课本”。用联合创始人兼总裁杨海波的话说,普通视频只能告诉机器人“发生了什么”,全模态数据能告诉它“下一步应该怎么行动”。

10万小时是什么概念?截至今年初,全球高质量真实物理交互数据总量大约50万小时。光轮智能这一开源,等于把全球存量的1/5直接摆上了台面。

但这不是终点。行业共识是,训练通用具身模型至少需要千万小时级数据。10万小时,是一声发令枪,不是终点线。

一家估值150亿元的数据公司,把最核心的资产免费放出来,图什么?

杨海波在世界人工智能大会期间说过一句很直白的话:“目前数据领域缺乏统一标准,所以什么标准最有价值,可能就是事实标准。当大家都去买同一份数据,认同它,它就逐渐成为事实标准。”

热闹归热闹,有几件事需要想清楚。

10万小时不等于千万小时。VLABench最新评测显示,当前所有主流VLA模型在标准测试集上的进展得分均低于15%——核心原因不是架构问题,而是训练数据覆盖范围太窄。

开源数据和商业级数据之间有“质量鸿沟”。学术界用的开源数据集和企业训练量产模型用的商业级数据,在标注精度、场景覆盖、失败案例多样性上差距明显。

仿真不是万能药。物理建模有极限,视觉与力觉的一致性、长期任务中的误差累积、柔性物体的精确模拟,都是“硬骨头”。光轮智能自己也承认,更底层的仿真器和求解器仍是国内亟待攻关的领域。

“数据驱动”不是唯一路线。具身智能的技术路线远没有收敛:端到端VLA、世界模型、传统规划+学习混合路线各有支持者。把所有赌注压在“数据规模决定一切”上,可能为时尚早。

2027年能否算平经济账,仍有不确定性。杨海波判断今年是“跑通”阶段,明年或有望在部分场景算平经济账。但机器人硬件成本下降速度、场景泛化能力、部署运维成本,这些变量都还在快速变化中。

2009年,李飞飞团队发布Im-ageNet,1400万张标注图片,直接引爆了深度学习革命。那个时刻之所以被称为“ImageNet时刻”——不是因为数据集本身有多了不起,而是因为它第一次让全世界的研究者在同一个基准上竞争,数据、算法、评估标准全部公开透明。

具身智能还没有等到自己的ImageNet时刻。

光轮智能的10万小时全模态开源数据集,可能是朝那个方向迈出的一步。但它能不能成为机器人领域的ImageNet,不取决于任何一家公司,而取决于有多少人用它、多少模型基于它训练、多少论文引用它、多少企业在它之上建立商业生态。

杨海波说,2026年是具身智能数据规模化的元年。王兴兴说,未来10年在AI大爆发下,整个产业的进化速度将大幅提升,“可能比我们预想的更快”。

机器人的聪明程度,最终不取决于它在展台上能翻几个跟头,而取决于它“读过多少书”。而这本书,正在被一页一页地写出来。

相关内容

热门资讯

毛泽东经典语录+后评 中国人民... 有一回哥老会抢了我家,我说,抢得好,人家没有嘛——太潇洒了吧。 国民经济的两个拳头,一个屁股。基础工...
空间改版经典搞笑语录 摇啊摇,... 1、鲜花往往不属于赏花的人,而属于牛粪。 2、事实证明,感情经得起风雨,却经不起平淡;友情经得起平...
搞怪非主流经典语录 傻瓜年年有... 1.什么是数学?你们不会的就是数学。 2.我跟你们讲,你们以后要是考不上大学,就去做牙托好了。你们...
小时代经典台词语录 小时代经...   “爸,如果你不是要去参加一个夏威夷草群聚会的话,请把现在你脖子上那条春花烂漫的领带换掉,好么?”...
超级经典搞笑语录 就唠会嗑,....   见利就收薄利多销  记得是08年的正月我从吉林坐飞机来到哈尔滨。  热带里的猴子,狒狒了  你这...