【环球网科技报道 记者 林梦雪】“世界模型能够让机器人、具身智能真正干活,帮助解决80亿人的劳动力问题。”在2026世界机器人大会期间,奥比中光创始人、董事长兼CEO黄源浩说道。
他直言,具身智能市场往往比数字市场大5到10倍,这意味着世界模型一旦成熟,其商业价值和社会价值将远超当前的大语言模型应用。
更令黄源浩振奋的是行业技术路线的演进。他观察到,具身智能正从VLA(视觉-语言-动作模型)到VTLA,再到世界模型的生成范式逐步转向。“甚至我们预测,世界模型跟具身智能的‘ChatGPT时刻’最快可能会在两三年内到来。”黄源浩说。
数据是当前世界模型的养料与瓶颈
作为3D视觉感知技术企业,奥比中光在世界模型产业链中扮演着关键角色,即为模型训练提供高质量的真实数据。
“我们是做世界模型的多模态数据,也联合触觉数据公司,把数据做成毫秒级同步的级别,给世界模型训练提供很好的养料。”黄源浩介绍道。
然而,数据恰恰是当前世界模型发展面临的最大瓶颈之一。大晓机器人董事长王晓刚也坦言:“具身数据,尤其是真人操作的数据,历史上积累是零。”
黄源浩对此深有感触。他指出,当前数据领域存在两大突出问题:“一是数据质量参差不齐,二是数据标准不统一。”
“机器人要跟人学习,现在有两个方向:一个是移动的,已经做得挺好;另一个是操作,比如拧螺丝、钉钉子这些灵巧操作,数据非常少。”黄源浩说。
更棘手的是多模态数据的同步问题。“我眼睛采到数据是这个时刻,手套数据差15毫秒就不对了,还有力的精度。”黄源浩举例说明,视觉数据与触觉数据之间的微小时间差,就可能导致训练效果的显著下降。
黄源浩认为,当下行业最大痛点,是数据没有形成统一标准。不同厂商硬件采集的数据,视场角、帧率、精度各不相同,触觉、视觉之间时间同步精度参差不齐,甚至出现丢帧问题。最终导致A机器人采集的数据,无法迁移给B机器人使用。
“数据飞轮的转动是最重要的。”黄源浩强调,只有建立起统一标准,不同机器人、不同数据采集员获取的数据才能实现跨本体复用、跨模型复用,数据成本才能真正降下来。
机器人何时能真正实现落地价值?
对于世界模型落地服务人类的完整路径,黄源浩有着清醒的认知。 “一方面模型需要不断进化,另一方面数据是特别重要的。”他同时指出,世界模型的发展需要两条腿走路:“一方面是从物理学的规则和理论上出发;另一方面,很多智能是喂数据涌现出来的。”
他以人类的成长作类比:“像GPT这种往往是互联网有大量数据喂出来的。包括人,其实我们刚出生的时候也没学过什么牛顿定律,人会智能、会做各种事情,也需要通过数据积累、模仿和学习。两方面都要走。”
但黄源浩也提醒到,仅有模型和数据还不够。“如果世界模型好了,真正机器人能为人类干脏活、苦活、累活,还得靠本体——传感器、灵巧手及机器人本体等环节,各方面都得好。”
他总结道:“从模型到数据到本体的执行,都要不断进步。现在也已经有一些可以落地了,先从最需要的方向、人类不愿意干的活先落地,后面泛化性好了、智能高了,再往更多的场景去渗透。”
那么,机器人何时能真正实现落地价值?黄源浩认为,机器人“ChatGPT时刻”大约是两三年时间。
“我们干企业13年多,从去年下半年开始,第一次被客户追着要货。”黄源浩说道,“自去年下半年开始,上游需求爆发,客户实际提货量普遍超出原订单计划两到三倍,客户甚至愿意提前试用工程样机,市场需求远超行业预期。”因此,黄源浩总结称,具身智能的“ChatGPT时刻”行业内的乐观者认为需要两三年,保守者则认为还需要三五年。
同时,在8月20日上午的2026世界机器人大会主论坛上,宇树科技创始人王兴兴在演讲中给出的个人判断是:具身智能达到类似“ChatGPT时刻”的产业临界点,快则可能还需2至3年,慢则可能需要5年甚至10年。