具身江湖志(四):它们,把机器人的大脑做实
创始人
2026-08-29 13:44:27

(来源:藏狐 脑极体)

越来越多的人,开始对机器人祛魅了。

过去两年来,在舞台上完成一套完整的表演,被认为是机器人技术的大进展。如今人们已经不会再轻易地被这些漂亮的机械动作打动,反而开始普遍追问:这些机器人到底能有什么用,动作是不是编好的,究竟能帮我做什么?恰恰说明具身智能行业正在进入一个关键的转换期。

成功跨越周期的企业,必须具备一个杀手锏:大脑。

在许多炫酷的赛场,我们都可以看到机器人是由人类工程师去遥控的,动作也是预设的。在预设框架内,再由AI策略自主执行,这已经是行业里比较先进的形态。

但是,在人类的指令下完成预设的动作,这并不意味着机器人能够理解环境,也不意味着它能够在陌生的环境当中自主地完成任务。这样的机器人,当然只能在特定场景,比如说工厂、园区、公园等,执行一些有限的任务。

可能有人会问,现在的工业机器人,已经能够稳定地在汽车工厂、电子工厂中承担一些焊接、搬运、装配等工作。这种场景下,根本就不需要大脑呀。

但只是那样的话,具身智能就跟传统的机器人产业或自动化没什么太大区别了。

具身智能这个概念之所以成立,就是机器人到了一个陌生的环境下,能够自主决策、自主识别、自主行动,把过去的经验迁移到新的任务,还需要能够从失败中学习,成为真正的通用机器人。换句话说,没有大脑,具身智能这个概念都会被直接证伪。

由此可见,具身智能行业从比拼身体展演,转向比拼谁的大脑更强。甚至可以说,有没有大脑,将是具身智能公司的斩杀线。

那么,谁正在这条“大脑派”的路上狂奔呢?

或许你看了今年的机器人运动会、机器人马拉松,觉得现在的机器人进化得太厉害了,能组成队列,跑得飞快,还能拳打老师傅。机器人是不是快把人类取代了?那可以放心了。其实,人形机器人的智力,还停留在不如一只边牧的水平。

在2025年的机器人世界大会上,一位具身智能公司的创始人就说过,目前机器人的底层模型普遍采用VLA模型,就是相对傻瓜式的架构。卡内基梅隆大学教授、Skild AI联合创始人Deepak Pathak也认为,机器人对物理世界缺乏真实理解。

由此可见,很多机器人看起来惊艳,但实际上只能照本宣科,人类指哪打哪。这恰恰说明了大脑是具身智能最有价值的部分,如果这一环做不出来,这一波人形机器人就只能是泡沫。那让机器人长出脑子这件事情,为什么难做呢?

一是数据。具身数据必须靠机器人与物理世界交互产生。谷歌曾组织16人团队,花了17个月,投入上千万美元,只采集了23万条真机轨迹。

二是封闭。如此珍贵且稀缺的数据,各家公司好不容易积累起来,肯定不愿意共享,所以各家企业数据封闭成为具身智能的关键瓶颈。

三是仿真。既然真实的数据如此稀缺,那么有些企业就选择了仿真,但是在仿真虚拟世界里面训练出来的机器人模型,到了真实的世界里就会遭遇sim-to-real的鸿沟。于是出现了世界模型这个方向,希望能够解决仿真问题。但是,世界模型只是构想,目前还没有明确的、可实现的工程突破。

让机器人真正长出脑子,行业内各有秘技。

既然数据是机器人智力的瓶颈,那么谁家的数据多,就像拥有了一个巨大的藏经阁,可以让自家的产品在里面自我修炼。所以,修一座数据的藏经阁,就是企业打造大脑的基础设施。

2025年1月,智元第1000台通用具身机器人量产下线。这些机器人既是产品,也是数据采集器,逐步形成了一个大力出奇迹的专有数据集AgiBot World,其中包含超过100万条真机轨迹、217个任务、5大部署场景,比此前任何公开数据集都大一个数量级。有数据显示,在这套数据集上预训练的策略,平均表现比在谷歌牵头的跨本体数据集OXE上,要高出30%。

真机数据的采集护城河很深,但是代价也比较大,数据得一条一条地采,每一次场景迁移都得重新采集,数据的扩张曲线是线性的,无法指数级增长。

这一重资产,智元正在一步步地积累。同时,也有人另辟蹊径去解决数据规模不足的问题。银河通用,就决定把合成数据,搬进机器人的藏经阁。

合成数据真的能达到真机数据的效果吗?2023年,银河通用团队的DexGraspNet,就是完全在仿真中构建的大规模灵巧手抓取数据集。发展到2025年,他们又更进一步构建了具有十亿级仿真抓取数据的SynGrasp-1B,GraspVLA就基于这一数据集训练,抓取成功率98.3%,实现了零样本泛化。

可以发现,合成数据这条路,银河通用走了很多年。之所以如此坚持,是他们发现,具身智能所依靠的数据,99%可以借助高质量合成数据完成,只有在合成数据无法处理时,才需要采集使用那1%的真实数据。

举个例子,在零售场景中,让机器人按顺序抓取货架上的矿泉水,先通过百亿级别的合成仿真数据完成预训练,然后只需一个人一天的真机数据,即可完成微调,合成数据的边际成本趋近于零,这种成本结构对中小型具身智能企业非常有吸引力。

总之,真机数据就像是历年的高考真题,让机器人经历真实的考试;合成数据就像是名师出的《三年模拟》,可以让机器人大规模刷题。显然,高质量的模拟题也不是谁都能出的。

合成数据需要很好的图形学、物理仿真、物理渲染和自动动作合成管线,并不断校准仿真与现实之间的差距,这些都需要长期的积累。

无论是现实世界的真题,还是仿真世界的模拟题,都是机器人大脑不断进化的藏经阁。唯有在大量任务、交互、失败和反馈中,机器人才能走向真正的智能化。

在全球具身智能赛道上,Physical Intelligence是大脑派的极端样本,不造机器人的本体,只专注于模型本身。PI提出了一个发现,或许不需要依靠很多的数据,通过架构层面的设计,再结合在线强化学习迭代,一样可以让机器人连续工作几个小时。

这就像是降龙十八掌,通过一套动作的衔接与设计,叠加起来,发挥出比实际内力更强大的作用。所以,如果架构设计好了,大脑需要的数据比想象中少得多。

但是设计一个好的架构并不容易。以星海图为例,研究团队来自Waymo、Momenta 等自动驾驶厂商,在AI算法架构设计上独善战场。2025年开源了G0,采用双系统VLA设计,其中System 1用扩散模型学细粒度动作执行,System 2是VLM,负责高层多模态规划,这一系统曾一度是行业的主流。

然而到了2026年,星海图G0.5的架构发生了一个巨大的转变,放弃了双系统的分离式设计,选择将具身推理和控制统一到单个自回归序列中,单个模型在统一token流中完成推理、规划和行动。

这样做的好处是让语言模型直接说出动作,推理与行动一口气完成,这样机器人的动作表现就能完整继承大语言模型的scaling law,有望进一步增强机器人的物理智能。

当然,除了星海图的这条路线之外,行业内也有其他方向的探索。比如智元提出的ViLLA架构,则通过引入“隐式动作标记”(latent action tokens)这个中间表示,让VLM的语义知识能流进动作生成,模型先在语义空间理解了要做什么,再在潜空间翻译成怎么做,最后落到具体关节控制。人类视频、不同机器人的异构数据,全都可以喂给中间层学习。

这个方法的效果也比较好,首个基于ViLLA架构的通用具身基座大模型GO-1,在“倒水”“补货”等需要指令理解与位置泛化的任务上,成功率明显优于RDT和π0模型。

当然,目前机器人大脑的架构路线,还远没有定型。不过,至少共识已经明确了,相同的数据、相似的基础模型,在不同的架构下,完全可能产生不同的实际效果。

你有你的降龙十八掌,我有我的大力金刚手,看谁能让机器人大脑学到更多的东西。

有没有一种功法,能快速平息江湖纷争?世界模型这个方向的出现,被寄予厚望,来解决算法与现实的鸿沟,从而提升机器人的泛化能力。但这一路线,可以看作是具身智能领域的昆仑之巅,想要求得秘籍,是一条略显遥远的路。

星动纪元,决定踏上这段旅程。

这不让人奇怪,其创始人陈建宇,清华本科,师从加州大学伯克利分校控制论泰斗Masayoshi Tomizuka(模型预测控制奠基人)。星动纪元也是清华大学唯一持股的人形机器人创业公司。仰望星空,符合学院派的气质。

具体来说,星动纪元的设想是,想让世界模型成为VLA的原生部件。一方面,世界模型让模型在行动之前先预测,我这么做会发生什么,先试错再出手,就能大大提高任务的成功率。另一方面,世界模型可以使用海量互联网视频,就像马斯克让FSD看老司机的驾驶视频一样,既降低了真机采集的数据成本,又让模型学会真实的物理常识。

从2024年一个7B参数的世界模型,一步步探索,2025年自研端到端VLA具身大模型ERA-42,已经是一个原生融合世界模型的端到端VLA,模型会在脑内先想象未来的画面,再从想象反推出该做什么动作。来到2026年,星动纪元参与的VLAW,让世界模型与VLA策略协同迭代优化,专治世界模型看起来对但物理不对的老毛病。

让大脑学会做梦,在梦里训练自己,这条路处在最前沿,也有着现实的工程难题。但机器人的昆仑之巅,总要有人去攀。

当下,大家觉得具身智能产业,尤其是人形机器人赛道存在一些泡沫。如果要给现在的人形机器人产业寻找一个最核心的泡沫观察指标,我认为是:有没有大脑。

这个问题进一步细化是一家企业有没有自己的基础模型?有没有持续产生真实世界数据的能力?有没有把数据转化为模型能力的能力?有没有把模型能力转化成通用技能的能力?

只有这个闭环建立起来,机器人的泛化能力增强,才能告别展演和demo阶段,走进更大的场景去证明自己的价值。

宇树科技创始人王兴兴最近谈到机器人产业时,也给出了一个爆发临界点:把一台机器人放进一个陌生的家庭环境,只通过语音、语言指令,它就能够自主完成大约80%的日常任务。

而做到这件事情,核心就在于一个真正强大的大脑。机器人的内功,仍然有待修炼。

相关内容

热门资讯

聚焦2026数博会|8所贵州高... 8月29日,2026中国国际大数据产业博览会“AI赋能开源创新与数智融合”交流活动在贵阳举行。活动现...
跟着赛事游冰城!一键解锁“哈马... (来源:哈尔滨新闻眼)9月13日2026哈尔滨银行哈尔滨马拉松即将鸣枪开跑! 参加哈马的运动员凭本人...
首届粤港澳大湾区咖啡产业博览会... 来源:惠州发布8月28日,粤港澳大湾区(广东·惠州)绿色农产品生产供应基地内,醇香弥漫、客商汇聚,首...
当“征服世界”过时,成年人开始... 晚上十点,林舟走出写字楼。玻璃幕墙里的灯还亮着,手机里同时躺着数条消息。一条是同事发来的新版方案,等...
台风沙德尔影响湖北,8月29日... #台风沙德尔即将影响湖北# 受今年第18号台风“沙德尔”外围环流和冷空气共同影响,8月29日至31日...