不久前刚在北京亦庄举行的2026世界机器人大会上,具身智能是否能进入“ChatGPT时刻”成为热点话题。
所谓“ChatGPT时刻”,是指2022年底ChatGPT上线后,5天破百万用户、2个月破亿的现象级爆发事件。此后,这一短语特别用来比喻AI(人工智能)领域一项新技术能达到让大众直观感受到“原来AI这么强”的颠覆性时刻。
根据央广网报道,在宇树科技董事长王兴兴看来,理想情况下,具身智能的“ChatGPT时刻”需要2至3年,慢则需要5至10年。当机器人进入任意陌生家庭环境,依靠语音指令可以自主完成80%左右的日常任务时,就是通用机器人产业真正爆发的临界点。
关于具身智能商用进展,中商产业研究院此前发布的《2026年全球及中国具身智能发展白皮书》称,2026年具身智能迈入小批量商用元年,产业竞争转向真实交付。
中商产业研究院预计,中国广义具身智能市场规模2026年预计突破1万亿元,人形机器人是其中增速最快、弹性最大的结构性增量。具身智能广义口径涵盖智能机器人整机、核心零部件、具身智能软件与系统集成等相关产值。
具身智能产业规模不断增长的同时,业界越来越清晰地意识到,实现规模化商用仍有多重难点待突破。
“当前真实数据面临巨大的资源缺口。”中国信通院、人形机器人(上海)有限公司和具身智能测试实验室近日发布的《具身智能训练场研究报告(2026年)》(下称“研究报告”)分析称,假设实现机器人“ChatGPT”时刻的模型参数量级为55B,按大语言模型的缩放定律,训练所需数据量约1.1万亿token(词元)。若全部由真机回流提供,按控制频率8Hz、每步约3个预测token、每天有效交互2小时、每年工作300天测算,约需21200台机器人连续工作一年,产出千万小时级有效数据。当前全球可用的高质量真实数据仅数十万至百万小时级,远未达到支撑具身基础模型智能涌现的门槛。
研究报告分析了具身智能与大语言模型在数据来源和使用方面存在的天然差异。“前者无法复制后者的数据积累路径。”研究报告称,具身智能所需的视觉、动作、关节扭矩、力触觉等多模态交互数据,此前从未被系统性记录,也无法从互联网直接获取,只能从零逐条生产。由此可见,“具身智能训练场成为现阶段推动实景实训的关键路径”。
随着具身智能加速从实验室走向产业落地,具身智能训练场成为关键基础设施。近两年,各地掀起一轮具身智能训练场建设热潮。
研究报告梳理公开数据称,2024年至2026年6月,各地已发布超40份政策文件,加大资金支持与要素保障力度,多措并举推进具身智能训练场建设,构建协同联动的训练基础设施体系。
截至今年6月底,建成启用的训练场超过70家,在建或规划中的训练场达46家。从省份分布看,已启用和在建的训练场分布在浙江、广东、江苏、四川、北京、上海、广西、山东、湖北、天津、重庆、福建、安徽、湖南、河南、江西、河北、吉林等18个省份。从各地数据看,浙江已建成的训练场最多,为14个;其次为山东、江苏、北京、广东,均为8个。
从行业场景分布看,当前,我国具身智能训练场建设主要围绕工业制造、家庭服务、商业零售、医疗康养、特种应急等行业场景加快布局。其中,含工业制造场景的训练场是最集中的方向,占86%。根据研究报告分析,工业制造领域的训练场景主要涵盖汽车制造、家电制造、电池制造、3C电子制造、半导体制造等细分场景,重点训练物料分拣、搬运、装配、质检等作业能力。
“物流仓储、物料搬运等任务布局最为集中,占已披露工业制造场景的近40%,已成为训练场面向工业制造场景开展数据采集和能力训练的重要切入点。”研究报告称,场景建设将直接决定数据生产方向、能力训练重点和运营服务边界。
医疗康养、特种应急是更高难度、更高安全要求的前沿探索。根据研究报告的数据,目前,这两个领域的训练场占比较低,分别为30%、25%。
“在快速推进过程中,训练场场景任务建设同质化、数据实际产能有限、数据多样性和流通性不足以及可持续商业模式尚未形成等问题逐渐凸显。”研究报告称,训练场建起来仅是第一步,更重要的是用起来、转起来,真正成为数据资源基地和实景实训平台,支撑具身智能产业规模化发展。
今年6月,工信部、国资委联合启动实景训练专项行动。该专项行动的通知印发给10个省份工信主管部门以及各有关中央企业。
该专项行动的目标是,到2026年底,人形机器人等重点产品在一批代表性场景中率先完成应用验证和常态部署,开启“作业模式”;凝练形成百个以上高价值应用场景,进一步丰富具身智能应用谱系,带动形成万台级规模落地能力。