8月20日,2026世界机器人大会上,北京具身数据独角兽企业光轮智能发布全球首个十万小时级全模态人类行为开源数据集 EgoSuite-Open100K,为机器人的“大脑”训练提供场景丰富的人类行为数据“教材”。
与大语言模型需要基于海量互联网数据进行训练相似,机器人的成长、学习,也需要大量数据作为“教材”。据了解,EgoSuite-Open100K数据集以10万小时的人类行为数据为整体规模,覆盖7大类环境、128类场景类型、1.5万余项任务。数据采用头部与腕部双视角,包含了手部与全身位姿、语义标注等信息。
记者在世界机器人大会现场的光轮智能展台看到,拆取快递包装、在家里摆放日用品、在超市选购商品、叠衣服、擦拭桌椅、切菜、刷洗碗筷、打字、工业质检等各种场景中的人类操作信息,都得到了精准记录。
光轮智能联合创始人兼总裁杨海波介绍,当前具身智能行业在采集口径、标注规范、数据格式和时序组织上存在差异,不同设备产生的数据难以组合复用。而EgoSuite-Open100K的开放,将帮助更多开发者以统一、可复用的数据基础开展模型研究,降低高质量具身数据的获取门槛。
在具身智能行业被视为宝贵资源的数据,免费向外界开源,对企业来说是否划算?对此杨海波表示,对那些难以承担高昂数据采购成本的开发者而言,这批数据将直接降低他们进入具身智能领域的门槛。与此同时,将数据集开源,也能让行业更好地认识光轮智能所生产数据的质量和价值,从而推动企业收获进一步的商业回报。
据悉,首批数据将在国际人工智能开源社区Hugging Face和开源代码托管与协作平台AtomGit 同步开源,面向学术研究与商业训练使用,相关项目还将捐赠给开放原子开源基金会孵化。光轮智能还将围绕开放数据、数据标准和生态协作,推动更多研究机构、模型团队、机器人企业和场景方参与共建。
来源:北京日报客户端
记者:孙奇茹