机器人背后的人:数据采集员是怎么工作的?
创始人
2026-09-01 16:33:23

21世纪经济报道记者 董静怡

在觅蜂科技的数采工厂里,一名数据采集员头戴传感器头盔,佩戴腕部相机,把桌子上的积木拼成指示图所示的样子。

任务不难,但他必须以正常速度的一半完成,不能有任何多余动作。拼好后按下结束键,一次任务完成,再把积木推倒,如此重复多次。

数据是AI时代的石油,训练机器人的“原油”就是这样被开采的。

无本体采集是近两年增长最快的数采方案。21世纪经济报道记者在现场了解到,一名采集员每天要工作大约10至12小时,最终完成4至5小时的数据采集。采集过程中必须遵循严格的标准操作程序——动作不能太快,光线不能太暗,镜头不能被遮挡。

“这一套动作一天要重复一百多次吧。”一名数据采集员向记者表示。

目前工厂内的数据采集,更多是让采集员在受控环境中执行标准动作——背景单一、光线可控、动作规范。这种模式能保证数据的“干净”和完整。

而外部采集则是把设备发放给C端用户,让他们在做家务、干本职工作的同时“顺便”采集数据。这种分布式采集模式的好处显而易见:数据带着现实世界的“噪音”,恰恰是机器人形成泛化能力亟需的“养分”。

8月31日,觅蜂宣布累计产出超过100万小时高质量无本体数据,全部来自开放环境中的真实采集,其数采设备已陆续进入家庭、办公、零售、生产、餐饮等真实场景。

觅蜂科技的一位负责人向记者打了个比方:人类不是只在驾校里学会开车的,而是在长期置身于各种真实场景中才具备了应对不同路况的能力。机器人也一样,真正的泛化能力要靠外部采集来支撑。

目前,数据仍然是具身智能发展的核心瓶颈。统计显示,国内真实物理交互场景合规数据仅50万小时,而机器人商业化落地需要数千万小时数据,缺口超过99%。

上述负责人向记者表示,具身智能比大语言模型更难,不仅需要推理和语言能力,还涉及动作和现实世界的物理交互。这需要的不仅仅是更多数据,更是更多样、更真实的数据。

相关内容

热门资讯

横琴“四新”产业如何合理有序推... 金风启序,横琴粤澳深度合作区迎来揭牌五周年。历经五年耕耘,由科技研发和高端制造、中医药等澳门品牌工业...
现阶段该如何看待联想控股对比联... 联想控股刚刚公布业绩,出乎意料的是在联想集团贡献亏损的情况下,实现了业绩的大幅增长,叠加其全面转型科...
工业柳州如何向海图强 一座不沿边、不靠海的工业重镇,如何向海图强? 8月28日,柳工秘鲁公司开业仪式在秘鲁首都利马举行。“...
两部门:9月1日起外籍个人股息... 财政部、国家税务总局今天(1日)联合发布公告,从9月1日起,外籍个人从外商投资企业取得的股息红利所得...
晋安:爱心捐赠暖山区 开学送“... 8月31日,晋安区妇联联合晋安区女企业家联谊会开展校服捐赠公益活动,为两所山区学校的学子送去114套...