转自:贵州日报
本报讯 8月28日下午举行的2026中国国际大数据产业博览会“高质量数据集和数据标注”主题交流活动上,高质量数据集开源社区正式启动。
本次活动由中国国际大数据产业博览会组委会主办,中国信息通信研究院、中国移动通信集团承办,旨在聚焦“夯实高质量数据底座,赋能人工智能创新发展”主题,展示行业高质量数据集建设成果和前沿动态,探讨数据和智能创新融合发展新路径。
活动现场,高质量数据集开源社区正式启动。该社区面向数据集建设单位、使用单位、技术企业、科研机构和高校等各方主体,围绕数据集、质量方法、技术工具和应用场景开展交流协作,促进建设经验交流和优秀成果展示。中国信通院、中国移动、中国电信、中国石油、国家管网、南方电网、中国机械工业集团、百度智能云、蚂蚁密算等单位的代表共同见证了社区启动。
围绕数据如何赋能人工智能发展,多位院士专家带来主旨演讲。在体系建设层面,有关方面介绍,当前正系统推进国家数据集管理服务系统建设,构建“3NM”工作体系,布局“7+32”数据标注先行先试新格局,推动数据标注产业从起步培育迈向快速成长新阶段。截至目前,全国已建成高质量数据集12.6万个,总体量突破1815PB,半年内体量增长近一倍。国家数据局、工业和信息化部今年4月联合启动“模数共振”行动,面向钢铁、石化化工、有色金属等重点行业,推动模型能力与数据资源深度融合,促进数据集建设从“有什么、建什么”转向“需要什么、建什么”。
聚焦技术前沿,深圳大学电子与信息工程学院院长丁文华指出,人工智能正从“能生成”迈向“能执行”、从模型智能迈向智能体智能,数据是人工智能的知识源泉。随着具身智能兴起,训练数据需求发生根本变化,从文本、图像、视频转向持续交互的轨迹数据,业界预测相关数据需求至少在千万小时乃至亿小时量级,当前供给存在明显缺口,成为亟待突破的关键瓶颈。香港中文大学(深圳)人工智能学院院长李海洲聚焦语言数据,指出语言数据是人工智能最核心也最稀缺的数据,我国中文数字化文本占比低,呼吁加快历史文化文献数字化,让更多中文数据滋养国产大模型。
产业实践同样亮点纷呈。国家医疗保障局有关负责人介绍,全国统一医保信息平台已覆盖13.3亿参保人全生命周期数据,正以应用为导向,通过“以数招模、以模汇数”深化医保高质量数据集建设,推动“医保+商保”清分结算、药品追溯码保理、个人医保云等场景落地。腾讯方面表示,腾讯混元4(Hy4 preview)于当日发布,并分享“数据即能力”观点,认为数据决定智能的上限与下限,高质量数据更需注重知识密度、多样性与可验证性。
圆桌论坛环节,来自中国科学院、鹏城实验室、广州国家实验室等机构的专家学者,围绕科学研究领域高质量数据集建设深入交流。与会专家认为,高质量数据集建设正从资源工程走向知识工程、迈向能力工程,应让科研全流程数据“可追溯、可复现”,把隐性知识显性化,推动数据集建设与模型研发形成反馈闭环。
当前,贵州正加快建设国家数据要素综合试验区,深入推进行业高质量数据集建设,全省在建及投运数据中心达50个。贵州把数据标注作为特色产业支持培育,出台数据标注22条政策,集聚数据标注企业135家、从业人员超1.6万人,并着力争创国家数据标注创新实验区,让数据要素价值在智能经济发展中加快释放。
(贵阳日报融媒体记者 许发顺)
(《高质量数据集开源社区正式启动》由贵阳日报为您提供,转载请注明来源,未经书面授权许可,不得转载或镜像。)