转自:贵州日报
连日来,来筑参加2026中国国际大数据产业博览会的部分嘉宾持续围绕“词元——数据要素价值释放新路径”年度主题,就人才培养、数据要素市场、数智技术、词元经济等热点话题,分享前沿观点与实践成果。
香港中文大学(深圳)党委副书记杨国华:
人才培养需立足企业真问题科研真课题
8月29日,香港中文大学(深圳)党委副书记杨国华在参加2026中国国际大数据产业博览会期间接受专访,就数据科学与人工智能人才培养、高校在打通数字经济“科研-转化-产业”链条的角色定位等方面问题发表观点。
香港中文大学(深圳)于2025年2月成立人工智能学院,在数据科学与人工智能人才的培养上进行了探索,形成了特色。杨国华从三个方面进行阐述。一是循序渐进、注重实战。香港中文大学(深圳)在本科四年的前两年打基础,大一、大二开设小班制“人工智能探索”课程,开展基础技能训练,帮助学生发现自己的兴趣所在;后两年练实战,大三开展“人工智能实践”,解决真实的产业或科研问题,大四开展“人工智能毕业设计”,对接企业需求或科研前沿。二是注重跨学科融合。在本科阶段与香港中文大学丘成桐班合作共同设置“2+2”双主修项目,第一主修是人工智能专业,第二主修是数学专业,有效糅合大湾区的教育资源、科技资源和产业资源,培养国际化人才。三是打通本硕博贯通式培养模式。依据学生本科阶段的学业成绩和表现,实施本硕、本硕博贯通的培养方式,为后续有效对接产业、解决科研一线问题打下良好基础。
对于高校在打通数字经济“科研-转化-产业”链条中的作用,杨国华认为关键在于将前沿的科研团队与产业的真实需求紧密结合起来,用最短、最有效的连接去解决“卡脖子”问题。他结合具体的实践,分享了高校科研和产业转化的经验做法:一是常态化的高校、企业、政府对接模式;二是聚焦企业的真实问题,找到真问题、发现新产品、解决真需求;三是在智库赋能和行业标准制定上做工作,给政府和行业提供、制定行业标准的参照文件,有利于在行业内树立标杆。
杨国华还立足教学实践,从高等教育的视角回答了如何通过产教融合培养更多“人工智能+”人才、夯实大数据产业发展的人才基石等问题。在他看来,产教融合是目前培养“人工智能+”人才的创新模式。一是需要把课程体系与业界结合起来,打破旧有的传统教学体系,企业、学校互相“请进来、走出去”。二是需要注重实战,在真实的场景应用所学的专业知识,锻炼解决问题的能力。三是立足本地产业优势,开展顶层设计,分层布局人才梯队,面向基础岗位,规模化培养数据标注师;面向核心岗位,定制化培养“算力运维师”;面向创新岗位,项目化培养AI应用开发者。
贵阳日报融媒体记者 郑文丰
深圳数据交易所市场发展部总经理宋义勇:
携手贵州推动数据要素市场化配置
“词元实现了数据参与价值创造的可观测、可计量,使得数据行业的商业模式发生了根本性变革。”8月29日,深圳数据交易所市场发展部总经理宋义勇在接受采访时表示,作为一种可拆分、可计量、可追溯的价值载体,词元的核心作用是将形态千差万别的数据产品与服务转化为市场可高效流通的标准化产品,未来数据产业的核心模式是模数共振,即“场景牵引数据、数据驱动模型、模型赋能应用、应用创造价值”的“数据飞轮”。
宋义勇说,这一变革意味着数据交易标的正从庞大、模糊的“数据集”向精细、可组合的词元“价值单元”演进,以满足AI智能时代规模化、高效率的数据要素新需求。数据价值的实现路径从一次性售卖转变为持续性的价值共创与收益分享,即通过词元化交易,每一次数据被调用、每一次模型因新数据而优化所产生的增量价值,都可以被精准计量并反馈给数据提供方,从而激励更多高质量数据的持续供给,形成自我强化的正向闭环,让数据越用越值钱,模型越用越强,业务越跑越优。
面对变革带来的机遇,宋义勇说,深圳数据交易所积极以“人工智能+数据要素”赋能产业,积极开展词元相关创新实践,探索成为“数据飞轮”的运营者,通过搭建可信数据生态、聚焦数据服务商,将海量异构的原始数据加工为标准词元,并通过自身的基础设施平台确保数据在生态中安全、可信、高效地流通与增值。探索以词元调用计量为核心的新型交易服务模式,推动交易范式从传统数据包售卖向“能力调用、按量计费”演进。
与此同时,全球数字贸易、人工智能、词元出海持续发展,带来大规模数据跨境流动需求。深圳数据交易所在全国率先落地场内跨境数据交易,打造“湾区数桥”数据跨境服务平台,通过持续探索可复制、可推广的数据跨境流通新模式,构建“规则互认、技术支撑、场景落地、多方协同”的一体化跨境治理体系,在数据跨境合规流动方面积累了宝贵“深圳经验”。
“原始数据不能直接变成资产,需经过‘资源化-产品化-资产化’的完整链条加工后,数据资源才能成为真正的资产。”宋义勇说,只有完成治理脱敏、加工标注,形成数据集、词元产品,能够对外提供服务、产生持续现金流,满足合法可控、可计量、具有预期经济利益才具备资产属性。数据转化为数据资产的过程中存在三道难题,一是权属和合规;二是数据资产估值;三是市场变现闭环尚未成熟,投入产出不确定、企业观望居多。
宋义勇表示,深圳数据交易所将通过“一地上架、全国互认”试点,助力全国一体化数据市场建设。贵州作为国家大数据综合试验区、“东数西算”算力枢纽节点,拥有算力底座、公共数据授权运营实践、语料数据集建设、贵阳大数据交易所平台等优势,与深圳数据交易所在数据要素市场化配置方面存在诸多合作空间。“一是交易机构互联互通。在推进数据产品跨区域互认互通方面,深圳数据交易所与贵阳大数据交易所已经形成‘一地上架、多地互认’互认互通合作;二是联合建设垂类高质量数据集专区。贵州可发挥公共数据授权运营、特色产业语料(气象、山地农业、民族语言等)、数据标注加工产业优势,与深圳数据交易所联合开发行业知识库数据集,共同打造‘行业知识库数据集+词元调用额度’一体化产品;三是推动‘深圳产业场景+贵州智算算力’协同;四是探索数据要素跨境与国内联动创新,拓展贵州数据产品出海通道。”宋义勇说。
贵阳日报融媒体记者 郑文丰
赛智产业研究院院长赵刚:
贵州数字经济先发优势已转化为品牌优势
赛智产业研究院院长赵刚在2026中国国际大数据产业博览会期间接受采访时,分享了其对词元经济、“十五五”数据产业发展特点、贵州数字经济发展的比较优势等议题的洞察。
赵刚认为,词元经济是随着大数据的发展、智能技术的应用,特别是大模型发展过程中产生的一种经济形态。在大模型运行中,谁的模型能更高效率地产出词元,在更复杂的任务中能输出更多的词元,这样的智能形态就能产生更大的经济价值。“智能经济的发展有三大要素:数据、算力和算法。词元经济的发展过程,实际上就是把海量的、有巨大价值的数据资源,通过算法和算力转化成知识智能服务,而这些智能服务是以词元为计量方式的,最终形成未来智能经济发展的商业模式和经济体系。”他形象地说,“就像互联网经济是用流量经济来等价定义的,智能经济实际上就是用词元经济来定义的。”
对于“十五五”期间数据产业的发展特点,赵刚从五个方面进行了介绍。一是数据基础制度体系会越来越完善。数据是词元经济、数据经济、智能经济的“原料”,必须保证“原料”高质量、大规模、标准化地供给,才能更高效率地投入生产。从“数据二十条”开始,国家在数据产权制度、收益分配制度、流通交易制度、安全治理制度方面出台了系列举措,系统性布局了数据基础制度体系的“四梁八柱”。二是数据资源体系的建设,要建设面向人工智能时代的高质量数据集。把数据资源转化成高质量数据集,为人工智能大模型、智能体部署到企业做好准备,所以数据标注、数据管线、面向人工智能的数据资源治理,都是下一阶段推动数据资源开发运营非常重要的方面。三是数据要素规模化投入生产,提升数据采集、加工的效率是关键,让人工智能参与,自动化做标注、自动化做数据采集、自动化做数据治理,最后形成自动化的高质量数据集。四是数据流通体系的探索完善。当下数据交易存在流通成本过高且无法追溯的问题,需要通过建立和完善数据流通体系进行解决。五是安全制度的建立与完善。数据产品和服务的流通全过程无法监控,需要加强安全治理、隐私计算、隐私保护、个人信息保护等方面的安全制度,这是数据产业发展的重要趋势。
赵刚认为,贵州在数字经济发展创新方面具有比较优势,最初是先发优势、战略优势、能源优势、生态优势。经过十多年的发展,能源、生态方面仍然是优势,而先发优势已转化成品牌优势、算力优势,并发展出云计算服务、数据加工服务、数据流通交易服务,形成了一个完整的大数据产业链,有了大数据产业的先行优势。与此同时,贵州在西部范围内具备了人才培育的智力优势。“贵州在数字经济发展创新方面的比较优势,过去是从无到有,现在是从有到好。”赵刚说。
贵阳日报融媒体记者 郑文丰
山东数据集团副总经理、浪潮卓数大数据董事长张帆:
期待和贵州合作 精细化释放数据要素价值
8月28日,2026中国国际大数据产业博览会期间,山东数据集团副总经理、浪潮卓数大数据董事长张帆接受记者专访时表示,在AI时代,工具已经不是最核心要素,场景才是起点。
张帆表示,浪潮卓数大数据自研的“模数工坊”是工业化的数据工厂,可将多模态原始数据加工为可重复使用、价值可量化的最小可计算数据单元,实现数据要素精细化释放。这与2026数博会“词元——数据要素价值释放新路径”的主题高度契合。
数据资源化是否是化解地方政府算力闲置、降低企业AI使用门槛的关键抓手,张帆给出了肯定回答。他指出,当前不少地方发展AI存在“重算力、轻数据”现象,而模型效果高度依赖训练数据质量。许多地方大力建设算力基础设施,却缺少足够语料和数据来训练模型,出现机房、设备大量闲置等现象。同时,企业AI数字化转型更看重当地有没有特色、专业化的数据资源。浪潮卓数大数据作为轻资产数据企业,依托“模数工坊”将原始数据加工为高质量数据集,导入地方闲置算力池。中小企业可以低成本调用当地算力与加工好的数据开展模型训练,研发完成后带走模型即可。这样既盘活地方闲置算力,又大幅降低企业使用成本,两方痛点同时得到化解。
对于颗粒度更细的数据资源形态能否填平技术工具与业务场景之间鸿沟的问题,张帆表示,单靠数据资源很难全部解决,需要场景牵引,同一套原始数据,只要应用场景不同,数据加工标准就完全不一样。如用于金融征信和用于医疗、消费分析、旅游等场景的清洗加工标准各不相同。他认为,词元作为大模型处理文本的最小数据单元,可以灵活组合,根据不同业务场景生成差异化数据集,这正是数据要素精细化释放的具体路径。完整闭环是从业务场景出发提出数据需求,原始数据加工成对应的数据资源,调用资源训练模型,模型赋能业务,业务持续产生新数据,形成数据飞轮,持续放大数据价值。
在数据资源出海方面,张帆介绍,公司已在山东布局相关业务,坚持数据不出域模式,原始数据保留在本地不流出,公司提供算力,以token形式对外提供服务,合作方完成训练后只带走训练结果,以此实现token层面出海。未来,希望将国内电力能源优势转化为标准化算力输出能力。
关于与贵州的合作可能性,张帆表示,围绕大数据工厂、数据标注基地、数据应用空间、数据人才实训培养等方向,非常期待和贵州开展产业合作,推动项目落地。
贵阳日报融媒体记者 舒锐
上海本原智数科技有限公司创始人兼CEO李逆勇:
真正决定人工智能上限的是数据
8月28日,上海本原智数科技有限公司(以下简称本原智数)举行以“数据为本 原力智慧”为主题的第一届本原智数生态发布会,发布聚焦高质量数据集建设的“双十亿计划”,即打造面向数字信息交互任务的“十亿条专家轨迹数据”、面向物理场景交互任务的“十亿小时具身操作数据”。
8月29日,本原智数创始人兼CEO李逆勇在接受专访时表示,人工智能的长期竞争不会只停留在算力和模型架构之上,真正决定人工智能上限的是数据,更准确地说是数据所承载的人类智慧、真实经验、复杂任务、专业知识与可验证反馈。
“我始终有一个观点,我们数据公司所做的事情,本质上就是把人类的知识跟经验萃取出来,投喂给AI模型。”李逆勇表示,我们可以把人类最精华的经验分为两种类型,第一种叫理论知识,掌握在学者、研究人员手里;第二种叫实践知识,掌握在各个行业的专家手里,如三甲医院的医生、知名律所的律师。具体萃取什么样的经验,取决于AI进化到了哪个阶段,比如大语言模型核心提炼的是人类语言,具身模型核心提炼的是人的肢体动作。
李逆勇曾梳理了一条清晰的“AI演进四阶段”路线图:语音模型、视频模型、自动驾驶、大模型。这一演进的方向很清晰:AI正在从“模仿感官”走向“模仿工作”,从“学知识”走向“学干活”。而“学干活”的数据,互联网上没有现成的。
“本原智数给自己的定位是全赛道、全生命周期的AI基础设施数据服务商。”李逆勇说,全赛道是指不仅服务大语言模型,还服务世界模型、具身模型等;全生命周期是指覆盖数据的采集、清洗、标注、合成、评测、智能体落地。
围绕这一定位,本原智数打造了“原测、原识、原智、原物”四大数据基础设施平台。其中,“原测”平台主攻大模型、智能体能力评价与标准演进,“原识”平台主攻专家与高质量数据供给,“原智”平台主攻智能体运行与持续进化,“原物”平台打造多技术路线的数据治理、训练和评测基础设施。这四大平台聚焦人工智能产业面临的能力难量化、数据供给不足、开发门槛高、仿真与真实场景偏差大等共性痛点,构建起“数据生产-模型训练-模型评测-持续优化”的完整产业闭环。
通过多年积累,本原智数在数据采集上沉淀了一套三梯队运营体系:底层由科学家和各领域的专家制定规则;中层有面向全球的12大交付网络,包括贵阳、成都在内;上层有800万众包网络。“目前,我们已经生产了PB级别、面向不同领域和模态的高质量数据集。”李逆勇说,所谓高质量数据集,就是能够在某些细分领域高效地提升模型表现的数据。
2025年,本原智数投资的贵州数策智算科技有限公司落地贵阳,主要专注于面向大语言模型的数据标注、面向具身智能的数据采集等数据服务,团队人数半年时间突破300人,并与省内10余所院校建立产教融合合作,为贵阳贵安数据标注产业快速集聚注入了鲜活动力。“贵阳贵安是国家大数据综合试验区核心区、全国首批数据要素综合试验区(贵州)核心区,具备绿色数据中心集群和较好的综合成本优势。同时,贵阳正在形成从数据标注、AI训练到智能终端的产业链条。我们希望以贵阳为核心,把这里建设成为一个面向全球的数据生态枢纽,让更多数据企业、专业团队、专家人才和产业伙伴在这里汇聚。”李逆勇说。
贵阳日报融媒体记者 郑文丰
上海卓益得机器人有限公司创始人兼董事长李清都:
安全和信任是机器人走进家庭的关键
8月28日,上海卓益得机器人有限公司创始人兼董事长李清都在接受记者专访时表示,机器人走进家庭,完成任务只是第一步,还需要在安全的基础上建立人机之间的信任,理解角色、时机、关系和边界,也就是“走心”。
李清都介绍,卓益得构建的是面向近人服务场景的仿生人形机器人及卓灵多模态交互智能系统。公司的核心目标是带给人安全感和幸福感,重点面向服务、文旅、康养、家庭场景。“想要机器人真正理解人,需要依靠智能交互大模型,也就离不开社交语境下的海量数据支撑。”他说,机器人要服务好人类不是只看单句对话,必须结合社会语境、表情、肢体动作、当前服务相关的必要历史信息进行综合判断。相较于动作和操作数据,带有对象、关系、角色、时机、身体状态、人的反馈的长周期真实交互数据更为稀缺,补齐后才能形成真正的数据闭环,近人服务才能真正落地。
李清都表示,未来是人机共存的社会。从GPT大模型问世、DeepSeek走向平民化,再到智能体快速普及,AI迭代速度飞快,他早年预判家庭机器人落地需要20年,而按照现在的发展节奏来看,成熟和规模化的近人服务应用或许会快很多。在近人服务场景中,养老机构、社区会率先落地,部分家庭场景也可投入使用。
“机器人走进家庭的关键,是机器人足够的安全并且建立人机之间的信任,没有这两点,人会对机器人心存戒备。”李清都说,现在行业正在研究具备长期记忆能力的个人智能体,可以持续记忆用户的习惯。当这类智能体和物理AI、社会AI结合,才能够建立人机信任。同时,保证人形机器人的安全运行至关重要,不仅要保证机器人本体足够安全,公司还在积极结合产品形态,评估人工智能拟人化交互相关监管规定的适用范围,并将数据治理、安全评估、伦理审查、老年用户保护前置到产品设计中,筑牢数据安全与隐私防护。
对机器人在养老场景中可以承担的具体工作、需要考虑的伦理安全举措及垂直场景下的高质量数据来源方面,李清都介绍,人形机器人处理非结构化任务会面临成功率难题,喂饭、复杂家务等演示效果虽好,但商业化初期不能作为主力功能。在人形机器人商业化的第一阶段,需优先验证与老年人的社交互动、日常提醒、基础健康信息记录等低风险需求。机器人可以陪老人聊天、散步、下棋,开展乒乓球、健身操等运动。以乒乓球交互为例,机器人不仅可以陪伴老人,另外搭配上公司正在研究的基于视觉的非接触式心率监测功能,还可以给出科学运动建议,避免老人运动过度,同时还可以对慢性病做长期监测、风险预警。机器人承接以上重复、低风险的服务工作,能够让护工有更多时间处理专业性和高危复杂的工作,同时协助采集高难度场景下的珍贵样本数据。
在安全方面,李清都介绍,卓益得为机器人搭建了三层防护体系,第一层是物理与控制安全,身高1.7米的人形机器人整机重量控制在30公斤,整机外部全覆盖柔软的晶格弹性体吸收冲击,全身搭载触觉传感器,包括头部及全身皮肤,以降低碰撞和近距离接触造成伤害的风险。第二层是信息与隐私安全,为人服务过程中的语音、图像、行为习惯等个人隐私原始数据尽量本地处理,仅上传经过token化处理的多模态词元数据,防止原始隐私泄露。第三层是行为与伦理安全,由机器人核心引擎判断角色、授权、对象和风险,输出执行、保持、拒绝或人工接管,并保留审计记录。
贵阳日报融媒体记者 舒锐
(《词元激活要素潜能 数据筑牢智能根基》由贵阳日报为您提供,转载请注明来源,未经书面授权许可,不得转载或镜像。)
下一篇:持续推动服务消费 提质惠民