智源研究院发布开源中文互联网语料库CCI 4.0
创始人
2025-05-08 22:44:12

北京商报讯(记者 魏蔚)5月8日,北京商报记者获悉,智源研究院近日在GOSIM全球开源创新论坛上发布大型开源文本数据集CCI 4.0。据了解,CCI 4.0兼顾多样性与高质量,从单一语言数据集扩展为多语种数据集。本次发布包括了中、英语两种语言,并将在随后的发布中,开源更多语言的版本。此外,CCI 4.0首次采用CoT方法进行推理轨迹数据合成,以提升预训练模型的基础推理能力。CCI 4.0数据集由智源研究院牵头,联合包括阿里云、上海人工智能实验室、华为、出门问问、金山办公、昆仑万维、面壁智能、奇虎科技、美团、稀宇科技、月之暗面、紫东太初、中科闻歌、科大讯飞等多个机构共同贡献。

相关内容

热门资讯

长... 9月18日,长飞公司与中国联通网络技术研究院(以下简称“中国联通网络技术研究院”)在京签署战略合作协...
F... 使用 framer 做原型时,几乎到处都需要用到图层。可以是一张图片,一段文字,一段视频。frame...
想... 随着科技的发展,电脑已经成为我们生活、学习、工作中不可缺少的一部分,办公软件也与我们的生活和工作息息...
新... 在互联网飞速发展的时代,电脑已经成为人们办公或者社交活动的基本操作工具。如果你还在为不会打字或者打字...
以... 今天给大家带来第176期优质空投微软和软银投资(福克斯的母公司)参与以太坊ETH开发的共识公司估值7...