国家数据局相关负责人披露,截至今年8月,全国已建成高质量数据集超过12.6万个,总体量突破1815PB(约合1.77EB),较今年一季度末大幅增长超89%。
所谓高质量数据集,是指经过采集、清洗、标注、加工等全流程数据处理后,可直接用于人工智能模型开发和训练、并能有效提升模型性能的数据集合。随着大模型技术加速迭代,高质量数据已成为AI产业发展的核心“燃料”。此次公布的12.6万个数据集,覆盖政务、医疗、金融、交通、制造等多个重点行业,标志着我国数据要素供给体系正在加速成型。
值得关注的是,国家数据集管理服务系统自今年4月正式上线以来,已累计发布数据集超1700个,数据供给规模持续攀升。该系统的运行有效打通了数据供需两侧的信息壁垒,为数据要素的高效流通和合规使用提供了基础设施支撑。
本届数博会还首次设立“数据集市”专场,95家数据企业携253个精品数据产品集中亮相,旨在促进供数方与用数方的精准对接。业内专家指出,数据集市的推出将大幅降低AI企业获取高质量训练数据的门槛,有望加速千行百业的智能化转型进程。
从一季度到三季度末,全国高质量数据集总量增长近九成,反映出我国在数据资源建设方面的投入力度持续加大。随着《数据二十条》等政策红利持续释放,以及各地数据交易所的陆续落地,我国数据要素市场正从“量的积累”迈向“质的飞跃”新阶段。可以预见,高质量数据集的爆发式增长,将为我国人工智能产业发展注入源源不断的动力。
评论