7月19日,国家数据局公布最新统计,核心信息显示:全国已建成的高质量数据集数量已达12万个,为人工智能等前沿领域筑牢数据根基。

具体来看,截至今年6月底,全国在科学研究、工业制造、医疗卫生、教育教学等多个关键领域,已建成高质量数据集,总数据量突破1565拍字节(PB,1PB=1024TB)。这一数字较一季度末增长超过60%,现有体量大约相当于中国国家图书馆数字资源总量的547倍。海量高质量数据的持续积累,正为人工智能的发展提供坚实支撑。
从数据标注产业来看,发展步伐明显加快,有效助推了高质量数据集的建设。数据显示,截至今年6月底,四川成都、辽宁沈阳、安徽合肥、湖南长沙、海南海口、河北保定、山西大同这七个数据标注先行先试城市,标注规模已超过119 PB,数据标注从业人员达到14万人。
下一步,国家数据局将深化构建面向人工智能的高质量数据供给体系,核心思路是:以模型应用牵引数据供给,同时以数据驱动模型迭代,最终推动形成数据集有偿使用的价值闭环。这正是关键所在。
