2026世界人工智能大会日前在上海圆满落幕,其中一场聚焦高质量语料生态建设的专题论坛,释放出清晰信号:人工智能的发展已从“堆砌算力、比拼算法”的阶段,正式迈入“以数据语料驱动产业落地”的新周期。通俗来说,大模型能否真正解决实际业务问题,关键在于它“训练”的数据是否足够优质、足够专业。
国家信息中心信息化和产业发展部主任单志广在论坛上点明了核心:高质量数据语料是人工智能时代的基础性、战略性资源。没有高质量的数据,便难以期待高质量模型。这句话表述直白,但其背后的逻辑值得深入思考——当前许多模型在专业场景中逻辑出现偏差、判断不够精准,根源往往并非算法不够强大,而是训练数据“过于粗糙”。
那么,语料建设如何破局?行业专家提出了“一横一纵”两条路径。“一横”指推进广度拓展,通过海量通用数据和规模化常识标注,夯实模型的通识能力,主要解决“是或否”这类基础常识性问题;“一纵”则深化垂直领域的专业深耕,依靠专家级数据和高精度标注,用顶尖专家的专业沉淀来定义语料标准,从而切实保障模型在具体场景中的专业精度。简而言之,前者让AI“能沟通”,后者让AI“能干活”。
本次论坛上,国家信息中心联合骨码智元实验室GOMAX LAB,正式发起《面向人工智能的数据语料构建生态路线图》课题研究。同时发布的还有《人工智能高质量语料生态共建行动暨产业路径图》,覆盖高端制造、生命健康、网络安全、城市治理等多个关键领域。这意味着,垂直领域语料的共建体系已不再停留于概念层面,而是拥有了清晰的路线图与首批落地方向。
骨码智元总裁陈旻麒在论坛上透露,下一步将锚定8个首批共研方向,加速推进各垂直领域语料的落地验证工作。同时,规划了7个长期拓展赛道,以支撑未来十年间人工智能产业的迭代升级需求。从这些布局来看,行业对语料的重视已从“有没有”转向“精不精”,而这场“语料攻坚战”的成败,很可能决定未来十年AI落地的实际水平。
