游乐游手机版
首页/AI热点日报/热点详情

专家建言高质量语料一横一纵并行拓宽AI认知广度

类型:热点整理2026-07-24
高质量语料是AI从“会生成”迈向“会理解、会判断”的核心基础设施。“一横一纵”并行发展:广度拓展依赖通用数据,深度深耕聚焦垂直领域专家数据。垂域高质量语料是突破产业智能瓶颈的关键,需构建共生、共建、共享、共治的数据生态。

通用大模型在日常对话和通识问答中确实表现出色,但一旦涉及甲状腺疾病临床诊断、隧道地质研判这类高难度专业场景,逻辑偏差、判断不准的问题便暴露无遗。

这背后,核心症结在于数据。市面上许多模型本质上是用碎片化的互联网通用数据“喂养”出来的,缺乏严谨的专业逻辑,自然难以支撑高门槛的行业决策。

高质量语料绝不仅仅是数据的简单堆砌,而是专业知识、专家经验、场景经验的系统化、工程化沉淀。这正是推动人工智能从“会生成”迈向“会理解、会判断、会协同、会行动”的关键基础设施。

那么,构建高质量语料到底该朝哪个方向发力?

“一横一纵”并行发展

在2026世界人工智能大会期间举办的“人工智能高质量语料生态论坛”上,图灵奖得主约翰·霍普克罗夫特回顾了AI从学术项目走向产业浪潮的历程,指出算力与数据基础设施的相互成就推动了这一进程,并强调各国需要制定能够应对持续变化的AI战略。

从当前探索来看,高质量语料建设主要沿着两条路径推进。

一条是“一横”,即广度拓展路径。它依赖海量通用数据和规模化常识标注,通过数据规模堆叠模型的通识能力,解决AI回答“是或否”这类常识问题。

另一条是“一纵”,即深度深耕路径。它聚焦于垂直领域的专家级数据和高精度标注,依靠顶尖专家的专业沉淀来定义语料标准,保障模型的专业精度与落地价值,解决AI“好不好用、能不能解决真问题”的核心命题。

“一横一纵”并非二选一,而是互为补充、并行发展的关系。不过,若要突破科学智能与产业智能的发展瓶颈,垂直领域的高质量语料才是真正的核心刚需。

构建面向人工智能的数据生态

据了解,国家信息中心联合GOMAX LAB已启动《面向人工智能的数据语料构建生态路线图》研究工作。

课题负责人、国家信息中心信息化和产业发展部主任单志广表示,构建面向人工智能的数据生态是一项系统化、长期性工程。需要立足全球人工智能产业竞争的新需求,顺应数据语料作为大模型研发、技术创新与产业赋能的战略性资源这一新趋势,联合“政产学研用”等多元主体力量,加速构建“共生、共建、共享、共治”的面向人工智能的数据语料生态。同时,要创新探索中文语料生产范式,系统布局通用型基础语料与垂直行业专业语料建设,打通从高质量语料到高可靠模型的技术通道,持续提升中文语料在全球数据资源市场的供给占比与品牌影响力。

GOMAX LAB AI总裁陈旻麒则描绘了更具体的图景:“未来的产业智能,依托专家沉淀的高质量语料持续训练;未来的行业模型,依托科学专业的Benchmark体系统一评测;未来的可信AI,依托标准、场景、闭环、生态持续进化。”

他还介绍了人工智能高质量语料产业发展路径图,勾勒出一个从“沉淀专家经验、深耕专业数据治理、构建分层高质量语料、搭建行业级Benchmark”,到“科学量化模型能力、真实场景闭环验证、沉淀标杆范式、建立行业标准与开放生态”的完整闭环。

规模化落地还需跨越门槛

理想很丰满,但垂直领域高质量语料要实现规模化落地,还需要跨越几道核心门槛。

比如,“全域多赛道覆盖,搭建国家级数据基础设施”;“长效协同共建模式,摒弃一次性数据交易”;“自研全链路工程算法底座,实现专家知识数字化转化”;以及“多元长效资本协同,支撑重投入长周期赛道”。

可以说,研究领域不断拓宽、合作共建持续深化、算法底座日益坚实、资本赋能长效支撑——这既是高质量语料赛道走向成熟的必经之路,也是长期深耕者的核心竞争力所在。

值得一提的是,人工智能高质量语料生态共建行动已正式启动。其目标在于凝聚国家智库、地方政府、产业平台、科研团队等多方合力,推动高质量语料真正实现“供得出、流得动、用得好”。

中国新一代人工智能发展战略研究院执行院长龚克特别提醒,跨学科协同需要在数据层面实现真正的融合,而高质量语料本身就是跨学科协同的产物。数据服务商需要转型为企业长期研发合作伙伴,深度嵌入模型全研发流程,同步迭代优化行业语料,持续稳定地保障AI的专业推理精度。

来源:https://k.sina.com.cn/article_1784473157_6a5ce64502003ore2.html?from=tech

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。