游乐游手机版
首页/科技数码/文章详情

全球AI监管下半场:数据成战略资源,标准谁定义

时间:2026-07-19 11:48
联合国贸发会议指出数据已成战略资源,但发展中国家缺乏规则话语权。全球AI监管呈现三中心格局:欧洲重标准,美国重投资,亚洲(中国)重基础设施。关键鸿沟在于是否有AI就绪基础设施,缺乏者将沦为数据供应方。标准需互操作,数据溯源与认证需独立。

联合国贸易和发展会议(UNCTAD)近期释放出明确信号:随着人工智能全面渗透经济各领域,数据已从普通资源跃升为战略性资源。核心问题在于,数据所产生的收益应如何公平分配?尤其对于发展中国家——它们每日产出海量高价值数字数据,却对数据的使用规则几乎没有话语权。

换言之,数据的价值与收益归属,最终取决于规则的制定者。数据治理的焦点早已超越“谁拥有数据”的简单问题,而是转向“谁有权决定哪些数据可用,以及遵循何种规则使用”。UNCTAD采取务实立场:不追求全球统一的监管框架,而是倡导基于共同原则、保障机制以及国际合作,循序渐进地推进。

Senscience联合创始人兼CEO、多伦多大学教授希尔(Sean Hill)持有相似观点。他指出,数据治理的核心在于标准和规则的制定权——这一权力直接决定了数据价值与收益的分配格局。当前,围绕“AI就绪数据”(即经过整理、可直接用于训练和分析的数据)的标准之争,正在全球范围内沿着多条不同路径展开。


欧美数据治理的推进模式

希尔将当前格局归纳为三个各有侧重的中心:欧洲在强制合规与标准制定方面领先,美国在投资与采纳方面领先,而亚洲部分地区——尤其是中国——则在基础设施建设上快速推进,并展现出主动制定标准而非被动继承的雄心。

欧美两条路径截然不同。欧洲将开放数据融入研究资助的基因:“地平线欧洲”计划默认要求数据开放,推行FAIR原则(可发现、可访问、可互操作、可重用),并辅以Plan S和欧洲开放科学云,确保论文发表后即可免费阅读下载。欧盟还成立了研究评估改革联盟(CoARA),改革研究者评价机制。加之GDPR与《人工智能法案》作为合规背景,形成了完整的体系。

美国则采取市场导向,依靠机构政策逐步推进。例如,NIH从2024年开始要求新项目提交数据管理与共享计划。值得注意的是,白宫科技政策办公室(OSTP)2024年发布的“纳尔逊备忘录”,要求所有联邦机构在2025年底前实现联邦资助的研究成果及其数据免费、即时、无禁令期开放——但该指令已陷入停滞。到2026年,特朗普政府领导下的OSTP正着手废止这一指令。

希尔认为,两种路径带来不同结果:更多资本流向美国的AI就绪数据,而欧洲则构建了更持久、更可复用的基础。二者并非对立,但各有短板。缺乏基础设施的规则只会增加研究者负担,而没有溯源机制的规模化数据则可能产生无人能复用的结果。

希尔直言:“只有当标准可被机器执行、整理足够简便,以至于合规成为良好研究实践的副产品而非额外杂务时,科学才能进步——这正是我们用FAIR²想要弥合的缝隙。”Senscience开发的FAIR²数据管理体系,旨在为科研数据建立一套可核验的质量与溯源标准。

被边缘化的数据供应方

希尔提醒,真正值得担忧的鸿沟并非不同路径之间的差异,而是“是否拥有AI就绪基础设施”这一分界线。他以基因组学为例:多年来,非洲人群的DNA样本被采集后运往境外分析,相关科学与工具也在国外建立。这正是非洲人类遗传与健康计划(H3Africa)当初试图弥合的落差。

这便是AI时代的真正风险:缺乏AI就绪基础设施的机构,被降格为向外部系统供应原料的角色。它们既无法参与标准制定,也无法分享由此产生的发现。

UNCTAD同样表达了担忧——发展中国家可能沦为宝贵数据的供应方,却在规则制定中缺乏实质话语权。这正是贸发会议主张基于共同原则而非单一全球模式构建合作的原因:在保留各国政策灵活性的同时,避免决策权集中在少数国家和科技公司手中。

标准一旦割裂,代价便会显现。希尔将此称为对科学的“直接课税”。在数据密集型领域,进步依赖于跨国界数据汇集,直到达到一定规模,规律才会浮现。互不兼容的标准会打断这一过程:同一套数据需要准备两遍,而在一套体系下整理的数据可能无法与另一套合并。

他以罕见病研究为例:“任何一个国家可能只有区区几百个病例,少到不足以查明病因;答案只有在欧洲、亚洲及其他地区的病例队列合并时才会浮现。如果无法合并,那项发现就不会发生,或者要延迟很多年。”

代价首先落在研究者身上,继而波及科学本身,但最深远的代价由社会承担——治愈手段来得更慢,发现被延误,努力被重复。公众需支付两次:一次为研究买单,另一次则体现在那些迟到甚至永不兑现的收益上。出路不在于统一,而在于兼容:“标准不必完全一致,但必须能够互操作。”

企业视角的标准之争

标准之争的另一端,则是使用数据训练模型的AI企业。希尔认为,当前真正能规范获取科研数据的AI公司寥寥无几,普遍做法是“先大规模抓取,来源问题事后再说,甚至根本不管”。

在他看来,AI公司使用他人数据时,应承担与任何研究者相同的责任:明确数据来源、予以署名、尊重使用条款,并对数据提供者表示感谢。数据溯源是可信度的根基,而非礼节性行为。

针对这一现状,希尔提出的解决方案聚焦于数据处理与认证的具体方式。他主张,当一套数据被整理成可直接用于训练的“AI就绪成品包”时,溯源与署名信息应随包保留,而非在打包过程中被剥离。来源清晰的数据本身就是“更好、更可信的数据”。

数据质量的背书者也有讲究。认证要真正有意义,必须确保质量判断与商业动机隔离——交由与结果无利害关系的独立同行评审完成。更关键的是评审形式:与其给出凭印象得来的不透明评分,不如将标准细化为一条条“离散、可核验的陈述”,由评审人逐条勾验。认证记录的不是一个分数,而是一套数据满足的具体条款。

来源:https://www.163.com/dy/article/L1D5QHT20519DDQ2.html
上一篇上海科创科学家攻坚耐热水稻守护粮食安全 下一篇SK海力士美国IPO获逾七倍超额认购
本站内容用于信息整理与展示,如有侵权或内容问题请及时联系处理。

相关推荐

补充同频道和同主题内容,方便继续浏览更多相关内容。

同类最新

继续查看同栏目最近更新的文章。

更多
中科量枢4个月两轮融资,打造量子计算全栈软件生态
科技数码 · 2026-07-20

中科量枢4个月两轮融资,打造量子计算全栈软件生态

中科量枢成立4个月完成两轮融资,团队源自中科院计算所,具备二十余年量子计算理论与算法研究经验。公司打造“天枢”操作系统、“天璇”编译平台及“天玑”算法库,构建全栈式软件生态,与中石油勘探院合作推动量子计算在油气勘探等领域的应用落地。

比亚迪巴西工厂第10万辆新能源车下线员工超5500人
科技数码 · 2026-07-20

比亚迪巴西工厂第10万辆新能源车下线员工超5500人

比亚迪巴西卡马萨里工厂投产满一年,第10万辆新能源汽车下线,车型为海鸥。工厂在岗员工超5500人,总投资约55亿雷亚尔,一期年产能15万辆。计划2026年底实现半数零部件本地化,已获阿根廷和墨西哥10万辆出口订单。

三星晶圆代工部门超八成员工因奖金不满欲离职
科技数码 · 2026-07-20

三星晶圆代工部门超八成员工因奖金不满欲离职

三星电子晶圆代工部门超八成员工因奖金差距巨大有意离职,离职意向是存储器部门的两倍以上。工会警告危机感突出,已着手研讨人才留存对策。

无问芯穹在AGI到来前构建前店后厂一中心
科技数码 · 2026-07-20

无问芯穹在AGI到来前构建前店后厂一中心

无问芯穹发布面向Agent时代的“前店后厂一中心”架构,涵盖算力集散中心、Token工厂和AI生产力商店,旨在解决算力异构与跨域协同难题,提升Token生产效率,并通过智能体蜂群优化基础设施运维,实现用智能进化智能。

WAIC青年论坛把AI圈真话全说了
科技数码 · 2026-07-20

WAIC青年论坛把AI圈真话全说了

在WAIC青年论坛上,多位从业者围绕模型格局、垂直AI、Agent确定性、具身智能机会、运动健康垂类模型、数据重要性及14岁AI原生思考等话题展开讨论,直言行业正从炫技转向较真付费与落地。