游乐游手机版
首页/AI热点日报/热点详情

AI最被低估的生意一年暴涨百倍现已爆发

类型:热点整理2026-07-24
AI训练数据,或许是这轮AI浪潮中最被低估的生意。 不久前,Menlo Ventures合伙人Deedy在X上发布了一张AI训练数据公司全景图。 图中一共收录了28家创业公司,合计年收入约85亿美元,总估值接近1000亿美元。仅从收入规模看,训练数据可能已经成为继AI算力和大模型之后,AI产业第三大

AI训练数据,或许是这轮AI浪潮中最被低估的生意。

不久前,Menlo Ventures合伙人Deedy在X上发布了一张AI训练数据公司全景图。

图中一共收录了28家创业公司,合计年收入约85亿美元,总估值接近1000亿美元。仅从收入规模看,训练数据可能已经成为继AI算力和大模型之后,AI产业第三大的细分赛道。

更值得关注的是,它仍在高速增长。

2025年9月,Mercor的年化收入约为5亿美元;2026年2月突破10亿美元;到6月,已经超过20亿美元。九个月时间,收入增长了三倍,规模变成原来的四倍。

Handshake的增长更是让人咂舌。它原本是一家经营了12年的大学生招聘平台,直到2025年初才切入AI训练数据业务。刚起步时,这项业务的年化收入只有500万到1000万美元;2026年1月,已经增长至5.5亿美元;到4月,第三方机构Sacra估算,其年化毛收入已经接近11亿美元。一年时间,Handshake的收入翻了整整100倍。

更重要的是,这还是一个高度集中的赛道。Scale AI、Surge AI、Mercor和Handshake四家公司,拿走了全行业超过四分之三的收入。

短短一年时间,AI训练数据不仅长出了一个近百亿美元的市场,还迅速诞生了数家十亿美元收入规模的公司。

那么,AI数据公司为什么会在今年突然爆发?这篇文章就来聊聊这门被长期低估的生意。

为什么数据公司开始集体印钞?

数据公司赚钱越来越多的核心原因在于,数据在模型训练中的角色彻底变了,从一次性投入的原材料,转变为持续消耗的燃料。

在大模型发展的早期,数据采购是项目制的。实验室在训练开始前备好数据集,跑完一轮训练,下一次采购要等到下一代模型立项,中间往往隔着一年半载。这决定了数据公司的收入是脉冲式的——有订单时忙一阵,交付完就进入空窗。

模型迭代节奏的加快,改变了这个模式。2022年底ChatGPT上线,四个月后,OpenAI发布GPT-4。此后,GPT-4到GPT-4o间隔了13个月。到了2026年,GPT-5.4在3月推出,GPT-5.5在4月跟进,间隔只剩一个月。Anthropic的节奏更快,5月底发布Opus 4.8后,仅过了11天,又在6月9日推出旗舰模型Claude Fable 5。

迭代越快,实验室发现的能力缺口就越多,对“新增的、针对性的、高价值数据”的需求自然也就越频繁。数据采购从一年几次的项目,变成了随时发起的日常动作。供给端也随之调整,Scale AI的交付模式已经从按月打包,升级为API按需交付——客户发起标注任务,最快一小时就能拿到生产级的标签数据。

除了需求频次上升,单位需求的数据体量也在同步膨胀,因为模型要学的任务变复杂了。代码智能体是最直观的例子。早期模型练代码,学习范围相当有限:行业基准SWE-bench Verified只覆盖12个Python仓库,模型翻来覆去学的是十几个项目的代码风格。2025年9月发布的SWE-bench Pro,把范围扩张到41个仓库、4种编程语言——模型要理解的问题域,从“一种语言、十几个项目”变成了“四种语言、四十多个项目”。

比覆盖面扩张更关键的,是单条数据的信息密度。SWE-bench Verified的任务平均只需修改11行代码,而Pro的任务平均要修改107行、跨越4个文件。一条训练样本也不仅仅是“改几行代码”,而是一整套包含需求理解、多文件定位、跨文件修改、测试验证的完整数据包——单条样本的容量,从几百个token涨到了几万个token。

采购频次更高,场景更多,每个场景的单条数据更重。三个因素叠加,训练数据的总需求量被推高了一个数量级。

除了数量的增长,数据的价格也水涨船高。最早的数据标注是按件计酬,比如NLP基础文本标注,一条大约0.02美元。但到了专家标注时代,计价单位变成了时薪——Scale AI的STEM专家时薪30到50美元,通才15到30美元;Mercor的STEM专家时薪甚至达到90到110美元。供给侧的人从众包工人换成了博士和执业律师,成本上升自然推动价格上涨。

但仅靠人力涨价,撑不起这个行业的毛利率。更深层的变化是,数据公司与模型研发的结合更加紧密。以Scale AI为例,它会先帮助客户评测模型,判断模型在哪些任务上表现较差,再针对这些能力缺口设计训练任务,组织专业人员生产数据,最后重新评测,验证模型能力是否得到提升。也就是说,AI数据公司从简单的劳动力外包,转向开始承担部分模型研发、评测和工程服务的工作。

数据公司赚的也不再是标注的人工费,而是深度参与模型研发所产生的服务溢价。利润率的变化反映了这一点。Mercor的毛利率从早期的约27%提升到目前的35%到40%,Scale AI长期保持在50%以上,而传统人力外包公司的毛利率普遍只有15%到20%。

当数据直接决定模型的能力上限,它的定价权自然水涨船高。而整个行业的天花板,也随之被彻底打开。这才是AI训练数据公司开始集体“印钞”的真正原因。

AI数据的两个趋势:真实工作流数据和RL环境

除了赚钱越来越多,AI数据行业也在发生新的变化。

第一个变化,是真实工作流数据正在取代人工标注数据,成为新的稀缺品。业内把训练数据分为两类:人工设计任务、由专家完成的,是Type 2;从真实业务中直接捕获的,是Type 1。过去行业的主流供给是Type 2,因为它可控、可规模化。但随着模型能力增强,Type 1数据的边际收益正在快速上升:模型已经学会了“做题”,现在需要学习真实世界里的工作是怎么完成的。

代码领域已经验证了这一点。大模型之所以在代码能力上进步最快,一个重要原因是GitHub是全球最大的Type 1数据宝库。一条commit记录串起了问题描述、修改方案、代码评审和测试结果,完整保留了一个问题从出现到解决的全链路。其他领域缺的不是需求,而是像GitHub这样现成的数据源。

于是,供给端开始主动制造Type 1数据源。四巨头中,Handshake走得最激进:2026年初,它与OpenAI达成合作,组织数千名自由职业者上传真实的日常工作成果,从原生的Word文档、PPT、Excel表格到代码仓库。今年4月,它进一步启动“雇主数据计划”,直接付费从企业采购真实运营数据。

不断扩大的市场也在催生新玩家。Protege、Sunset、SF Data等公司陆续冒头,核心业务只有一件事:帮企业把内部的工作流数据,加工成模型可训练的格式。Protege是其中的代表,这家2024年成立的公司聚焦医疗数据,这是一个需求旺盛但供给极难打通的领域。受合规和内控约束,医疗数据的传统采购流程通常需要数月甚至一年以上。Protege把交付周期压缩到了30天,靠的是把采购流程中最耗时的环节全部前置。

具体来说,Protege的做法分三步:第一步是提前聚合,单一数据源凑不齐数百万份影像,Protege预先对接了上百家数据合作伙伴,所有数据源在入库前就完成了AI训练适用性预审,砍掉了传统采购中“先找数据、再谈合规、再谈价格”的反复拉扯。第二步是精筛,AI公司要的是有诊断价值的“阳性发现”(即异常病例),Protege的数据实验室开发了定制化筛选技术,只保留高价值的阳性样本。第三步是合规打包,所有数据源被纳入单一许可协议,客户签一份合同就能合法使用来自几十个数据源的数据;数据全部完成去标识化处理,全程符合HIPAA要求,同时通过收入分成机制让数据持有方持续获益,既保证了供给的连续性,也让授权结构可以重复使用。

Protege做的事,本质上就是给AI实验室当“数据买手”。当模型训练从“喂课本”变成“喂真实世界的工作记录”,这种连接数据持有方和模型厂商的中间层,就成了绕不开的基础设施。

第二个变化,是RL环境正在取代静态数据集,成为实验室的采购重点。RL环境即强化学习环境,一个可控、可交互的模拟世界。如果说静态数据集是课本和标准答案,RL环境就是给AI搭建的训练场:模型在其中自主探索、反复试错,做对了获得奖励,做错了受到惩罚,直到练出稳定的任务执行能力。这个变化背后,是AI正在从“对话时代”进入“智能体时代”——模型的核心能力要求,从回答问题变成了完成任务。而完成任务的能力,靠静态数据教不会,只能在环境里练出来。

围绕这个新需求,市场目前有两种玩法。一种是模型厂商自建:OpenAI训练ChatGPT Agent所用的“UI Gym”浏览器环境,据SemiAnalysis估算,单个网站环境的搭建成本约2万美元,而OpenAI已经采购了数百个网站用于训练。Anthropic内部则讨论过,一年在RL环境上的投入可能超过10亿美元。另一种是外包给数据公司,Mercor今年7月收购软件仿真公司Deeptune,看中的正是这块业务——Deeptune复刻了Excel、Salesforce、Slack、Zendesk等上班族日常使用的办公软件,做成高度仿真的沙盒环境。据公司透露,Mercor计划在2026年9月前,将RL环境业务的ARR提升至千万美元级别。

头部玩家开始分化

底层逻辑在变,四家头部公司的路线选择也随之分化。它们切入市场的资源禀赋不同,走的路各异,但方向一致:都在从“数据供应商”向价值链更深处迁移。

Scale在向下游走,目标是成为“政企AI总包商”。这家2016年成立的公司是行业里资历最深的玩家,如今已不满足于数据生意本身,而是基于数据集优势,为政府和大型企业客户开发内部AI应用。这块企业级应用业务的年化收入已达2亿美元,CEO预计18个月内将反超传统数据标注,成为公司最大的收入来源。

Surge在向上走,做高端精品。这家2020年成立的公司只有110人,未拿过一分钱外部融资,却做出了12亿美元营收。它坚决不碰众包,只做高难度的RLHF(基于人类反馈的强化学习)和安全评估,客户名单上只有五家顶级实验室:OpenAI、Google、Microsoft、Meta和Anthropic。

Mercor在横向扩张专家网络。它是四家中最年轻的,2023年才成立,但增长最快——估值从2025年10月的100亿美元,几个月内翻倍至200亿美元。它构建了一张覆盖全球的专家网络:招募博士、律师、银&行从业者、科学家和程序员制作专业训练数据,每天向3万名外包人员支付的报酬超过400万美元。收购Deeptune进军RL环境,则是它在专家网络之外压下的第二注。

Handshake做的是管道生意。12年大学生招聘业务,让它左手握着1800万求职者,右手连着970家财富500强企业。Handshake更愿意充当数据管道:一边组织职场人上传原生的Word、Excel和代码,一边付费从企业采购真实运营数据,转手供给AI实验室。它是四家中唯一一个几乎不生产数据、只搬运数据的玩家——而在Type 1数据成为稀缺品的当下,掌握供给两端的管道,可能恰恰是最稀缺的位置。

把四条路线放在一起看,这个行业的演化方向已经清晰:单纯的数据标注正在贬值,被压缩为整个价值链中利润最薄的一环,所有人都在往价值链更深处迁移。上一代互联网巨头的能力边界,很大程度上由它们掌握的数据决定。这一轮AI竞赛中,同样的逻辑正在重演——只是这一次,数据不再是巨头的副产品,而是一门独立的、正在奔向千亿美元的生意。

来源:https://36kr.com/p/3909541708584073

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。