游乐游手机版
首页/AI热点日报/热点详情

真实工作流正成为下一代训练数据的关键

类型:热点整理2026-07-23
真实工作流数据正成为模型训练新需求,数据公司与RLaaS公司分别服务模型实验室和企业。数据市场随模型能力瓶颈变化,Type1真实数据优于Type2构造数据,RL环境趋向复杂化,企业自训模型仍处早期。

近期在与多家AI实验室及数据公司的交流中,一个显著趋势逐渐清晰:真实世界数据(real-world data)——即企业在实际工作流程中产生的数据——正成为模型训练的新需求。相较于已被大量挖掘的互联网公开数据,这一领域宛如一座待开采的富矿,先行者才刚刚开始布局。

这个市场有趣之处在于,数据和利用数据的能力分别集中在两端:模型公司通常拥有丰富的机器学习工程资源(MLE-rich),但缺乏高质量数据(data-poor);而企业则恰恰相反,数据充足但机器学习工程能力薄弱(data-rich, MLE-poor)。在此趋势下,市场上涌现出两类公司,它们构成了这一市场的两个侧面:

Human data company(人类数据公司):为模型实验室服务,提供所需数据。

RLaaS (RL-as-a-service) 公司:服务于企业,将企业自身的业务流程转化为可训练的模型环境。其本质是提供外包MLE咨询、Agent系统搭建以及Post-training服务。

本文整理了近期关于该数据赛道的20条阅读笔记与交流心得,内容主要来自一线从业者的实践观察与复盘。具体参考文献附于文末,便于读者进一步深入探索。

01. 数据市场:一场逐浪而动的生意

数据市场就像一场冲浪运动,需求长期存在,但每当模型能力达到新的瓶颈,“最有价值的数据”便会切换类型与形态。因此,整个数据市场的参与者都在紧随模型训练范式的迭代而不断调整方向。

过去几年中,每一轮新兴数据需求都催生了一批新的赢家。Scale AI精准抓住了自动驾驶和早期大语言模型(LLM)的数据标注机遇;Mercor、Surge AI和Handshake则赶上了专家数据的浪潮;当训练重心进一步转向真实工作流时,Protege、Sunset、SF Data等新公司纷纷登场。与此同时,老牌玩家也在紧跟前沿实验室的需求调整策略——Mercor和Handshake近期开始讲述企业数据的故事,为下一波浪潮提前布局。

最新一波浪潮聚焦于真实世界数据(Real-world Data)。近年来,前沿实验室的预算重点从专家标注转向了强化学习环境(RL environments),如今又开始重视真实世界数据。核心原因在于,长周期任务(Long Horizon)是模型进步的关键主线。模型处理任务的单位正从单次代码修改,逐步扩展到一个文件、一个代码库,最终甚至是一个完整项目。任务越长,人工搭建环境的难度就越大。真实项目中充斥着历史状态、工具依赖、组织规则和意外分支,这些细节很难由专家在沙盒中凭空编造出来。

从这个视角来看,数据和RL市场远未达到饱和。尽管淘金热快速升温,但整体上供给仍未能跟上需求。大量真实的白领工作、企业流程和专业知识,至今尚未被转化为模型可学习的数据,或可供反复训练的环境。未来将涌现出更多专注于“数据生产”和“环境生产”的企业,甚至可能出现新型中间层公司(如企业数据中介、专家网络),从而形成一条更加成熟、分工更为细化的供应链。

02. 如何成功运营一家数据公司

根据数据来源,当前市场上的数据可划分为两大类型:

Type 1:从真实工作过程中捕获的数据。这类数据类似于“工作过程录像”,包括会话回放(Session replay)、屏幕操作记录、公司内部协作日志等。最佳的Type 1数据不仅记录动作,还能还原动作背后的意图。例如,GitHub就是典型的Type 1数据源:提交信息(Commit message)、问题(Issue)和工单(Ticket)解决过程串联在一起,几乎完整保留了一个问题从出现到解决的完整脉络——一个人想要解决什么、尝试了哪些修改、为何这样修改,以及最终是否被接受。

Type 2:人为构造的数据。这正是目前绝大多数人类数据公司(Human data company)所从事的业务:寻找领域专家→人工设计任务→让专家在预设环境中完成工作→收集结果→再加工成模型可训练的格式。

Type 2数据非常适合用于预训练或早期能力爬坡,但随着模型开始处理更长的链路和更高经济价值的任务,Type 1数据的重要性将日益凸显。然而,纯粹的Type 1数据难以获取,现实中更可行的方案是先实现Type 1.5的中间形态,即让Type 2数据更接近Type 1。这通常包括:长期绑定少数高质量专家,并让他们理解基本的奖励塑造(reward shaping)和模型训练逻辑;重新设计激励机制——人类往往比模型更擅长奖励黑客(reward hacking),因此需要防止标注员随意标注数据;设计多层质量检查(QA),让运营团队QA外包人员,机器学习工程师QA运营团队,最终交付前所有人都从不同维度进行审查,并将成熟的检查方法逐步工程化,包括异常检测、贡献者行为分析,以及利用实际训练效果反向验证数据质量。

在设计训练数据时,真正关键的是“爬坡能力”(hillclimbability)。许多公司设计任务的逻辑是:只要能做出一个当前模型无法完成的任务,就能证明这里存在机会。但问题在于,设计一个让前沿模型做不出来的任务并不困难,难的是让任务恰好落在模型的能力边界上,使其既有挑战性,又能够通过训练逐步提升。可以设想两种情景:pass@1 = 0%,pass@32 = 30%——即模型单次尝试无法成功,但在允许独立探索32次后,有30%的概率成功,说明模型已经偶尔触及成功路径,只是还不稳定,这样的任务正好卡在模型能力边界,具有很高的训练价值。而pass@1 = 0%,pass@256 = 0%——即使尝试256次也无一成功,说明任务远超模型当前能力,或者任务本身过于冷门,这通常不是一个好的训练基准。

纵观当前的数据市场,存在以下四类问题:

• 数据失真:Type 2数据常常被包装成源自真实工作的Type 1数据。

• 评估失真:数据公司会设计一些不够贴近真实工作场景的评估(eval),当当前最先进(SOTA)模型已经能够开箱即用完成某些评估时,供应商还会刻意增加难度,制造“模型还有很大提升空间”的假象。尤其当研究员或采购方本身并非该领域专家时,这一策略往往奏效。

• 质量检查无法规模化:许多公司将质量检查(QA)视为运营问题,通过增加人力和多层人工审核来解决。但QA本质上应是工程问题——依靠自动化质检、数据追溯、环境生成和评测系统,将质量稳定地嵌入生产流程。如果工程团队始终忙于一次性客户定制,长期将难以构建真正可扩展的数据能力。

• 需求传递失真:研究人员(Researcher)自身有时也未必能清晰传达数据需求,或做好质量检查工作。但如果模型实验室在内部单独设立一个数据采购团队,又会在研究人员与外部供应商之间增加一层沟通,导致信息传递进一步磨损。这也是为什么不少实验室仍将数据采购预算直接交给研究人员的原因。

一个数据供应商能否赢得模型实验室的信任,通常取决于以下三种能力:

• Data taste(数据品味):即是否真正理解优质数据的样子,也就是把握数据质量的能力。

• Research taste(研究品味):能够准确判断模型当前卡在哪个环节,并知道针对该问题需要寻找何种类型的数据。

• Scalability(可扩展性):是否能够在规模扩大后,依然保持相同的质量水平。这一点很容易被忽视,因为许多公司在演示阶段会聘请最优秀的专家,由创始人亲自监督项目,再加上大量人工质量检查,因此小规模交付看起来非常出色。但这并不意味着它们能够将同样的质量复制到10倍、100倍的规模。

随着旧金山小圈子中“售卖RL环境/数据”的淘金热不断升温,越来越多的创业者涌入这一市场,但模型实验室的研究人员已经对这些公司的推销感到厌倦。如今,要想真正获得研究员的信任,需要切实证明上述三种能力,具体方式包括:发布基准测试(Benchmark)和技术文章;用自己的数据训练模型,展示实际提升效果;提供可审计的数据溯源(Data lineage),说明数据来源、清洗过程、专家资质及质量检查机制。

此外,还可以通过招聘结构粗略判断公司的DNA:偏向Type 2的公司通常更注重项目管理和运营,会频繁招聘专项项目负责人(SPL,Special Project Leads),本质上是在不断接订单、扩大团队、进行定制化交付。而真正想向Type 1靠拢的公司,几乎只招聘“技术人员(members of technical staff)”,重点聚焦于数据工程、环境工程和质量检查自动化。前者是在“卖人力”,后者是在“建工厂”。随着数据价值不断向Type 1迁移,Type 2的窗口期可能仅剩两年。

03. 强化学习(RL)的持续进化

RL环境究竟是什么呢?可以将其理解为一个软件环境,模型能够进入其中、调用工具、完成任务、接受检查并获得奖励。以销售运营Agent为例,它的环境可能包含:模拟的Salesforce、邮箱、客户数据库、产品文档、审批系统等。假如交给Agent一个任务:找出过去三个月内流失风险最高的20个客户,并为每个客户准备个性化的续约邮件。为了完成任务,模型需要执行以下步骤:查询数据→理解客户历史→判断流失风险→调用CRM→撰写邮件→生成报价→提交审批。而环境则会根据一组预设规则进行评分:是否正确找到了客户?风险判断是否合理?邮件是否符合要求?报价是否合适?是否在规定时间内完成?

一个明显的趋势是,Agent的环境和任务正在变得越来越复杂,主要的变化方向包括以下四个:

• 空间变大:一个Agent不再局限于单个沙盒中完成所有工作,而是能够在多个环境之间穿梭。

• 工具变活:未来Agent可能会直接调用一些输出结果不确定的工具,例如环境中的“搜索工具”可能不再是传统的搜索API,而是另一个SOTA模型,因此Agent还需要学会控制参数、判断结果并进行交叉验证。

• 组织变复杂:复杂任务将由一个Agent拆解并分配给多个子Agent(Sub-agent),再统一汇总结果。此时,奖励(Reward)不仅要衡量任务是否完成,还要考虑成本和延迟(Latency)。同样的结果,40分钟完成与3分钟完成,其商业价值天差地别。

• 任务边界上移:随着模型能力增强,任务的拆分方式也会发生变化。原本需要拆解为20步训练的任务,可能只需一步就能确定性地完成。因此,RL环境的训练目标也会不断上移,从训练模型执行单个动作,到完成一个子流程,再到规划和编排一整套工作流。

那么,什么样的RL数据最适合模型学习?Jason Wei曾提出一个“验证者定律”(Verifier's Law):训练AI解决某个任务的容易程度,与该任务的可验证性成正比。最终,任何可以被衡量的东西都可以被优化。这种可验证性主要包含以下7个维度:

这里需要额外强调一点:RL的关键不仅在于“结果是否可验证”,还在于“环境能否反复重置”,以便模型获得足够多的练习。编程(Coding)特别适合强化学习,不仅因为其拥有清晰的奖励信号(Reward signal),更因为整个环境极易复制、并行化和重置。一个代码仓库可以复制成上万个容器,模型可以不断修改代码、运行测试、失败后重来。即使每次学习效率很低,也可以依靠海量尝试堆出能力。但真实世界没有这么多存档点。例如,“在亚马逊上成功购买一件商品”固然可以验证,但很难让模型同时复制出一万个真实的亚马逊,在每个副本中下单、付款、重新开始。即使人工仿制一个电商网站,也需要维护库存、支付、账户、物流等大量细节。进入真实世界则更加困难——创业、管理、投资、法律、销售等活动都有结果,但很难开出上万个平行世界让模型反复尝试。这些反馈缓慢、因果关系模糊,而且每次机会都不可重复。

因此,未来AI要真正进入真实世界,不能永远依赖暴力刷题(大量重复尝试),它必须提高样本效率(Sample efficiency),从少量、不可重复、反馈模糊的经历中,快速提取可迁移的规律。这仍然是人类相对于模型最明显的优势之一。

目前,业界对于如何提高样本效率有几种不同的构想:

思路1:OPSD(在线策略自蒸馏,On-policy Self-distillation)。这可以理解为一种“经验压缩”机制。假设一个模型已经与用户一起工作了一周。到了第七天,它的记忆里会逐渐形成对这个组织的理解:它知道用户反复纠正过哪些问题,哪些方法已经尝试过但效果不佳。此时的模型就像一位熟悉公司内部情况的老员工。接下来,可以让这个“老员工模型”充当教师(Teacher),指导一个没有看过完整历史记录的基础模型(Student)。学生不需要记住过去一周发生的每个细节,而是要学会教师最终形成的判断方式:哪些信息更重要、何时应该追问,以及什么情况下可以直接行动。

这与直接将聊天记录用于监督微调(SFT)不同。普通SFT很容易让模型学习如何复述转录文本,包括其中无关紧要的细节,而OPSD旨在蒸馏出经历之后形成的策略(Policy)。它的另一个优势在于,监督信号不必只来自最终的成功或失败。即使一个项目最终需要几个月才能知道结果,带有完整上下文(Context)的教师也可以在过程中的每一个决策点给出更好的行动示范。因此,稀疏的现实反馈可以被转化为相对密集的训练信号。

思路2:梦境模拟(Dreaming)。如果说OPSD是向内压缩经验,那么Dreaming就是向外展开经验。模型在完成一天的工作后,不仅仅简单总结发生了什么,而是基于已有经历建立一个内部的世界模型(World model),并在其中进行大量模拟。例如,模型白天只经历了一次客户谈判。到了晚上,它可以继续推演:客户提出不同反对意见时该如何应对、如果换一种定价策略会怎样、如果换一种沟通方式,结果会不会更好。然后,模型在这些自己生成的模拟世界里反复练习,并更新自己的权重。这与人类的学习方式非常相似——人并非只有在真实事件发生时才能学习,我们会复盘、想象其他可能性。一场重要对话可能只持续了十分钟,但之后几小时的反思会让其产生远超十分钟的信息量。

一个较为接近的例子是,在DeepMind发布AlphaZero几年后,一组研究人员训练出了名为EfficientZero的模型。假设EfficientZero和一个人类都只有2小时可以与一个从未见过的游戏模拟器互动,最终EfficientZero很可能会战胜这个人类新手。因为EfficientZero在真实游戏中每走一步,都会在自己的内部模型里模拟数十局游戏。表面上,它与真实环境只交互了少量次数,但在内部,它实际上已经进行了大量练习。如果模型能在泛化环境中做到这一点,那么这可能在预训练(Pretraining)、强化学习(RL)和推理时计算(Inference-time compute)之后,形成一条新的扩展路径,也可以称为测试时训练(Test-time training)。

04. 企业需要自训练模型吗?

如果工作流正在变成训练数据,企业是否也应该考虑自行进行后训练(Post-train)模型?硅谷对此的讨论日益增多,但目前来看,这个市场仍处于相当早期的阶段。企业自行后训练模型,主要出于以下两方面的原因:

• 通用模型不理解企业的独特偏好。典型的如客服场景,通用模型被训练得友好、顺从,但企业并不希望模型对退款请求有求必应,因此Sierra、Decagon等客服公司是最先开始自研模型的企业。

• 成本考虑。Cursor是一个典型例子。Claude Code、Codex等产品都在大量补贴自己的模型,如果Cursor一直按外部API价格购买模型,那么每增长一个用户,就要向竞争对手支付一笔过路费,使其能够降价补贴自家产品。因此,Cursor必须自研模型,将能力达到前沿模型的80-90%,而价格仅为其1/5到1/10,这样用户体感上才能具有竞争力。今年,硅谷一些垂直AI公司,如Harvey等,也开始沿着类似路径进行尝试。今年上半年,企业AI用量呈指数级增长,但受算力限制,Token成本居高不下,导致明显的毛利压力。因此,这些公司首先在探索更优的模型路由(Model routing),其次则开始考虑自行后训练模型。

企业应该如何判断自己是否该尝试后训练(Post-training)?自行后训练模型本质上是用资本支出(Capex)替换运营支出(Opex),即用一次性训练成本替代长期重复的推理开销。这笔账能否算得过来,大致取决于四个乘数:数据独特性 × 评估清晰度 × 任务频率 × 单次改善价值。其中任何一个乘数接近零,这笔投资都很难成立:数据越独特,通用模型越难直接学会;评估越清晰,训练越容易稳定优化;任务发生得越频繁,训练成本越容易被摊薄;每次能力提升带来的价值越高,后训练的ROI也越大。一个典型案例是DoorDash的菜单录入。每年超过10万家商户入驻DoorDash,他们会上传菜单图片,系统需要提取其中的信息,并按照DoorDash的内部规则将其转换为电子菜单。通用模型虽然能识别菜单,但不知道DoorDash内部关于商品、修改项(Modifier)、附加项(Add-on)等细节的具体规则。因此,DoorDash与外部RLaaS供应商合作,利用内部数据自行强化学习了一个能理解自身业务标准的小模型。

应用公司自行后训练模型有哪些优势?首先,应用公司最重要的资产在于,它占据了真实用户的工作流入口,天然能够获取高质量、完整的Agentic轨迹数据(Agentic trajectory data)。这类数据在外部市场上价格昂贵,高质量轨迹的单条报价可达上千美元。其次,企业任务的范围通常非常狭窄,既不需要关注跨领域的泛化能力,也不需要关心其他产品环境的泛化能力,因此可以以极高的资本效率进行专项强化学习。例如,Cursor至今的一大优势在于,OpenAI、Anthropic实际上不敢直接进行过多的编程RL,因为模型还需要处理PPT、Chat等其他任务,如果过度进行编程RL,其他能力就容易退化,而Cursor则没有这个顾虑。

除了Cursor之外,其他通用领域的Agentic数据能否用于训练模型?事实上,编程之外的Agentic轨迹数据反而非常稀缺和珍贵。即使没有编程那样清晰的硬奖励(Hard reward),也可以通过多种方式进行训练。例如,用户行为本身就包含大量隐性的偏好数据,可以被整理成直接偏好优化(DPO)等训练方法所需的偏好对(Preference pair):成功完成 vs 失败;用户接受结果 vs 拒绝结果;少量修改 vs 大幅重写;被下载 vs 未被使用;低Token、低延迟的实现路径 vs 高成本路径。

Reference

To Build an RL Envs and Human Data Startup | Sean Cai
https://seanzcai.substack.com/p/to-build-an-rl-envs-and-human-data

The next big breakthrough will be AIs learning on the job | Dwarkesh Patel
https://www.dwarkesh.com/p/the-next-paradigm

Stanford MS&E 435: Economics of the AI Supercycle, Enterprise Internal Knowledge | Yash Patil
https://www.youtube.com/watch?v=LRGX-gTegVA

来源:https://www.bestblogs.dev/article/2ef49f9c25?utm_source=rss&utm_medium=feed&utm_campaign=resources&entry=rss_article_item

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。