高仿真训练环境:AI智能体能力提升的关键基础设施
Bespoke Labs于2026年7月6日宣布,已完成种子轮与A轮合计4000万美元融资。A轮由Wing VC领投,Mayfield、House Fund、dbt Labs首席执行官特里斯坦·汉迪参投,多位来自Anthropic、OpenAI、Meta的天使投资人也共同出资。种子轮则由8VC主导,投资方包括谷歌DeepMind的杰夫·迪恩、DevRev首席执行官迪拉杰·潘迪、Resolve AI首席执行官斯皮罗斯·桑索斯等。
这家团队规模仅约40至48人的AI初创公司,获得了多家头部AI模型厂商资深工程师的个人投资。其核心业务方向,恰好与这些工程师日常推动模型能力增长的路径形成互补:在安全、可控的高仿真环境中,让AI智能体持续试错、发现问题并暴露能力短板。
Bespoke Labs由马赫什·萨西亚穆尔蒂与亚历克斯·迪马基斯于2024年创立,总部位于加州山景城。公司专注于搭建高度仿真的企业数字场景,用于AI智能体训练。相关场景覆盖大型代码库、团队聊天记录、工单、企业邮件、业务运行日志等内容,能够更完整地复刻真实企业的业务流程、协作方式与运行逻辑。
仅靠扩大模型规模,难以突破AI智能体性能瓶颈
当前AI智能体面临的核心挑战在于:如果训练和测试只围绕规整、标准化的基准任务展开,它们就很难真正适应复杂、混乱且跨多日推进的真实业务流程。以处理一份跨三套内部系统、涉及一周聊天记录留存的客户投诉为例,智能体必须在接近真实业务环境的复杂场景中反复演练,而不是仅依赖简洁、标准化的提示词任务。
行业研究数据也进一步印证了这一方向的重要性。METR机构数据显示,过去六年中,AI智能体可完成任务的时长门槛大约每7个月翻一番,而近期分析表明,这一提升速度已加快到每4个月翻倍。仅依赖扩大模型规模,并不足以持续支撑这种性能增长,AI训练环境正在成为限制智能体能力提升的关键瓶颈。
Bespoke Labs联合创始人兼首席执行官马赫什·萨西亚穆尔蒂表示:“前沿AI实验室、各类企业以及所有依赖可靠智能体的机构,都迫切需要高质量的仿真训练环境。这是优化和迭代AI智能体不可或缺的核心基础设施。”
高仿真训练环境的工作原理
高仿真训练环境的构建逻辑,建立在“环境即基础设施”的定位之上。它并不直接提供模型或数据集,而是为AI智能体打造专属的“实训场景”。其核心工作流程通常包括以下几个环节:
- 场景复刻:从大型代码库、团队聊天记录、工单系统、企业邮件、业务运行日志中提取真实数据,构建能够模拟企业真实运行状态的数字孪生环境。
- 任务生成:在该环境中生成跨系统、跨时段的复杂任务,要求智能体综合调用多个内部系统、理解历史上下文,并完成多步骤操作。
- 交互反馈:智能体在仿真环境中执行操作后,系统会提供实时反馈,包括成功、失败、报错信息等,帮助智能体据此调整执行策略。
- 迭代训练:通过持续反复试错,智能体逐步掌握处理长周期、多步骤、复杂业务任务的实际能力。
这种训练方式与传统标准化基准测试的显著区别在于:仿真环境不会预先给出“标准答案”,而是尽可能模拟真实业务中的不确定性、信息缺失、系统差异与流程不一致问题。
差异化定位:AI智能体训练基础设施服务商
Bespoke Labs在这一赛道中采取了明确的差异化策略。尽管许多竞品也在从不同方向切入类似需求,但其业务重心并不相同:
- Scale AI获Meta注资143亿美元,估值接近2900亿美元,核心业务在于数据集标注,而非交互式仿真训练环境。
- AI代码初创公司Poolside完成50亿美元B轮融资,估值300亿美元,主要聚焦代码专用基础大模型。
- Reflection AI拿下1.3亿美元种子轮融资,重点投入自主软件工程智能体研发。
上述企业大多聚焦模型或数据集方向,而Bespoke Labs则以AI基础设施服务商的身份切入市场,不直接与大型厂商竞争自研大模型。这种定位有助于其覆盖更广泛的AI智能体训练与应用场景,而不是被限制在单一技术路线之中。
Wing VC创始合伙人彼得·瓦格纳表示:“前沿AI实验室与原生AI企业正不断突破长周期智能体的能力边界,市场也迫切需要新一代数据与训练底层基础设施来支撑这一发展。”
研究能力与行业影响力
Bespoke Labs同时具备AI初创企业与专业研究实验室的双重属性。团队是业内权威智能体评测基准Terminal-Bench的核心共建方,还联合斯坦福大学、加州大学伯克利分校等高校推出开源推理数据集项目OpenThoughts。这些研究成果,为高仿真训练环境的设计、评估与优化提供了扎实的理论基础和实践参考。
适用场景与边界
高仿真训练环境的核心价值,集中体现在应对长周期、多步骤、跨系统的复杂任务上。其典型适用场景包括:
- 需要跨多个内部系统协同执行的业务流程自动化
- 需要处理历史上下文与长期对话的智能客服系统
- 涉及代码库、工单系统和团队协作工具的软件工程智能体
- 需要适应真实业务复杂性,而非仅面对标准化测试的企业级AI应用
不过,这类方案的有效性仍然存在一定边界。当前行业尚未完全验证,“更优质的训练环境”是否一定能够显著优于“更大规模的大模型”。这一问题的最终答案,将在很大程度上决定Bespoke Labs等AI基础设施企业,能否在下一轮融资周期中持续生存并扩大影响力。
市场前景与风险
全球AI智能体市场规模在2026年达到109亿美元。根据Grand View Research预测,到2033年这一数字将增长至1829亿美元,复合年均增长率高达49.6%。与此同时,Meta也在大规模布局AI基础设施,其中AI数据中心融资规模已创下行业纪录,这表明整个产业链的资本力量,正在持续押注AI智能体相关的全栈技术与底层设施。
对于企业和开发者而言,更现实的问题是评估当前AI智能体在真实业务中的能力瓶颈。如果智能体频繁在跨系统、长周期任务中失败,那么引入高仿真训练环境进行针对性训练和迭代,可能是一条有效路径。但如果业务任务本身较为简单,且流程标准化程度较高,那么未必需要投入这类AI训练基础设施。
