游乐游手机版
首页/AI热点日报/热点详情

阿里开源通义DeepResearch 科研智能体能力首次追平OpenAI

类型:热点整理2026-07-24
阿里开源TongyiDeepResearch-30B-A3B,首次使开源模型在科研智能体基准测试中追平OpenAI。该模型采用MoE架构与128K上下文,具备长期规划、迭代检索和证据跟踪能力。通过全自动合成数据与On-policy强化学习训练,在HLE、BrowseComp等测试中表现优异,并开源权重、推理脚本与评测工具。
# 阿里开源 Tongyi DeepResearch:一份面向科研人员的全面解读与实践指南

科研智能体(Research Agent)正从概念走向现实。2025年9月,阿里巴巴通义实验室发布的 Tongyi DeepResearch-30B-A3B,首次让开源模型的科研智能体能力,在权威基准测试中追平了 OpenAI 的同类产品。无论你是专注于大模型智能体化的开发者,还是寻求科研任务自动化的研究者,这份教程都将为你提供一份详尽的技术解读与实操指南。

一、为什么 DeepResearch 模型至关重要?

在科研和信息检索任务中,传统聊天模型常常面临三个核心痛点:

  • 容易“编故事”:面对复杂学术问题,缺乏可靠证据,产生“幻觉”。
  • 长链路任务执行不完整:跨文献追溯、逐步构建论证等任务常常被截断。
  • 易受信息噪声干扰:在庞大的上下文中间出现逻辑漂移。

DeepResearch 模型的设计初衷,正是为了解决这些“科研痛点”。它不仅仅是一个问答助手,更像一位研究人员,具备以下核心能力:

  1. 长期规划:能够制定多步执行计划。
  2. 迭代检索与交叉验证:从多个来源检索信息并进行比对。
  3. 证据跟踪与低幻觉率:每一步推理都基于可追溯的证据。
  4. 多源信息综合:擅长整合超长上下文中的分散信息。

因此,Tongyi DeepResearch 的出现,被业内视为 “开源科研智能体时代的开始”

小提示:如果你的研究场景需要处理大量文献、进行跨域推理,传统对话模型容易“跑偏”,那么 DeepResearch 模型就是你需要的工具。

二、性能表现:开源模型首次对标 OpenAI

阿里官方公布的基准测试结果,证明了其卓越的性能:

  • Humanity’s Last Exam (HLE)32.9
  • BrowseComp43.4(英文)/ 46.7(中文)
  • xbench-DeepSearch75

这些测试被业内视为科研智能体的“综合考核”,主要评估模型在复杂信息检索、多步推理和跨源综合中的表现。这意味着,Tongyi DeepResearch 已经站在了 OpenAI DeepResearch 的同一水平线上,并且在开源社区中“一骑绝尘”。

常见问题:这些基准测试到底在测什么?

  • HLE:模拟人类考试,评估模型在极端复杂、需要深层次推理的知识问答中的表现。
  • BrowseComp:模拟网络浏览和文档检索任务,评估模型在海量信息中寻找答案和交叉验证的能力。
  • xbench-DeepSearch:专门针对深度搜索与多步推理的评估。

简单来说,它们衡量的是模型“像研究员一样工作”的能力,而非简单的文本生成。

三、创新架构:MoE 设计 + 超长上下文处理能力

Tongyi DeepResearch 能取得如此成绩,其创新的架构是核心原因。

3.1 Mixture-of-Experts(MoE)架构

  • 总参数:约 305 亿 参数。
  • 激活参数:每个 Token 仅激活 30~33 亿 参数。
  • 效果:用“小模型成本”获得了“大模型能力”,延续自阿里在 Qwen3-MoE 中的技术积累。

3.2 超长上下文:128K Token

  • 容量:足以处理多篇学术论文、完整研究报告,甚至是跨领域文献集合。
  • 优势:在“长链路推理”上天然占优,能处理需要综合大量信息的复杂任务。

3.3 双推理模式

  • ReAct 模式:原生的推理与工具调用模式,用于评估模型的内生能力。
  • Hea vy Mode(IterResearch):通过迭代重构上下文来减少噪声,专门应对超复杂的科研任务。

小提示:MoE 架构的精髓在于“以小博大”。如果你的计算资源有限,但又希望获得接近顶尖模型的推理能力,Tongyi DeepResearch 是一个理想的选择。你可以根据任务复杂度切换推理模式,实现效率与性能的平衡。

四、训练方法:全自动合成数据 + On-policy 强化学习

Tongyi DeepResearch 与多数聊天模型不同,它从一开始就被训练为“智能体”。其训练方法包含三个核心阶段:

4.1 自动化数据引擎

阿里搭建了一套完全自动化的数据生成系统:

  • 从知识图谱、文档库、历史工具调用轨迹中构建语料。
  • 自动生成问题与答案对。
  • 合成多步推理和行动轨迹数据。
  • 关键点:不依赖昂贵的商业 API 调用,实现了可扩展的“自我进化循环”。

4.2 冷启动 SFT(监督微调)

  • 通过 ReAct 和 IterResearch 两种格式,生成结构化推理数据。
  • 帮助模型快速掌握工具使用与规划能力。

4.3 On-policy 强化学习(GRPO 算法)

  • GRPO 算法:Group Relative Policy Optimization,基于群体相对优势的优化方式。
  • Token 级策略梯度:实现精细化的学习信号。
  • 负样本过滤:避免训练崩溃或格式坍塌。
  • 高并发沙盒环境:模拟网页搜索、文档查询,保证模型在真实环境中也能稳定学习。
  • 效果:这套 RL 策略显著提高了模型的鲁棒性,解决了以往科研智能体容易“卡死”或“乱跑”的问题。

常见问题:这个训练方法对开发者有什么实际意义?

  • 可复现性:阿里开源了训练数据管线,你可以基于自己的数据集,复现类似的训练过程。
  • 可定制化:你可以在其基础上,添加自己的工具调用和任务规划逻辑,构建垂直领域的科研智能体。
  • 低成本:由于训练数据是自动合成的,显著降低了依赖人工标注的高昂成本。

五、在科研与信息检索中的应用价值

从实验室走向实际应用,Tongyi DeepResearch 能做什么?以下是一些典型的落地场景:

  1. 学术研究助手
    • 自动整理多篇论文的关键结论。
    • 在跨学科主题中寻找共通点。
    • 生成逻辑严谨的研究综述。
  2. 企业文档研究
    • 针对上万页报告、专利、内部文件,快速抽取核心观点。
    • 跨来源验证,避免“只看一家之言”。
  3. 多语言信息获取
    • 在 BrowseComp-ZH 的成绩表明,它在中文语境下同样表现优异,对中国科研人员尤其友好。
  4. Web 调研与商业分析
    • 从公开网页中持续追踪信息,综合成可靠的决策依据。

它的定位并不是“写作助手”,而是更接近一个 “智能研究员”

小提示:在尝试企业级应用时,建议先用一个较小的数据集测试模型的长文本综合能力。例如,你可以输入 5 篇相关论文的摘要,观察它能否提取出共同的研究趋势和矛盾点。

六、为何开源意义重大?

很多人会问:既然 OpenAI 已经有 DeepResearch,为什么还需要阿里的开源版本?

答案很简单:科研需要可验证、可复现、可定制的工具

  • 闭源模型再强,也无法满足企业的合规需求。
  • 大学和研究机构需要对训练数据与方法有掌控。
  • 开源模型能形成“科研共同体”,不断自我进化。

阿里这次不仅开源了权重,还提供了推理脚本、评测工具、数据管线。对于开发者来说,这是一整套 “可落地的科研智能体方案”

七、未来趋势:科研智能体会成为“标配”吗?

Tongyi DeepResearch 的发布,释放了一个清晰信号:科研和信息检索类任务,正在全面智能体化。

未来几年,我们可能会看到以下趋势:

  1. 科研人员人手一个智能体助手
    • 它帮你查文献、对比实验、验证假设。
    • 你只需要做最后的判断与创新。
  2. 企业内部知识库自动化
    • 不再依赖人工整理文档。
    • 智能体可以根据上下文动态生成研究报告。
  3. 跨学科融合加速
    • 智能体能轻松“跳出专业壁垒”,让不同领域知识快速联通。

可以预见,未来科研智能体就像今天的搜索引擎一样,会成为研究与信息工作的标配。

结语

Tongyi DeepResearch 的问世,不只是阿里的一次技术突破,更是 开源社区在科研智能体方向上的里程碑。它证明了:即使面对最复杂的科研任务,开源模型依然有机会追平乃至超越闭源巨头。

对于科研人员、企业研究团队、开发者来说,真正的价值在于——你可以直接下载、运行、改造它,让它成为你自己的“研究助手”。也许,未来的某个科研突破,就会诞生在这样一个开源智能体的辅助下。

来源:https://www.53ai.com/news/OpenSourceLLM/2025092329483.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。