游乐游手机版
首页/AI热点日报/热点详情

Deep Research开源产品本地化部署详细步骤实战指南

类型:热点整理2026-07-19
DeepResearch技术将报告生成从数天缩短至十几分钟,开源方案助力本地化部署以满足数据隐私需求。GPTResearcher因高商业友好度与热度备受关注,通过配置本地模型与API可实现部署,未激活检索时仍可依赖模型知识生成报告。

Deep Research技术让报告生成从数天缩短到十几分钟,开源方案助力企业实现本地化部署。

先说几个核心判断:Deep Research正在重塑研究分析类工作的效率边界。过去需要数天甚至数周才能完成的信息检索、整理、理解、加工和报告撰写,现在借助大模型的Deep Research能力,十几分钟就能拿出一份像样的成果。关键区别在于——系统不再对模型执行时间设限,而是给足十几分钟甚至更长时间,让模型充分搜集信息、反复推敲,最终形成报告。

Deep Research开源产品的本地化部署

Deep Research是什么?

Deep Research技术,说白了就是帮你生成一份详尽的研究报告。以往这类工作需要人花大量时间泡在资料里,检索、阅读、理解、整合、输出,任何一个环节都不能马虎。现在大模型可以接手这条流水线,而且干得还不赖。它会在后台“慢慢”工作,反复搜索、验证、补充,最后交出一份结构完整的报告。

这个过程中,模型不再受到“几秒内必须回复”的限制,而是被允许花上十几分钟甚至更久。时间换质量,这在AI应用里是个很有意思的转向。

使用体验

从实际体验来看,豆包的深入研究功能表现可圈可点。让它生成一份关于Deep Research的研究报告时,它会先跟你确认几个关键细节,然后开启“研究模式”——一边搜集资料,一边分析,还能根据已经掌握的信息动态调整下一步要搜集的内容。最后它会产出两份报告:一份是markdown格式的,另一份是更美观的html格式,都可以直接下载。

这个功能在实际工作中确实能派上用场。尤其是进入一个陌生领域时,它能快速带你入门,省去大量前期调研的时间成本。

至于ChatGPT的Deep Research功能,免费用户每个月可以使用5次。不过实际测试中发现,它并没有真正触发“深度研究”的流程,更像是基于已经掌握的知识来生成报告,和想象中那种主动搜集、动态调整的工作方式还有差距。

相关开源产品

如果工作场景中确实有研究分析的需求,而且需要结合私有化数据,那就得把目光转向开源方案了。毕竟,对数据隐私和安全有要求的场景,本地化部署几乎是唯一的选择。如果只是对完全公开的内容做分析,直接用豆包这类在线服务就足够了。

目前市面上已经有一批成熟的开源项目值得关注:

  • khoj-ai/khoj - 30.5k stars,AGPL-3.0协议,商业不友好
  • assafelovic/gpt-researcher - 22.3k stars,Apache-2.0协议,商业友好
  • dzhng/deep-research - 17k stars,MIT协议,商业友好
  • bytedance/deer-flow - 15.2k stars,MIT协议,商业友好
  • nickscamara/open-deep-research - 5.8k stars
  • jina-ai/node-DeepResearch - 4.6k stars
  • langchain-ai/open_deep_research - 4.3k stars

综合热度和商业友好度来看,GPT Researcher是最值得优先研究的对象。

GPT Researcher的本地化部署

项目的README文件对部署过程做了简要说明,支持多种方式。这里选择基于源码部署,方便修改配置。启动服务后直接在浏览器访问即可。当然,也可以直接用pip安装gpt-researcher当作SDK使用,后续做系统集成的场景下,SDK方式显然更灵活。

要让GPT Researcher跑在本地,核心就是调好两个配置文件。一个是.env文件,用来配置API KEY、API BASE等变量;另一个是default.py文件,用来配置使用的模型、报告语言、本地文档、MCP等内容。

本次部署只给GPT Researcher接上了本地模型,没有激活web检索器、本地文档和MCP部分。以下是配置文件的核心改动:

.env文件内容:

OPENAI_API_KEY=local-llm-key-xxxxxx
OPENAI_API_BASE=https://local-llm-base/v1

default.py文件修改内容:

DEFAULT_CONFIG: BaseConfig = {
    "EMBEDDING": "openai:embedding-model",
    "FAST_LLM": "openai:llm-model",
    "SMART_LLM": "openai:llm-model",
    "STRATEGIC_LLM": "openai:llm-model",
    "LANGUAGE": "chinese",
    "EMBEDDING_KWARGS": {
        'tiktoken_enabled': False,
        'tiktoken_model_name': 'D:/Models/embedding-model'
    },
}

模型字符串分两部分,冒号前面是提供者,冒号后面是模型名称。底层通过langchain连接大模型,不同的provider对应不同的langchain依赖。EMBEDDING_KWARGS的配置是为了让OpenAIEmbeddings模型使用本地的tiktoken model,做这个修改还需要额外安装transformers包。

配置完成后,用README提供的命令启动服务即可。即使没有激活检索功能,系统依然可以生成报告——只不过数据来源完全依赖模型自身知识。

一个小细节:之前一直在琢磨怎么让系统读取.env文件里的配置,后来在main.py里找到了答案——通过这两行代码,默认就将.env文件中的内容加载为环境变量:

from dotenv import load_dotenv  # line 1
...
load_dotenv()  # line 29

这个实现方式简洁高效,算是本地化部署时的一个实用技巧。

来源:https://www.53ai.com/news/OpenSourceLLM/2025072409687.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。