游乐游手机版
首页/AI教程/文章详情

美团开源LoHoSearch:用知识图谱校准AI能力认知的下一代搜索智能体评测基准

时间:2026-07-24 16:46
基于包含762万实体的维基知识图谱,LoHoSearch自动化生成544道高难度搜索题目,覆盖11个领域。通过双维度控制搜索空间与结构复杂度,最强模型GPT-5 5准确率仅34 74%,远低于现有基准,为搜索智能体能力评估提供了更具区分度的新标尺。
过去一年,搜索智能体的能力提升速度确实令人瞩目。在BrowseComp等评测基准中,顶尖模型的准确率从最初的约30%迅速攀升至90%以上。然而,一旦基准迅速饱和,其用于区分模型能力的衡量标准也随之失效。 问题究竟出在哪里?BrowseComp的题目全部依赖人工设计,这本身就存在一个固有局限:标注者只能基于自身已知的实体和关系来构思题目,无法站在全局知识网络的视角判断——哪些条件真正难以检索?哪些约束的候选空间足够大?正是这种“视角盲区”,促使我们开始探索另一种可能性:能否让机器自主生成题目? 美团LongCat团队在最新论文中提出的LoHoSearch基准,正是将这一可能性变为现实。

LoHoSearch 的核心“硬核”看点

  • 知识图谱自动化构造。以覆盖762万维基百科实体的知识图谱为基础自动生成题目,替代人工出题。基准包含544道经过人工核验的题目,覆盖11个领域。
  • 双维度难度控制。在生成过程中系统性地控制搜索空间与结构复杂度,构建出难度显著高于现有基准的挑战性问题。
  • 当前模型性能表现。已评测模型中,GPT-5.5准确率为34.74%;现有上下文管理策略在LoHoSearch上提升幅度为6.8%,低于在BrowseComp上的14.03%。

01 设计原理:让机器出题,需要几步?

机器出题的前提是让机器拥有“全局视野”。整个构建流程可拆分为四个环节:建图 → 控制难度 → 质量把关 → 数据概览。下面逐一展开。

1.1 建图:搭建知识图谱,让机器获得全局视野

LoHoSearch的第一步,是从完整的英文维基百科出发,构建一张大规模知识图谱:
  • 762万个实体(每个维基页面作为一个实体节点)
  • 2.65亿条有向边(页面正文中指向其他维基页面的超链接)
  • 每个实体的类型取自其Wikidata P31类别,实体热度通过入度来衡量
这张图谱为后续在全局视角下挑选“难题”奠定了坚实基础。 有了图谱之后,下一个问题是:什么样的题目才算“难”?LoHoSearch从两个维度来定义难度。

1.2 控制难度:搜索空间和结构复杂度两个维度

决定搜索难度的核心有两个维度,而它们恰恰是人工出题最难把控的:
  • 搜索空间:满足某一条件的候选实体有多少。候选越多,排除成本越高。
  • 结构复杂度:需要同时满足多少条件才能锁定答案。条件越多、咬合越紧,求解链条越长。
针对这两个维度,LoHoSearch设计了两种子图结构:
  • 树结构主要通过放大“搜索空间”来制造难度。
  • 图结构则在巨大搜索空间之上,通过引入环形依赖和交叉约束,进一步叠加了“结构复杂度”。

1.3 质量把关:从生成到验证,层层把关

子图采样完成后,还需要转换为可读的自然语言题目。整个转换与验证流程分为三层:
  • 题目生成:从子图抽取维基描述,改写为自然语言问题。
  • 自动验证:检查问题是否完整覆盖子图关系,并由搜索智能体验证标准答案满足所有条件。
  • 筛选与复核:排除多答案题和易答题,再由人工审核。
经过三层筛选,自动化流程的整体质量表现如下:75.5%的题目直接通过人工复核,22.3%经标注员微调后接受,仅有2.2%因严重问题被丢弃。

1.4 数据概览:544道题目,11个主题领域

LoHoSearch最终收录544道经过人工核验的题目。对比树结构和图结构可以看出,图结构子图明显更稠密——节点更多、边数接近前者的两倍,这正对应其更高的结构复杂度。题目内容覆盖音乐、地理与地点、影视、体育等11个主题领域。 最强模型GPT-5.5准确率仅34.74%,DeepSeek-V4-Pro、Claude-Opus-4.6和Kimi-K2.6集中在15.53%–15.99%,其余模型均低于14%。这与它们在BrowseComp上80%以上的表现形成鲜明对照——LoHoSearch对当前最先进搜索智能体构成了实质性挑战。

洞察一:解一道题,平均工具调用从35次增至61次

使用DeepSeek-V4-Flash作为探针对比两个基准:同一模型在BrowseComp上准确率58.84%,在LoHoSearch上仅10.02%。 解一道LoHoSearch题目,平均工具调用次数从35次增至61次(+74%),中位数从26次升至59次。图结构题目准确率仅8.01%,远低于树结构的11.89%,印证了结构复杂度是独立于搜索空间之外的额外难度来源。

洞察二:重复采样收益可观,但天花板依然很低

对DeepSeek-V4-Flash采样16个独立回答,结果如图5所示。 pass@N从N=1的9.3%升至N=16的38.3%,重复采样收益可观,但38.3%仍处于低位。尝试16次仍有六成以上题目无法攻克。三种聚合策略中best-of-N表现最优(24.6%),远低于pass@16上界,说明模型在答案置信度校准上存在明显不足。

洞察三:现有的上下文管理策略,在这里已失真

以标准ReAct为基线,测试Summary和Discard-all两种策略,并加入Verify模块。 表现最佳的组合(Discard-all + Verify)将成绩从10.02%提至16.82%,绝对提升仅6.8个百分点,而同一套策略在BrowseComp上可带来14个百分点的增益。收益收窄的原因在于LoHoSearch需要更长的推理链,简单的轨迹压缩或重启无法解决长程搜索中的信息丢失问题——这使其成为下一代上下文管理技术更有价值的试验场。

洞察四:知识图谱是系统化构造高难度题目不可或缺的基础

对比两个基准中“隐藏实体”的特征可以发现:
  • 其一,BrowseComp的隐藏实体流行度明显更高,人工出题难以精确控制实体知名度,导致实体偏易。
  • 其二,即便将流行度控制在同一水平,LoHoSearch的关系搜索空间仍显著更大,实体推断难度远高于BrowseComp。
这说明人工构建存在系统性局限,知识图谱是系统化构造高难度题目不可或缺的基础。

02 总结:为下一代智能搜索提供新标尺

LoHoSearch的价值体现在三项具体贡献上:
  • 基于知识图谱的自动化构造流程。以覆盖762万实体的知识图谱为基础自动生成题目,系统控制搜索空间与结构复杂度,突破人工出题的难度上限。
  • 更具区分度的评测标准。最强模型GPT-5.5准确率仅34.74%,正确轨迹所需工具调用次数是BrowseComp的1.7倍。LoHoSearch为搜索智能体建立了更具区分度的评测标尺。
  • 面向上下文管理研究的挑战性平台。最优策略仅带来6.8%的提升,远低于其在BrowseComp上14.03%的增益,表明LoHoSearch可成为推动下一代上下文管理技术研究的理想试验场。
LoHoSearch已全面开源,欢迎各大模型前来接受“长程搜索”大考。

开源链接

  • Paper: arxiv.org/abs/2606.12…
  • HuggingFace: huggingface.co/datasets/me…
来源:https://juejin.cn/post/7665647348635779118
上一篇图的最短路径迪杰斯特拉算法原理实现详解 下一篇年图工程指南中文完整版
本站内容用于信息整理与展示,如有侵权或内容问题请及时联系处理。

相关推荐

补充同频道和同主题内容,方便继续浏览更多相关内容。

同类最新

继续查看同栏目最近更新的文章。

更多
TalkVisions实时视频翻译应用,消除语言障碍
AI教程 · 2026-07-25

TalkVisions实时视频翻译应用,消除语言障碍

TalkVisions是一款实时视频翻译应用,能将视频中的口语实时转录为文本并翻译成用户所选语言,以字幕形式叠加在画面上,支持多语言、低延迟,还可保存录制视频,有效消除跨语言沟通障碍。

AI驱动的日历管理工具Ipso
AI教程 · 2026-07-25

AI驱动的日历管理工具Ipso

IpsoAI是一款专为专业人士及助手打造的AI日历管理工具,能够自动协调多方日程、智能草拟邮件,并通过快速安排会议、提供智能建议及自动化工作流程,显著减少琐碎操作,帮助用户高效管理时间、提升工作效率。

Spectate企业级专业高效监控与事故管理一体化平台
AI教程 · 2026-07-25

Spectate企业级专业高效监控与事故管理一体化平台

Spectate是一款高效监控和事故管理工具,能在30秒内检测故障并推送告警。它支持Slack、PagerDuty等主流集成,提供自定义状态页面和全球性能监控。系统自动更新状态并推送修复建议,帮助团队减少沟通成本,快速解决问题。

阿里云通义千问2.5大模型发布 多项能力赶超GPT-4
AI教程 · 2026-07-25

阿里云通义千问2.5大模型发布 多项能力赶超GPT-4

通义千问2 5大模型发布,多项能力宣称赶超GPT-4,中文语境下文本理解、生成、知识问答等表现优异。相比2 1版本,理解提升9%、逻辑推理提升16%、指令遵循提升19%。开源1100亿参数模型超越Llama-3-70B,获评开源最强。已服务超9万家企业,与小米、微博等达成合作。

万知个人AI工作站:一站式智能阅读创作分享平台
AI教程 · 2026-07-25

万知个人AI工作站:一站式智能阅读创作分享平台

万知是集成多种AI能力的个人工作站,支持自然语言交互、文档快速阅读与摘要生成、PPT自动设计与优化,覆盖学术研究、商务报告、写作辅助及日常问答等场景,全方位提升工作效率。