HiRAG 通过层级化知识索引与检索机制,有效克服了传统 RAG 在语义关联和知识连贯性方面的关键难题。以下教程将帮助你系统了解其工作原理、优势与局限,并附上实用技巧与常见问题解答。
一、背景与挑战:现有 RAG 面临的两大核心问题
传统的检索增强生成(RAG)方法虽然能够整合外部知识,但在处理特定领域任务时,存在两个关键缺陷:
- 语义相似实体的结构距离问题:在知识图谱中,语义高度相关的实体(例如“大数据”与“推荐系统”)可能因缺乏直接连接而在图上相距较远,导致检索时无法有效关联它们。
- 局部与全局知识的鸿沟问题:现有方法难以同时兼顾局部细节(比如亚马逊的子公司有哪些)和全局概览(比如亚马逊在云计算领域的整体布局),使得大语言模型生成的回答容易出现前后矛盾或信息遗漏。
为解决这两大瓶颈,HiRAG(Hierarchical Knowledge-based RAG)框架应运而生。它通过整合层级化知识,在索引和检索两个阶段增强语义理解与结构捕捉能力。
二、HiRAG 的核心创新
HiRAG 的主要贡献可以概括为以下两点:
- 识别并针对性解决两大局限:提出层级化索引与检索机制,消除语义相似实体间的结构距离,弥合局部-全局知识鸿沟。
- 两大核心模块:
- 层级化知识索引(HiIndex):构建多层级知识图谱,通过高层摘要实体增强语义相似实体之间的连接。
- 层级化知识检索(HiRetrieval):同时检索局部、全局及桥接三层知识,确保知识连贯完整,提升大语言模型生成质量。

三、核心方法详解
3.1 层级化知识图谱构建(HiIndex)
- 基础图谱 Layer 0:首先从文档中提取实体和关系,形成最基本的三元组(例如:亚马逊 → 子公司 → AWS),构建初始知识图谱。
- 语义聚类:对第 i−1 层实体的嵌入向量进行高斯混合模型(GMM)聚类,将语义相似的实体归为同一簇(例如将“大数据”和“推荐系统”聚类为“数据挖掘”相关簇)。
- 高层摘要实体生成:利用大语言模型为每个聚类生成高层摘要实体(例如“数据挖掘技术”),作为第 i 层的节点,同时建立与下层实体的关联(如“数据挖掘技术 → 包含 → 大数据”)。
- 动态停止机制:计算“聚类稀疏度”(衡量聚类质量的指标)。当新增层级对聚类质量的提升低于阈值(例如 5%)时,停止继续分层,最终形成多层级知识图谱。
- 社区检测:使用 Leiden 算法从层级图谱中划分社区。每个社区包含多层实体,并生成对应的社区语义报告(例如“亚马逊的业务生态”)。
