阿里推出的 CoFE-RAG 框架,旨在突破传统 RAG 系统的评估瓶颈,实现从文档解析到答案生成的全链路精准诊断与优化。这份教程将带你深入理解 CoFE-RAG 的核心设计、评估流程、创新点以及实际应用价值,帮助你快速掌握这一前沿技术。
研究背景与动机
检索增强生成(RAG)显著提升了回答的准确性与可靠性,有效缓解了传统生成模型中的“幻觉”问题。然而,现有 RAG 评估方法存在三大核心挑战:
- 数据多样性不足:知识来源和查询类型的多样性不足限制了RAG系统的适用性。
【现有评价方法的外部知识库基本来源于从HTML中抓取的格式良好的纯文本,缺乏数据多样性,难以纳入PDF等复杂文档。此外,这些方法主要侧重于简单的查询】 - 问题定位模糊:多数方法仅评估端到端结果,难以定位RAG流程中具体阶段(如分块、检索、重排序、生成)的问题。
- 检索评估不稳定:依赖“黄金片段”标注,当分块策略变更时需重新标注,成本高昂。
为系统性解决上述问题,本文提出 CoFE-RAG,实现对RAG全流程的可解释、高效、稳定评估。
CoFE-RAG 框架设计
核心思想:多粒度关键词驱动评估
CoFE-RAG 引入 多粒度关键词 替代传统“黄金片段”标注,实现对检索与重排序阶段的免标注评估。
| 粒度 | 定义 | 作用 |
| 粗粒度关键词 | 从查询与上下文中提取的核心主题词(如“智能汽车”) | 初步筛选相关片段 |
| 细粒度关键词 | 每个信息点对应的原文片段列表(如政策目标、时间节点) | 精细评分与验证 |
