游乐游手机版
首页/AI热点日报/热点详情

Meta超级智能实验室首篇论文重新定义RAG

类型:热点整理2026-07-24
Meta超级智能实验室提出REFRAG框架,通过压缩-感知-扩展机制优化RAG解码,将首字生成速度提升最高30倍,等效扩大上下文窗口16倍,同时保持准确率不变。该框架显著降低了长文本推理延迟,实现了高效解码。

Meta超级智能实验室发布了一项重磅研究,提出了REFRAG框架,能够将RAG的首字生成速度提升最高30倍,有效解决了长上下文处理效率的难题。接下来,我们将逐步剖析该框架的核心原理、技术细节及实际测试效果。

一、RAG技术当前面临的挑战:长上下文处理效率低下与计算浪费

首先,我们需要回顾RAG(检索增强生成)的基本工作流程:

  • 当大型语言模型(LLM)需要回答一个依赖精确背景知识的问题时,仅依靠内部参数容易产生事实错误或信息滞后。
  • RAG通过外部知识库(如企业文档、专业数据库)检索,将与问题最相关的信息提取出来,作为上下文与问题一同输入LLM。
  • LLM参考这些精确资料后,就能生成更加可靠、具有时效性的答案。

然而,这种模式在工程实现上带来了一个核心问题:推理效率与信息量的权衡

  • 当检索到的参考资料数量庞大(即“长上下文”)时,LLM的处理负担显著增加。
  • 模型处理上下文的计算复杂度通常与上下文长度的平方成正比,导致生成第一个字的延迟(TTFT,Time-to-First-Token)明显上升,直接影响实时交互体验。
  • 处理长上下文还意味着更高的计算和内存开销,给规模化部署带来挑战。

研究人员的实验发现:在RAG中,LLM处理多个检索文档时,其计算过程存在大量冗余。模型内部的注意力机制在处理这些文档时呈现出一种“块对角”(block-diagonal)的稀疏模式——注意力主要集中在单个文档内部,以及各文档与用户问题之间的关联上,而不同文档片段之间的交叉注意力得分通常很低。然而标准的Transformer架构并不区分关联性强弱,而是对所有词元进行全局注意力计算,造成了不必要的资源浪费。

来源:https://www.53ai.com/news/RAG/2025091807869.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。