在RAG(检索增强生成)系统中,检索模块会从知识库中捞出与用户问题最相关的片段,然后将这些片段交给大模型来生成答案。这本是解决大模型“幻觉”和“信息滞后”的利器,但你可能不知道:检索到的片段中,常常混入一些与问题高度相似、却根本不包含答案(甚至包含误导信息)的“杂草”。这些看似无关的片段,会如何影响大模型的输出?今天,我们带你深入解读一篇来自学术界的实验报告《How Easily do Irrelevant Inputs Skew the Responses of Large Language Models?》,看看LLM在面对这些“答案无关片段”时,到底有多容易被带偏。
核心发现:先记住这四大结论
在展开细节之前,我们把最重要的结论先摆出来,方便你快速把握全文脉络:
- 结论一:语义越相关,误导性越强——与常见语义无关的片段相比,LLMs更容易受到高度语义相关的答案无关片段的影响,即那些看起来“很像答案”、实际却不含正确答案的段落。
- 结论二:越多越“晕”——随着答案无关片段数量的增加,LLMs的注意力被分散,识别正确信息的能力明显降低,更倾向于选择错误答案。
- 结论三:问题格式决定抵抗力——LLMs对无关片段的抵抗能力,因问题格式不同而差异巨大:自由式问答 > 是非性问答 > 多项选择式问答(抵抗力依次递减)。
- 结论四:常规“防干扰”手段几乎无效——在系统提示中增加“忽略无关片段”等指令,改善效果很弱;而使用COT(思维链)或ICL(上下文学习)反而导致模型过度思考、识别能力变差。
