先阐述几个核心判断:大语言模型在推理任务上的表现确实令人印象深刻,但动辄千亿参数的黑盒模型,落地门槛实在太高。尤其在处理复杂数学问题时,逻辑链条时常在中途断裂,导致错误答案。传统研究思路几乎只盯着那些最终推理出正确答案的“正样本”来迁移知识,而那些半路夭折、得出错误答案的“负样本”,往往被视为废料,直接丢弃。
有趣的是,在AAAI 2024上,小红书搜索算法团队提出了一种反常识的框架:在蒸馏大模型推理能力的过程中,不仅要关注正样本,还要把负样本的价值彻底榨干。事实证明,这些看似无用的错误推理链,其实蕴藏着宝贵的知识。
这篇论文的核心贡献,在于验证了负样本在大模型蒸馏中的关键作用,并以此构建了一个完整的模型专业化框架。该框架并非单一技巧,而是覆盖从训练到推理全过程的“组合拳”,包含三个精心设计的步骤:负向协助训练(NAT)、负向校准增强(NCE)和动态自洽性(ASC)。一系列广泛的实验足以证明,负向数据在知识蒸馏中的价值绝非可以忽略的“边角料”。
为什么负样本不是“错误答案”,而是“隐藏宝藏”?
思维链(CoT)提示固然赋予了LLM强大的推理能力,但必须承认,这种能力是千亿级参数模型的“专属特权”。高昂的计算成本和推理延迟,决定了它难以大规模落地。那么,能否让小模型通过知识蒸馏的方式,也学会这种复杂的算术推理?
知识蒸馏是一条可行的路径。过去的研究利用LLM的上下文学习能力,生成数学问题的推理路径,再用这些数据进行训练。但问题在于,它们只采用了那些得出正确答案的路径(即正样本),而忽略了那些推理错误但过程依然有价值的负样本。

如何证明负样本的价值?表1展示了一个有趣的现象:我们分别用正样本和负样本训练了两个小模型,然后观察它们在MATH测试集上的表现。猜猜结果如何?这两个模型正确回答的题目,重叠度非常低。这说明什么?说明负样本训练的模型虽然整体准确率不高,但它能解决一些正样本模型完全搞不定的问题。换句话说,负样本里确实包含了正样本所缺乏的知识。
另一个必须考虑的现实问题是成本。OpenAI的token定价是明摆着的,就算强如GPT-4,在MATH数据集上的准确率也低于50%。这意味着,如果只盯着那不到一半的正样本,大量花费token生成的、蕴藏潜在知识的推理路径,就被白白浪费了。与其扔掉,不如思考如何把里面有用的知识提取出来,这才是更明智的做法。
框架全景:如何让负样本从“绊脚石”变为“垫脚石”?
模型专业化通常可分为三步:先用LLM生成的推理链进行知识蒸馏,再用自蒸馏或数据自扩充来强化,最后用自洽性解码策略来提升最终效果。但传统方法在每个环节都对负样本视而不见。
这项工作的创新之处在于,它设计了一套全新的框架,将负样本的价值全方位挖掘出来,贯穿从训练到推理的完整流程:
- 首先是负向协助训练(NAT),设计了一个dual-LoRA结构,一正一负。正向负责学习正确答案的推理逻辑,负向则专注吸收那些出错路径中的知识。通过一种动态集成机制,负向LoRA的知识可以以正向或负向的方式,融入正向LoRA的训练中,效果相当显著。
- 其次是负向校准增强(NCE),在自我增强阶段,不再是一视同仁地重复训练,而是利用负向输出作为基线,精准识别并强化那些决定最终答案的关键推理步骤,让蒸馏过程更有针对性。
- 最后是动态自洽性(ASC)。传统的自洽性方法要么给所有推理路径直接投票,要么按概率加权,选出结果时容易受那些听起来合理但实际有偏差的路径干扰。ASC的思路很直接:在投票前先评估每条推理链的质量,而这个评估模型,正是用正负样本训练出来的。

负向协助训练(NAT)
NAT分两步走。第一步是负向知识吸收,先让一个独立的负LoRA模块,从那些错误的推理链中学习隐含的模式。第二步是动态集成单元,因为无法事先知道负LoRA在哪些问题上表现出色,所以设计了一个校正注意力机制,在正向LoRA的学习过程中,动态地决定是否需要从负LoRA那里引入知识。简单来说,它既能吸取正样本所缺乏的有益知识,又能剔除负样本中可能包含的有害干扰。
负向校准增强(NCE)
NCE的核心目标是在自蒸馏阶段“温故而知新”。它利用NAT训练后的模型生成新的扩充样本,然后通过比较NAT和原始模型在推理链路中的差异(用KL散度来衡量),找出那些包含关键推理步骤的样本。差异越大,说明这一步骤越关键,在自蒸馏时就会赋予它更高的学习权重。这就像是让模型自己找到自己的薄弱环节,然后针对性地去加强。
动态自洽性(ASC)
ASC的改进相当直接。它训练了一个专门的排序模型,根据推理链能否得到正确答案,给每条推理链打出不同的分数。在最终投票时,依据这个分数进行加权,使得那些高质量的正确推理链拥有更大的话语权,从而提升最终答案的可靠性。
实验效果:数据不会说谎
实验在极具挑战性的MATH数据集上进行,同时也在GSM8K、ASDiv、MultiArith和SVAMP等四个数据集上验证了泛化能力。教师模型是GPT-3.5和GPT-4,学生模型是LLaMA-7b。
NAT与NCE的显著提升

结果显示,NAT在所有基线上都取得了显著的提升。相比于直接在原始数据上微调,在两种不同的CoT来源下实现了约75.75%的提升。而同为负样本利用方法的MIX(直接用正负样本混合训练)表现不佳,证明直接混合效果很差,NAT这种精细化的知识集成方式才是正解。

再看NCE,相比标准的知识蒸馏(KD),实现了平均10%的进步;即使在NAT的基础上,也仍有6.5%的提升,实现了模型进一步压缩和性能提升的双赢。
ASC与泛化能力

在解码策略方面,ASC相比于传统自洽性和基于概率加权的自洽性,表现出了更强的优势。它学会了如何更好地聚合不同样本的答案,做出更明智的决策。

在泛化性测试中,该框架也展现了优秀的迁移能力,证明了其在数学推理领域的通用性,绝非仅在单一数据上有效。
总结:这条“逆向思维”的路,走得很值
这项工作的价值在于,它系统性地证明了负样本对于提炼大模型复杂推理能力的关键作用。小红书搜索算法团队提出的NAT、NCE和ASC三大法宝,并非孤立的技巧,而是一个完整的、环环相扣的解决方案,将负向信息从被人嫌弃的“错误答案”,转变成了模型专业化过程中宝贵的“训练素材”和“校准基准”。大量实验表明,从生成质量不佳的负样本中提取知识,远比直接丢弃要有效得多。对于那些寻求将强大模型的能力轻量化部署的团队来说,这个思路提供了非常有价值的参考。
作者:
李易为: 现博士就读于北京理工大学,小红书社区搜索实习生,在AAAI、ACL、EMNLP、NAACL、NeurIPS、KBS等顶级会议/期刊上发表数篇论文,主要研究方向为大语言模型蒸馏与推理、开放域对话生成等。
袁沛文: 现博士就读于北京理工大学,小红书社区搜索实习生,在NeurIPS、AAAI等发表多篇一作论文,曾获DSTC11 Track 4第二名。主要研究方向为大语言模型推理与评测。
冯少雄: 负责小红书社区搜索向量召回。在AAAI、EMNLP、ACL、NAACL、KBS等顶级会议/期刊上发表数篇论文。
道玄(潘博远): 小红书交易搜索负责人。在NeurIPS、ICML、ACL等顶级会议上发表数篇一作论文,在斯坦福机器阅读竞赛SQuAD排行榜上获得第二名,在斯坦福自然语言推理排行榜上获得第一名。
曾书(曾书书): 小红书社区搜索语义理解与召回方向负责人。硕士毕业于清华大学电子系,在互联网领域先后从事自然语言处理、推荐、搜索等相关方向的算法工作。
