游乐游手机版
首页/AI热点日报/热点详情

基于ICL范式的大语言模型最高置信度预测方案

类型:热点整理2026-07-21
提出上下文采样(ICS)方法,通过优化多个上下文学习提示的结构,使模型输出置信度最高的预测。实验表明,ICS相比传统ICL方法显著提升准确率并降低标准差,不同采样策略与组合数量影响效果,数据多样性策略是关键。

大多数现有的提示工程方法都围绕着同一个问题打转——如何在单个提示里塞进一组最优质的数据样本?但换个思路,如果我们手里不止一个提示,而是多个,结果会怎样?本文提出了一种面向低资源场景的提示工程技术:上下文采样(ICS)。它的核心思路,是通过优化多个上下文学习(ICL)提示输入的结构,让模型最终吐出最有把握的那个预测结果。

介绍

如今,指令微调的大模型,比如 Flan-T5、LLaMA 和 Mistral,在语言理解和生成上已经相当不错。但真要让它们高效地完成一个需要领域知识的任务,问题就没那么简单了。研究人员试过不少办法,其中最出名的就是“少样本上下文学习”(ICL)——往提示里塞几条例子,模型就能举一反三。这个路子确实有效,尤其在它从未见过的任务上边。问题是,ICL 的效果到底受什么影响?例子的数量、顺序、组合方式,这几方面都有人在琢磨,但目前还没有一个公认的最好方案。

这里有一个关键假设:不同的 ICL 样本集,对模型来说意味着不同的“知识”。换句话说,不同样本让模型对同一任务的“解读”是不一样的。这就引出一个直截了当的问题:能不能让模型同时参考多个不同的 ICL 提示,然后从这些预测里挑出最可信的那一个?基于此,我们设计了 ICS 方法。它遵循一个三步流程:采样、增强、验证。整个过程如图1所示。

ICS 策略

假设我们有一个任务指令和一条待研判的数据,输入给指令微调的模型,它会吐出一个结果。这里的例子,作用是双重的:其一,帮模型直接理解任务指令和预期输出是什么;其二,间接地告诉模型“这类问题该从哪个角度入手”。

ICS 的框架如图1所示,具体分三步走:首先,从没打标签的数据池里,采样一批候选样本并获取标注;其次,用不同的 ICL 组合去“增强”这些标签;最后,从众多个候选标签里,验证出置信度最高的那个,作为最终预测。

整套 ICS 方法是模型无关的,说白了就是“即插即用”——你可以轻松换掉采样、增强或验证的算法,不费什么力气。

示例候选集采样

从大量未标注数据里挑出少量作为 ICL 示例,通常有两条路:基于数据多样性,或者基于模型概率。ICS 选的是前者——基于聚类的策略(核心集法)。这一步想做到的是:挑出的样本既能代表未标注数据的大致分布,同时彼此之间足够“不一样”。具体操作上,先用句子编码器算每条数据的相似度(余弦相似度),然后按得分排序,再从排序后的列表里,等间隔地取出 K 个样本,确保这组样本足够多样化。这里要拿捏三个要素:

  • 样本的多样性要充分,能代表底层数据的分布;
  • 置信预测要有一定的鲁棒性;
  • 标注成本要尽可能低。

ICL 组合增强

如图1所示,ICS 要预测同一条数据,会构建出多个不同的 ICL 组合,然后从所有预测结果里挑出最笃定的那个。你猜怎么着?我们不需要穷尽所有组合——那计算量太大了。类比一下就知道:人类投票时,少数几个靠谱的代表就能反映民意。所以 ICS 只选一个“够用”的提示输入数量。我们分别试了随机采样和基于多样性的算法作为基准,研究它们的差异。两种方法都是从候选列表里迭代采样 N 次。多样性策略用的就是前面那套算法。对同一条测试数据,模型会被反复查询 N 次,拿到 N 个预测结果(也就是“弱标签”),最后整理成一个集合。

置信标签验证

拿到了这批弱标签,接下来要做的事就很清楚了——用一个验证算法找出置信度最高的那个标签,作为最终预测。可以想象,ICL 有潜力提供模型自己“信得过的”无标签预测结果,这在资源匮乏的场景下特别有用:专家标注既难搞又贵,但我们可以拿这种自动标注的结果,去迭代地微调模型。

实验

实验设置

实验中选了两个主流的指令微调模型:FLAN-T5-XL 和 Mistral。测试任务选的是三个难度递增的 NLI 任务:eSNLI、Multi-NLI 和 ANLI。LLaMA-2 为什么没上桌?因为在初步实验中它暴露出一个明显的问题——对“中性”这个类别有严重的过拟合倾向。

baseline 用的是最朴素的 ICL。ICS 策略则基于随机采样构建提示输入,然后用多数投票找出最可信的标签。每个提示输入固定放 3 个例子。ICS 有两个控制变量:采样样本池大小 N(N=100、150、200)和增强组合数(M=5、10、15),其中 M=1 就是经典的 ICL baseline。按真实场景,500 个标注算一个还算合理的成本。所有结果取 10 次实验的平均值。

对 LLaMA-2 的初步分析

在 ANLI 上,我们用三种不同的自然语言指令对 LLaMA-2 做了初步测试:

  • 判断假设是“蕴含”“中性”还是“矛盾”;
  • 把一对“前提-假设”分成三类;
  • 预测“前提-假设”之间是蕴含、中性还是矛盾关系。

结果如表2所示。很明显,哪怕换了指令,LLaMA-2 仍然倾向于把结果预测成“中性”,而真实分布是三个类别之间相对均衡的。所以,后续实验去掉了 LLaMA-2。可能的原因之一是:LLaMA-2 在 NLI 这类任务(或共享同一套目标标签的任务)上已经过了拟合。

实验结果

图2展示的是 M=15 时,baseline ICL 与 ICS 在各个模型和数据集上的预测精度。右纵轴的虚线表示标准差变化。可以看到,不管用哪种采样策略(随机或多样性),ICS 都能稳定地提升模型的预测性能——这直接证明了 ICS 这条技术路线是有效的。

此外,不同模型对 ICS 的敏感度差异非常明显。Flan-T5 的精度提升幅度较小,这很可能是它已经在三个 NLI 数据集上“学得太死”了。相比之下,Mistral 的提升非常显著,平均精度提升超过 5%。当 M 超过 10 之后,继续增加组合数量带来的收益就开始递减;标准差方面,M=10 时模型的预测波动降到最低。再看采样池大小 N,一旦超过 100,精度提升就不再明显——可以认为 100 个样本已经足够多样、足够有代表性了。

下面表3和表4分别展示了 FlanT5XL 和 Mistral-7b 的完整评估结果。

消融实验

消融实验选用性能最优的设置:M=15、N=100,模型只用 Mistral-7B。从三个 NLI 数据集中各随机采样 3000 条作为训练集、1000 条作为测试集。我们做了四种组合策略,每种 10 次试验。RD 代表随机策略,DS 代表基于数据相似性的策略。结果如表1所示。

结论很清楚:基于数据多样性的样本候选采样和组合增强策略,确实能有效提升 ICL 的性能。

总结

本文提出的是上下文采样(ICS)——一种基于 ICL 的新范式,核心目标是逼出模型最有把握的预测结果。实验数据摆在那里:相比于传统 ICL 方法,ICS 不仅提升了准确性,还压低了预测的标准差。我们也探讨了不同样本数量和 ICL 组合数的影响,并通过消融实验说明,ICS 里那条简单有效的数据多样性策略,才是整个效果的关键来源。

限制

这篇文章的主线是提出 ICS 并验证它的有效性。不过,虽然我们试了不同的 M 和 N 组合,仍有一些变量值得进一步深挖。比如,虽然任务涵盖了3个不同难度的数据集,但它们全都是 NLI 任务。此外,数据多样性的候选采样和组合增强策略也只做了一个小规模的消融研究。最初实验打算覆盖三个模型,但 LLaMA-2 由于对“中性”类的过度偏好被移除了。其他经过指令微调的大模型,比如 InstructGPT,也还没有在这项工作中涉及——这些都可以是后续研究的方向。

来源:https://m.elecfans.com/article/2321182.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。