游乐游手机版
首页/AI热点日报/热点详情

大语言模型究竟能否真正进行推理与规划

类型:热点整理2026-07-21
【导读】前段时间,LeCun转发了2篇长文,集中讨论了LLM的规划推理能力和涌现能力的来源。作者认为,LLM本身不具有规划推理能力,而涌现出来的能力,根源应该都是上下文学习的结果。大语言模型到底会不会推理?涌现出来的各种能力,背后到底是什么机制在驱动?这个问题最近在圈内又炸开了锅。LeCun在自己推

【导读】前段时间,LeCun转发了2篇长文,集中讨论了LLM的规划推理能力和涌现能力的来源。作者认为,LLM本身不具有规划推理能力,而涌现出来的能力,根源应该都是上下文学习的结果。

大语言模型到底会不会推理?涌现出来的各种能力,背后到底是什么机制在驱动?

这个问题最近在圈内又炸开了锅。LeCun在自己推特上连续转了好几篇文章,态度很明确:

「自回归LLM无法制定计划(并且无法真正推理)」。

而另一篇转发的论文,则直接冲着“涌现能力”这个热门概念去了。

原推的原话是这么说的:不管大伙儿信不信涌现能力,这篇文章都值得认真读一读——

「经过了超过1000次的系列实验,我们证明了大语言模型所谓的涌现能力,其实仅仅是上下文学习而已。」

LLM真的能推理和规划吗?

Subbarao Kambhampat教授的文章一上来就挑明了:网上那些说LLM能推理、能规划的说法,本身就不太站得住脚。当然,学界也确实在严肃地研究这个问题。

至少从他之前针对GPT-3的研究来看,要说大语言模型能推理和规划,问题很大。

https://arxiv.org/pdf/2206.10498.pdf

他们提出了一个可扩展的评估框架,专门测试LLM推理行动和变化的能力——这可是人类智力的核心方面。测试用例比之前任何一个基准都复杂,每个用例都会评估关于操作和变化的推理的不同侧面。结果呢?GPT-3 (da vinci)、Instruct-GPT-3 (text-da vinci-002) 和 BLOOM (176B) 在这个推理任务上,表现相当惨淡。

到了GPT-4出来,教授的团队立刻跟进,想看看新一代模型有没有什么新进展。

https://arxiv.org/pdf/2206.10498.pdf

他们用了类似国际规划竞赛的方式,生成了一组实例,分两种模式来评估LLM:自主模式和启发式模式。结果很清楚——LLM自主生成可执行计划的能力相当有限,GPT-4在各领域的平均成功率只有大约12%。

但启发式模式倒是给了些希望。在这种模式下,LLM生成的计划可以改进底层规划器的搜索过程;而且,外部验证者还能对生成的计划提供反馈,反过来提示LLM生成更好的计划。

文章配了一张很有意思的图,告诉读者:LLM表现出来的所谓推理能力,主要原因其实是任务太简单,而且问问题的人事先就知道答案。

真正到了竞赛级别的规划和推理任务,比如国际规划大赛(IPC)里的“积木世界”(Blocks World)问题,LLM的表现就原形毕露了。

初步结果表明,从GPT-3到GPT3.5再到GPT-4,生成的平面图精度确实有一定提升——GPT-4在Blocks World里达到了30%的经验精度(empirical accuracy),但其他领域仍然很低。

教授的团队推测:LLM在这些规划任务上的表现,可能只是因为它在大规模训练中“记住”了规划内容。于是他们做了个巧妙的实验——把规划问题里动作和对象的名称全部混淆掉,阻断模型去检索自己记住的“规划内容”。

结果,GPT-4的表现断崖式下跌。

面对LLM不能直接自主规划的局限,团队试了两种改进思路。

第一种是微调模型。但微调之后,模型的规划能力并没有提升。团队认为,就算微调后能力提高了,本质上也只是把规划任务变成了基于内存的检索,根本证明不了LLM有自主规划能力。

第二种方法是不断提示LLM,让它改进初始计划。但这种方法,尤其是让模型自己生成改进意见的提示,本质上是让模型瞎猜,或者由提示者来判断哪些猜测更好——跟模型自身计划能力的提升无关。

那些顶会上声称展示了LLM规划能力的论文,到底问题出在哪里?

持怀疑态度的读者马上就会问:那些在高调会议上声称LLM有规划能力的论文,究竟是怎么回事?

要分析这些说法,得先弄清楚:解决规划任务需要两个能力——

1. 拥有必要的规划领域知识;
2. 能够把这些知识组装成可执行的计划,处理子目标之间的交互和资源分配。

第一个叫知识获取,第二个才叫推理/计划。

很多声称LLM有规划能力的论文,仔细一看,其实混淆了“从LLM中提取的可执行计划”和“一般的规划知识”。如果研究人员找的只是抽象的计划,比如“婚礼计划”这种不需要实际执行的模板,那就很容易跟完整的可执行计划混为一谈,根本没法准确评估LLM的计划能力。

教授的团队仔细审了几篇这类论文后发现:LLM要么是在那些子目标交互可以被忽略的领域里做计划(也就是只规划了些没意义或不重要的任务),要么就是把推理问题丢给了循环过程中的人类——通过反复提示和“纠正”来生成计划。

如果没有这些假设或人工缓冲,LLM给出的计划在外行看来可能挺合理,但一旦执行起来,就会冒出一堆问题。

一个典型的例子:旅行计划类书籍大量涌现,内容基本由LLM自动生成。读者买回去以为是可执行的计划,结果执行起来各种失望。

LLM并不存在计划和推理能力

总而言之,教授的态度很明确:他读过、验证过、自己做过的所有工作,没有任何一件事能让他信服LLM真的会像我们通常理解的那样进行推理或规划。

那些认为LLM有推理/规划能力的研究,本质上都是在利用大规模训练带来的“近似检索”——有时候会被误认为是推理。

不过,LLM确实很擅长为任何任务“产生想法”,包括那些需要推理的任务,这可以有效地用来辅助推理/计划。换句话说,LLM已经拥有足够惊人的近似检索能力,我们完全可以充分利用这一点,但没必要硬把虚假的推理/计划能力安在它头上。

如果对这个话题感兴趣,还可以去翻翻教授的那场演讲,干货不少。

涌现能力?不存在!

https://arxiv.org/pdf/2309.01809.pdf

另一篇关于涌现能力的文章,把矛头指向了上下文学习。

简单说,研究人员发现:LLM在执行一些没有明确训练、且需要复杂推理能力的任务时,表现异常出色。这个发现对NLP的研究方向产生了重大影响,随着模型越做越大,应用场景也越来越普遍。

但问题在于:评估LLM能力的时候,很多因素会干扰结果,造成混淆。

比如,有些能力可能是prompt技术带来的。上下文学习(in-context learning)和指令跟随(instruction following)都是典型例子。这些情况会随着模型规模的增大而增多。

于是,本文的研究团队全面考察了这些能力,并考虑到了各种可能影响评估的偏差因素。

他们选了一个包含18个模型的大家族,参数范围从6000万到1750亿,测试了22项任务。在超过1000次实验后,拿出了充足的证据:所谓的涌现能力,主要就是上下文学习带来的。

而且,他们没有找到任何能证明LLM有推理能力的证据。

实验方法

具体来看,研究人员逐一研究了以下几个问题:

  • 为了消除上下文学习和指令微调可能带来的影响,他们选择了零样本条件,并且使用了非指令微调的模型。
  • 探究上下文学习和指令微调之间的相互作用:到底是不是推理能力解释了指令微调模型的一些额外能力?为此,他们比较了没有指令微调的模型,和经过不同程度指令微调的不同规模模型的表现。
  • 通过人工检查,评估LLM的功能性语言能力、形式语言能力,以及能否记住任务。

为了尽可能减少误导因素,团队精心设计了实验结构。特别注意的是:不能触发模型的上下文学习能力。因为指令微调会把训练模型的指令转化为示例(exemplar),这本身就可能引起上下文学习。所以他们使用了非指令微调的模型来规避这个问题。

下图是实验选用的模型。

研究人员对来自四个模型系列(GPT、T5、Falcon、LLaMA)的不同规模模型进行了评估。选GPT和LLaMA,是因为之前有文献发现它们存在涌现能力;Falcon则处于LLM排行榜前列。选T5,因为它是一个编码器-解码器模型,其指令微调版本(Flan)是用大量指令微调数据集训练出来的。

在GPT系列里,他们用了GPT-2和GPT-3的指令微调和非指令微调版本;T5系列则包括T5和它的指令微调版FLAN-T5。同样,Falcon也用了两种版本,而LLaMA因为本身没有指令微调版本,就只能用原版。

另外还评估了GPT-3 text-da vinci-003(InstructGPT)。InstructGPT先用注释者写的prompt和期望行为微调,再用收集的排序数据通过RLHF进一步微调。这种训练方法确实能提高模型性能。

值得注意的是,选用的T5模型特意低于1B参数量,因为这么小的模型中还没观察到涌现能力,正好作为对照。

选用的GPT-3 da vinci(非指令微调)、GPT-3 text-da vinci-001(指令微调)和GPT-3 text-da vinci-003(InstructGPT)都是之前观察到涌现能力的模型。其他如PaLM、Chinchilla、Gopher、LaMDA也有涌现能力,但因为没公开API,就没评估。

上图是实验中使用的任务清单,标注了每个任务之前是否被识别为涌现,以及任务所需能力的性质分类。分类通过人工检查数据,并用Mahowald等人的框架确定。每个任务评估了50个示例的记忆情况,假定任务数据没有泄露。

上表详细列出了整体实验设置:测试的模型、任务、评估设置。由于目标是评估不受其他因素影响的涌现能力,团队对T5和GPT系列中的12个模型,在所有22个任务上都进行了评估。

每个任务都用了相同的prompt策略:封闭式和封闭式对抗。考虑到反应的可变性,每个实验重复三次,计算平均结果。所有实验在英伟达A100 GPU上进行,温度0.01,批量大小16。

对于GPT-3 175B参数模型(da vinci、text-da vinci-001、text-da vinci-003),使用官方API评估一次,温度设为0,保证结果可重复,降低幻觉风险。

此外,还从LLaMA和Falcon系列选了6个模型,在22个任务中的4个上评估。选任务时,确保其中两个是先前被确定为涌现的任务,另两个是非涌现任务。同样使用封闭式和对抗式prompt,每个实验运行三次。

针对某些任务选项数量不固定的情况,通过多次随机选择问题选项并求平均分数,构建了每项任务的基线。

实验结果

第一个研究问题:在不存在上下文学习(包括指令微调)的情况下,哪些能力是真正的涌现能力?

团队首先展示了零样本条件下,未经指令微调的175B参数GPT-3的表现。

上图是在封闭式prompt策略下,GPT系列模型在各种任务上的表现。研究团队使用了BERTScore精确度 (BSA) 和匹配精确度 (EMA),在少样本 (FS)、零样本 (ZS) 设置下对指令调整(IT)和非指令调整(non-IT)模型进行了评估。

蓝色表示指令微调模型在少样本条件下的结果,与之前文献报道的结果相当。黄色表示相同设置下用BSA测得的性能。红色表示非指令微调模型在零样本条件下的BSA结果——换句话说,就是排除了上下文学习影响后的结果。

上图为Falcon(上部)和LLaMA(下部)模型在非指令调整零样本条件下,对所选任务子集的性能表现。结果很清楚:没有上下文学习的时候,模型始终缺乏所谓的涌现能力。

上图为非指令微调的GPT模型在对抗环境下的表现。在这些任务子集上,GPT的表现高于随机基线。但其中一些任务的表现是可预测的,不能算涌现能力。在其余任务中,与随机基线相比,成绩提升幅度也相对较小。

第二个问题:经过指令微调的模型是否表现出了推理能力?还是说指令微调只是让模型更高效地进行上下文学习?

需要提醒的是:指令微调的本质是在指令和范例之间建立映射关系——这正是上下文学习的特征。所以这个过程很可能确实触发了上下文学习。

研究人员的假设是:指令微调让LLM获得了将指令转化为范例的能力,而范例随后调动了它们的上下文学习能力。

下图是T5系列模型在不同环境下的性能表现。

来源:https://m.elecfans.com/article/2327913.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。