游乐游手机版
首页/AI热点日报/热点详情

深度探究编辑多模态大语言模型的可行性

类型:热点整理2026-07-21
多模态大语言模型面临对象幻觉问题。模型编辑技术可在不重训模型前提下精准修正知识。为此构建了专用基准与评估数据集,从可靠性、稳定性、泛化性三维度衡量,并提出视觉编辑与语言编辑两种方式。实验表明,模型编辑在纠正幻觉上优于微调且避免灾难性遗忘。

世界不只是文字构成的——我们每天感知的,实际上是视觉、听觉、触觉等多模态信息的叠加。正是这些信息帮助我们理解环境、做出判断、与周围世界互动。最近,OpenAI开放了ChatGPT的多模态能力,多模态大语言模型再次成为焦点。目前主流的多模态大语言模型框架,大多是把训练好的大语言模型和图像编码器连起来,中间用一个图文特征对齐模块做桥梁,让语言模型能读懂图像特征,进而完成更深层的问答推理。VisualGLM、BLIP 2、MiniGPT-4都是这条路线的代表作。

但一个棘手的问题始终悬在这些模型头上:对象幻觉(Object Hallucination)。即便是质量相当高的InstructBLIP,也会输出不少“胡说八道”的文本。为什么会出现幻觉?原因主要有两个:一是多模态指令微调过程中,模型容易对训练数据里频繁出现或共现的物体产生过度依赖,从而幻想出并不存在的东西;二是部分幻觉来自背后的语言模型,如果LLMs本身就带着错误或谬误知识,多模态模型继承下来,自然也跟着“犯迷糊”。

最近,一种叫作“模型编辑”的新范式提供了解决幻觉问题的新思路。简单来说,模型编辑可以在不重新训练整个模型的前提下,精准修改模型里存储的某些知识,从而省下大量计算资源。但问题在于,现有的模型编辑方法大多只针对单模态——那多模态模型能编辑吗?这正是本文要探究的核心问题。文章构建了一个专门为多模态语言模型知识编辑场景设计的benchmark,为多模态模型编辑定义了评估指标,并构造了配套的数据集。受人类视觉问答中的出错场景启发,文章还提出了编辑多模态语言模型的两种方式。下图展示了多模态模型编辑的整体概念:

MMEdit

指标

多模态模型编辑比单模态要复杂得多——它需要同时考虑多种模态信息。不过出发点是类似的,从单模态的评估框架扩展而来。文章从三个维度来衡量:可靠性(Reliability)、稳定性(Locality)和泛化性(Generality)。

可靠性:模型编辑首先要保证修改后的知识是正确的。所以可靠性衡量的是编辑后模型输出的准确率。多模态场景下亦如此,作者给出了如下定义:

稳定性:稳定性用来判断编辑操作对模型中其他知识的影响有多大。我们希望只改想改的那部分知识,不动其他无关的内容。但多模态模型涉及多个模块(语言模块和视觉模块),因此需要区分编辑到底影响了哪一部分。作者提出了两种稳定性测试:T-Locality(纯语言模型的稳定性)和M-Locality(多模态整体模型的稳定性),定义如下:

泛化性:编辑的效果需要能在一定范围内推广。单模态情况下只考虑同义句式的泛化,但多模态多了一个图像维度。于是作者设计了两类泛化性指标:

数据集

为了支撑上述指标,作者构建了对应的评测数据集。可靠性数据集来自现有多模态大模型表现不佳的任务,涵盖VQA和Image Caption两个方向,分别得到E-VQA和E-IC两个编辑任务数据集。

泛化性数据方面,多模态模型的数据本身也是多模态的,因此需要考虑更多的泛化情况。下面的例子展示了具体形式:

针对文本数据,作者使用ChatGLM构造VQA任务的文本泛化集——设计合适的prompt让对话模型生成语义相近的句子。Image Caption任务的数据相对简单,生成效果不理想,所以人工构建了几十条相似文本,再通过随机替换的方式扩充。对于图像数据,作者利用COCO数据集中的图片描述,调用Stable Diffusion 2.1生成相似场景的图片。构造流程如下:

稳定性数据集则分为Text Stability和Vision Stability两类。文本部分沿用MEND中的NQ数据集,多模态部分使用了OK-VQA这个较为简单的问答数据集。最终数据集统计如下:

多模态模型编辑

如何具体操作多模态模型编辑?文章类比人类视觉问答中的常见出错场景来设计实验。以VQA任务为例,人类在答题时可能犯两类错误:

  • 视觉出错:可能在图片识别阶段就看错了。比如色盲患者无法正确分辨颜色,导致颜色相关的问题答错。针对这一点,作者提出了Vision Edit,专门编辑多模态模型的视觉模块。
  • 知识出错:可能准确识别了图片里的关键特征,但本身的知识库里缺少对应的概念,结果“指鹿为马”。这对应的方案是Language Edit——因为多模态模型的知识主体来自LLMs,编辑语言模型部分即可纠正这类错误。

多模态模型编辑的整体流程如下图所示:

实验

实验部分展示了当前主流编辑方法在多模态大语言模型上的表现,并与传统的微调方法进行了对比。结果如下:

可以看到,微调的效果普遍一般,而且容易对模型中的其他知识造成灾难性遗忘。相比之下,模型编辑在可靠性上表现不错,同时稳定性也保持得较好,不会导致过拟合或灾难性遗忘。

此外,作者还展示了编辑不同模块区域的效果差异:

差别相当大——编辑视觉模块要困难得多。作者认为这可能与模型架构有关:编辑语言模型部分可以直接影响输出,而编辑视觉部分只能影响输入。更何况模型的大部分知识都存储在LLMs中,因此只动视觉模块效果自然不佳。最后贴几组具体的编辑案例:

总结

多模态模型是当前非常重要的研究方向,而幻觉问题正是它走向实用化的关键瓶颈。模型编辑技术为解决幻觉提供了一条不错的路径,但在多模态场景下仍有很多坑要填:如何更有效地实现不同模态间的协同编辑?如何处理OOD数据的编辑?又如何在多模态模型上做到连续编辑?这些都值得进一步探索。

来源:https://m.elecfans.com/article/2307654.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。