万物皆可RAG:深入解读50种多模态组合应用与未来发展
来自华中科技大学、复旦大学、中国电信以及美国伊利诺伊大学芝加哥分校的研究团队联合发布了一篇系统性综述,全面覆盖了几乎所有模态组合作为输入与输出的MM-RAG研究框架,深入勾勒了这一广阔研究与应用领域的技术全景。
免费影视、动漫、音乐、游戏、小说资源长期稳定更新! 👉 点此立即查看 👈
以ChatGPT、Deepseek、千问、豆包、Gemini等为代表的大语言模型应用普遍采用联网检索增强生成(RAG)技术来响应用户提问。随着多模态大模型(MLLMs)的快速发展,作为主流技术之一的RAG正迅速向多模态方向演进,形成了新兴的多模态检索增强生成(MM-RAG)领域。目前ChatGPT、千问、豆包、Gemini等平台均已支持用户同时输入文字、图片等多种模态内容。
然而当前MM-RAG的研究与应用尚处于起步阶段,现有研究及综述主要聚焦于文本和图像等有限模态组合。虽然音频、视频、代码、表格、知识图谱、3D对象等多种模态的组合均可用于检索增强生成,但相关探索仍十分有限。这使得研究者和开发者难以全面把握MM-RAG的技术脉络和广阔的应用空间。
这支跨校研究团队发表的综述首次系统性地涵盖了所有可能的输入输出模态组合,为全面理解这一快速发展的领域提供了重要参考。

论文标题:A Comprehensive Survey on Multimodal RAG: All Combinations of Modalities as Input and Output
TechRxiv:https://doi.org/10.36227/techrxiv.176341513.38473003/v2
GitHub项目主页:https://github.com/INTREBID/Awesome-MM-RAG
该论文最大的亮点在于其前所未有的覆盖广度:
它首次涵盖了所有可能的模态组合作为输入和输出,包括文本、图像、音频、视频、代码、表格、知识图谱、3D对象等。
通过这种全景式梳理,作者们首次揭示了MM-RAG领域中庞大的潜在输入输出模态组合空间,并指出了其中尚未被充分探索的研究空白(如表1所示)。在作者提出的54种潜在组合中,目前仅有18种组合存在已有研究(表1中绿色对勾的格子),许多极具应用价值的组合——例如“文本+视频作为输入,生成视频作为输出”——仍然是一片亟待开拓的蓝海。

表1:基于输入-输出模态组合的MM-RAG分类法
在此基础上,作者们构建了一个基于输入-输出模态组合的全新MM-RAG分类法,不仅系统地组织了现有研究,还清晰展示了不同MM-RAG系统的核心技术组件(如表2所示),为后续研究提供了统一框架和方法参考。

表2:不同输入输出模态下多模态RAG的核心技术组件、任务和应用
四大关键阶段剖析MM-RAG工作流
基于这个新的分类法,该综述深入分析了MM-RAG系统的工作流程,并将其划分为四个关键阶段(如图1所示):

图1 MM-RAG的工作流
a) 预检索:数据组织和查询的准备工作。
b) 检索:高效准确地从海量多模态知识库中找到相关信息。
c) 增强:将检索到的多模态信息有效地融入到大模型中。
d) 生成:基于输入和增强信息生成高质量的多模态输出。
论文详细总结了每个阶段的常用方法,并针对不同模态讨论了优化策略,为构建高性能的MM-RAG系统提供了实用的技术指导。
一站式指南:训练、评估与应用前瞻
除了技术流程,该综述还提供了构建MM-RAG系统的一站式指南:
训练策略:讨论了MM-RAG系统的训练方法,以最大化其检索和生成能力。
评估方法:总结了现有的MM-RAG评估指标和基准,帮助研究者评估系统性能。
应用与未来:探讨了MM-RAG在多个领域的潜在应用,并指出了未来的重要研究方向。
作为首个覆盖所有常见输入-输出模态组合、并系统性解析了MM-RAG工作流、组件、训练、评估等核心技术的重要综述,该论文不仅为研究者提供了索引式的知识入口,也为产业应用提供了全面的技术参考。论文作者还提供了持续更新的资源库,方便读者跟踪最新进展。
相关攻略
4月5日消息,据“上海交通大学”公众号消息,日前,米哈游联合创始人、总裁、董事长、上海交通大学2005级信息工程专业本科、2009级通信与信息系统专业硕士校友刘伟,代表米哈游创始团队蔡浩宇、罗宇皓,
据彭博社近日报道称,尽管2026年Alphabet、亚马逊、Meta和微软等科技巨头都要投入超过6,500亿美元扩展人工智能(AI),但关键电气元件可用性成为主要障碍,近50%将因电力基础设施短缺和
4月6日消息,最近两年AI发展速度越来越快,AI取代大量工作导致人类失业的说法甚嚣尘上,然而事实可能不是这样。著名风投机构创始人a16z联合创始人Marc Andreessen也是AI圈的大佬,他日
4月6日消息,今日,红果短剧发布《关于持续治理AI短剧素材违规使用行为的公告》(以下简称《公告》)。《公告》显示,今年一季度,平台已累计下架违反平台治理规范的漫剧1718部。其中,针对近期AI短剧素
4月4日消息,发布仅1天的阿里千问新模型Qwen3 6-Plus,冲上全球知名大模型API调用平台OpenRouter的日榜榜首,成为当下最受企业和开发者热捧的大模型。OpenRouter最新数据显
热门专题
热门推荐
加密货币行业翘首以盼的监管里程碑,终于有了实质性进展。美国证券交易委员会(SEC)主席保罗·阿特金斯(Paul Atkins)近日证实,那份允许加密项目在早期获得注册豁免权的“安全港”框架提案,已经正式送抵白宫,进入了最终审查阶段。 在范德堡大学与区块链协会联合举办的数字资产峰会上,阿特金斯透露了这
微策略Strategy报告:第一季录得144 6亿美元浮亏 再斥资约3 3亿美元买进4871枚比特币 市场震荡的威力有多大?看看Strategy的最新季报就明白了。根据其最新向美国证管会(SEC)提交的8-K报告,受市场剧烈波动影响,这家公司所持的比特币在第一季度录得了一笔惊人的数字——144 6亿
稳定币巨头Tether的动向,向来是加密世界的风向标。这不,它向Web3基础设施的版图扩张,又迈出了关键一步。公司执行长Paolo Ardoino在社交平台X上透露,其工程团队正在全力“烹制”一个新项目——去中心化搜索引擎 “Hypersearch”。这个消息一出,立刻引发了行业的广泛猜想。 采用D
基地位于Coinbase旗下以太坊Layer2网络Base的Seamless Protocol,日前正式宣告了服务的终结。这个曾经吸引了超过20万用户的原生DeFi借贷协议,在运营不到三年后,终究没能跑赢时间。它主打的核心产品是Integrated Leverage Markets(ILMs)——一
PAAL代币揭秘:深度解析Web3社区治理的核心钥匙 在去中心化自治组织的浪潮中,谁真正掌握了项目的话语权?PAAL代币提供了一套系统化的答案。它不仅是生态内流转的价值媒介,更是开启链上治理大门的核心凭证。通过持有并质押PAAL代币,用户能够对协议升级、资金分配乃至战略方向等关键事务投出决定性的一票





