搜索 猫眼电影 融媒体矩阵
  • 山东手机报

  • 猫眼电影

  • 大众网官方微信

  • 大众网官方微博

  • 抖音

  • 人民号

  • 全国党媒平台

  • 央视频

  • 百家号

  • 快手

  • 头条号

  • 哔哩哔哩

首页 >新闻 >社会新闻

迎接「万物皆可RAG」时代:最新综述展示50多种多模态组合

2025-12-27 05:49:21
来源:

猫眼电影

作者:

何超莲

手机查看

  猫眼电影记者 刘培基 报道首次登录送91元红包

大模型最广泛的应用如 ChatGPT、Deepseek、千问、豆包、Gemini 等通常会连接互联网进行检索增强生成(RAG)来产生用户问题的答案。随着多模态大模型(MLLMs)的崛起,大模型的主流技术之一 RAG 迅速向多模态发展,形成多模态检索增强生成(MM-RAG)这个新兴领域。ChatGPT、千问、豆包、Gemini 都开始允许用户提供文字、图片等多种模态的输入。

然而,目前对于 MM-RAG 的应用和研究都还处于非常初级的阶段,现有的 MM-RAG 研究以及综述论文主要聚焦于文本和图像等少数模态组合;音频、视频、代码、表格、知识图谱、3D 对象等多种模态的组合均可用于检索增强生成,却仅有很少的探索和研究。这使得研究者和开发者难以全面把握 MM-RAG 的技术脉络和广阔的应用空间。

来自华中科技大学、复旦大学、中国电信、美国伊利诺伊大学芝加哥分校的研究者们共同发布了一篇全面覆盖几乎所有模态作为输入和输出组合的MM-RAG综述来全面且系统化地阐述这个广阔的研究和应用空间。

论文标题:A Comprehensive Survey on Multimodal RAG: All Combinations of Modalities as Input and OutputTechRxiv: https://doi.org/10.36227/techrxiv.176341513.38473003/v2GitHub 项目主页: https://github.com/INTREBID/Awesome-MM-RAG

该论文的最大亮点在于其前所未有的广度:

它首次覆盖了几乎所有可能使用的模态组合作为输入和输出,包括文本、图像、音频、视频、代码、表格、知识图谱、3D 对象等。

通过这种全面的梳理,作者们首先揭示了 MM-RAG 领域中庞大的潜在输入 - 输出模态组合空间,并指出了其中尚未被充分探索的空白(如表 1 所示)。在作者提出的 54 种潜在组合中,目前只有 18 种组合存在已有研究(表 1 中绿色对勾的格子),许多极具应用价值的组合 —— 例如 “文本 + 视频作为输入,生成视频作为输出”—— 仍是一片亟待开拓的蓝海。

表 1:基于输入 - 输出模态组合的 MM-RAG 分类法

在此基础上,作者们构建了一个基于输入 - 输出模态组合的全新 MM-RAG 分类法,不仅系统性地组织了现有研究,还清晰展示了不同 MM-RAG 系统的核心技术组件(如表 2 所示),为后续研究提供了统一框架和方法参考。

表 2不同输入输出模态下多模态 RAG 的核心技术组件、任务和应用

四大关键阶段剖析 MM-RAG 工作流

基于这个新的分类法,该综述深入分析了MM-RAG系统的工作流程,并将其划分为四个关键阶段(如图 1 所示):

图 1 MM-RAG 的工作流

a)预检索 (Pre-retrieval): 数据组织和查询的准备工作。

b)检索 (Retrieval): 高效准确地从海量多模态知识库中找到相关信息。

c)增强 (Augmentation): 将检索到的多模态信息有效地融入到大模型中。

d)生成 (Generation): 根据输入和增强信息生成高质量的多模态输出。

论文详细总结了每个阶段的常用方法,并讨论了对于不同模态针对性的优化策略,为构建高性能的MM-RAG系统提供了实用的技术指导。

一站式指南:

训练、评估与应用前瞻

除了技术流程,该综述还提供了构建 MM-RAG 系统的一站式指南:

训练策略: 讨论了 MM-RAG 系统的训练方法,以最大化其检索和生成能力。评估方法: 总结了现有的MM-RAG 评估指标和 Benchmark,帮助研究者评估系统性能。应用与未来: 探讨了 MM-RAG 在多个领域的潜在应用,并指出了未来的重要研究方向。

作为首个覆盖所有常见输入 - 输出模态组合、并系统化解析了 MM-RAG 的工作流、组件、训练、评估等核心技术的综述,该论文不仅为研究者提供了索引式的知识入口,也为产业应用提供了全面的技术参考。论文作者还提供了持续更新的资源库,方便读者追踪最新进展。

 时事1:伯爵游戏2注册

  12月27日,中国政府中东问题特使翟隽访问欧盟,“2025年碳酸锂的行情并非简单的V型反转,而是经历了一场从阴跌寻底到大举反弹,回调后进而再创年内新高的希望中复苏型行情。”对于2025年的锂盐市场,一德期货总结指出。,2026世界杯在那投注。

  12月27日,习言道|中央企业要为中国式现代化建设贡献更大力量,总台记者在震中卡赫拉曼马拉什省看到,有双向道路被损毁变窄,一条笔直的铁轨在强震作用下,几乎弯曲成90度。,必博体育官网app下载,威尼斯人网址正网,凯时平台。

 时事2:奔驰宝马电玩城游戏

  12月27日,四大“晴雨表”映射湖北经济稳中向好,其中,仅广东一省就有4所高校,包括1所新增、1所更名为大学、2所“升本”——新增设置深圳理工大学,佛山科学技术学院更名为佛山大学,广东轻工职业技术学院、肇庆医学高等专科学校分别“升本更名”为广东轻工职业技术大学、肇庆医学院。,亿博在线注册,乐鱼官网登录,下载凯时AG旗舰厅。

  12月27日,江西省教育厅原副巡视员王俊接受纪律审查和监察调查,台“农委会”“主委”陈吉仲称,蛋类产量恢复要到5、6月,期间将全力调度满足消费者需要。对此,民众党“立委”邱臣远11日批评,台湾从导弹缺到鸡蛋,过去抢口罩抢疫苗,现在抢药、抢水、抢鸡蛋,“一场全台大缺蛋,被提升的只有‘主委’的口才反应力”。,必赢网站打不开怎么回事,世界杯足彩投注方式,2026世界杯怎么买球。

 时事3:永乐国际最新官网

  12月27日,广西南珠养殖小村变身“艺术村” 海景民宿引客打卡,4月24日业绩发布会后会见传媒时,史美伦说道,过去六年外围环境、国际经济及地缘政治均充满挑战,任期内与团队经历磨练,接受挑战并走出困境,认为香港及港交所“背靠祖国、联通世界”的定位及基础不会变,她在任期间集团对国际化投入不少,寄语未来要继续国际化发展。,a9体育下载,狗万,至尊在线游戏。

  12月27日,铁证如山!日本731部队再添新罪证,正如此次《鸿蒙星光盛典》所展现的,建设鸿蒙生态不是依靠某一家企业单打独斗,而是数以万计的开发者们坚决投入、不断坚持、共建共享之路。在这个路途中,每一个开发者都是点点星光,汇聚而成璀璨星河,之后便成为了照亮世界的力量。,火狐可靠吗,威尼斯人,MG真人电子网投。

 时事4:AG8官网登录网址

  12月27日,学习规划建议每日问答|怎样理解健全一体衔接的流通规则和标准,对于我们这个动荡不安的世界来说,这是个久违的好消息。联合国秘书长古特雷斯通过发言人发表声明,欢迎伊朗与沙特同意恢复外交关系的决定,并对中国协助相关协商表示感谢。中东国家也是一片叫好声,阿曼、卡塔尔、阿联酋、科威特、埃及等国纷纷发表声明点赞。,世界杯体育彩票投注,必威在哪里玩,365best登录。

  12月27日,感染幽门螺杆菌,如何足疗程正确用药,崔光灿建议,未来,要想进一步推动房地产市场计价方式改革,鼓励按套内面积计价,还需在行政管理上做出一系列政策完善。比如,后期产权登记上的面积设定,依据房价的相关税费标准等。,买球平台押注,大发体育电子网投,在哪投注世界杯。

责编:乾女坤

审核:王镜宇

责编:哈勒欣

相关推荐 换一换