搜索 猫眼电影 融媒体矩阵
  • 山东手机报

  • 猫眼电影

  • 大众网官方微信

  • 大众网官方微博

  • 抖音

  • 人民号

  • 全国党媒平台

  • 央视频

  • 百家号

  • 快手

  • 头条号

  • 哔哩哔哩

首页 >新闻 >社会新闻

迎接「万物皆可RAG」时代:最新综述展示50多种多模态组合

2025-12-27 11:47:27
来源:

猫眼电影

作者:

大卫·拉塞尔

手机查看

  猫眼电影记者 谭进 报道首次登录送91元红包

大模型最广泛的应用如 ChatGPT、Deepseek、千问、豆包、Gemini 等通常会连接互联网进行检索增强生成(RAG)来产生用户问题的答案。随着多模态大模型(MLLMs)的崛起,大模型的主流技术之一 RAG 迅速向多模态发展,形成多模态检索增强生成(MM-RAG)这个新兴领域。ChatGPT、千问、豆包、Gemini 都开始允许用户提供文字、图片等多种模态的输入。

然而,目前对于 MM-RAG 的应用和研究都还处于非常初级的阶段,现有的 MM-RAG 研究以及综述论文主要聚焦于文本和图像等少数模态组合;音频、视频、代码、表格、知识图谱、3D 对象等多种模态的组合均可用于检索增强生成,却仅有很少的探索和研究。这使得研究者和开发者难以全面把握 MM-RAG 的技术脉络和广阔的应用空间。

来自华中科技大学、复旦大学、中国电信、美国伊利诺伊大学芝加哥分校的研究者们共同发布了一篇全面覆盖几乎所有模态作为输入和输出组合的MM-RAG综述来全面且系统化地阐述这个广阔的研究和应用空间。

论文标题:A Comprehensive Survey on Multimodal RAG: All Combinations of Modalities as Input and OutputTechRxiv: https://doi.org/10.36227/techrxiv.176341513.38473003/v2GitHub 项目主页: https://github.com/INTREBID/Awesome-MM-RAG

该论文的最大亮点在于其前所未有的广度:

它首次覆盖了几乎所有可能使用的模态组合作为输入和输出,包括文本、图像、音频、视频、代码、表格、知识图谱、3D 对象等。

通过这种全面的梳理,作者们首先揭示了 MM-RAG 领域中庞大的潜在输入 - 输出模态组合空间,并指出了其中尚未被充分探索的空白(如表 1 所示)。在作者提出的 54 种潜在组合中,目前只有 18 种组合存在已有研究(表 1 中绿色对勾的格子),许多极具应用价值的组合 —— 例如 “文本 + 视频作为输入,生成视频作为输出”—— 仍是一片亟待开拓的蓝海。

表 1:基于输入 - 输出模态组合的 MM-RAG 分类法

在此基础上,作者们构建了一个基于输入 - 输出模态组合的全新 MM-RAG 分类法,不仅系统性地组织了现有研究,还清晰展示了不同 MM-RAG 系统的核心技术组件(如表 2 所示),为后续研究提供了统一框架和方法参考。

表 2不同输入输出模态下多模态 RAG 的核心技术组件、任务和应用

四大关键阶段剖析 MM-RAG 工作流

基于这个新的分类法,该综述深入分析了MM-RAG系统的工作流程,并将其划分为四个关键阶段(如图 1 所示):

图 1 MM-RAG 的工作流

a)预检索 (Pre-retrieval): 数据组织和查询的准备工作。

b)检索 (Retrieval): 高效准确地从海量多模态知识库中找到相关信息。

c)增强 (Augmentation): 将检索到的多模态信息有效地融入到大模型中。

d)生成 (Generation): 根据输入和增强信息生成高质量的多模态输出。

论文详细总结了每个阶段的常用方法,并讨论了对于不同模态针对性的优化策略,为构建高性能的MM-RAG系统提供了实用的技术指导。

一站式指南:

训练、评估与应用前瞻

除了技术流程,该综述还提供了构建 MM-RAG 系统的一站式指南:

训练策略: 讨论了 MM-RAG 系统的训练方法,以最大化其检索和生成能力。评估方法: 总结了现有的MM-RAG 评估指标和 Benchmark,帮助研究者评估系统性能。应用与未来: 探讨了 MM-RAG 在多个领域的潜在应用,并指出了未来的重要研究方向。

作为首个覆盖所有常见输入 - 输出模态组合、并系统化解析了 MM-RAG 的工作流、组件、训练、评估等核心技术的综述,该论文不仅为研究者提供了索引式的知识入口,也为产业应用提供了全面的技术参考。论文作者还提供了持续更新的资源库,方便读者追踪最新进展。

 时事1:巴黎人网投电玩

  12月27日,中越浦寨-新清货运专用通道智慧口岸中方段即将投运,第三招是抹黑,认为中国别有用心。柯比说,将继续关注中国“在世界其他地方获得影响力和立足点”。,为什么很多平台都有AG。

  12月27日,四中全会精神解读·市场最前沿丨驶向丘陵山区!国产农机焕新启程,梁启东说,渤海海峡跨海通道建成后,会节约山东到辽东半岛乃至整个东北的运输成本,打通交通堵点,扩大物流,激发新的增长点,并对沿线旅游业产生积极影响。受历史上闯关东等因素影响,山东与东北地区历史渊源深厚,两个地区从经济联系、区位关系,再到情感纽带、文化渊源等方面都有很好的区域协同发展的基础。,hth华体会外围官网,手机版彩票网站官网,贝搏体育平台官方。

 时事2:九州娱城乐十年信誉玩家首选

  12月27日,工信部:2025年前10月通信业运行总体平稳,“中国始终恪守国际法基本原则和国际关系基本准则,坚持维护世界和平,促进共同发展,致力于推动构建人类命运共同体,在和平共处五项原则基础上同各国发展友好合作。”他说。,新宝体育,大发官网APP,凯发k8是真是假。

  12月27日,哥斯达黎加前总统顾问:中国成为全球南方发展关键伙伴,广西北海市气象台7日5时50分将暴雨橙色预警信号提升为红色,北海全市中小学停课。,心博天下网站是什么,欧洲世界杯投注,宝博游戏app下载。

 时事3:必赢亚洲手机

  12月27日,香港特区政府:香港警方已完成两栋大厦搜索 未发现遗体,2025年1月,黄金还在2614美元盎司左右。今年黄金年内涨幅接近70%,势将创下1979年以来的最大年度涨幅。然而,在摩根大通分析师看来,金价未来一年仍有逾10%的上涨空间。,金鼎国际,真人版天天诈金花,四川血战麻将现金版。

  12月27日,“闽侨智库·华商研究中心”在福州揭牌,其中,一季度,广东规模以上工业增加值0.91万亿元,同比增长6.1%,增速比上年同期和上年全年分别提高4.7个、1.7个百分点。分门类看,采矿业增加值增长4.2%,制造业增加值增长6.0%,电力、热力、燃气及水生产和供应业增加值增长8.2%。,万博登陆首页,最新申搏sunbet官网,在哪个APP可以买滚球。

 时事4:2026世界杯足球外围在线投注网

  12月27日,明年2月1日起北京市收费公路将全面使用电子发票,若发射成功,Innospace 将成为韩国首家实现客户卫星入轨的民营公司,此次失败使其错失抢占小型卫星发射市场的先机。,2026世界杯买球盘口,大富豪网址,星速app下载苹果版安装。

  12月27日,透视11月数据 3个关键词锚定明年经济工作,对于西方大国来说,一个团结强大的伊斯兰世界并不符合其战略利益,一个虚弱、分裂的伊斯兰世界才符合心意。,巴黎人所有网站,体育外围的app,黄金岛注册。

责编:孙昭明

审核:比尔盖茨

责编:李先忠

相关推荐 换一换