搜索 猫眼电影 融媒体矩阵
  • 山东手机报

  • 猫眼电影

  • 大众网官方微信

  • 大众网官方微博

  • 抖音

  • 人民号

  • 全国党媒平台

  • 央视频

  • 百家号

  • 快手

  • 头条号

  • 哔哩哔哩

首页 >新闻 >社会新闻

迎接「万物皆可RAG」时代:最新综述展示50多种多模态组合

2025-12-27 09:53:22
来源:

猫眼电影

作者:

金铃

手机查看

  猫眼电影记者 麦尔亨利奇 报道首次登录送91元红包

大模型最广泛的应用如 ChatGPT、Deepseek、千问、豆包、Gemini 等通常会连接互联网进行检索增强生成(RAG)来产生用户问题的答案。随着多模态大模型(MLLMs)的崛起,大模型的主流技术之一 RAG 迅速向多模态发展,形成多模态检索增强生成(MM-RAG)这个新兴领域。ChatGPT、千问、豆包、Gemini 都开始允许用户提供文字、图片等多种模态的输入。

然而,目前对于 MM-RAG 的应用和研究都还处于非常初级的阶段,现有的 MM-RAG 研究以及综述论文主要聚焦于文本和图像等少数模态组合;音频、视频、代码、表格、知识图谱、3D 对象等多种模态的组合均可用于检索增强生成,却仅有很少的探索和研究。这使得研究者和开发者难以全面把握 MM-RAG 的技术脉络和广阔的应用空间。

来自华中科技大学、复旦大学、中国电信、美国伊利诺伊大学芝加哥分校的研究者们共同发布了一篇全面覆盖几乎所有模态作为输入和输出组合的MM-RAG综述来全面且系统化地阐述这个广阔的研究和应用空间。

论文标题:A Comprehensive Survey on Multimodal RAG: All Combinations of Modalities as Input and OutputTechRxiv: https://doi.org/10.36227/techrxiv.176341513.38473003/v2GitHub 项目主页: https://github.com/INTREBID/Awesome-MM-RAG

该论文的最大亮点在于其前所未有的广度:

它首次覆盖了几乎所有可能使用的模态组合作为输入和输出,包括文本、图像、音频、视频、代码、表格、知识图谱、3D 对象等。

通过这种全面的梳理,作者们首先揭示了 MM-RAG 领域中庞大的潜在输入 - 输出模态组合空间,并指出了其中尚未被充分探索的空白(如表 1 所示)。在作者提出的 54 种潜在组合中,目前只有 18 种组合存在已有研究(表 1 中绿色对勾的格子),许多极具应用价值的组合 —— 例如 “文本 + 视频作为输入,生成视频作为输出”—— 仍是一片亟待开拓的蓝海。

表 1:基于输入 - 输出模态组合的 MM-RAG 分类法

在此基础上,作者们构建了一个基于输入 - 输出模态组合的全新 MM-RAG 分类法,不仅系统性地组织了现有研究,还清晰展示了不同 MM-RAG 系统的核心技术组件(如表 2 所示),为后续研究提供了统一框架和方法参考。

表 2不同输入输出模态下多模态 RAG 的核心技术组件、任务和应用

四大关键阶段剖析 MM-RAG 工作流

基于这个新的分类法,该综述深入分析了MM-RAG系统的工作流程,并将其划分为四个关键阶段(如图 1 所示):

图 1 MM-RAG 的工作流

a)预检索 (Pre-retrieval): 数据组织和查询的准备工作。

b)检索 (Retrieval): 高效准确地从海量多模态知识库中找到相关信息。

c)增强 (Augmentation): 将检索到的多模态信息有效地融入到大模型中。

d)生成 (Generation): 根据输入和增强信息生成高质量的多模态输出。

论文详细总结了每个阶段的常用方法,并讨论了对于不同模态针对性的优化策略,为构建高性能的MM-RAG系统提供了实用的技术指导。

一站式指南:

训练、评估与应用前瞻

除了技术流程,该综述还提供了构建 MM-RAG 系统的一站式指南:

训练策略: 讨论了 MM-RAG 系统的训练方法,以最大化其检索和生成能力。评估方法: 总结了现有的MM-RAG 评估指标和 Benchmark,帮助研究者评估系统性能。应用与未来: 探讨了 MM-RAG 在多个领域的潜在应用,并指出了未来的重要研究方向。

作为首个覆盖所有常见输入 - 输出模态组合、并系统化解析了 MM-RAG 的工作流、组件、训练、评估等核心技术的综述,该论文不仅为研究者提供了索引式的知识入口,也为产业应用提供了全面的技术参考。论文作者还提供了持续更新的资源库,方便读者追踪最新进展。

 时事1:bet伟德体育下载

  12月27日,《中国餐饮产业发展报告(2025)》发布,亿纬锂能董事长刘金成表示,公司致力于打造氢、锂、钠电化学储能综合解决方案,将持续深耕智能化制造,实现“机器人为机器人造电池”的愿景,构建高度自动化、智能化的电池制造体系。,亚星网投。

  12月27日,湖北恩施现奇幻洞穴 游客仿佛步入异星秘境,为使交易显得“合理”,诺泰生物还要求对浙江华贝进行估值调整。时任财务总监徐东海参与协调第三方机构,将浙江华贝估值大幅提高,使其“看起来”有能力支付3000万元。这一行为进一步佐证了交易的非真实性。,永利博如何注册,未来娱乐,万博manxbet官网登录。

 时事2:ku游娱乐app软件下载

  12月27日,“早餐会”话发展面对面解难题 甘肃金昌让企业敢闯敢投敢干,崔光灿也认为,住房按套内面积销售或按套销售,更有利于保障购房人的权益。他提出了另外两点原因,其一,由于公摊面积没有规范性标准,可大可小,且透明性不足,可能会损害购房人权益;其二,购房不仅要考虑交易成本,也需考虑使用成本。“后面的使用费用如暖气费等,如果按建筑面积分摊也不尽合理。”,澳门皇冠app下载安装,米博体育平台下载安装,365bet足球网址。

  12月27日,南宋花器修复展在杭启幕 再现宋人雅韵,今年 8 月,在面壁智能成立 3 周年之际,面壁智能CEO李大海发出了全员信。信中首次披露,面壁智能成立汽车业务线一级组织,旨在实现“压强式”突破,让 MiniCPM 端侧模型应用到更多汽车上。,买世界杯球用什么软件,网赌排行前十,立博竞彩官网。

 时事3:巴黎人官网可以注册吗

  12月27日,香港警方在宏福苑两座大厦中没有发现遇难者遗体,重庆取代广州再次晋级“经济第四城”,苏州以微弱优势力压成都,长沙连续被无锡、郑州反超,南通压过西安、佛山,温州则反超大连、徐州拿下“后备军团”第一坐席……,必赢电子游戏网址,九五至尊网络平台,网上电玩娱乐。

  12月27日,澳大利亚前议员协会代表团走进四川感受发展脉动,5月10日,中新(西兰)两军在西安举行第11次战略对话。双方围绕共同关心的国际和地区问题坦诚交换意见,表达了共同致力于推动两军交流合作的积极意愿,增进了相互了解和信任。,PK10开奖结果 上快赢,棋牌送30元,澳门永利是干嘛的公司。

 时事4:奥博集团网址是多少啊

  12月27日,冬奥会混双冰壶资格赛开赛 中国组合迎来两连胜,“北溪”天然气管道泄露事故距今已发生四月余,调查各方均认为管道遭“蓄意人为破坏”,但对于可能的幕后黑手,至今仍众说纷纭。,AG注册网,爱博手机APP,真人街机捕鱼网络版。

  12月27日,“超级月亮”即将登场,等你来赏!,值得注意的是,据中国基金报,今年春节过后,A股已连续三个月没有IPO公司接受上市委的审议。交易所最近的一次上市委会议是在2月6日,也就是已经三个月没有安排IPO企业上会。,宝博体育打不开网页,牛牛怎么玩赢钱几率大,澳彩网。

责编:郭晓峰

审核:程华

责编:高丽亚

相关推荐 换一换