搜索 猫眼电影 融媒体矩阵
  • 山东手机报

  • 猫眼电影

  • 大众网官方微信

  • 大众网官方微博

  • 抖音

  • 人民号

  • 全国党媒平台

  • 央视频

  • 百家号

  • 快手

  • 头条号

  • 哔哩哔哩

首页 >新闻 >社会新闻

迎接「万物皆可RAG」时代:最新综述展示50多种多模态组合

2025-12-26 07:27:35
来源:

猫眼电影

作者:

卢小鱼

手机查看

  猫眼电影记者 金刚葫芦娃 报道首次登录送91元红包

大模型最广泛的应用如 ChatGPT、Deepseek、千问、豆包、Gemini 等通常会连接互联网进行检索增强生成(RAG)来产生用户问题的答案。随着多模态大模型(MLLMs)的崛起,大模型的主流技术之一 RAG 迅速向多模态发展,形成多模态检索增强生成(MM-RAG)这个新兴领域。ChatGPT、千问、豆包、Gemini 都开始允许用户提供文字、图片等多种模态的输入。

然而,目前对于 MM-RAG 的应用和研究都还处于非常初级的阶段,现有的 MM-RAG 研究以及综述论文主要聚焦于文本和图像等少数模态组合;音频、视频、代码、表格、知识图谱、3D 对象等多种模态的组合均可用于检索增强生成,却仅有很少的探索和研究。这使得研究者和开发者难以全面把握 MM-RAG 的技术脉络和广阔的应用空间。

来自华中科技大学、复旦大学、中国电信、美国伊利诺伊大学芝加哥分校的研究者们共同发布了一篇全面覆盖几乎所有模态作为输入和输出组合的MM-RAG综述来全面且系统化地阐述这个广阔的研究和应用空间。

论文标题:A Comprehensive Survey on Multimodal RAG: All Combinations of Modalities as Input and OutputTechRxiv: https://doi.org/10.36227/techrxiv.176341513.38473003/v2GitHub 项目主页: https://github.com/INTREBID/Awesome-MM-RAG

该论文的最大亮点在于其前所未有的广度:

它首次覆盖了几乎所有可能使用的模态组合作为输入和输出,包括文本、图像、音频、视频、代码、表格、知识图谱、3D 对象等。

通过这种全面的梳理,作者们首先揭示了 MM-RAG 领域中庞大的潜在输入 - 输出模态组合空间,并指出了其中尚未被充分探索的空白(如表 1 所示)。在作者提出的 54 种潜在组合中,目前只有 18 种组合存在已有研究(表 1 中绿色对勾的格子),许多极具应用价值的组合 —— 例如 “文本 + 视频作为输入,生成视频作为输出”—— 仍是一片亟待开拓的蓝海。

表 1:基于输入 - 输出模态组合的 MM-RAG 分类法

在此基础上,作者们构建了一个基于输入 - 输出模态组合的全新 MM-RAG 分类法,不仅系统性地组织了现有研究,还清晰展示了不同 MM-RAG 系统的核心技术组件(如表 2 所示),为后续研究提供了统一框架和方法参考。

表 2不同输入输出模态下多模态 RAG 的核心技术组件、任务和应用

四大关键阶段剖析 MM-RAG 工作流

基于这个新的分类法,该综述深入分析了MM-RAG系统的工作流程,并将其划分为四个关键阶段(如图 1 所示):

图 1 MM-RAG 的工作流

a)预检索 (Pre-retrieval): 数据组织和查询的准备工作。

b)检索 (Retrieval): 高效准确地从海量多模态知识库中找到相关信息。

c)增强 (Augmentation): 将检索到的多模态信息有效地融入到大模型中。

d)生成 (Generation): 根据输入和增强信息生成高质量的多模态输出。

论文详细总结了每个阶段的常用方法,并讨论了对于不同模态针对性的优化策略,为构建高性能的MM-RAG系统提供了实用的技术指导。

一站式指南:

训练、评估与应用前瞻

除了技术流程,该综述还提供了构建 MM-RAG 系统的一站式指南:

训练策略: 讨论了 MM-RAG 系统的训练方法,以最大化其检索和生成能力。评估方法: 总结了现有的MM-RAG 评估指标和 Benchmark,帮助研究者评估系统性能。应用与未来: 探讨了 MM-RAG 在多个领域的潜在应用,并指出了未来的重要研究方向。

作为首个覆盖所有常见输入 - 输出模态组合、并系统化解析了 MM-RAG 的工作流、组件、训练、评估等核心技术的综述,该论文不仅为研究者提供了索引式的知识入口,也为产业应用提供了全面的技术参考。论文作者还提供了持续更新的资源库,方便读者追踪最新进展。

 时事1:牛牛游戏怎么赚钱

  12月26日,“航模达人”高宪农:四十五年坚守 诠释航空航天科普情怀,从一季度的市场情况来看,人均消费在二三百元的中端餐饮日子确实不那么好过。近日,一家人均消费约为320元的海鲜餐厅相关负责人告诉记者:“我们门店以前一个月能做350万左右的营业额,现在只能做到250万元。”另一家人均消费约为222元的苏浙菜员工则表示:“生意比去年下滑20%。”甚至还有一家人均消费约为276元的私营浙菜馆老板表示:“我们马上倒闭了。”,有什么网赌网址。

  12月26日,500余名选手角逐大湾区青少年跳绳王者 赛事三超世界纪录,12月27日,圣元环保收到厦门证监局出具的《厦门证监局关于对圣元环保股份有限公司、朱煜煊、朱恒冰、陈文钰采取出具警示函措施的决定》。,九游会登录入口,体育担保网,立博官网中文登录。

 时事2:心博天下备用网址

  12月26日,广西古镇冬日味道:遇见“腊”份乡愁,其二,节省外汇储备并支持国内矿业发展。用本币从本国金矿采购,可以节省外汇储备,并能支持国内矿业发展。一些国家的央行(如加纳、坦桑尼亚)要求矿商将一定比例的产量卖给央行,是想储备增加和资金留在国内经济的双赢。,澳门在线皇冠,体球网址多少,ROR手机版登录。

  12月26日,陆军某团结合高原驻训任务培育官兵战斗精神,全球央行黄金存储模式有三类,一是纽约模式,二是伦敦模式,三是境内或三方模式。三类模式在交易便利性、主权控制权和地缘政治风险之间寻求平衡。,美高梅游戏怎么下分,世界杯竞猜买球,庄家补牌规则对照表。

 时事3:炸金花的软件有哪些

  12月26日,日本两团体请求访华 中方回应,据该公司2017年三季度偿付能力报告显示,刘树林于报告期内已卸任总裁职务,不过其还担任该公司执行董事。2017年四季度,执行董事名单更新为徐兴建、李东明、王新利三人。,下载威尼斯人,华人在线,新金沙登录。

  12月26日,“百万英才汇南粤”招聘会深圳启幕 近半岗位年薪超20万元,但是,非洲市场的营收占比却从超过40%,下降至不足30%。其中虽有转向其他新兴市场的因素,但传音在非洲市场正在遭遇挑战已是客观事实。这种挑战直接体现在传音的财务报表上。,和记娱乐网页版,世博体育官网app下载,葡京体育在哪注册。

 时事4:澳门百利宫

  12月26日,从联合国到哥大 东方传统手工艺赋能跨文明对话,尽管关税政策对经济的提振效果未达预期,但特朗普演讲中多项核心关税承诺最终基本得以兑现。,爱游戏体育官方,进入sunbet官网下载,澳门新永利是做什么的。

  12月26日,残特奥会田径比赛:李四双破女子800米T36级世界纪录,包括经营性租赁,如何将闲置率、上下游现金流回报写入系统模型并与厂家对接,也需要系统支持。还有绿色碳交易等,传统租赁方式或许可行,但现在我们可以对接碳交易市场,甚至用碳配额抵补租金,这是非常新颖的方式。,心乐棋牌,bet足球分析网,365网开户。

责编:叶萌

审核:刘松恺

责编:爱—安利

相关推荐 换一换