猫眼电影
猫眼电影记者 陈虎 报道首次登录送91元红包
大模型最广泛的应用如 ChatGPT、Deepseek、千问、豆包、Gemini 等通常会连接互联网进行检索增强生成(RAG)来产生用户问题的答案。随着多模态大模型(MLLMs)的崛起,大模型的主流技术之一 RAG 迅速向多模态发展,形成多模态检索增强生成(MM-RAG)这个新兴领域。ChatGPT、千问、豆包、Gemini 都开始允许用户提供文字、图片等多种模态的输入。
然而,目前对于 MM-RAG 的应用和研究都还处于非常初级的阶段,现有的 MM-RAG 研究以及综述论文主要聚焦于文本和图像等少数模态组合;音频、视频、代码、表格、知识图谱、3D 对象等多种模态的组合均可用于检索增强生成,却仅有很少的探索和研究。这使得研究者和开发者难以全面把握 MM-RAG 的技术脉络和广阔的应用空间。
来自华中科技大学、复旦大学、中国电信、美国伊利诺伊大学芝加哥分校的研究者们共同发布了一篇全面覆盖几乎所有模态作为输入和输出组合的MM-RAG综述来全面且系统化地阐述这个广阔的研究和应用空间。
论文标题:A Comprehensive Survey on Multimodal RAG: All Combinations of Modalities as Input and OutputTechRxiv: https://doi.org/10.36227/techrxiv.176341513.38473003/v2GitHub 项目主页: https://github.com/INTREBID/Awesome-MM-RAG
该论文的最大亮点在于其前所未有的广度:
它首次覆盖了几乎所有可能使用的模态组合作为输入和输出,包括文本、图像、音频、视频、代码、表格、知识图谱、3D 对象等。
通过这种全面的梳理,作者们首先揭示了 MM-RAG 领域中庞大的潜在输入 - 输出模态组合空间,并指出了其中尚未被充分探索的空白(如表 1 所示)。在作者提出的 54 种潜在组合中,目前只有 18 种组合存在已有研究(表 1 中绿色对勾的格子),许多极具应用价值的组合 —— 例如 “文本 + 视频作为输入,生成视频作为输出”—— 仍是一片亟待开拓的蓝海。
表 1:基于输入 - 输出模态组合的 MM-RAG 分类法
在此基础上,作者们构建了一个基于输入 - 输出模态组合的全新 MM-RAG 分类法,不仅系统性地组织了现有研究,还清晰展示了不同 MM-RAG 系统的核心技术组件(如表 2 所示),为后续研究提供了统一框架和方法参考。
表 2不同输入输出模态下多模态 RAG 的核心技术组件、任务和应用
四大关键阶段剖析 MM-RAG 工作流
基于这个新的分类法,该综述深入分析了MM-RAG系统的工作流程,并将其划分为四个关键阶段(如图 1 所示):
图 1 MM-RAG 的工作流
a)预检索 (Pre-retrieval): 数据组织和查询的准备工作。
b)检索 (Retrieval): 高效准确地从海量多模态知识库中找到相关信息。
c)增强 (Augmentation): 将检索到的多模态信息有效地融入到大模型中。
d)生成 (Generation): 根据输入和增强信息生成高质量的多模态输出。
论文详细总结了每个阶段的常用方法,并讨论了对于不同模态针对性的优化策略,为构建高性能的MM-RAG系统提供了实用的技术指导。
一站式指南:
训练、评估与应用前瞻
除了技术流程,该综述还提供了构建 MM-RAG 系统的一站式指南:
训练策略: 讨论了 MM-RAG 系统的训练方法,以最大化其检索和生成能力。评估方法: 总结了现有的MM-RAG 评估指标和 Benchmark,帮助研究者评估系统性能。应用与未来: 探讨了 MM-RAG 在多个领域的潜在应用,并指出了未来的重要研究方向。
作为首个覆盖所有常见输入 - 输出模态组合、并系统化解析了 MM-RAG 的工作流、组件、训练、评估等核心技术的综述,该论文不仅为研究者提供了索引式的知识入口,也为产业应用提供了全面的技术参考。论文作者还提供了持续更新的资源库,方便读者追踪最新进展。
时事1:英亚官网中文
12月26日,涉新粒子探测、人造细胞等领域 首批3个重大非共识基金项目拟获资助,刘树林:男,1964年11月出生,曾任中国信达济南办事处高级经理、执行高级经理。2011年6月任信达财险山东分公司总经理、党委书记,2014年5月起任总公司副总裁、党委委员。2015年4月起任执行董事,2016年4月连选连任执行董事,2016年4月起任总裁。,体球网手机比分新版。
12月26日,黄庭坚诞辰980周年特展启幕 85件套文物再现“山谷雅集”,据宁波市海曙出租汽车服务中心李贵春介绍,截至6月12日下午,已有50余人提交《超过法定退休年龄驾驶员从业资格证延续注册登记表》并参加体检,此次政策调整预计释放约2000名驾驶员资源。,世界杯购买球票网站app,e星体育下载地址在哪,手机版伟德bv源自英国客户端。
时事2:澳门游戏平台大全
12月26日,报告称湖北科技服务业向规模化、专业化发展,斯托尔滕贝格此前2月1日在日本东京访问时,就反复渲染“中国挑战”。斯托尔滕贝格当时声称,“中国大陆对台湾的威胁没有正当理由,北约对中国大陆在台湾海峡的威胁性言论和胁迫性行为感到担忧,防止中国大陆使用军事力量至关重要。 ”,体育彩票投注点,最大的AG真人网站是哪个,7m体育。
12月26日,锚定新目标 奋力开新局——2025年中央经济工作会议侧记,根据国际文传电讯社,哈萨克斯坦财政部长Madi Takiyev表示,哈萨克斯坦计划在1月至2月发行3亿至4亿美元的熊猫债。,万人在线银河游戏平台,澳门电玩城安全,万博官网手机版网页登陆。
时事3:贝多娱乐彩票正规平台吗
12月26日,齐勇凯获得残特奥会男子举重59公斤级双金,我国西部地域广阔,涵盖内蒙古、广西、重庆、四川、贵州、云南、西藏、陕西、甘肃、青海、宁夏、新疆等12个省、自治区、直辖市。,澳门庄闲网址,棋牌真金,吉祥体育坊。
12月26日,元旦假期国内机票预订量同比增长约46%,值得注意的是,本次反补贴调查并非应汽车共同体产业投诉而发起,而是欧委会依职权启动,这也是本次反补贴调查不同的地方。,爱游戏电竞网站,皇冠体育盘口直营,华体会手机版。
时事4:金沙娱城全部
12月26日,国防部:强烈敦促日方正视当前中日关系困难的症结,“中国+中亚五国”元首会晤机制的建立无疑具有突破性意义,中国与中亚的合作必将在现有的高位上提质升级。,完美国际官方网站,kb教育官网,im电竞真人投注。
12月26日,“新大众文艺价值引领与精神建构”学术沙龙在京举办,路透社报道称,在其第三个任期,莫迪预计将延续对中国“强硬但务实”的政策。不过,随着莫迪本人有可能在新政府中话语权下降,也或将为中印关系带来更多变数。,亚博官方网站,赌场网站娱乐,宝博官网APP。
责编:保罗·普罗克特
审核:林绍强
责编:齐麟












