猫眼电影
猫眼电影记者 刘翀 报道首次登录送91元红包
大模型最广泛的应用如 ChatGPT、Deepseek、千问、豆包、Gemini 等通常会连接互联网进行检索增强生成(RAG)来产生用户问题的答案。随着多模态大模型(MLLMs)的崛起,大模型的主流技术之一 RAG 迅速向多模态发展,形成多模态检索增强生成(MM-RAG)这个新兴领域。ChatGPT、千问、豆包、Gemini 都开始允许用户提供文字、图片等多种模态的输入。
然而,目前对于 MM-RAG 的应用和研究都还处于非常初级的阶段,现有的 MM-RAG 研究以及综述论文主要聚焦于文本和图像等少数模态组合;音频、视频、代码、表格、知识图谱、3D 对象等多种模态的组合均可用于检索增强生成,却仅有很少的探索和研究。这使得研究者和开发者难以全面把握 MM-RAG 的技术脉络和广阔的应用空间。
来自华中科技大学、复旦大学、中国电信、美国伊利诺伊大学芝加哥分校的研究者们共同发布了一篇全面覆盖几乎所有模态作为输入和输出组合的MM-RAG综述来全面且系统化地阐述这个广阔的研究和应用空间。
论文标题:A Comprehensive Survey on Multimodal RAG: All Combinations of Modalities as Input and OutputTechRxiv: https://doi.org/10.36227/techrxiv.176341513.38473003/v2GitHub 项目主页: https://github.com/INTREBID/Awesome-MM-RAG
该论文的最大亮点在于其前所未有的广度:
它首次覆盖了几乎所有可能使用的模态组合作为输入和输出,包括文本、图像、音频、视频、代码、表格、知识图谱、3D 对象等。
通过这种全面的梳理,作者们首先揭示了 MM-RAG 领域中庞大的潜在输入 - 输出模态组合空间,并指出了其中尚未被充分探索的空白(如表 1 所示)。在作者提出的 54 种潜在组合中,目前只有 18 种组合存在已有研究(表 1 中绿色对勾的格子),许多极具应用价值的组合 —— 例如 “文本 + 视频作为输入,生成视频作为输出”—— 仍是一片亟待开拓的蓝海。
表 1:基于输入 - 输出模态组合的 MM-RAG 分类法
在此基础上,作者们构建了一个基于输入 - 输出模态组合的全新 MM-RAG 分类法,不仅系统性地组织了现有研究,还清晰展示了不同 MM-RAG 系统的核心技术组件(如表 2 所示),为后续研究提供了统一框架和方法参考。
表 2不同输入输出模态下多模态 RAG 的核心技术组件、任务和应用
四大关键阶段剖析 MM-RAG 工作流
基于这个新的分类法,该综述深入分析了MM-RAG系统的工作流程,并将其划分为四个关键阶段(如图 1 所示):
图 1 MM-RAG 的工作流
a)预检索 (Pre-retrieval): 数据组织和查询的准备工作。
b)检索 (Retrieval): 高效准确地从海量多模态知识库中找到相关信息。
c)增强 (Augmentation): 将检索到的多模态信息有效地融入到大模型中。
d)生成 (Generation): 根据输入和增强信息生成高质量的多模态输出。
论文详细总结了每个阶段的常用方法,并讨论了对于不同模态针对性的优化策略,为构建高性能的MM-RAG系统提供了实用的技术指导。
一站式指南:
训练、评估与应用前瞻
除了技术流程,该综述还提供了构建 MM-RAG 系统的一站式指南:
训练策略: 讨论了 MM-RAG 系统的训练方法,以最大化其检索和生成能力。评估方法: 总结了现有的MM-RAG 评估指标和 Benchmark,帮助研究者评估系统性能。应用与未来: 探讨了 MM-RAG 在多个领域的潜在应用,并指出了未来的重要研究方向。
作为首个覆盖所有常见输入 - 输出模态组合、并系统化解析了 MM-RAG 的工作流、组件、训练、评估等核心技术的综述,该论文不仅为研究者提供了索引式的知识入口,也为产业应用提供了全面的技术参考。论文作者还提供了持续更新的资源库,方便读者追踪最新进展。
时事1:12bet入口登录
12月27日,广东国有资产“亮家底”:总资产超31.6万亿元,李瀚明进一步分析,西安接近中国的几何中心,这样的地理位置飞国内任何地方都很便利。加上西安产业发达,又是旅游胜地,这些因素让西安国内客流常年处于高位,间接影响了打造国际枢纽的必要性。此外,也是因为接近国内几何中心,西安无论哪个方向的洲际航线,都得使用宽体机。二线枢纽用宽体机飞国际线,往往存在客流不足、上座率不高的情况。,十大正规网赌。
12月27日,海口深化打造“国际演艺之都” 明年拟引进大型演唱会超12场,1995年,帕哈罗河也发生一次决堤,帕哈罗社区及超过1000公顷农业用地被淹,2人死亡,经济损失将近1亿美元。加州去年通过一项法律,推动投入资金用于堤坝建设。这一计划定于2024年开始。,365bet手机在线注册,澳门永利登入注册,葡京娱乐2。
时事2:皇冠hg8868
12月27日,“奥运健儿公益服务大行动”走进广西崇左,其次,高管薪酬面临行业性压制。尽管公开信息未披露北京人寿具体的高管薪酬数字,但其所处的行业背景值得关注。近年来,在财政部“限薪令”和行业周期下行的影响下,保险业高管薪酬整体呈下降趋势。特别是对于北京人寿这类股权结构中包含地方国资背景(如北京供销社、顺鑫控股)的企业,其薪酬体系受到的政策约束更为严格。行业数据显示,2024年已无国资背景的非上市险企董监高年薪超过500万元。,飞五棋牌官方网站版,万博manbetx最新体育版,乐动体育手机版登录。
12月27日,【好评中国】破“堵点”通“循环”,内需市场“活”起来,股东大会出现不一致声音的情况从今年起一直存在,国任保险今年8月召开的第四十六次临时股东大会上,通过了选举独立董事孟宾的议案,此次议案同样有6.01亿票反对。今年4月召开的第四十五次股东大会通过了多项报告与议案,其中《关于公司2025年度财务预算方案(草案)的议案》遭到6.5亿票反对。,ag厅真的吗,游戏牛牛,大富豪在线平台。
时事3:世界杯开户网
12月27日,商务部:强烈反对欧委会密集对中国企业发起FSR调查,西部证券发布研报称,据液冷产业链最前沿数据,2026年谷歌TPUv7及以上等级芯片预计出货约220万颗—230万颗,测算2026年谷歌机柜液冷市场规模为24亿美元—29亿美元。展望2026年,国产芯片出货有望保持高增,叠加AI超节点整机出货形式采用率的快速提升,将给国内液冷市场带来高增机遇。,必赢亚洲手机,欢乐炸金花最新安卓版下载,2020欧洲杯德国队。
12月27日,广东湛江今年前11个月对东盟进出口同比增长9.5%,根据全球汽车行业信息资讯机构JATO数据,2023年上汽集团在欧洲十三国的出口量最多,去年全年出口量为242861辆,其次是吉利集团和比亚迪,分别为22486辆和15976辆。,买球在哪买最好,天博国际网站多少,体育网手机比分。
时事4:血拼赢三张
12月27日,【理响中国·铿锵有理】坚持内需主导,建设强大国内市场,“你们做的是具有历史意义的事情,已经取得很好的成绩,再接再厉,前途光明。”,微信捕鱼版红包,狗万体育官方网站,世界杯网上彩票投注。
12月27日,黑龙江省绥化市人大常委会原副主任宋树生被开除党籍,比如2024年一季度,全聚德(002186.SZ)实现营业收入3.58亿元,同比增长11.99%;归母净利润1530.71万元,同比增长66.85%。,pg欢乐嘉年华爆分,可以打真钱的棋牌,万博官网网页版首页登陆不了。
责编:冯春莲
审核:张全明
责编:康文华












