Multi-modal RAG 原理与挑战
技术原理、系统架构与关键挑战,应用场景举例
原题:请详细介绍多模态检索增强生成(Multi-modal RAG)的技术原理、系统架构和关键挑战,并举例说明其应用场景。
多模态 · 阿里真题
回答与解析
原理与架构
多模态 RAG 从文本、图像、音频或视频中检索外部证据,再由能消费相应模态的模型回答。典型流程是:OCR、ASR 或视觉编码入库,分块时保留页码、区域和时间戳;查询做模态识别与改写;多路召回、跨模态重排;最后编排上下文、生成并验证引用。
索引可将多模态对齐到共享向量空间,也可为各模态分别建索引后用 RRF、分数校准或重排器晚融合。共享空间便于跨模态检索但可能损失模态细节;分索引保留专用能力却增加路由和校准复杂度。
关键挑战包括:细粒度区域或时间片对齐;OCR/ASR 错误和域偏移;有限上下文内的证据去重与排序;版权、隐私、提示注入和访问控制。评估要拆分各模态 Recall@K、跨模态重排、答案忠实度、引用定位、尾延迟和成本。财报图表问答、设备图片诊断、视频定位和商品图文客服都是适用场景,但模型与索引选择必须由目标数据基准决定。
口语版讲法(约90秒)
- 入库保留跨模态内容及空间时间锚点
- 共享空间与分索引晚融合各有取舍
- 跨模态重排后再编排证据
- 召回、引用、忠实度和治理分层验收
- 架构选择由目标数据与质量成本基准决定
多模态 RAG 先从文本、图片、音频或视频检索证据,再让多模态模型基于证据回答。入库时除了 OCR、ASR 或视觉编码,还要保存页码、图像区域和视频时间戳,否则召回后无法精确引用。
索引有两条主线:把模态映射到共享向量空间,或使用各自的专用索引再做名次融合、分数校准和跨模态重排。前者简单但可能损失细节,后者能力专用但系统复杂。
难点是粒度与对齐。问题可能只涉及图表中的一列或视频中的一个片段;OCR、ASR 错误和域偏移也会传递到生成。评估要分别看各模态 Recall@K、重排、证据忠实度、引用定位、尾延迟和成本;访问控制、版权和恶意内容必须在资产读取层执行。上线前我会用带区域标注和时间戳的真实问题回放,单独统计 OCR 或 ASR 错误造成的漏召回,并验证删除一项资产后,对应向量、缩略图和缓存都被同步清理,防止旧证据继续被引用。
关键一句:多模态RAG的核心是跨模态检索与可定位证据。
核验来源
面试官还可能这样问
- 问法 1 · 场景切入
假设你在做电商智能导购,用户上传一张穿搭照片,说“帮我找类似的衣服”,同时输入“想要休闲风格”。你怎么同时处理图片和文字两个query?检索和生成环节分别要考虑什么?
- 问法 2 · 层层追问
RAG里文本检索你肯定熟悉。但如果query里既有文本又有图片……你怎么统一表示它们?……检索出来的结果可能有图文混合,生成时怎么把两种模态的信息融合起来?
- 问法 3 · 直球架构
设计一个多模态RAG系统,要求能同时接受文本和图像输入,输出图文混合的答案。请从编码、检索、融合、生成几个环节讲清楚架构方案,并指出关键挑战。