跳到正文

Multi-modal RAG 是什么?

相比文本RAG的技术挑战、核心组件与典型应用场景

原题:请解释什么是多模态检索增强生成(Multi-modal RAG),并说明其相比传统文本RAG的技术挑战、核心组件及典型应用场景。

多模态 · 阿里真题

30 秒回答

  1. 明确多模态RAG的定义(支持文本、图像、视频、音频等多模态输入和检索)
  2. 技术挑战(跨模态语义对齐、多模态索引构建、模态融合策略)
  3. 核心组件(多模态编码器、跨模态检索器、多模态生成器)
  4. 典型应用场景(电商图文搜索、医疗影像诊断、工业质检、多模态客服)

回答与解析

答案要点

  • 明确多模态RAG的定义(支持文本、图像、视频、音频等多模态输入和检索)
  • 技术挑战(跨模态语义对齐、多模态索引构建、模态融合策略)
  • 核心组件(多模态编码器、跨模态检索器、多模态生成器)
  • 典型应用场景(电商图文搜索、医疗影像诊断、工业质检、多模态客服)

什么是多模态RAG

传统RAG只检索文本知识,多模态RAG将检索范围扩展到图像、视频、音频、表格等多模态数据,实现"以文搜图、以图搜文、跨模态联合推理"的增强生成。


核心挑战 vs 文本RAG

维度 传统文本RAG 多模态RAG
表征空间 单一文本Embedding空间 需对齐文本、图像、视频等多个异构空间
检索粒度 文档/段落级 需支持区域级(如图中物体)、帧级(视频关键帧)
融合难度 文本拼接即可 需解决模态间语义鸿沟、信息冲突

三大技术难点:

  • 跨模态对齐:如何让"猫的图片"和"猫的描述"在向量空间相近
  • 多模态索引:图像怎么切分、视频关键帧如何抽取、音频时序对齐
  • 生成一致性:LLM需理解非文本输入,输出要 grounding 到具体模态内容

核心组件架构

多模态输入 → [多模态编码器] → 统一Embedding空间 → [跨模态检索器] 
                                                    ↓
                    检索结果(图文混合) → [多模态融合模块] → [多模态LLM] → 生成输出

关键模块:

  • 编码层:CLIP/Chinese-CLIP(图文)、ImageBind(图文音)、Q-Former(细粒度)
  • 检索层:向量库支持多模态索引(如Milvus多向量集合)、重排序模型
  • 生成层:LLaVA、Qwen-VL、GPT-4V等多模态大模型,支持图文交错输入

典型应用场景

  • 电商智能导购:用户上传穿搭图,检索相似商品图+详情文本,生成搭配建议
  • 医疗辅助诊断:CT影像检索相似病例图像+诊断报告,生成综合分析
  • 工业设备运维:故障现场照片+设备日志,跨模态检索维修手册和案例视频
  • 教育多模态答疑:学生圈出题目图片区域,检索对应知识点讲解视频片段

一句话总结

多模态RAG的本质是把"检索"从文本知识库扩展到多模态世界,让大模型能"看见"并"引用"真实世界的多元信息

口语版讲法(约4分钟)

  • 一句话定位:多模态RAG的本质是让大模型能引用非文本信息
  • 边界划分:什么时候必须上多模态,什么时候纯文本就够了
  • 核心组件:编码、检索、生成三块,重点讲跨模态对齐这个坑
  • 业务场景:电商图文搜索的落地挑战
  • 风险与取舍:索引构建成本、模态冲突、我的判断

这道题其实是在问,当大模型需要引用的不只是文字,还有图片、视频、音频这些信息时,检索增强生成要怎么做。传统RAG只处理文本,但真实世界的信息是多模态的。所以多模态RAG的核心就是让模型能“看见”并引用这些非文本数据。

先说边界。多模态RAG不是万能的。如果业务场景里用户只问纯文本问题,比如“退货流程是什么”,那传统文本RAG就够了。但一旦涉及到“这个商品长什么样”、“帮我找一张和这个类似的图”,或者“这个CT影像对应什么诊断”,就必须上多模态。落地时往往不是二选一,而是文本RAG和多模态RAG一起上,根据输入类型路由到不同的检索通道。

核心组件其实就三块:多模态编码器、跨模态检索器、多模态生成器。编码器负责把不同模态的数据映射到统一的向量空间,最典型的就是CLIP,它让文本和图像在同一个空间里可比。检索器在这个统一空间里做相似度搜索,找到相关的图文片段。生成器则是一个能理解多模态输入的大模型,比如LLaVA或Qwen-VL,它接收检索结果和用户问题,生成最终回答。

这里有个大坑:跨模态语义对齐。说白了,怎么让“一只黑猫”的文本描述和一张黑猫的图片在向量空间里距离足够近。训练数据如果不够好,或者模态差异太大,比如音频和视频,对齐就很难。我上线前一定会用一批人工标注的query去测召回质量,看看图文是否真的匹配。另一个坑是索引构建:图像怎么切分?视频关键帧怎么抽?音频怎么分片?这些都得根据具体模态和数据特点来设计,没有通用方案。

举个例子,电商智能导购。用户上传一张穿搭图,想找类似的商品。系统先对图片做编码,在向量库里检索相似商品图,同时检索对应的详情文本。然后多模态大模型结合这些信息,生成搭配建议。这里常见失败场景是:用户上传的图背景复杂,模型可能只关注了背景而非衣服本身。所以我会在检索前加一层物体检测,先定位主体区域再编码。

说到检索,其实还有一个延伸问题:多模态检索的排序怎么做?图文混排时,单纯靠向量距离不够,通常需要二次重排,比如用Cross-Encoder对图文对做更精细的匹配。但重排的计算成本很高,所以要做级联策略。

最后说说我的判断。多模态RAG的落地前提是数据质量和索引成本可控。如果业务里多模态数据量巨大,比如上亿张图,索引构建和更新就是个大工程。我会更倾向于先用纯文本RAG兜底,对多模态查询做降级处理,比如用图片的文本描述替代原图检索。等基础设施成熟了再逐步上线多模态。说到底,多模态RAG的本质是把“检索”从文本知识库扩展到多模态世界,但工程上永远要在效果和成本之间做取舍。

关键一句:多模态检索的排序策略,图文混排时向量距离不够,需要级联重排。

面试官还可能这样问

  1. 问法 1 · 场景切入

    假设你做一个电商智能导购,用户上传一张穿搭图,想找类似商品。除了文本描述,你还需要处理图片检索、图文融合生成推荐。这种场景下,你怎么设计一个能同时利用图片和文本知识的检索增强生成系统?

  2. 问法 2 · 层层追问

    传统RAG你肯定熟悉,就是文本检索加生成。那如果知识库里既有文本也有图片,甚至视频,你打算怎么让模型能同时理解它们?……检索的时候,文本和图片的特征空间不一样,怎么对齐?……最后生成时,怎么把图片信息用进去?

  3. 问法 3 · 直球架构

    说一下多模态RAG的定义,跟传统文本RAG比,技术上多了哪些挑战?核心组件有哪些?你觉得哪些场景特别适合用它来落地?

同模块相关题目