弱多模态+强文本模型怎么协同?
图文理解场景下分工与信息交互机制设计,含数据流与部署优化
原题:给定一个性能有限的多模态模型和一个强大的纯文本大模型(如DeepSeek-R1),请设计一种高效、可扩展的协同推理框架,通过模型间分工与信息交互机制,提升多模态任务(如图文理解、视觉问答)的回答质量。需说明数据流、角色分配、错误控制及实际部署中的优化考虑。
多模态 · 美团真题
回答与解析
核心架构:感知与推理解耦
让多模态模型负责读取像素、OCR、目标和空间关系,让强文本模型基于可追溯的视觉观察做推理。纯文本模型不能直接消费任意“视觉 token”;只有两侧共享兼容表示或经过投影层、适配器与联合训练时才能传递连续视觉特征,否则应交换结构化文本、坐标、裁剪图引用或工具结果。
1. 数据流与角色
- 请求先经过任务分类和安全检查,确定是否需要 OCR、检测、图表解析或通用 VQA。
- VLM 输出结构化 observation,例如对象、属性、关系、区域坐标、OCR 原文和置信度,并保留对应图像区域 ID。
- 文本模型根据问题与 observation 规划推理;需要核实时发出明确的补充视觉查询,例如重新裁剪区域、提高分辨率或调用 OCR。
- 最终答案引用观察项或区域,证据不足时明确拒答或请求人工确认。
2. 错误控制
- 文本模型的自我质疑不能证明视觉事实正确;关键 claim 应通过再次感知、独立 OCR/检测器、规则校验或人工复核验证。
- 置信度需要在目标数据上校准,不能把 0.6、0.85 等数值当作通用路由阈值。
- 两模型答案不一致只表示需要诊断,不能仅凭语义相似度判断哪一侧正确。
3. 部署优化
按图像尺寸和任务类型动态批处理,缓存同一图像或同一文档页的感知结果,并用内容哈希、模型版本和预处理版本作为缓存键。跨不同请求复用视觉 KV Cache 只有在前缀完全兼容且实现明确支持时才安全。为补充视觉调用设置预算、超时和降级路径。
4. 评测
分别评估感知准确率、OCR/定位质量、观察覆盖率、答案正确性、视觉忠实度、拒答质量、延迟和成本;同时保留端到端 bad case,区分感知错、信息传递丢失和文本推理错。
口语版讲法(约4分钟)
- 核心思路:感知-推理分离,小模型看,大模型想
- 数据流设计:视觉压缩token + 自适应路由门控
- 错误控制:三层防护,一致性校验、幻觉检测、回退
- 部署优化:异步流水线、KV Cache复用、边缘-云端分级
- 扩展性与反馈闭环:多VLM_S、LLM_L池化、蒸馏回传
这道题的核心是感知和推理分离。小多模态模型负责看图,把图像信息转成文本大模型能理解的结构化 observation;强文本模型负责复杂推理、知识整合和最终表达。简单说就是,小模型看,大模型想,但大模型不能凭空看图,它只能基于小模型给出的视觉证据推理。
数据流我会这样设计:图片或视频帧先进 VLM,小模型输出多种结果,包括整体 caption、OCR 文本、关键物体列表、位置框、表格结构、候选答案和置信度。然后把这些结果整理成结构化文本,传给纯文本 LLM。LLM 根据用户问题判断这些视觉证据够不够,如果够,就推理并生成答案;如果不够,它生成一个补充请求,比如“请放大右上角表格区域识别数字”或“请确认红色按钮上的文字”,再让 VLM 对 ROI 重新识别。
路由上我会做分级。简单高置信任务,比如 OCR、物体识别、单图描述,可以直接由 VLM 快速回答;中等复杂任务,比如图文问答,让 VLM 输出结构化观察,LLM 做语言组织和逻辑判断;低置信或多步推理任务,比如图表分析、流程图理解、视频事件推断,就进入多轮协同,LLM 不断提出需要补充的视觉证据,VLM 定向返回。
错误控制有几层。先说置信度控制,VLM 对 OCR、检测、分类都要带 confidence,低于阈值不能直接下结论。再看证据对齐,最终答案里的视觉事实要能对应到某条 observation,比如某个 bbox、某段 OCR 或某个检测结果。还要看一致性检查,如果 VLM 候选答案和 LLM 推理结论冲突,要触发复查,而不是让 LLM 强行解释。最后看回退机制,超时或多轮补充失败时,可以返回不确定结论或转人工。
部署上,效率主要靠路由和缓存。简单请求走 fast path,不必每次都调用大模型。视频或文档场景可以缓存视觉 embedding、OCR 结果和页面结构,同一张图或相邻帧不用重复识别。多模型部署时,可以按任务类型路由到专用 VLM,比如 OCR 模型、图表模型、通用 VLM;LLM 侧也可以按成本分层,普通问题用便宜模型,复杂推理再上强模型。
扩展性方面,我会把 VLM 和 LLM 之间的接口标准化成 observation schema。只要接口稳定,后面替换更强的 VLM、增加图表专用模型、接入视频模型,都不会影响上层推理逻辑。
最后可以做反馈闭环。把 LLM 发现的错误、人工修正样本、低置信案例回流,用来微调 VLM 或训练路由器。这样系统不是一次性拼两个模型,而是能持续提升“看得准”和“想得对”的协同效果。
关键一句:纯文本模型不能直接消费任意视觉 token;无兼容表示或适配器时,应通过可追溯的结构化观察与补充视觉查询协同。
面试官还可能这样问
- 问法 1 · 场景切入
假设你在做一个电商客服助手,用户上传一张商品图片问‘这个能用吗?’,你手上的模型一个能看懂图但推理一般,另一个纯文本但特别能推理。你怎么让它们配合,既快又准地给出答案?
- 问法 2 · 层层追问
现在有两个模型,一个小的多模态模型和一个大的纯文本模型,你想让它们协同工作……你会怎么分工?……那视觉信息怎么传给大模型?……如果小模型不确定,怎么处理?
- 问法 3 · 直球架构
设计一个双模型协同推理框架,小多模态模型负责感知,大文本模型负责推理。请说明数据流、角色分配、错误控制,以及部署时怎么优化延迟和吞吐。