跳到正文

多模态 vs 纯文本大模型怎么选?

从兴趣来源和技术考量分析两种方向,适合职业规划

原题:你更倾向于从事多模态大模型还是纯文本大模型的研究或开发?请说明你的兴趣来源和技术考量。

多模态 · 快手真题

回答与解析

我的倾向:更看好多模态大模型,但认为文本能力是根基

兴趣来源

  • 人类认知本身就是多模态的,纯文本是"压缩后的世界",而多模态更接近AGI的终极形态
  • 快手的核心业务(短视频、直播、电商)天然是多模态的,技术落地空间更大

技术考量

维度 纯文本LLM 多模态大模型
技术成熟度 相对成熟,Scaling Law清晰 仍在快速演进,架构未收敛
核心挑战 数据质量、长上下文、推理能力 模态对齐、训练稳定性、数据配比
创新空间 边际效益递减,需找新范式 架构、训练策略、应用场景都有探索空间
业务价值 通用能力强,但差异化难 视频理解、内容生成、电商导购等场景直接变现

具体技术判断

  • 文本能力是底座:没有强大的文本推理能力,多模态只是"花瓶"
  • 当前瓶颈在对齐:不是简单拼接编码器,而是真正实现跨模态的联合推理
  • 快手场景的独特优势:拥有海量视频-文本配对数据,这是训练多模态模型的稀缺资源

我的定位 希望从多模态切入,但保持对文本核心能力的深耕——不做"调包侠",而是理解视觉编码器、投影层、LLM backbone的协同机制,能在业务中做针对性的架构改造。

口语版讲法(约4分钟)

  • 问题本质是选择技术方向与业务匹配
  • 多模态是趋势但文本是根基
  • 业务场景:快手的视频理解与电商导购
  • 核心挑战在模态对齐
  • 我的取舍:从多模态切入深耕文本

这道题其实是在问,你更看好哪个方向能解决实际问题。我的倾向很明确:更看好多模态大模型,但文本能力是绕不开的根基。

先说我为什么倾向多模态。人类认知本身就是多模态的,你看东西、听声音、说话,这些信息是混在一起的。纯文本其实相当于把世界压缩了一遍,丢了很多信息。而多模态更接近AGI的终极形态。再加上我如果去快手,它的核心业务,短视频、直播、电商,天然就是多模态的。你做一个纯文本模型,在视频理解或者商品推荐里很难直接落地。所以从技术趋势和业务价值来看,多模态的想象空间更大。

但这里有个前提:没有扎实的文本推理能力,多模态就是花瓶。你看现在很多多模态模型,能识别图片里的猫,但问它“猫为什么在桌子上”就答不上来,因为它底层推理能力弱。所以我的策略是,从多模态切入,但持续深耕文本能力。

具体到技术考量,我重点讲一个核心挑战,Multimodal 多模态对齐。这不是简单把视觉编码器和语言模型拼一起,而是真正让它们联合推理。举个例子,在快手的电商场景里,用户上传一个商品视频,里面包含产品外观、使用场景、价格标签。多模态模型需要同时理解视频帧里的视觉特征和语音解说里的文本信息,然后结合用户评论做导购推荐。这中间的对齐就很难:视觉特征和文本特征不在一个语义空间,怎么让它们协同?如果对齐不好,模型可能把红色衣服识别成蓝色,或者忽略视频里的关键文字。

还有一个实际风险是训练稳定性。多模态模型参数量大、数据来源杂,训练时很容易梯度爆炸或者模态坍塌。我如果上线这样的模型,会特别关注数据配比,视觉数据、文本数据、视频-文本配对数据的比例要调得很小心。常见失败场景是,模型过度依赖视觉特征,忽略文本指令,或者反过来。

所以我的判断是,多模态的未来在于对齐技术的突破。现在架构还没收敛,有的用Q-Former,有的用Cross-Attention,有的直接拼接。这个领域创新空间很大,不像纯文本模型已经接近Scaling Law的边际递减。

不过这里有个有意思的延伸:当前多模态模型在做复杂推理时,比如“先看视频里的动作,再结合语音判断情绪”,容易失败。我怀疑根本原因不是对齐不够好,而是文本backbone的推理能力不够强。如果LLM本身推理能力弱,你给它再多视觉信息也没用。所以我在想,是不是应该先把文本backbone的Chain-of-Thought 思维链能力做扎实,再考虑多模态扩展?

总结一下:我更倾向多模态方向,但会死磕文本能力,不做调包侠。我会把多模态看成业务落地的加速器,而文本是模型能力的底座。两者结合才是真正能用的东西。

关键一句:多模态模型推理失败可能根源在文本backbone不够强,而非对齐不足

面试官还可能这样问

  1. 问法 1 · 场景切入

    假设你在两个岗位方向中选择:一个聚焦纯文本模型,另一个聚焦图文视频多模态模型。你会怎样结合自己的真实兴趣、能力证据、技术成熟度和落地空间做决定?

  2. 问法 2 · 层层追问

    你真实投入最多的是文本还是多模态?……两条路线各自的主要技术挑战是什么?……哪些能力可以迁移,哪些需要补齐?……你会用什么项目验证自己的选择?

  3. 问法 3 · 直球技术

    说明你对多模态大模型与纯文本大模型方向的倾向,并从兴趣来源、技术判断、能力匹配和学习计划给出证据。

同模块相关题目