LLM怎么融入推荐系统?意图理解与生成
特征表示、用户意图理解、生成式推荐三条技术路径
原题:在现代推荐系统中,如何有效融合大语言模型的能力?请从特征表示、用户意图理解、生成式推荐等角度分析可能的技术路径与挑战。
RAG基础 · 快手真题
回答与解析
一、特征表示层面:LLM作为增强编码器
核心思路:利用LLM的语义理解能力,将非结构化内容(商品标题、视频描述、用户评论)转化为高质量稠密向量。
- 物品侧:用LLM编码item文本,替代或补充传统ID embedding,缓解冷启动
- 用户侧:聚合用户历史行为的文本描述,生成动态用户画像向量
- 融合方式:LLM特征与ID特征双塔并行,后期拼接或门控融合
关键挑战:LLM特征维度高、推理慢,需蒸馏到轻量模型或离线预计算。
二、用户意图理解:从匹配到推理
传统推荐是"相关度匹配",LLM可实现"意图推理":
| 场景 | 传统方法 | LLM增强 |
|---|---|---|
| 搜索推荐 | 关键词匹配 | 语义改写、需求扩展("平价手机"→"2000元档骁龙机型") |
| 会话推荐 | 序列建模 | 多轮对话理解,捕捉隐性偏好 |
| 跨域推荐 | 难以迁移 | 利用LLM的通用知识桥接领域gap |
落地形式:LLM作为上游模块,输出意图标签或改写后的query,喂给下游精排模型。
三、生成式推荐:直接生成结果
两条技术路线:
生成Item ID:将item ID视为token,用seq2seq生成下一个观看的video ID
- 优势:统一生成框架,天然支持多任务
- 难点:ID无语义,需配合语义ID或分层索引
生成推荐理由/模板:LLM生成个性化文案,提升点击率
- 更成熟,快手已落地"为你推荐"的个性化话术
四、核心挑战与应对
| 挑战 | 应对策略 |
|---|---|
| 幻觉(推荐不存在item) | 约束解码+检索增强(RAG),先召回候选集再重排 |
| 实时性 | LLM只做离线特征或粗排,精排保持轻量;或投机解码 |
| 成本 | 大小模型级联,简单请求走小模型,复杂请求触发LLM |
| 评估困难 | 离线用A/B test,在线关注用户停留时长等长期指标 |
五、快手场景的特殊考量
短视频推荐的核心是实时性+多样性:
- LLM适合做session级别的兴趣总结(如识别用户从"搞笑"转向"知识")
- 不适合逐帧实时推理,可采用小时级更新用户画像向量的折中方案
学习建议
建议系统学习该知识点
口语版讲法(约4分钟)
- 一句话定位:本质是LLM如何融入推荐系统
- 特征表示:LLM增强编码,冷启动收益与离线蒸馏
- 意图理解:从匹配到推理,适合上游模块
- 生成式推荐:直接生成ID或文案,落地风险
- 风险与取舍:幻觉、实时性、成本,我的判断
这道题其实问的是,在大模型时代,推荐系统怎么「吃」上LLM的能力,不是简单替换,而是找到最经济的融合点。我主要从三个技术路径来看:特征表示、用户意图理解,还有生成式推荐。先说特征表示。传统推荐靠ID embedding,冷启动很弱。LLM能把商品标题、用户评论这些非结构化文本变成高质量向量,本质上是用语义理解补上ID的盲区。具体落地时,我会把物品侧和用户侧分开处理。物品侧直接用LLM编码文本,用户侧聚合历史行为生成动态画像。但这里有个坑:LLM推理太慢,维度又高,线上扛不住。所以实际我会把LLM特征离线预计算,再蒸馏到轻量模型,或者和ID特征做门控融合,线上只走双塔后期拼接。前提是离线更新频率要够,如果商品信息秒级变化,这条路就走不通。再说用户意图理解。传统推荐是匹配,LLM能做推理。比如用户搜「平价手机」,传统靠关键词,LLM能理解成「2000元档骁龙机型」,做语义改写或需求扩展。但LLM不适合直接做实时排序,我倾向于把它放在上游模块,输出意图标签或改写后的query,喂给下游精排。这样既利用了推理能力,又不影响实时性。边界很清楚:LLM适合session级或跨域推理,不适合逐请求实时响应。第三个路径是生成式推荐,直接让LLM生成结果。一条路是生成Item ID,把ID当token,seq2seq预测下一个视频ID。好处是统一框架,但ID无语义,需要配合语义ID或分层索引,否则生成出来不存在的东西就是幻觉。另一条路更成熟:生成推荐理由,比如快手「为你推荐」的个性化话术,提升点击率。但生成推荐理由有个风险:如果文案和实际内容不符,用户点进去发现被骗,长期体验会崩。所以我会用约束解码加RAG,先召回候选集,再让LLM基于候选集生成文案,确保内容真实。落地时核心挑战是幻觉、实时性和成本。幻觉靠检索增强和约束解码;实时性靠LLM只做离线特征或粗排,精排保持轻量;成本靠大小模型级联,简单请求走小模型,复杂请求才触发LLM。具体到短视频场景,我会把LLM定位成session级兴趣总结工具,比如识别用户从搞笑转向知识,小时级更新用户画像,而不是逐帧推理。如果只让我选一个路径,我更倾向特征表示加意图理解组合,因为生成式推荐在实时性和幻觉上风险太大,现阶段更适合做锦上添花。
还有一个我没展开的点:LLM特征和ID特征怎么融合效果最好?直接拼接还是门控?我最近看到一些工作用MoE动态选择特征来源,但线上工程复杂度很高。
关键一句:LLM特征与ID特征融合方式的选择,门控 vs MoE vs 直接拼接,以及工程复杂度
面试官还可能这样问
- 问法 1 · 场景切入
假设你在做电商推荐,用户搜了“夏季连衣裙”,但系统推荐的都是碎花款,用户其实想要纯色的。你打算怎么用大模型来理解这种没说出来的意图?
- 问法 2 · 层层追问
你觉得大模型在推荐系统里主要能做什么?……具体到特征表示,它怎么帮我们理解物品和用户?……它的推理能力怎么用来理解用户意图?……最后,有没有可能让大模型直接生成推荐结果?
- 问法 3 · 直球架构
请从特征表示、用户意图理解、生成式推荐三个角度,直接讲讲你怎么把大模型融合到推荐系统里,以及每个角度会遇到什么挑战。