跳到正文

LLM怎么融入推荐系统?意图理解与生成

特征表示、用户意图理解、生成式推荐三条技术路径

原题:在现代推荐系统中,如何有效融合大语言模型的能力?请从特征表示、用户意图理解、生成式推荐等角度分析可能的技术路径与挑战。

RAG基础 · 快手真题

回答与解析

一、特征表示层面:LLM作为增强编码器

核心思路:利用LLM的语义理解能力,将非结构化内容(商品标题、视频描述、用户评论)转化为高质量稠密向量。

  • 物品侧:用LLM编码item文本,替代或补充传统ID embedding,缓解冷启动
  • 用户侧:聚合用户历史行为的文本描述,生成动态用户画像向量
  • 融合方式:LLM特征与ID特征双塔并行,后期拼接或门控融合

关键挑战:LLM特征维度高、推理慢,需蒸馏到轻量模型或离线预计算。


二、用户意图理解:从匹配到推理

传统推荐是"相关度匹配",LLM可实现"意图推理":

场景 传统方法 LLM增强
搜索推荐 关键词匹配 语义改写、需求扩展("平价手机"→"2000元档骁龙机型")
会话推荐 序列建模 多轮对话理解,捕捉隐性偏好
跨域推荐 难以迁移 利用LLM的通用知识桥接领域gap

落地形式:LLM作为上游模块,输出意图标签或改写后的query,喂给下游精排模型。


三、生成式推荐:直接生成结果

两条技术路线:

  1. 生成Item ID:将item ID视为token,用seq2seq生成下一个观看的video ID

    • 优势:统一生成框架,天然支持多任务
    • 难点:ID无语义,需配合语义ID或分层索引
  2. 生成推荐理由/模板:LLM生成个性化文案,提升点击率

    • 更成熟,快手已落地"为你推荐"的个性化话术

四、核心挑战与应对

挑战 应对策略
幻觉(推荐不存在item) 约束解码+检索增强(RAG),先召回候选集再重排
实时性 LLM只做离线特征或粗排,精排保持轻量;或投机解码
成本 大小模型级联,简单请求走小模型,复杂请求触发LLM
评估困难 离线用A/B test,在线关注用户停留时长等长期指标

五、快手场景的特殊考量

短视频推荐的核心是实时性+多样性

  • LLM适合做session级别的兴趣总结(如识别用户从"搞笑"转向"知识")
  • 不适合逐帧实时推理,可采用小时级更新用户画像向量的折中方案

学习建议

建议系统学习该知识点

口语版讲法(约4分钟)

  • 一句话定位:本质是LLM如何融入推荐系统
  • 特征表示:LLM增强编码,冷启动收益与离线蒸馏
  • 意图理解:从匹配到推理,适合上游模块
  • 生成式推荐:直接生成ID或文案,落地风险
  • 风险与取舍:幻觉、实时性、成本,我的判断

这道题其实问的是,在大模型时代,推荐系统怎么「吃」上LLM的能力,不是简单替换,而是找到最经济的融合点。我主要从三个技术路径来看:特征表示、用户意图理解,还有生成式推荐。先说特征表示。传统推荐靠ID embedding,冷启动很弱。LLM能把商品标题、用户评论这些非结构化文本变成高质量向量,本质上是用语义理解补上ID的盲区。具体落地时,我会把物品侧和用户侧分开处理。物品侧直接用LLM编码文本,用户侧聚合历史行为生成动态画像。但这里有个坑:LLM推理太慢,维度又高,线上扛不住。所以实际我会把LLM特征离线预计算,再蒸馏到轻量模型,或者和ID特征做门控融合,线上只走双塔后期拼接。前提是离线更新频率要够,如果商品信息秒级变化,这条路就走不通。再说用户意图理解。传统推荐是匹配,LLM能做推理。比如用户搜「平价手机」,传统靠关键词,LLM能理解成「2000元档骁龙机型」,做语义改写或需求扩展。但LLM不适合直接做实时排序,我倾向于把它放在上游模块,输出意图标签或改写后的query,喂给下游精排。这样既利用了推理能力,又不影响实时性。边界很清楚:LLM适合session级或跨域推理,不适合逐请求实时响应。第三个路径是生成式推荐,直接让LLM生成结果。一条路是生成Item ID,把ID当token,seq2seq预测下一个视频ID。好处是统一框架,但ID无语义,需要配合语义ID或分层索引,否则生成出来不存在的东西就是幻觉。另一条路更成熟:生成推荐理由,比如快手「为你推荐」的个性化话术,提升点击率。但生成推荐理由有个风险:如果文案和实际内容不符,用户点进去发现被骗,长期体验会崩。所以我会用约束解码加RAG,先召回候选集,再让LLM基于候选集生成文案,确保内容真实。落地时核心挑战是幻觉、实时性和成本。幻觉靠检索增强和约束解码;实时性靠LLM只做离线特征或粗排,精排保持轻量;成本靠大小模型级联,简单请求走小模型,复杂请求才触发LLM。具体到短视频场景,我会把LLM定位成session级兴趣总结工具,比如识别用户从搞笑转向知识,小时级更新用户画像,而不是逐帧推理。如果只让我选一个路径,我更倾向特征表示加意图理解组合,因为生成式推荐在实时性和幻觉上风险太大,现阶段更适合做锦上添花。

还有一个我没展开的点:LLM特征和ID特征怎么融合效果最好?直接拼接还是门控?我最近看到一些工作用MoE动态选择特征来源,但线上工程复杂度很高。

关键一句:LLM特征与ID特征融合方式的选择,门控 vs MoE vs 直接拼接,以及工程复杂度

面试官还可能这样问

  1. 问法 1 · 场景切入

    假设你在做电商推荐,用户搜了“夏季连衣裙”,但系统推荐的都是碎花款,用户其实想要纯色的。你打算怎么用大模型来理解这种没说出来的意图?

  2. 问法 2 · 层层追问

    你觉得大模型在推荐系统里主要能做什么?……具体到特征表示,它怎么帮我们理解物品和用户?……它的推理能力怎么用来理解用户意图?……最后,有没有可能让大模型直接生成推荐结果?

  3. 问法 3 · 直球架构

    请从特征表示、用户意图理解、生成式推荐三个角度,直接讲讲你怎么把大模型融合到推荐系统里,以及每个角度会遇到什么挑战。

同模块相关题目