LLM怎么融入推荐系统?特征提取与召回
特征提取、召回排序、用户意图理解三路径详解
原题:如何将大语言模型的能力融入推荐系统中?请从特征提取、召回排序、用户意图理解等角度阐述可能的技术路径与挑战。
向量检索 · 快手真题
30 秒回答
- 物品语义特征:用LLM生成item的文本摘要、标签、情感极性,替代人工标注
- 用户兴趣画像:将用户行为序列(点击、评论)输入LLM,抽取动态兴趣标签
- 交叉特征生成:LLM理解item A和item B的语义关联,生成隐式交叉特征
回答与解析
核心思路
LLM融入推荐不是"替换"而是"增强",关键是找到传统模型做不了或做不好的环节,用LLM的语义理解能力补位。
三阶段技术路径
1. 特征提取层(最成熟)
- 物品语义特征:用LLM生成item的文本摘要、标签、情感极性,替代人工标注
- 用户兴趣画像:将用户行为序列(点击、评论)输入LLM,抽取动态兴趣标签
- 交叉特征生成:LLM理解item A和item B的语义关联,生成隐式交叉特征
快手实践:用LLM解析短视频标题/ASR文本,生成结构化标签,喂给双塔模型
2. 召回层(探索中)
| 方案 | 原理 | 挑战 |
|---|---|---|
| 语义向量召回 | Item→LLM Embedding→向量库 | 推理成本高,需离线预计算 |
| 生成式召回 | LLM直接生成候选item ID或描述 | 需微调适配ID空间,幻觉问题 |
| 对话式交互 | 用户query→LLM理解→扩展语义召回 | 适合搜索推荐联动场景 |
3. 排序层(谨慎切入)
- 重排序阶段:用LLM做精排后的多样性重排(MMR+语义去重)
- 推荐理由生成:非排序本身,但提升CTR和用户体验
- 直接打分:Prompt预测点击概率——仅适合冷启动或长尾,全量不经济
关键挑战
计算成本 vs 实时性
- 解法:LLM特征离线预计算 + 在线轻量模型;蒸馏小模型替代在线LLM
ID空间与语义空间错位
- 传统推荐强依赖ID共现,LLM擅长语义;需设计ID-语义对齐的联合训练
评估困境
- LLM引入后,离线AUC可能涨但线上GMV跌(语义相关≠转化相关),需强化因果推断评估
我的判断
当前ROI最高的落地点是特征增强+冷启动场景,而非端到端替换。快手这类短视频场景,LLM在理解视频内容、生成解释性推荐理由上价值最大。
学习建议
建议系统学习该知识点
口语版讲法(约4分钟)
- 一句话定位:LLM不是替代推荐,而是补位传统模型做不好或做不了的环节
- 边界划分:特征提取最成熟,召回探索中,排序谨慎切入
- 真实业务场景:快手短视频,用LLM生成标签提升冷启效果
- 落地风险与前提:计算成本、ID-语义对齐、评估困境
- 工程师姿态收尾:ROI最高的是特征增强+冷启动,不是端到端替换
这道题其实问的是,大模型怎么跟推荐系统结合,而不是谁取代谁。我的核心看法是,LLM是来补位的,它擅长语义理解,能帮传统模型解决那些它们做不了或者做不好的环节。所以我不会一上来就说用LLM端到端替换推荐模型,那个成本太高,也不现实。
具体来说,我会从三个层面去考虑。先说特征提取,这块最成熟,很多公司已经在用了。比如快手,他们用LLM解析短视频的标题和ASR文本,生成结构化的标签,比如场景、情绪、人物,喂给双塔模型。这些标签以前靠人工标注,成本高还覆盖不全,LLM能自动化,而且质量不差。再一个,用户兴趣画像也可以用LLM来增强,比如把用户的历史行为序列,像点击、评论,输入LLM,让它抽取出动态的兴趣标签,比如最近偏好旅行类Vlog,而不是静态的标签。
然后是召回层,这块还在探索中。一种做法是语义向量召回,把item通过LLM生成Embedding,存到向量库,离线预计算,在线用ANN检索。另一种是生成式召回,让LLM直接生成候选item的ID或者描述,但需要微调来适配ID空间,而且有Hallucination问题,生成不存在的item。还有一种是对话式交互,用户query进来,LLM理解意图后扩展语义,适合搜索和推荐联动的场景。这里有个边界:语义向量召回适合冷启动和长尾内容,而ID协同过滤在头部内容上仍然更高效,所以真正落地时,我倾向两者结合,比如用语义召回补充协同过滤覆盖不到的部分。
排序层我比较谨慎。LLM直接打分,比如用Prompt预测点击概率,成本太高,全量跑不经济,只适合冷启动或长尾。我更看重的是重排序阶段,用LLM做精排后的多样性重排,比如用MMR加语义去重,避免推荐结果都是同质化内容。另外,生成推荐理由,比如这段视频为什么推荐给你,虽然不是排序本身,但能提升CTR和用户体验。
不过落地有几个关键风险。先说计算成本和实时性,LLM推理慢,全量在线调用不现实。解法是离线预计算特征,在线用轻量模型,或者用Distillation蒸馏小模型替代在线LLM。接着说ID空间和语义空间的错位,传统推荐强依赖ID共现,LLM擅长语义,两者要联合训练做对齐,不然离线AUC涨了,线上GMV可能跌,因为语义相关不一定等于转化相关。再补充评估困境,引入LLM后,因果推断更难做了,需要更细致的A/B实验设计。
所以我会特别关注评估环节,尤其是离线指标和线上业务指标不一致的问题。比如,LLM生成的推荐理由让用户点击更多,但实际购买转化没有提升,这时候怎么判断是LLM的问题还是排序模型的问题?这个点挺有意思。
最后,我的判断是,当前ROI最高的落地点是特征增强和冷启动场景,而不是端到端替换。像快手这种短视频场景,LLM在理解视频内容、生成解释性推荐理由上价值最大。我更倾向把它当作一个增强模块,而不是核心排序模型。
关键一句:LLM引入后,离线AUC涨但线上GMV跌,评估困境怎么解决?
面试官还可能这样问
- 问法 1 · 场景切入
假设你在做电商推荐,用户搜索完“运动鞋”没下单,过一会儿又搜“跑步鞋”,传统协同过滤可能当两个独立事件。你觉得大模型能怎么理解这背后的真实意图?具体怎么用上?
- 问法 2 · 层层追问
推荐系统里特征、召回、排序,你觉得哪个环节最值得用大模型?……那特征提取具体怎么搞?……如果让你用大模型直接做召回,你会怎么设计?
- 问法 3 · 直球架构
请从特征提取、召回、排序三个阶段,分别说出大模型落地推荐系统的一种技术路径和对应的主要挑战。