生成式推荐系统有哪些改进方向?
模型架构、训练策略、系统集成三大方向展望
原题:结合当前生成式推荐系统的技术现状与局限,展望其未来发展,在模型架构、训练策略、系统集成及应用场景等方面,有哪些值得探索的改进方向?请阐述你的思考与判断依据。
Agent · 小红书真题
回答与解析
当前核心瓶颈
生成-评估鸿沟:生成目标(MLE)与推荐目标(点击/转化)不一致,导致生成内容"流畅但无用"
曝光偏差固化:自回归生成高度依赖历史曝光,难以突破信息茧房
推理效率约束:自回归解码延迟高,难以支撑在线实时推荐
四维度改进方向
1. 模型架构:从"纯生成"到"生成-判别协同"
| 方向 | 具体思路 | 判断依据 |
|---|---|---|
| Diffusion+LLM混合 | Diffusion负责候选集生成(多样性),LLM负责重排序(个性化) | Diffusion在多样性生成上有理论优势,弥补LLM模式坍塌 |
| 多模态统一生成 | 图文视频统一token化,端到端生成推荐理由+封面+标题 | 小红书内容形态丰富,模态对齐能提升种草转化率 |
| 隐式反馈显式化 | 将停留时长、滑动速度等连续信号编码为生成条件 | 解决当前序列建模只依赖点击ID的稀疏问题 |
2. 训练策略:推荐专用的RL优化
- Reward设计:组合即时反馈(点击)+ 长期价值(关注/复访)+ 多样性约束,避免单一CTR导向
- DPO替代PPO:推荐场景偏好对数据易获取(曝光vs点击即为隐式偏好对),DPO训练更稳定
- 对比学习增强负样本:难负样本来自"曝光未点击"而非随机采样,提升判别能力
3. 系统集成:RAG与Agent的深度融合
用户Query → Agent规划(意图识别→工具调用)→ RAG检索实时热点/库存 →
生成式模型融合多源信息 → 交互式澄清(多轮)→ 最终推荐
- RAG增强:接入实时笔记池、趋势话题,解决生成内容"过时"问题
- Agent协同:支持多轮对话式推荐,主动询问偏好(如"喜欢户外还是室内活动?"),突破单次请求的信息局限
4. 应用场景:从"推荐结果"到"推荐过程"
| 场景 | 创新点 |
|---|---|
| 可解释推荐 | 生成个性化推荐理由,提升用户信任 |
| 跨域生成 | 基于穿搭笔记生成配饰推荐,实现场景延伸 |
| 创作者辅助 | 反向生成"什么样的标题/封面更容易被推荐",打通双边平台 |
关键判断依据
- 技术可行性:Diffusion加速(如SDXL-Turbo)、投机采样等已使生成延迟降至可接受范围
- 业务匹配度:小红书"内容即广告"的形态,天然适合生成式描述而非传统CTR预估
- 数据飞轮:生成式推荐可产出自然语言形式的推荐理由,本身就是高质量训练数据
学习建议
建议从生成式模型的基本原理入手,结合推荐系统经典架构,多阅读顶会论文(如RecSys、KDD)中关于生成式推荐的最新研究,关注RAG与Agent在实际场景中的应用案例。
口语版讲法(约4分钟)
- 生成式推荐本质是生成与推荐的博弈
- 模型架构:Diffusion加LLM混合
- 训练策略:用DPO替代PPO
- 系统集成:RAG加Agent深度整合
- 落地风险与判断收尾
这道题其实是在问,生成式推荐现在最大的矛盾是什么,以及怎么解这个矛盾。我觉得核心矛盾就是生成和推荐的目标不一致,模型学的是流畅生成,但业务要的是点击和转化,这就导致生成内容看着挺顺眼,但实际效果不行。另一个问题是它太依赖历史曝光,容易困在信息茧房里,而且自回归解码太慢,线上根本跑不了实时推荐。
具体怎么改进,我重点讲几个方向。先说模型架构,我觉得未来不会是纯生成式模型一统天下,而是生成和判别协同。具体来说,我会用 Diffusion 加 LLM 混合的方案。Diffusion 负责候选集生成,因为它天然擅长多样性输出,能避免 LLM 那种模式坍塌;LLM 负责重排序,做个性化精排。这样分工明确,各取所长。举个例子,在小红书这种内容平台,Diffusion 可以生成一批封面和标题的候选,LLM 再根据用户历史偏好挑出最可能点击的那个。这里有个前提,就是 Diffusion 的推理速度要够快,现在像 SDXL-Turbo 这些加速方案已经让延迟降到了可接受范围,不然线上没法用。
再一个,训练策略上,我倾向用推荐专用的 RL 优化,但不用 PPO,而是用 DPO。为什么?因为推荐场景里偏好对特别好拿,曝光但没点击就是天然的负样本,比随机采样强得多。DPO 训练更稳定,不用维护一个在线策略模型,工程成本低。我会把奖励设计成即时反馈加长期价值的组合,比如点击、关注、复访都算进去,再加个多样性约束,避免模型只推高 CTR 但同质化的内容。
系统集成这块,我觉得 RAG 加 Agent 是必走的路。生成式推荐有个硬伤,就是模型知识有截止时间,推荐的东西可能过时。用 RAG 接入实时笔记池和趋势话题,就能解决时效性问题。Agent 负责多轮对话,比如用户说想看点什么,Agent 可以反问喜欢户外还是室内,这样信息量就大了,不是一次请求定终身。具体流程是用户 Query 进来,Agent 做意图识别,然后调 RAG 检索实时信息,生成模型融合多源数据出推荐,最后如果用户不满意还能再问一轮。
落地的时候有几个坑得注意。一个是 RAG 的检索质量,如果召回的内容不相关,生成出来的推荐理由就是胡扯,反而伤害体验。所以上线前我会特别关注检索的 重排 效果,用 Cross-Encoder 把 Top-K 再精排一遍。另一个是延迟,Agent 多轮对话加 RAG 检索,整体响应时间很容易超标,得做 KV Cache 和投机采样来优化。
还有一个点值得深入,就是生成式推荐产出的推荐理由本身就是高质量训练数据,可以用来做 Self-RAG 让模型自己学会反思,比如生成的理由用户不买账,模型下次就调整风格。这个数据飞轮怎么设计,我觉得挺有意思。
所以总的来说,我会把生成式推荐看成一种 生成加判别协同的系统,而不是单一的生成模型。Diffusion 和 LLM 混合做架构,DPO 做训练,RAG 加 Agent 做系统,这样才可能既保证多样性又保证个性化,既实时又准确。当然,前提是工程上能压住延迟和检索质量,不然都是空谈。
关键一句:生成式推荐产出的推荐理由可以作为Self-RAG的训练数据,形成数据飞轮
面试官还可能这样问
- 问法 1 · 场景切入
假设你在做电商推荐,用户搜了“夏季连衣裙”,模型生成了几个款式,但点击率很低。你觉得这可能是生成目标(语言流畅)和推荐目标(点击转化)之间的鸿沟导致的。你怎么从模型架构或训练策略上缩小这个差距?
- 问法 2 · 层层追问
生成式推荐现在挺火,你觉得它相比传统推荐有什么独特优势?……但实际落地中,是不是有生成内容“好看不好用”的问题?……比如曝光偏差、推理延迟,你怎么看这些瓶颈?未来从模型、训练到系统,你觉得最值得改的方向是什么?
- 问法 3 · 直球架构
请系统性地展望一下生成式推荐系统的发展方向,包括模型架构(比如生成-判别协同)、训练策略(比如RL优化)、系统集成(比如RAG+Agent),以及应用场景的拓展。说说你的判断依据。