跳到正文

生成式推荐系统有哪些改进方向?

模型架构、训练策略、系统集成三大方向展望

原题:结合当前生成式推荐系统的技术现状与局限,展望其未来发展,在模型架构、训练策略、系统集成及应用场景等方面,有哪些值得探索的改进方向?请阐述你的思考与判断依据。

Agent · 小红书真题

回答与解析

当前核心瓶颈

生成-评估鸿沟:生成目标(MLE)与推荐目标(点击/转化)不一致,导致生成内容"流畅但无用"

曝光偏差固化:自回归生成高度依赖历史曝光,难以突破信息茧房

推理效率约束:自回归解码延迟高,难以支撑在线实时推荐


四维度改进方向

1. 模型架构:从"纯生成"到"生成-判别协同"

方向 具体思路 判断依据
Diffusion+LLM混合 Diffusion负责候选集生成(多样性),LLM负责重排序(个性化) Diffusion在多样性生成上有理论优势,弥补LLM模式坍塌
多模态统一生成 图文视频统一token化,端到端生成推荐理由+封面+标题 小红书内容形态丰富,模态对齐能提升种草转化率
隐式反馈显式化 将停留时长、滑动速度等连续信号编码为生成条件 解决当前序列建模只依赖点击ID的稀疏问题

2. 训练策略:推荐专用的RL优化

  • Reward设计:组合即时反馈(点击)+ 长期价值(关注/复访)+ 多样性约束,避免单一CTR导向
  • DPO替代PPO:推荐场景偏好对数据易获取(曝光vs点击即为隐式偏好对),DPO训练更稳定
  • 对比学习增强负样本:难负样本来自"曝光未点击"而非随机采样,提升判别能力

3. 系统集成:RAG与Agent的深度融合

用户Query → Agent规划(意图识别→工具调用)→ RAG检索实时热点/库存 → 
生成式模型融合多源信息 → 交互式澄清(多轮)→ 最终推荐
  • RAG增强:接入实时笔记池、趋势话题,解决生成内容"过时"问题
  • Agent协同:支持多轮对话式推荐,主动询问偏好(如"喜欢户外还是室内活动?"),突破单次请求的信息局限

4. 应用场景:从"推荐结果"到"推荐过程"

场景 创新点
可解释推荐 生成个性化推荐理由,提升用户信任
跨域生成 基于穿搭笔记生成配饰推荐,实现场景延伸
创作者辅助 反向生成"什么样的标题/封面更容易被推荐",打通双边平台

关键判断依据

  • 技术可行性:Diffusion加速(如SDXL-Turbo)、投机采样等已使生成延迟降至可接受范围
  • 业务匹配度:小红书"内容即广告"的形态,天然适合生成式描述而非传统CTR预估
  • 数据飞轮:生成式推荐可产出自然语言形式的推荐理由,本身就是高质量训练数据

学习建议

建议从生成式模型的基本原理入手,结合推荐系统经典架构,多阅读顶会论文(如RecSys、KDD)中关于生成式推荐的最新研究,关注RAG与Agent在实际场景中的应用案例。

口语版讲法(约4分钟)

  • 生成式推荐本质是生成与推荐的博弈
  • 模型架构:Diffusion加LLM混合
  • 训练策略:用DPO替代PPO
  • 系统集成:RAG加Agent深度整合
  • 落地风险与判断收尾

这道题其实是在问,生成式推荐现在最大的矛盾是什么,以及怎么解这个矛盾。我觉得核心矛盾就是生成和推荐的目标不一致,模型学的是流畅生成,但业务要的是点击和转化,这就导致生成内容看着挺顺眼,但实际效果不行。另一个问题是它太依赖历史曝光,容易困在信息茧房里,而且自回归解码太慢,线上根本跑不了实时推荐。

具体怎么改进,我重点讲几个方向。先说模型架构,我觉得未来不会是纯生成式模型一统天下,而是生成和判别协同。具体来说,我会用 Diffusion 加 LLM 混合的方案。Diffusion 负责候选集生成,因为它天然擅长多样性输出,能避免 LLM 那种模式坍塌;LLM 负责重排序,做个性化精排。这样分工明确,各取所长。举个例子,在小红书这种内容平台,Diffusion 可以生成一批封面和标题的候选,LLM 再根据用户历史偏好挑出最可能点击的那个。这里有个前提,就是 Diffusion 的推理速度要够快,现在像 SDXL-Turbo 这些加速方案已经让延迟降到了可接受范围,不然线上没法用。

再一个,训练策略上,我倾向用推荐专用的 RL 优化,但不用 PPO,而是用 DPO。为什么?因为推荐场景里偏好对特别好拿,曝光但没点击就是天然的负样本,比随机采样强得多。DPO 训练更稳定,不用维护一个在线策略模型,工程成本低。我会把奖励设计成即时反馈加长期价值的组合,比如点击、关注、复访都算进去,再加个多样性约束,避免模型只推高 CTR 但同质化的内容。

系统集成这块,我觉得 RAG 加 Agent 是必走的路。生成式推荐有个硬伤,就是模型知识有截止时间,推荐的东西可能过时。用 RAG 接入实时笔记池和趋势话题,就能解决时效性问题。Agent 负责多轮对话,比如用户说想看点什么,Agent 可以反问喜欢户外还是室内,这样信息量就大了,不是一次请求定终身。具体流程是用户 Query 进来,Agent 做意图识别,然后调 RAG 检索实时信息,生成模型融合多源数据出推荐,最后如果用户不满意还能再问一轮。

落地的时候有几个坑得注意。一个是 RAG 的检索质量,如果召回的内容不相关,生成出来的推荐理由就是胡扯,反而伤害体验。所以上线前我会特别关注检索的 重排 效果,用 Cross-Encoder 把 Top-K 再精排一遍。另一个是延迟,Agent 多轮对话加 RAG 检索,整体响应时间很容易超标,得做 KV Cache 和投机采样来优化。

还有一个点值得深入,就是生成式推荐产出的推荐理由本身就是高质量训练数据,可以用来做 Self-RAG 让模型自己学会反思,比如生成的理由用户不买账,模型下次就调整风格。这个数据飞轮怎么设计,我觉得挺有意思。

所以总的来说,我会把生成式推荐看成一种 生成加判别协同的系统,而不是单一的生成模型。Diffusion 和 LLM 混合做架构,DPO 做训练,RAG 加 Agent 做系统,这样才可能既保证多样性又保证个性化,既实时又准确。当然,前提是工程上能压住延迟和检索质量,不然都是空谈。

关键一句:生成式推荐产出的推荐理由可以作为Self-RAG的训练数据,形成数据飞轮

面试官还可能这样问

  1. 问法 1 · 场景切入

    假设你在做电商推荐,用户搜了“夏季连衣裙”,模型生成了几个款式,但点击率很低。你觉得这可能是生成目标(语言流畅)和推荐目标(点击转化)之间的鸿沟导致的。你怎么从模型架构或训练策略上缩小这个差距?

  2. 问法 2 · 层层追问

    生成式推荐现在挺火,你觉得它相比传统推荐有什么独特优势?……但实际落地中,是不是有生成内容“好看不好用”的问题?……比如曝光偏差、推理延迟,你怎么看这些瓶颈?未来从模型、训练到系统,你觉得最值得改的方向是什么?

  3. 问法 3 · 直球架构

    请系统性地展望一下生成式推荐系统的发展方向,包括模型架构(比如生成-判别协同)、训练策略(比如RL优化)、系统集成(比如RAG+Agent),以及应用场景的拓展。说说你的判断依据。

同模块相关题目