跳到正文

粗排冷启动指标与路径

评估粗排性能的关键指标及新用户/新物品冷启动技术路径

原题:请说明评估粗排模型性能的关键指标和方法。当新用户或新物品缺乏行为数据时,粗排模型如何实现冷启动?有哪些可行的技术路径?

评估与监控 · 哔哩哔哩真题

回答与解析

粗排评估指标

粗排的核心矛盾是效率与精度的平衡,评估要分两层:

离线指标

  • AUC/GAUC:AUC看整体区分度,GAUC按用户分组平均,消除用户间差异,更适合推荐场景
  • LogLoss:校准概率质量,粗排输出给精排的分数需要概率意义
  • HitRate@K:粗排截断后精排目标物品的召回率,直接反映粗排价值
  • RT(响应时间):P99延迟必须<10ms,QPS要支撑全量流量

线上指标

  • 精排召回率 = 精排最终曝光物品中来自粗排的比例
  • 端到端CTR/CVR变化,粗排是漏斗第一层,最终业务指标才是金标准

冷启动技术路径

新用户冷启动

  • side information融合: demographics + 上下文(时间、地理位置、设备)→ 共享embedding层
  • 元学习(MAML):学一个"好初始化",新用户几步梯度快速适应
  • 跨域迁移:用站外行为预训练(如有),或站内其他业务线数据

新物品冷启动

  • 内容理解embedding:视频标题/封面/标签走多模态编码(CLIP类),与ID embedding对齐到同一空间
  • 作者/品类先验:新视频继承作者历史表现、同品类热门物品的embedding
  • 探索机制:ε-greedy或Thompson Sampling,冷启动物品给额外曝光机会

关键工程点

  • 冷启动走独立通道,避免污染主模型分布;线上AB实验要分桶看"纯新用户"子集效果

学习建议

掌握推荐系统粗排流程,理解常用评估指标如AUC、GAUC,并学习冷启动场景下的embedding初始化与迁移学习方法。

口语版讲法(约4分钟)

  • 粗排的本质是效率与精度的博弈
  • 评估指标分离线与线上两层
  • 冷启动用side info和元学习
  • 工程上要有独立通道和实验

这道题其实是在问:粗排作为推荐漏斗的第一层,怎么在几十毫秒内从几百万物品里捞出几百个给精排,同时还要解决新用户新物品没行为数据的问题。核心矛盾就是效率跟精度的平衡,评估和冷启动都是围绕这个来的。

先说评估。离线我最看两个:一个是 GAUC,不是全局AUC。因为推荐场景里用户差异很大,全局AUC可能被头部用户带偏,GAUC按用户分组算再平均,更能反映每个用户视角的排序质量。再一个是 HitRate@K,直接看粗排截断后,精排真正需要的那批物品有多少还在里面,这个指标跟业务目标最贴近。线上我会盯精排召回率,就是精排最终曝光的物品里有多少是从粗排来的,如果这个比例掉下去,说明粗排漏了东西。当然端到端CTR这些最终指标也得看,但粗排本身更关注召回率。

这里有个坑:离线指标做得再好,线上可能完全不一样。我见过一个案例,粗排离线AUC涨了2个点,但线上精排召回率反而降了,因为模型过度拟合了某些特征,把一些长尾好内容排掉了。所以上线前一定要做分桶AB,而且 不能只看整体,要拆新老用户、新老物品分别看。

再讲冷启动。新用户没行为,我会从两个方向入手。第一是 side information融合,把用户的人口属性、设备、当前时间这些特征跟共享embedding层结合,让模型能利用跨用户的共性。第二是元学习,比如MAML,学一个初始参数,新用户来了只做几步梯度更新就能快速适应。不过元学习工程代价大,得看业务规模,小流量没必要上。

新物品冷启动更常见。我会用内容理解embedding,比如视频的标题、封面图、标签,走多模态编码,像 CLIP 那样,把内容embedding跟ID embedding映射到同一空间。这样新视频一进来,即使没点击,也能靠内容相似度找到位置。另外还可以继承作者或品类的先验,新视频就带上它所属品类的平均embedding。

但冷启动有个关键前提:必须走独立通道。不能把冷启动物品直接混进主模型,否则会拉低主模型的预测精度,因为主模型没见过这些无行为物品。我通常会开一个单独的探索池,用ε-greedy或Thompson Sampling分配额外曝光,同时限制整体流量占比不超过5%。线上实验也得单独分桶看纯新用户子集的效果,否则整体指标可能被老用户稀释。

其实冷启动还有一个方向是跨域迁移,比如用站外行为或站内其他业务的数据来预训练embedding,这个在数据充足时效果很好,但前提是领域分布不能差太远,否则会负迁移。

所以整体上,我会把粗排看成漏斗的守门员,评估上先保召回率再提精度,冷启动上先用内容embedding兜底,再逐步用元学习或跨域迁移优化。

关键一句:冷启动的跨域迁移需要领域分布相近,否则会负迁移

面试官还可能这样问

  1. 问法 1 · 场景切入

    假设你在做电商推荐的新用户冷启动,用户刚注册,没有任何点击行为,粗排模型需要给精排提供候选物品。你怎么评估这个粗排模型的效果?特别是对于这些新用户,模型怎么做到冷启动?

  2. 问法 2 · 层层追问

    粗排模型一般怎么评估?……离线指标和线上指标分别看什么?……那对于新用户和新物品,缺乏行为数据,冷启动怎么处理?有哪些技术路径可以走?

  3. 问法 3 · 直球架构

    请说明评估粗排模型性能的关键指标和方法,以及当新用户或新物品缺乏行为数据时,粗排模型如何实现冷启动?有哪些可行的技术路径?

同模块相关题目