SFT 置信度下降影响
置信度下降对校准、阈值和业务决策的影响,补充适用边界与工程取舍
原题:在进行监督微调(SFT)后,某些分类模型的预测概率分布从原本较为集中(高置信度)变为更加均匀(低置信度)。请分析可能导致这一现象的技术原因,并讨论其潜在影响。
模型训练 · 网易真题
回答与解析
置信度下降不等于性能或校准必然变差
预训练语言模型与常规生成式 SFT 通常都使用 token 级交叉熵;分类头微调也常使用交叉熵。两者并不存在“预训练交叉熵鼓励自信、SFT 交叉熵反而鼓励平均”的通用对立。
排查可分为四层:
- 数据与标签:类别先验变化、域迁移、边界样本增多、冲突标注或硬标签噪声都会改变 posterior。硬标签噪声仍是 one-hot 错标,不等同于软标签。
- 训练目标:label smoothing、知识蒸馏软目标、Mixup、熵或 logit 正则会抑制极端 logits;class weighting 也会改变有效先验。
- 优化与模型:学习率过大、分类头重置、灾难性遗忘、冻结策略、训练不足、weight decay 和 dropout 都可能缩小 logit margin。
- 实现与校准:重复 softmax、temperature 配置、train/eval mode、label map、checkpoint 和 dtype 不一致都会造成假象。
应在同一测试集同时看 accuracy/F1、NLL、Brier、ECE 和 reliability diagram。Focal Loss 用于降低易分类样本权重,不是温度校准的替代品。若只是系统性尺度偏差,可在独立校准集拟合 temperature;若准确率或域内质量下降,应修数据与训练根因。
口语版讲法(30秒速答 + 90秒主答 + 完整展开)
- 先区分置信度、准确率与校准
- 核对数据先验和标签类型
- 检查损失、正则与优化配置
- 排除推理和 softmax 实现问题
- 按诊断结果选择校准或重训
【30秒速答】 SFT 后概率变平只说明 logit margin 或温度尺度发生变化,不等于模型一定更差。预训练和常规生成式 SFT 都常用 token 级交叉熵,不能说两者对置信度的目标相反。排查时看数据先验、域迁移、硬标签错标、label smoothing 或蒸馏软目标、学习率、分类头、冻结策略和推理实现。硬标签噪声不是软标签。评估要同时看准确率、NLL、Brier、ECE 与可靠性图,Focal Loss 也不能代替温度校准。
【90秒主答】 先固定同一份验证或测试数据,比较微调前后的预测类别、最大概率、logit margin 和错误样本。若置信度降低但准确率不变,NLL 与 ECE 反而更好,原模型可能只是过度自信,没必要强行把分布变尖。若准确率和置信度一起下降,才更像表示退化、域迁移或训练不足。若总体准确率正常,但某些类别明显变平,应检查类别先验、class weighting 和该类数据质量。
数据层面,SFT 样本可能更均衡,也可能包含更多模糊边界、冲突标注或新领域文本。硬标签噪声指 one-hot 标签本身错了,优化仍把全部目标质量放在错误类别上;软标签则主动给多个类别分配概率,两者的梯度和含义不同。label smoothing、知识蒸馏、Mixup 或熵正则会直接抑制极端 logit,必须查训练配置,而不能从现象反推一定使用了某种方法。
【完整展开】 优化层要检查分类头是否重新初始化、主干是否全部解冻、学习率是否过大、warmup 是否变化、weight decay 和 dropout 是否增强,以及训练是否提前停止。大步更新可能让原有特征被破坏,冻结过多又可能让分类头无法适配新域。LoRA 只是限制更新子空间,不会天然把概率平均化,仍要比较层级 logit、特征可分性与权重更新。
实现层经常被忽略。推理是否调用 eval、dropout 是否关闭、BatchNorm 统计是否一致、label id 是否错位、是否对已经归一化的概率再次 softmax、temperature 是否沿用旧配置、加载的 checkpoint 与 tokenizer 是否匹配,都可能制造置信度下降。校准修复要放在根因之后。Temperature scaling 在独立校准集上拟合一个正温度,主要调整概率尺度而不改变 argmax;Focal Loss 改变训练时易难样本权重,不能承担同一职责。上线若用置信度做拒答或转人工,还要重算覆盖率与准确率曲线,冻结温度和阈值后再到独立测试集验收。
【验证补充】还应检查类别概率是否被后处理改写,例如业务先验校正、阈值映射或多模型融合。校准集必须与最终测试集分开,避免反复调温度后把测试集也变成训练信号。
关键一句:概率变平可能是校准改善,也可能是能力退化,只有准确率与概率指标联合评测才能区分。
核验来源
面试官还可能这样问
- 问法 1 · 场景切入
假设你在做一个电商客服的意图分类模型,SFT之前模型对‘退货’这类意图预测很自信,但微调后输出概率变得均匀,高低分不清了。你觉得可能是什么原因?
- 问法 2 · 层层追问
SFT后模型预测概率变平,你遇到过吗?……这背后跟数据分布、损失函数有什么关系?……如果标签里有很多‘软’的标注,会怎么影响输出?
- 问法 3 · 直球架构
SFT后分类模型置信度降低,概率分布从尖锐变均匀。请从技术原理角度分析可能的原因,以及这种变化对模型部署有什么正面和负面影响。