SFT vs 预训练:核心区别在哪?
目标、数据、训练方式对比,复读机现象与对齐场景选择
原题:请详细说明监督微调(SFT)与预训练阶段在目标、数据、训练方式等方面的区别。SFT可能带来哪些问题(如复读机现象)?在什么场景下选择SFT作为对齐手段更为合适?
模型训练 · 字节真题
回答与解析
预训练与 SFT 常共享 next-token 交叉熵,差异主要在数据和监督范围
自回归预训练通常在大规模通用文本上预测下一个 token,几乎所有有效 token 都参与损失,目标是学习语言、知识和通用表示。SFT 使用人工或合成的指令、对话和目标回答,仍常采用 next-token cross-entropy,但通过对话模板与 loss mask 只监督 assistant 回答或指定部分,目标是让模型遵循任务、格式、风格和行为边界。学习率、训练轮数、数据规模与混合策略也通常不同,但没有某个训练方式的固定参数。
SFT 风险包括示范错误被直接模仿、长回答或固定措辞偏置、训练集复述、灾难性遗忘、领域过拟合、拒答失衡和模板泄漏。所谓“复读机”需要区分训练样本记忆、解码重复、数据重复和提示模板问题,再分别处理去重、数据多样性、正则、混合预训练数据、学习率与解码。
SFT 适合有高质量目标输出、希望稳定格式或行为、无需大量在线探索的任务,也是许多偏好优化或 RL 的初始化。复杂推理和安全对齐并非必须使用 RLHF/DPO;可选方法包括更好的示范与过程监督、检索或工具、拒绝采样、DPO、在线 RL 和规则约束,选择应由可执行任务、独立偏好与安全评测决定。DPO 也不能被笼统写成比 PPO 更不稳定。
口语版讲法(30秒速答 + 90秒主答 + 完整展开)
- 先说明共同的 next-token 交叉熵
- 比较数据分布、模板和 loss mask
- 解释 SFT 的行为适配作用
- 分解复述、遗忘和过拟合风险
- 按评测选择过程监督、偏好优化或 RL
【30秒速答】 自回归预训练和常规 SFT 都常用 next-token 交叉熵。预训练在大规模通用文本上让几乎所有 token 参与损失,学习通用语言和知识;SFT 在指令与目标回答上,通过对话模板和 loss mask 重点监督 assistant token,让模型适配任务、格式与行为。SFT 可能记忆示范、形成固定措辞、过拟合或遗忘,但复杂推理和安全并不必然要求 RLHF 或 DPO。可以用高质量示范、过程监督、工具、偏好优化或在线 RL,按独立评测选择。
【90秒主答】 预训练样本通常是连续文档或代码,目标是预测每个位置的下一个 token,数据覆盖广、步数和计算量大。SFT 把 system、user、assistant 消息格式化成模型模板,常把 user 和 padding 位置 mask 掉,只对 assistant 回答计算交叉熵;有些多轮配置会监督多个 assistant 回合,所以要看实现。两者并非一个用无监督 loss、一个用完全不同监督 loss,核心差异在数据来源、监督 token、目标行为、训练强度和评测。SFT 能让基础模型更会听指令、输出 JSON、采用领域术语或遵守对话风格,但不会保证补齐最新知识,也不会自动提升所有推理。学习率过大、轮数过多或数据窄会造成通用能力退化。示范中重复模板、冗长回答和错误事实也会被模型学习。
【完整展开】 “复读机”要先定位。若输出复现训练句子,检查近似重复和数据泄漏;若同一段循环生成,检查 EOS、解码、上下文和重复惩罚;若所有答案像一个模板,增加任务与表达多样性并减少过度统一的合成数据;若通用能力下降,比较混合预训练数据、较小学习率、早停或参数高效微调。验证集要按 prompt 或来源去重,除平均 loss 外测指令遵循、事实、推理、安全、风格和基准保持。
方法选择由反馈形式决定。有可靠标准答案时,高质量 SFT 是直接基线;有步骤可验证时可做过程监督或工具执行;只有成对偏好时可考虑 DPO 等偏好优化;有可执行 reward 且需要策略探索时可考虑在线 RL;高风险边界还需要规则、检索和人工。偏好数据噪声会影响 DPO,奖励漏洞会影响 PPO,二者没有脱离实现的稳定性绝对排序。好的流程从 SFT 基线开始,逐项增加方法并做消融,只有独立任务和安全指标真实改善才保留,而不是把更复杂的算法当必选项。
【验证补充】数据混合和模板变化也应分别消融,避免把收益错误归因给训练算法。
关键一句:SFT 与预训练常共享 CE,真正决定行为差异的是数据、模板、loss mask 和训练强度。
核验来源
面试官还可能这样问
- 问法 1 · 场景切入
假设现在要把通用基座适配成任务助手。你会怎样区分预训练与 SFT 的数据、监督范围和目标行为,并根据评测决定是否还需要偏好优化或其他手段?
- 问法 2 · 层层追问
两阶段都可能用 next-token CE,真正差异在哪?……SFT 的 loss mask 怎样工作?……复读、记忆与遗忘如何区分?……什么证据支持继续用 DPO、在线 RL、工具或规则?
- 问法 3 · 直球技术
请对比预训练与 SFT 的目标、数据、模板、损失范围和训练配方,分析 SFT 风险,并说明后续对齐方法应由哪些任务与安全评测选择,而非存在“必须 RLHF”。