跳到正文

SFT 人工标注数据怎么构建?

无用户数据时设计原则、标注流程与质量验证方法

原题:在缺乏足够真实用户行为数据的情况下,如何系统性地设计和构建大批量、高质量的人工标注数据集,以支持大模型的监督微调(SFT)?请描述数据设计原则、标注流程控制和质量验证方法。

模型训练 · 美团真题

回答与解析

人工数据集从任务抽样、试标和可复核流程构建

先定义目标任务、使用边界、输出 schema 和验收指标,再从预期流量、专家知识、公开任务与失败案例构造候选池。分层维度可包括意图、语言、难度、风险、输入长度和长尾类型。题量、专家占比、抽检率和真实/合成比例都应由试点误差、预算与学习曲线决定,不存在通用的 20/60/20、10% 或 1:3 配方。

标注指南应给定义、正反例、边界、不可判断、证据要求和升级路径。先做小批试标,收集分歧并迭代指南,再正式生产。两名固定标注者处理名义类别时可使用 Cohen's kappa;多名标注者的名义分类可按设计选择 Fleiss' kappa;标注人数不固定、存在缺失或量表不同可考虑 Krippendorff's alpha。指标选择取决于测量尺度和抽样设计,不能把“3 到 5 人算 Cohen's kappa”笼统处理,也不能把 0.7 当所有任务的统一放行线。

质量控制包括资格测试、隐藏金标、重叠标注、专家仲裁、理由与证据留存、标注者漂移监控和版本化。验证层检查 schema、重复、泄漏、类别分布和安全,再用小规模 SFT 或代理任务看学习曲线与切片表现。模型辅助可用于预标和风险排序,但不能用未经验证的分类器自动判定最终质量。发布数据卡,记录来源、指南版本、一致性、已知偏差和不适用场景。

口语版讲法(30秒速答 + 90秒主答 + 完整展开)

  • 从目标分布与验收标准设计任务
  • 通过分层抽样覆盖主流和长尾
  • 用试标迭代指南与边界
  • 按标注设计选择一致性统计
  • 以仲裁、金标、漂移和学习曲线闭环

【30秒速答】 缺少真实行为数据时,先定义任务和输出标准,从公开任务、专家知识、失败案例与合成候选构造分层池,再做小批试标。指南写清正反例、边界、证据和不可判断,分歧由专家仲裁。两名标注者的名义分类可用 Cohen's kappa,多人名义分类可考虑 Fleiss' kappa,人数不固定、缺失或不同量表可用 Krippendorff's alpha。样本量、专家占比、抽检率和放行阈值都由试标、风险和学习曲线决定,不套固定比例。

【90秒主答】 设计阶段先写模型将面对哪些用户、输入和风险,建立意图、语言、长度、难度、领域和安全分层。候选数据可以由专家编写、公开许可数据改造、模板组合、模型生成和真实失败案例脱敏获得,但每条都保留来源和生成方式。合成数据用于扩大覆盖时,要有可执行检查、独立模型或人工复核,避免同一模型生成并自评造成错误自举。试标选一批覆盖主要边界的样本,让标注者独立工作,记录分歧理由,迭代定义与示例。不要先规定必须三到五人、两百条或某个一致性阈值,再强行让任务适配流程。Cohen's kappa 面向两名标注者;多人、缺失和量表结构不同需要选择 Fleiss 或 Krippendorff 等合适统计,并结合原始一致率和类别分布解释。

【完整展开】 生产阶段对标注者做资格测试和校准,持续插入隐藏金标与重叠样本。高风险或低一致类别增加专家覆盖,简单稳定类别可以降低重叠;比例来自错误成本和抽检结果。仲裁不是简单多数票,而是按指南和证据给最终标签,并把新边界回写指南。监控每位标注者的通过率、分歧类型、处理时间和随时间漂移,指南版本、标注工具和参考资料都进入数据血缘。

数据验收先查 schema、重复、泄漏、敏感信息、类别与来源分布,再训练小模型或小规模 SFT 看学习曲线和切片表现。模型质检器只能排序可疑样本,阈值由人工金标上的 precision、recall 和严重错误成本校准,不能预设提效百分比。随着数据量增加,如果独立验证不再改善,应把预算转向长尾、纠错和新场景。最终数据卡说明动机、组成、采集、标注设计、一致性统计、仲裁、已知偏差和不适用边界。这样的流程能扩量,同时保留每个标签为何可信的证据。

关键一句:一致性统计必须匹配标注人数、类别尺度和缺失设计,Kappa 不是一个可随意套用的统一指标。

核验来源

  1. A Coefficient of Agreement for Nominal Scales
  2. Measuring nominal scale agreement among many raters
  3. krippendorffsalpha: An R Package for Measuring Agreement
  4. Datasheets for Datasets

面试官还可能这样问

  1. 问法 1 · 场景切入

    假设我们做个电商客服大模型,但现在线上只有很少的用户真实对话数据,没法直接微调。你会怎么从零开始设计一批高质量标注数据?比如先定哪些类型的问题,再怎么控制标注质量?

  2. 问法 2 · 层层追问

    大模型微调需要大量标注数据,但你没有真实用户行为数据,怎么搞?……具体设计数据时,你会考虑哪些原则来保证覆盖度和多样性?……那标注流程上怎么保证一致性?最后怎么验证数据质量?

  3. 问法 3 · 直球架构

    请系统性地讲一下,在缺乏真实用户数据的情况下,如何构建大批量高质量SFT标注数据集?从数据设计原则、标注流程控制到质量验证方法,说清楚你的整体方案。

同模块相关题目