跳到正文

训练数据来源怎么选?

大模型微调数据集常见来源与质量合规评估方法

原题:在构建大模型训练或微调数据集时,常见的数据来源有哪些?如何评估不同来源数据的质量与合规性?

项目与经历 · 百度真题

回答与解析

数据来源、质量与合规要分别建立证据

常见来源包括自有业务交互与人工反馈、专家或众包标注、公开数据集、获得许可的第三方数据、合成数据、工具执行轨迹和模型生成数据。每条数据应能追溯到来源、采集时间、版本、许可、用途、处理链和删除要求;网页可访问不等于允许抓取、再分发或用于商业训练。合规结论依赖许可文本、合同、个人信息处理目的和适用司法辖区,技术团队不能给出无地区边界的笼统法律保证。

质量评估从相关性、覆盖、正确性、一致性、唯一性、时效性、毒性与偏差、隐私、污染和可学习性展开。事实性应使用权威来源对照、可执行结果、数据库约束或专门核验任务;普通 RLHF 奖励模型学习的是给定偏好数据上的相对偏好,可能偏爱风格、长度或迎合,不应当作通用事实正确性评估器。合成数据要保留生成模型、提示、过滤和人工抽检记录,防止错误自举和分布变窄。

落地时为数据集建立 datasheet 或 dataset card,按来源和风险分层抽样,去重后再划分 train、validation、test,避免同源泄漏。发布前运行许可证白名单、敏感信息检测、内容安全、基准污染和人工评审;训练后按来源做消融,发现某来源只增加规模却降低目标指标时应降权或移除。法务意见、数据主体请求、供应商撤回和版本变更都要可落实到样本级删除与重训决策。

口语版讲法(30秒速答 + 90秒主答 + 完整展开)

  • 列举来源并记录逐样本血缘
  • 从任务质量和覆盖评估数据
  • 用权威证据而非偏好分数核验事实
  • 按许可、隐私和地区判断合规
  • 以数据卡、消融和删除机制闭环

【30秒速答】 训练数据可来自自有业务、人工或专家标注、公开数据集、授权第三方、合成数据和工具执行轨迹。质量看任务相关性、覆盖、正确性、一致性、时效、重复、隐私、偏差和污染;合规看具体许可、合同、用途、个人信息和适用地区。网页能访问不代表能抓取并商业训练。事实性要靠权威证据、执行结果或专门核验,RLHF 奖励模型主要学习相对偏好,不能当通用事实裁判。每个数据集应有数据卡、样本血缘、去重防泄漏、来源消融和删除机制。

【90秒主答】 数据源先分类并建立台账。自有业务数据要确认用户告知、授权范围和保留期限;人工标注要记录指南、标注者、复核与一致性;公开数据集要读取原始许可证和数据卡;第三方数据要看合同是否允许训练、衍生模型和跨境处理;合成数据要保留生成模型、提示、采样和过滤版本;工具轨迹还要检查其中是否含账号、密钥或受限内容。质量不能只看数量。用任务分层统计覆盖,抽查标签与事实,检查近似重复、时间新鲜度、语言和来源分布、毒性与敏感信息,并在划分前去重,防止同一文档或改写跨进训练和测试。事实答案通过权威文档、数据库、代码执行或专家核验确认,偏好模型的高分只说明更符合它学到的偏好,不等于客观正确。

【完整展开】 合规评审至少保存来源 URL 或系统、采集方式、时间、许可版本、合同编号、允许用途、再分发限制、地域、个人信息类别和删除联系人。没有明确许可时不能用“公开数据”代替结论;版权、数据库权、隐私和合同责任在不同地区可能不同,应由法务结合实际用途判断。对敏感数据做最小化、脱敏、访问控制和保留期限,供应商撤回或数据主体请求应能追到样本并执行删除。

工程流程给每个样本 source id、document id、license tag、processing version 和 split。建立 datasheet 或 dataset card,说明动机、组成、采集、处理、已知偏差、适用与不适用场景。质量门包含 schema、语言、长度、重复、个人信息、安全类别、事实抽检和基准污染。合成数据不能只由同一个模型生成再由同一个模型评分,可加入可执行验证、独立模型、规则和人工抽检。训练后按来源做消融和切片评测,观察目标质量、严重错误和公平性;来源贡献不明确或风险不可接受时降权、隔离或移除。最终交付的是一套可追溯、可解释、可删除的数据资产,而不是一个无法说明来源的大文件。

关键一句:偏好奖励分数与事实正确性不是同一目标,事实数据必须回到权威证据或可执行验证。

核验来源

  1. Datasheets for Datasets
  2. Hugging Face Dataset Cards
  3. Training language models to follow instructions with human feedback

面试官还可能这样问

  1. 问法 1 · 场景切入

    假设你在做一个金融客服大模型,需要收集对话数据来微调。你手头有网上扒的对话、自己用GPT生成的、还有真实客服日志,这三种数据你会怎么选?怎么判断哪个能用、哪个不能用?

  2. 问法 2 · 层层追问

    构建训练数据集时,数据来源一般有哪些?……好,那你怎么评估这些数据的好坏?比如质量怎么查?……还有合规性,像版权、隐私这些你怎么把关?

  3. 问法 3 · 直球架构

    请说说大模型微调数据集的常见数据来源,以及评估数据质量和合规性的方法。从来源类型、评估维度到具体操作,简要但全面地讲一下。

同模块相关题目