训练数据来源怎么选?
大模型微调数据集常见来源与质量合规评估方法
原题:在构建大模型训练或微调数据集时,常见的数据来源有哪些?如何评估不同来源数据的质量与合规性?
项目与经历 · 百度真题
回答与解析
数据来源、质量与合规要分别建立证据
常见来源包括自有业务交互与人工反馈、专家或众包标注、公开数据集、获得许可的第三方数据、合成数据、工具执行轨迹和模型生成数据。每条数据应能追溯到来源、采集时间、版本、许可、用途、处理链和删除要求;网页可访问不等于允许抓取、再分发或用于商业训练。合规结论依赖许可文本、合同、个人信息处理目的和适用司法辖区,技术团队不能给出无地区边界的笼统法律保证。
质量评估从相关性、覆盖、正确性、一致性、唯一性、时效性、毒性与偏差、隐私、污染和可学习性展开。事实性应使用权威来源对照、可执行结果、数据库约束或专门核验任务;普通 RLHF 奖励模型学习的是给定偏好数据上的相对偏好,可能偏爱风格、长度或迎合,不应当作通用事实正确性评估器。合成数据要保留生成模型、提示、过滤和人工抽检记录,防止错误自举和分布变窄。
落地时为数据集建立 datasheet 或 dataset card,按来源和风险分层抽样,去重后再划分 train、validation、test,避免同源泄漏。发布前运行许可证白名单、敏感信息检测、内容安全、基准污染和人工评审;训练后按来源做消融,发现某来源只增加规模却降低目标指标时应降权或移除。法务意见、数据主体请求、供应商撤回和版本变更都要可落实到样本级删除与重训决策。
口语版讲法(30秒速答 + 90秒主答 + 完整展开)
- 列举来源并记录逐样本血缘
- 从任务质量和覆盖评估数据
- 用权威证据而非偏好分数核验事实
- 按许可、隐私和地区判断合规
- 以数据卡、消融和删除机制闭环
【30秒速答】 训练数据可来自自有业务、人工或专家标注、公开数据集、授权第三方、合成数据和工具执行轨迹。质量看任务相关性、覆盖、正确性、一致性、时效、重复、隐私、偏差和污染;合规看具体许可、合同、用途、个人信息和适用地区。网页能访问不代表能抓取并商业训练。事实性要靠权威证据、执行结果或专门核验,RLHF 奖励模型主要学习相对偏好,不能当通用事实裁判。每个数据集应有数据卡、样本血缘、去重防泄漏、来源消融和删除机制。
【90秒主答】 数据源先分类并建立台账。自有业务数据要确认用户告知、授权范围和保留期限;人工标注要记录指南、标注者、复核与一致性;公开数据集要读取原始许可证和数据卡;第三方数据要看合同是否允许训练、衍生模型和跨境处理;合成数据要保留生成模型、提示、采样和过滤版本;工具轨迹还要检查其中是否含账号、密钥或受限内容。质量不能只看数量。用任务分层统计覆盖,抽查标签与事实,检查近似重复、时间新鲜度、语言和来源分布、毒性与敏感信息,并在划分前去重,防止同一文档或改写跨进训练和测试。事实答案通过权威文档、数据库、代码执行或专家核验确认,偏好模型的高分只说明更符合它学到的偏好,不等于客观正确。
【完整展开】 合规评审至少保存来源 URL 或系统、采集方式、时间、许可版本、合同编号、允许用途、再分发限制、地域、个人信息类别和删除联系人。没有明确许可时不能用“公开数据”代替结论;版权、数据库权、隐私和合同责任在不同地区可能不同,应由法务结合实际用途判断。对敏感数据做最小化、脱敏、访问控制和保留期限,供应商撤回或数据主体请求应能追到样本并执行删除。
工程流程给每个样本 source id、document id、license tag、processing version 和 split。建立 datasheet 或 dataset card,说明动机、组成、采集、处理、已知偏差、适用与不适用场景。质量门包含 schema、语言、长度、重复、个人信息、安全类别、事实抽检和基准污染。合成数据不能只由同一个模型生成再由同一个模型评分,可加入可执行验证、独立模型、规则和人工抽检。训练后按来源做消融和切片评测,观察目标质量、严重错误和公平性;来源贡献不明确或风险不可接受时降权、隔离或移除。最终交付的是一套可追溯、可解释、可删除的数据资产,而不是一个无法说明来源的大文件。
关键一句:偏好奖励分数与事实正确性不是同一目标,事实数据必须回到权威证据或可执行验证。
核验来源
面试官还可能这样问
- 问法 1 · 场景切入
假设你在做一个金融客服大模型,需要收集对话数据来微调。你手头有网上扒的对话、自己用GPT生成的、还有真实客服日志,这三种数据你会怎么选?怎么判断哪个能用、哪个不能用?
- 问法 2 · 层层追问
构建训练数据集时,数据来源一般有哪些?……好,那你怎么评估这些数据的好坏?比如质量怎么查?……还有合规性,像版权、隐私这些你怎么把关?
- 问法 3 · 直球架构
请说说大模型微调数据集的常见数据来源,以及评估数据质量和合规性的方法。从来源类型、评估维度到具体操作,简要但全面地讲一下。