训练数据清洗:规则 vs LLM
训练数据清洗时规则与 LLM 的质量、成本和审计取舍
原题:在大模型训练前的数据清洗阶段,应如何权衡使用基于规则的方法与基于大模型(LLM)的自动化清洗?请从准确性、效率、可解释性和成本角度对比两种方法的适用场景。
模型训练 · 美团真题
回答与解析
规则和LLM清洗不是二选一,关键是错误是否能稳定形式化。编码损坏、HTML残留、精确重复、长度和已知敏感格式适合规则,执行路径可追踪;连贯性、主题相关、隐含广告或专业质量更依赖语义判断,LLM可能提供帮助,但也会误删少数表达。
效率不能用百万条每秒或百条每秒概括。规则速度受正则复杂度、I/O和文本长度影响,LLM吞吐受模型、硬件、batch、量化和输入输出长度影响。短文本可批处理,长文本会改变成本。任何比较都应在同一数据集、硬件和端到端管线上测样本吞吐与单位token或单位文档成本。
准确性要用人工gold集评估。对每类脏数据分别报告precision、recall和误杀高质量样本的比例,并按语言、来源和长度切片。规则可能精确但漏长尾,LLM可能召回更高却受prompt和模型版本漂移。不能只看模型给自己的质量分。
常见级联是先做低风险确定性规范化与去重,再用规则或轻量分类器过滤明显样本,把不确定语义案例交给LLM,最后对高风险删除进行人工复核。各层都应保留原因码和原文引用,支持回滚。规则先删掉多少数据完全由当前语料决定,不设固定比例。
LLM清洗还要防提示注入、内容泄露和输出不稳定。如果文本包含指令,模型可能偏离分类任务;外部API还涉及数据许可与隐私。使用结构化输出、隔离prompt、版本固定和抽样审计,并让模型输出证据片段,可以提高可追踪性,但仍不能替代人工gold。
最终要做小规模训练消融:原始数据、规则清洗、LLM清洗和混合方案在相同token预算下训练proxy model,比较目标任务、通用能力、记忆和毒性。若过滤指标看起来很好却损伤下游能力,就不能上线。成本、质量和训练收益共同决定清洗架构。
口语版讲法(约4分钟)
- 按错误类型划分规则与语义任务
- 删除固定吞吐数字
- 建立人工gold评测
- 设计可追溯级联
- 用下游模型验证清洗价值
规则和LLM清洗不是二选一,关键是错误是否能稳定形式化。编码损坏、HTML残留、精确重复、长度和已知敏感格式适合规则,执行路径可追踪;连贯性、主题相关、隐含广告或专业质量更依赖语义判断,LLM可能提供帮助,但也会误删少数表达。
效率不能用百万条每秒或百条每秒概括。规则速度受正则复杂度、I/O和文本长度影响,LLM吞吐受模型、硬件、batch、量化和输入输出长度影响。短文本可批处理,长文本会改变成本。任何比较都应在同一数据集、硬件和端到端管线上测样本吞吐与单位token或单位文档成本。
准确性要用人工gold集评估。对每类脏数据分别报告precision、recall和误杀高质量样本的比例,并按语言、来源和长度切片。规则可能精确但漏长尾,LLM可能召回更高却受prompt和模型版本漂移。不能只看模型给自己的质量分。
常见级联是先做低风险确定性规范化与去重,再用规则或轻量分类器过滤明显样本,把不确定语义案例交给LLM,最后对高风险删除进行人工复核。各层都应保留原因码和原文引用,支持回滚。规则先删掉多少数据完全由当前语料决定,不设固定比例。
LLM清洗还要防提示注入、内容泄露和输出不稳定。如果文本包含指令,模型可能偏离分类任务;外部API还涉及数据许可与隐私。使用结构化输出、隔离prompt、版本固定和抽样审计,并让模型输出证据片段,可以提高可追踪性,但仍不能替代人工gold。
最终要做小规模训练消融:原始数据、规则清洗、LLM清洗和混合方案在相同token预算下训练proxy model,比较目标任务、通用能力、记忆和毒性。若过滤指标看起来很好却损伤下游能力,就不能上线。成本、质量和训练收益共同决定清洗架构。
清洗结果还应支持抽样解释。每种规则和模型判断都保留原因码、版本与证据片段,质检人员可以按原因分层抽样,发现某一层误杀后只回滚受影响数据。若只保存最终保留或删除标签,后续无法判断质量变化来自哪项策略,也难以满足删除和审计要求。
对于LLM给出的质量分,可以做校准或只用于排序,但不能假设分数本身是概率。阈值应根据人工gold和误删代价选择,并随来源漂移复验。若不同语言分数分布不同,使用全局阈值会系统性偏向某些语料,需要分桶或重训。
关键一句:怎样在相同硬件和语料上公平比较规则与LLM清洗的真实吞吐和误杀。
核验来源
面试官还可能这样问
- 问法 1 · 场景切入
假设现在要从混合格式文档中抽取固定字段和语义长尾字段。你会怎样让规则与 LLM 分工,并控制成本、延迟与错误传播?
- 问法 2 · 层层追问
格式稳定且可枚举的字段适合什么?……合同式长尾语义又适合什么?……结构化输出是否等于语义正确?……高风险字段怎样校验和转人工?
- 问法 3 · 直球技术
请比较规则与 LLM 在数据预处理/信息提取中的适用场景、维护成本、可审计性、概率错误和混合架构,并给出同口径评测方案。