数据预处理关键步骤与目的
格式转换、去噪、增强、采样等关键步骤及目的
原题:请描述你在项目中所进行的数据预处理和清洗工作,包括数据格式转换、去噪、增强、采样等关键步骤及其目的。
项目与经历 · 商汤科技真题
回答与解析
用真实项目数据填写清洗与监控闭环
经历部分必须使用候选人的真实数据源、规模、字段和工具。可按【原始来源与用途】【质量画像】【转换与清洗】【采样或增强】【验证与监控】组织。先保留不可变原始层并记录版本、时间、许可和处理代码,再建立 schema、主键、值域、缺失、重复、语言、长度、隐私与内容安全画像。
格式转换应统一编码、时区、单位、字段类型和消息结构;去噪包括精确或近似重复、模板垃圾、乱码、低质量 OCR、敏感信息和无权使用内容;增强或重采样必须服务于已观察到的覆盖缺口,并保持训练、验证和测试隔离。每个步骤都要输出前后数量、拒绝原因和抽检样本,不能只说“清洗后质量更好”。
上线后的数据漂移监控应比较当前窗口与基线窗口,按字段类型选择 PSI、KS、Jensen-Shannon、Wasserstein、类别占比、缺失率、重复率、约束失败率等指标,并结合业务表现与人工复核设阈值。阈值由历史波动和风险成本校准,不是看到任意距离变化就自动增量训练。Self-RAG 是让生成模型按需检索并用反思 token 评价检索与生成的 RAG 方法,不是通用数据漂移检测或自动清洗触发器。
口语版讲法(30秒速答 + 90秒主答 + 完整展开)
- 用真实数据源和业务目的限定回答
- 建立原始层、schema 与质量画像
- 说明转换去噪采样和增强的依据
- 用分布与约束指标监控漂移
- 澄清 Self-RAG 的真实作用边界
【30秒速答】 项目经历应替换成【真实数据源】【真实规模】【真实质量问题】。处理时先保留不可变原始层和血缘,再做编码、时区、单位与 schema 统一;按业务主键去重,处理乱码、模板垃圾、低质量 OCR、敏感信息和许可问题;采样或增强只针对已验证的覆盖缺口。每一步记录前后数量、失败原因和抽检。上线后用分布距离、缺失率、重复率、约束失败率、业务表现和人工复核监控漂移。Self-RAG 是检索与生成反思方法,不是数据漂移检测器。
【90秒主答】 回答开头先说明数据用于【真实任务】,来自【真实来源】,个人实际负责【真实环节】。原始数据落到只读层,保存采集时间、版本、来源许可和处理作业版本,避免清洗错误后无法回放。画像阶段统计字段类型、主键覆盖、空值、长度、语言、重复、异常值、类别分布与隐私风险。格式转换统一 UTF 编码、时间时区、币种或单位、枚举和消息角色,同时把解析失败送入隔离区,而不是静默丢弃。去重需定义业务语义:文件哈希可找完全重复,文本指纹或向量只能提供近似候选,最终规则要避免删掉含义相近但标签不同的样本。增强与重采样要依据长尾召回、类别不平衡或鲁棒性测试,增强样本标明来源,不能污染验证和测试集。
【完整展开】 质量验证分为自动约束、统计抽检和任务评测。自动层检查 schema、值域、跨字段关系、敏感信息和来源权限;统计层按来源、时间、语言、难度切片;人工层抽查边界样本并记录错误类型。处理前后给出【真实数量】、各拒绝原因占比和任务指标变化,所有结果附统计窗口。若没有真实记录,就保留占位符,不用编造提升比例。
持续监控时建立稳定基线和当前窗口。连续变量可看 KS 或 Wasserstein,类别分布可看 PSI、Jensen-Shannon 或类别占比,文本还可看长度、语言、主题、嵌入分布与质量模型分数。任何单一指标都可能受样本量和季节性影响,所以告警还要结合缺失率、规则失败、线上错误率和人工样本。阈值应从历史波动、业务风险和回测中得到,告警后先定位来源、字段与切片,再决定修采集、修清洗、补标注或重训。Self-RAG 论文关注按需检索、生成和反思 token,可用于改善 RAG 回答,但不会替代数据质量监控。完整闭环是可回放数据、版本化规则、明确告警、人工确认和受控发布。
关键一句:漂移告警需要分布、质量约束和任务表现联合确认,Self-RAG 不能代替数据监控。
核验来源
面试官还可能这样问
- 问法 1 · 场景切入
假设我们有个电商客服场景,用户订单日志是Excel,客服对话是API返回的,还有些PDF解析的。这些数据格式五花八门,你要把它们统一成能训练模型的数据集,会怎么做预处理?
- 问法 2 · 层层追问
你拿到原始数据后,一般先做什么处理?……那去噪你用什么方法?……如果有些噪声是语义上的,比如广告内容,规则过滤不好使,你会怎么办?
- 问法 3 · 直球架构
详细说说你在项目中数据预处理和清洗的完整流程,包括格式转换、去噪、增强、采样这几个关键步骤,每一步的具体方法和你为什么这么做。