跳到正文

评测数据集怎么选?

项目实战中评测集选择标准与性能反映逻辑

原题:请列举你在项目中使用过的评测数据集,并说明选择这些评测集的原因以及它们如何反映模型性能。

评估与监控 · 商汤科技真题

回答与解析

只列举确实使用过的数据集

回答应先说明任务、模型版本和评测目的,再从真实实验记录中选择数据集:

  • 通用知识与理解:若实际使用 MMLU,说明它覆盖多学科多项选择,关注宏平均、学科切片、prompt 与 few-shot 设置。
  • 数学问题求解:GSM8K 是小学数学文字题,MATH 覆盖更具挑战的竞赛数学问题。它们评测的是数学问题求解结果;是否使用或输出 CoT 是推理与评分协议,不能直接把数据集叫作“CoT 能力测试”。
  • 代码生成:若使用 HumanEval,说明以单元测试执行 functional correctness,并报告 pass@k、采样数和沙箱安全。
  • 业务或 RAG:公开集不能代替目标场景,应建立经过许可、去重和版本化的私有测试集,分别评估检索、上下文利用、faithfulness 和任务成功。

每个数据集都要交代选择理由、split、样本数、污染与近重复检查、评分脚本版本和局限。没有实际跑过的金融、代码或线上数据不能写成个人项目成果。

口语版讲法(30秒速答 + 90秒主答 + 完整展开)

  • 先说明真实任务和评测目的
  • 按能力选择实际运行的数据集
  • 写清评分协议与版本
  • 检查污染、近重复与切分
  • 补充业务集和局限

【30秒速答】 评测集只能列真实跑过的。回答时给出【模型版本】、【任务】和【评测时间】,再说明每个数据集测什么、为什么选、评分脚本和局限。MMLU 测多学科选择题,GSM8K 与 MATH 测数学问题求解,不能直接叫 CoT 能力评测;HumanEval 通过单元测试看代码 functional correctness。目标业务还需要自己的去重测试集。没有运行记录的金融集、代码集和线上指标不写。

【90秒主答】 可以把真实评测分成公开基准和目标场景集。公开基准方便与论文或历史版本对齐,但要锁定 prompt、zero-shot 或 few-shot、解码参数和评分脚本。MMLU 覆盖多个学科的多项选择题,适合观察知识与题目理解的分科表现;总分会掩盖弱科,所以要保留学科切片。GSM8K 是小学数学文字题,MATH 来自竞赛数学题,两者可以评估最终答案正确率和不同难度,但“模型写了推理过程”与“真的具备可靠推理”不是同一件事。若评分只看最终答案,它并没有直接验证隐藏或输出的每一步 CoT。

HumanEval 给函数签名、描述和测试,用执行结果衡量生成代码是否通过。pass@k 依赖采样数量与估计方式,运行环境必须隔离不可信代码,并记录语言版本、超时和隐藏测试。只给一个 pass@1 数字而不说明 prompt 与采样设置,无法复现。

【完整展开】 业务评测需要覆盖真实输入分布。RAG 场景可把检索 recall/precision、证据是否进入上下文、回答是否使用证据、引用是否正确和最终任务成功拆开。分类或抽取任务要按类别、长度、语言、时间与高风险样本分层。数据来源、使用许可、脱敏、标注指南、仲裁流程和版本都要记录。若相同文档、用户或模板跨训练与测试,会造成泄漏;公开 benchmark 还要做预训练污染和近重复检查。

选择理由必须和错误成本对应。需要知识覆盖就选多学科集,需要代码可执行性就选测试驱动集,需要真实安全性就加红队与拒答集。一个数据集不能代表全部能力,榜单高分也不能替代目标场景。报告时列出实际运行日期、commit、模型 checkpoint、tokenizer、量化、上下文长度、解码、样本数和置信区间。若只在离线集验证,就明确没有线上结论。这样的答案既能解释为何选择评测,也能让他人复现,不需要借用任何不存在的项目指标。

【验证补充】公开数据集还要固定许可证和评测许可,特别是代码执行与私有业务数据。结果发布时给出未回答、解析失败和超时数量,避免评分脚本静默丢弃失败样本。

关键一句:评测集名称只有和真实运行协议、污染检查及目标错误成本绑定时才有意义。

核验来源

  1. Measuring Massive Multitask Language Understanding
  2. Training Verifiers to Solve Math Word Problems
  3. Measuring Mathematical Problem Solving With the MATH Dataset
  4. Evaluating Large Language Models Trained on Code

面试官还可能这样问

  1. 问法 1 · 场景切入

    假设你在做电商客服模型,上线前总要测一下效果吧?你一般用什么评测集来验证模型在退货咨询、价格查询这些场景上的表现?

  2. 问法 2 · 层层追问

    你平时怎么评估模型能力?……都用过哪些评测集?……那为什么选这些而不选其他的?它们能真实反映模型在业务上的表现吗?

  3. 问法 3 · 直球架构

    请列举你在项目中用过的评测数据集,说明选择它们的理由,以及每个评测集具体能反映模型的哪些能力维度。

同模块相关题目