自动 vs 人工评价怎么选?
大模型评估中 BLEU、ROUGE 等自动指标与人工标准的优劣对比
原题:在评估大语言模型时,常用的自动评价指标和人工评价标准有哪些?它们各自的优缺点是什么?
评估与监控 · 百度真题
回答与解析
自动评测按证据类型分类
- reference-based:BLEU、ROUGE、BERTScore 等将输出与参考答案比较,适合翻译、摘要或有参考文本的任务,但会受参考覆盖和表述多样性限制。
- reference-free:perplexity、质量/安全分类器、groundedness 检查或某些 reward model 可不依赖标准答案,但依赖模型假设、训练域和校准。
- execution-based:代码单元测试、SQL 执行、工具或规则验证直接检查可执行结果,信号清晰但覆盖受测试用例限制。
- model-as-judge:按 rubric 让评审模型比较或打分,扩展性好,但存在位置、长度、自偏好、提示和版本偏差,需要与人工校准。
- 任务指标:accuracy、F1、检索 recall、引用正确率、任务成功率按具体任务定义。
人工评测应给出 correctness、relevance、faithfulness、completeness、style、safety 等可操作 rubric,随机化样本与答案顺序,培训评审者,报告一致性和置信区间。自动工具可以检测一部分安全问题,例如毒性或越狱分类器、静态规则与红队基准;它们不是完全不能检测安全,也不能覆盖所有攻击。
口语版讲法(30秒速答 + 90秒主答 + 完整展开)
- 按是否需要参考答案分类自动指标
- 补充执行型和任务型证据
- 说明模型评审的系统偏差
- 设计可复现的人工 rubric
- 把安全分类器与红队纳入评测
【30秒速答】 自动评测不能都归为“依赖标准答案”。BLEU、ROUGE、BERTScore 属于 reference-based;perplexity、部分质量或安全分类器可 reference-free;代码测试、SQL 执行属于 execution-based;model-as-judge 用 rubric 打分,但有位置、长度和模型偏差。人工评测看正确、相关、忠实、完整、风格与安全,需要盲评、顺序随机化和一致性。安全也能用分类器、规则和红队基准自动检测一部分,只是无法覆盖全部风险。
【90秒主答】 BLEU 统计 n-gram precision 并加入 brevity penalty,常用于机器翻译;ROUGE 侧重与参考摘要的 n-gram 或最长公共子序列重合;BERTScore 用上下文 embedding 匹配参考与候选。它们都需要参考文本,但参考答案往往不完整,语义正确的改写可能被词面指标低估,embedding 指标也可能忽略事实矛盾。因此要按任务选择,并人工抽检。
reference-free 指标不需要标准答案,但仍需要证据。语言模型 perplexity 反映对给定文本的平均对数似然,不直接等于帮助性或事实性。毒性、PII、越狱和内容安全分类器可以批量扫描,效果取决于训练域与阈值。groundedness 分类器可比较答案和来源文本,但也可能被长上下文、否定和领域术语误导。
【完整展开】 execution-based 评测在可验证任务上很有价值。代码生成可运行隔离的单元测试,SQL 可在固定数据库执行,数学或工具任务可检查最终结构化结果。它能直接测功能正确性,但隐藏测试不充分时会漏掉边界错误,沙箱、超时和副作用也必须控制。model-as-judge 能按 rubric 比较开放回答,适合规模化,但评审模型可能偏爱更长答案、自己的风格或某个位置,模型版本变化还会让历史分数漂移。可以交换答案顺序、使用多评审、加入人工金标并报告相关性。
人工评测需要把抽象词变成可观察标准。例如 faithfulness 要逐条核对是否被给定来源支持,completeness 要检查关键点是否遗漏,safety 要按风险等级判断拒答与替代帮助。评审者应看不到模型身份,样本随机,分歧有仲裁,并报告一致性与置信区间。安全评测同时使用静态规则、专用分类器、对抗提示和人工红队,自动检测能覆盖已知模式,却不能证明系统安全。最终报告要给指标定义、脚本版本、数据切片和失败案例,避免把一个总分当成完整能力。
【验证补充】聚合指标前先定义样本权重。宏平均关注各类别,微平均更受大类影响;成对偏好与绝对打分也不能直接混合。报告中保留原始判断和评审分歧,才能追查总分变化来自模型还是评测器。
关键一句:自动指标是否需要参考答案,取决于指标定义,而不是它是否由程序计算。
核验来源
面试官还可能这样问
- 问法 1 · 场景切入
假设你做了一个电商客服模型,上线前需要评估它回答用户退货问题的质量。你会用哪些指标来快速批量验证?人工评估的话,主要看哪些方面?
- 问法 2 · 层层追问
你怎么评估一个模型生成的回答好不好?……自动指标比如BLEU、ROUGE够用吗?……那人工评估又怎么组织,主要看哪些维度?
- 问法 3 · 直球架构
大模型评估中,常用的自动评价指标和人工评价标准有哪些?各自优缺点是什么?