跳到正文

格式化输出 vs 思维链,怎么选?

格式化输出、思维链、指令重构等方法对比与适用场景

原题:在将传统判别式任务(如分类、匹配等)转化为生成式建模任务时,学术界有哪些典型方法(例如格式化输出、思维链引导、指令重构等)?请列举并比较这些方法的效果、适用场景及已有研究中的性能对比结果。

模型架构 · 字节真题

回答与解析

五类转化方式

  1. 格式化直接生成:把分类标签写成合法字符串或JSON字段,直接最大化目标文本似然,适合接口统一。
  2. Cloze与verbalizer:PET等方法把任务改写为带空位的模板,并用verbalizer把类别映射到词。PET的核心是对候选verbalizer概率评分,不是普通自由生成后的字符串排序。
  3. Text-to-text重构:T5把分类、匹配、抽取统一为文本输入到文本输出,可多任务训练。
  4. 指令与上下文示例:自然语言描述任务并提供示例;是否更新参数要区分in-context learning和instruction tuning。
  5. 推理提示与Self-Consistency:适用于确实需要多步且结果可验证的任务。Self-Consistency从随机采样的多条推理路径聚合答案,不适用于temperature=0的单一路径;产品不应保存或展示模型的隐藏推理文本。

不同论文的数字受模型、数据、示例数、解码和评测口径影响,不能跨设置直接排出通用胜负。普通分类先比较直接生成或verbalizer;只有任务存在可验证中间结果时再评估推理提示,并同时报告准确率、格式合法率、校准和推理成本。

口语版讲法(约4分钟)

  • 先说明为何转成生成接口
  • 比较直接生成与PET
  • 介绍text-to-text和指令方式
  • 限定CoT与Self-Consistency场景
  • 给出公平评测口径

把判别任务转成生成任务,核心价值是统一接口和复用预训练模型,但方法之间差异很大。一种方式是格式化直接生成。例如输入一段文本,要求模型只输出正面、负面或一个JSON类别字段,训练时对目标字符串做语言建模损失。标签可以是任何合法字符串,不要求一定是自然语言长句。优点是接口简单,风险是格式错误和标签概率受tokenization影响。

另一种方式是cloze和verbalizer。PET会把输入改写成带空位的模板,再为每个类别指定一个或多个verbalizer词,依据掩码语言模型对这些候选词的概率进行类别评分。它不是先让模型自由生成一段文本,再把结果做普通概率排序。模板和verbalizer质量会直接影响性能,因此要做多模板或校准,而不能把PET等同为任意prompt。

还有一种方式是text-to-text。T5把分类、匹配、抽取和生成统一为文本输入到文本输出,方便多任务共享模型。另一个方向是指令和上下文示例:in-context learning在推理时把示例放进上下文,不更新模型参数;instruction tuning则要用指令数据做梯度训练。两者都可以输出类别字符串,但训练成本和泛化机制不同。

继续看推理提示和Self-Consistency。推理提示适合数学、符号推理或需要可验证中间结果的任务,不是所有复杂分类都必然受益。Self-Consistency需要用非零随机性采样多条推理路径,再按最终答案聚合;如果temperature等于零,只会反复得到同一路径,就失去了这种方法的意义。普通情感分类或匹配任务,先比较直接输出和verbalizer往往更合理。

性能比较必须绑定实验设置。模型大小、示例数量、模板、数据划分、是否微调、解码方法和评测规则不同,论文里的数字不能直接拼成一张通用排行榜。我会在同一模型和数据上比较准确率或F1、格式合法率、概率校准、token成本和延迟;对推理任务再加步骤正确性与答案一致性。

因此选型顺序是:先建立直接生成基线;标签语义与MLM接口匹配时试PET;多任务统一时看text-to-text;需要任务适应时区分ICL和指令微调;只有中间推理确有价值时才评估推理提示与多样化采样。

生产系统应记录可核验中间结果与工具证据,不保存或展示隐藏推理文本。

如果业务需要可比较的类别概率,还要注意生成序列概率受标签长度影响。可以限制每类为单token verbalizer,或按token数归一化并做校准;最终仍要在独立验证集检查可靠性,不能把语言模型原始概率直接当成业务置信度。

关键一句:PET的verbalizer概率评分与自由生成标签有什么本质区别。

核验来源

  1. Exploiting Cloze Questions for Few Shot Text Classification and Natural Language Inference
  2. Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer
  3. Chain-of-Thought Prompting Elicits Reasoning in Large Language Models
  4. Self-Consistency Improves Chain of Thought Reasoning in Language Models

面试官还可能这样问

  1. 问法 1 · 场景切入

    假设现在要把一个意图分类任务统一到生成式接口。你会如何定义输出标签、格式约束和评测,并判断是否真的需要思维链?

  2. 问法 2 · 层层追问

    直接生成标签与结构化输出有什么差别?……指令重构改变了什么?……CoT 适合哪类需要中间推理的任务?……性能、校准和延迟怎样同口径比较?

  3. 问法 3 · 直球技术

    请比较格式化标签生成、seq2seq/指令化与思维链在判别任务转生成任务中的作用、适用边界和评测方法,不预设生成方案更优。

同模块相关题目