跳到正文

Prompt 怎么设计和优化?

构建原则、迭代方法及实际效果详解

原题:在大模型应用中,你是如何设计和优化Prompt的?请说明构建原则、迭代方法及实际效果。

模型微调 · 科大讯飞真题

回答与解析

真实性边界

这是 Prompt 实践经历题。场景、公司、基线、样本数、准确率、幻觉率、token 和延迟都必须来自候选人的真实实验。题库不提供可直接背诵的“优化成绩”。

回答框架

  1. 任务与失败定义:输入、输出、错误类型、主指标和线上约束。
  2. 初始基线:模型及版本、原 Prompt、解码参数、评测集和基线结果。
  3. 迭代过程:每轮只改变有限变量,例如指令分层、上下文、示例选择、结构化输出或校验。
  4. 因果验证:固定模型与数据做单变量对照,按切片报告质量、格式成功率、延迟和成本。
  5. 上线治理:版本化、灰度、回归集、监控、回滚和敏感输入处理。

事实填空

任务是【真实任务】,模型版本【】,基线 Prompt【】,评测集【来源/规模/切分】,主要错误【】。我负责【】;第一个改动【】,第二个改动【】,各自消融结果【真实数据】。最终指标【】从【真实基线】到【真实结果】,同时【延迟/token/成本】变化【】,观察窗口【】。

证据自检

能否提供 Prompt 版本 diff、固定测试集、失败样本、实验配置、统计波动和回滚记录?如果同时更换模型、数据和 Prompt,就不能把结果全部归因于 Prompt。

追问入口

准备解释示例如何选择、上下文污染如何防止、结构化输出是否真正受约束、评测器偏差、提示注入、长上下文成本,以及何时应改用微调或 RAG。

口语版讲法(约90秒)

  • Prompt本质是约束模型行为的边界条件
  • 设计原则:系统与用户解耦、具体化约束
  • 迭代方法:从Badcase到自动化评估
  • 业务案例:工单分类的准确率与成本双优化
  • 风险与取舍:Prompt不是万能,需要和微调配合

我会选一个能回到版本记录的真实任务来讲。场景是【真实任务】,使用【模型版本】,当时最主要的失败是【主要失败】。我负责【本人职责】,不在我职责里的模型训练或业务决策会直接说明团队分工。

优化时我先固定模型、数据、解码参数和回归集,只改一个主要因素。具体改动是【关键改动】,它必须对应前面那个失败,例如用清晰的指令层级解决冲突,用结构化输出加服务端校验解决解析问题,而不是为了堆技巧。效果按【评测口径】评估,既看主任务质量,也看格式成功率、危险输入、token 和延迟。

结果只填写【真实结果】,并保留 Prompt diff、失败样本和实验配置。如果同一轮还换了模型或数据,我不会把收益全部归因于 Prompt。上线后按 Prompt 版本灰度和监控,出现关键切片退化就回滚;如果问题来自知识缺失、权限或模型能力上限,我会改用 RAG、工具或微调,而不是继续加提示词。

关键一句:Prompt和微调之间如何选择,以及各自的适用边界。

面试官还可能这样问

  1. 问法 1 · 场景切入

    假设你在做电商客服的意图识别,用户问‘我的订单怎么还没到?’,你准备怎么设计Prompt让模型既要识别诉求,又不能瞎编物流信息?

  2. 问法 2 · 层层追问

    你平常写Prompt一般注意哪些点?……如果效果不好,你怎么一步步去调?……那怎么衡量优化前后的效果差距?

  3. 问法 3 · 直球架构

    设计一个生产级的Prompt优化流程,从初版构建到线上监控,你具体会分哪几个阶段?每个阶段用什么方法或工具来保证效果和成本可控?

同模块相关题目