调试与评估提示词
先描述“哪里不对”
Section titled “先描述“哪里不对””“再聪明一点”无法指导修改。把问题分成几类:
- 理解错:没有抓住任务目标或范围;
- 事实错:引用了不存在的内容或旧信息;
- 格式错:字段缺失、顺序不对或混入额外文字;
- 执行错:修改了不该动的文件,或没有运行检查;
- 风格错:语气、长度、术语或视觉不符合要求。
一次只改一个变量
Section titled “一次只改一个变量”保留同一组测试输入,先只改“上下文是否完整”,再测试;接着只改输出格式,再测试。一次同时更换模型、提示词和资料,很难知道哪个因素带来了变化。
建立最小评测集
Section titled “建立最小评测集”准备 5~20 个真实样例,至少包含:
- 最常见的正常情况;
- 缺少信息的情况;
- 容易混淆的边界情况;
- 应该拒绝或转人工的高风险情况。
记录输入、期望结果、实际结果和失败原因。每次修改提示词后重新运行,避免“刚好这个例子成功”造成错觉。
一个可复用的反馈方式
Section titled “一个可复用的反馈方式”问题:输出中的 model 字段经常使用展示名,而不是 API ID。证据:第 2、4、7 个样例出现同一错误。期望:字段必须从给定的模型表中选择,找不到时返回 unknown。请只修改提示词中与模型选择相关的规则,并说明为什么。何时换模型,何时补提示词
Section titled “何时换模型,何时补提示词”- 如果模型看不到关键资料:先补上下文或改检索;
- 如果任务规则不清楚:先改提示词和示例;
- 如果上下文足够但复杂推理仍不稳定:测试更适合的模型;
- 如果错误只出现在工具或外部 API:检查权限、参数、超时和返回值,而不是只重写提示词。
评估不只看“答对”
Section titled “评估不只看“答对””还要看成本、速度、可追溯性、隐私、失败后的恢复方式。一个偶尔给出惊艳答案但无法稳定复现的提示词,不一定适合放进工作流。