跳转到内容

调试与评估提示词

“再聪明一点”无法指导修改。把问题分成几类:

  • 理解错:没有抓住任务目标或范围;
  • 事实错:引用了不存在的内容或旧信息;
  • 格式错:字段缺失、顺序不对或混入额外文字;
  • 执行错:修改了不该动的文件,或没有运行检查;
  • 风格错:语气、长度、术语或视觉不符合要求。

保留同一组测试输入,先只改“上下文是否完整”,再测试;接着只改输出格式,再测试。一次同时更换模型、提示词和资料,很难知道哪个因素带来了变化。

准备 5~20 个真实样例,至少包含:

  1. 最常见的正常情况;
  2. 缺少信息的情况;
  3. 容易混淆的边界情况;
  4. 应该拒绝或转人工的高风险情况。

记录输入、期望结果、实际结果和失败原因。每次修改提示词后重新运行,避免“刚好这个例子成功”造成错觉。

问题:输出中的 model 字段经常使用展示名,而不是 API ID。
证据:第 2、4、7 个样例出现同一错误。
期望:字段必须从给定的模型表中选择,找不到时返回 unknown。
请只修改提示词中与模型选择相关的规则,并说明为什么。
  • 如果模型看不到关键资料:先补上下文或改检索;
  • 如果任务规则不清楚:先改提示词和示例;
  • 如果上下文足够但复杂推理仍不稳定:测试更适合的模型;
  • 如果错误只出现在工具或外部 API:检查权限、参数、超时和返回值,而不是只重写提示词。

还要看成本、速度、可追溯性、隐私、失败后的恢复方式。一个偶尔给出惊艳答案但无法稳定复现的提示词,不一定适合放进工作流。