模型升级后,旧 Prompt 为什么可能不好用了?
Why old prompts can break after a model upgrade模型更听话,不代表原来的指令还会得到同样的结果。
以前以为模型升级之后,同一个 Prompt 的效果只会更好。
但 Anthropic 在发布 Claude Opus 4.7 时,专门提醒了一件很反直觉的事:
因为新模型更严格、更字面地遵循指令,为早期模型写的 Prompt,有时反而会出现意外结果。
到了 Opus 4.8,这类行为仍然延续。它会更明确地执行 Prompt,不会自动把针对一个部分的要求推广到其他部分,也不会主动补上用户没有提出的需求。
这到底是什么意思?
假设你有一段代码审查 Prompt:
检查这段代码。只报告高严重程度的问题。判断要保守,不要吹毛求疵。
模型发现了两个问题:
- 一个可能导致用户被重复扣款;
- 另一个会让少数异常状态显示错误。
以前的模型可能把“只报告高严重程度”理解得比较宽松,最后两个都告诉了你。
更严格遵循指令的模型,也可能发现了两个问题,但只输出第一个,因为它认为第二个没有达到你规定的严重程度。
用户看到的却是:
新模型怎么反而少发现了一个问题?
能力未必下降了。它可能只是更认真地执行了旧 Prompt 里的过滤条件。
有些旧 Prompt 过去表现不错,可能部分依赖模型没有完全照做。
为什么模型要变得更字面?
因为“替用户猜”不总是一件好事。
例如,你只在第一部分下面写:
每个标题下使用三条 bullet points。
旧模型可能自行理解为全文都要这样排版。
在聊天里,这或许显得很懂你。但放进 API、结构化提取或者自动化流程里,就可能变成擅自扩大指令范围。
现在的模型更倾向于只执行你明确写出的要求。希望全文适用,就需要写清楚:
这一规则适用于所有部分。
Anthropic 给出的好处是:这样更精确,来回折腾更少,也更适合需要稳定、可预测结果的自动化流程。
换句话说,以前模型可能会帮你补全意思;现在它更希望你把范围说清楚。
旧 Prompt 里还可能藏着“脚手架”
所谓脚手架,是任务之外,为了弥补模型过去的缺点,额外加上的一套工作规则。
例如,真实任务只是修复一个 Bug,但项目指令里还写着:
开始前必须列计划。每调用三次工具必须汇报一次进度。每完成一个阶段都要总结。遇到任何不确定都要停下来询问。
这些规则未必有问题。
但其中一些可能是因为旧模型不主动汇报、容易漏步骤,才逐渐加进去的。
Opus 4.7 和 4.8 会在较长的 agent 任务中,更规律地主动更新进展。因此 Anthropic 建议,如果工作流里有“每三次工具调用必须汇报”这样的机制,可以先试着移除。
原因也没有那么严重:两套汇报方式叠加后,可能只是信息重复、机械更新变多,额外占用上下文和成本。
默认汇报不好用,再明确告诉模型,希望它在什么节点、汇报哪些内容。
重点不是旧规则都要删掉,而是:
这条规则当初在补什么?模型现在是不是已经会了?
有时需要调整的不是 Prompt
Opus 4.7 之后,Anthropic 还强调了一个重要变量:effort。
同一个模型,可以用不同的 effort 运行。effort 越高,模型通常会投入更多推理和工具调用,但速度更慢、成本也更高。Anthropic 认为,在同一个模型内调整 effort,很多时候比直接更换模型更合适;对于多数 coding 和 agentic 任务,官方建议使用 xhigh。
所以复杂任务回答得太浅时,不一定要继续往 Prompt 里写:
深入思考。全面分析。不要遗漏任何可能性。
可以先检查 effort。
工具调用太少时,也可能需要提高 effort,或者明确写出什么情况下必须使用工具。
这也意味着,结果发生变化时,不能只怪 Prompt。
可能是模型变了,也可能是 effort、工具调用习惯或者默认行为变了。
用户需要做什么?
不用因为模型升级,就把所有 Prompt 推倒重写。
一次性聊天,结果正常,继续用就好。
真正值得重新试一次的是:
- 长期反复使用的 Prompt;
- Skills;
- Claude Code 等 agent 的项目规则;
- 已经接入真实工作的自动化流程。
换模型后,拿一两个平时真的会用的任务跑一遍。重点看几个明显变化:
- 原来会覆盖的内容,现在有没有遗漏;
- 限制条件是否执行得更严格;
- 语气和篇幅有没有明显变化;
- 工具调用和进度更新是否还符合需要;
- 当前 effort 是否适合任务。
哪里真的变了,再改哪里。
范围不清,就把范围写清;过滤太严,就调整筛选条件;进度汇报重复,就试着移除旧脚手架;推理太浅,就检查 effort;模型本身不适合任务,再考虑换模型。
换了模型,重要的旧 Prompt 最好重新跑一遍。
这一篇讨论的是:模型变了,旧 Prompt 可能需要重新适配。
但还有另一种情况——模型没有变,Prompt 和 Skill 也可能在不断补规则的过程中,慢慢变得不好用。