ChatGPT/Codex - Model/Effort 怎么选?不是越高越好
Choosing model and effort in ChatGPT/Codex升级 ChatGPT Pro 后,我最自然的反应是:
既然有了 Pro 和 Extra High,重要的问题当然选最高档。Codex 也一样,模型选最强的,effort 尽量往上开。
但真正用了一段时间后,我发现这并不是最好的方式。
Pro 的确经常会等更久;Codex 开高档位后,额度也消耗得很快。有一次,我一个上午几乎用掉了一周的 usage。更关键的是,付出了更多时间和额度,结果不一定更适合当前任务。
有些答案会更周全,但也更啰嗦;有些简单问题会被过度分析;写标题、改措辞这类任务,低档位反而可能更直接、更自然。
问题不在于高档位没用,而在于:
模型和 effort 解决的不是同一个问题,最高档也不是所有任务的标准答案。
以下产品信息截至 2026 年 7 月。
一、Model 和 Effort,分别影响什么?
可以把一次 AI 任务理解成请人做事。
Model,是选择让谁来做。
不同模型不只是“强弱”不同,擅长的事情也不同:
- 有的适合复杂、开放、需要判断的任务;
- 有的适合日常工作,在能力、速度和成本之间更平衡;
- 有的适合清楚、重复、容易验收的任务。
Effort,是决定这一次让它投入多少推理。
更高的 effort,通常意味着模型会花更多计算去拆解问题、比较方案、检查约束和修正结果。
这不等于答案一定更长。
高 effort 可能思考很久,最后只给出几句话;低 effort 也可能写出一篇很长、但没有真正想清楚的内容。
还有两个变量也不能忽略:
Prompt 和上下文决定任务有没有说清楚;工具和数据决定模型手里有没有完成任务所需的材料。
所以,一次回答不好,不一定是模型不够强,也不一定是 effort 不够高。
可能只是:
- 目标没说清楚;
- 缺少关键文件;
- 没有搜索最新信息;
- 验收标准不明确;
- 或者本来应该拆开的任务,被塞进了一次请求里。
更高 effort 主要解决“推理投入不够”,解决不了所有质量问题。
二、为什么高档位有时还不如低档位?
这里的“不如”,不一定是能力更差,而是结果更不适合当前任务。
1. 简单任务被做复杂了
例如:
帮我把这句话改得自然一点。
低档位可能直接给出一个能用的版本。
高档位可能开始分析人物关系、语气强弱和文化差异,再给出五种写法。内容未必有错,但完成这件小事的时间和阅读成本都变高了。
2. 目标错了,模型却做得更认真了
假如你想让 AI 删除文章里的水分,但它把目标理解成“写得更专业”,更高的 effort 可能让文章结构更完整、解释更多,也更像一份报告。
它不是没努力,而是努力错了方向。
这种情况应该重新说明目标和完成标准,而不是继续升档。
3. 真正缺的是信息
询问最新政策、产品价格、岗位状态、代码现状时,模型需要的是搜索、文件、数据库或真实代码。
思考得再久,也不能把旧信息变成新信息。
4. 创意和表达没有唯一答案
标题、文案、私人消息、情绪对话,并不总有一个可以靠不断推理逼近的“最优解”。
更高 effort 有时会让文字更完整、更安全,但也更平均、更不自然。
相反,高档位真正擅长的是:
- 多步骤问题;
- 多个条件之间的权衡;
- 长上下文;
- 容易遗漏细节的审计;
- 需要验证和反复检查的任务。
官方给 Codex 的建议其实也很直接:先使用能够产出所需结果的最低 reasoning effort,只有任务确实需要更多规划、分析或检查时,再向上调整。
三、ChatGPT 的几个档位怎么选?
截至目前,ChatGPT 中:
- Instant 使用 GPT-5.5 Instant;
- Medium、High、Extra High 都使用 GPT-5.6 Sol,区别主要是 reasoning effort;
- Pro 使用 GPT-5.6 Sol Pro,面向更困难、运行时间更长的任务。
所以,Medium 升到 High,主要是增加同一个模型的推理投入;Extra High 切到 Pro,则不只是继续加一级 effort,而是换到了 Pro 路径。
Instant:直接完成的小事
适合:
- 简单问答;
- 翻译和措辞;
- 短文本总结;
- 快速 brainstorm;
- 明确、低风险的小任务。
例如改一句英文、整理一条消息、解释一个简单概念,没有必要先开 Pro。
Medium:多数认真问题的起点
适合:
- 解释一个新概念;
- 第一轮内容整理;
- 普通产品讨论;
- 梳理一个问题的主要利弊;
- 有一定推理,但不需要复杂审计的任务。
对多数日常问题,Medium 已经够用。
High:严肃工作的主力档
适合:
- 多个方案的比较和取舍;
- 产品设计;
- 文章重构;
- 求职材料和岗位匹配;
- 需要明确判断,而不是简单罗列信息的任务。
对我来说,High 比 Pro 更适合作为日常严肃工作的主力。
它通常有足够的分析深度,又不至于每次都等待很久。
Extra High:终审和审计
适合:
- 很长的上下文;
- 多份材料相互核对;
- 检查冲突和遗漏;
- 技术方案审查;
- 长文的事实、结构和重复检查;
- 重要内容提交前的 final review。
我更愿意在内容已经基本完成后使用 Extra High,而不是从第一稿就开始使用。
Pro:少量真正困难的任务
适合:
- 高价值、长链路任务;
- 需要综合大量证据;
- 普通档位已经出现明显遗漏;
- 错误会带来较高成本;
- 多花一些时间换取更高可靠性是值得的。
例如 repo 级架构审计、跨代码和文档的系统诊断,或者重要方案提交前的综合检查。
Pro 通常会等得更久,但等待时间也不全是“思考”:搜索、读取文件、调用工具、运行代码和生成结果都会占用时间。
因此,看到它转了很久,不能简单理解为“它一定想得更深,也一定答得更好”。
四、ChatGPT Pro 有额度吗?
有。
购买 Pro 订阅,不代表所有模型和档位都可以无限使用。官方说明,Pro 计划中的部分模型有独立 usage allowance;达到后,对应模型可能暂时不可用,直到额度重置。
但目前没有一张面向个人用户的固定换算表,告诉你一次 High、一次 Extra High 和一次 Pro 分别扣多少。
还有一个实用细节:
Instant 自动判断并切换到 Medium,不计入手动选择 reasoning 的 allowance。
所以,日常把 Instant 的自动切换打开,比所有问题都手动选择 High 或 Pro 更省心。
五、Codex 里,先选 Model,再选 Effort
Codex 当前主要提供三个 GPT-5.6 模型:
- Sol;
- Terra;
- Luna。
官方默认的 Power 设置是 Sol + Medium。这是一个可靠的通用起点,但不意味着所有任务都应该一直留在 Sol。
Luna:任务已经很清楚
适合:
- 提取和分类信息;
- 转换 JSON、CSV 或其他格式;
- 按模板生成文件;
- 批量修改文案;
- 重命名变量;
- 其他重复、明确、容易验收的工作。
判断 Luna 是否合适,不是看任务“小不小”,而是看:
你是否已经知道,什么叫正确完成。
Terra:日常开发主力
适合:
- 实现范围清楚的功能;
- 修复普通 bug;
- 添加测试;
- 修改已有组件;
- 按现有架构增加一个 API;
- 需要一定推理和工具调用,但不需要复杂架构判断的工作。
例如给已有列表增加导出功能、补充表单校验、修复移动端布局,这些任务通常没有必要全部交给 Sol。
Sol:复杂、模糊、高价值任务
适合:
- 原因不明确的复杂 bug;
- 跨多个模块的重构;
- 新模块的架构设计;
- 代码和文档一致性检查;
- 多种技术方案之间的权衡;
- 重要 PR 的深度 review。
Sol 的价值不只是代码写得更好,而是它更适合那些不能按照明确步骤机械完成的任务。
官方对三个模型的定位也是:Sol 负责复杂、开放、需要判断和打磨的工作;Terra 是日常主力;Luna 面向清楚、重复和高频的任务。
Codex 里还可能看到 Spark。它是一个强调低延迟、接近实时编码反馈的 research preview,更像专用的快速交互模式,不是 Sol、Terra、Luna 之间简单的“最低档”。
六、选完模型,再决定 Codex 的 Effort
Light / Low
适合修改范围很小、几乎不需要探索的任务。
例如:
把按钮文案从 Continue 改成 Submit,并更新对应测试。
Medium
适合大多数普通开发任务。
它会读取相关代码、做基本规划、完成修改并验证结果,但不会投入过多时间反复探索。
High
适合:
- 涉及多个文件;
- 需要定位根因;
- 存在多种实现方式;
- 容易引入回归;
- 完成后需要系统验证的任务。
例如:
用户偶尔会收到两封重复邮件,请定位原因、修复、补充回归测试,并检查是否存在同类问题。
Extra High
Extra High 会让当前模型围绕一个任务思考得更深。
它适合高度耦合、难以拆分的问题,例如一个同时涉及缓存、并发和状态恢复的复杂 bug。
Ultra
Ultra 不是“比 Max 更努力”。
它会调用 subagents,把任务拆成几个相对独立的部分并行处理。
例如,一次发布前审计可以同时检查:
- 前端;
- API;
- 数据库迁移;
- 测试;
- 文档;
- 安全风险。
这种任务适合 Ultra。
两者的区别可以简单记成:
Max:一个 agent 深挖同一道难题。Ultra:多个 agents 分头处理可以拆开的任务。
大多数普通开发任务,两者都不需要。
七、为什么 Codex 的 usage 会消耗得很快?
Codex 的消耗不只取决于“发了几条消息”。
Prompt、聊天历史、文件、代码、工具返回结果和最终输出都会占用 token;模型、上下文大小、reasoning 和工具使用,也都会影响 credit 消耗。
按照当前 rate card,在同样的 token 用量下:
- Sol 的 credit rate 大约是 Terra 的两倍;
- Sol 大约是 Luna 的五倍。
具体数字以后可能变化,但它说明了一件事:
选择模型,本身就是在分配开发预算。
长 Prompt、很大的 AGENTS.md、不必要的 MCP、不断增长的对话历史,以及长期使用高 effort,都会让消耗增加。OpenAI 的官方建议也包括:删除不必要的上下文、控制 AGENTS.md 的长度,并关闭当前任务不需要的 MCP。
所以,一个上午用掉大量 usage,不一定只是任务太多,也可能是每个任务都走了最重的路径。
八、答案不好时,先别急着升档
我现在会先判断问题出在哪里。
事实不新或缺少证据:
搜索网页、读取官方资料,而不是让模型继续猜。
没有理解真正目标:
重新说明 Goal、Context、Constraints 和 Done when。
Codex 总在 repo 里犯同一种错:
完善 AGENTS.md、测试和验证方式,而不是每次换成 Sol + Extra High。
分析明显太浅,漏掉多个条件:
这时再提高 effort。
任务太大,而且能够拆成几个独立方向:
拆任务,或者考虑 Ultra。
任务本身很简单,答案却越来越复杂:
降低档位,收紧输出要求。
我的默认选择
现在我大致会这样使用:
ChatGPT
- 日常问题:Instant,开启自动切换到 Medium;
- 普通认真讨论:Medium;
- 产品、写作、求职和复杂决策:High;
- 多材料核对和最终审稿:Extra High;
- 少量真正困难、高价值的任务:Pro。
Codex
- 清楚、重复、可验收:Luna;
- 日常功能和普通 bug:Terra;
- 复杂 bug、架构和跨模块任务:Sol;
- Effort 从 Medium 开始,不够再升;
- Max 和 Ultra 只留给确实符合它们工作方式的任务。
付费获得更高档位,当然应该使用。
但“充分使用”不等于每一次都选最高。
先选择适合任务的模型,再选择能够稳定完成任务的最低 effort。
当答案不好时,先找出缺的是信息、任务定义、上下文、工具、模型能力,还是推理投入。
知道什么时候需要最高档很重要。
知道什么时候不需要,也一样重要。