Day 067AI 协作手记 Working with AI约 11 分钟

ChatGPT/Codex - Model/Effort 怎么选?不是越高越好

Choosing model and effort in ChatGPT/Codex

升级 ChatGPT Pro 后,我最自然的反应是:

既然有了 Pro 和 Extra High,重要的问题当然选最高档。Codex 也一样,模型选最强的,effort 尽量往上开。

但真正用了一段时间后,我发现这并不是最好的方式。

Pro 的确经常会等更久;Codex 开高档位后,额度也消耗得很快。有一次,我一个上午几乎用掉了一周的 usage。更关键的是,付出了更多时间和额度,结果不一定更适合当前任务。

有些答案会更周全,但也更啰嗦;有些简单问题会被过度分析;写标题、改措辞这类任务,低档位反而可能更直接、更自然。

问题不在于高档位没用,而在于:

模型和 effort 解决的不是同一个问题,最高档也不是所有任务的标准答案。

以下产品信息截至 2026 年 7 月。

一、Model 和 Effort,分别影响什么?

可以把一次 AI 任务理解成请人做事。

Model,是选择让谁来做。

不同模型不只是“强弱”不同,擅长的事情也不同:

  • 有的适合复杂、开放、需要判断的任务;
  • 有的适合日常工作,在能力、速度和成本之间更平衡;
  • 有的适合清楚、重复、容易验收的任务。

Effort,是决定这一次让它投入多少推理。

更高的 effort,通常意味着模型会花更多计算去拆解问题、比较方案、检查约束和修正结果。

这不等于答案一定更长。

高 effort 可能思考很久,最后只给出几句话;低 effort 也可能写出一篇很长、但没有真正想清楚的内容。

还有两个变量也不能忽略:

Prompt 和上下文决定任务有没有说清楚;工具和数据决定模型手里有没有完成任务所需的材料。

所以,一次回答不好,不一定是模型不够强,也不一定是 effort 不够高。

可能只是:

  • 目标没说清楚;
  • 缺少关键文件;
  • 没有搜索最新信息;
  • 验收标准不明确;
  • 或者本来应该拆开的任务,被塞进了一次请求里。

更高 effort 主要解决“推理投入不够”,解决不了所有质量问题。

二、为什么高档位有时还不如低档位?

这里的“不如”,不一定是能力更差,而是结果更不适合当前任务。

1. 简单任务被做复杂了

例如:

帮我把这句话改得自然一点。

低档位可能直接给出一个能用的版本。

高档位可能开始分析人物关系、语气强弱和文化差异,再给出五种写法。内容未必有错,但完成这件小事的时间和阅读成本都变高了。

2. 目标错了,模型却做得更认真了

假如你想让 AI 删除文章里的水分,但它把目标理解成“写得更专业”,更高的 effort 可能让文章结构更完整、解释更多,也更像一份报告。

它不是没努力,而是努力错了方向。

这种情况应该重新说明目标和完成标准,而不是继续升档。

3. 真正缺的是信息

询问最新政策、产品价格、岗位状态、代码现状时,模型需要的是搜索、文件、数据库或真实代码。

思考得再久,也不能把旧信息变成新信息。

4. 创意和表达没有唯一答案

标题、文案、私人消息、情绪对话,并不总有一个可以靠不断推理逼近的“最优解”。

更高 effort 有时会让文字更完整、更安全,但也更平均、更不自然。

相反,高档位真正擅长的是:

  • 多步骤问题;
  • 多个条件之间的权衡;
  • 长上下文;
  • 容易遗漏细节的审计;
  • 需要验证和反复检查的任务。

官方给 Codex 的建议其实也很直接:先使用能够产出所需结果的最低 reasoning effort,只有任务确实需要更多规划、分析或检查时,再向上调整。

三、ChatGPT 的几个档位怎么选?

截至目前,ChatGPT 中:

  • Instant 使用 GPT-5.5 Instant;
  • Medium、High、Extra High 都使用 GPT-5.6 Sol,区别主要是 reasoning effort;
  • Pro 使用 GPT-5.6 Sol Pro,面向更困难、运行时间更长的任务。

所以,Medium 升到 High,主要是增加同一个模型的推理投入;Extra High 切到 Pro,则不只是继续加一级 effort,而是换到了 Pro 路径。

Instant:直接完成的小事

适合:

  • 简单问答;
  • 翻译和措辞;
  • 短文本总结;
  • 快速 brainstorm;
  • 明确、低风险的小任务。

例如改一句英文、整理一条消息、解释一个简单概念,没有必要先开 Pro。

Medium:多数认真问题的起点

适合:

  • 解释一个新概念;
  • 第一轮内容整理;
  • 普通产品讨论;
  • 梳理一个问题的主要利弊;
  • 有一定推理,但不需要复杂审计的任务。

对多数日常问题,Medium 已经够用。

High:严肃工作的主力档

适合:

  • 多个方案的比较和取舍;
  • 产品设计;
  • 文章重构;
  • 求职材料和岗位匹配;
  • 需要明确判断,而不是简单罗列信息的任务。

对我来说,High 比 Pro 更适合作为日常严肃工作的主力。

它通常有足够的分析深度,又不至于每次都等待很久。

Extra High:终审和审计

适合:

  • 很长的上下文;
  • 多份材料相互核对;
  • 检查冲突和遗漏;
  • 技术方案审查;
  • 长文的事实、结构和重复检查;
  • 重要内容提交前的 final review。

我更愿意在内容已经基本完成后使用 Extra High,而不是从第一稿就开始使用。

Pro:少量真正困难的任务

适合:

  • 高价值、长链路任务;
  • 需要综合大量证据;
  • 普通档位已经出现明显遗漏;
  • 错误会带来较高成本;
  • 多花一些时间换取更高可靠性是值得的。

例如 repo 级架构审计、跨代码和文档的系统诊断,或者重要方案提交前的综合检查。

Pro 通常会等得更久,但等待时间也不全是“思考”:搜索、读取文件、调用工具、运行代码和生成结果都会占用时间。

因此,看到它转了很久,不能简单理解为“它一定想得更深,也一定答得更好”。

四、ChatGPT Pro 有额度吗?

有。

购买 Pro 订阅,不代表所有模型和档位都可以无限使用。官方说明,Pro 计划中的部分模型有独立 usage allowance;达到后,对应模型可能暂时不可用,直到额度重置。

但目前没有一张面向个人用户的固定换算表,告诉你一次 High、一次 Extra High 和一次 Pro 分别扣多少。

还有一个实用细节:

Instant 自动判断并切换到 Medium,不计入手动选择 reasoning 的 allowance。

所以,日常把 Instant 的自动切换打开,比所有问题都手动选择 High 或 Pro 更省心。

五、Codex 里,先选 Model,再选 Effort

Codex 当前主要提供三个 GPT-5.6 模型:

  • Sol;
  • Terra;
  • Luna。

官方默认的 Power 设置是 Sol + Medium。这是一个可靠的通用起点,但不意味着所有任务都应该一直留在 Sol。

Luna:任务已经很清楚

适合:

  • 提取和分类信息;
  • 转换 JSON、CSV 或其他格式;
  • 按模板生成文件;
  • 批量修改文案;
  • 重命名变量;
  • 其他重复、明确、容易验收的工作。

判断 Luna 是否合适,不是看任务“小不小”,而是看:

你是否已经知道,什么叫正确完成。

Terra:日常开发主力

适合:

  • 实现范围清楚的功能;
  • 修复普通 bug;
  • 添加测试;
  • 修改已有组件;
  • 按现有架构增加一个 API;
  • 需要一定推理和工具调用,但不需要复杂架构判断的工作。

例如给已有列表增加导出功能、补充表单校验、修复移动端布局,这些任务通常没有必要全部交给 Sol。

Sol:复杂、模糊、高价值任务

适合:

  • 原因不明确的复杂 bug;
  • 跨多个模块的重构;
  • 新模块的架构设计;
  • 代码和文档一致性检查;
  • 多种技术方案之间的权衡;
  • 重要 PR 的深度 review。

Sol 的价值不只是代码写得更好,而是它更适合那些不能按照明确步骤机械完成的任务。

官方对三个模型的定位也是:Sol 负责复杂、开放、需要判断和打磨的工作;Terra 是日常主力;Luna 面向清楚、重复和高频的任务。

Codex 里还可能看到 Spark。它是一个强调低延迟、接近实时编码反馈的 research preview,更像专用的快速交互模式,不是 Sol、Terra、Luna 之间简单的“最低档”。

六、选完模型,再决定 Codex 的 Effort

Light / Low

适合修改范围很小、几乎不需要探索的任务。

例如:

把按钮文案从 Continue 改成 Submit,并更新对应测试。

Medium

适合大多数普通开发任务。

它会读取相关代码、做基本规划、完成修改并验证结果,但不会投入过多时间反复探索。

High

适合:

  • 涉及多个文件;
  • 需要定位根因;
  • 存在多种实现方式;
  • 容易引入回归;
  • 完成后需要系统验证的任务。

例如:

用户偶尔会收到两封重复邮件,请定位原因、修复、补充回归测试,并检查是否存在同类问题。

Extra High

Extra High 会让当前模型围绕一个任务思考得更深。

它适合高度耦合、难以拆分的问题,例如一个同时涉及缓存、并发和状态恢复的复杂 bug。

Ultra

Ultra 不是“比 Max 更努力”。

它会调用 subagents,把任务拆成几个相对独立的部分并行处理。

例如,一次发布前审计可以同时检查:

  • 前端;
  • API;
  • 数据库迁移;
  • 测试;
  • 文档;
  • 安全风险。

这种任务适合 Ultra。

两者的区别可以简单记成:

Max:一个 agent 深挖同一道难题。Ultra:多个 agents 分头处理可以拆开的任务。

大多数普通开发任务,两者都不需要。

七、为什么 Codex 的 usage 会消耗得很快?

Codex 的消耗不只取决于“发了几条消息”。

Prompt、聊天历史、文件、代码、工具返回结果和最终输出都会占用 token;模型、上下文大小、reasoning 和工具使用,也都会影响 credit 消耗。

按照当前 rate card,在同样的 token 用量下:

  • Sol 的 credit rate 大约是 Terra 的两倍;
  • Sol 大约是 Luna 的五倍。

具体数字以后可能变化,但它说明了一件事:

选择模型,本身就是在分配开发预算。

长 Prompt、很大的 AGENTS.md、不必要的 MCP、不断增长的对话历史,以及长期使用高 effort,都会让消耗增加。OpenAI 的官方建议也包括:删除不必要的上下文、控制 AGENTS.md 的长度,并关闭当前任务不需要的 MCP。

所以,一个上午用掉大量 usage,不一定只是任务太多,也可能是每个任务都走了最重的路径。

八、答案不好时,先别急着升档

我现在会先判断问题出在哪里。

事实不新或缺少证据:

搜索网页、读取官方资料,而不是让模型继续猜。

没有理解真正目标:

重新说明 Goal、Context、Constraints 和 Done when。

Codex 总在 repo 里犯同一种错:

完善 AGENTS.md、测试和验证方式,而不是每次换成 Sol + Extra High。

分析明显太浅,漏掉多个条件:

这时再提高 effort。

任务太大,而且能够拆成几个独立方向:

拆任务,或者考虑 Ultra。

任务本身很简单,答案却越来越复杂:

降低档位,收紧输出要求。

我的默认选择

现在我大致会这样使用:

ChatGPT

  • 日常问题:Instant,开启自动切换到 Medium;
  • 普通认真讨论:Medium;
  • 产品、写作、求职和复杂决策:High;
  • 多材料核对和最终审稿:Extra High;
  • 少量真正困难、高价值的任务:Pro。

Codex

  • 清楚、重复、可验收:Luna;
  • 日常功能和普通 bug:Terra;
  • 复杂 bug、架构和跨模块任务:Sol;
  • Effort 从 Medium 开始,不够再升;
  • Max 和 Ultra 只留给确实符合它们工作方式的任务。

付费获得更高档位,当然应该使用。

但“充分使用”不等于每一次都选最高。

先选择适合任务的模型,再选择能够稳定完成任务的最低 effort。

当答案不好时,先找出缺的是信息、任务定义、上下文、工具、模型能力,还是推理投入。

知道什么时候需要最高档很重要。

知道什么时候不需要,也一样重要。