姚顺宇提到的 Long Horizon,为什么是 AI 的下一道难题?
Why long horizon is AI's next hard problem- “基于你当下的认知,一个关键的重要的 bet 是什么”?
- “Long horizon.”
我最早注意到 Long Horizon 这个词,就是在那场4个多小时的姚顺宇的访谈,非常精彩。
一开始我以为它讲的是“长期记忆”。
后来发现,不是。
Long Horizon 不是简单地说 AI 要记得更久。
它更像是在问:
AI 能不能在一个很长的任务里,持续保持目标、状态和行动?
这件事比“回答一个问题”难得多。
因为回答一个问题,AI 只需要在当前上下文里表现聪明。
但完成一个长期任务,AI 要知道:
- 之前做到哪里了;
- 哪些判断已经变了;
- 哪些信息只是旧假设;
- 哪些错误不能重复;
- 下一步要做什么;
- 做完之后怎么检查;
- 中途被人纠正后,怎么继续,而不是从头再来。
这才是 long horizon 真正难的地方。
它不是一次漂亮回答。
它是 AI 能不能在时间里不迷路。
Long Horizon 到底是什么?
先用很简单的话解释:
Long Horizon = 长跨度任务能力。
这里的 horizon,可以理解成“任务视野”或“任务跨度”。
短 horizon 的任务是:
- 帮我翻译一句话。
- 帮我总结一篇文章。
- 帮我解释一个概念。
- 帮我改一段文案。
这类任务通常只需要一次输入、一次输出。
你把材料给 AI,它看完,回答你。
但 long horizon 的任务是:
- 帮我做一个产品。
- 帮我找工作。
- 帮我写一个系列内容。
- 帮我完成一个代码项目。
- 帮我调研一个复杂问题。
- 帮我持续优化一个工作流。
这类任务不是一次完成的。
它们会跨很多步骤。会不断出现新信息。会需要回看旧判断。会在中途改变方向。会有错误、反馈、修正、再执行。
所以 long horizon 不是“记忆长一点”而已。
它更接近:
长期目标 + 多步计划 + 上下文管理 + 记忆 + 工具调用 + 状态更新 + 错误恢复 + 结果验证
这些合起来,才叫长期任务能力。
Long Horizon 和长期记忆有什么区别?
这点很容易混。
长期记忆是:
- AI 记得你过去说过什么。
- 记得你的偏好。
- 记得项目背景。
- 记得历史决策。
但 long horizon 是:
- AI 能不能基于这些记忆,在很长的任务链条里持续行动。
所以长期记忆只是 long horizon 的一部分。
打个比方。
你让一个人帮你做项目。
他记性很好,当然有帮助。但只记得多,不等于他会做事。
他还需要能判断:
- 现在的目标是什么;
- 之前哪个方案已经被推翻;
- 最新反馈意味着什么;
- 下一步该做什么;
- 什么时候该继续;
- 什么时候该停下来重新评估。
否则,他只是一个记性很好的混乱同事。
AI 也是一样。
记忆解决的是:
过去的信息在哪里。
Long horizon 解决的是:
这些过去的信息,今天还怎么用。
这两个不是一回事。
为什么现在大家越来越关注 Long Horizon?
因为 AI 已经很会“回答”了。
- 你问它一个孤立问题,它经常能答得不错。
- 你给它一段文本,它能总结。
- 你给它一个概念,它能解释。
- 你让它写一段代码,它也能写。
但真实世界里,重要任务很少是一次性问答。
真正有价值的事情,通常都长这样:
- 做一个产品,不是一次 prompt。
- 找一份工作,不是一次 prompt。
- 写一个账号,不是一次 prompt。
- 学 AI,不是一次 prompt。
- 维护一个代码库,也不是一次 prompt。
这些任务会持续。会变化。会出现新的事实。会推翻旧判断。会需要阶段性复盘。
这时候,AI 如果只是“会回答”,就不够了。
它要能持续跟进。
这也是为什么 long horizon 会变重要。
因为 AI 从 chatbot 走向 agent,本质上就是从「回答问题」走向「持续完成任务」。
而一旦开始完成任务,问题就不再只是“模型聪不聪明”。
问题变成:
- 它能不能记住目标;
- 能不能维护状态;
- 能不能调用工具;
- 能不能处理失败;
- 能不能根据反馈修正;
- 能不能知道自己什么时候应该停下来问人。
这就是 long horizon 的难点。
一个例子:做独立产品
比如你在做一个独立产品。
第一天,你说:
“我觉得目标用户是海外独居女性。”
第二天,你发现:
“也许不是独居,而是已经开始承担家庭责任的人。”
第三天,你发了小红书,数据很差。你怀疑是标题问题。
第四天,你复盘后发现:
也许不是标题问题,而是需求表达太绕,用户没有立刻看懂。
第五天,你决定:
先不急着转化,先做内容验证。
如果 AI 只是“记住所有内容”,它会乱。
因为这些信息里有些是旧假设。有些是新判断。有些是情绪。有些是证据。有些只是过程里的自我怀疑。
它不能把所有东西平铺在那里,然后随机拿一条出来影响今天的回答。
这就是为什么“记得多”不等于“帮得好”。
记忆像仓库。状态管理像版本控制。
仓库告诉你:这里有很多东西。版本控制告诉你:现在应该以哪个版本为准。
Long horizon 真正考验的,就是这个版本感。
为什么 AI 在长期任务里容易跑偏?
我觉得有几个原因。
1. 它容易把旧信息当成当前事实
你上个月说过的目标,不一定今天还成立。
你之前说想商业化。后来你可能决定先验证需求。
你之前说想做完整产品。后来你可能决定先做一个 demo。
如果 AI 不区分新旧,它就会一直拿旧地图带你走路。
看起来很努力。但方向已经错了。
2. 它容易把情绪当成设定
这点尤其危险。
你某一天说:
“我好沮丧。”“我觉得这个产品没人要。”“我可能不适合做这个。”
这些都可能只是某一刻的状态。
AI 不应该把它们永久记成:
你是一个容易放弃的人。这个项目没有价值。你不适合继续。
长期任务里,AI 需要分清楚:
- 这是事实,还是情绪?
- 这是阶段性反馈,还是长期判断?
- 这是证据,还是疲惫?
否则它的记忆会变成误解。
3. 它容易只会继续,不会重新评估
很多 AI 很擅长顺着往下写。
- 你说继续,它就继续。
- 你说改,它就改。
- 你说换个方向,它也换。
但长期任务里,真正有价值的不是永远配合。
而是它能提醒你:
- 这个方向之前已经试过。
- 这个假设还没有证据。
- 这个判断和昨天的新信息冲突。
- 这里最好先停一下,不要继续堆输出。
如果 AI 只会配合,它会显得很听话。但未必可靠。
一个好的 long-horizon agent,不应该只是执行命令。它应该能维护目标,发现偏离。
4. 它容易缺少外部反馈
长期任务不可能只靠语言完成。
- 做代码,需要跑测试。
- 做产品,需要看用户反馈。
- 做内容,需要看数据。
- 做求职,需要记录投递和回应。
- 做研究,需要查资料和校验来源。
所以 long horizon 不只是“长记忆”。
它还需要环境。
AI 要能和外部世界交互:
读文件;调用工具;运行测试;查询资料;更新状态;记录结果;根据反馈继续。
这也是为什么 Agent 比 Chatbot 复杂。
Chatbot 主要是说。Agent 必须能在环境里行动。
所以 Long Horizon 到底考验哪些能力?
我会拆成七层。
第一层是 Model。
模型本身要能理解、推理、规划。
第二层是 Memory。
它要记得长期有用的信息。
第三层是 Context。
它要知道当前该带入哪些信息,而不是把所有历史都塞进来。
第四层是 State。
它要知道现在处在哪个阶段,哪个判断是最新版。
第五层是 Tools。
它要能读文件、跑代码、查资料、调用系统。
第六层是 Eval。
它要能检查自己有没有做对,而不是只生成一个看起来合理的答案。
第七层是 Control。
它要知道哪些动作可以自动做,哪些必须让人确认。
这七层加起来,才是长期任务能力。
所以 long horizon 不是一个单独功能。
它是整套 agent 系统的综合能力。
对普通用户有什么用?
如果你用 AI 做长期任务,不要只依赖它“自己记得”。
你可以给每个长期项目准备一个状态文件。
比如:
- 当前目标:
- 目前阶段:
- 已经做过:
- 已放弃方向:
- 最新有效判断:
- 待验证问题:
- 一步行动:
- 不要再重复讨论:
这个文件不需要很长。
但它能帮 AI 快速知道:
现在的版本是什么。
如果你用 ChatGPT,可以放在 Project Instructions 或项目文件里。如果你用 Claude,可以放在 Project Knowledge 里。如果你用 Codex / Claude Code,可以写进 AGENTS.md 或 CLAUDE.md。
不要指望 AI 从一堆聊天历史里自动猜对。
人类做复杂项目,也不是靠脑子硬记。我们靠文档、看板、日志、版本记录、复盘。
AI 也一样。
你要给它一个工作台。
对独立开发者有什么启发?
如果你在做 AI 产品,long horizon 是很值得思考的方向。
因为很多 AI 产品的问题不是模型不会答。而是它无法持续跟进。
- 它不知道用户上次做到哪里。
- 不知道哪些假设已经被推翻。
- 不知道什么时候应该更新状态。
- 不知道什么时候该继续,什么时候该停。
- 不知道旧信息和新信息冲突时该听谁的。
所以一个真正有价值的 AI 产品,不能只是:
用户输入 → 模型输出
它更应该是:
用户目标 → 当前状态 → 历史决策 → 相关资料 → 下一步行动 → 结果反馈 → 状态更新
这才是产品层的价值。
独立开发者未必能训练一个更强的模型。但可以在一个具体场景里,把长期任务系统设计得更好。
比如:
健身助手,不只是生成计划,而是维护周期、反馈、疼痛、恢复和进步。写作助手,不只是生成文章,而是维护账号定位、读者反馈、过往选题和禁用表达。求职助手,不只是改简历,而是维护岗位目标、投递记录、简历版本和面试反馈。Coding agent,不只是写代码,而是维护项目规则、测试命令、历史 bug、当前分支和验证结果。
这些都是 long horizon 的产品机会。
不是“模型更会说”。而是“系统更会持续工作”。
最后
所以我现在理解的 Long Horizon,不是一个炫技词。
它是在问一个很朴素的问题:
AI 能不能陪人把一件复杂的事,真的做下去?
不是今天给一个漂亮回答。
不是明天重新开始。
不是每次都像新来的实习生。
而是它知道:
- 我们在哪里;
- 为什么走到这里;
- 哪些判断已经过期;
- 哪些问题还没验证;
- 下一步应该做什么;
- 什么时候应该请人来判断。
这才是 AI 从 chatbot 走向 agent 的关键。
弱的 AI 只会回答当下。一般的 AI 会记住过去。真正好的 AI,会管理变化。
而长期任务最需要的,恰恰不是一个永远滔滔不绝的回答机器。
是一个能在时间里保持清醒的合作者。