如果只读 3 篇论文理解今天的 AI
Three papers to understand today's AI前面写了一个小系列,聊普通人如何正确相信 AI。
写完之后,我想到一个更小的问题:
如果不想系统学机器学习,但想理解今天 AI 行业为什么变成这样,只读 3 篇论文,我会选哪三篇?
先说明:这不是“AI 史上最伟大的三篇论文”。
我选的是:最能帮普通人和独立开发者理解今天 AI 主线的三篇。
它们分别对应三件事:
架构。 AI 为什么能处理复杂上下文。规模化。 AI 为什么变成算力、数据和工程的竞争。助手化。 AI 为什么从“会生成文本”变成“像一个助手”。
所以我会选:
- Attention Is All You Need
- Training Compute-Optimal Large Language Models
- Training language models to follow instructions with human feedback
1. Attention Is All You Need
发表时间:2017 年相关机构:Google,University of Toronto关键词:Transformer / attention / context
这篇论文提出了 Transformer 架构。
标题经常被当成一句名言,但它首先是一篇论文标题。
它的核心不是“注意力很重要”这种鸡汤,而是:模型可以通过 attention mechanism,更有效地处理序列里不同 token 之间的关系。
说人话就是:
当前这个词,要参考上下文里的哪些信息?参考多少?
这也是为什么今天的 AI 很会处理上下文。
它能总结文章。能改写语气。能接住前文。能判断一段话里“它 / 他 / 这个”到底指向谁。能把混乱的表达整理成结构。
所以它像是“听懂了你”。
但更准确地说,是它很会处理语言里的关系。
今天看,它解释了什么?
它解释了为什么 AI 产品里,“上下文”这么重要。
Prompt、memory、long context、RAG、agent workflow,本质上都绕不开同一个问题:
模型拿到了什么上下文?有没有用对上下文?
这不是小细节。很多 AI 输出质量问题,不是模型完全不行,而是上下文给错了、少了、乱了,或者没有被正确保留。
Take away
对普通人来说,prompt 不是咒语。
更重要的是:你有没有讲清楚背景、目标、限制和判断标准。
不要只问:
帮我分析一下。
更好的问法是:
这是背景。这是我的目标。这是我不确定的地方。请基于这些信息帮我分析。
对独立开发者来说,AI 产品不是接一个模型 API 就结束了。
你真正要设计的是:
用户输入什么。系统保留什么。哪些信息不能丢。什么时候要检索资料。什么时候要追问用户。什么时候要让用户确认。
很多 AI 产品失败,不一定是模型太差。而是上下文设计太差。
哪些被证实 / 修正了?
被证实的是:Transformer 确实成为现代主流 LLM 的重要基础之一。
需要修正的是:它不是“所有 AI 的唯一基础”。
AI 还有推荐系统、扩散模型、强化学习、机器人控制、传统机器学习等很多路线。
更准确的说法是:
如果讨论今天的聊天式 AI / 大语言模型,Transformer 是绕不开的基础。但不要把它写成整个 AI 世界的唯一答案。
2. Training Compute-Optimal Large Language Models
发表时间:2022 年相关机构:DeepMind常见名字:Chinchilla 论文关键词:scaling law / compute / data / model size
这篇论文通常被叫做 Chinchilla 论文。
Chinchilla 是一种南美小型啮齿动物,中文常叫龙猫。DeepMind 之前有一个更大的模型叫 Gopher,而 Chinchilla 参数量更小、训练数据更多,表现反而更好。
这个名字也刚好很适合这篇论文想表达的核心:
大不一定更好,配比更重要。
在这之前,很多人容易形成一个粗糙理解:
模型越大越好。
但 Chinchilla 论文给了一个更细的结论:
不是只把参数做大。模型大小、训练数据量和算力预算要匹配。
论文指出,当时很多大语言模型其实是 undertrained。也就是说,模型参数很大,但训练数据相对不够。
这篇的重要性在于,它把行业从“盲目堆参数”往前推了一步:
大,不够。还要算数据、训练 token、成本和效率。
今天看,它解释了什么?
它解释了为什么 AI 行业是一场资源竞争。
不是只有模型架构。还有数据、算力、训练效率、推理成本、数据质量、基础设施。
这也是为什么基础模型公司很难只是“小团队拍脑袋做出来”。
基础模型竞争很重。重在钱,重在数据,重在工程,重在基础设施。
Take away
对普通人来说,不要只看参数量。
一个模型不是越大就越适合你。
你真正要看的是:
它在你的任务上表现好不好。回答是否稳定。速度是否能接受。成本是否合理。有没有你需要的工具能力。是否适合你的语言和场景。
普通人选模型,不是在选“谁最大”。是在选“谁最适合这个任务”。
对独立开发者来说,不要迷信最大模型。
产品早期更重要的是:
成本。延迟。稳定性。上下文长度。失败率。是否容易做 eval。是否适合你的 workflow。
很多独立开发者的机会,不在训练基础模型。而在场景、工作流、上下文、评估、体验和分发。
哪些被证实 / 修正了?
被证实的是:数据量、训练 token、算力效率,确实成了大模型竞争的核心变量。
需要修正的是:Chinchilla 不是最终答案。
后来行业继续往前走,出现了长上下文、MoE、合成数据、推理时算力、多模态、小模型专用化等方向。
所以 Chinchilla 的意义不是告诉我们“以后永远按这个公式训练模型”。
它真正提醒的是:
大模型不是玄学。能力背后有资源配比、成本结构和工程约束。
3. Training language models to follow instructions with human feedback
发表时间:2022 年相关机构:OpenAI常见名字:InstructGPT / RLHF 论文关键词:instruction following / human feedback / alignment
这篇论文解释了一个关键变化:
为什么语言模型后来不只是“续写文本”,而越来越像一个会听指令的助手?
一个基础语言模型,本质上是在预测下一个 token。
但一个好用的 AI 助手,不能只是续写。
它要知道用户想要什么。要尽量有帮助。要减少有害输出。要更符合人的偏好。要在很多情况下 follow instructions。
InstructGPT 这篇论文展示了一条路径:
用人类反馈训练模型,让它更接近用户想要的行为。
这也是为什么今天很多 AI 工具不是冷冰冰地补全句子,而是会解释、配合、提醒、拒绝、建议、总结。
今天看,它解释了什么?
它解释了为什么 AI 变得这么“像助手”。
礼貌。耐心。配合。会解释。会按格式回答。会说“我建议你……”。会在敏感场景里拒绝或提醒风险。
这些不只是因为模型变大了。也是因为它被训练成更符合人类偏好的交互方式。
Take away
对普通人来说,AI 很会配合你,不等于它永远可靠。
它可能很 helpful。也可能很会顺着你。
你问:
我是不是应该放弃?
它可能认真分析放弃的理由。
你问:
我是不是应该坚持?
它也可能认真分析坚持的理由。
所以不要只让 AI 认同你。
更好的用法是:
请反驳我。请指出盲点。请区分事实、猜测和建议。请告诉我哪些地方需要现实验证。
对独立开发者来说,模型能回答,不等于产品可用。
你要定义:
什么叫好回答。什么叫坏回答。什么情况必须拒答。什么情况必须人工确认。什么输出会带来风险。什么结果需要被持续评估。
这就是为什么 eval 很重要。
AI 产品不是只看模型“能不能生成”。而是要看:
这个输出在我的场景里,算不算好?坏输出的代价是什么?我怎么持续发现和修正坏输出?
哪些被证实 / 修正了?
被证实的是:instruction tuning / human feedback 确实是 AI 助手变得可用的重要一步。
需要修正的是:它没有解决所有问题。
RLHF 可以让模型更 helpful、更像人类想要的助手。但不等于模型永远真实。不等于模型真的理解你。也不等于它不会迎合你。
所以今天看这篇,最值得记住的不是:
AI 更听话了。
而是:
AI 被训练得更像助手。但一个很会帮忙的助手,也可能很会把错误讲得很顺。
为什么是这三篇?
这三篇连起来,是一条很清楚的行业线:
Transformer 解释了架构基础:AI 为什么这么会处理上下文。
Chinchilla 解释了规模化逻辑:AI 为什么变成算力、数据、成本和工程的竞争。
InstructGPT 解释了产品化过程:AI 为什么从“会生成文本”变成“会配合用户的助手”。
所以它们刚好回答了三个问题:
AI 为什么能?AI 为什么贵?AI 为什么像助手?
这对普通人和独立开发者都重要。
普通人要理解:AI 很强,但不是魔法。
独立开发者要理解:AI 产品不是模型越大越好,而是场景、上下文、评估和体验一起成立。
是不是 2022 年后,学术就差不多了?
不是。
更准确的说法是:
2017–2022 年,奠定了今天 LLM 产业爆发的几块地基。2022 年之后,AI 进入了“学术 + 工程 + 产品 + 算力 + 分发”共同驱动的阶段。
最近几年当然还有研究进展。
比如更长上下文。比如多模态。比如 MoE。比如推理时算力。比如合成数据。比如 agent workflow。比如更系统的 eval。比如小模型和专用模型。
只是很多进展不再只以一篇经典论文的形式被普通人感知。
它们可能出现在 technical report、开源 repo、模型发布、benchmark、产品体验、工程系统里。
所以不是学术停了。
而是 AI 从“论文里看见未来”,变成了:
论文、工程、产品、算力、数据和市场,一起把未来推到你面前。
如果只用一句话总结这三篇给我的启发,我会说:
不要只看 AI 给了什么答案。要看这个答案是怎么被生成、被训练、被约束、被验证的。