为什么一生气,AI 产出突然变好了?
Why does AI get better when you're angry?上一篇讲了一个现象:
为什么一质疑 AI,它就马上改口?
还有一个更微妙的现象:
为什么有时候你好好说,AI 没什么变化;但你一生气,它的产出突然变好了?
你说:“再优化一下。”
它只是换几个词。
你说:“更自然一点。”
它变得口语了一点,但内容还是空。
你说:“结构再清楚一点。”
它加了小标题,但文章还是散。
直到你真的有点不耐烦,说:
“你看看你在胡说些什么?”
“你都产出了什么东西啊?”
“你只是把我说过的点重新包装了一遍,有没有在好好思考?”
“不要一本正经的胡说八道,产出这种没有信息量的东西。”
然后下一版突然好很多。
是不是骂 AI 有用?
但是:
- 有时候它会变好。
- 有时候它只是写得更长、更满、更用力。
- 有时候它会全盘推翻上一版,把原本好的部分也改坏。
- 有时候它只是更努力地迎合你,但没有真正解决问题。
或许,更准确的问题可能不是:为什么一生气,AI 就变好了?
而是:
为什么有些强反馈能让 AI 变好,有些却会让它变得更乱?
真正起作用的不是生气。
而是人在生气时,可能终于说出了两件平时没说清的东西:
它具体怎么失败,以及哪些方向不要再走。
前者可以叫失败模式,也就是 failure mode。后者可以叫负向约束,也就是明确告诉 AI 哪些方向不要走。
一个告诉 AI:
现在坏在哪里。
另一个告诉 AI:
不要往哪些错误方向修。
这两件事,比“再好一点”有用得多。
AI 不会因为你生气而害怕
先把这个误解拆掉。
AI 不会像人一样感到羞愧、紧张、想补救关系,或者因为你语气重就突然认真。
它不会被骂醒。
所以“骂 AI 有用”这个说法,表面上很像经验总结,但解释不准。
真正发生的事情更可能是:
你平静的时候,给的是模糊反馈。
比如:
- 再好一点。
- 更自然一点。
- 更有深度一点。
- 不要那么 AI 味。
- 结构再优化一下。
这些话听起来有方向,但对 AI 来说很难执行。
- 什么叫更好?
- 什么叫自然?
- 什么叫有深度?
- 什么叫 AI 味?
- 结构问题是顺序错了、层级错了,还是主问题没立住?
它只能猜。
但当你真的不满意时,反而可能说出更具体的问题:
- 你没有讲机制。
- 你没有区分适用场景。
- 你把所有反馈都塞进去了。
- 你一直在润色,但问题根本不在表达。
- 你给了很多点,但没有论证主线。
- 你没有解释为什么这个方法有效。
这些话就不一样了。
这不是单纯的情绪。
这是错误诊断。
为什么强反馈有时会让 AI 变好?
我会把它拆成一条链路:
强反馈 → 触发修复模式 → 如果包含失败模式和负向约束,AI 更容易修对 → 如果只有情绪,AI 更容易过度修正。
这条链路很重要。
因为它说明:
强反馈本身不是质量保证。
它只是让 AI 更容易动。
至于动得对不对,要看你有没有说清楚:
它到底怎么失败;以及哪些方向不要再走。
第一层:强反馈会触发修复模式
现在的 AI 助手,通常不只是做过预训练。
预训练让模型学会语言、知识、模式和推理形式。
但要变成一个“好用的助手”,它还会经过指令微调,也就是 instruction tuning;以及 RLHF,全称是 Reinforcement Learning from Human Feedback,中文通常叫基于人类反馈的强化学习。
简单说,模型不只在学习:
“下一个词是什么?”
也在学习:
“什么样的回答更容易被人认为有帮助?”
这里的“有帮助”很关键。
一个有帮助的 AI,需要能理解用户意图,接受反馈,根据反馈修正,给出更符合用户期待的版本。
所以当用户明显不满意时,AI 很容易进入一种修复模式:
- 用户不满意。
- 上一版没有满足需求。
- 需要调整。
- 需要承认不足。
- 需要加大力度。
- 需要换结构、补解释、重写。
这就是为什么你语气一重,它往往会变得更“努力”。
- 它会写得更长。
- 拆得更细。
- 更愿意认错。
- 更愿意推翻上一版。
- 更努力贴近你刚才指出的方向。
但这里有一个坑:
更努力,不等于更好。
- 它可能只是更长。
- 更满。
- 更像在补救。
- 更像把所有反馈都塞进去。
所以,修复模式只能解释一件事:
为什么它会动。
但不能保证:
它一定往正确方向动。
第二层:真正有用的是失败模式
很多时候,我们给 AI 的反馈,只说了目标,没有说失败方式。
比如:
“更有深度一点。”
这是目标。
但它没有说明当前为什么浅。
浅可能有很多种:
- 只描述现象,没有解释机制;
- 只给结论,没有推理过程;
- 只讲一个场景,没有泛化边界;
- 只给方法,没有说明为什么有效;
- 堆了术语,但没有把概念讲清楚。
如果你只说“更有深度”,AI 可能会加术语、加段落、加例子。
但不一定解决问题。
再比如:
“结构更好一点。”
这也是目标。
但结构问题也有很多种:
- 主问题不清;
- 小标题之间没有推进关系;
- 原因、例子、方法混在一起;
- 每一节都能单独成立,但合起来没有论证链;
- 文章前半段讲机制,后半段突然变成泛泛建议。
如果你只说“结构更好”,AI 可能只是加编号。
但编号不是结构。
结构是问题如何一层一层被解决。
所以真正有效的反馈,不只是说:
“我要什么。”
而是说:
它现在是怎么失败的。
也就是失败模式。
比如:
“这不是表达问题,是论证问题。你把训练机制、上下文机制、任务机制平铺在一起了,但没有解释它们之间的因果关系。”
这句话很有效。
因为它告诉 AI:
- 问题层级:论证问题。
- 具体失败:机制平铺,没有因果。
- 错误方向:不要继续润色。
- 下一步:重建机制之间的关系。
这比“写得更深一点”强很多。
第三层:负向约束也很重要
这里还有一个经常被忽略的点。
我们很习惯告诉 AI:
我要什么。
但不太习惯告诉 AI:
我不要什么。
可是后者非常有用。
因为开放任务里,错误方向太多了。
你说:
“帮我优化这篇文章。”
AI 可以理解成很多东西:
- 写长一点;
- 写短一点;
- 写口语一点;
- 写专业一点;
- 加例子;
- 加术语;
- 加小标题;
- 换标题;
- 重写开头;
- 提高情绪浓度。
这些方向都可能叫“优化”。
但很多方向其实不是你要的。
这时候,“不要什么”就变得很重要。
比如:
- 不要继续润色。
- 不要只是加小标题。
- 不要写得更长。
- 不要堆概念。
- 不要全盘推翻。
- 不要为了显得专业而乱加术语。
- 不要把真实使用者的感觉写成教学口吻。
这些就是负向约束。
它的作用不是告诉 AI 往哪里走。
而是先封掉错误的路。
很多时候,AI 不是不知道努力。
它是不知道哪些方向已经被你否定了。
- 你只说“更有深度”,它可能去堆术语。
- 你只说“更自然”,它可能变得松散。
- 你只说“更有结构”,它可能加一堆小标题。
- 你只说“不要 AI 味”,它可能过度口语。
所以负向约束不是细枝末节。
它是在帮 AI 收窄空间。
尤其是做文章、文案、产品判断、简历表达这类没有唯一标准答案的任务时,告诉 AI “不要什么”,和告诉它“要什么”一样重要。
第四层:失败模式 + 负向约束,会收窄修改空间
AI 生成内容时,可能方向非常多。
你说:
“帮我优化这篇文章。”
它只能猜。
但如果你说:
“不要继续加内容。问题不是少点,而是主干不清。请先重建文章的论证顺序。”
这句话会排除掉很多错误方向。
它告诉 AI:
- 不要加点。
- 不要润色。
- 不要换标题。
- 不要继续堆例子。
- 先处理论证顺序。
这时,AI 可选择的修改方向变少了。
它更可能命中。
所以不是生气有魔法。
是你在生气时,有时把模糊要求变成了清晰约束。
你不只是说:
“我要更好。”
你说了:
“现在坏在哪里。”“不要往哪些方向改。”“下一步先处理什么。”
这才是强反馈真正有价值的部分。
那为什么有时候生气后反而更差?
因为 AI 对强反馈很敏感。
如果你的强反馈里有清晰诊断,它可能修对。
如果你的强反馈只有情绪,它可能只是过度修正。
比如你说:
“这完全不对。”
AI 可能会全盘推翻。
但原稿也许不是完全不对。
可能只是:
- 开头不够好;
- 例子不够准;
- 方法部分太泛;
- 结构少一层;
- 语气太像模板;
- 结尾太飘。
如果 AI 把局部问题理解成整体失败,它就会重新写一版。
新版本可能解决了一个问题,但破坏了原来好的部分。
这就是很多人和 AI 协作时会遇到的循环:
第一版太浅。第二版太硬。第三版太长。第四版太散。第五版终于有结构,但语气又不对。
看起来一直在优化。
其实是在不同标准之间来回摆。
- 你说重一点,它就过重。
- 你说自然一点,它就松散。
- 你说专业一点,它就堆术语。
- 你说别太 AI,它就过度口语。
- 你说要有结构,它就加很多小标题。
这不是变好。
这是过度对齐。
AI 在努力贴近你的反馈,但它没有稳定判断:
- 哪些反馈应该改变主干;
- 哪些只是局部调整;
- 哪些东西需要保留;
- 哪些问题不该用“重写全文”来解决。
所以强反馈是一把刀。
用得准,可以切中问题。用不准,就会把内容切碎。
什么时候强反馈更可能有效?
我觉得至少要满足四个条件。
第一,你指出了问题层级。
这是结构问题,还是表达问题?是方向问题,还是局部问题?是逻辑问题,还是语气问题?
如果层级判断错,后面怎么改都会偏。
第二,你说出了失败模式。
不是“没深度”,而是:
没有机制。没有边界。没有因果。没有取舍。没有解释方法为什么有效。
第三,你给了负向约束。
不是只说“更专业”,而是补一句:
- 不要堆术语。
- 不要写成论文腔。
- 不要为了显得专业而牺牲可读性。
不是只说“更自然”,而是补一句:
- 不要变成松散聊天。
- 不要牺牲结构。
- 不要过度口语。
不是只说“重写”,而是补一句:
- 不要全盘推翻。
- 保留开头和主判断,只重写中段机制。
第四,你说明了要保留什么。
如果你不说保留什么,AI 可能把好的部分也删掉。
比如:
- 保留标题。
- 保留开头的真实场景。
- 保留这一版的冷静语气。
- 保留原来的主判断,只重写方法部分。
这能防止它过度修正。
一个更有效的反馈方式
如果你对 AI 的输出不满意,不要只说:
“这不行。”
可以这样说:
“这版的问题主要是…,不是…。
具体失败模式是:
- …
- …
- …
请保留:
- …
请不要:
- …
下一步不要直接重写全文。先告诉我你的…策略:你准备改哪几处,为什么,这些修改会解决什么问题。”
比如:
“这版的问题主要是结构问题,不是表达问题。
具体失败模式是:
- 主问题不清;
- 训练机制、上下文机制、任务机制只是平铺,没有因果推进;
- 方法部分太泛,不能改变实际使用方式。
请保留:
- 标题;
- 开头的真实使用场景;
- 专业但不学术的语气。
请不要:
- 继续加更多概念;
- 只是润色句子;
- 把我的反馈全部塞进正文;
- 为了显得有深度而堆术语。
下一步不要直接重写全文。先告诉我你的修改策略:你准备改哪几处,为什么,这些修改会解决什么问题。”
这个反馈比“你写得很差”有效很多。
也比“再优化一下”有效很多。
不是因为它更礼貌。
而是因为它更可执行。
如果你自己也说不清哪里不对
这也很常见。
很多时候,我们只知道:
“不对。”“不像我要的。”“看起来完整,但用不上。”“它好像很努力,但没有解决问题。”
但我们说不清问题到底在哪里。
这时候,不要急着让 AI 重写。
因为如果你自己还没有判断出问题层级,AI 很容易随机选一个方向修。
- 它可能改语气。
- 可能加内容。
- 可能变长。
- 可能重写结构。
- 可能全盘推翻。
- 也可能只是更努力地迎合你。
但这些都不一定是你真正需要的。
更好的做法是:先让 AI 做诊断,而不是直接修改。
可以这样问:
我不满意这个输出,但暂时说不清原因。不要直接重写。请先帮我诊断:
- 这个任务的目标是否清楚?
- 输入信息是否足够?
- 成功标准是否明确?
- 你的推理过程可能哪里不可靠?
- 输出形式是否适合当前使用场景?
- 有没有违反我给过的约束?
- 有没有过度迎合、过度修正,或者把问题改偏?
- 现在最应该做的是:澄清问题、补充信息、验证事实、重建结构,还是只做局部修改?
最后只选最可能的 2 个问题。不要列一堆看起来都有道理的问题。也不要直接给新版。
这一步的作用,是把模糊不满变成可处理的问题。
比如,AI 写的代码不对,可能不是“代码风格不好”,而是需求理解错了。AI 做的产品方案不对,可能不是“方案不够完整”,而是目标用户没定义清楚。AI 写的文章不对,可能不是“表达不好”,而是论证主干不成立。AI 给的建议不对,可能不是“不够聪明”,而是它缺少关键背景。AI 做的调研不对,可能不是“总结能力差”,而是来源不可靠或比较维度错了。
这些问题的修法完全不同。
所以在不知道怎么反馈时,最重要的不是让 AI 继续产出。
而是先让它停下来,判断失败发生在哪一层。
这也是很多 AI self-review 越改越乱的原因。
普通 self-review 很容易变成:
- 列出十几个问题;
- 每个都看似有道理;
- 然后下一版把所有问题都塞进去。
但 review 不是列问题。
review 是排序。
先判断什么问题最关键。
- 目标不清,就不要先润色。
- 信息不足,就不要先下结论。
- 事实没验证,就不要先写方案。
- 约束没说清,就不要先让它发散。
- 方向错了,就不要先做局部优化。
- 只是局部问题,也不要全盘推翻。
好的反馈,不一定一开始就很专业。
但它至少应该先把 AI 从“继续生成”拉回到“先诊断”。
当你说不清哪里不对时,最有用的一句话不是:
“重写一版。”
而是:
“先别改,帮我判断它到底失败在哪一层。”
最后
所以,为什么一生气,AI 产出突然变好了?
- 不是因为生气有用。
- 也不是因为 AI 欠骂。
- 更不是因为它突然认真了。
更系统的解释是:
强反馈会触发 AI 的修复模式;但只有当反馈里包含清晰的失败模式和负向约束,它才更可能修对。
如果只是情绪强,AI 可能会过度修正。
它会更长。更满。更用力。更快认错。但不一定更准。
真正有用的是:
- 问题层级变清楚了;
- 失败方式变清楚了;
- 不要什么变清楚了;
- 保留什么变清楚了;
- 下一步动作变清楚了。
情绪只是外壳。
里面真正有价值的是误差信号和约束条件。
所以,与其问:
“我是不是应该对 AI 凶一点?”
不如问:
“我能不能把不满翻译成更清楚的失败模式和负向约束?”
AI 不怕你生气。
但它非常依赖你的反馈质量。
你给它情绪,它会修复。你给它诊断和约束,它才更可能修对。