S2 Day 006人与 AI Human & AIAI 还做不太好的事 2/3研究约 10 分钟

AI 都能替我做了,我还需要自己会吗?

If AI can do it for me, do I still need to know how?

上一篇写练琴时,我最后发现,AI 明明知道很多钢琴知识,却不一定真的能教好一个正在弹琴的人。

原因不是一句“AI 没有身体”就可以解释。真正的教学至少要经过四层:

Observe → Diagnose → Intervene → Verify

先看见真实发生了什么,再判断原因,选择适合这个人的干预,最后根据新的结果继续调整。

这是这一轮 research 里遇到的第一种边界:AI 有知识,不等于这些知识能够顺利抵达现实结果。

继续往下看,我开始碰到另一种很不一样的问题。

这一次,AI 甚至可能什么都没有做错。

它可以帮我把邮件写好,把资料整理好,把代码做出来,把一道题解出来,结果比我自己完成得更快、更完整。

那如果 AI 已经可以替我做了,我还需要自己会吗?

我觉得这个问题不能统一回答。

因为我们使用工具,本来就在不断放弃一些“必须自己会”的事情。

我不需要自己拥有冰箱保存食物的能力,也不需要为了维持心算水平,每次使用计算器前先手算一遍。导航让我少记很多路,洗衣机也早就替代了大量手洗的技能。

AI 没有什么不同。

真正需要先分清的,是我希望这件事情做完以后,留下什么。

我现在大概会把它分成三种。

第一种:我只需要结果

这类事情最简单。

比如整理一份会议记录、转换文件格式、提取一批信息,或者写一封很普通的行政邮件。

如果最后需要的是一个准确、可用的结果,AI 能稳定做好,我很愿意直接交给它。

我不会因为让 ChatGPT 帮我把一封英文邮件改得更自然,就担心自己因此没有“真正学会写这封邮件”。

因为这封邮件本来就不是一堂英语课。

工具存在的意义之一,就是把一些没有必要继续由人亲自完成的工作拿走。

所以我并不太认同一种笼统的说法:

只要越来越依赖 AI,就是人在失去能力。

失去什么能力,为什么还需要它,才是更重要的问题。

第二种:我可以不亲自做,但需要懂到能判断

有些事情我也愿意把执行交出去,但不能完全失去理解结果的能力。

我现在用 Coding Agent 做产品就是一个很明显的例子。

我并不觉得自己一定要先成为一个能够独立写 production code 的工程师,才有资格让 Agent 帮我开发产品。

它能做出来,就是实实在在的价值。

但我还是需要理解一些东西。

比如一个技术方案会不会改变产品行为,某个 Agent 应该获得多大权限,一次架构调整带来了什么 trade-off,测试通过到底证明了什么,又有哪些事情其实还没有被验证。

否则我交出去的就不只是 coding execution。

连判断“这件事有没有做对”的能力,也一起交出去了。

所以这里真正需要保留的,不一定是执行能力,而是足够的 judgment / oversight capability。

我不需要亲自做每一步。

但至少要知道什么时候可以放心,什么时候应该继续追问,什么时候其实已经超出了自己能够审核的范围。

第三种:有些事情,能力本身就是我要的结果

到了这里,问题才真正变得不同。

我练英文口语,是因为希望下一次面试时自己能说。

练琴,是因为希望自己的手真的会弹。

学生学习数学,也不是为了今天这一页习题最后全部显示绿色对勾,而是希望以后遇到类似问题,自己能够处理。

这时,“AI 帮我把任务完成得更好”和“我自己学会了”就不再是一回事。

这一点在教育研究里已经开始出现很具体的证据。

AI 辅助时做得更好,不代表能力已经留在人身上

2025 年,PNAS 发表了一项接近 1000 名高中生参与的数学随机对照实验。

研究者设计了两个基于 GPT-4 的 AI 助手。

一个比较接近普通 ChatGPT 的使用方式,学生遇到题目,可以直接让它帮助解答。

另一个则专门按照教学目标做了限制:更倾向于给 hint,而不是直接交出答案,同时使用教师准备的正确解法、常见错误和反馈方式来指导学生。

实验还有一组不使用生成式 AI 的学生作为对照。

在有 AI 辅助的练习阶段,两个 AI 组的表现都明显提高。

普通 GPT 组比对照组高约 48%,经过教学设计的 GPT Tutor 组高约 127%。

只看这里,当然很容易觉得 AI 帮助了学习。

但实验还有下一步。

研究者把 AI 拿走,让学生自己考试。

这时候,之前使用普通 GPT 的学生,成绩反而比没有使用 AI 的对照组低了约 17%。

经过教学设计的 GPT Tutor 组基本消除了这种负面影响,但在无 AI 的考试里,也没有显著超过对照组。

同一个实验里,于是出现了一个很重要的区别:

AI 在场时,学生完成任务的表现可以明显提高。

但 AI 撤掉以后,人的独立能力不一定获得了同样的提升。

研究者进一步看学生如何使用普通 GPT 时,也发现很多人更容易直接向它索取答案。

这其实不难理解。

如果学生真正需要练习的是自己读题、回忆知识、尝试、犯错、再根据反馈修改,那么 AI 直接跨过这些过程,把正确答案交出来,当然可以提高眼前的 performance。

但它同时也可能替学生做掉了一部分原本需要发生在人身上的工作。

这并不意味着学习时应该少用 AI

另一项研究正好补上了另一半。

同样是在 2025 年,Harvard 的研究团队在一门本科物理课程里做了一项 194 人参与的随机实验。

学生分别使用传统课堂中的 active learning,或者一个专门设计的 AI Tutor 学习相同内容。

这个 AI Tutor 并不是把一个普通聊天机器人直接放在学生面前。

研究团队按照教育和认知科学中的一些原则设计互动,让学生主动参与,逐步获得信息,在需要的时候得到提示和反馈,并按照自己的进度学习。

在实验涉及的两节课程内容里,AI Tutor 组的即时学习增益高于课堂 active learning,而且花费的时间更少,学生报告的 engagement 和 motivation 也更高。

这项研究当然有边界。

它发生在一门 Harvard 本科物理课里,只测试了特定教学内容,主要观察短期学习结果,也没有证明几个月以后学生依然记得更多。

但和前一个数学实验放在一起,我觉得已经足够说明一个很重要的问题:

关键不是学习时“有没有 AI”。

而是:

AI 替学生做了什么,又保留了什么让学生自己完成。

AI 可以直接跨过思考过程,把答案交出来。

也可以看着学生自己尝试,在真正卡住的时候给一点帮助。

表面上都是“AI tutoring”,实际产品目标完全不同。

如果「能力提升」是目标,有些看起来低效的步骤不能全部拿掉

我们做普通生产力产品时,很自然会追求减少 friction。

能一步完成,就不要让用户走三步。

能自动填,就不要让他自己输入。

AI 把这种方向推得更远:很多事情已经可以直接从一个问题跳到一个看起来完整的答案。

但如果任务的目标是学习,有一些 friction 本身可能就是学习过程。

  • 自己先想。
  • 从记忆里把东西找出来。
  • 试一个不一定正确的答案。
  • 发现哪里不会。
  • 获得反馈以后再做一次。
  • 换一个场景,看自己能不能迁移。

这些过程看起来没有“直接生成正确答案”高效。

但如果我真正想训练的就是这个能力,把它们全部拿掉,最后被优化掉的可能正是我要学习的部分。

所以我现在觉得,好的学习型 AI 有时候反而需要克制一点:

不是尽快替我完成,而是尽量让我完成。

关于「表达能力退化」的思考

第一个 100 天记录结束的时候,我写过一个很个人的感受。

我发现自己完整组织一段文字,好像比以前费劲了一点。

与此同时,AI 越来越能接住我的不完整表达。几个零散的想法,一些没有组织好的句子,都可以先扔给它,再变成一篇结构完整的文字。

我不知道这种变化是不是 AI 导致的。

自己的感觉当然不能证明因果。

但现在我会换一个问题问自己:

完整表达这件事,对我来说究竟属于哪一类?

很多文字生产,其实只属于第一类。

一封邮件、一段说明、一份格式清楚的材料,我只想得到结果,完全可以大量使用 AI。

但表达对我又不只是文字生产。

现实里,我还要参加面试,要和别人讨论复杂问题,要在没有 AI 中介的时候让另一个人理解自己。

这意味着表达本身依然有独立的实际价值。

另外还有一层,我现在只能把它当作自己的观察,而不是 research 已经证明的结论:

有时候我并不是先完整想好一个观点,再把它翻译成语言。

把一个模糊的东西慢慢说清楚,本身也是我思考的一部分。

写到一半,才发现两件事情其实没有逻辑关系。

试着解释一个观点,才发现自己也不知道为什么相信它。

讲给别人听的时候,才意识到这里缺了一块证据。

所以我真正担心的并不是:

以后我的句子会不会没有 AI 写得漂亮。

而是:

如果所有还没成形的想法,都在很早的时候交给 AI 帮我补完整,我是不是也少经历了一部分自己把事情想清楚的过程?

目前我没有足够证据回答这个问题。

但至少我知道,这是一个我自己仍然想保留的能力。

所以我现在会先问:这件事做完以后,我希望留下什么?

这是这轮 research 给我的第二个比较实用的判断。

面对一件越来越容易交给 AI 的事情,我会先把它放进三个位置之一。

我只需要结果

那就放心外包。

没有必要把所有任务都包装成“学习机会”。

我需要保留判断

执行可以交出去,但需要留下足够的理解、验证和决定能力。

我未必需要自己写代码,但需要知道什么时候不能只听 Agent 说“已经完成”。

我需要的就是这项能力

那 AI 应该参与练习,而不是把真正需要训练的部分全部替掉。

这里最终要看的,不只是:

AI 在旁边的时候,我做得有多好。

还要看帮助逐渐减少以后:

什么真的留在了自己身上。

我觉得这就是第二篇里 AI 一个很容易被忽略的边界。

它很擅长把自己的能力借给我们。

但:

AI 的能力,不会因为被我使用过,就自动变成我的能力。

如果我只需要结果,这完全不是问题。

如果我要保留判断,就需要留下一部分理解和验证。

如果人的能力形成本身就是目标,那么产品甚至需要故意留下那些本来可以由 AI 直接完成、但对学习仍然必要的步骤。

这也刚好把问题带到这组 research 的最后一篇。

前面第二种情况里,我说:

执行可以交给 AI,但重要判断留给人。

这已经是现在很多 AI 产品非常常见的设计:

Human in the Loop。

AI 先做,人最后检查。

听起来很合理。

但下一篇我想继续追一个更麻烦的问题:

人在 loop 里,就代表他真的审得出来吗?

关于这轮 research

这是「AI 还做不太好的事」研究系列的第二篇。

第一篇讨论的是,当 AI 要指导一个真实的人完成一项技能时,从观察现实、判断原因,到干预和反馈,中间任何一层都可能成为限制。

这一篇关注另一种边界:当人的能力形成本身是目标时,AI 提高有工具辅助时的 performance,并不能自动证明 learning 发生了。

本篇主要使用两项随机对照实验。

Bastani 等人的高中数学研究覆盖接近 1000 名学生,同时比较 AI 在场时的练习表现,以及撤掉 AI 后的独立考试,因此能够把 assisted performance 和后续 learning outcome 分开观察。

Kestin 等人的研究则在 Harvard 本科物理课程中测试专门按照教学原则设计的 AI Tutor,提供了方向不同的证据:AI 并不天然妨碍学习,系统怎样设计、又替学生完成了什么,才是关键变量之一。

两项实验的对象、学科和评价周期都不同,所以不能简单比较谁“更正确”。放在一起,对我最有价值的反而是这个区分:

AI 能把一项任务做得更好,和 AI 能帮助人形成一项能力,需要分别验证。

主要参考 · ReferencesGenerative AI without guardrails can harm learning: Evidence from high school mathematics,PNAS,2025AI tutoring outperforms in-class active learning: an RCT introducing a novel research-based design in an authentic educational setting,Scientific Reports,2025