S2 Day 005人与 AI Human & AIAI 还做不太好的事 1/3研究约 11 分钟

AI 还有一些做得不太好的事,比如教我练琴

Things AI still does poorly — like teaching me piano

上一篇写林夕、黄伟文和 AI,最后其实留下了一个没有回答完的问题。

AI 已经越来越会写。它可以理解失恋,可以分析情绪,也可以很快生成一句漂亮的话。所以我不太愿意用“因为 AI 没有真的爱过”来解释为什么有些表达仍然差很多。这个答案太容易了,也没有真正解释问题。

顺着这个疑问,我后来想做一件反方向的事。

这几年我们一直在看 AI 又能做什么,我想认真看看:

它现在还有哪些事情做得不太好?为什么?

不是整理一张“AI 的 20 个缺点”,也不是先假定某些事情永远只能由人来做。我更想从自己真实使用时遇到的 friction 出发,再看看研究能不能解释这些体验,或者反过来证明我原来的理解并不准确。

最后我整理了大约 20 组核心证据,涉及音乐感知、教育随机实验、人机协作、医疗决策和 AI reliability。主要看原始研究、随机实验和 meta-analysis;一些很新的 2026 年研究目前仍是会议论文或预印本,所以也只把它们当作早期证据,不往外推得太远。

这轮 research 有一个结果我还挺喜欢:它没有简单证明“我的感觉是对的”。

有些我原来以为是 AI 的本质局限,拆开以后,可能只是它没有拿到需要的信息;有些确实和当前模型能力有关;还有一些,问题甚至不在 AI 自己,而在我们怎么使用它、怎样判断结果。

我准备分三篇写。

第一篇先从一个我自己很有体感的例子开始:练琴。

第二篇想看,AI 帮我们完成一件事情,和我们自己真正学会一件事情,是不是同一回事。

最后一篇再回到现在很常见的 Human in the Loop:只要最终有人审核,系统就真的可靠吗?

我一开始的理解很简单:练琴这件事,光靠文字说不清楚

我和 AI 聊过不少钢琴。

如果问一首曲子的背景、曲式、和声,或者某一段通常应该怎样练,它经常讲得很好。

这并不奇怪。音乐里有大量已经被语言和符号表达出来的知识:乐谱、和声理论、音乐分析、教材、老师总结过的练习方法。大语言模型处理这些内容,本来就有优势。

但真正坐到琴前,情况会变得不一样。

有时候我会觉得这一段“不太自然”,手有点紧,或者明明每个音都弹对了,声音就是不好听。

AI 当然还是可以给建议:降低速度、放松手腕、分手练、注意 voicing、听旋律线。

这些建议通常不能说错。

但它们经常更像是在告诉我:

“一个人在这种情况下,通常可以试试这些方法。”

而不是一个老师真的听完我弹两遍以后,说:

“你这里的问题其实是这个。”

所以我原来的解释很直觉。

练琴里面有太多重要信息,不是文字。

触键用了多少力量,手指和手腕怎样配合,两个音之间那一点 timing,声音到底硬在哪里,身体什么时候开始紧张,这些东西很多时候连我自己都很难准确描述。

这里常常会涉及 tacit knowledge(隐性知识) 和 embodied knowledge(身体化知识):有些技能存在于身体、感觉和长期经验里。一个人会做,不代表他可以把自己做这件事时的所有判断都说清楚。

而 ChatGPT、Claude、Gemini 这些我们现在大量使用的 AI,确实是从 LLM 发展起来的。

当然,这里也要把概念说准确一点。

AI 是一个很大的范围,LLM 只是其中一种技术。

而今天这些通用 AI 也早已不再只是“文字进、文字出”的纯 LLM。它们可以处理图片、声音等多模态输入,也可以连接各种工具和专门系统。

所以 research 以后,我觉得自己原来的说法——

钢琴很多东西无法用语言描述,所以基于 LLM 的 AI 不会教琴。

还是太粗了。

更准确的问题应该是:

那些不在语言里的重要信息,AI 到底有没有真正获得,并且理解对了?

从这里开始,我发现“教一个人练琴”其实可以很清楚地拆成四层:

Observe → Diagnose → Intervene → Verify

先观察发生了什么,再判断为什么,选择怎样干预,最后验证有没有真正变好。

任何一层出问题,都可能得到一种很熟悉的结果:

AI 说得挺对,但没真正帮上忙。

1. Observe:它首先得真的听见我弹成了什么样

2025 年有一项研究,专门测试现在的多模态大模型到底能不能“听懂”一些基础音乐信息。

研究者让 Gemini 2.5 Pro、Gemini 2.5 Flash、Qwen2.5-Omni 等模型完成节奏、移调、和弦识别等任务,然后比较两种输入方式。

  • 一种是直接让模型听音频。
  • 另一种是先把音乐转换成 MIDI,把音高、时间这些结构化信息明确表示出来,再交给模型。

结果出现了很明显的差异。

例如其中一个和弦类别识别任务里,Gemini 2.5 Pro 直接处理音频时,zero-shot 准确率大约是 47.7%;同样的信息换成 MIDI 后,接近 97.7%。

不同任务的差异并不完全一样,所以不能拿一个数字得出“AI 听不懂音乐”。

但这项实验至少支持了一个很重要的区别:

模型知道很多音乐知识,不等于它能够同样可靠地从真实声音里提取这些知识需要的信号。

这正好击中了我原来那个直觉的一部分。

假设我弹完一段以后问:

为什么这里听起来不对?

在讨论音乐性、练习方式甚至手腕之前,其实应该先确认:

它到底有没有准确听到,我刚刚弹成了什么样?

如果我只是用文字说一句“这里有点僵”,大量真正影响判断的信息根本没有进入系统。

即使给它一段录音,也不能默认多模态模型已经像钢琴老师一样听见了里面所有重要细节。

一个现场老师拿到的信息更多。他不只听,还在看我的手和身体;刚才哪里犹豫了一下,他可能直接看到;如果不确定,还能马上让我再弹一次。

所以我现在觉得,比“音乐无法用语言表达”更准确的说法是:

对演奏这种身体技能来说,语言是一种有损的信息接口。

而即使把语言换成音频、视频,第一关还是一样:

系统到底有没有观察到真正重要的现实?

2. Diagnose:听见哪里不对,还要知道为什么

再往前假设一步。

AI 已经准确听出:

这一小节节奏不稳定。

事情仍然没有结束。

因为“不稳定”只是一个现象。

背后的原因可以完全不同。

可能是谱还没有读熟,所以弹到这里会迟疑;可能是几个手指的控制问题;可能速度已经超过了当前能力;也可能我本来就在做 rubato,只是控制得不好。

最后听起来,都可能是:

这里不太稳。

但练法不会一样。

所以第二层真正需要的是:

从现象走到原因。

这也是为什么我现在觉得,“AI 可以识别错误”和“AI 可以诊断技术问题”最好不要混为一谈。

一个系统可以标出:

这里比标准节拍晚了一点。

这是一项很具体、也比较容易测量的能力。

但要继续判断:

为什么这个学习者会在这里慢下来?

已经进入了另一层。

老师在做这类判断时,往往也不只是调用一条明确规则,而是用过去看过很多学生、听过大量演奏、自己也长期练习形成的经验。

这并不意味着 AI 永远做不到。

只是:

发现问题,和知道问题为什么发生,本来就是两件不同的事。

3. Intervene:知道原因以后,还要知道现在该怎么教这个人

假设前两步也都做对了。

AI 不只听出不稳,也判断主要是右手几个手指控制的问题。

接下来是不是就会教了?

还是不一定。

因为教学不是输出:

《手指控制不稳定的十种解决办法》。

同一个问题,不同学习者适合的方法可能不一样。

  • 有人应该先降速。
  • 有人需要改变动作。
  • 有人适合做节奏变体。
  • 也可能一个人已经机械重复太多,再继续练二十遍,只是在把紧张也一起练得更熟。

所以第三层真正困难的不是:

AI 知道多少种练习方法。

而是:

它能不能判断,眼前这个人现在最应该先做哪一件事。

这也是通用建议和教学之间很大的差别。

AI 很容易给出五条“都对”的建议。

老师很多时候会做另一件事:

先别管其他的。

只改这个。

等这里真的变了,再继续。

4. Verify:教了一次以后,还得知道这个方法有没有用

最后还有一层。

老师让我换一种方法,再弹一次。

  • 如果变好了,需要判断是偶然弹好了一次,还是已经开始稳定。
  • 如果没有变,是我没理解?方法不适合?还是最开始的诊断本身就错了?

所以真正的教学从来不是一次回答。

它是一个反馈循环:

Observe → Diagnose → Intervene → Verify

观察、诊断、干预,再回到现实检查结果。

2026 年一个叫 Profy 的钢琴研究,刚好让我觉得这个边界特别清楚。

研究者收集了 73 名演奏者、超过一千段有效演奏,同时记录琴键运动和音频,再用模型找出一段演奏中比较值得学习者回听和检查的位置。

结果显示,这类系统已经可以比较有效地帮助人定位值得注意的演奏片段。

这是很实际的进步。

但论文自己也很谨慎:它验证的是这些提示和专家判断之间的对应,以及这种反馈方式是否可用;并没有证明学生长期学习效果更好、能力能够迁移,或者这种系统已经可以替代老师。

我很喜欢这个区别。

“更准确地指出哪里值得看”,和“真正把一个人教会”,中间还有很长一段链路。

所以,AI 为什么现在还不太会教人练琴?

Research 以后,我现在的答案不再是:

因为 AI 没有身体。

也不是:

因为音乐无法用语言表达。

更接近这四层:

1. Observe

它首先要真正听见、看见你现在弹成什么样。

2. Diagnose

发现问题以后,还得知道问题为什么发生。

3. Intervene

知道原因以后,要选择适合这个具体学习者、这个阶段的练习方法。

4. Verify

最后还要重新观察,确认这个干预真的产生了效果,再决定下一步。

任何一环比较弱,最后都会出现一种很像的体验:它懂很多,也说了很多正确的话,但没有真正教到你。

这四层当然不是“AI 所有问题”的总框架。

它更适合这一类任务:需要观察真实世界、判断原因、进行个体化干预,再不断根据反馈调整。

钢琴只是其中一个很具体的例子。

但把它拆清楚以后,我发现这件事对其他 AI 使用也挺有帮助。

当 AI 没有帮上忙时,与其马上问:

是不是模型还不够强?

我现在会先看:

  • 它有没有拿到完成任务真正需要的信息?
  • 它只是看到现象,还是有足够依据判断原因?
  • 它给的建议是一般正确,还是适合眼前这个具体情况?
  • 最后有没有新的现实反馈,证明这个建议真的有用?

答案不同,解决方式也会完全不同。

有时候确实应该换更强的模型。

有时候缺的是声音、视频、传感器或者更完整的数据。

有时候需要一个专门为这类任务设计的系统,而不是继续和通用 Chatbot 聊。

还有一些时候,下一步真正需要的不是再生成一个答案,而是回到现实里试一次,再把新的结果拿回来。

这可能是这轮 research 给我的第一个有用的 takeaway。

当 AI 明明知道很多,却没有真正帮上忙时,先别急着给它贴上“不会做”的标签。先看看,从观察现实到验证结果,这条链到底断在哪里。

下一篇会继续看另一种我觉得更隐蔽的问题。

有时候 AI 根本没有明显做错。

它给出的答案很好,我们也顺利完成了任务。

但如果这件事情本来是为了学习:

AI 帮我做到了,和我自己真正学会了,是不是一回事?

关于这轮 research

这是「AI 还做不太好的事」研究系列的第一篇。

整轮研究从我自己在练琴、学习、写作、关系和 AI 产品里的真实 friction 出发,再去找不同领域的研究,看这些体验背后的解释有没有证据,哪里需要修正。

目前整理的核心证据约 20 组,主要来自音乐感知与身体技能、教育随机实验、人机协作 meta-analysis、医疗决策和 AI / Agent reliability。

它不是严格意义上的系统综述,也不会拿某一个模型今天的表现去定义 AI 永久的能力边界。个人体验负责提出问题;研究负责检验这些解释;证据暂时回答不了的地方,就保留为开放问题。

这一篇主要用了两类研究。

一类测试多模态模型处理真实音频和结构化音乐信息时的差异,帮助回答“模型到底有没有听到”。

另一类研究专门的钢琴反馈系统已经能够做到什么,又还没有证明什么,帮助区分“分析演奏”和“真正产生教学效果”。

主要参考 · ReferencesEvaluating Multimodal Large Language Models on Core Music Perception Tasks,2025Interpretable Visualization of Expertise-Dependent Motor Skills Toward Supporting Piano Practice,2026