语言不是世界:AI 下一步要补的,可能是“现实感”

Language is not the world

上一篇写到杨立昆对 LLM 的质疑。

他的核心提醒是:

会说话的 AI,不一定真的理解世界。

这个观点让我很有共鸣。

因为语言本身就是有边界的。

很多东西无法被语言完整表达。

你可以描述一个空间为什么舒服,但描述不是你身体待在那个空间里的感受。你可以解释一段音乐为什么动人,但解释不是那个音色、节奏和停顿本身。你可以说一个设计“高级”,但真正的判断常常来自比例、材质、留白、节奏和经验。你可以写下“我很孤独”,但这句话永远不能完整承载孤独本身。

语言很强大。

它是人类文明最重要的压缩工具之一。

但语言不是经验本身。

这也是为什么,现在 AI 研究里有一批方向,都在试图回答同一个问题:

如果语言不够,AI 还需要补什么?

我最近看到几个关键词,觉得很值得放在一张地图里理解。

第一个是 symbol grounding,符号接地。

简单说,就是一个词怎么真正连接到世界。

比如 AI 知道“杯子”这个词,它真的理解杯子吗?

如果它只是在文本里学到:

杯子可以喝水。杯子会碎。杯子放在桌上。杯子可能掉下来。

这当然是一种知识。

但“杯子”真正接到现实世界,还包括视觉、形状、重量、材质、大小、抓取方式、是否装水、掉落后会发生什么。

如果一个系统只是用词解释词,用符号解释符号,它可能会形成一个漂亮的语言网络,但意义并没有真正接到世界上。

这就是 symbol grounding 关心的问题:

语言符号如何从世界中获得意义?

第二个是 embodied AI,具身智能。

具身智能强调:智能不是只发生在语言里,也不是只发生在抽象大脑里。

人类理解世界,是通过身体、感官、行动、环境和反馈完成的。

我们理解“重”,不是只因为知道这个字,而是因为身体举过重物。我们理解“远”,不是只因为知道距离单位,而是因为身体走过路。我们理解“紧张”,不是只因为知道定义,而是因为身体真的体验过心跳、呼吸和压力。

很多知识不是显性语言,而是身体经验。

这也是为什么弹琴、运动、设计判断、亲密关系里的微妙变化,都很难被语言完整讲清楚。

一个真正进入现实世界的 AI,可能不能只读文本。

它需要看、听、移动、试错、接收反馈。

第三个是 world models,世界模型。

世界模型可以理解成:

AI 内部要有一个关于“世界如何变化”的模型。

不是只预测下一个词,而是预测接下来会发生什么。

比如看到桌边的杯子。

普通识别模型可能会说:这里有一个杯子。语言模型可能会说:杯子靠近桌边,可能会掉。更强的世界模型应该能判断:如果有人碰到桌子,杯子可能掉下去;如果杯子是玻璃材质,可能会碎;如果目标是避免损坏,应该先把它移到更安全的位置。

也就是说,世界模型关心的不是“怎么说”,而是“事情会怎么发展”。

这对机器人、自动驾驶、工业系统、空间计算都很重要。

第四个是 spatial intelligence,空间智能。

这是李飞飞现在特别关注的方向之一。

空间智能关心的是:AI 能不能理解三维世界。

物体在哪里?它们之间是什么关系?从不同角度看会发生什么变化?一个人如何在空间中移动?一个动作会如何影响周围环境?

今天很多 AI 很会处理文字和二维图像,但真实世界是三维的、连续的、动态的。

如果 AI 要进入 AR/VR、机器人、自动驾驶、家居空间、建筑设计、游戏世界,它就不能只“看见一张图”,而要理解空间结构。

第五个是 VLA,vision-language-action model。

这个词可以拆开理解:

vision:看见。language:理解语言指令。action:采取行动。

也就是说,AI 不只是看图和回答问题,而是要把视觉、语言和动作连起来。

比如你对机器人说:

“把桌上的红色杯子拿到水槽旁边。”

它需要看见桌子、识别红色杯子、理解你的语言、规划路径、控制手臂、抓取杯子、避开障碍、放到指定位置。

这不是一个纯语言任务。

它是视觉、空间、动作、反馈的综合任务。

第六个是 human-compatible AI,或者说更适合与人协作的 AI。

这条线关注的是:

AI 不只是完成任务,还要理解人的目标、约束、偏好和合作方式。

因为现实里的任务很少是完全清楚的。

用户说“帮我整理一下”,到底整理到什么程度?用户说“做得高级一点”,高级是什么意思?用户说“帮我处理这件事”,哪些可以自动做,哪些必须先问人?

一个真正有用的 AI,不只是聪明,还要可控、可信、可解释、可交接。

它需要知道什么时候该行动,什么时候该确认,什么时候该停下来,什么时候必须把判断权交还给人。

这几个方向看起来很学术,但对做产品其实很有启发。

它们共同指向一件事:

AI 的下一步,可能不是更会聊天,而是更能被现实约束。

好的 AI 产品不应该只是语言机器。

它应该理解任务、理解场景、接触真实上下文,并产出可验证的结果。

比如做一个钢琴练习产品。

如果用户只输入“我弹不好”,AI 很难真正理解发生了什么。

更有价值的上下文可能是:

音频。视频。节拍。曲谱位置。老师批注。练习历史。错误片段。手型和触键。

因为弹琴不是语言问题。

它是身体、听觉、节奏、力度和反馈的问题。

再比如做一个人生信息整理工具。

如果 AI 只是生成一段“你应该整理账户和文件”的建议,价值有限。

真正有价值的是结构化、可交付、可验证:

账户在哪里?文件在哪里?谁可以联系?哪些信息缺失?哪些事情优先?最后能不能导出一份别人真的看得懂、用得上的文档?

这就是从“会回答”走向“能交付”。

所以,我现在判断 AI 产品时,会少问一句:

它用了哪个模型?

多问几句:

它接触到了什么真实数据?它理解的是语言,还是任务场景?它的输出能不能被验证?它能不能行动?行动的边界在哪里?失败后能不能修正?哪些地方必须保留人类判断?

很多时候,AI 产品真正的差异不在模型名,而在 grounding。

也就是,它到底有没有被现实约束住。

语言很强大,但语言不是世界。回答很有用,但回答不是行动。生成很惊艳,但生成不是可靠交付。

未来的 AI 也许不只是一个更会说话的模型。

而是一套能理解目标、进入场景、接触现实、采取行动,并在反馈中修正自己的系统。

这也是我觉得这些研究方向值得关注的原因。

它们不一定马上变成一个新工具。也不一定立刻对日常效率最有用。但它们会帮我们理解:

AI 的边界在哪里。下一阶段的机会在哪里。以及,为什么真正好的 AI 产品,不能只停留在“说得很像懂了”。