语言不是世界:AI 下一步要补的,可能是“现实感”
Language is not the world上一篇写到杨立昆对 LLM 的质疑。
他的核心提醒是:
会说话的 AI,不一定真的理解世界。
这个观点让我很有共鸣。
因为语言本身就是有边界的。
很多东西无法被语言完整表达。
你可以描述一个空间为什么舒服,但描述不是你身体待在那个空间里的感受。你可以解释一段音乐为什么动人,但解释不是那个音色、节奏和停顿本身。你可以说一个设计“高级”,但真正的判断常常来自比例、材质、留白、节奏和经验。你可以写下“我很孤独”,但这句话永远不能完整承载孤独本身。
语言很强大。
它是人类文明最重要的压缩工具之一。
但语言不是经验本身。
这也是为什么,现在 AI 研究里有一批方向,都在试图回答同一个问题:
如果语言不够,AI 还需要补什么?
我最近看到几个关键词,觉得很值得放在一张地图里理解。
第一个是 symbol grounding,符号接地。
简单说,就是一个词怎么真正连接到世界。
比如 AI 知道“杯子”这个词,它真的理解杯子吗?
如果它只是在文本里学到:
杯子可以喝水。杯子会碎。杯子放在桌上。杯子可能掉下来。
这当然是一种知识。
但“杯子”真正接到现实世界,还包括视觉、形状、重量、材质、大小、抓取方式、是否装水、掉落后会发生什么。
如果一个系统只是用词解释词,用符号解释符号,它可能会形成一个漂亮的语言网络,但意义并没有真正接到世界上。
这就是 symbol grounding 关心的问题:
语言符号如何从世界中获得意义?
第二个是 embodied AI,具身智能。
具身智能强调:智能不是只发生在语言里,也不是只发生在抽象大脑里。
人类理解世界,是通过身体、感官、行动、环境和反馈完成的。
我们理解“重”,不是只因为知道这个字,而是因为身体举过重物。我们理解“远”,不是只因为知道距离单位,而是因为身体走过路。我们理解“紧张”,不是只因为知道定义,而是因为身体真的体验过心跳、呼吸和压力。
很多知识不是显性语言,而是身体经验。
这也是为什么弹琴、运动、设计判断、亲密关系里的微妙变化,都很难被语言完整讲清楚。
一个真正进入现实世界的 AI,可能不能只读文本。
它需要看、听、移动、试错、接收反馈。
第三个是 world models,世界模型。
世界模型可以理解成:
AI 内部要有一个关于“世界如何变化”的模型。
不是只预测下一个词,而是预测接下来会发生什么。
比如看到桌边的杯子。
普通识别模型可能会说:这里有一个杯子。语言模型可能会说:杯子靠近桌边,可能会掉。更强的世界模型应该能判断:如果有人碰到桌子,杯子可能掉下去;如果杯子是玻璃材质,可能会碎;如果目标是避免损坏,应该先把它移到更安全的位置。
也就是说,世界模型关心的不是“怎么说”,而是“事情会怎么发展”。
这对机器人、自动驾驶、工业系统、空间计算都很重要。
第四个是 spatial intelligence,空间智能。
这是李飞飞现在特别关注的方向之一。
空间智能关心的是:AI 能不能理解三维世界。
物体在哪里?它们之间是什么关系?从不同角度看会发生什么变化?一个人如何在空间中移动?一个动作会如何影响周围环境?
今天很多 AI 很会处理文字和二维图像,但真实世界是三维的、连续的、动态的。
如果 AI 要进入 AR/VR、机器人、自动驾驶、家居空间、建筑设计、游戏世界,它就不能只“看见一张图”,而要理解空间结构。
第五个是 VLA,vision-language-action model。
这个词可以拆开理解:
vision:看见。language:理解语言指令。action:采取行动。
也就是说,AI 不只是看图和回答问题,而是要把视觉、语言和动作连起来。
比如你对机器人说:
“把桌上的红色杯子拿到水槽旁边。”
它需要看见桌子、识别红色杯子、理解你的语言、规划路径、控制手臂、抓取杯子、避开障碍、放到指定位置。
这不是一个纯语言任务。
它是视觉、空间、动作、反馈的综合任务。
第六个是 human-compatible AI,或者说更适合与人协作的 AI。
这条线关注的是:
AI 不只是完成任务,还要理解人的目标、约束、偏好和合作方式。
因为现实里的任务很少是完全清楚的。
用户说“帮我整理一下”,到底整理到什么程度?用户说“做得高级一点”,高级是什么意思?用户说“帮我处理这件事”,哪些可以自动做,哪些必须先问人?
一个真正有用的 AI,不只是聪明,还要可控、可信、可解释、可交接。
它需要知道什么时候该行动,什么时候该确认,什么时候该停下来,什么时候必须把判断权交还给人。
这几个方向看起来很学术,但对做产品其实很有启发。
它们共同指向一件事:
AI 的下一步,可能不是更会聊天,而是更能被现实约束。
好的 AI 产品不应该只是语言机器。
它应该理解任务、理解场景、接触真实上下文,并产出可验证的结果。
比如做一个钢琴练习产品。
如果用户只输入“我弹不好”,AI 很难真正理解发生了什么。
更有价值的上下文可能是:
音频。视频。节拍。曲谱位置。老师批注。练习历史。错误片段。手型和触键。
因为弹琴不是语言问题。
它是身体、听觉、节奏、力度和反馈的问题。
再比如做一个人生信息整理工具。
如果 AI 只是生成一段“你应该整理账户和文件”的建议,价值有限。
真正有价值的是结构化、可交付、可验证:
账户在哪里?文件在哪里?谁可以联系?哪些信息缺失?哪些事情优先?最后能不能导出一份别人真的看得懂、用得上的文档?
这就是从“会回答”走向“能交付”。
所以,我现在判断 AI 产品时,会少问一句:
它用了哪个模型?
多问几句:
它接触到了什么真实数据?它理解的是语言,还是任务场景?它的输出能不能被验证?它能不能行动?行动的边界在哪里?失败后能不能修正?哪些地方必须保留人类判断?
很多时候,AI 产品真正的差异不在模型名,而在 grounding。
也就是,它到底有没有被现实约束住。
语言很强大,但语言不是世界。回答很有用,但回答不是行动。生成很惊艳,但生成不是可靠交付。
未来的 AI 也许不只是一个更会说话的模型。
而是一套能理解目标、进入场景、接触现实、采取行动,并在反馈中修正自己的系统。
这也是我觉得这些研究方向值得关注的原因。
它们不一定马上变成一个新工具。也不一定立刻对日常效率最有用。但它们会帮我们理解:
AI 的边界在哪里。下一阶段的机会在哪里。以及,为什么真正好的 AI 产品,不能只停留在“说得很像懂了”。