今天,我们很高兴发布 李飞飞博士近期关于世界模型的博文节选。更多内容可在李飞飞的 Substack 或 World Labs 网站 阅读。请欣赏!
“世界是一切发生之事的总和。”
—— 路德维希·维特根斯坦,《逻辑哲学论》,1921
世界并不是由词语构成的。
在此前的一篇文章中,我们曾提出,空间智能是 AI 的下一个前沿,而世界模型正是通往这一前沿的路径。在这里,我和 World Labs 团队想再往深处探一层:如今有许多东西都被称作“世界模型”,那么,真正构成这种能力的功能模块究竟有哪些,它们各自又是做什么的?
语言模型让机器对概念、词汇和推理拥有了惊人的掌握力,但无论是虚拟世界还是真实世界,物理世界都建立在另一种不同的底层之上。语言模型学习的是文本的统计结构,而世界模型学习的是空间与时间的统计结构:光如何落在表面上,一座花园从一个从未被任何相机拍到的角度看去会是什么样子,物体如何响应作用力并遵循物理定律。
这也让“世界模型”成为当今 AI 领域里最重要、同时也最容易被过度泛化的术语之一。计算机视觉、机器人学、强化学习和生成式 AI 都声称自己在构建世界模型,但它们所指代的东西其实大相径庭。一个能生成华丽却不符合物理规律火焰的视频模型,一个即兴编出可玩游戏的语言模型,以及一个能够忠实模拟燃烧过程的物理引擎,如今都被冠以同一个名字。
古希腊人始终无法就世界由什么构成达成一致:是火、水,还是不可分割的原子,因为“世界”从来都不是单一之物。它始终只是一个代称,指向某位思想者为了推理而需要面对的那个整体。AI 如今继承了同样的问题,而且偏偏是在这个领域最需要精确定义的时刻。
分类法之下的闭环
要理清这层混乱,得先回到一个比相关技术本身更古老的图示。几十年来,强化学习教材,包括 Sutton 和 Barto 的经典著作,都在用某种版本的同一张图来描述智能体如何与世界交互。这张图的正式名称是“部分可观测马尔可夫决策过程”,即 POMDP,而“世界模型”这一术语最初的定义,正是出自这一传统。
一个智能体,可以是人、机器人,也可以是软件系统,会采取行动。行动会影响世界的状态。智能体从来无法直接看到状态本身。真正到达智能体的是观测:落在视网膜上的光子、传感器的读数,以及视频帧中的像素。新的观测会引出新的行动,如此循环往复。
“状态”这个词需要拆开来讲,因为它在不同领域里的含义并不相同。这里说的不是化学家意义上的状态,不是固态、液态、气态之间的区别。这里说的是物理学家和机器人学家意义上的状态:对某一时刻世界中正在发生之事的完整描述,其中包括每一个物体、每一个位置、每一个速度、每一种属性。状态是世界的底层现实;原则上它是完整的,但对身处其中的任何智能体来说,它都永远不可被直接看见。观测则是智能体对这一现实的局部视图。行动是智能体对此作出的反应。
正是这个闭环——从智能体到行动,再到状态,再到观测,然后回到智能体——赋予了现代术语“世界模型”其技术含义。这个短语本身还要更早,可以追溯到 Kenneth Craik 在 1943 年提出的观点:心智通过运行现实的“缩尺模型”来进行推理。到 20 世纪 80 年代末和 90 年代初,这一概念又被带入神经网络领域。而这个闭环也解释了今天人们说这个词时究竟在指什么。如今那些被称作世界模型的不同东西,实际上都是同一个闭环的不同投影。它们各自输出的,只是这个闭环中的不同部分。
本通讯仅供参考之用,不应被视为法律、商业、投资或税务建议。此外,本内容不构成投资建议,也无意供任何 a16z 基金的投资者或潜在投资者使用。本通讯可能链接至其他网站,或包含来自第三方来源的其他信息;a16z 未对该等信息进行独立核实,也不对其当前或持续的准确性作出任何陈述。若本内容包含第三方广告,a16z 未审查该等广告,也不对其中包含的任何广告内容或相关公司表示认可。文中提及、引用或描述的任何投资或被投公司,并不能代表 a16z 所管理载体中的全部投资;完整投资列表请访问 https://a16z.com/investment-list/。其他重要信息请见 a16z.com/disclosures。你之所以收到这份通讯,是因为你此前已选择订阅;若你希望不再接收后续通讯,可以立即取消订阅。


