当下的大语言模型擅长处理文字,但对物理世界缺乏直观理解——它们无法想象一个杯子掉落后会怎样。世界模型(World Model)的目标,是让AI在大脑里构建一个可以「预演」现实的世界模拟器,理解物体运动、因果关系和时间演化,从而在下棋、开车、操作机器人等需要长期规划的任务中表现得更加可靠。
以Sora为代表的视频生成模型被认为是通向世界模型的雏形:它们在生成连续视频的过程中,隐式学到了光照、碰撞、重力等物理规律。但单纯的「看起来合理」不等于「真正理解」,研究者正在探索如何让模型在生成之外,还能进行反事实推理——例如预测「如果换个角度会发生什么」,这是通往通用智能的关键能力。
世界模型最有潜力的应用在具身智能与自动驾驶领域:机器人可以在虚拟世界中反复试错训练,再迁移到现实,大幅降低数据采集成本。难点在于模型容易产生幻觉,对小概率事件和复杂交互的预测仍然不可靠,且训练所需的算力规模巨大。即便如此,它已被视为通往通用人工智能的重要拼图。
展望未来,随着算力持续提升和训练数据不断丰富,世界模型有望成为连接语言、视觉与物理行动的枢纽,让AI从「会说」走向「会做」,真正逼近通用智能的目标。