世界模型:人工智能理解与预测现实的革命性突破
什么是“世界模型”?尽管你可能已经熟悉大语言模型、图像生成模型等概念,但“世界模型”或许还是个新词。为此,我们采访了谷歌工程师Shlomi Fruchter和Jack Parker-Holder,深入了解这一前沿技术。 他们共同主导了谷歌最新项目Project Genie的开发。Shlomi负责下一代视频与世界模型的研究与优化,而Jack则专注于构思模型的新能力,并推动团队制定实现路径。 Project Genie是一个让用户通过图像和文字创建虚拟世界并实时探索的工具。你可以想象自己踏上外星星球,或潜入海底与海洋生物共游。关键在于,这些世界并非预设的动画场景,而是由模型动态生成的——当你走进一个由图片构建的房间,模型会实时预测门后景象、镜面反光、木地板的光影变化,甚至模拟水洒在地上或下雨时的反应。你可以与物体互动,比如推一个地上的球,它会像现实中一样滚动。 这正是世界模型的核心:它不是预测下一个词,而是预测环境在动作下的演变。它基于视觉输入,学习世界中物体如何相互作用,模拟物理规律,实现端到端的动态推理,无需依赖传统游戏引擎。 虽然“世界模型”概念早已有之,但2018年谷歌大脑(现属DeepMind)的David Ha和Jürgen Schmidhuber发表的论文首次系统性地展示了从视觉数据中训练世界模型的方法,使这一术语广为人知。 与大语言模型不同,语言模型学习的是语言的统计规律,预测下一个词;而世界模型学习的是物理与环境的动态规律,预测“接下来会发生什么”,并能模拟复杂交互。 目前,世界模型主要基于视觉观察,但未来也可融合触觉、嗅觉等多模态感知。 如何使用Genie?最有效的方式是上传一张图片(如沙滩上的狗)并添加描述性文字,比如“海面波涛汹涌”。模型会据此构建一个可互动的动态场景。 世界模型的应用潜力巨大:可用于训练AI智能体在虚拟环境中学习真实世界技能,避免现实实验的风险与成本;也可用于教育,让学生“走进”古罗马或深海,通过互动学习历史与科学知识,让课堂更生动、更具沉浸感。
