World Model 是什么?AI 世界模型详解

World Model世界模型JEPA

World Model 指的是能在内部模拟环境如何随动作变化的模型:给它当前状态和一个动作,它预测接下来会发生什么。语言模型预测下一个词,世界模型预测下一个状态

World Model 预测环境随动作如何演化

World Model 预测环境随动作如何演化

World Model 中文叫「世界模型」。技术上的定义相当朴素:它是一个学出来的函数,输入是世界的当前状态加上一个动作,输出是接下来会变成什么样。语言模型预测下一个词,世界模型预测环境的下一个状态。

区别于视频生成模型的关键在于动作条件可交互:视频模型通常生成一段固定的片段,世界模型要能回答「如果我现在这么做,会怎样」。

先用一句话抓住它

World Model 是 AI 脑子里那个「如果我这么做会怎样」的模拟器。

生活里的类比是老司机的预判。倒车入库时,你不需要真把车倒进去才知道会不会蹭到,你脑子里已经跑过一遍:方向盘打多少、车尾会走什么弧线、后面那根柱子会不会碰到。这种「先在脑子里演一遍再动手」的能力,就是世界模型想给 AI 的东西。

为什么会出现这个词

大语言模型在文本上很强,但把它放到物理环境里就容易露怯:不理解物体不会凭空消失、不知道东西掉下去会加速、不清楚一个动作的后果会持续多久。做机器人、自动驾驶、具身智能的人需要的是对空间、时间、因果和物体恒存的建模,而不只是对语言分布的建模。

Yann LeCun 是这个方向最有名的倡导者。他 2022 年提出 JEPA(Joint Embedding Predictive Architecture,联合嵌入预测架构),主张在抽象表示空间里做预测,而不是逐像素预测。理由是视频里大部分内容(树叶抖动、光线闪烁)本质上不可预测,逼网络去预测这些细节既浪费容量又会污染表示。

2026 年这个方向的资本和人事变动很密集。据 TechCrunch 报道,LeCun 在 2025 年 11 月离开 Meta 后于 2026 年初创办 AMI Labs(总部巴黎),并在 2026 年 3 月 9 日宣布完成 10.3 亿美元种子轮,专门做通用世界模型。

flowchart LR
    Obs["当前观察"] --> Enc["编码器<br/>映射成抽象表示"]
    Act["拟采取的动作"] --> Pred["预测器"]
    Enc --> Pred
    Pred --> Next["预测的下一个表示"]
    Next --> Plan{"结果可接受?"}
    Plan -->|否,换动作| Act
    Plan -->|是| Exec["真正执行"]

它通常包含什么

JEPA 的结构可以作为代表:先训一个编码器,把观察映射成表示;再训一个预测器,从「过去的表示」预测「未来的表示」,到此为止——不重建像素。LeCun 更完整的蓝图《A Path Towards Autonomous Machine Intelligence》里给了六个模块:感知、世界模型、代价模块、短期记忆、行动器和配置器,其中分层版本 H-JEPA 主张智能体应学习多层次、多时间尺度的预测表示,用来支持规划和模型预测控制。

这一脉的实际产出包括 I-JEPA(在图像的抽象表示之间比较而不是比较像素)和 V-JEPA(把这套做到视频上,学到可用于物理推理的表示)。Meta 发布的 V-JEPA 2 用一百万小时互联网视频训练,再用 62 小时机器人交互数据微调,在零样本机器人操作上达到约八成成功率。

另一条路线走的是生成式模拟。DeepMind 的 Genie 从纯游戏录像里学,没有动作标签,靠推断潜在动作空间来让生成的环境变得可交互;后续版本把帧率和一致性推到了可用水平。NVIDIA、Wayve 等公司也在做面向自动驾驶和机器人的版本。

和大语言模型、视频生成的区别

大语言模型的区别在预测对象:语言模型预测下一个 token,训练信号来自文本;世界模型预测下一个状态,训练信号来自观察和动作的序列。两者也在靠拢——一类常见的混合思路是让语言模型负责用语言推理,让模拟模块在执行前验证动作是否物理可行。

和视频生成模型的区别在可控性和闭环。视频模型的目标是画面好看且连贯;世界模型的目标是「按我给的动作演化得对」,所以评价标准也从画质转向了闭环有用性、可控性和对决策的帮助程度。

和具身智能、强化学习的关系

强化学习里早就有「基于模型的方法」,即先学环境模型再在模型里做规划,世界模型可以看作这条思路在深度学习时代的延续与放大。对具身智能来说,世界模型的价值是在脑子里试错:真实机器人试错代价高、速度慢,能在内部模拟里预演,就能大幅减少真实交互次数。

容易误解的地方

第一个误解是以为这个词有统一定义。它被严重超载了:DeepMind 的 Genie、NVIDIA Cosmos、Wayve 的 GAIA-2、Meta 的 V-JEPA 2,以及 OpenAI 把 Sora 描述成「世界模拟器」,都在用这个标签,指的东西并不一样。听到这个词时最好先问一句「你说的是哪一种」。

第二个误解是把生成一段逼真视频等同于理解了物理。2026 年评价标准的迁移正是针对这一点:看的不再是画面像不像,而是在闭环任务里有没有用。生成模型出现「重力不对」这类失败并不罕见。

第三个误解是觉得 JEPA 路线和生成式路线必有一胜。比较多的判断是未来会是混合架构——在需要抽象时用抽象,在需要重建细节时重建,学会什么时候相信哪一种。

第四个误解是把融资规模等同于技术成熟。长时程一致性、记忆、物理真实感、基准可比性和仿真到现实的迁移,都还是没解决的问题,从理论走到商用按当事方自己的说法也要以年计。

怎么判断它该不该关心

如果你做的是文本、客服、内容或一般的企业应用,世界模型目前和你关系不大,它的落点在机器人、自动驾驶、工业仿真和游戏环境生成。

如果你在做具身相关的方向,值得关心的是三件事:这个模型是不是动作条件的(能不能回答「如果这样做会怎样」)、评测是不是闭环的(有没有在真实任务上验证,而不只是看视频质量)、以及它在长时程上会不会漂移。这三点比参数量和演示视频更能说明它有没有用。

资料来源