世界模型开始合流,中国团队正在进入核心问题。作者丨吴思梦 编辑丨岑 峰 2026 年 9 月 8 日,全球计算机视觉顶级会议 ACM 与 ECVA(European Computer Vision Association)主办的 ECCV 2026 将在瑞典马尔默的 Malmö Arena 和 Malmömässan 两个相邻场馆开幕。
这个两年一届、与 CVPR、ICCV 并称计算机视觉领域“三大顶会”的学术盛会 ,收到了 10473 篇论文投稿,最终接收 2883 篇(接收率 27.5%)。在会议公布的 86 个 workshop 中,有 13 个直接以“World Models”或“Embodied AI”为主题,这是 ECCV 历史上从未出现过的密度。
Yann LeCun、Jürgen Schmidhuber、Kristen Grauman、Jamie Shotton 等学者都将作为 keynote 演讲者出现。围绕世界模型的 workshop、tutorial 和论文,从三维理解、视频生成,到具身智能、安全评估,被集中放到了 ECCV 2026 的议程中。
届时AI 科技评论将前往现场,进行前沿追踪报道。这背后代表的不只是一个研究方向升温。
它意味着 AI 的竞争正在从“理解世界”,走向“预测世界”。而在这场变化中,中国研究者正在试图占据新的位置。
01 ECCV 2026 为什么突然都在讨论世界模型?世界模型并不是一个新概念。
早在强化学习领域,研究者就提出过类似思想:如果智能体能够预测环境变化,就可以减少真实世界中的试错成本。但过去很长时间,这条路线没有真正成为主流。
原因很简单:世界太复杂。真实环境中的数据昂贵,物理规律难以建模,而传统模型很难同时处理视觉、动作和长期预测。
过去两年的变化,让世界模型重新进入中心。一方面,生成式 AI 的快速发展,让模型第一次具备了预测复杂视觉世界的能力。
另一方面,机器人和自动驾驶产业开始迫切需要一种新的学习方式。机器人不能像语言模型一样,通过互联网文本获得经验。
它需要面对真实世界里的动作和反馈。于是,一个新的问题出现:AI 能不能像人一样,在行动之前先想象?
ECCV 2026 的世界模型相关讨论,实际上集中在四个问题。第一个问题:世界模型如何构建?
研究者需要回答,什么样的数据才能训练一个理解世界变化的模型。单纯的视频是否足够?
是否需要动作数据?是否需要三维信息?
第二个问题:世界模型如何评价?过去评价生成模型,通常关注图像质量。
但世界模型不同。一个模型生成的视频再逼真,如果无法帮助机器人完成任务,也没有真正价值。
因此,新的评测体系开始关注:模型是否理解空间关系?是否符合物理规律?
是否能够预测行动结果?第三个问题:世界模型是否可靠?
如果未来进入自动驾驶、人形机器人等领域,错误预测可能带来真实风险。模型不仅需要预测未来,还需要知道自己的预测是否可信。
第四个问题:世界模型如何进入行动闭环?这是最关键的一步。
预测未来不是目的。帮助机器做出正确行动,才是世界模型最终价值。
如果再把这四个问题放到一起看,会发现 ECCV 2026 上世界模型的爆发,并不是单一研究方向升温,而是三股独立趋势在同一年合流的结果。第一股是世界模型本身的范式转移。
从 Yann LeCun 2022 年的 JEPA 论文,到 ECCV 2026 主会 keynote 上 Yann LeCun 与 Jürgen Schmidhuber 同台,世界模型从“少数派方向”变成了主流共识。 LeCun 长期主张“智能的核心是预测物理世界”,而工业界的 Sora、Veo、Genie 把这条预言变成了可视化产物。
当 CVPR、NeurIPS、ICLR 都把世界模型作为专题时,ECCV 的转向只是时间问题。第二股是 3D 高斯泼溅(Gaussian Splatting)的工程化成熟。
2023 年 Inria 团队在 SIGGRAPH 上重新激活这条路线后,三年内它已经扩散到 SLAM、水下场景、热红外、4D 动态场景、压缩流式传输、医学 CT 重建等几乎所有 3D 视觉下游任务。 ECCV 2026 第一场海报就列出超过 80 篇 Gaussian Splatting 相关论文,覆盖范围横跨动态 4D、自动驾驶模拟、医学影像。
当世界模型需要“操作 3D 场景”时,3D 高斯是最自然的 token 候选,它可微、紧凑、有位置/朝向/尺度/颜色/透明度五个可学习参数。这让“世界模型的可计算基座”第一次有了工程落点。
第三股是具身智能的产业化压力。当人形机器人、自动驾驶汽车、配送机器人开始面对真实的开放环境,单纯模仿学习的泛化瓶颈就暴露了。
Spirit AI、Physical Intelligence、Google DeepMind、NVIDIA 同时押注 VLA + 世界模型,不是技术潮流,而是工业交付压力下的工程妥协。这三条线在 ECCV 2026 第一次正式会师:13 个 Embodied AI & World Models workshop、3 个 keynote、Yilun Du 等 panelist 的“AI 能否自主发现新知识”圆桌讨论,背后是同一个判断:世界模型、3D 表示、具身智能已经不再能分开讨论。
02 中国学者 正在补齐世界模型的三块拼图 模型需要的不只是更大的参数量,还需要连接三个环节:理解世界,预测未来,影响行动。在这条产业链上,中国研究者正在从不同方向切入。
有人试图重新定义世界模型的边界,有人在建立评价体系,也有人正在把模型推向真实机器人。 ▎ 王新超:重新定义世界模型,从“生成未来”到“行动未来” 世界模型最大的争议之一,是它到底应该做什么。
如果一个模型可以生成未来的视频,它是不是已经理解世界?答案并不确定。
因为现实世界中的智能,并不只是预测。预测的目的,最终还是落到行动。
王新超(新加坡国立大学)团队提出的 World Action Model(WAM)概念,正是在重新划定世界模型的边界。在《World Action Models: A Survey》中,研究者认为,过去很多工作混淆了世界模型、视频生成模型、视觉语言行动模型之间的区别。
真正面向具身智能的世界模型,需要满足一个条件:预测出来的未来,必须进入行动路径。简单来说:如果模型只是生成“未来会发生什么”,它更像一个视频预测器。
如果模型利用这个预测帮助机器人决定“下一步应该做什么”,它才更接近世界模型真正的价值。这也是 WAM 这个概念出现的原因。
过去的 VLA(Vision-Language-Action)模型解决的是:看到什么,应该做什么。而 World Action Model 希望进一步解决:如果这样做,未来会怎样。
这种变化非常关键。因为现实世界中的任务,往往没有标准答案。
机器人拿起一个杯子,不只是识别杯子在哪里,还需要判断:杯子的重量是多少?抓取力度是否合适?
移动过程中是否可能碰撞?这些问题,本质上都需要预测。
因此,未来的具身智能系统可能不是一个单纯的行动模型,而是一个“预测未来,再选择行动”的系统。 ▎ 陈志波、李新:让世界模型从“看起来真实”走向“真正可用” 世界模型发展的另一个难题,是如何判断一个模型到底懂不懂世界。
一辆生成出来的汽车视频,即使视觉上非常真实,如果下一秒车辆运动违反物理规律,它仍然无法用于自动驾驶。因此,世界模型需要新的评价标准。
陈志波团队关注的,正是这一问题。他们提出的 4DWorldBench,将评价对象从单纯视觉质量扩展到更接近真实世界的问题:模型是否理解空间结构?
是否保持时间连续性?是否符合物理规律?
是否能够支持后续任务?这也是为什么 benchmark 正成为世界模型竞争的重要部分。
因为没有评价体系,就无法知道一个世界模型到底是在理解世界,还是只是在模仿世界。在这一方向上,陈志波团队和李新(Xin Li)团队进一步探索了世界模型与 VLA 的结合。
ECCV 2026 主会场出现的 VLA-JEPA,就是其中一个代表。它尝试在视觉语言行动模型中加入潜空间世界模型,让模型不仅学习当前观察和动作之间的关系,也学习隐藏状态如何变化。
简单理解:传统 VLA 更像是看到图片后直接回答:“下一步怎么做?而加入世界模型后,模型会多一个过程:“如果我这样做,未来状态可能是什么?
再决定动作。这让机器人从即时反应,向预测式决策迈进一步。
▎ 杨高、梁晓丹:让世界模型进入机器人 如果说前两条路线解决的是“世界模型是什么”和“如何评价”,那么杨高和梁晓丹关注的问题更加工程化:世界模型如何真正进入机器人。 9 月 9 日的 ECCV 2026 “How to Build Effective World Models for Embodied AI” workshop 中,二者出现在该 workshop 早期公布的 invited speakers 名单中。
最终议程里,梁晓丹成为重要演讲嘉宾。他们代表了两条不同的路线。
杨高更关注如何利用大规模视觉数据和基础模型能力,让机器人获得更强泛化能力。梁晓丹(中山大学)是另一条路线。
她的核心命题是物理具身基础模型:表征、架构及真机评测,强调世界模型的核心价值是预测一个会发生的世界,而不是生成一个像真的视频。这条命题在 ECCV 2026 之前,已经通过几个工作落地:A1(自适应早退机制)、AtomicVLA(原子动作分解)、eWAM(VLA 与世界模型的原生融合)、PhyAgentOS(标准化框架)、ManipArena(真机评测基准)。
eWAM 的核心思想是把世界模型的潜空间预测作为 VLA 的内部监督信号,让预测下一帧与输出下一动作共享表示,这与 VLA-JEPA 的判断一致,但路径不同:VLA-JEPA 强调潜空间作为接口,eWAM 强调原生耦合。 ProPhy 是这个思路在视频生成侧的延伸:通过 Mixture-of-Physics-Experts(MoPE)机制,把物理先验逐层注入视频生成,让视频是否符合物理规律成为可优化目标。
两条路线的合流点是:当 VLA、世界模型、视频生成都在尝试把物理一致性内化为可优化的目标时,世界模型这个词的边界正在被改写,它不再只是预测未来的模块,而是机器人感知、决策、生成三者的共同约束。这也是为什么 ECCV 2026 把它放到与 Embodied AI 同等的位置。
03 最后 世界模型竞争的下一步,已经从“能不能生成好看的未来”,转向“能不能预测一个会发生的世界”。围绕这个问题的不同回答,构成了 ECCV 2026 世界模型相关 13 个 workshop、上百篇论文和同期竞赛的全部议程。
当学界、产业界、监管者把视线投向同一议题时,它就不再只是一个研究方向,更是一个产业拐点。中国研究者从世界模型的边界、评价体系、机器人落地三个方向切入,并不是分散行动,而是同一个问题的三个不同侧面。
当这三个侧面在某个时间点拼合在一起时,中国学术界在世界模型这条赛道上的位置,才会被真正改写。为了方便大家抱团交流、互通会议消息,雷峰网专门建了 ECCV 2026 参会交流群 !
进群你会解锁这些「福利」 ?会议情报站 : 投稿 DDL、格式规范、评审进度……关键节点第一时间送达,再也不怕错过 deadline,投稿准备稳稳的。
同行茶话会 : 天南海北的同行都在群里,聊心得、碰思路、攒人脉,科研路上我们同行。前沿补给站 : 最新研究成果、热点方向实时同步,结合会议主题帮你捋清投稿脉络,给论文灵感加满油。
现场后援团: (会议期间专属开启): 到了会场也不用慌—— 路线导航 : 场馆分布、报告厅怎么走,群里随时问; 议题共读 : 热门 session、Keynote 现场探讨,错过也能追; Poster 汇编 : 现场海报精华整理,一键收藏不遗漏; 约局广场 : 约饭局、采访局、交流局……想唠嗑、想合作、想面基,群里发起就成。 ?
进群传送门: 扫码进群或添加微信 Qvv0909777 ,备注:ECCV + 单位/学校+姓名+方向 。搞科研/搞技术,信息差很重要。
来,一起快人一步!上车,带你看遍全球 AI 顶会精华 可独家畅览: 专家演讲PPT 大会报告全文 热门论文解读 学术新星访谈 扫描上方二维码 或点击 「 阅读原文 」 关注专区。