VicroCode
让代码创造价值
VicroCode是一个轻量级代码在线发布、交易平台,开箱即用,免部署、免服务器、免备案,支持接入智能体、通用管理系统、游戏等多种项目
稍候片刻,您可先学习AI编程手册
正在加载中...

市场信息

这个新开源的世界模型只有1.3B,单卡就能实时跑!

轻量版LingBot-World 2.0

www.qbitai.com · 2026-09-10T07:44:00+00:00

这个新开源的世界模型只有1.3B,单卡就能实时跑!十三 2026-09-10 15:44:00 来源: 量子位 轻量版LingBot-World 2.0 金磊 发自 凹非寺 量子位 | 公众号 QbitAI 大火的 世界模型 ,真的不能拿 一张消费级显卡 跑吗?

有的,家人们,真的有的。因为就在刚刚,一个 国产 的、 开源 的世界模型,做到了!

来,先来看一下第一人称射击效果: 视频地址: /ai-market-guide/ 在雪地科幻场景里,角色一边移动和转动视角,一边开火,过程中还能看到爆炸、火焰、能量护盾等反馈。重点是这些变化都发生在同一个持续生成的世界里,场景也会随着操作继续往前走。

再来看大热的《奥德赛》的场景: 视频地址: /ai-market-guide/ 这次是第三人称视角,角色在巨型木马、城墙和火光之间向前探索。随着角色不断移动,近处的人物、地面和远处建筑也在持续展开,整个场景的空间关系基本能一直维持下来。

再换一个完全不同的风格: 视频地址: /ai-market-guide/ 三个Demo,三种完全不同的世界。而跑出这些效果的,就是 蚂蚁灵波 在 7 月开源的 LingBot-World 2.0 。

而刚刚,他们又发布了 LingBot-World 2.0 的轻量版,参数规模只有1.3B。是面向消费级单卡GPU设计、可以在 本地实现 实时世界生成的那种。

视频地址: /ai-market-guide/ LingBot-World 2.0在今年7月开源的是14B主模型。这套世界模型已经能做到小时级持续生成、丰富的动作和事件交互,并在相应算力和推理配置下实现720p/60fps的高清实时体验。

彼时,“1.3B”这个数字,就已经悄悄出现在了论文摘要里。而且就在上周的IFA柏林消费电子展开幕演讲上,这个伏笔又被公开点了一次。

在开幕演讲中,AMD高级副总裁Jack Huynh一共点名了 3 个开源模型,除了智谱、千问,就是LingBot-World。他拿LingBot-World 2.0做了Demo。

一个Prompt生成世界之后,角色可以在中国小镇、欧洲乡村等环境里长时间探索、环顾和行动,场景还会随着交互继续向前展开。 Jack Huynh看完之后给了一句评价: This is the future of Personal AI. 一切的承诺,今天,均已兑现。

但比起又一个开源这个动作来说,我们或许更好奇的是—— 能本地实时跑起来的世界模型,到底是怎么做到的?不只是变小了那么简单 要回答这个问题,得先从世界模型和普通视频生成的区别说起。

平时我们用AI生成一段视频,输入Prompt之后,等几十秒甚至几分钟都很正常。模型把整段视频生成完,再把结果交到你手里,事情基本就结束了。

但世界模型显然不是这么干的。人在场景里往前走一步,模型就得接着往前生成;视角转向左边,画面也得跟着变化……换句话说, 世界模型是在生成一个持续演进的世界 。

虽然7月的LingBot-World 2.0已经把这件事做到了一个相对不错的效果,例如做过超过一小时的不间断生成测试,从水乡、城市一路跑到雪地、太空等不同场景,整个过程中,模型都能维持比较稳定的场景结构和视觉质量。但这一套体验的背后,工程栈也是相当繁重的。

蚂蚁灵波在部署层面堆了编译器级别的注意力Kernel优化、动态KV缓存调度、异步流媒体传输,还有混合并行推理策略等……为的是让高质量的实时世界能先跑起来。于是在今天之前,绝大多数人接触世界模型的方式其实只有两种:看官方放出来的视频,或者去在线Demo页面点两下。

所以1.3B版本想要解决的问题是, 能不能在较少的算力情况下,也把它跑起来。不过从14B到1.3B,蚂蚁灵波并非是先做出大模型然后再砍小,而是先把一条训练路线走通,小模型是这条路线走到最后自然出现的产物。

为此,蚂蚁灵波团队首先训练了一个叫 Causal World 的模型。所谓Causal,可以简单理解成,模型生成当前状态时,只能依赖过去已经发生的视觉信息,以及用户到此刻为止给出的输入,未来还没发生的内容不能提前看,即为因果。

但在这个过程中,自回归模型会把自己刚刚生成出来的结果继续当成后面的输入。前面只要稍微偏一点,这个误差就有可能一路被带到后面。

生成时间拉长之后,纹理会变糊,几何结构会逐渐变形,整个场景甚至可能慢慢漂掉。为了让Causal Pretrain阶段的模型在长上下文里保持住生成质量,LingBot-World 2.0又设计了MoBA,也就是Mixture of Bidirectional and Autoregressive Attention Mask。

它主要解决的是纯Teacher Forcing在长上下文里容易出现的另一个问题。随着上下文越来越长,模型会越来越依赖前面已经给出的干净Context,最后容易出现过拟合,视觉质量也会跟着下降。

MoBA在原有Teacher Forcing Mask里加入一部分双向Attention,相当于给训练过程增加一层正则,让模型适应更灵活的视频长度,同时缓解这种过拟合和画质退化。这一阶段训练出来的Backbone,先把世界模型的基础能力撑了起来。

团队后来还专门拿这个Causal Pretrained Backbone和MAGI、HY-World 1.5做过长时生成对比。从5秒到60秒,LingBot-World 2.0在纹理、几何结构和场景连贯性上的保持更加稳定。

但高质量的Backbone还有一个很现实的问题:慢。这个经过因果预训练的Backbone,同时也承担Teacher的角色。

Teacher可以给出质量更高的生成结果,但每一帧都需要经过很多步去噪,如果直接拿去做实时交互,计算成本还是太高。所以接下来,LingBot-World 2.0开始做蒸馏。

第一步是一致性蒸馏,也就是Consistency Distillation。它把Teacher原本需要很多步才能走完的去噪轨迹压缩到少数几步,让Student用更少的计算完成生成,同时尽量保留预训练阶段已经学到的动作条件动态能力。

不过Student真正部署出去以后,面对的大量状态都来自它自己上一轮的生成。前面只要出现偏差,后面还是有可能继续放大。

于是团队又在这一步加入了DMD,也就是Distribution Matching Distillation,并且专门让Student在自己的长时self-rollout轨迹上继续训练。换句话说,模型以后真正会跑进什么状态,训练时就先让它提前见过。

这种训练方式可以减少长时自回归过程里的累计漂移。到这里,整条路线才算真正接了起来。

LingBot-World 2.0先用Causal Pretrain打下一个长时生成相对稳定的世界模型底座,再让Teacher提供高质量的生成过程,随后通过蒸馏把原本需要多步完成的计算压缩到少步,最后再让Student去适应自己真正运行之后会遇到的状态。所以从表面看,这次只是又多了一个小尺寸版本。

往深一层看,蚂蚁灵波实际上把LingBot-World 2.0的研发链路也往外开放了一截。世界模型的门槛也要被打下来了 若是我们把时间往前倒一点,就不难发现LingBot-World这一年的变化几乎一直围绕两个字展开—— 门槛 : 今年1月,LingBot-World 1.0第一次开源; 到了7月,LingBot-World 2.0来到14B,开始挑战小时级持续生成、复杂事件交互和720p/60fps实时体验; 今天,1.3B版本又把同一套世界模型往消费级单卡上推了一步。

三次开源,依次回答的其实是三个问题: 能不能做出来,能不能做得久、做得真,以及能不能让更多人跑起来。而这次蚂蚁灵波把Causal Pretrain和双向Teacher一起放出来,走的也是同一个逻辑。

小模型负责让更多人把世界模型跑起来。这两个上游模型管的是跑起来之后,社区能不能接着往下改,做后训练、做蒸馏、做压缩、做垂直场景适配。

因此,如果说世界模型的上半场,比的是能不能生成得更久、更真;那么下半场要比的,可能是能不能让普通人手上那张卡也跑得动。这个规律在AI发展的过程中其实已经重复过好几回了。

真正让一项技术扩散开的,往往不是最强的那个版本,而是第一个足够小、足够便宜、能被拿来试一试的版本。最后,如果说世界模型一直在尝试把AI装进一个可以无限延展的世界里。

那么现在,当门槛被打下去之后,这个世界终于开始装得进普通人的显卡了。官网: /ai-market-guide/ 模型: /ai-market-guide/ 代码: /ai-market-guide/ 论文: /ai-market-guide/ 版权所有,未经授权不得以任何形式转载及使用,违者必究。

返回 AI 市场导读

来源:qbitai.com