蚂蚁灵波开源1.3B轻量版世界模型:单卡即可实现实时交互生成

2026/09/10 15:44阅读量 2

蚂蚁灵波(RobbyAnt)发布LingBot-World 2.0的1.3B轻量版,专为消费级单卡GPU设计,支持本地实时世界生成。该模型通过因果预训练、MoBA注意力机制及一致性蒸馏等技术,解决了长时生成中的漂移与画质退化问题,实现了小时级持续生成与稳定场景连贯性。此举大幅降低了世界模型的部署门槛,使其能在普通硬件上运行。

事件概述

蚂蚁灵波(RobbyAnt)于近期开源了 LingBot-World 2.0 的轻量版模型,参数量仅为 1.3B。这是首个面向消费级单卡 GPU 设计、可在本地实现实时世界生成的开源模型。此前,其主模型 LingBot-World 2.0(14B)已于今年7月开源,具备小时级持续生成能力。

核心技术与突破

从 14B 缩减至 1.3B 并非简单的模型裁剪,而是基于完整训练链路自然产生的结果。团队主要采用了以下关键技术路径:

  • 因果预训练(Causal Pretrain):构建基础底座,确保模型在生成当前状态时仅依赖过去视觉信息和用户输入,避免“窥视”未来信息,从而保证逻辑因果性。
  • MoBA 注意力机制:引入 Mixture of Bidirectional and Autoregressive Attention Mask,在 Teacher Forcing 训练中增加双向注意力正则化,缓解长上下文下的过拟合和视觉质量退化问题。
  • 双重蒸馏策略
    • 一致性蒸馏(Consistency Distillation):将多步去噪轨迹压缩为少数几步,提升推理速度。
    • 分布匹配蒸馏(DMD):让 Student 模型在自身的长时自回归轨迹上进行训练,提前适应实际运行状态,减少累计漂移。

性能表现与应用场景

  • 实时交互:支持第一人称射击、第三人称探索等多种视角,角色移动、视角转动及环境交互(如爆炸、火焰反馈)均能实时响应。
  • 长时稳定性:在纹理、几何结构和场景连贯性上保持较高水平,能够维持长时间的场景展开而不出现严重变形或模糊。
  • 低算力需求:无需高性能集群,普通消费级显卡即可驱动,显著降低了世界模型的使用门槛。

行业意义

此次开源标志着世界模型技术从“云端演示”走向“本地部署”。通过开放上游模型(Causal Pretrain Backbone 和双向 Teacher),蚂蚁灵波旨在降低社区二次开发门槛,推动后训练、蒸馏、压缩及垂直场景适配的发展。世界模型的下半场竞争焦点将从单纯的生成质量转向普惠性与可访问性,使该技术真正进入普通用户的硬件环境中。

资源链接

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。