PixVerse R2发布:爱诗科技构建实时世界模型“全科生”架构

2026/09/23 14:08阅读量 5

爱诗科技发布新一代实时世界模型PixVerse R2,通过Omni Causal AR与Real-Time Acceleration双层架构,成功突破实时性与通用能力难以兼顾的行业瓶颈。该模型将视觉、音频、动作等多模态信号统一纳入因果自回归框架,实现了高保真画面的毫秒级实时生成与长程状态记忆。这一技术路径为互动娱乐、具身智能及虚拟交互等场景提供了新的数字世界底座。

事件概述

爱诗科技(PixVerse)正式发布新一代实时世界模型 PixVerse R2。该模型旨在解决实时世界模型长期面临的“能力越强,实时越难守”的工程难题,通过统一的扩展性框架,实现了在保持高实时性的同时,大幅提升世界的通用理解、多模态控制及长程一致性能力。

核心技术与架构创新

1. 突破传统Scaling瓶颈
传统LLM依赖离散符号系统实现稳定的Scaling增长,而视频/图像作为连续、高维且冗余的信息形态,缺乏统一的紧凑表征体系。此外,实时计算预算(毫秒级窗口)与模型容量(需理解复杂物理关系)之间存在天然冲突。R2通过重构投入产出逻辑,不再单纯依赖参数规模扩大,而是建立了一套可持续扩展的协同增长体系。

2. Omni Causal AR:统一因果建模框架

  • 多模态统一:将短视频、长视频、多模态参考、音频和Action控制信号统一进入同一套因果自回归框架。
  • 动态适配:通过动态Chunk适配不同时间尺度,利用Hybrid Teacher/Diffusion Forcing、多时间尺度记忆和Error Bank机制,解决长程生成中的误差累积、角色漂移和状态断裂问题。
  • 协同增长维度:将Scaling拆解为模型规模、数据分布、任务迁移、控制信号和时间尺度五个维度,新增资源可转化为整体世界建模能力的复利增长。

3. Real-Time Acceleration:实时加速层

  • 先造大脑,再给加速器:采用“能力上限”与“实时效率”分离的设计思路。首先通过持续预训练夯实Omni Causal AR的基础能力(质量、长程状态、因果逻辑),随后将其蒸馏至实时加速层。
  • 性能表现:确保在毫秒级延迟下,依然能沿用底层的世界理解逻辑,实现音画同步、边生成边响应的丝滑体验。

应用场景与演示效果

  • 互动影游与DIY剧情:用户可通过Prompt实时改写剧情走向(如输入魔法指令改变战斗画面),世界能够“记住”前后状态并合理演化。
  • 实时数字人与探险:支持WASD视角控制及基于文本的角色动作控制,无明显卡顿,具备强在场感。
  • 跨场景泛化:从赛博世界到奥德赛草原风格,模型展现出较强的跨场景适应能力和画面一致性。

行业影响

PixVerse R2的技术路线表明,实时世界模型正从单一的画质或时长优化,转向对“世界状态空间”本身的建模。这种能够持续理解环境、维持状态并根据外部输入实时生成的底层能力,有望成为内容生产、具身智能、虚拟人及游戏实时渲染的共同底座,推动互动娱乐进入“内容随用户行为动态展开”的新阶段。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。