HelixWorld 1.0发布:世界模型首次实现24FPS画面与48kHz立体声实时同步生成
Noiz AI联合香港科技大学、清华大学、CMU、Google DeepMind等机构发布HelixWorld 1.0,这是首个支持24 FPS画面和48 kHz双声道音频实时生成的交互式音视频世界模型。模型采用原生Transformer架构统一生成声画,并对用户操作做出即时响应,模型权重和代码将在未来几周完全开源。
事件概述
Noiz AI联合香港科技大学、清华大学、CMU、Google DeepMind等机构的研究员,发布了实时可交互音视频世界模型HelixWorld 1.0。该模型只需输入一张图片和一句提示词,即可生成持续演进的交互世界,画面和声音会随用户操作实时变化。
核心能力
- 实时生成:支持24 FPS画面实时生成,同时输出48 kHz双声道音频。
- 统一生成:画面和声音由原生Transformer架构统一生成,从生成起始就绑定在一起,而非事后配音。
- 实时交互:用户的前进、转身等操作会同时作用于画面和声音,声场会随视角和位置变化,包括距离衰减、材质反射、方向定位等空间声学效果。
技术路线
HelixWorld的技术路径分为四步:
-
数据构建:团队同时从真实世界和游戏世界取材。真实世界数据以第一人称连续行走素材为主,保证声画天然对齐和真实感;游戏数据补充精确的空间关系(几何、材质、声源位置、遮挡规则等)。经清洗后获得百万量级训练片段。
-
联合生成:以音视频生成基座LTX2.3为起点,音频和视频保留各自latent表征,但进入同一套Transformer联合生成,让声画共同响应动作。
-
因果化改造:将双向预训练模型改造成只允许查看过去的因果模型,通过KV Cache复用历史信息,逐块自回归生成。训练时引入模型自生成历史,让模型学会带着误差持续生成。
-
推理加速:将轨迹蒸馏和DMD(分布匹配蒸馏)结合,把数十步去噪压到个位数,配合因果化后的KV Cache形成连续流水线,达到实时门槛。
开源计划
HelixWorld的模型权重和代码将在接下来几周完全开源,仓库地址:https://github.com/NoizAI/HelixWorld
团队组建于2025年底,成员来自Meta、Google、Dolby、清华等机构,开源项目累计超过5万GitHub Stars。创始人陈伟嘉(Vega)曾在Meta主导Yann LeCun团队ASR模型落地,首席科学家田泽越(Zeyue Tian)开源过AudioX、YuE、ChatMusician等工作。目前模型API已进入内测阶段。
值得关注
团队认为,HelixWorld的实时音视频交互只是第一步,下一步将朝着多智能体(Multi-Agent)、多人现场、超长时间一致性、世界自主进化等方向演进。
