Vivix发布首个实时交互多模态模型A1,统一流式架构实现消费级GPU实时推理

2026/07/25 11:21阅读量 3

Vivix(灵动时刻)正式发布实时交互多模态模型A1,采用统一流式架构,近30B激活参数,通过MJD蒸馏、原生NVFP4训推策略和VMI推理基础设施,在消费级GPU上实现实时视频生成,延迟平均0.6秒。该模型能持续聆听用户并实时响应,直接建模语音、动作、环境等多模态信号,而非传统流水线。同时发布W1模型支持用户介入改变剧情走向。

事件概述

Vivix(灵动时刻)正式发布其首个实时交互多模态基础模型A1,以及配套的W1模型。A1定位为全球首个在一套原生流式架构中统一多模态参考、实时交互和流式生成的模型,支持用户与虚拟角色进行类似视频通话的持续交互。

核心信息

模型架构与能力

  • A1采用统一流式架构,将多模态参考条件、实时交互信号和视频生成融合到同一链路中,通过因果时序建模和流式状态维护保证长期一致性和角色稳定性。
  • 直接建模语言语义、声学特征、非语言声音、环境事件、手势和动态视觉信号,而非传统ASR-LLM-TTS-Motion串联流水线,支持持续聆听和事件触发响应。
  • 模型近30B激活参数,采用8x8x4高质量压缩率的VAE。

性能与优化

  • 通过MJD(多维联合蒸馏)将视频扩散从8-Step压缩到2-Step推理,同时保持画质、动作表现和长期稳定性。
  • 原生NVFP4训推策略:训练阶段即对齐4-bit数值分布,在Blackwell GPU上实现接近无损的BV16基线质量,同时降低显存占用。
  • VMI(Vivix Model Infra)基础设施:Encoder与Decoder解耦独立弹性伸缩;P/D分离架构及KV Cache传输层优化;计算-通信-内存协同调度引擎,PCIe带宽利用率88%+;单卡吞吐超10000 video tokens/s。
  • 流式调度器响应新输入最短300ms,用户发出输入到画面首次可见反应平均延迟0.6秒。

模型产品

  • A1:实时交互多模态模型,支持角色开口、行动、转身、改变姿态,并与环境持续互动。
  • W1:允许用户随时介入改变人物选择和剧情走向。

值得关注

A1将部署门槛压至消费级GPU(如RTX系列)实时推理,在近似画质下推理效率提升近两个数量级。这标志着实时交互视频生成从概念验证进入可实际运行阶段。官方已开放内测申请(vivix.ai)。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。