生数科技发布Vidu S2:实现实时视频编辑与空间视频探索
2026/09/16 10:58阅读量 4
生数科技发布Vidu S2模型,推出S2-Editing和S2-Avatar两大核心能力,支持对正在播放的视频进行实时换装、换背景及风格迁移,并将数字人交互分辨率提升至720P。该模型还探索了实时空间视频生成与编辑,旨在通过VR头显提供沉浸式互动体验。技术层面采用Backbone-Refiner架构与Self-Replay Forcing策略,解决了流式生成中的偏差累积问题,实现了高画质下的低延迟实时交互。
事件概述
生数科技于2026年9月16日发布Vidu S2模型,标志着AI视频生成从“离线生成”向“实时交互”的进一步演进。相比两个月前发布的Vidu S1,S2在交互清晰度、动作控制精度及视频编辑灵活性上均有显著提升,并首次开放全量使用。
核心功能升级
1. S2-Editing:实时视频编辑
该模块允许用户对正在生成的视频流进行即时修改,主要包含四类能力:
- 实时换装:保持人物动作连贯性与面部一致性,服装形变自然(如袖口遮挡首饰等细节处理)。
- 背景替换:支持将主体无缝融入不同场景,透视与遮挡关系准确。
- 角色替换:可更换视频中的人物主体,甚至替换为非人类形象(如动物、财神爷等),并保持环境融合度。
- 风格迁移:实时改变视频整体画风(如二次元转赛博朋克),保持画面一致性。
2. S2-Avatar:实时交互数字人
- 分辨率提升:输出分辨率从540p提升至720P,面部与衣物细节更丰富。
- 动作控制增强:不仅能语音对话,还能执行大幅度肢体动作(跳舞、转身等),响应准确率高于S1。
- 动态参考图接入:互动过程中可随时输入参考图,指令数字人拿起指定物品或更换特定服饰。
3. 空间视频探索
- 支持将生成或编辑的视频转换为左右眼格式的空间视频,适配Apple Vision Pro等设备。
- 用户可通过头显摄像头捕捉真实物理世界作为“画布”,结合AI生成内容进行混合现实创作。
- 目前仍面临头显设备对分辨率和延迟的高要求挑战,团队正致力于优化以减少晕眩感和画面延迟。
技术实现路径
- 数据与标注优化:补充舞蹈、动画等多模态训练素材,重新设计基于事件边界的连续互动标注方式,明确动作起始、变化及结束状态。
- 流式训练策略:引入Self-Replay Forcing机制,通过因果回放让模型学会纠正前期偏差,确保后续片段生成的稳定性,解决接力生成中的误差累积问题。
- 双阶段架构:采用Backbone-Refiner结构,Backbone负责低分辨率下的主体结构与运动语义确定,Refiner负责高分辨率细节重建。通过异步流水线并行处理,保障720P输出下的帧率稳定。
- 时间戳对齐:重新设计位置编码,将参考图注入时间与视频时间戳对齐,确保编辑条件(如换装)在指定时间点平滑生效,维持光照与运动的连续性。
- 智能体监控:集成VLM Agent(视觉语言模型智能体),持续解析画面状态,跟踪用户指令执行情况,动态调整生成条件以匹配当前场景。
- 强化学习优化:双向阶段采用DPO优化画质与自然度;流式阶段采用Streaming NFT直接优化因果模型,提升指令遵循能力。
行业影响
Vidu S2的发布缩短了版本迭代周期(仅69天),展示了实时视频生成技术在直播互动、虚拟演出及创意内容制作中的应用潜力。其“边播边改”的能力降低了视频制作门槛,使观众能实时参与内容创作,推动了AI视频从单向生成向双向交互的转变。
