生数科技发布 Vidu S2:实现 AI 视频「边看边改」,乔布斯数字人实测引关注
生数科技发布 Vidu S2 视频生成模型,突破传统离线生成限制,实现实时交互与编辑。该模型包含 Avatar(数字人)和 Editing(实时编辑)两大核心能力,支持 720p 高清输出及动作、服装、背景的即时修改。通过 SRF 训练技术与 Backbone-Refiner 架构,Vidu S2 解决了流式生成中的漂移问题,标志着 AI 视频从“一次性生成”向“持续交互过程”转变。
事件概述
生数科技(Shengshu Technology)正式发布 Vidu S2,这是一款面向实时操控领域的 AI 视频生成模型。与当前主流视频模型专注于提升时长和清晰度的离线生成赛道不同,Vidu S2 将战场转向了“边看边改”的实时交互领域,旨在让数字人互动更丰富、视频画面更具可编辑性。
核心功能与技术突破
1. 双核心能力模块
- S2-Avatar(实时交互模型):面向实时数字人互动,支持 720p 高清输出。具备增强的动作指令遵循能力,可通过语音或文本驱动高质量动作(如摆臂、扭身等)。用户可上传参考图创建数字人物,并在直播中实时输入指令完成持品互动、换装及换背景。
- S2-Editing(实时编辑模型):面向流动的视频画面,支持实时修改风格、服装、人物主体与背景。只需一张参考图即可对正在播放的视频流进行虚拟试穿、换背景、改风格和换角色操作,实现“拍摄即出片”。
2. 关键技术创新
- SRF(Self-Replay Forcing)训练技术:生数科技独创的技术,赋予模型“自我纠错的记忆”,使其能直面生成历史并修正误差,彻底解决长时间流式生成带来的画面崩溃与漂移问题。
- Backbone-Refiner 两阶段架构:
- 主干网络(Backbone):以极低延迟负责骨架运动、物理规律和镜头语言的实时推流。
- 精炼网络(Refiner):以异步流水线在毫秒级内完成 720P 高清细节重构、材质纹理与光影修复。
- 两者并行作业,在保证低延迟的同时维持高画质。
- VLM Agent 协调机制:基于视觉语言模型的中控调度系统,负责实时解析画面运动相位和空间状态,确保新元素介入符合惯性与光照物理规律。
实测案例与应用场景
1. “乔布斯”数字人互动测试
评测者利用 Vidu S2 创建了史蒂夫·乔布斯的数字人形象,并通过设定性格、表达方式及产品态度等描述,使其具备角色逻辑。测试显示,该数字人能结合人设对 iPhone Duo 做出符合角色的评价(如“价格让人犹豫”),并能执行复杂的全身舞蹈动作,展现了极高的动作连贯性和面部特征稳定性。
2. 实时换装与特效演示
- 虚拟试穿:上传服装参考图后,模型能实时生成多种穿搭效果,面料随肢体运动的物理形变逼真,且保持较高的动作流畅度。
- 背景与风格替换:支持杂乱背景实时清退及多美学质感迁移,透视对齐精准,无明显后期拼贴痕迹。
3. 潜在应用场景
- 直播带货:运营人员仅需上传商品白底图,数字人主播即可无缝换装或持品讲解,将单向广播变为即时响应式导购。
- 影视包装:替代传统依赖后期的风格化渲染,实现实时视频画面的美学质感呈现。
- 社交与娱乐:支持个性化交互会话,满足恋爱陪伴、游戏陪玩等实时在线交互需求。
行业影响与展望
Vidu S2 的出现被视为 AI 视频发展的分水岭,标志着内容生产从“生成结束”走向“世界继续”。分析认为,到 2026 年底,创作者将不再等待渲染队列,AI 系统将支持对画面本身的实时交互,广告形式也可能从“一条视频面对大众”转变为“为每个人定制专属视频”。
目前,包括 Adobe(MotionStream)、HeyGen(LiveAvatar)在内的厂商也在探索实时视频控制与数字人应用,但 Vidu S2 率先将实时空间视频的生成与编辑推向实用化,允许用户输入不断改变后续内容,并通过头显呈现立体深度,开启了“持续交互”与“空间体验”结合的新范式。
