人机互动的进化,Soul如何重新定义实时多模态交互丨WAIC2026

2026/07/20 13:04阅读量 5

Soul在WAIC 2026展示了其实时数字人及AI硬件B Soul,核心模型SoulX-FlashTalk实现0.87秒首帧视频输出延迟,接近真人对话节奏。公司正从社交平台升级为模型与应用一体化的AI生态公司,目前已拥有460万日活AI功能用户,约占整体日活40%。SoulX模型矩阵覆盖语音、情感、数字人等多模态能力,并计划2026年下半年面向B端输出一站式多模态交互能力,2027年启动海外市场拓展。

事件概述

Soul在WAIC 2026现场展示了实时数字人交互体验和首款AI硬件B Soul,核心自研大模型SoulX聚焦情绪感知与实时多模态交互。其数字人模型SoulX-FlashTalk实现了14B参数下0.87秒的首帧视频输出延迟,达到亚秒级,远超传统大模型驱动的2-5秒延迟,使得对话具有“活人感”——能自然插入回应、根据语气调整语调、在用户停顿犹豫时主动补话,并可被顺利打断后接续话题。

核心信息

  • 模型矩阵:SoulX系列已形成差异化互补模型,包括轻量化实时数字人SoulX-FlashHead(单卡RTX 4090实现96FPS流式推理,仅需6.4G显存)、高帧率低延时SoulX-FlashTalk(适配实时直播)、全身动作稳定在线SoulX-LiveAct(适配长期复杂场景)。
  • AI硬件B Soul:首款便携式AI硬件,集成SoulX的语音交互、情感表达和数字生命能力,用户可自定义角色名称、性别、关系和声音,角色接入记忆体后可记住交互内容。
  • 用户数据闭环:Soul App已有460万日常用户使用AI功能,约占整体日活40%,形成“模型—产品—用户—数据”闭环,持续迭代情绪感知能力。
  • 开源与生态:Soul AI团队已开源语音合成模型SoulX-Podcast(登顶HuggingFace TTS趋势榜,GitHub超3500星标)、歌声合成SoulX-Singer、全双工语音对话模块SoulX-Duplug、多人对话转录模型SoulX-Transcriber,以及实时数字人系列模型。
  • 商业化与拓展:2026年下半年计划面向国内企业推出多模态交互能力服务,覆盖电商AI直播、短视频制作、AI教育、NPC交互、AI客服等领域,并输出情绪感知与交互决策方案。预计2027年启动海外市场拓展,优先围绕语音生成、实时交互及内容演绎推出产品和服务。

值得关注

Soul的定位已从社交平台升级为模型与应用一体化的AI生态公司。其核心优势在于拥有真实社交场景驱动的数据闭环,而非单纯模型能力。460万日活AI用户意味着每天有大量真实交互数据用于模型迭代,这种从场景中长出的能力难以被外部复制。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。