阶跃发布 StepAudio 3 系列:五款语音模型登顶 Artificial Analysis 全球榜单

2026/09/15 17:50阅读量 2

9月15日,阶跃星辰发布新一代语音大模型 StepAudio 3 系列,涵盖实时交互、识别、生成及音乐创作五大场景。多款核心模型在权威评测机构 Artificial Analysis 的榜单中位列全球第一,标志着该系列在语音理解、推理与全栈能力上的突破。目前,StepAudio 3 系列五款模型均已上线阶跃星辰开放平台。

事件概述

9月15日,阶跃星辰(StepFun)正式发布新一代语音大模型 StepAudio 3 系列。该系列一次性推出五款模型:StepAudio 3 Realtime(实时交互)、StepAudio 3 ASR(语音识别)、StepAudio 3 TTS(语音合成)、StepAudio 3 Gen(音频生成)和 StepAudio 3 Music(音乐创作)。这一发布标志着语音大模型从单一的“听”或“说”单项能力,向覆盖理解、推理、交互和内容创作的全栈能力演进。

核心信息与性能表现

根据第三方权威 AI 模型评测机构 Artificial Analysis 的数据,StepAudio 3 系列中的多款模型在全球榜单中取得优异成绩,具体表现如下:

  • StepAudio 3 Realtime(实时语音交互)

    • 榜单排名:在 Artificial Analysis Conversational Dynamics(对话动态)榜单中以 98.9% 的综合得分排名 全球第一。在 Speech Reasoning(语音推理)榜单中也位列 全球第一
    • 技术特性:支持原生全双工对话,能够判断回应时机,处理临时打断和连续反馈。具备语音推理和任务执行能力,可同时理解语义、语气、情绪及环境声音。支持 Tool Call 和长任务异步执行,确保在任务运行期间不打断当前对话。
  • StepAudio 3 ASR(语音识别)

    • 榜单排名:在 Artificial Analysis 非流式语音识别准确性榜单中,词错误率(WER)为 1.7%,并列 全球第一
    • 技术特性:结合高精度识别与大语言模型的上下文理解能力,优化了对专业术语、人名、地名、方言及复杂上下文的理解。针对低声、快速语音、含糊连读及背景音乐等复杂输入场景进行了专项优化,支持中文、英文、中英混说等多类场景。
  • StepAudio 3 TTS(真人级语音生成)

    • 技术特性:不仅生成自然的音色、语调、节奏和情绪,还能模拟笑声、迟疑、重复、改口等真实交流中的副语言表现。采用流式生成架构,实现生成与播放同步,满足实时应用需求。
  • StepAudio 3 Gen(综合音频生成)

    • 技术特性:整合人声、音效、环境声和背景音乐生成环节。用户可通过自然语言描述角色、场景和剧情,一次生成包含多种声音元素的完整音频,并精确控制音色、情绪及声音出现的时间顺序。适用于影视、动画、游戏、广播剧等内容生产。
  • StepAudio 3 Music(音乐创作)

    • 技术特性:支持歌曲创作、清唱配乐、翻唱及基于 ABC 记谱法的多轮交互创作。允许用户通过歌词、清唱或参考歌曲与模型协作完成编曲和作品迭代,深入参与实际音乐生产流程。

值得关注

StepAudio 3 系列的发布展示了语音大模型在实时性理解深度创作广度上的显著进步。特别是 Realtime 模型在保持低延迟的同时引入推理和任务执行能力,以及 ASR 模型在复杂噪声环境下的高准确率,体现了其在工业级应用场景中的竞争力。目前,所有五款模型均已上线阶跃星辰开放平台供开发者使用。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。