腾讯混元发布Hy ASR 3.0 preview:让语音识别从转写走向上下文理解
2026/08/04 16:58阅读量 2
8月4日,腾讯混元发布新一代语音识别模型Hy ASR 3.0 preview。基于Hy3大模型与自研语音编码器,模型在通用识别、上下文理解、方言和复杂声学场景上实现提升,开源评测中普通话、英语、粤语WER分别为3.34%、2.62%、3.12%。目前已在腾讯云开放API,元宝首发接入并免费开放。
事件概述
8月4日,腾讯混元正式发布新一代语音识别模型 Hy ASR 3.0 preview。该模型基于最新一代大语言模型 Hy3 的语言理解能力,融合高精度语音识别与深度语义理解,从“逐字转写、单点优化”演进为“理解语境、兼容场景、一键直出”。
核心能力
- 通用识别更准确:提升通用语音、方言、中英混说等场景下的识别准确性,减少错字、漏字问题。
- 更能理解用户意图:结合上下文精准捕捉用户语境,智能纠错同音词,消除语义歧义。
- 更容易适配专业场景:支持热词注入增强,帮助模型快速识别品牌产品名称、人名及行业术语,降低业务接入和持续维护成本。
- 复杂环境下更稳定:针对高噪、耳语、悄悄话等多种声学场景进行专项优化,保持稳定表现。
评测表现
在开源评测集中,Hy ASR 3.0 preview 的多语种 WER 均控制在 3% 左右,其中中文普通话 WER 3.34%、英语 WER 2.62%、粤语 WER 3.12%,整体领先竞品。
在自建评测集上,模型在通用识别、方言识别、上下文理解、复杂声学场景(高噪、耳语)等评测中保持较低 WER,综合表现领先。
技术要点
- 采用兼顾效率与性能的 MoE 架构,基座模型升级为 Hy3,增强语言理解、上下文建模和语义推理能力。
- 语音侧自研无监督语音 Encoder,通过数千万小时级无监督语音数据训练,提取高质量声学表征,并与语音 Encoder 和大语言模型进行联合训练。
- 引入数千万小时级、多来源语音数据,覆盖多种方言、口音和声学环境,并通过高质量数据管线标注。
- 通过多阶段能力注入,逐步获得上下文感知、复杂场景适应和方言识别能力。
- SFT 数据体系覆盖 10 大方言片区和 20 余个二级小片区,并引入多阶段强化学习,针对通用转写准确性、上下文能力和复杂长尾场景进行优化,降低误识别和漏识别。
落地进展
Hy ASR 3.0 preview 已上线腾讯云,对外提供 API 服务,可广泛应用于智能客服、内容理解、语音搜索等场景。
元宝深度参与共研并完成首发上线,用户按住说话即可体验方言识别、上下文智能纠错与复杂环境稳定转写能力,目前免费开放;WorkBuddy 等产品也在陆续接入中。
体验地址:https://aistudio.tencent.com/visual;https://cloud.tencent.com/document/product/1093/135476
