腾讯混元正式推出新一代语音识别模型 Hy ASR3.0preview。基于最新一代大语言模型 Hy3 的语言理解能力,以及融合了高精度语音识别与深度语义理解能力,实现了语音识别能力的全面升级。
根据介绍,Hy ASR3.0preview 目标在于:让语音识别不再只是听清,而是真正听懂。通过先理解你的语境和意图,再把准确的文字直接给到你。从“逐字转写、单点优化”演进为“理解语境、兼容场景、一键直出”。
Hy ASR 3.0 preview 不要求标准普通话,方言识别覆盖粤语、吴语等 10 大方言片区和 20 余个二级小片区。在开源评测集中,Hy ASR 3.0 preview 在多语种的WER(Word Error Rate, 词错误率)上控制在 3% 左右,其中中文普通话 WER 3.34%、英语 WER 2.62%、粤语 WER 3.12%。
结合 Hy3 的语言理解能力,结合上下文 Context 精准捕捉用户语境,Hy ASR 3.0 preview 可消除歧义,智能纠错同音词。在转写难度较大的会议纪要、访谈转写等长音频场景中却尤为有优势。
技术层面上,Hy ASR3.0preview 在模型架构层面:采用兼顾效率与性能的MoE架构,基座模型升级至Hy3。在语音侧,混元团队自研了无监督语音Encoder,通过数千万小时级的无监督语音数据训练,使其能够从各种复杂音频中提取高质量的声学表征。Encoder负责听得好,Hy3负责理解对。
数据Scaling层面:团队对语音 Encoder 和大语言模型进行联合训练,引入数千万小时级、多来源的语音数据,持续增强模型的语音建模与理解能力。并通过多阶段能力注入,使其具备上下文感知、复杂场景适应和方言识别等能力。
后训练优化上:围绕通用识别、上下文理解和复杂场景鲁棒性,构建了高质量的 SFT recipe,覆盖上下文Context、专业名词、不同声学环境以及多样人群语音等。团队还进一步引入多阶段强化学习,分别针对通用转写准确性、Any-context 上下文能力和复杂长尾场景进行优化,降低模型在复杂声学环境中的误识别和漏识别问题。

目前,Hy ASR3.0preview已上线腾讯云官网对外开放API,可广泛应用于智能客服、内容理解、语音搜索等领域。腾讯旗下AI助手“元宝”已完成首发接入,用户可通过语音输入体验方言识别、上下文智能纠错、复杂环境稳定转写等功能,相关能力免费开放;WorkBuddy等产品也在陆续接入中。