8月4日,腾讯混元正式发布新一代语音识别模型Hy ASR 3.0 preview。基于最新一代大语言模型Hy3的语言理解能力,该模型将高精度语音识别与深度语义理解融合,在通用识别、上下文感知、多场景鲁棒性及方言覆盖等维度实现全面提升,从传统的“逐字转写”演进为“理解语境、兼容场景、一键直出”。
评测表现:多语种词错误率控制在3%左右
Hy ASR 3.0 preview在多个开源评测集和自建评测集上表现领先。开源评测集数据显示,该模型在多语种的词错误率(WER,即Word Error Rate,数值越低代表识别越准确)上都控制在3%左右,其中中文普通话WER为3.34%,英语为2.62%,粤语为3.12%,整体领先于同类竞品。
在自建评测集上,Hy ASR 3.0 preview在通用识别、方言识别、上下文理解、专词理解以及高噪、耳语等复杂声学场景测试中,同样保持较低词错误率。
能力升级:四类核心提升
从用户使用角度,Hy ASR 3.0 preview重点提升了四类能力:
通用识别更准确。提升通用语音、方言、中英混说等场景下的识别准确性,进一步减少错字、漏字及长音频中的错误累积。
更能理解用户意图。结合上下文精准捕捉用户语境,智能纠错同音词,消除语义歧义。例如,“期中考试”和“终考试”、“致癌”和“治癌”这类同音词,单靠声学信号难以区分,但结合上下文语义判断就能准确识别。
更容易适配专业场景。支持热词注入增强,帮助模型快速识别品牌名称、人名及行业术语,降低业务接入和持续维护成本。
复杂环境下更稳定。面向高噪、耳语、悄悄话等多种声学场景进行专项优化,在工厂车间、地铁站、咖啡厅等复杂环境下依然保持稳定识别表现。
技术架构:三重驱动实现能力跃升
Hy ASR 3.0 preview的能力提升并非来自单一模块,而是模型架构、数据规模与后训练优化共同作用的结果。
架构层面,模型采用兼顾效率与性能的MoE架构,基座模型升级为Hy3。在语音侧,团队自研了无监督语音Encoder,通过数千万小时级无监督语音数据训练,使其能够从复杂音频中提取高质量的声学表征——Encoder负责“听得好”,Hy3负责“理解对”。
数据层面,团队对语音Encoder和大语言模型进行联合训练,引入数千万小时级、多来源的语音数据,覆盖多种方言、口音和声学环境,并通过多阶段能力注入,逐步获得上下文感知、复杂场景适应和方言识别等能力。针对方言识别,SFT数据体系覆盖了10大方言片区和20余个二级小片区。
后训练层面,团队构建了高质量的SFT方案,覆盖上下文理解、专业名词、不同声学环境和多样人群语音,并进一步引入多阶段强化学习,分别针对通用转写准确性、上下文能力和复杂长尾场景进行优化,降低复杂声学环境中的误识别和漏识别问题。
上线进展:腾讯云与元宝同步开放
目前Hy ASR 3.0 preview已上线腾讯云官网,对外提供API服务,可广泛应用于智能客服、内容理解、语音搜索等场景。
腾讯旗下AI助手“元宝”深度参与共研并已完成首发上线。用户打开元宝按住说话,即可体验方言识别、上下文智能纠错与复杂环境稳定转写等能力提升,相关功能向用户免费开放。此外,WorkBuddy等办公产品也在陆续接入中。
从“逐字转写”到“理解语境”,Hy ASR 3.0 preview让语音识别不再只是“听清”每个字,而是在理解用户真实意图后给出更准确的文字结果。这一技术演进将为多场景语音交互体验带来切实提升。