🎙️ AI · 语音识别 · 大模型
一、从逐字转写到语义理解,ASR迎来范式升级🔥 腾讯混元将大模型语义理解首次深度融合语音识别链路,让AI不仅"听清"更"听懂",多语种词错误率压至3%区间。
8月4日,腾讯混元正式发布新一代语音识别模型HyASR3.0preview。与此前仅依赖声学特征做机械逐字转写的传统ASR不同,该模型基于最新一代大语言模型Hy3的语言理解能力,将高精度语音识别与深度语义理解融合,能在复杂真实环境中给出准确、连贯的转写结果,实现从"逐字转写、单点优化"到"理解语境、兼容场景、一键直出"的跨越。
简单来说,以前的语音识别像一台只听声的录音机,现在HyASR3.0preview更像一个能边听边思考的翻译官。它不再拘泥于单字单句的声学匹配,而是结合上下文理解说话人的真实意图。遇到"期中考试"与"期终考试"这类同音歧义,模型能自动依据语境选出正确用词,大幅减少人工校对工作量。
二、3%词错误率领跑行业,覆盖十大方言区在开源评测集中,HyASR3.0preview的多语种词错误率(WER)控制在了3%左右:中文普通话WER 3.34%、英语WER 2.62%、粤语WER 3.12%,整体领先竞品。在自建评测集的通用识别、方言识别、上下文理解及高噪、耳语等复杂声学场景中,WER同样保持较低水平。
更关键的是,模型覆盖了粤语、吴语等十大方言片区及二十余个二级小片区,支持普通话、英语及中英文混说自然切换。这意味着一个川渝带货主播用方言口播、语速飞快还夹杂品牌英语词,模型照样能精准转写——实测方言WER低至3%区间,同类场景错字量比传统ASR降低了一半以上。
三、MoE架构+数千万小时训练,腾讯元宝已首发体验技术层面,HyASR3.0preview采用兼顾效率与性能的MoE混合专家架构,基座升级至Hy3,语音侧自研无监督语音Encoder,通过数千万小时级多来源语音数据联合训练,并辅以多阶段SFT与强化学习优化。模型还支持热词注入增强,企业可快速定制品牌名、产品名及行业术语识别,降低业务接入成本。
目前该模型已上线腾讯云并提供API服务,腾讯元宝App已完成首发接入,用户长按说话即可免费体验方言识别、上下文纠错与复杂环境稳定转写等能力,WorkBuddy等产品也在陆续接入中。语音识别不再是逐字反馈的哑巴工具,而是真正能听懂语境的生产力入口。
综合央广网、中关村在线、网易科技、深圳市人工智能产业协会报道 | 2026年8月11日