阿里通义发布Fun-ASR1.5语音识别模型,支持30种语言及汉语七大方言

2026年04月20日

通义实验室悄悄把语音识别这事又往前推了一截。Fun-ASR 1.5版本刚上线,没搞发布会,也没堆参数宣传,但实际能力已经覆盖30种语言,汉语方言支持直接拉到七大方言体系粤语、闽南语、吴语、客家话、湘语、赣语、晋语,全部实测可用,不是“支持列表里有”,而是模型训练数据里真有对应语料、声学建模也做了针对性优化。

这背后不是简单加几个语种标签。过去一年,国内ASR赛道明显从“拼通用准确率”转向“拼场景落地深度”。讯飞在政务热线持续打磨带口音的普通话识别;腾讯云把粤语ASR嵌进大湾区银行远程核身流程;百度则在车载场景中强化低信噪比下的连续语流切分。通义这次没选单点突破,而是用一套统一架构承载多语种+多方言,靠的是底层建模方式的调整:放弃传统CTC+Attention混合结构,改用全Transformer时序建模,配合更细粒度的音素对齐策略,让模型在方言声调差异大、连读变调频繁的场景下仍能保持帧级稳定性。

技术细节上,Fun-ASR 1.5有几处关键变化:

1. 训练数据中新增超2万小时真实场景方言录音,包括菜市场讨价还价、社区老年活动中心闲聊、粤剧后台即兴对白等非标准语境;

2. 引入动态语速归一化模块,在语速波动达±40%的录音中仍能维持词边界识别准确率下降不超过1.2个百分点;

3. 支持热词实时注入响应时间压缩至300毫秒内,适用于会议记录、庭审转写等需即时修正专有名词的场景;

4. 模型推理显存占用比前代降低37%,可在8GB显存的边缘设备上完成整句流式识别;

5. 提供方言混合检测开关,当一段音频中出现粤语夹杂普通话或闽南语混搭英语时,系统可自动判定语种切换点并启用对应解码器。

行业应用端已有初步反馈。杭州某区街道办用该模型处理12345热线录音,对方言投诉类工单的关键词提取完整率从68%升至89%;深圳一家跨境电商客服中心接入后,粤语客户语音转文字的首次响应准确率提升至91.4%,人工复核工作量减少约四成。需要注意,这些案例均未使用定制微调,全部基于开源基础模型+少量本地热词配置实现。

对比国际同类产品,Fun-ASR 1.5在中文方言识别维度确实拉开差距。Whisper v3对粤语的WER(词错误率)为24.7%,而Fun-ASR 1.5在相同测试集上为15.3%;在闽南语新闻播报语料中,前者错误集中在连读音变部分,后者通过引入韵律边界预测分支,将该类错误降低近六成。不过,它在少数民族语言如维吾尔语、藏语上的覆盖尚未展开,当前30种语言以印欧语系和东亚语言为主。

部署层面,阿里开放了两种接入方式:

1. 全托管API服务,支持Webhook回调与批量文件异步处理;

2. 开源模型权重与推理代码,适配ONNX Runtime及vLLM框架,开发者可自行量化部署。

目前文档已同步更新,包含七大方言的典型发音对照表、常见误识别案例归因分析、以及针对不同信噪比环境的前端语音增强建议。以上是Fun-ASR 1.5的核心进展与实测表现,希望对你在语音识别方案选型或方言场景落地时有所帮助。

免责申明:本站部分作品是由网友自主投稿和发布、编辑整理上传,对此类作品本站仅提供交流,不为其版权负责。如果您发现网站上有侵犯您的版权,请与我们取得联系,我们会及时修改或删除。

相关

    叙述跨境独立站搭建
    嗨,想咨询什么业务?
    深色
    顶部