2026年最佳开源语音识别模型对比:WER、语言、延迟与许可证全解析
2026年开源语音识别已不再是Whisper一家独大。本文对比Cohere Transcribe、IBM Granite Speech 4.1、ARK-ASR等16款模型在词错误率、语言覆盖、流式延迟和许可证上的差异,并揭示排行榜数字不可直接相减的陷阱,帮你选出最适合实际场景的模型。
一句话看懂
开源语音识别在2026年已从Whisper垄断走向多强争霸,Cohere、IBM、ARK等模型WER差距不到1%,选型关键从排名转向许可证、语言覆盖和吞吐量。
详细发生了什么
过去一年,开源语音识别(ASR)格局彻底改变。2026年3月,Cohere发布Transcribe 2B模型(Apache 2.0),以5.42%平均词错误率登顶Hugging Face Open ASR排行榜;五周后,IBM Granite Speech 4.1 2B以5.33%超越。随后ARK-ASR-3B和MOSS-Transcribe-preview-2B也交出更低数字。目前排行榜顶部差距不到1个WER点,排名已不再是决定性因素。
但排行榜数字存在陷阱:各模型测试集不完全一致。Cohere的5.42%基于8个英文测试集(含TED-LIUM),而ARK-ASR-3B的5.04%仅基于7个(不含TED-LIUM)。若统一到相同7个集,Cohere变为5.84%,IBM变为5.65%,ARK领先幅度反而更大。此外,MOSS-Transcribe明确在排行榜训练集上进行了强化学习微调,分数反映的是benchmark而非真实能力。Appen提供的私有测试集(含澳大利亚、加拿大、印度、美国口音)重新排序后,zoom/scribe_v1从第4升至第1。
中文圈视角
对中文用户而言,Qwen3-ASR-1.7B(Apache 2.0)是首选:覆盖52种语言和方言,包括30种语言加22种中文方言,WER 5.76%,且附带完整推理工具包和11种语言的强制对齐模型。它直接对标Whisper large-v3的中文表现,但许可证更友好(Apache 2.0 vs MIT),且针对中文区域语音做了专门优化。
国内用户需注意:Cohere Transcribe虽为Apache 2.0,但仓库需填写联系信息才能访问;Whisper large-v3仍是MIT许可证,生态最成熟(whisper.cpp、faster-whisper等)。对于需要流式处理的场景,Voxtral Realtime和Kyutai STT支持低延迟,但中文支持有限。Meta的Omnilingual ASR覆盖1600+语言,但中文WER未公布,更适合极端低资源语言场景。
监管方面:数据出境问题需关注,尤其使用Cohere或IBM模型时,音频数据可能传输至境外服务器。国产替代方案如阿里通义千问ASR、百度飞桨PaddleSpeech可考虑,但本文未涉及。
几条值得记住的细节
- 排行榜数字不可直接相减:各模型测试集不同,Cohere 5.42%和ARK 5.04%并非同一基准,统一后ARK领先更大。
- Cohere Transcribe:2B参数,Apache 2.0,14种语言,下载超62万次,支持transformers、vLLM、Apple Silicon等,但无自动语言检测、时间戳和说话人分离。
- IBM Granite Speech 4.1 2B:6种语言ASR+双向语音翻译,支持关键词列表偏置、标点和大小写(含德语名词大写),RTFx 231.29。
- Qwen3-ASR-1.7B:覆盖52种语言(含22种中文方言),Apache 2.0,附带强制对齐模型,中文场景首选。
- Parakeet TDT 0.6B v3:吞吐量王者,RTFx 3332.74,25种欧洲语言,WER 6.32%,比Granite 4.1 2B快约14倍。
一句话总结
选ASR模型别再只看排行榜排名,根据你的语言需求、吞吐量要求和许可证偏好,从Cohere、IBM、Qwen或Parakeet中挑最合适的。