微软发布MAI-Transcribe-1.5语音转文字模型:43语言支持、2.4%词错误率、1小时音频15秒内转录
微软AI推出MAI-Transcribe-1.5语音转文字模型,支持43种语言,在Artificial Analysis榜单上达到2.4%词错误率,1小时音频转录仅需15秒。新增关键词偏置功能,可降低30%词错误率。已在Azure AI Foundry上线。本文详解其性能、中文场景适用性及与国产模型的对比。
一句话看懂
微软发布第二代语音转文字模型MAI-Transcribe-1.5,支持43种语言,1小时音频15秒内转录完成,新增关键词偏置功能,已在Azure AI Foundry上线。
详细发生了什么
微软AI于上周发布MAI-Transcribe-1.5,这是其自研语音转文字(ASR)模型的第二代。该模型支持43种语言,覆盖多种口音和嘈杂环境,定位为生产级转录工具。
在准确率方面,MAI-Transcribe-1.5在FLEURS多语言转录基准上达到微软声称的“最佳”词错误率(WER),在Artificial Analysis公开榜单上WER为2.4%,排名第三。语言覆盖从第一代的25种扩展到43种,新增18种语言,包括10种南亚语言(如孟加拉语、泰米尔语、泰卢固语)和8种欧洲语言(如乌克兰语、希腊语、加泰罗尼亚语)。
速度是亮点:该模型在Artificial Analysis的准确率×速度综合排名中领先。处理1小时音频仅需不到15秒,比Gemini 3.1、Scribe v2和GPT-4o-Transcribe等模型快5倍,相比前代MAI-Transcribe-1长音频推理速度提升5.7倍。
关键新功能是关键词偏置(entity biasing):用户可提供最多200个领域特定关键词(如人名、产品名、医学术语),模型会优先识别这些词,但不会强制匹配,而是结合上下文判断。微软称该功能在FLEURS上降低30% WER。例如,无偏置时“Shaun”可能被识别为“Sean”,添加关键词后即可正确转录。
MAI-Transcribe-1.5已集成到Copilot、Teams、GitHub和Dynamics 365 Contact Centre,并通过Azure AI Foundry提供通用访问。
中文圈视角
对中文用户来说,MAI-Transcribe-1.5目前不支持中文,这是一个明显缺口。微软的43种语言中包括日语、韩语等东亚语言,但未提及中文(普通话/粤语)。这意味着国内用户无法直接使用该模型进行中文语音转文字,需要等待后续版本或寻找替代方案。
国产替代方面,百度飞桨(PaddleSpeech)、阿里通义听悟、科大讯飞等已在中文ASR领域深耕多年,支持方言、专业术语,且价格更低。例如,讯飞开放平台提供免费API额度,中文WER可低至2%左右。此外,DeepSeek、Kimi等国产大模型也具备语音输入能力,但专业ASR性能仍需验证。
对英文转录需求(如国际会议、英文播客、学术讲座),MAI-Transcribe-1.5的速度和关键词偏置功能很有价值。国内用户可通过Azure国际版访问,但需注意数据出境合规问题——音频数据可能传输至海外服务器,涉及个人信息保护法要求。
一个未被广泛讨论的盲点:关键词偏置功能对中文企业用户同样重要,但微软未提供中文关键词支持。如果未来加入中文,将直接冲击国内ASR市场,尤其是医疗、法律等专业领域。
几条值得记住的细节
- 词错误率(WER):在Artificial Analysis榜单上为2.4%,排名第三,前两名未公开。
- 速度:1小时音频转录时间低于15秒,比同类模型快5倍。
- 关键词偏置:支持最多200个自定义关键词,可降低30% WER。
- 语言覆盖:43种语言,不含中文;新增18种语言,包括南亚和欧洲语言。
- 可用性:已在Azure AI Foundry上线,集成于Copilot、Teams等产品。
- 限制:不支持说话人分离(diarization),无原生流式API。
一句话总结
MAI-Transcribe-1.5在英文ASR上速度领先,但缺少中文支持,国内用户需关注国产替代或等待后续版本。