NVIDIA 发布 Audex 统一音频文本大模型:保留文本智能的 MoE 模型,支持语音识别、翻译与音频生成
NVIDIA 推出 Audex(Nemotron-Labs-Audex-30B-A3B),一个统一处理音频理解、语音识别、翻译、TTS 和音频生成的 MoE 大模型。它基于 Nemotron-Cascade-2 骨干,在文本基准上几乎无退化,同时支持 1M token 上下文。本文详解其设计、训练策略、性能对比及中文用户的实际应用场景。
一句话看懂
NVIDIA 发布 Audex,一个 30B 参数的 MoE 模型,统一处理音频输入输出,文本能力几乎不降,支持 1M 上下文,但仅限非商业使用。
详细发生了什么
NVIDIA 研究团队发布了 Audex(全称 Nemotron-Labs-Audex-30B-A3B),这是一个统一的音频-文本大语言模型。它能够理解和生成音频与语音,同时保留其骨干模型 Nemotron-Cascade-2-30B-A3B 的文本智能。模型采用 Mixture-of-Experts(MoE)架构,总参数量 30B,每个 token 激活 3B 参数。骨干是混合 Mamba-Transformer,52 层,128 个可路由专家,每 token 激活 6 个。
设计上,音频输入被编码并投影到文本嵌入空间,文本 token 和量化音频 token 在生成时统一处理。没有 thinker-talker 分离或级联模型堆叠,因此可以运行在标准 LLM 栈上(Megatron-LM 训练,vLLM 推理)。支持 instruct 模式和 thinking 模式,上下文长度达 1M token。
训练采用多阶段 SFT 课程:文本 SFT → 音频 warmup → 音频生成 → 音频理解。音频 warmup 阶段冻结文本 token 嵌入,避免文本质量下降。之后应用纯文本 Cascade RL 和多领域在线蒸馏(MOPD),音频任务无退化,文本分数反而提升。数据混合包含 157.4B 音频 token 和 320.5B 文本 token,覆盖 ASR、AST、TTS、文本到音频和音频理解。
性能方面,文本基准与骨干几乎一致:MMLU-Redux 86.4(骨干 86.3),IMO AnswerBench 81.1(骨干 79.3)。语音识别在 OpenASR 上平均词错误率 6.82,领先 Step-Audio-R1.1-33B 和 Qwen3-Omni-30B-A3B-Thinking。音频理解在 MMAU 上领先,但在 MMAR 和 MMSU 上落后。Audex 是少数能生成通用音频(非语音)的开源模型。
中文圈视角
Audex 对中文用户有几点值得关注:
-
可用性与平替:模型权重以非商业许可证(NVIDIA OneWay Noncommercial License)发布,商业使用受限。国内用户需要梯子访问 Hugging Face 下载。平替方面,国内有阿里开源的 Qwen3-Omni(30B-A3B),但文本推理能力有较大退化,且不支持通用音频生成。智谱的 GLM-4V 系列支持视觉,但音频能力较弱。
-
中文场景应用:Audex 支持多语言语音识别和翻译,对中文语音识别(ASR)和语音翻译(AST)场景有直接价值。例如,跨国会议中实时转录中文并翻译成英文。但需注意,模型训练数据中中文占比未知,实际中文效果需测试。
-
监管与合规:非商业许可证意味着国内企业不能直接用于商业产品。数据出境问题:模型权重需从海外下载,可能涉及数据合规审查。国内用户可关注 ModelScope 上是否有镜像。
-
盲点:多数中文评测聚焦文本和视觉,音频多模态模型评测较少。Audex 的 1M 上下文对长音频处理(如播客、会议记录)是亮点,但中文社区对此讨论不足。
几条值得记住的细节
- Audex 总参数 30B,每 token 激活 3B,采用 MoE 架构。
- 上下文长度达 1M token,支持长音频输入。
- 语音输出使用 X-Codec2,50 tokens/秒;非语音音频使用 X-Codec,200 tokens/秒。
- 文本基准几乎无退化:MMLU-Redux 86.4 vs 骨干 86.3。
- 许可证为 NVIDIA OneWay Noncommercial License,禁止商业使用。
一句话总结
Audex 是当前最强的开源统一音频文本模型之一,但非商业许可证限制了中文圈的商业应用,个人开发者可免费用于研究和实验。