Kyutai 发布 MuScriptor:开源权重解码器 Transformer,实现多乐器音乐转录为 MIDI
Kyutai 与 Mirelo 联合推出 MuScriptor,一个开源权重的解码器 Transformer 模型,可将多乐器混音转录为 MIDI。本文详解其三阶段训练流程、基准测试表现及本地运行方法,并探讨对中文音乐创作者的实际意义。
一句话看懂
Kyutai 与 Mirelo 发布 MuScriptor,一个开源权重的解码器 Transformer,能将多乐器混音转录为 MIDI,训练数据含 170k 真实录音与 145 万合成 MIDI。
详细发生了什么
自动音乐转录(AMT)一直是个难题,尤其是多乐器混音。Kyutai 与 Mirelo 团队推出的 MuScriptor 试图填补这一空白。它是一个解码器-only Transformer,输入音频的 mel-spectrogram,然后自回归预测 MIDI 类 token(音高、时序、乐器),本质上是将转录任务转化为语言建模。
模型在 Hugging Face 上提供三个权重版本:small(103M)、medium(307M,默认)、large(1.4B)。推理代码采用 MIT 许可,权重为 CC BY-NC 4.0(限制商业使用)。
训练分为三阶段:
- 预训练:使用约 145 万 MIDI 文件(D_Synth),通过在线管道合成音频,并加入音高偏移、速度调整等增强。
- 微调:使用内部 17 万条真实录音(D_Real),总计超 11,000 小时,对齐标注通过音频-符号同步实现。
- 强化学习后训练:使用 300 条人工验证曲目(D_RL),采用类似 GRPO 的方法,奖励函数结合 onset、frame、offset 三个 F1 分数。
基准测试中,1.3B 模型在 D_Test 上达到 onset F1 60.4、multi F1 48.2,显著优于仅合成数据训练的基线。
中文圈视角
MuScriptor 对中文音乐创作者意味着什么?首先,它是开源权重模型,国内用户可通过 Hugging Face 下载(需梯子),但权重为 CC BY-NC 4.0,商业项目需谨慎。国内类似产品如字节跳动的 MusicGen、网易天音等,但 MuScriptor 专注多乐器转录,而非生成。对于编曲爱好者、音乐教育者,它可快速将录音转为 MIDI 进行二次编辑,降低入门门槛。不过,模型对中文流行音乐、民乐等风格的表现尚未有公开评测,且 1.4B 参数对本地硬件有一定要求(建议 16GB+ VRAM)。监管方面,模型不涉及数据出境,但输出 MIDI 文件本身不包含音频,合规风险较低。中文社区目前讨论较少,这是一个盲点——用户可尝试用中文流行歌曲测试其泛化能力。
几条值得记住的细节
- 模型提供三个权重:103M、307M(默认)、1.4B,推理代码 MIT 许可,权重 CC BY-NC 4.0。
- 训练数据包含 170k 真实录音(11,000+ 小时)和 145 万合成 MIDI。
- 强化学习阶段使用 300 条人工验证曲目,奖励 onset/frame/offset F1。
- 1.3B 模型在 D_Test 上 onset F1 60.4,multi F1 48.2。
- 支持 instrument conditioning,可指定关注特定乐器。
一句话总结
MuScriptor 让多乐器音乐转录变得可行,中文创作者可免费用于非商业项目,但需注意硬件门槛和许可限制。