AI 快讯 编译自 simon_willison #模型发布#工具评测#视频生成

MiniMax-H3 视频生成模型登陆 Apple Silicon:MLX 移植版实测,115GB 模型本地跑通

MiniMax 发布全模态生成系统 MiniMax-H3,支持文本、图像、音频和视频输入,可生成带音频的 15 秒视频。开发者 PipeNetwork 将其移植到 MLX,可在 Apple Silicon 上本地运行。本文实测 M5 Max MacBook Pro 运行效果,下载 115GB 模型,生成耗时 45 分钟,并分析对中文用户的实用价值与替代方案。

编译发布 2026/08/04 原文发布 2026/08/04

一句话看懂

MiniMax 发布全模态生成系统 MiniMax-H3,支持文本、图像、音频和视频输入,可生成带音频的 15 秒视频;开发者 PipeNetwork 将其移植到 MLX,让 Apple Silicon 用户本地运行。

详细发生了什么

MiniMax 两天前在 Hugging Face 上发布了 MiniMax-H3,官方称其为“通用全模态生成系统”。实际能力是接受文本、图像、音频和视频输入,并生成最长 15 秒、包含音频的视频片段。

开发者 PipeNetwork 发布了一个 Python 包,将 MiniMax-H3 移植到 MLX 框架,专门用于 Apple Silicon 芯片。Simon Willison 在 M5 Max MacBook Pro 上实测,克隆仓库后通过命令行运行。他下载了约 115 GB 的模型文件,生成一个视频片段耗时不到 45 分钟。

测试提示词为“一只彩虹色的臭鼬在超市里跳过一根长满苔藓的原木”,生成的视频效果令人印象深刻,但因为没有提供音频提示,生成的音频是类似语音的乱码。Simon 表示视频本身质量不错,但音频部分需要进一步优化。

整个流程依赖 Hugging Face 下载模型,使用 uv 工具管理依赖,命令相对简单,但需要足够的磁盘空间和耐心。

中文圈视角

对中文用户来说,这个 MLX 移植版有几个关键点值得关注。

首先,MiniMax-H3 是国产模型,但 Hugging Face 在国内访问不稳定,下载 115 GB 模型需要梯子或镜像站。如果网络条件不允许,可以考虑使用 ModelScope(魔搭)上的替代版本,不过目前尚未看到官方或第三方上传。

其次,Apple Silicon 用户(M 系列芯片)可以直接本地运行,无需 GPU 服务器,这对个人创作者和中小团队是巨大便利。但 115 GB 的模型体积和 45 分钟的单次生成时间,意味着它更适合离线批量处理,而不是实时交互。

对比国产同类产品,如可灵、即梦等云端视频生成服务,MiniMax-H3 的优势是本地部署、数据不出域,适合对隐私敏感的场景(如商业项目、医疗内容)。但劣势是硬件门槛高,普通用户可能更倾向使用云端 API。

另外,中文提示词的支持情况尚未明确,建议英文提示词为主。如果后续社区推出中文优化版本,可能会更贴近国内用户需求。

几条值得记住的细节

  • MiniMax-H3 支持文本、图像、音频、视频输入,输出最长 15 秒带音频的视频。
  • MLX 移植版由 PipeNetwork 开发,专为 Apple Silicon 优化,M 系列芯片均可尝试。
  • 模型文件约 115 GB,生成一个视频耗时约 45 分钟(M5 Max 实测)。
  • 运行命令依赖 uv 和 Hugging Face,需要预先下载两个模型仓库。
  • 音频生成质量目前不稳定,无音频提示时可能产生语音式乱码。

一句话总结

MiniMax-H3 的 MLX 移植让 Apple 用户本地跑视频生成,但 115GB 体积和 45 分钟耗时,更适合有硬件储备的创作者尝鲜。