PrismML 发布 Bonsai 27B:1-bit 和三元量化版 Qwen3.6-27B,可在笔记本和手机上运行
PrismML 推出 Bonsai 27B,基于 Qwen3.6-27B 的低比特量化版本,提供三元(1.71bpw,5.9GB)和 1-bit(1.125bpw,3.9GB)两种变体,均采用 Apache 2.0 许可。在 15 项基准测试中,三元版保留 FP16 性能的 94.6%,1-bit 版保留 89.5%,并支持 262K token 上下文。该模型可在 iPhone 17…
一句话看懂
PrismML 发布 Bonsai 27B,将 Qwen3.6-27B 压缩至 3.9GB(1-bit)或 5.9GB(三元),可在手机和笔记本上运行,性能保留 89.5%-94.6%。
详细发生了什么
PrismML 发布了 Bonsai 27B,这是 Qwen3.6-27B 的低比特量化版本,不是全新预训练模型。架构保持不变,提供两种变体,均采用 Apache 2.0 许可。
- 三元 Bonsai 27B:权重为 {-1, 0, +1},实际每权重 1.71 bits,理想大小 5.9GB。
- 1-bit Bonsai 27B:权重为 {-1, +1},每权重 1.125 bits,大小 3.9GB。
两者都是多模态模型,包含约 24.8B 语言权重、0.46B 视觉塔和 2.5B 嵌入/LM head。视觉塔以 4-bit HQQ 单独存储。上下文长度 262K tokens,因为 Qwen3.6-27B 约 75% 的注意力是线性结构。
压缩方法:每个权重是一个码字,每 128 个权重共享一个 FP16 scale。三元值携带 log2(3) ≈ 1.585 bits,加上 scale 开销后为 1.71 bpw,相比 FP16 压缩约 9.4 倍。1-bit 为 1.125 bpw,压缩约 14.2 倍。
性能方面,PrismML 在 15 项基准测试中评估了思考模式。三元 Bonsai 27B 保留 FP16 基线的 94.6%,1-bit 版保留 89.5%。传统 sub-4-bit 量化(如 IQ2_XXS)在 AIME26 和 LiveCodeBench 上性能崩溃,分别降至 57.5 和 56.4。
内存是关键约束。iOS 限制单个应用使用约一半物理内存,12GB iPhone 可用约 6GB。KV cache 方面,仅 16/64 层有全注意力缓存,FP16 下约 64 KiB/token,262K 窗口需 17.2GB,4-bit KV cache 可降至 4.3GB。三元版在 100K tokens 时峰值内存 14.7GB,1-bit 为 11.6GB,而 Q4_K_XL 需 25.6GB。
吞吐量方面,在 M5 Max 上 1-bit 版生成速度 66.4 tok/s,iPhone 17 Pro Max 上 11.0 tok/s。PrismML 还提供了 DSpark 推测解码 drafter,在 H100 上实现 143.8 tok/s,1.37 倍加速。
运行方式:通过 llama.cpp 或 MLX 加载 GGUF 模型,支持 OpenAI 兼容 API 和 tool calling。
中文圈视角
Bonsai 27B 对中文用户意味着什么?
-
端侧大模型终于可用:此前 27B 级模型在手机上运行几乎不可能。Bonsai 27B 的 1-bit 版仅 3.9GB,可在 iPhone 17 Pro Max 上以 11 tok/s 运行,且支持 262K 上下文。这对隐私敏感场景(如医疗、金融)和离线使用是重大利好。
-
国产模型生态受益:Qwen3.6-27B 本身是阿里通义千问系列,中文能力出色。Bonsai 27B 的量化技术直接提升了其部署灵活性。国内用户可通过 Hugging Face 或 ModelScope 下载,无需特殊网络。
-
与国产量化方案对比:国内 ModelScope 社区也有 GGUF 量化版本,但 Bonsai 27B 的 1-bit 和三元量化在压缩比和性能保留上更激进。传统 2-bit 量化(如 IQ2_XXS)在复杂任务上性能崩溃,而 Bonsai 27B 在 1-bit 下仍保留 89.5% 性能,差距明显。
-
应用场景:中文写作、代码审查、长文档分析(如法律合同、学术论文)可在本地笔记本上完成。三元版适合需要高精度的场景,1-bit 版适合手机端快速推理。
-
监管合规:模型完全本地运行,数据不出设备,符合国内数据安全法规。Apache 2.0 许可允许商业使用,但需注意 Qwen3.6-27B 本身可能受阿里许可限制。
几条值得记住的细节
- 三元 Bonsai 27B 大小 5.9GB,1-bit 版 3.9GB,均可在 12GB 内存手机上运行。
- 三元版保留 FP16 性能的 94.6%,1-bit 版保留 89.5%。
- 上下文 262K tokens,得益于 75% 线性注意力,KV cache 仅需 4.3GB(4-bit)。
- 1-bit 版在 iPhone 17 Pro Max 上生成速度 11 tok/s。
- 支持 tool calling 和思考模式,通过 OpenAI 兼容 API 调用。
一句话总结
Bonsai 27B 让 27B 级大模型真正跑在手机和笔记本上,中文用户可免费下载,实现本地、隐私、高效的 AI 推理。