Unsloth vs Axolotl vs TRL vs LLaMA-Factory:四大微调框架速度、显存与多卡对比
Unsloth、Axolotl、TRL、LLaMA-Factory 四大开源微调框架横向对比。从训练吞吐、峰值显存到多卡扩展,拆解各自的技术路线与适用场景,帮你选对框架省时间省显存。
一句话看懂
Unsloth、Axolotl、TRL、LLaMA-Factory 四大微调框架在速度、显存和多卡扩展上各有所长。Unsloth 单卡最快,Axolotl 多卡并行最灵活,TRL 是基础 API,LLaMA-Factory 覆盖模型最广。
详细发生了什么
当前主流的开源 LLM 微调框架有四个:Unsloth、Axolotl、TRL 和 LLaMA-Factory。它们都基于 PyTorch 和 Hugging Face 生态,但工程优化方向不同。Unsloth 重写底层 kernel,Axolotl 组合并行策略,TRL 定义 trainer API 供其他框架调用,LLaMA-Factory 追求模型覆盖广度与零代码操作。
速度方面:Unsloth 单卡优势明显。Llama 3.1 8B 和 Llama 3.3 70B 上达到 2x 加速;gpt-oss-20b 在 B200 上 8K 上下文时比 Transformers v5 快 7.3x。Axolotl 自 2025 年 2 月引入自定义 Triton kernel,单卡 H100 上 Qwen3.5-35B-A3B 8-bit LoRA 获得 1.45x 加速和 30% 显存节省。TRL 是基准参考,LLaMA-Factory 通过配置调用 Unsloth 等外部 kernel。
显存方面:Unsloth 在长上下文场景优势突出。8B 模型 4-bit QLoRA 最低 6 GB,70B 最低 41 GB。在 80 GB A100 上,Llama 3.3 70B 可支持 89,389 token 上下文,而标准 FA2 基线仅 6,916 token。MoE 模型上,Unsloth 通过 split-LoRA 避免专家权重物化,gpt-oss-20b 在 8K 上下文仅用 47.43 GB(Transformers v5 需 73.80 GB)。Axolotl 的 MoE expert 量化可将 GLM-4.7-Flash QLoRA 显存从 127 GiB 降至 23 GiB。
多卡扩展:排名反转。Unsloth 单卡领先但多卡扩展不如 Axolotl。Axolotl 支持 DeepSpeed ZeRO、FSDP2、DDP,以及数据、张量、上下文、专家并行组合(FSDP+TP、HSDP+TP、FSDP+CP 等)。TRL 提供两种序列切分后端:Ring Attention(FSDP2)和 ALST/Ulysses(DeepSpeed),分别适合超长上下文和 FlashAttention 场景。
中文圈视角
对国内开发者来说,这四个框架的可用性差异不大,但有几个关键点值得注意:
-
国产模型兼容性:LLaMA-Factory 覆盖 100+ 模型,对 Qwen、GLM、Yi 等国产模型支持最好,且有 Gradio 网页界面 LlamaBoard,适合快速实验。Unsloth 和 Axolotl 对 Qwen 系列也有良好支持,但需要一定命令行经验。
-
显存门槛与硬件:国内很多开发者使用 24 GB 显存的 RTX 4090 或 48 GB 的 A6000。Unsloth 在 24 GB 上可支持 Llama 3.1 8B 的 78K 上下文,而标准框架仅 5.8K,这对长文档微调(如法律、金融合同)非常实用。
-
多卡训练场景:国内高校和中小团队常有多卡但非顶级互联(如 4×4090)。Axolotl 的 FSDP2 和序列并行在 4090 上效率会下降(SP degree 8 时反而变慢),建议优先使用 2-4 卡。TRL 的 Ring Attention 适合 1M+ token 超长上下文,但需注意 FlashAttention 不支持。
-
平替与生态:如果不想折腾,LLaMA-Factory 是最省心的选择,配置简单且社区活跃。追求极致单卡速度选 Unsloth,多卡并行选 Axolotl。TRL 适合需要自定义训练逻辑的进阶用户。
-
监管合规:微调后的模型若涉及数据出境(如使用 OpenAI API 或国外云服务),需注意《数据安全法》要求。建议优先使用本地部署方案,Unsloth 和 LLaMA-Factory 均支持纯本地运行。
几条值得记住的细节
- Unsloth 单卡 8B QLoRA 最低 6 GB 显存,70B 最低 41 GB;长上下文优势显著,80 GB A100 上 70B 模型可达 89K token。
- Axolotl 的 MoE expert 量化可将 GLM-4.7-Flash QLoRA 显存从 127 GiB 降至 23 GiB。
- Axolotl 多卡并行最灵活,支持 FSDP+TP+CP+EP 组合,但 4090 上 SP degree 8 时效率低于单卡。
- TRL 的 Ring Attention 适合 1M+ token 超长上下文,但仅支持 SDPA;ALST/Ulysses 支持 FlashAttention-2,但需 attention head 数大于等于 sp_size。
- LLaMA-Factory 覆盖 100+ 模型,通过 use_unsloth: true 可调用 Unsloth kernel 获得 170% 加速。
一句话总结
选框架看场景:单卡速度选 Unsloth,多卡并行选 Axolotl,省心覆盖广选 LLaMA-Factory,自定义训练选 TRL。