

Unsloth 是由 Daniel Han 和 Michael Han 开发的开源微调库,通过自定义的 Triton CUDA 内核,可将 LLM 训练速度提升 2 倍,并减少高达 70% 的 VRAM 占用。支持包括 Llama、Qwen 和 DeepSeek 在内的 500 多种模型。免费使用,并提供支持多 GPU 训练的付费 Pro 版本。
Unsloth 是一个开源 Python 库,自 2026 年 3 月起还推出了一款无代码桌面应用程序(Unsloth Studio),它使得在消费级和研究级 NVIDIA 硬件上微调大型语言模型变得显著更快且更节省内存。该库由位于澳大利亚悉尼的 Daniel Han 和 Michael Han 兄弟开发,使用自定义的 Triton CUDA 实现取代了标准的 FlashAttention 2 内核,将训练时间缩短了 2-5 倍,并将 VRAM 使用量降低了高达 70%,且模型准确率没有可测量的损失。该项目从 Y Combinator 的 2024 年夏季批次毕业,截至 2026 年 5 月,已在 GitHub 上积累了超过 63,000 颗星,每月模型下载量达到 1000 万次。
核心库通过 pip 安装,采用 Apache 2.0 许可证,支持超过 500 种模型,包括 Llama 3.1/3.2、Qwen3.5/3.6、Gemma 1-4、DeepSeek-R1、Mistral、Phi-4 以及嵌入模型。支持的训练技术包括 LoRA、QLoRA、用于推理模型对齐的 GRPO 以及强化学习。该库的动态 4-bit 量化将困惑度(perplexity)保持在 8-bit 基准的 0.02 点以内。Unsloth Studio 增加了一个无代码 GUI,包含 Data Recipes(从 PDF、CSV 和 DOCX 文件创建数据集)、用于并排推理比较的 Model Arena、带有损失曲线和 GPU 使用情况的实时训练监控,以及 GGUF/Safetensors 导出功能。
Unsloth 在 2026 年 5 月的实际功能
该库的核心机制是内核融合(kernel fusion):Unsloth 没有调用标准的 PyTorch 注意力例程(这些例程会在 GPU 内存和计算单元之间反复移动数据),而是将注意力、RoPE 嵌入、交叉熵和层归一化操作重写为融合的 Triton 内核。这减少了整个前向和反向传播过程中的内存带宽开销。
在独立的基准测试中,使用 QLoRA 在 A100 40GB 上微调 Llama-3.1 8B(2 个 epoch,512-token 序列),Unsloth 在 3.2 小时内完成了训练。在相同的硬件和配置下,Axolotl 花费了 5.8 小时。使用 Unsloth 作为后端的 LLaMA-Factory 与 Unsloth 表现相当,耗时 3.4 小时;而没有 Unsloth 后端的 LLaMA-Factory 运行时间接近 5 小时。在 RTX 4090 硬件上,Unsloth 使得 Qwen3 30B-A3B(一种混合专家模型)仅需 17.5GB VRAM 即可进行训练,而标准 PyTorch 则需要 48GB。动态 4-bit 量化将上下文长度支持扩展到了 500,000+ tokens。
2026 年 2 月的更新增加了针对 MoE 的特定优化,其训练速度比标准实现提高了 12 倍。在 RTX 4090 上,DeepSeek-R1 蒸馏模型可以使用 GRPO 在不到 6GB 的 VRAM 下进行微调。最新版本 v0.1.37-beta(2026 年 4 月 23 日)在 Unsloth Studio 中添加了实验性的兼容 OpenAI/Anthropic 的 API 端点。
Unsloth 与 Axolotl 和 LLaMA-Factory 的定位对比
这三个库从不同的角度处理微调。了解它们在机制上的差异有助于您选择合适的工具,或决定何时将它们结合使用。
Unsloth vs. Axolotl
Axolotl 作为 HuggingFace Transformers 的配置驱动包装器运行。训练运行在 YAML 文件中定义,这意味着它们是可版本控制的、可重复的,并且可以在 CI/CD 管道中编写脚本。Axolotl 不注入自定义的 CUDA 内核:它依赖于 PyTorch 的原生注意力和 HuggingFace 的 Accelerate 进行多 GPU 分布式训练。这是它的主要权衡。在 A100 40GB(Llama-3.1 8B QLoRA)上,Axolotl 运行需要 5.8 小时,而 Unsloth 仅需 3.2 小时。如果您按小时支付云 GPU 费用,这种差距就显得尤为重要。
Axolotl 的优势在于:多 GPU 分布式训练(FSDP2、DeepSpeed)是一流的且开源的。在四大主要框架中,Axolotl 还拥有最完整的数据预处理管道,并且它将视觉语言模型微调(Qwen2-VL、LLaVA)作为一流的用例提供支持,而这正是 Unsloth 所缺乏的。如果您需要用于生产环境的可重复多节点训练,Axolotl 是正确的选择。
Unsloth vs. LLaMA-Factory
LLaMA-Factory 附带了一个名为 LlamaBoard 的 Web UI,允许非工程师在浏览器中配置和启动训练,而无需编写 Python 代码。它还拥有最广泛的零日(day-0)模型架构支持,通常比 Unsloth 或 Axolotl 更早添加对新模型系列的兼容性。LLaMA-Factory 在 2026 年集成了 KTransformers 和 Megatron-LM 后端,扩大了其生产范围。凭借 68,400 颗 GitHub 星,它在社区规模上略微领先于 Unsloth。
LLaMA-Factory 可以使用 Unsloth 作为后端以提升速度,但如果没有该后端,其原始训练速度与 Axolotl 相当。GUI 的抽象可能会在调试期间掩盖错误,并且在训练开始前通常有 2-3 分钟的初始化延迟。对于希望在代码级别控制其训练循环的从业者来说,Unsloth 的 Python API 更加透明。
“对于只有一块 GPU 且需要充分利用它的从业者来说,在单 GPU 效率方面,没有其他工具能与之媲美。速度的提升是真实的,而不是营销噱头。” - 摘自 2026 年 3 月 r/LocalLLaMA 框架比较帖子的社区总结
“Unsloth 团队有着修复甚至连原模型作者都忽略的模型错误的记录。他们为 Qwen3.5 制作的 GGUF 量化版本在一个帖子中就获得了 1,100 个赞。当您在选择依赖哪种模型训练工具时,这种社区信任非常重要。” - r/LocalLLaMA,2026 年 3 月
微调工作流的实际情况
对于直接运行 Python 库的用户来说,工作流接近标准的 HuggingFace Transformers,只需将 Unsloth 作为模型加载的直接替代方案。您调用 FastLanguageModel.from_pretrained() 而不是 AutoModelForCausalLM.from_pretrained(),使用 get_peft_model() 包装模型以添加 LoRA 适配器,然后使用标准的 HuggingFace SFTTrainer 或 GRPOTrainer 进行训练。Unsloth 的内核会自动激活。相对于标准的 HuggingFace 训练脚本,代码更改极小,通常只需 3-5 行。
对于 Unsloth Studio 用户,入口点是在本地运行的基于浏览器的界面。Data Recipes 允许您拖放 PDF、CSV 或 DOCX 文件,并通过可视化节点工作流对它们进行路由,以生成格式化的训练数据集。这消除了非工程师面临的最大摩擦点:数据集格式化。Model Arena 允许您加载两个微调后的模型,并在相同的提示词下对它们进行并排测试。
2025 年 1 月的 DeepSeek-R1 时刻充分展示了社区对 Unsloth 的信任以及该团队的工作风格。当 DeepSeek 发布 R1(671B 参数,FP8 格式,720GB 下载量)时,大多数研究人员无法运行它。几天之内,Unsloth 发布了跨多个精度层级的 GGUF 量化版本。1 月 27 日,他们发布了 1.58-bit 动态 GGUF,将文件大小缩减了 80%,使模型降至 150GB 以下。2 月 6 日,他们添加了 GRPO 训练支持,以便用户可以在该架构上微调自定义推理模型。每次更新都伴随着 Daniel Han 直接在 r/LocalLLaMA 上发布设置指南。这种模式在 2025 年 5 月的 DeepSeek-R1-0528 中再次重演,Unsloth 在发布后 24 小时内推出了动态 1-bit 量化版本,将 720GB 的模型压缩至 185GB。
您可以将 Unsloth 微调后的模型与 Hugging Face Hub 结合使用,以进行模型托管和分发。对于无需本地硬件的托管微调,Predibase(在 2025 年 6 月被收购后现为 Rubrik 的一部分)和 OpenPipe 提供了处理基础设施的云端替代方案,尽管它们会增加每次运行的成本并失去对本地数据的控制。
Unsloth 为谁而建
适用人群:
Unsloth 专为在 NVIDIA GPU 硬件上进行训练并希望从现有设备中榨取最大效率的 ML 工程师、研究人员和具备技术能力的从业者而构建。运行单块 RTX 4090 (24GB) 且原本会因 VRAM 限制而受阻的研究人员是 Unsloth 的核心用户。该库支持使用 QLoRA 在 24GB 显存上微调 Llama-3.1 20B,而这在标准实现中会导致 OOM(内存溢出)。预算有限的学术实验室、独立的微调研究人员以及构建自定义模型变体的开源社区,正是 Han 兄弟开发此工具的目标受众。
Unsloth 也适合对数据隐私有严格要求的团队。如果训练数据不能离开您的基础设施,或者受 GDPR、HIPAA 等合规性约束,那么通过 Unsloth(或 Axolotl)进行本地自托管训练是比托管云平台更合适的架构选择。
Unsloth 不适合的场景
在以下情况下请跳过:
您正在运行 AMD GPU。截至 2026 年 5 月,AMD ROCm 支持仍处于实验阶段且不稳定。bitsandbytes 会在 AMD 上自动禁用,使您从 4-bit 降级到 16-bit LoRA。GitHub issue #5180(2026 年 4 月)记录了 Unsloth Studio 2026.4.5 中的 HIP 加速器检测失败问题。Windows AMD 用户有一个尚未解决的开放功能请求(#4280)。
您需要在免费层中进行大规模的多 GPU 分布式训练。开源库专注于单 GPU 优化。多 GPU 支持需要付费的 Pro 版本,甚至 Pro 用户也报告了在某些模型架构中出现 DDP 失败的情况(issue #3915,双 H100 设置,2026 年 5 月)。如果您的工作流是多节点分布式训练,带有 FSDP2 的 Axolotl 或托管平台会更可靠。
您使用的是 macOS 并且想要训练模型。Unsloth Studio 中的 Mac 支持仅限于推理。MLX 训练已列入路线图,但截至 2026 年 5 月尚未发布。
您不是工程师,并且需要包含部署管道的全托管微调。Unsloth Studio 通过其无代码界面显著降低了门槛,但它仍然假设您在管理自己的硬件,并处理 GPU 驱动程序安装、Python 环境和模型导出工作流。对于希望通过平台端到端处理基础设施的团队来说,OpenPipe 或 Predibase 是更好的选择。
您需要对每个新模型架构的零日(day-0)支持。LLaMA-Factory 通常比 Unsloth 更快地发布对新模型系列的兼容性,而 Unsloth 在主要架构发布后偶尔会有滞后期。例如,Gemma 4 的集成在 2026 年 4 月需要多个补丁版本(v0.1.35 到 v0.1.36)才能稳定梯度累积和推理索引问题。
同样值得注意的是 Unsloth 内部的许可证区别。核心 Python 库(pip install unsloth)采用 Apache 2.0 许可证,允许不受限制的商业使用和重新分发。GUI 应用程序 Unsloth Studio 采用 AGPL-3.0 许可证,这要求您分发的任何衍生软件也必须开源。对于大多数运行本地微调的研究人员和从业者来说,这两种许可证都不会构成实际障碍。但对于计划重新分发基于 Unsloth Studio 界面构建的产品的公司来说,AGPL 条款需要进行法律审查。
付费 Pro 版本缺乏公开定价,这给试图评估微调基础设施决策总成本的团队带来了摩擦。如果不要求报价,您无法直接比较“Unsloth Pro vs Predibase vs Together AI”。对于预算规划来说,这种不透明性是一个合理的抱怨点,即使开源层在功能上已经满足了许多工作流的需求。如果您是一个已经触及单 GPU 上限并需要多 GPU 训练的团队,请尽早将与供应商的沟通纳入您的评估流程中。
用户评价
暂无评价,快来分享你的第一条体验吧!
登录 后即可撰写评价。
收录于精选合集
包含 Unsloth 的精选合集。
相关文章
与 Unsloth 相关的指南和文章。

Run Open Source AI Models Locally: Battle-Tested Guide

Local Agentic Coding May 2026: Qwen 3.6 + BeeLlama.cpp + Star Elastic

Grok 4.3 API for Agents (May 2026): Pricing, Benchmarks, Migration

Vantaige Launches the LLM VRAM Calculator: A Free GPU Compatibility Finder for Open-source and Open-Weight AI

Mistral Medium 3.5 Self Host: 77.6% SWE-Bench on 4 GPUs (2026)
