跳到主要内容
Vantaige
Axolotl screenshot
Axolotl logo

Axolotl

免费增值

Axolotl 是一款免费、开源的大语言模型 (LLM) 微调框架,机器学习团队只需使用单个 YAML 配置文件,即可在多 GPU 环境下对 100 多种模型架构进行可复现的 LoRA、QLoRA 和 GRPO 训练。

使用场景:代码与开发
功能:APIOpen Source

Axolotl 是一款免费、开源的大语言模型 (LLM) 微调框架,由 Wing Lian 构建,并在 GitHub 上的 Axolotl AI 和 OpenAccess AI Collective 组织下进行维护。它将 Hugging Face Transformers、PEFT 及相关库封装在一个由 YAML 驱动的配置系统之后,使训练过程成为可复现的产物,您可以将其提交到 git、与团队成员共享,或交付给 CI/CD 流水线。该框架在 Apache 2.0 许可下发布,对商业使用没有任何许可限制,自 2023 年推出以来已吸引了 170 多名开发者的贡献。

Axolotl 支持 100 多种模型架构,包括 Llama 4、Mistral Small 4、Qwen 3、Gemma 4、Granite 4,以及不断增加的视觉语言模型(如 Qwen-VL、Pixtral 和 InternVL 3.5)。训练方法涵盖全量微调、LoRA、QLoRA、偏好微调(DPO、IPO、KTO、ORPO)、强化学习(GRPO、GDPO)、奖励建模和量化感知训练。通过 FSDP1、FSDP2 和 DeepSpeed 实现的多 GPU 分布式训练是其一流特性,同时还通过 Torchrun 和 Ray 提供多节点支持。数据集可以从本地磁盘、Hugging Face Hub 或 S3、Azure、GCP 和 OCI 等云存储中提取。

Axolotl 在 2026 年 4 月的实际表现

2026 年 4 月 2 日发布的 v0.16.0 版本是该框架迄今为止最重要的一次更新。Wing Lian 宣布了两项核心功能:带有融合 LoRA Triton 内核的 ScatterMoE(与之前的实现相比,MoE 前向传递速度提高了 15 倍,内存占用减少了 40 倍),以及集成了 vLLM 的异步 GRPO 训练(通过将 token 生成与训练过程重叠,使步进时间加快了 58%)。

"Axolotl v0.16.0 来了。本次发布有两大支柱:1. MoE 和 LoRA,使 MoE 微调变得快速(速度提升 15 倍,内存减少 40 倍),并且在各种架构中实现开箱即用的无缝 LoRA 训练。2. GRPO、异步训练(速度提升 58%)、自定义 Triton 内核、环境。" —— Wing Lian (@winglian),X,2026 年 4 月 2 日

同一版本还增加了带有自动回退功能的 Flash Attention 4、用于强化学习训练环境的 NeMo Gym 集成、作为新型强化学习方法的基于能量的微调 (EBFT)、LoRA 的 CPU 层卸载、MX 量化感知训练,以及对 Mistral Small 4、Qwen 3.5 和 NeMo Super 的新模型支持。Wing Lian 还宣布了对文档的全面修订:“我们还彻底重构了文档,新增了关于 GRPO 训练、vLLM 部署、训练稳定性、调试以及特定智能体工作流的指南。”

2024 年 12 月发布的 v0.13.0 版本引入了针对无限数据集大小的流式 SFT、作为插件的文本扩散训练以及 NVFP4 量化感知训练。2026 年 3 月发布的 v0.15.0 版本增加了 Torch 2.10.0、适用于 Hopper 和 Blackwell GPU 的 SonicMoE 内核、将大型混合专家模型的峰值保留内存从 127 GiB 降至 23 GiB 的 MoE 专家量化,以及 SageAttention 集成。

该框架现在通过单个 YAML 文件涵盖了完整的训练后生命周期:数据集预处理、训练、评估、量化和推理准备。关键的默认性能优化包括 Flash Attention 变体、多重打包(将序列打包在一起以消除填充浪费)以及针对长上下文模型的序列并行。Wing Lian 在 Latent Space 播客中解释了采用配置驱动方法的理由:“我非常希望它能放在一个 YAML 文件中,因为它更具可移植性和可复现性。”

Axolotl 与 Unsloth 和 LLaMA-Factory 的定位对比

截至 2026 年,Unsloth 是目前最快的单 GPU 微调工具,在 GitHub 上拥有 53.9k 颗星,而 Axolotl 为 11.8k。Unsloth 使用自定义 Triton 内核在内核级别替换了标准的 FlashAttention 2,与基线方法相比,训练速度提高了 2-5 倍,显存占用减少了 70-80%。在一项直接基准测试中,在 A100 40GB 上对 Llama-3.1 8B 进行 QLoRA 训练(512 个 token,两个 epoch),Unsloth 耗时 3.2 小时,而 Axolotl 耗时 5.8 小时。Unsloth 还提供了快 12 倍的 MoE 训练,并能将 GRPO 推理模型训练压缩到 5GB 显存中。其结构性限制在于:开源版本的 Unsloth 仅支持单 GPU。多 GPU 训练需要订阅 Unsloth Pro。扩展到 4 个、8 个或更多 GPU 且需要开放许可的团队会选择 Axolotl。

LLaMA-Factory 在 GitHub 上拥有 68.4k 颗星,是需要 Web UI 而非终端的团队的入门首选。其 LlamaBoard 界面无需任何命令行交互即可处理数据集配置、训练方法选择和评估,并且它在内部使用了 Unsloth 加速后端,因此首次使用的用户可以自动获得极具竞争力的速度。LLaMA-Factory 的弱点在于底层定制受到 GUI 的限制,而且通过 Web 界面进行生产调试比阅读导致训练失败的 YAML 文件要困难得多。Axolotl 的 YAML 配置具有版本可控、可进行差异对比 (diff-able) 以及与流水线兼容的特性,这些都是 GUI 配置运行所不具备的。

TRL(Transformer Reinforcement Learning,17.6k 颗星)是 Hugging Face 针对 RLHF 和 GRPO(DeepSeek 用于训练推理模型的技术)的参考实现。TRL 是对齐研究论文首先得到实现的地方,但它并未针对监督微调的吞吐量进行优化。Axolotl 的 v0.16.0 GRPO 实现带有异步 vLLM 重叠,现在使其在多 GPU 规模的生产对齐训练中能够与 TRL 直接竞争。

日常工作流的实际情况

Axolotl 的训练运行从一个 YAML 文件开始。一个最小配置指定了基础模型(Hugging Face Hub 路径或本地目录)、数据集(Hub ID、本地 JSONL 或云存储 URI)、训练方法(LoRA、QLoRA、全量微调)以及任何优化标志。然后,该 YAML 驱动数据集分词和预处理(运行一次,缓存)、使用配置的方法进行训练以及可选的评估。CLI 命令非常简短:先执行 axolotl preprocess config.yml,然后执行 axolotl train config.yml。

对于多 GPU 运行,同一个 YAML 会添加一个 DeepSpeed 或 FSDP2 配置段。来自 Spheron 2026 年基准测试的一个真实生产示例:在 8 个 H100 GPU 上对 50,000 个样本进行 Llama-3.1 70B 训练,使用 Axolotl FSDP2 耗时 18 小时,并在下游任务上比 QLoRA 变体产生了 8-12% 的提升。配置文件与实验结果一起提交,使得任何团队成员都能复现该运行。

Red Hat 的开发者博客在 2025 年 6 月记录了一个基于 Axolotl 构建的三步稀疏微调流水线。该工作流结合了用于稀疏化的 LLM Compressor、使用 ConstantPruningModifier 配方进行稀疏感知微调的 Axolotl,以及在 vLLM 部署之前的训练后量化。结果是:使用稀疏 FP8 的模型体积缩小了 3 倍,速度提高了 2 倍;或者使用稀疏 INT4 的模型体积缩小了 5 倍,速度提高了 3 倍,同时在任务上保持了 99%+ 的准确率。

Axolotl 是几个著名开源模型系列背后的框架。Nous Research 使用它训练了 Puffin、Capybara 和 NousHermes。Teknium 的 OpenHermes 和 Trismigestus 模型也是基于 Axolotl 配置构建的。该框架基于 YAML 的可复现性意味着针对特定模型/数据集组合的社区配置会与微调后的权重一起在 GitHub 和 Hugging Face 上流传,让团队可以复刻和调整成功的实验,而不是从头开始。对于与 Predibase 或 OpenPipe 集成以进行托管微调的团队来说,Axolotl 的检查点格式(标准的 Hugging Face Transformers)是兼容的:在 Axolotl 中训练的适配器可以直接加载到任何基于 Transformers 的推理栈中。

Axolotl 为谁而建

Axolotl 面向需要生产级微调并对训练过程拥有完全控制权的机器学习工程师和研究团队。典型用户画像:一个在特定领域数据上微调 7B-70B 参数模型的团队,在 2 个以上 GPU 或云 GPU 节点上运行,并且需要将训练运行提交到版本控制中,以便在六个月后可以对其进行审计、重复或移交给另一位工程师。

该框架在以下方面尤为强大:进行多模态微调(视觉语言或音频模型)的团队,因为 Unsloth 在这方面的覆盖尚不完整;使用 DeepSeek 风格的 GRPO 训练推理或特定领域强化学习模型的团队;将微调集成到 MLOps 流水线中的团队,在这些流水线中,可复现性比最小化单次运行的挂钟时间更重要;以及进行稀疏或量化感知训练的团队,Axolotl 的 QAT 支持及其与 LLM Compressor 等压缩工具的集成提供了一个完整的流水线。

“对于大多数用户,特别是如果您是初学者,我们建议使用 Axolotl,因为它在易用性和强大功能之间取得了平衡。” —— Modal.com 微调指南,2025 年

Axolotl 还能与更广泛的生态系统自然集成。只需在 YAML 中提供一个 Hub 数据集 ID,即可从 Hugging Face Hub 加载数据集。训练指标会流式传输到 Weights and Biases 或其他受支持的日志记录器。检查点以标准的 Transformers 格式保存,以便直接进行推理部署。检查点兼容性是一个有意义的实际优势:因为所有四个主要的开源微调框架(Axolotl、Unsloth、LLaMA-Factory 和 TRL)底层都共享 Hugging Face Transformers 检查点格式,所以在 Axolotl 中训练的 LoRA 适配器可以直接加载到 Unsloth 中进行推理,或者加载到任何基于 Transformers 的服务栈(包括 vLLM 和 llama.cpp)中。团队不会被锁定。从 Axolotl 的 YAML 驱动训练切换到不同的推理运行时,除了重写配置外,没有任何成本。

将 YAML 作为配置的理念也塑造了 Axolotl 用户分享工作的方式。当研究人员在 Hugging Face Hub 上发布微调模型时,YAML 配置文件会与权重一起提供,使训练设置透明且可复现。这与笔记本驱动的工作流文化不同:您得到的不是一个嵌入了参数的 Colab 笔记本,而是一个声明式规范,团队中的任何工程师都可以在不接触 Python 的情况下运行、审计和修改它。对于模型训练运行需要通过内部审查,或者在几个月后为了合规性或调试而需要复现的组织来说,这种审计跟踪是优于基于 GUI 工具的实质性优势。

Axolotl 不是什么

对于没有机器学习背景的人来说,Axolotl 并不是合适的第一步。安装需要 Python 3.11+、PyTorch 2.9.1+ 以及兼容 CUDA 的 NVIDIA Ampere GPU 或更新版本。首次使用的用户在初始运行时经常会遇到依赖版本不匹配或内存不足的错误,而且错误消息并不总是清楚地指向负责的 YAML 参数。在各种评论中经常出现的一个抱怨是:“Axolotl 是一个很棒的工具,但它的文档不容易理解。”如果您需要 Web 界面、五分钟的设置且无需命令行工作,LLaMA-Factory 才是正确的选择。

Axolotl 也不是最快的单 GPU 框架。如果您的限制是在单个消费级 GPU(RTX 4090、3090 或免费的 Colab 实例)上最大化训练速度,在相当的显存使用量下,Unsloth 的吞吐量将比 Axolotl 高出约 2 倍。围绕 Hugging Face Transformers 的抽象层增加了开销,这在单 GPU 基准测试中表现得很明显。只有当您拥有 2 个以上 GPU 并且需要 FSDP 或 DeepSpeed 协调时,Axolotl 的多 GPU 优势才会显现出来。

最后,Axolotl 不是托管服务或 API。没有可以调用来微调模型的 Axolotl 端点。您需要在自己的硬件或云 GPU 提供商上自行运行它。希望将微调作为托管 API 的团队应该考虑使用 Predibase 或 OpenPipe。

用户评价

暂无评价,快来分享你的第一条体验吧!

登录 后即可撰写评价。

收录于精选合集

包含 Axolotl 的精选合集。

相关文章

与 Axolotl 相关的指南和文章。