Saltar al contenido principal
Vantaige
Axolotl screenshot
Axolotl logo

Axolotl

Freemium

Axolotl es un framework de ajuste fino de LLM gratuito y de código abierto que permite a los equipos de ML ejecutar entrenamientos reproducibles de LoRA, QLoRA y GRPO en más de 100 arquitecturas de modelos utilizando un único archivo de configuración YAML en configuraciones multi-GPU.

Funciones:APIOpen Source

Axolotl es un framework de ajuste fino de LLM gratuito y de código abierto creado por Wing Lian y mantenido bajo las organizaciones Axolotl AI y OpenAccess AI Collective en GitHub. Envuelve Hugging Face Transformers, PEFT y bibliotecas relacionadas detrás de un sistema de configuración basado en YAML, de modo que las ejecuciones de entrenamiento se convierten en artefactos reproducibles que puedes confirmar en git, compartir con compañeros de equipo o transferir a canalizaciones de CI/CD. Publicado bajo la licencia Apache 2.0, el framework no tiene restricciones de licencia para uso comercial y ha atraído contribuciones de más de 170 desarrolladores desde su lanzamiento en 2023.

Axolotl es compatible con más de 100 arquitecturas de modelos, incluyendo Llama 4, Mistral Small 4, Qwen 3, Gemma 4, Granite 4 y un conjunto creciente de modelos de visión-lenguaje como Qwen-VL, Pixtral e InternVL 3.5. Los métodos de entrenamiento abarcan el ajuste fino completo, LoRA, QLoRA, ajuste de preferencias (DPO, IPO, KTO, ORPO), aprendizaje por refuerzo (GRPO, GDPO), modelado de recompensas y entrenamiento consciente de la cuantización. El entrenamiento distribuido multi-GPU a través de FSDP1, FSDP2 y DeepSpeed es una característica de primer nivel, junto con el soporte multinodo a través de Torchrun y Ray. Los conjuntos de datos se pueden extraer del disco local, Hugging Face Hub o almacenamiento en la nube en S3, Azure, GCP y OCI.

Lo que Axolotl realmente hace en abril de 2026

El lanzamiento de la versión v0.16.0 el 2 de abril de 2026 fue la actualización más significativa del framework hasta la fecha. Wing Lian anunció dos capacidades principales: ScatterMoE con kernels Triton de LoRA fusionados que ofrecen pases hacia adelante de MoE hasta 15 veces más rápidos y un 40 % menos de memoria que las implementaciones anteriores, y entrenamiento GRPO asíncrono con integración de vLLM que logra tiempos de paso un 58 % más rápidos al superponer la generación de tokens con el pase de entrenamiento.

"Axolotl v0.16.0 ya está aquí. Dos grandes pilares en este lanzamiento: 1. MoE y LoRA, haciendo que el ajuste fino de MoE sea rápido (15 veces más rápido, 40 veces menos memoria) y el entrenamiento de LoRA sea fluido, en todas las arquitecturas, listo para usar. 2. GRPO, entrenamiento asíncrono (58 % más rápido), kernels Triton personalizados, entorno." -- Wing Lian (@winglian), X, 2 de abril de 2026

El mismo lanzamiento añadió Flash Attention 4 con respaldo automático, integración de NeMo Gym para entornos de entrenamiento de RL, Energy-Based Fine-Tuning (EBFT) como un enfoque novedoso de RL, descarga de capas de CPU para LoRA, MX Quantization-Aware Training y soporte para nuevos modelos como Mistral Small 4, Qwen 3.5 y NeMo Super. Wing Lian también anunció una revisión completa de la documentación: "También revisamos la documentación, nuevas guías para el entrenamiento GRPO, servicio vLLM, estabilidad del entrenamiento, depuración y flujos de trabajo específicos para agentes".

El lanzamiento de la versión v0.13.0 en diciembre de 2024 introdujo SFT en streaming para tamaños de conjuntos de datos ilimitados, entrenamiento de difusión de texto como un complemento y entrenamiento consciente de la cuantización NVFP4. El lanzamiento de la versión v0.15.0 en marzo de 2026 añadió Torch 2.10.0, kernels SonicMoE para GPU Hopper y Blackwell, cuantización experta de MoE que redujo la memoria máxima reservada de 127 GiB a 23 GiB para grandes modelos de mezcla de expertos, e integración de SageAttention.

El framework ahora cubre todo el ciclo de vida posterior al entrenamiento a través de un único archivo YAML: preprocesamiento de conjuntos de datos, entrenamiento, evaluación, cuantización y preparación para la inferencia. Los valores predeterminados de rendimiento clave incluyen variantes de Flash Attention, multipacking (empaquetado de secuencias juntas para eliminar el desperdicio de relleno) y paralelismo de secuencias para modelos de contexto largo. Wing Lian explicó la lógica del enfoque basado en la configuración en el podcast Latent Space: "Realmente quería que estuviera en un archivo YAML porque era más portátil y reproducible".

Dónde se sitúa Axolotl frente a Unsloth y LLaMA-Factory

Unsloth es la herramienta de ajuste fino de una sola GPU más rápida disponible a partir de 2026, con 53.9k estrellas en GitHub frente a las 11.8k de Axolotl. Unsloth utiliza kernels Triton personalizados que reemplazan a FlashAttention 2 estándar a nivel de kernel, logrando un entrenamiento de 2 a 5 veces más rápido y un 70-80 % menos de VRAM que los métodos de referencia. En un benchmark directo, Llama-3.1 8B QLoRA entrenado en una A100 de 40GB durante dos épocas sobre 512 tokens tardó 3.2 horas con Unsloth frente a 5.8 horas con Axolotl. Unsloth también ofrece un entrenamiento de MoE 12 veces más rápido y puede ajustar el entrenamiento del modelo de razonamiento GRPO en 5GB de VRAM. La limitación estructural: la versión de código abierto de Unsloth es solo para una GPU. El entrenamiento multi-GPU requiere una suscripción a Unsloth Pro. Los equipos que escalan a 4, 8 o más GPU y que necesitan licencias abiertas eligen Axolotl.

LLaMA-Factory cuenta con 68.4k estrellas en GitHub y es el punto de entrada para los equipos que necesitan una interfaz de usuario web en lugar de una terminal. Su interfaz LlamaBoard maneja la configuración de conjuntos de datos, la selección de métodos de entrenamiento y la evaluación sin ninguna interacción de línea de comandos, e internamente utiliza el backend de aceleración de Unsloth para que los usuarios primerizos obtengan una velocidad competitiva automáticamente. La debilidad de LLaMA-Factory es que la personalización de bajo nivel está restringida por la GUI, y la depuración de producción a través de una interfaz web es más difícil que leer un archivo YAML que causó un fallo en el entrenamiento. Las configuraciones YAML de Axolotl son controlables por versiones, comparables y compatibles con canalizaciones de formas que las ejecuciones configuradas por GUI no lo son.

TRL (Transformer Reinforcement Learning, 17.6k estrellas) es la implementación de referencia de Hugging Face para RLHF y GRPO, la técnica que DeepSeek utilizó para entrenar modelos de razonamiento. TRL es donde los artículos de investigación de alineación se implementan primero, pero no está optimizado para el rendimiento en el ajuste fino supervisado. La implementación GRPO de la versión v0.16.0 de Axolotl con superposición asíncrona de vLLM ahora lo hace directamente competitivo con TRL para el entrenamiento de alineación de producción a escala multi-GPU.

Cómo es realmente el flujo de trabajo diario

Una ejecución de entrenamiento de Axolotl comienza con un archivo YAML. Una configuración mínima especifica el modelo base (una ruta de Hugging Face Hub o un directorio local), el conjunto de datos (ID de Hub, JSONL local o URI de almacenamiento en la nube), el método de entrenamiento (LoRA, QLoRA, ajuste fino completo) y cualquier indicador de optimización. El YAML luego impulsa la tokenización y el preprocesamiento del conjunto de datos (se ejecuta una vez, se almacena en caché), el entrenamiento con el método configurado y la evaluación opcional. Los comandos de la CLI son cortos: axolotl preprocess config.yml seguido de axolotl train config.yml.

Para ejecuciones multi-GPU, el mismo YAML añade una estrofa de DeepSpeed o FSDP2. Un ejemplo de producción real del benchmark de Spheron de 2026: el entrenamiento de Llama-3.1 70B en 8x GPU H100 a través de 50,000 ejemplos tomó 18 horas con Axolotl FSDP2 y produjo una mejora del 8-12 % sobre las variantes de QLoRA en tareas posteriores. El archivo de configuración se confirmó junto con los resultados del experimento, haciendo que la ejecución fuera reproducible por cualquier miembro del equipo.

El blog de desarrolladores de Red Hat documentó una canalización de ajuste fino disperso de tres pasos construida sobre Axolotl en junio de 2025. El flujo de trabajo combinó LLM Compressor para la dispersión, Axolotl para el ajuste fino consciente de la dispersión utilizando una receta ConstantPruningModifier, y la cuantización posterior al entrenamiento antes de la implementación de vLLM. El resultado: modelos 3 veces más pequeños y 2 veces más rápidos con FP8 disperso, o 5 veces más pequeños y 3 veces más rápidos con INT4 disperso, conservando al mismo tiempo una precisión del 99 %+ en la tarea.

Axolotl es el framework detrás de varias familias prominentes de modelos de código abierto. Nous Research lo utilizó para entrenar Puffin, Capybara y NousHermes. Los modelos OpenHermes y Trismigestus de Teknium se construyeron sobre configuraciones de Axolotl. La reproducibilidad basada en YAML del framework significa que las configuraciones de la comunidad para combinaciones específicas de modelos/conjuntos de datos circulan en GitHub y Hugging Face junto con los pesos ajustados, permitiendo a los equipos bifurcar y adaptar experimentos exitosos en lugar de empezar desde cero. Para los equipos que se integran con Predibase u OpenPipe para el ajuste fino alojado, el formato de punto de control de Axolotl (Hugging Face Transformers estándar) es compatible: los adaptadores entrenados en Axolotl se cargan directamente en cualquier pila de inferencia basada en Transformers.

Para quién está diseñado Axolotl

Axolotl está dirigido a ingenieros de ML y equipos de investigación que necesitan un ajuste fino de nivel de producción con control total sobre el proceso de entrenamiento. El perfil: un equipo que realiza ajustes finos en modelos de 7B-70B parámetros con datos específicos del dominio, ejecutándose en 2 o más GPU o en un nodo de GPU en la nube, y que necesita que la ejecución del entrenamiento se confirme en el control de versiones para que pueda ser auditada, repetida o entregada a otro ingeniero seis meses después.

El framework es particularmente fuerte para: equipos que realizan ajustes finos multimodales (modelos de visión-lenguaje o audio) donde la cobertura de Unsloth es incompleta; equipos que utilizan GRPO al estilo DeepSeek para entrenar modelos de razonamiento o RL específicos del dominio; equipos que integran el ajuste fino en canalizaciones de MLOps donde la reproducibilidad importa más que minimizar el tiempo de reloj en una sola ejecución; y equipos que realizan entrenamiento disperso o consciente de la cuantización donde el soporte QAT de Axolotl y la integración con herramientas de compresión como LLM Compressor proporcionan una canalización completa.

"Para la mayoría de los usuarios, especialmente si eres principiante, recomendamos usar Axolotl debido a su equilibrio entre accesibilidad y potencia." -- Guía de ajuste fino de Modal.com, 2025

Axolotl también se integra de forma natural con el ecosistema más amplio. Los conjuntos de datos se cargan desde Hugging Face Hub con un único ID de conjunto de datos de Hub en el YAML. Las métricas de entrenamiento se transmiten a Weights and Biases u otros registradores compatibles. Los puntos de control se guardan en formato estándar de Transformers para la implementación directa de inferencia. La compatibilidad de los puntos de control es una ventaja práctica significativa: debido a que los cuatro principales frameworks de ajuste fino de código abierto (Axolotl, Unsloth, LLaMA-Factory y TRL) comparten el formato de punto de control de Hugging Face Transformers en su base, los adaptadores LoRA entrenados en Axolotl se cargan directamente en Unsloth para la inferencia, o en cualquier pila de servicio basada en Transformers, incluyendo vLLM y llama.cpp. Los equipos no están atados. Cambiar del entrenamiento basado en YAML de Axolotl a un tiempo de ejecución de inferencia diferente no cuesta nada excepto reescribir la configuración.

La filosofía de YAML como configuración también da forma a cómo los usuarios de Axolotl comparten el trabajo. Cuando los investigadores publican modelos ajustados en Hugging Face Hub, el archivo de configuración YAML viaja junto con los pesos, haciendo que la configuración del entrenamiento sea transparente y reproducible. Esta es una cultura diferente a la de los flujos de trabajo basados en notebooks: en lugar de un notebook de Colab con parámetros integrados, obtienes una especificación declarativa que cualquier ingeniero del equipo puede ejecutar, auditar y modificar sin tocar Python. Para las organizaciones donde las ejecuciones de entrenamiento de modelos necesitan pasar una revisión interna o ser reproducidas meses después para cumplimiento o depuración, ese rastro de auditoría es un beneficio material sobre las herramientas basadas en GUI.

Lo que Axolotl no es

Axolotl no es el primer paso adecuado para alguien sin experiencia en aprendizaje automático. La instalación requiere Python 3.11+, PyTorch 2.9.1+ y una GPU NVIDIA Ampere compatible con CUDA o más reciente. Los usuarios primerizos se encuentran regularmente con desajustes en las versiones de dependencias o errores de falta de memoria en las ejecuciones iniciales, y los mensajes de error no siempre apuntan claramente al parámetro YAML responsable. Una queja recurrente en las reseñas: "Axolotl es una gran herramienta, pero su documentación no es fácil de seguir". Si necesitas una interfaz web, una configuración de cinco minutos y ningún trabajo de línea de comandos, LLaMA-Factory es la opción correcta.

Axolotl tampoco es el framework de una sola GPU más rápido. Si tu limitación es maximizar la velocidad de entrenamiento en una GPU de consumo (RTX 4090, 3090 o una instancia gratuita de Colab), Unsloth superará el rendimiento de Axolotl en aproximadamente el doble con un uso de VRAM comparable. Las capas de abstracción alrededor de Hugging Face Transformers añaden una sobrecarga que se muestra claramente en los benchmarks de una sola GPU. La ventaja multi-GPU de Axolotl solo se materializa cuando tienes 2 o más GPU y necesitas la coordinación de FSDP o DeepSpeed.

Por último, Axolotl no es un servicio gestionado ni una API. No hay un endpoint de Axolotl al que puedas llamar para ajustar un modelo. Lo ejecutas tú mismo en tu propio hardware o en un proveedor de GPU en la nube. Los equipos que deseen el ajuste fino como una API gestionada deberían considerar Predibase u OpenPipe en su lugar.

Reseñas de usuarios

Aún no hay reseñas. ¡Sé el primero en compartir tu experiencia!

Inicia sesión para escribir una reseña.

Destacado en colecciones

Listas seleccionadas que incluyen Axolotl.

Artículos relacionados

Guías y artículos relacionados con Axolotl.