Saltar al contenido principal
Vantaige
Unsloth screenshot
Unsloth logo

Unsloth

Freemium

Unsloth es una biblioteca de fine-tuning de código abierto creada por Daniel y Michael Han que ofrece un entrenamiento de LLM el doble de rápido y hasta un 70 % menos de uso de VRAM mediante kernels Triton CUDA personalizados. Es compatible con más de 500 modelos, incluyendo Llama, Qwen y DeepSeek. De uso gratuito, con un nivel Pro de pago para entrenamiento multi-GPU.

Funciones:APIOpen Source

Unsloth es una biblioteca de Python de código abierto y, desde marzo de 2026, también una aplicación de escritorio sin código (Unsloth Studio), que hace que el fine-tuning de grandes modelos de lenguaje sea drásticamente más rápido y eficiente en memoria en hardware NVIDIA de consumo y de nivel de investigación. Creada por los hermanos Daniel y Michael Han en Sídney, Australia, la biblioteca reemplaza los kernels estándar de FlashAttention 2 con implementaciones personalizadas de Triton CUDA que reducen el tiempo de entrenamiento entre 2 y 5 veces y disminuyen el uso de VRAM hasta en un 70 %, sin pérdida medible en la precisión del modelo. El proyecto se graduó del lote de verano de 2024 de Y Combinator y ha acumulado más de 63.000 estrellas en GitHub y 10 millones de descargas mensuales de modelos hasta mayo de 2026.

La biblioteca principal se instala a través de pip bajo la licencia Apache 2.0 y es compatible con más de 500 modelos, incluyendo Llama 3.1/3.2, Qwen3.5/3.6, Gemma 1-4, DeepSeek-R1, Mistral, Phi-4 y modelos de embeddings. Las técnicas de entrenamiento compatibles incluyen LoRA, QLoRA, GRPO para la alineación de modelos de razonamiento y aprendizaje por refuerzo. La cuantización dinámica de 4 bits de la biblioteca mantiene la perplejidad dentro de los 0,02 puntos de las líneas base de 8 bits. Unsloth Studio añade una interfaz gráfica sin código con Data Recipes (creación de conjuntos de datos a partir de archivos PDF, CSV y DOCX), un Model Arena para la comparación de inferencias en paralelo, monitorización del entrenamiento en tiempo real con curvas de pérdida y uso de GPU, y exportación a GGUF/Safetensors.

Lo que realmente hace Unsloth en mayo de 2026

El mecanismo central de la biblioteca es la fusión de kernels: en lugar de llamar a las rutinas de atención estándar de PyTorch que mueven datos repetidamente entre la memoria de la GPU y las unidades de cálculo, Unsloth reescribe las operaciones de atención, embeddings RoPE, entropía cruzada y normalización de capas como kernels Triton fusionados. Esto reduce la sobrecarga del ancho de banda de memoria en todo el pase hacia adelante y hacia atrás (forward y backward pass).

En pruebas de rendimiento independientes realizando fine-tuning de Llama-3.1 8B en una A100 de 40GB con QLoRA (2 épocas, secuencias de 512 tokens), Unsloth completó el entrenamiento en 3,2 horas. Axolotl en el mismo hardware y configuración tardó 5,8 horas. LLaMA-Factory usando Unsloth como backend igualó a Unsloth con 3,4 horas; LLaMA-Factory sin el backend de Unsloth se acercó a las 5 horas. En hardware RTX 4090, Unsloth permite que Qwen3 30B-A3B (un modelo de mezcla de expertos) se entrene con solo 17,5GB de VRAM, en comparación con los 48GB requeridos por el PyTorch estándar. La cuantización dinámica de 4 bits amplía el soporte de longitud de contexto a más de 500.000 tokens.

La actualización de febrero de 2026 añadió optimizaciones específicas para MoE, donde las mejoras de velocidad de entrenamiento alcanzan 12 veces más que las implementaciones estándar. Los modelos destilados de DeepSeek-R1 se pueden ajustar con GRPO en menos de 6GB de VRAM en una RTX 4090. La versión más reciente, v0.1.37-beta (23 de abril de 2026), añadió endpoints de API experimentales compatibles con OpenAI/Anthropic a Unsloth Studio.

Dónde se sitúa Unsloth frente a Axolotl y LLaMA-Factory

Estas tres bibliotecas abordan el fine-tuning desde diferentes ángulos. Comprender las diferencias mecánicas te ayuda a elegir la adecuada o a decidir cuándo combinarlas.

Unsloth vs. Axolotl

Axolotl funciona como un wrapper basado en configuración sobre HuggingFace Transformers. Las ejecuciones de entrenamiento se definen en archivos YAML, lo que significa que son controlables por versión, reproducibles y programables en pipelines CI/CD. Axolotl no inyecta kernels CUDA personalizados: depende de la atención estándar de PyTorch y de Accelerate de HuggingFace para la distribución multi-GPU. Esta es su principal contrapartida. En una A100 de 40GB (Llama-3.1 8B QLoRA), Axolotl se ejecuta en 5,8 horas frente a las 3,2 horas de Unsloth. La diferencia es importante si estás pagando por tiempo de GPU en la nube por hora.

Dónde gana Axolotl: la distribución multi-GPU (FSDP2, DeepSpeed) es de primer nivel y de código abierto. Axolotl también tiene el pipeline de preprocesamiento de datos más completo entre los cuatro frameworks principales, y soporta el fine-tuning de modelos de visión-lenguaje (Qwen2-VL, LLaVA) como un caso de uso principal, algo de lo que Unsloth carece. Si necesitas un entrenamiento multinodo reproducible para producción, Axolotl es la opción correcta.

Unsloth vs. LLaMA-Factory

LLaMA-Factory incluye una interfaz web llamada LlamaBoard que permite a los no ingenieros configurar y lanzar ejecuciones de entrenamiento desde un navegador, sin escribir Python. También tiene el soporte más amplio de arquitectura de modelos desde el día 0, añadiendo típicamente compatibilidad para nuevas familias de modelos antes que Unsloth o Axolotl. LLaMA-Factory integró los backends KTransformers y Megatron-LM en 2026, ampliando su rango de producción. Con 68.400 estrellas en GitHub, supera ligeramente a Unsloth en tamaño de comunidad.

LLaMA-Factory puede usar Unsloth como backend para ganar velocidad, pero sin ese backend, la velocidad de entrenamiento en bruto es comparable a la de Axolotl. La abstracción de la interfaz gráfica puede ocultar errores durante la depuración, y normalmente hay un retraso de inicialización de 2 a 3 minutos antes de que comience el entrenamiento. Para los profesionales que desean un control a nivel de código de su bucle de entrenamiento, la API de Python de Unsloth es más transparente.

"Para los profesionales con una sola GPU que necesitan aprovecharla al máximo, nada se le acerca en eficiencia de una sola GPU. Las mejoras de velocidad son reales, no marketing." - síntesis de la comunidad del hilo de comparación de frameworks en r/LocalLLaMA, marzo de 2026
"El equipo de Unsloth tiene un historial de corrección de errores en modelos que incluso a los autores originales se les escapan. Sus cuantizaciones GGUF para Qwen3.5 consiguieron 1.100 votos positivos en un solo hilo. Ese tipo de confianza de la comunidad importa cuando eliges en quién confiar para las herramientas de entrenamiento de modelos." - r/LocalLLaMA, marzo de 2026

Cómo es la realidad del flujo de trabajo de fine-tuning

Para los usuarios que ejecutan la biblioteca de Python directamente, el flujo de trabajo es similar al de HuggingFace Transformers estándar, con Unsloth como un reemplazo directo para la carga de modelos. Llamas a FastLanguageModel.from_pretrained() en lugar de AutoModelForCausalLM.from_pretrained(), envuelves el modelo con get_peft_model() para añadir adaptadores LoRA, y luego entrenas con un SFTTrainer o GRPOTrainer estándar de HuggingFace. Los kernels de Unsloth se activan automáticamente. Los cambios de código en relación con un script de entrenamiento estándar de HuggingFace son mínimos, típicamente de 3 a 5 líneas.

Para los usuarios de Unsloth Studio, el punto de entrada es una interfaz basada en navegador que se ejecuta localmente. Data Recipes te permite arrastrar y soltar archivos PDF, CSV o DOCX y enrutarlos a través de un flujo de trabajo de nodos visuales para producir conjuntos de datos de entrenamiento formateados. Esto elimina el mayor punto de fricción para los no ingenieros: el formateo de conjuntos de datos. El Model Arena te permite cargar dos modelos ajustados y probarlos en paralelo con los mismos prompts.

El momento DeepSeek-R1 en enero de 2025 ilustró tanto la confianza de la comunidad en Unsloth como el estilo de trabajo del equipo. Cuando DeepSeek lanzó R1 (671B parámetros, formato FP8, descarga de 720GB), la mayoría de los investigadores no podían ejecutarlo. En cuestión de días, Unsloth lanzó cuantizaciones GGUF en múltiples niveles de precisión. El 27 de enero, publicaron GGUFs dinámicos de 1,58 bits que redujeron el tamaño del archivo en un 80 %, llevando el modelo a menos de 150GB. El 6 de febrero, añadieron soporte de entrenamiento GRPO para que los usuarios pudieran ajustar modelos de razonamiento personalizados en la arquitectura. Cada actualización fue acompañada por Daniel Han publicando directamente en r/LocalLLaMA con guías de configuración. El patrón se repitió con DeepSeek-R1-0528 en mayo de 2025, donde Unsloth lanzó cuantizaciones dinámicas de 1 bit que comprimieron el modelo de 720GB a 185GB en las 24 horas posteriores a su lanzamiento.

Puedes emparejar los modelos ajustados con Unsloth con Hugging Face Hub para el alojamiento y distribución de modelos. Para el fine-tuning gestionado sin hardware local, Predibase (ahora parte de Rubrik tras su adquisición en junio de 2025) y OpenPipe ofrecen alternativas en la nube que manejan la infraestructura, aunque añaden costes por ejecución y eliminan el control de datos locales.

Para quién está creado Unsloth

El perfil ideal:

Unsloth está diseñado para ingenieros de ML, investigadores y profesionales con capacidad técnica que entrenan en hardware de GPU NVIDIA y desean extraer la máxima eficiencia de lo que tienen. Un investigador que ejecuta una sola RTX 4090 (24GB) que de otro modo estaría bloqueado por la VRAM es el usuario principal de Unsloth. La biblioteca permite el fine-tuning de Llama-3.1 20B en 24GB con QLoRA, algo que daría un error OOM (Out of Memory) con implementaciones estándar. Laboratorios académicos con presupuesto limitado, investigadores independientes de fine-tuning y comunidades de código abierto que construyen variantes de modelos personalizados son la audiencia para la que los hermanos Han crearon esto.

Unsloth también encaja en equipos con estrictos requisitos de privacidad de datos. Si los datos de entrenamiento no pueden salir de tu infraestructura, o se aplican restricciones de cumplimiento como GDPR, HIPAA u otras, el entrenamiento local autoalojado a través de Unsloth (o Axolotl) es la elección arquitectónica correcta frente a las plataformas en la nube gestionadas.

Lo que Unsloth no es

Evítalo cuando:

Estés utilizando GPUs de AMD. El soporte para AMD ROCm es experimental e inestable a partir de mayo de 2026. bitsandbytes se desactiva automáticamente para AMD, bajando de LoRA de 4 bits a 16 bits. El issue #5180 de GitHub (abril de 2026) documenta fallos de detección del acelerador HIP en Unsloth Studio 2026.4.5. Los usuarios de AMD en Windows tienen una solicitud de función abierta (#4280) que no ha sido abordada.

Necesites un entrenamiento distribuido multi-GPU serio en el nivel gratuito. La biblioteca de código abierto se centra en la optimización de una sola GPU. El soporte multi-GPU requiere el nivel Pro de pago, e incluso los usuarios Pro han reportado fallos de DDP en ciertas arquitecturas de modelos (issue #3915, configuración dual H100, mayo de 2026). Si tu flujo de trabajo es el entrenamiento distribuido multinodo, Axolotl con FSDP2 o una plataforma gestionada es más fiable.

Estés en macOS y quieras entrenar modelos. El soporte para Mac en Unsloth Studio es solo para inferencia. El entrenamiento con MLX ha estado en la hoja de ruta pero no se ha lanzado a partir de mayo de 2026.

No seas ingeniero y necesites un fine-tuning totalmente gestionado con pipelines de despliegue incluidos. Unsloth Studio reduce la barrera significativamente con su interfaz sin código, pero aún asume que estás gestionando tu propio hardware y lidiando con la instalación de controladores de GPU, entornos de Python y flujos de trabajo de exportación de modelos. OpenPipe o Predibase son mejores opciones para los equipos que desean una plataforma que maneje la infraestructura de principio a fin.

Necesites soporte desde el día 0 para cada nueva arquitectura de modelo. LLaMA-Factory suele lanzar compatibilidad para nuevas familias de modelos más rápido que Unsloth, que ocasionalmente tiene un período de retraso después de los lanzamientos de arquitecturas importantes. Por ejemplo, la integración de Gemma 4 requirió múltiples parches en abril de 2026 (v0.1.35 a v0.1.36) para estabilizar la acumulación de gradientes y los problemas de indexación de inferencia.

También vale la pena señalar la distinción de licencias dentro del propio Unsloth. La biblioteca principal de Python (pip install unsloth) es Apache 2.0, lo que permite el uso comercial y la redistribución sin restricciones. Unsloth Studio, la aplicación de interfaz gráfica, es AGPL-3.0, lo que requiere que cualquier software derivado que distribuyas también debe ser de código abierto. Para la mayoría de los investigadores y profesionales que ejecutan fine-tuning local, ninguna de las licencias es una barrera práctica. Para las empresas que planean redistribuir un producto construido sobre la interfaz de Unsloth Studio, la cláusula AGPL necesita revisión legal.

La ausencia de un precio público para el nivel Pro de pago crea fricción para los equipos que intentan evaluar el coste total de una decisión de infraestructura de fine-tuning. No se puede comparar directamente "Unsloth Pro vs Predibase vs Together AI" sin solicitar un presupuesto. Esa opacidad es una queja legítima para la planificación de presupuestos, incluso si el nivel de código abierto es funcionalmente completo para muchos flujos de trabajo. Si eres un equipo que ha alcanzado el límite de una sola GPU y necesita entrenamiento multi-GPU, incorpora esa conversación con el proveedor en tu proceso de evaluación desde el principio.

Reseñas de usuarios

Aún no hay reseñas. ¡Sé el primero en compartir tu experiencia!

Inicia sesión para escribir una reseña.

Destacado en colecciones

Listas seleccionadas que incluyen Unsloth.

Artículos relacionados

Guías y artículos relacionados con Unsloth.