

Unsloth est une bibliothèque open source de fine-tuning créée par Daniel et Michael Han, qui offre un entraînement des LLM 2x plus rapide et réduit l'utilisation de la VRAM jusqu'à 70 % grâce à des noyaux Triton CUDA personnalisés. Elle prend en charge plus de 500 modèles, dont Llama, Qwen et DeepSeek. Utilisation gratuite, avec un niveau Pro payant pour l'entraînement multi-GPU.
Unsloth est une bibliothèque Python open source et, depuis mars 2026, une application de bureau no-code (Unsloth Studio), qui rend le fine-tuning des grands modèles de langage considérablement plus rapide et plus économe en mémoire sur le matériel NVIDIA grand public et de recherche. Conçue par les frères Daniel Han et Michael Han à Sydney, en Australie, la bibliothèque remplace les noyaux FlashAttention 2 standards par des implémentations Triton CUDA personnalisées qui réduisent le temps d'entraînement de 2 à 5x et diminuent l'utilisation de la VRAM jusqu'à 70 %, sans perte mesurable de la précision du modèle. Le projet est issu de la promotion Summer 2024 de Y Combinator et a accumulé plus de 63 000 étoiles GitHub et 10 millions de téléchargements de modèles par mois en mai 2026.
La bibliothèque principale s'installe via pip sous licence Apache 2.0 et prend en charge plus de 500 modèles, notamment Llama 3.1/3.2, Qwen3.5/3.6, Gemma 1-4, DeepSeek-R1, Mistral, Phi-4 et des modèles d'embedding. Les techniques d'entraînement prises en charge incluent LoRA, QLoRA, GRPO pour l'alignement des modèles de raisonnement, et l'apprentissage par renforcement. La quantification dynamique 4-bit de la bibliothèque maintient la perplexité à moins de 0.02 point des références 8-bit. Unsloth Studio ajoute une interface graphique no-code avec Data Recipes (création de jeux de données à partir de fichiers PDF, CSV et DOCX), un Model Arena pour la comparaison d'inférence côte à côte, le suivi de l'entraînement en temps réel avec des courbes de perte et l'utilisation du GPU, ainsi que l'exportation GGUF/Safetensors.
Ce que fait réellement Unsloth en mai 2026
Le mécanisme central de la bibliothèque est la fusion de noyaux : au lieu d'appeler les routines d'attention standards de PyTorch qui déplacent les données de manière répétée entre la mémoire du GPU et les unités de calcul, Unsloth réécrit les opérations d'attention, d'embedding RoPE, d'entropie croisée et de normalisation de couche sous forme de noyaux Triton fusionnés. Cela réduit la surcharge de la bande passante mémoire sur l'ensemble des passes avant et arrière.
Lors de benchmarks indépendants de fine-tuning de Llama-3.1 8B sur un A100 40GB avec QLoRA (2 époques, séquences de 512 tokens), Unsloth a terminé l'entraînement en 3.2 heures. Axolotl, sur le même matériel et avec la même configuration, a pris 5.8 heures. LLaMA-Factory utilisant Unsloth comme backend a égalé Unsloth à 3.4 heures ; LLaMA-Factory sans le backend Unsloth s'est rapproché des 5 heures. Sur du matériel RTX 4090, Unsloth permet à Qwen3 30B-A3B (un modèle mixture-of-experts) de s'entraîner sur seulement 17.5GB de VRAM, contre 48GB requis par le PyTorch standard. La quantification dynamique 4-bit étend la prise en charge de la longueur de contexte à plus de 500 000 tokens.
La mise à jour de février 2026 a ajouté des optimisations spécifiques aux MoE, où les accélérations d'entraînement atteignent 12x par rapport aux implémentations standards. Les modèles distillés DeepSeek-R1 peuvent être fine-tunés avec GRPO avec moins de 6GB de VRAM sur une RTX 4090. La version la plus récente, v0.1.37-beta (23 avril 2026), a ajouté des points de terminaison d'API expérimentaux compatibles avec OpenAI/Anthropic à Unsloth Studio.
Où se situe Unsloth par rapport à Axolotl et LLaMA-Factory
Ces trois bibliothèques abordent le fine-tuning sous des angles différents. Comprendre les différences mécaniques vous aide à choisir la bonne, ou à décider quand les combiner.
Unsloth vs. Axolotl
Axolotl fonctionne comme un wrapper piloté par configuration au-dessus de HuggingFace Transformers. Les exécutions d'entraînement sont définies dans des fichiers YAML, ce qui signifie qu'elles sont contrôlables en version, reproductibles et scriptables dans les pipelines CI/CD. Axolotl n'injecte pas de noyaux CUDA personnalisés : il s'appuie sur l'attention standard de PyTorch et sur Accelerate de HuggingFace pour la distribution multi-GPU. C'est son principal compromis. Sur un A100 40GB (Llama-3.1 8B QLoRA), Axolotl s'exécute en 5.8 heures contre 3.2 heures pour Unsloth. L'écart a son importance si vous payez le temps de GPU cloud à l'heure.
Là où Axolotl gagne : la distribution multi-GPU (FSDP2, DeepSpeed) est de premier ordre et open source. Axolotl possède également le pipeline de prétraitement des données le plus complet parmi les quatre frameworks majeurs, et il prend en charge le fine-tuning des modèles de vision-langage (Qwen2-VL, LLaVA) comme un cas d'usage de premier plan, ce qui manque à Unsloth. Si vous avez besoin d'un entraînement multi-nœuds reproductible pour la production, Axolotl est le bon choix.
Unsloth vs. LLaMA-Factory
LLaMA-Factory est livré avec une interface web appelée LlamaBoard qui permet aux non-ingénieurs de configurer et de lancer des exécutions d'entraînement depuis un navigateur, sans écrire de Python. Il offre également la plus large prise en charge d'architectures de modèles dès le premier jour (day-0), ajoutant généralement la compatibilité pour les nouvelles familles de modèles avant Unsloth ou Axolotl. LLaMA-Factory a intégré les backends KTransformers et Megatron-LM en 2026, élargissant ainsi sa gamme de production. Avec 68 400 étoiles GitHub, il devance légèrement Unsloth en taille de communauté.
LLaMA-Factory peut utiliser Unsloth comme backend pour la vitesse, mais sans ce backend, la vitesse d'entraînement brute est comparable à celle d'Axolotl. L'abstraction de l'interface graphique peut masquer les erreurs lors du débogage, et il y a généralement un délai d'initialisation de 2 à 3 minutes avant le début de l'entraînement. Pour les praticiens qui souhaitent un contrôle au niveau du code de leur boucle d'entraînement, l'API Python d'Unsloth est plus transparente.
"Pour les praticiens disposant d'un seul GPU et qui doivent le rentabiliser, rien d'autre ne s'en approche en matière d'efficacité mono-GPU. Les améliorations de vitesse sont réelles, ce n'est pas du marketing." - synthèse de la communauté issue du fil de comparaison des frameworks sur r/LocalLLaMA, mars 2026
"L'équipe d'Unsloth a l'habitude de corriger des bugs de modèles qui échappent même aux auteurs originaux des modèles. Leurs quantifications GGUF pour Qwen3.5 ont récolté 1 100 upvotes dans un seul fil de discussion. Ce genre de confiance de la communauté compte lorsque vous choisissez sur qui vous appuyer pour les outils d'entraînement de modèles." - r/LocalLLaMA, mars 2026
À quoi ressemble la réalité du workflow de fine-tuning
Pour les utilisateurs exécutant directement la bibliothèque Python, le workflow est proche de celui de HuggingFace Transformers standard, Unsloth servant de remplacement direct (drop-in) pour le chargement du modèle. Vous appelez FastLanguageModel.from_pretrained() au lieu de AutoModelForCausalLM.from_pretrained(), vous enveloppez le modèle avec get_peft_model() pour ajouter les adaptateurs LoRA, puis vous l'entraînez avec un SFTTrainer ou GRPOTrainer standard de HuggingFace. Les noyaux d'Unsloth s'activent automatiquement. Les modifications de code par rapport à un script d'entraînement HuggingFace standard sont minimes, généralement 3 à 5 lignes.
Pour les utilisateurs d'Unsloth Studio, le point d'entrée est une interface sur navigateur s'exécutant localement. Data Recipes vous permet de glisser-déposer des fichiers PDF, CSV ou DOCX et de les acheminer via un workflow de nœuds visuels pour produire des jeux de données d'entraînement formatés. Cela élimine le plus grand point de friction pour les non-ingénieurs : le formatage des jeux de données. Le Model Arena vous permet de charger deux modèles fine-tunés et de les tester côte à côte sur les mêmes prompts.
Le moment DeepSeek-R1 en janvier 2025 a illustré à la fois la confiance de la communauté envers Unsloth et le style de travail de l'équipe. Lorsque DeepSeek a publié R1 (671B de paramètres, format FP8, 720GB de téléchargement), la plupart des chercheurs ne pouvaient pas l'exécuter. En quelques jours, Unsloth a publié des quantifications GGUF sur plusieurs niveaux de précision. Le 27 janvier, ils ont publié des GGUF dynamiques 1.58-bit qui ont réduit la taille du fichier de 80 %, ramenant le modèle à moins de 150GB. Le 6 février, ils ont ajouté la prise en charge de l'entraînement GRPO afin que les utilisateurs puissent fine-tuner des modèles de raisonnement personnalisés sur l'architecture. Chaque mise à jour était accompagnée de publications de Daniel Han directement sur r/LocalLLaMA avec des guides de configuration. Le schéma s'est répété avec DeepSeek-R1-0528 en mai 2025, où Unsloth a publié des quantifications dynamiques 1-bit qui ont compressé le modèle de 720GB à 185GB dans les 24 heures suivant sa sortie.
Vous pouvez associer les modèles fine-tunés par Unsloth avec Hugging Face Hub pour l'hébergement et la distribution des modèles. Pour un fine-tuning géré sans matériel local, Predibase (qui fait désormais partie de Rubrik suite à son acquisition en juin 2025) et OpenPipe offrent des alternatives cloud qui gèrent l'infrastructure, bien qu'elles ajoutent des coûts par exécution et suppriment le contrôle local des données.
À qui s'adresse Unsloth
Le profil idéal :
Unsloth est conçu pour les ingénieurs ML, les chercheurs et les praticiens techniquement capables qui s'entraînent sur du matériel GPU NVIDIA et souhaitent tirer le maximum d'efficacité de ce dont ils disposent. Un chercheur exécutant une seule RTX 4090 (24GB) qui serait autrement bloqué par la VRAM est l'utilisateur principal d'Unsloth. La bibliothèque permet le fine-tuning de Llama-3.1 20B sur 24GB avec QLoRA, ce qui provoquerait une erreur OOM (Out of Memory) avec les implémentations standards. Les laboratoires universitaires aux budgets limités, les chercheurs indépendants en fine-tuning et les communautés open source créant des variantes de modèles personnalisées constituent le public pour lequel les frères Han ont conçu cet outil.
Unsloth convient également aux équipes ayant des exigences strictes en matière de confidentialité des données. Si les données d'entraînement ne peuvent pas quitter votre infrastructure, ou si le RGPD, l'HIPAA ou d'autres contraintes de conformité s'appliquent, l'entraînement local auto-hébergé via Unsloth (ou Axolotl) est le bon choix architectural par rapport aux plateformes cloud gérées.
Ce que n'est pas Unsloth
À éviter si :
Vous utilisez des GPU AMD. La prise en charge d'AMD ROCm est expérimentale et instable en mai 2026. bitsandbytes se désactive automatiquement pour AMD, vous faisant passer d'un LoRA 4-bit à 16-bit. Le ticket GitHub #5180 (avril 2026) documente des échecs de détection de l'accélérateur HIP dans Unsloth Studio 2026.4.5. Les utilisateurs Windows équipés d'AMD ont une demande de fonctionnalité ouverte (#4280) qui n'a pas été traitée.
Vous avez besoin d'un entraînement distribué multi-GPU sérieux dans la version gratuite. La bibliothèque open source se concentre sur l'optimisation mono-GPU. La prise en charge multi-GPU nécessite le niveau Pro payant, et même les utilisateurs Pro ont signalé des échecs DDP sur certaines architectures de modèles (ticket #3915, configuration double H100, mai 2026). Si votre workflow est un entraînement distribué multi-nœuds, Axolotl avec FSDP2 ou une plateforme gérée est plus fiable.
Vous êtes sur macOS et souhaitez entraîner des modèles. La prise en charge de Mac dans Unsloth Studio est limitée à l'inférence. L'entraînement MLX est sur la feuille de route mais n'a pas été déployé en mai 2026.
Vous n'êtes pas ingénieur et avez besoin d'un fine-tuning entièrement géré avec des pipelines de déploiement inclus. Unsloth Studio réduit considérablement la barrière avec son interface no-code, mais il suppose toujours que vous gérez votre propre matériel et que vous vous occupez de l'installation des pilotes GPU, des environnements Python et des workflows d'exportation de modèles. OpenPipe ou Predibase sont de meilleurs choix pour les équipes qui souhaitent une plateforme pour gérer l'infrastructure de bout en bout.
Vous avez besoin d'une prise en charge dès le premier jour (day-0) pour chaque nouvelle architecture de modèle. LLaMA-Factory déploie généralement la compatibilité pour les nouvelles familles de modèles plus rapidement qu'Unsloth, qui a parfois une période de décalage après les sorties d'architectures majeures. Par exemple, l'intégration de Gemma 4 a nécessité plusieurs correctifs en avril 2026 (de v0.1.35 à v0.1.36) pour stabiliser l'accumulation de gradients et les problèmes d'indexation d'inférence.
Il convient également de souligner la distinction de licence au sein même d'Unsloth. La bibliothèque Python principale (pip install unsloth) est sous licence Apache 2.0, ce qui permet une utilisation commerciale et une redistribution sans restriction. Unsloth Studio, l'application graphique, est sous licence AGPL-3.0, ce qui exige que tout logiciel dérivé que vous distribuez soit également open source. Pour la plupart des chercheurs et praticiens exécutant un fine-tuning local, aucune de ces licences ne constitue un obstacle pratique. Pour les entreprises prévoyant de redistribuer un produit construit sur l'interface d'Unsloth Studio, la clause AGPL nécessite un examen juridique.
L'absence de prix public pour le niveau Pro payant crée des frictions pour les équipes essayant d'évaluer le coût total d'une décision d'infrastructure de fine-tuning. Vous ne pouvez pas comparer directement "Unsloth Pro vs Predibase vs Together AI" sans demander un devis. Cette opacité est une plainte légitime pour la planification budgétaire, même si le niveau open source est fonctionnellement complet pour de nombreux workflows. Si vous êtes une équipe qui a atteint le plafond du mono-GPU et qui a besoin d'un entraînement multi-GPU, intégrez cette conversation avec le fournisseur tôt dans votre processus d'évaluation.
Avis des utilisateurs
Aucun avis pour l'instant. Soyez le premier à partager votre expérience !
Se connecter pour écrire un avis.
Présent dans les collections
Listes sélectionnées incluant Unsloth.
Articles associés
Guides et articles en lien avec Unsloth.

Run Open Source AI Models Locally: Battle-Tested Guide

Local Agentic Coding May 2026: Qwen 3.6 + BeeLlama.cpp + Star Elastic

Grok 4.3 API for Agents (May 2026): Pricing, Benchmarks, Migration

Vantaige Launches the LLM VRAM Calculator: A Free GPU Compatibility Finder for Open-source and Open-Weight AI

Mistral Medium 3.5 Self Host: 77.6% SWE-Bench on 4 GPUs (2026)
