Aller au contenu principal
Vantaige
Llama screenshot
Llama logo

Llama

Gratuit

Llama est la famille de modèles de langage à poids ouverts de Meta, allant des versions originales de 2023 jusqu'aux versions MoE multimodales de Llama 4. Gratuits à télécharger et à auto-héberger, ces modèles propulsent des milliers d'outils dérivés et de pipelines d'entreprise à travers le monde.

Fonctionnalités :APIOpen Source

Llama est la famille de grands modèles de langage à poids ouverts conçue et publiée par Meta Platforms. Lancée pour la première fois en février 2023, la famille a évolué à travers quatre générations majeures pour devenir la lignée de modèles la plus dérivée (forked) de l'histoire de l'IA, propulsant plus de 20 000 modèles dérivés sur Hugging Face. Contrairement aux fournisseurs de modèles fermés, Meta publie les véritables poids des modèles en téléchargement : les chercheurs, les développeurs et les entreprises peuvent exécuter Llama localement sur leur propre matériel, l'affiner (fine-tune) sur des jeux de données privés et redistribuer des versions modifiées sans payer de frais d'API par token.

La génération phare actuelle, Llama 4 (sortie le 5 avril 2025), est passée des transformeurs denses à une architecture clairsemée de mélange d'experts (MoE) et a ajouté une capacité multimodale native. Llama 4 Scout offre 17 milliards de paramètres actifs à partir d'un pool de 109 milliards de paramètres répartis sur 16 experts, avec une fenêtre de contexte annoncée de 10 millions de tokens et la capacité de tenir sur un seul GPU de classe serveur. Llama 4 Maverick passe à l'échelle avec 400 milliards de paramètres au total répartis sur 128 experts, dont 17 milliards actifs au moment de l'inférence, et une fenêtre de contexte de 1 million de tokens. Les deux modèles traitent le texte et les images conjointement via une fusion précoce (early fusion). L'accès est gratuit pour l'auto-hébergement ; des fournisseurs tiers comme Together AI, Fireworks et Groq proposent les modèles via API à des tarifs commençant autour de $0.08 par million de tokens en entrée pour Scout.

Llama en un coup d'œil, avril 2025

La sortie de Llama 4 le 5 avril 2025 a fait passer la famille des transformeurs denses à un mélange d'experts (MoE) clairsemé, où chaque token n'active qu'un sous-ensemble de sous-réseaux "experts" spécialisés plutôt que l'ensemble complet des paramètres. Deux modèles sont accessibles au public :

  • Llama 4 Scout (17B/109B) : 17B actifs, 109B au total, 16 experts, contexte de 10M de tokens (ajusté aux instructions). Tient sur un seul GPU H100 avec quantification. Entraîné sur jusqu'à 40 billions de tokens couvrant 200 langues.

  • Llama 4 Maverick (17B/400B) : 17B actifs, 400B au total, 128 experts, contexte de 1M de tokens (ajusté aux instructions). Disponible en BF16 et FP8. Nécessite une configuration multi-GPU ou un service distribué pour une précision maximale.

  • Llama 4 Behemoth (~2 billions de paramètres au total) : Annoncé en avril 2025 mais non publié publiquement en date d'avril 2026. Conçu comme le modèle de recherche de pointe de Meta avec ~288B de paramètres actifs et une compréhension native de la vidéo.

La génération précédente Llama 3.x reste largement déployée. Llama 3.3 70B et Llama 3.1 8B sont toujours privilégiés par de nombreux développeurs pour les pipelines de code, en partie parce que leur architecture dense offre un comportement de service plus prévisible que la structure MoE de Llama 4.

Ce que Llama offre réellement

Pour les équipes ayant des exigences strictes en matière de confidentialité des données, la valeur de Llama est évidente : vos données ne quittent jamais votre infrastructure. Les plateformes de communication de pièces juridiques, les hôpitaux traitant des dossiers de patients, les sous-traitants de la défense analysant des documents sensibles et les institutions financières soumises à des obligations réglementaires de traitement des données déploient tous Llama précisément pour cette raison. Les poids se téléchargent une seule fois ; l'inférence s'exécute entièrement dans votre propre environnement.

L'écosystème que Llama a su attirer constitue son deuxième atout majeur. Ollama, llama.cpp, vLLM et Text Generation Inference (TGI) prennent tous en charge Llama de manière native. AWS Bedrock, Google Vertex AI et Azure proposent tous des points de terminaison Llama hébergés. Hugging Face héberge les poids du modèle avec une intégration native de Transformers. Si un développeur a besoin d'exécuter un modèle localement, de l'affiner sur des données spécifiques à un domaine ou de se connecter à un backend d'inférence, il existe des tutoriels reconnus et des outils testés en production pour chaque étape.

L'ajustement fin (fine-tuning) est le troisième pilier. LoRA et QLoRA via Hugging Face PEFT permettent aux équipes d'adapter Llama à des domaines très précis : analyse de contrats, résumé de notes cliniques, conformité réglementaire. Les fournisseurs de modèles fermés ne le permettent pas.

"Ollama + Llama 3.1 8B. S'il ne fait pas ce dont vous avez besoin après une semaine d'utilisation réelle, alors vous comprenez suffisamment bien vos lacunes pour faire un meilleur choix." -- Fil de discussion de la communauté r/LocalLLaMA, 2025

Où Llama échoue -- les limites que les utilisateurs rencontrent fréquemment

L'accueil de la génération Llama 4 par la communauté des développeurs a été très négatif sur certains points qui méritent d'être abordés en toute transparence.

Dégradation du contexte long à grande échelle. La promesse d'un contexte de 10 millions de tokens pour Llama 4 Scout ne tient pas la route en pratique au-delà de 256K tokens. Les modèles ont été pré-entraînés sur des séquences allant jusqu'à 256K tokens ; le chiffre de 10M s'applique à un ajustement fin basé sur des instructions qui étend l'encodage positionnel mais ne garantit pas la qualité du raisonnement sur toute la longueur. Des benchmarks indépendants ont révélé que la précision chutait à 15.6% sur des tâches de récupération complexes à des longueurs étendues. Gemini a conservé plus de 90% de ses performances à des longueurs équivalentes lors des mêmes tests. Des bugs d'implémentation dans le mode de parallélisme de pipeline de vLLM ont provoqué des résultats inexploitables sur Llama 4 à plus de 64K tokens, comme documenté dans plusieurs tickets GitHub.

"Llama Scout et Llama Maverick semblent profondément décevants -- décevants au point que 'les gens pensent qu'ils doivent être mal configurés pour être aussi mauvais.'" -- Fil de discussion Hacker News, avril 2025

Performances de codage en deçà des attentes. Llama 4 Maverick a obtenu un score de 16% sur le benchmark de codage Aider Polyglot, à la traîne derrière Qwen 2.5 Coder bien qu'il soit 10 fois plus grand en termes de paramètres actifs. Sur les benchmarks de codage axés sur le SRE, il est arrivé dernier avec une précision de 69.5%, soit 6% en dessous de DeepSeek V3 et 18% derrière GPT-4o. Les développeurs ont noté que Llama 3.3 70B, la génération précédente, surpassait Llama 4 Maverick sur certaines tâches de codage. Les équipes ayant des charges de travail axées sur le code ont trouvé peu de raisons de migrer vers la nouvelle version.

Aucun petit modèle grand public dans Llama 4. La génération Llama 3.2 comprenait des modèles 1B et 3B qui fonctionnaient sur du matériel grand public et des appareils mobiles. Llama 4 a été lancé uniquement avec Scout (109B au total) et Maverick (400B au total). Le plus petit modèle Llama 4 accessible au public nécessite un matériel de classe serveur, excluant de fait les segments des amateurs et des développeurs sur MacBook qui ont largement contribué à l'adoption de Llama 3. Il s'agit d'une lacune structurelle, et non d'un problème de configuration.

Qualité des résultats décrite comme fade. De multiples analyses de développeurs ont souligné que les résultats de Llama 4 étaient verbeux et génériques par rapport à ses concurrents. Une observation récurrente : les modèles produisent des réponses longues et truffées d'emojis plutôt que des réponses précises et directes. Pour les cas d'usage en production nécessitant un suivi strict des instructions, certaines équipes ont trouvé les modèles Llama 3.1 plus prévisibles.

Llama vs. Mistral vs. Qwen

Tous trois sont des familles de modèles à poids ouverts. Les différences se situent au niveau de l'architecture, des licences et des benchmarks.

Mistral (Mistral AI, France) : Mistral Small 4 (mars 2026) utilise une architecture MoE avec 119B de paramètres au total mais seulement 4 experts actifs par token, ce qui donne environ 6B de paramètres actifs par inférence -- soit moins de la moitié des 17B actifs de Llama 4 Scout. Une empreinte active plus petite signifie un coût d'inférence par token inférieur à matériel équivalent. La licence est Apache 2.0 : entièrement permissive, sans plafond de MAU (utilisateurs actifs mensuels), sans restrictions en aval, sans exigence d'attribution. La fenêtre de contexte de Mistral est de 256K (plus petite que ce que revendique Scout, mais plus proche de ce que le matériel offre réellement de manière fiable). Mistral n'a pas le même volume de modèles dérivés par la communauté, mais sa licence plus claire en a fait le choix par défaut pour les startups préoccupées par la clause des 700M de MAU de Llama.

Qwen (Alibaba, Chine) : Qwen 3.5/3.6 utilise également une architecture MoE avec environ 397B de paramètres au total et 17B actifs, ce qui le rend directement comparable à Llama 4 Scout en termes de calcul actif. La licence est Apache 2.0 sans aucune restriction. Qwen est en tête des benchmarks de codage pour la période 2025-2026 : Qwen 2.5-Coder-32B a dominé les classements de codage, et Qwen 3.6 Plus obtient un score de 78.8% sur SWE-bench contre environ 70% pour Llama 4 Maverick. Début 2026, Qwen a dépassé Llama en nombre total de téléchargements sur Hugging Face avec près d'un milliard de téléchargements cumulés. La part des modèles dérivés sur Hugging Face a atteint 69% pour Qwen contre 11% pour Llama en février 2026. La principale préoccupation concernant Qwen est qu'il est développé par Alibaba, ce qui soulève des questions de traçabilité des données et de conformité géopolitique pour certains acheteurs d'entreprise qui ne s'appliquent pas à Llama.

En résumé : le nombre de paramètres actifs de Llama 4 dépasse celui de Mistral à une échelle totale similaire, et son écosystème est plus vaste que celui de ses deux concurrents. Mais Mistral et Qwen utilisent tous deux la licence Apache 2.0 sans restrictions commerciales, et Qwen est en tête pour le codage à puissance de calcul active comparable.

Le piège de la licence -- ce que signifient réellement 700M de MAU

L'accord de licence communautaire Llama 4 de Meta accorde des droits libres de redevances pour utiliser, modifier et distribuer les poids dans des produits commerciaux, avec une limite stricte : si votre produit ou service compte plus de 700 millions d'utilisateurs actifs mensuels, votre licence est automatiquement résiliée et vous devez contacter Meta pour négocier un accord distinct. Meta n'a aucune obligation d'accorder cet accord, peut imposer n'importe quelles conditions et peut refuser sans explication.

Ce seuil semble énorme jusqu'à ce que l'on considère qu'il s'applique au produit dans son ensemble, et non à la fonctionnalité d'IA spécifiquement. Une entreprise de 800 millions d'utilisateurs qui souhaite ajouter un chatbot d'assistance propulsé par Llama dans un coin de sa plateforme est techniquement en dehors de la licence. La clause s'applique également à l'ensemble des filiales : c'est le nombre combiné d'utilisateurs d'un groupe d'entreprises qui compte, et non celui d'une seule filiale.

Les analystes juridiques ont noté que la restriction des 700M de MAU et la définition formelle de l'open source par l'OSI sont incompatibles : Llama est plus précisément décrit comme "source disponible" (source available) plutôt qu'open source, malgré le discours marketing de Meta. Cela a son importance pour les équipes d'achat qui exigent des licences approuvées par l'OSI pour les logiciels utilisés dans les systèmes de production.

Mistral et Qwen, en revanche, sont publiés sous licence Apache 2.0. Aucun plafond d'utilisateurs, aucune exigence d'attribution, aucune négociation nécessaire.

Meilleurs cas d'usage et quand éviter Llama

Où Llama gagne sa place :

  • Pipelines de confidentialité des données d'entreprise : Les équipes juridiques, de santé, de finance et de défense déployant le RAG sur des documents internes où la souveraineté des données est non négociable. Les poids ouverts signifient que l'inférence s'exécute entièrement au sein de votre infrastructure.

  • Ajustement fin pour des domaines précis : Les équipes qui ont besoin d'un modèle comprenant une terminologie propriétaire, un langage réglementaire spécifique ou un raisonnement propre à un domaine. L'ajustement fin LoRA/QLoRA sur Llama est bien documenté et pris en charge par l'ensemble de la chaîne d'outils Hugging Face.

  • Applications à fort volume avec des exigences de faible coût par token : L'auto-hébergement de Llama sur votre propre cluster GPU coûte beaucoup moins cher à grande échelle que de payer les tarifs des API propriétaires. Pour les applications générant des centaines de millions de tokens par mois, l'aspect économique favorise les poids ouverts.

  • Recherche et expérimentation : Les chercheurs en interprétabilité, les équipes d'alignement et les red-teamers qui ont besoin d'un accès en boîte blanche aux poids du modèle pour sonder les représentations internes.

Quand éviter Llama :

  • Votre besoin principal est l'assistance au codage : Qwen 2.5-Coder et DeepSeek Coder surpassent Llama 4 sur les benchmarks de codage à nombre de paramètres actifs comparable. Si le codage est le cas d'usage principal, le choix est clair.

  • Vous avez besoin d'une fenêtre de contexte fiable de plus de 1M de tokens : Les promesses de contexte de 10M pour Scout et de 1M pour Maverick ne tiennent pas la route dans les benchmarks de récupération réels au-delà de 256K tokens. Gemini 1.5/2.5 est l'outil approprié pour les véritables tâches de recherche d'aiguille dans une botte de foin sur des contextes très longs.

  • Vous voulez une interface de chat sans ingénierie : Llama fournit des poids, pas une application. Obtenir une interface de chat fonctionnelle nécessite Ollama, llama.cpp ou un point de terminaison hébergé par un tiers. Les utilisateurs non techniques devraient utiliser directement Claude, Gemini ou ChatGPT.

  • Votre entreprise a ou prévoit plus de 700M de MAU : La structure de la licence nécessite une négociation avec Meta au-dessus de ce seuil. Mistral ou Qwen sous Apache 2.0 sont structurellement plus simples pour les grandes plateformes.

Démarrer avec Llama

La voie locale la plus rapide est Ollama : installez-le, exécutez ollama pull llama3.2 pour un modèle 3B sur du matériel grand public, et accédez-y via ollama run llama3.2 ou une API locale sur localhost:11434. Llama 4 Scout nécessite un GPU de classe serveur ; les versions quantifiées via llama.cpp fonctionnent sur des machines grand public dotées d'une grande VRAM. Pour un accès API cloud sans auto-hébergement, Together AI et Fireworks proposent Scout à environ $0.08/M de tokens et Maverick à environ $0.15-$0.30/M de tokens. Hugging Face héberge les poids sous l'organisation meta-llama ; Transformers v4.51.0+ prend en charge Llama 4 de manière native, y compris les entrées multimodales.

Avis des utilisateurs

Aucun avis pour l'instant. Soyez le premier à partager votre expérience !

Se connecter pour écrire un avis.

Présent dans les collections

Listes sélectionnées incluant Llama.

Articles associés

Guides et articles en lien avec Llama.