

Gemma est la famille de modèles de langage à poids ouverts de Google DeepMind, téléchargeables et auto-hébergeables gratuitement. Gemma 4 (avril 2026) offre des capacités de raisonnement et multimodales de pointe sous licence Apache 2.0, allant des modèles edge de 2B au modèle phare dense de 31B.
Gemma est la famille de modèles de langage à poids ouverts de Google DeepMind, lancée pour la première fois en février 2024 et qui en est aujourd'hui à sa quatrième génération majeure. Contrairement à l'API fermée de Gemini, les poids de Gemma sont entièrement téléchargeables et auto-hébergeables : aucun abonnement, aucun plafond d'utilisation et, depuis Gemma 4 (sorti le 2 avril 2026), aucune licence personnalisée restrictive. Le nom vient de « gemstone » (pierre précieuse), l'idée étant d'être petit, précis et précieux. La famille se situe entre les expérimentations d'amateurs et l'inférence locale de niveau production, au service des développeurs, des chercheurs et des entreprises qui souhaitent une intelligence de la classe de Gemini sans dépendance au cloud.
Gemma 4 est disponible en quatre tailles : Effective 2B (E2B, 2.3B de paramètres actifs), Effective 4B (E4B, 4.5B), une variante Mixture-of-Experts de 26B activant 4B de paramètres par passe avant, et un modèle phare dense de 31B. Tous les modèles gèrent nativement les entrées d'images et de vidéos ; les E2B et E4B prennent en outre en charge les entrées audio via un encodeur conformer USM, ce qui en fait les seuls modèles ouverts de moins de 5B dotés d'une compréhension audio native. Les fenêtres de contexte atteignent 256K tokens sur les modèles plus grands. La famille est multilingue par conception, entraînée sur plus de 140 langues, et repose sur les mêmes bases de recherche que Gemini 3. La licence Apache 2.0 signifie qu'il n'y a aucune restriction de MAU, aucune exigence d'attribution, et aucun obstacle à la redistribution commerciale ou au fine-tuning pour des produits concurrents.
Gemma en un coup d'œil, avril 2026
La gamme actuelle de Gemma 4 couvre tout le spectre de déploiement, de l'inférence mobile sur appareil aux stations de travail à un seul GPU, en passant par les racks de serveurs multi-GPU.
Gemma 4 E2B : 2.3B de paramètres effectifs. Contexte : 128K. Multimodal : image, vidéo, audio. Cible le mobile et l'edge via MediaPipe/LiteRT. Atteint ~60 tok/s sur une RTX 3070.
Gemma 4 E4B : 4.5B de paramètres effectifs. Contexte : 128K. Même pile multimodale que le E2B. Le « meilleur petit modèle » recommandé pour l'inférence locale sur ordinateur de bureau.
Gemma 4 26B-A4B : Mixture-of-Experts, 26B au total, 4B actifs par token. Contexte : 256K. Tourne à ~11 tok/s sur RTX 4090 Q4. Atteint 1441 sur LM Arena. 97% de la qualité du modèle dense de 31B avec environ 8 fois moins de calcul par étape d'inférence.
Gemma 4 31B Dense : Le modèle phare. Contexte : 256K. Benchmarks : MMLU Pro 85.2%, AIME 2026 89.2%, GPQA Diamond 84.3%, LiveCodeBench 80.0%. Classé n°3 mondial sur le classement texte des modèles ouverts LM Arena en avril 2026.
L'architecture introduit les Per-Layer Embeddings (PLE) : chaque token reçoit des vecteurs dédiés par couche combinant l'identité du token avec des composants sensibles au contexte plutôt qu'un seul embedding initial, permettant une spécialisation spécifique à la couche. Un cache KV partagé (les N dernières couches réutilisent les tenseurs K/V des couches précédentes) réduit la pression sur la mémoire lors de l'inférence à contexte long. L'attention alterne entre une fenêtre glissante locale (512-1024 tokens) et des couches globales à contexte complet, réduisant le calcul sur les entrées longues sans sacrifier la cohérence.
Les générations précédentes restent disponibles. Gemma 3 (12 mars 2025) dans les tailles 1B, 4B, 12B et 27B est encore largement utilisé pour le fine-tuning, et Gemma 2 (2B, 9B, 27B) reste pris en charge sur Hugging Face. Toutes les générations sont disponibles via Ollama, llama.cpp, MLX (Apple Silicon) et Hugging Face Transformers.
Ce pour quoi Gemma est vraiment doué
Les domaines les plus forts de Gemma 4, soutenus par des benchmarks et des tests utilisateurs, sont le raisonnement mathématique, la génération de code et la compréhension multimodale. Sur AIME 2026, le 31B obtient 89.2%, un score supérieur à celui de Llama 4 Scout ou de Qwen 3.5 dans la même classe de paramètres. Sur Codeforces, il atteint un ELO de 2150, en tête de la catégorie 27-31B. Le MoE de 26B produit un code que les utilisateurs décrivent comme qualitativement indiscernable des modèles d'API payants, pour une fraction du coût d'exploitation.
« Le genre de qualité qui vous fait relire la requête pour vérifier si vous ne l'avez pas accidentellement routée via Claude Sonnet d'une manière ou d'une autre. » - PIXIPACE, Medium, avril 2026
L'aspect multimodal est réel et différencié. Tous les modèles Gemma 4 gèrent des images à résolution variable avec des budgets de tokens configurables (70 à 1120 tokens de vision), une sortie native de boîtes englobantes pour la détection d'objets, la reconstruction HTML à partir de captures d'écran et l'analyse de graphiques. La capacité audio sur E2B et E4B est unique dans la catégorie des moins de 5B. Pour les équipes qui construisent des pipelines sur appareil traitant des entrées vocales en même temps que des images, il n'y a actuellement aucun modèle à poids ouverts concurrent de cette taille offrant la même couverture.
« Je suis impressionné, des modèles extrêmement intelligents, une intelligence de pointe sans être gourmands en ressources comme les modèles de plus de 70 milliards... Cela met tout le monde sur un pied d'égalité et permet à quiconque disposant d'un système à peu près correct d'avoir accès à l'IA. » - DorkMckork1, Hugging Face, avril 2026
Le passage à la licence Apache 2.0 qui a accompagné Gemma 4 a une importance pratique : les équipes juridiques des grandes entreprises ont pré-approuvé Apache 2.0. Les précédentes conditions d'utilisation de Gemma, bien que raisonnables dans l'esprit, comportaient des exceptions vagues qui rendaient les services d'achats nerveux. Cette friction a disparu.
Où Gemma échoue : les modes de défaillance que les utilisateurs rencontrent
La plainte la plus persistante concerne la pression sur la mémoire du cache KV dans les contextes plus longs. Les utilisateurs exécutant le 26B ou le 31B à plus de 40K tokens sur 24GB de VRAM signalent des plantages par manque de mémoire et une dégradation de la qualité à mesure que le cache augmente. L'architecture de cache KV partagé est efficace en théorie, mais impitoyable lorsqu'un grand modèle quantifié remplit la mémoire disponible. Une solution de contournement (quantification du cache KV en Q4) aide, mais ajoute une surcharge de configuration.
La surcharge de routage du MoE est une surprise pratique. Bien qu'il n'active que 4B de paramètres par passe avant, le MoE 26B-A4B tourne à environ 11 tok/s sur une RTX 4090 Q4, ce qui est plus lent que l'équivalent de Qwen 3.5 à environ 35 tok/s. Les utilisateurs qui s'attendent à une « vitesse de 4B » d'un MoE de 26B sont souvent déçus. Pour les applications sensibles à la latence, le modèle dense de 31B ou un modèle plus petit est un meilleur choix.
La fragilité de l'écosystème d'inférence au lancement est un schéma récurrent chez Gemma. La sortie de Gemma 4 le 2 avril 2026 s'est accompagnée de : sorties incompréhensibles après ~230 tokens avec -nkvo activé dans llama.cpp (issue GitHub #21726), appels d'outils cassés dans Ollama v0.20.0, blocages de Flash Attention sur les prompts Apple Silicon au-delà de 500 tokens, et plantages avec « unknown model architecture: 'gemma4' » sur des conteneurs non patchés. Le modèle a dû être re-téléchargé sur Hugging Face à quatre reprises au fur et à mesure que les correctifs arrivaient. La communauté s'est accordée sur un message clair : attendez au moins une semaine avant de juger la qualité d'une nouvelle version de Gemma à travers une pile d'inférence instable.
L'OCR de vision sur du texte dense est incohérent. Un fil de discussion sur Hugging Face concernant le modèle Gemma 4 31B-it a signalé que le modèle « ne peut pas reconnaître l'intégralité du texte sur l'image » de manière fiable. L'analyse de graphiques est plus forte que l'OCR de documents. La précision du rappel factuel de base a été documentée comme faible dans Gemma 3 (score SimpleQA de 10.0) ; Gemma 4 s'est considérablement amélioré, mais la famille n'excelle pas dans les requêtes de type recherche par cœur sans génération augmentée par la recherche.
Une voix critique sur Hugging Face lors de la semaine de lancement a capturé une véritable frustration :
« Sortie un peu décevante, à mon avis... J'aimerais juste que les grandes entreprises technologiques s'inspirent d'OpenAI et publient des OSS réellement compétitifs au lieu de sortir des modèles génériques... » - urroxyz, Hugging Face, avril 2026
Cette critique exagère la situation. Les benchmarks ne sont pas génériques. Mais elle reflète un segment de la communauté de l'IA locale qui trouve Gemma moins différencié qu'ils ne le souhaiteraient pour des workflows spécifiques d'agents et d'appels d'outils.
Gemma vs. Llama 4 vs. Qwen 3.5
Llama 4 (Meta) utilise une architecture exclusivement MoE à une échelle différente : Scout possède 109B de paramètres au total avec 17B actifs par token ; Maverick en a 400B au total avec 17B actifs. La fenêtre de contexte de 10M de tokens de Scout est son principal élément différenciateur (Gemma 4 plafonne à 256K). Cependant, la licence communautaire personnalisée de Llama 4 impose un plafond de 700M de MAU, exige la marque « Built with Llama » et interdit l'utilisation des sorties de Llama pour entraîner des modèles concurrents. Pour les équipes d'entreprise qui lancent des produits commerciaux, cette licence nécessite un examen juridique dédié. La licence Apache 2.0 de Gemma 4 ne comporte aucune de ces conditions. Sur les benchmarks, Gemma 4 31B devance Llama 4 Scout sur GPQA Diamond (84.3% contre 74.3%), AIME 2026 et le codage. Llama 4 n'a pas de support audio natif ; les E2B/E4B de Gemma en ont un. Pour les besoins bruts en contexte supérieurs à 256K, Llama 4 Scout est la seule option dans la catégorie des poids ouverts.
Qwen 3.5 (Alibaba) est également distribué sous Apache 2.0 et offre le plus large spectre de modèles (de 0.8B à 397B MoE), le 35B-A3B n'activant que 3B de paramètres par token, soit le ratio de parcimonie le plus agressif de sa catégorie. Qwen 3.5 s'exécute environ 3 fois plus vite que Gemma 4 31B dense sur un matériel équivalent (35 tok/s contre 25 tok/s sur RTX 4090 Q4). MMLU Pro favorise légèrement Qwen (86.1% contre 85.2%). Les principaux avantages de Gemma : l'entrée audio sur les petits modèles, l'architecture d'embedding par couche pour une meilleure cohérence sur les contextes longs, une intégration plus étroite avec l'écosystème Gemini (Google AI Studio, Vertex AI), et une gamme plus large de cibles de déploiement incluant MediaPipe/LiteRT pour l'embarqué. Les deux sont véritablement performants ; le choix pratique se résume souvent à savoir si vous avez besoin d'une entrée audio ou d'un débit MoE plus rapide.
Le lancement de Gemma 3 le 12 mars 2025 a été le point d'inflexion. Le 27B a surpassé le modèle fermé Gemini 1.5 Pro dans tous les benchmarks, et le 4B a battu l'ensemble du modèle 27B de Gemma 2. LMSys a placé Gemma 3 27B dans le top 10 mondial. Cela a établi la crédibilité de la famille et défini la trajectoire pour le positionnement plus agressif de Gemma 4.
Le niveau payant en vaut-il la peine ?
Il n'y a pas d'abonnement payant pour Gemma. Les poids sont gratuits sous Apache 2.0. La question du coût concerne uniquement le choix de l'infrastructure. L'auto-hébergement est gratuit au-delà du matériel (le MoE de 26B tient dans 16GB de VRAM en Q4 ; le 31B nécessite 24GB). Google AI Studio fournit un accès gratuit à l'API avec une limite de débit. OpenRouter route le 31B à $0/M tokens sur son niveau gratuit, et à $0.13/$0.38 par million en entrée/sortie sur le standard. Vertex AI coûte $0.15/$0.60 par million pour le MoE de 26B et constitue le bon choix pour les équipes qui ont besoin de SLA gérés et d'une consolidation de la facturation GCP. Pour la plupart des développeurs, Google AI Studio ou l'auto-hébergement couvre tous les besoins jusqu'à ce que l'échelle de production exige une infrastructure gérée.
Meilleurs cas d'usage (et quand l'éviter)
Idéal pour :
L'inférence locale sur du matériel grand public sans coûts d'API cloud. Le 4B ou le MoE de 26B couvre la plupart des tâches de codage et d'assistance.
Les applications mobiles et edge sur appareil nécessitant des entrées multimodales (images, audio, vidéo) sans dépendance au cloud. Seul Gemma propose des modèles de moins de 5B avec une entrée audio native.
Le fine-tuning pour des domaines spécialisés. Les intégrations Unsloth et TRL prennent en charge le fine-tuning multimodal avec des exemples d'agents de style CARLA. Un commentateur sur Hugging Face a noté qu'il « correspond exactement à notre domaine de l'éducation des enfants » et l'a immédiatement mis en production.
Les équipes d'entreprise qui ont besoin d'une licence permissive et juridiquement pré-approuvée (Apache 2.0) et qui souhaitent une intelligence de la qualité de Google sans la tarification cloud de Google.
Les applications d'assistants multilingues dans plus de 140 langues où la qualité des données d'entraînement au niveau de la tokenisation spécifique à la langue est importante.
À éviter quand :
Vous avez besoin d'un contexte au-delà de 256K tokens. Llama 4 Scout gère jusqu'à 10M.
La vitesse d'inférence brute est la priorité absolue. Qwen 3.5 s'exécute plus rapidement sur un matériel équivalent et propose des tailles de modèles de départ plus petites (0.8B).
Vous devez déployer au cours de la première semaine d'une version majeure de Gemma et ne pouvez pas tolérer l'instabilité de l'écosystème d'inférence. Le schéma des bugs de la semaine de lancement est constant d'une génération à l'autre.
Votre cas d'usage est principalement l'OCR de documents sur du texte dense. Les capacités de vision sont plus fortes sur les graphiques et la compréhension des interfaces graphiques que sur la reconnaissance de pages denses en texte.
Démarrer avec Gemma
La voie locale la plus rapide est Ollama : ollama run gemma4 télécharge automatiquement la taille par défaut. Pour Apple Silicon, MLX surpasse Ollama en termes de débit. Pour le contrôle de la quantification, utilisez llama.cpp avec les builds GGUF de ggml-org depuis Hugging Face. Google AI Studio (ai.google.dev) offre un accès gratuit à l'API sans aucune infrastructure. OpenRouter route vers le modèle 31B sans frais sur son niveau gratuit. Le fine-tuning est couvert par Unsloth Studio, TRL et les conteneurs gérés de Vertex AI. Les tokens d'appel de fonction natifs du modèle fonctionnent directement avec des schémas JSON ou des fonctions Python typées.
Avis des utilisateurs
Aucun avis pour l'instant. Soyez le premier à partager votre expérience !
Se connecter pour écrire un avis.
Présent dans les collections
Listes sélectionnées incluant Gemma.
Articles associés
Guides et articles en lien avec Gemma.

Gemma 4 on RTX 4090: Real Tokens/Sec, VRAM & Variant Pick (2026)

Nous Hermes 4: The Self-Hosted Open-Weight Agent Brain (2026)

Mistral Medium 3.5 Self Host: 77.6% SWE-Bench on 4 GPUs (2026)

Run Open Source AI Models Locally: Battle-Tested Guide

Grok 4.3 API for Agents (May 2026): Pricing, Benchmarks, Migration
