
Zhipu GLM est une famille de grands modèles de langage à poids ouverts (open-weight) développée par Z.ai (Zhipu AI), basée à Pékin, et reposant sur une architecture de mélange d'experts (mixture-of-experts). Sous licence MIT et auto-hébergeables, les générations GLM-4.5 et GLM-4.6 offrent un contexte de 200K tokens, des niveaux d'API flash gratuits et des résultats de référence compétitifs face à Claude et DeepSeek.
Zhipu GLM est une famille de grands modèles de langage à poids ouverts conçue par Z.ai, la marque internationale de Zhipu AI, une startup pékinoise issue de l'Université Tsinghua en 2019. La série GLM utilise une architecture de mélange d'experts (MoE) et publie ses poids sous licence MIT, ce qui signifie que les développeurs peuvent auto-héberger, affiner (fine-tune) et déployer commercialement les modèles sans obligations de redevances ni restrictions d'utilisation. L'interface web se trouve sur chat.z.ai ; l'accès à l'API passe par bigmodel.cn et docs.z.ai. À la mi-2026, la génération active comprend GLM-4.5 (sorti en août 2025), GLM-4.6 (septembre 2025) et GLM-4.7 (décembre 2025), chacun représentant un bond incrémental mais mesurable en matière de codage, de raisonnement et de capacités agentiques.
Les fonctionnalités principales sont claires : des fenêtres de contexte de 200K tokens (à partir de GLM-4.6), un double mode de réflexion/non-réflexion pour arbitrer entre profondeur et vitesse, un support de la vision multimodale via les variantes GLM-V, et une compatibilité totale avec les clients API compatibles OpenAI, ce qui en fait un remplacement direct dans des outils comme Cline, Roo Code et OpenCode. Des variantes flash gratuites (GLM-4.7-Flash, GLM-4.5-Flash) sont disponibles sans frais via l'API pour les tâches légères. L'accès payant à l'API pour le modèle complet GLM-4.5 coûte $0.60/million de tokens en entrée et $2.20/million de tokens en sortie, soit environ 5 à 6 fois moins cher que Claude Sonnet à des niveaux de capacité comparables. Les poids ouverts sont sur HuggingFace (zai-org/GLM-4.5, zai-org/GLM-4.6) et ModelScope, avec une prise en charge intégrée de l'inférence vLLM et SGLang.
Zhipu GLM en un coup d'œil, mai 2026
La famille GLM couvre plusieurs variantes de modèles actives. GLM-4.5 utilise 355 milliards de paramètres au total avec 32 milliards actifs (routage MoE), un contexte de 128K tokens et une licence MIT pour le déploiement commercial. GLM-4.5-Air réduit cela à 106B au total et 12B actifs, diminuant considérablement les exigences matérielles tout en préservant la majeure partie de la qualité des benchmarks. GLM-4.6 a étendu le contexte à 200K tokens, amélioré l'efficacité des tokens d'environ 15 % par rapport à GLM-4.5, et a atteint la première place sur LMArena parmi les modèles ouverts lors de son lancement en septembre 2025. GLM-4.7, sorti le 22 décembre 2025, a introduit un comportement de « réflexion avant action », une pause de raisonnement préalable à l'action qui a produit une amélioration de 38 % sur le benchmark Humanity's Last Exam (HLE) par rapport à GLM-4.6. Le modèle multimodal GLM-4.6V (106B) et sa version plus petite GLM-4.6V-Flash (9B, gratuit pour un usage commercial) ajoutent la compréhension des images à la famille. Tous les modèles prennent en charge nativement le chinois et l'anglais, reflétant le marché principal de Z.ai et l'un des véritables avantages concurrentiels de la famille pour les déploiements d'entreprise bilingues.
Les véritables points forts de Zhipu GLM
Les chiffres des benchmarks constituent le point de départ le plus objectif. GLM-4.5 a obtenu 98.2% sur les problèmes de compétition mathématique AIME 2025, égalant Claude Opus 4 sur cette tâche. Sur les benchmarks d'appel d'outils (tool-calling), il a devancé Claude Sonnet 4 (90.6% contre 89.5%). Sur les tâches d'agent de navigation web, GLM-4.5 a surpassé Claude 4 Opus (26.4% contre 18.8%). Avec GLM-4.6, les performances de codage sur LiveCodeBench ont atteint 82.8%, s'approchant de la fourchette moyenne des 80 de Claude 4. GLM-4.6 a obtenu 93.9% sur AIME 2025 et 82.9% sur GPQA, faisant pratiquement jeu égal avec Claude 4.5 sur ce dernier.
Pour les développeurs, la licence MIT est la caractéristique qui change la donne. L'auto-hébergement de GLM-4.5 via Ollama ou vLLM signifie aucune facturation par token, aucune révision de politique d'utilisation, et la possibilité d'affiner le modèle sur des bases de code propriétaires. Le contexte de 200K tokens gère de vastes bases de code existantes en une seule requête. La génération front-end est particulièrement saluée : les évaluateurs décrivent GLM-4.6 comme produisant des « pages front-end visuellement soignées » nécessitant un nettoyage minimal. Pour les flux de travail agentiques, le modèle s'intègre proprement avec Cline, Roo Code et les configurations compatibles MCP via des points de terminaison compatibles OpenAI.
« J'utilise GLM-4.6 depuis sa sortie ce mois-ci. C'est mon nouveau favori. [J'ai] annulé Claude après avoir utilisé les deux services pendant deux ans. » -- jhancock, Hacker News, septembre 2025
« GLM 4.7 est déjà en avance lorsqu'il s'agit de dépanner une bibliothèque open source complexe mais courante construite sur GLib/GObject. » -- greenavocado, Hacker News, mars 2026
Les tâches bilingues chinois-anglais constituent une force distincte. Les équipes traitant des documents juridiques, des rapports financiers ou des données clients en chinois parallèlement à des sorties en anglais trouveront l'optimisation native en chinois de GLM plus fiable que les modèles formés principalement sur des corpus anglophones.
Les limites de Zhipu GLM et les problèmes récurrents des utilisateurs
La friction la plus signalée est le filtrage du contenu politique dans les requêtes en langue chinoise. Des recherches publiées dans PNAS Nexus (2026) ont confirmé que les modèles GLM refusent de discuter de la place Tian'anmen, des manifestations à Hong Kong et des critiques du PCC lorsqu'ils sont sollicités en chinois, tandis que les mêmes questions en anglais peuvent recevoir des réponses substantielles. Cette censure dépendante de la langue est le produit de la réglementation de l'IA par le gouvernement chinois (les entreprises doivent certifier les refus sur des sujets spécifiques avant le déploiement public), et non une limitation technique. La communauté a créé des variantes GGUF « ablitérées » et sans restriction sur HuggingFace et Ollama, mais les utilisateurs qui ont besoin de réponses en langue chinoise sans contraintes politiques doivent évaluer les alternatives avec soin.
Les performances sur SWE-Bench Verified montrent un véritable écart au plus haut niveau : GLM-4.6 a obtenu 68% contre 77.2% pour Claude Sonnet 4.5. Pour le débogage complexe au niveau du dépôt sur de vastes bases de code non familières, Claude conserve un avantage significatif. GLM-4.7 a amélioré cela, mais l'écart persiste sur les tâches de contrôle d'interface graphique/navigateur et les sessions de codage autonome prolongées.
Les limites de débit se font sentir sur le niveau gratuit. Les modèles d'API flash sont limités en débit pour les utilisateurs enregistrés, et l'interface gratuite chat.z.ai a des limites d'utilisation hebdomadaires qui frustrent les utilisateurs intensifs (power users) découvrant le modèle et essayant de le pousser à bout avant de s'engager vers un accès payant. Le tarif promotionnel du Coding Plan à $3/mois a été supprimé le 11 février 2026, et les prix ont augmenté d'environ 30 % début 2026, ce qui a généré des frictions parmi les premiers utilisateurs.
La profondeur de l'écosystème est plus faible que celle d'OpenAI ou d'Anthropic. Il n'y a pas d'extension de navigateur native, pas d'application mobile, et le répertoire de plugins/intégrations est peu fourni. Les développeurs l'utilisent via des points de terminaison compatibles OpenAI dans des outils tiers, ce qui fonctionne de manière fiable, mais l'expérience consommateur clé en main reste en retrait.
Zhipu GLM vs. Qwen vs. DeepSeek
Qwen (Alibaba) et GLM sont les deux familles de modèles à poids ouverts chinois les plus puissantes, et leurs différences architecturales comptent pour les décisions de déploiement. Qwen 3.6-35B-A3B n'utilise que 3 milliards de paramètres actifs contre 32 milliards pour GLM-4.5, ce qui rend Qwen considérablement moins cher à exécuter par appel d'inférence à des niveaux de qualité comparables. Qwen 3.6 Plus s'étend à un contexte de 1M de tokens contre 200K pour GLM-4.6, un écart significatif pour les tâches sur de très longs documents. Lors de l'évaluation directe du codage au lancement de GLM-4.5, GLM a atteint un taux de victoire de 80.8% contre Qwen3-Coder dans des tâches en face-à-face, mais Qwen mène sur l'efficacité par FLOP de SWE-Bench Verified. Pour les équipes fonctionnant avec des budgets GPU plus serrés, Qwen est généralement l'option la plus légère ; pour la qualité brute des benchmarks par génération, GLM et Qwen s'échangent les victoires selon le type de tâche.
DeepSeek V3/V4 rivalise au même niveau de pointe mais avec un modèle considérablement plus grand : environ 1 billion de paramètres au total, nécessitant des clusters de GPU H100 ou H800 pour un auto-hébergement à grande échelle. GLM-4.5, avec ses 32 milliards de paramètres actifs, est beaucoup plus accessible sur du matériel plus modeste, rendant l'auto-hébergement réaliste pour les équipes sans accès à des GPU hyperscale. Sur la tarification de l'API, DeepSeek est moins cher ($0.28/M en entrée contre $0.60/M pour GLM-4.5), et DeepSeek V4 mène les benchmarks de codage brut avec 83.7% sur SWE-Bench Verified. DeepSeek a également subi une violation de données très médiatisée en janvier 2025 qui a exposé les historiques de chat des utilisateurs, un incident dont GLM n'a pas connu d'équivalent. Les deux modèles présentent un filtrage du contenu politique dépendant de la langue, bien que les spécificités diffèrent selon le sujet et le contexte de déploiement. Pour une utilisation exclusive via API où le coût domine, DeepSeek l'emporte sur le prix. Pour un déploiement auto-hébergé sur du matériel de milieu de gamme, l'empreinte plus faible des paramètres actifs de GLM constitue l'avantage pratique.
Face à Llama (Meta) et Mistral, le principal différenciateur de GLM est l'entraînement bilingue chinois-anglais à grande échelle et le contexte de 200K tokens au niveau des paramètres de pointe. Les variantes Scout/Maverick de Llama 4 utilisent une architecture de transformateur dense plutôt que MoE, ce qui entraîne des compromis matériels différents. Les modèles ouverts de Mistral restent solides pour les cas d'utilisation multilingues européens mais n'égalent pas les performances en langue chinoise de GLM. Face à Kimi (Moonshot AI), un autre concurrent chinois à poids ouverts, GLM-4.6 et Kimi K2 font à peu près jeu égal sur les performances de codage, Kimi offrant un contexte légèrement plus grand de 256K contre 200K pour GLM-4.6, tandis que GLM montre une meilleure efficacité des tokens.
Le niveau payant en vaut-il la peine ?
Pour la plupart des développeurs individuels, le niveau gratuit est un véritable point de départ, et non un simple essai. GLM-4.7-Flash et GLM-4.5-Flash sont disponibles sans frais via l'API et gèrent gratuitement un large éventail de tâches de formatage, de résumé et de codage léger. L'interface web gratuite chat.z.ai offre un accès aux modèles de qualité maximale avec des plafonds hebdomadaires.
L'abonnement Coding Plan (Lite à environ $10/mois, Pro à $30/mois, Max à $80/mois) est judicieux pour les équipes utilisant GLM-4.6 ou GLM-4.7 comme assistant de codage principal, où le coût de l'API par token dépasserait le seuil de l'abonnement. Pour les charges de travail de production gourmandes en API, le paiement à l'usage à $0.60/M de tokens en entrée est rentable par rapport aux alternatives à source fermée équivalentes. À $2.20/M de tokens en sortie contre Claude Sonnet 3.5 à environ $15/M en sortie, le calcul favorise GLM pour les tâches de génération à fort volume, même aux tarifs payants.
Les poids ouverts constituent la valeur cachée. L'auto-hébergement de GLM-4.5 via vLLM sur un cluster GPU loué élimine entièrement les coûts par token. Pour les équipes ayant des charges d'inférence prévisibles et à fort volume, la licence MIT signifie que le coût total de possession peut chuter en dessous des options d'API hébergées les moins chères sur 6 à 12 mois.
Meilleurs cas d'usage (et quand l'éviter)
GLM est idéal pour : les développeurs construisant des pipelines agentiques auto-hébergés qui ont besoin de poids sous licence MIT qu'ils peuvent affiner sur du code propriétaire ; les équipes d'entreprise bilingues chinois-anglais traitant des documents à grande échelle ; les chercheurs travaillant sur des tâches mathématiques et logiques lourdes (problèmes de compétition de niveau AIME) ; et les équipes soucieuses des coûts exécutant des charges de travail API à fort volume où la tarification de Claude est prohibitive.
Évitez GLM si : vos utilisateurs écrivent principalement en chinois et doivent discuter de sujets politiquement sensibles (le filtrage de contenu est réglementaire, non configurable via l'API officielle) ; votre flux de travail dépend de l'automatisation d'interface graphique/navigateur où Claude Sonnet 4.5 reste le leader de référence ; vous avez besoin d'un produit grand public soigné avec une application mobile et une extension de navigateur ; ou votre équipe a besoin de performances de pointe sur SWE-Bench Verified à tout prix (où Claude Sonnet 4.5 à 77.2% devance toujours les 68% de GLM-4.6).
Premiers pas avec Zhipu GLM
Le chemin le plus rapide est chat.z.ai, qui nécessite une inscription gratuite et offre un accès immédiat aux modèles de qualité maximale avec des plafonds d'utilisation hebdomadaires. Pour l'accès à l'API, inscrivez-vous sur bigmodel.cn ou docs.z.ai, qui délivre une clé API compatible avec les clients au format OpenAI. Pour pointer Cline ou Roo Code vers GLM-4.6, définissez l'URL de base sur le point de terminaison Z.ai et insérez la clé API, aucune modification de configuration n'est nécessaire au-delà.
Pour un déploiement local, les poids de GLM-4.6 sont sur HuggingFace sous zai-org/GLM-4.6 et disponibles en versions quantifiées GGUF sur Ollama (ollama pull glm-4.6). Le modèle MoE à 32B actifs fonctionne sur des machines avec 40-80 Go de VRAM en pleine précision ; les versions quantifiées en 4 bits tombent à 20-24 Go, ce qui le rend viable sur des configurations à double GPU grand public. vLLM et SGLang sont les frameworks d'inférence pris en charge pour l'auto-hébergement en production. La variante GLM-4.5-Air (12B actifs) est le point de départ recommandé pour les équipes ayant des budgets matériels plus serrés qui souhaitent tout de même des modèles à poids ouverts plutôt que le niveau d'API flash.
Avis des utilisateurs
Aucun avis pour l'instant. Soyez le premier à partager votre expérience !
Se connecter pour écrire un avis.
Présent dans les collections
Listes sélectionnées incluant Zhipu GLM.
Articles associés
Guides et articles en lien avec Zhipu GLM.

Grok 4.3 API for Agents (May 2026): Pricing, Benchmarks, Migration

Nous Hermes 4: The Self-Hosted Open-Weight Agent Brain (2026)

Vantaige Launches the LLM VRAM Calculator: A Free GPU Compatibility Finder for Open-source and Open-Weight AI

Google Vision AI Explained (2026): Pricing Per 1,000 Units, Free Tier, and Alternatives

Local Agentic Coding May 2026: Qwen 3.6 + BeeLlama.cpp + Star Elastic
