Aller au contenu principal
Vantaige
Qwen screenshot
Qwen logo

Qwen

Freemium

Qwen3.6-27B offre des performances de codage proches de l'état de l'art dans 16.8 GB. Il tient sur une RTX 4090 et surpasse son prédécesseur de 397B. La licence Apache 2.0 appliquée à toute la famille de modèles à poids ouverts en fait le LLM chinois doté de la licence la plus claire pour un usage commercial en 2026.

Fonctionnalités :Apache 2.0 LicenseOpen WeightsMultilingual (119+ languages)MoE ArchitectureCode Generation (Qwen-Coder)Multimodal Vision-Language (Qwen3-VL)Agent Tool CallingHybrid Thinking Mode

Le 22 avril 2026, l'équipe Qwen d'Alibaba a publié Qwen3.6-27B, un modèle dense de 27 milliards de paramètres qui obtient un score de 77.2% sur SWE-bench Verified, surpassant le modèle MoE de 397 milliards de paramètres qui l'a précédé sur les benchmarks de codage, tout en tenant dans 16.8 GB de VRAM. Cela signifie qu'il tourne confortablement sur une seule RTX 4090 grand public. Simon Willison, qui suit systématiquement les performances des LLM locaux depuis des années, l'a testé le jour même et l'a qualifié de "résultat exceptionnel pour un modèle local de 16.8GB." Cette seule donnée, un modèle de 27B battant un modèle de 397B sur le benchmark le plus important pour les agents de codage, fait de Qwen l'histoire de modèle à poids ouverts la plus intéressante d'avril 2026.

La famille Qwen au sens large n'est pas un projet de niche. Début 2026, Alibaba a signalé 700 millions de téléchargements cumulés sur Hugging Face, Qwen dépassant Llama de Meta en téléchargements mensuels dès octobre 2025. Rien qu'en février 2026, Qwen a généré 153.6 millions de téléchargements, soit plus du double du total combiné de Meta, DeepSeek, OpenAI, Mistral et Nvidia. Ce que vous avez sous les yeux est à la fois la famille de modèles d'IA open source la plus téléchargée au monde et un produit API hébergé de niveau production.

Qwen en un coup d'œil. Avril 2026

La famille Qwen couvre plusieurs niveaux de produits distincts. Côté grand public, qwen.ai (anciennement chat.qwen.ai) propose une interface web gratuite avec accès aux modèles de la famille Qwen3, incluant la compréhension d'images et de vidéos, le traitement de documents, la recherche web, l'utilisation d'outils et les artefacts de code. Côté développeurs, l'API DashScope / Alibaba Cloud Model Studio API offre un accès programmatique à partir de $0.05 par million de tokens d'entrée pour Qwen-Turbo. Et sous ces deux niveaux se trouve la couche à poids ouverts : des modèles sous licence Apache 2.0 téléchargeables depuis Hugging Face que vous pouvez exécuter entièrement sur votre propre matériel, sans payer personne, et modifier sans restriction.

Le fleuron actuel à poids ouverts pour la plupart des cas d'usage est Qwen3.6-27B (publié le 22 avril 2026, Apache 2.0). Pour les équipes ayant besoin de plus d'envergure, Qwen3.5-397B-A17B (MoE, Apache 2.0) est le fleuron de la génération précédente, avec 397 milliards de paramètres au total et 17 milliards actifs par token. Pour les déploiements en périphérie (edge) ou sur mobile, la petite série Qwen3.5 descend jusqu'à 0.8B de paramètres avec une empreinte de 3 GB ciblant le matériel de l'iPhone 15 Pro. Pour un accès API propriétaire exclusif avec des capacités maximales, Qwen3.6-Max-Preview (publié le 20 avril 2026) revendique la première place sur six benchmarks de codage avec une fenêtre de contexte de 1M de tokens, bien que la tarification de l'API n'ait pas été finalisée publiquement au 23 avril 2026.

Tous les modèles Qwen3+ à poids ouverts prennent en charge un basculement hybride réflexion/sans réflexion : un seul poids de modèle permet de passer du mode instruction rapide au raisonnement étendu par chaîne de pensée (chain-of-thought) pour chaque requête. Aucun déploiement séparé n'est nécessaire, une fonctionnalité introduite avec QwQ-32B (mars 2025) et désormais standard dans toute la famille.

Les véritables points forts de Qwen

Le codage est sa force la plus évidente. Le score de 77.2% de Qwen3.6-27B sur SWE-bench n'est pas une victoire isolée, le précédent Qwen3.6-35B-A3B MoE (publié le 16 avril 2026) ayant obtenu 73.4% sur le même benchmark. Les variantes dédiées Qwen-Coder vont encore plus loin : Qwen3-Coder-30B-A3B est disponible pour les équipes qui souhaitent un point de contrôle (checkpoint) spécialisé dans le codage plutôt que le modèle d'instruction généraliste. Les tests de Simon Willison du 22 avril ont mesuré une vitesse de lecture d'environ 54 tokens/seconde et une génération de 25 tokens/seconde sur du matériel local, des vitesses pratiques pour un usage interactif.

La capacité multilingue est le deuxième avantage structurel, et elle est intégrée au niveau de l'architecture plutôt qu'ajoutée a posteriori. Tous les modèles Qwen3 ont été entraînés sur 36 billions de tokens à travers 119 langues et dialectes. Qwen3.5 étend cela à 201 langues. Le tokenizer BBPE utilise un vocabulaire de 151,669 tokens, soit environ quatre fois plus grand que les vocabulaires BPE traditionnels, ce qui signifie que les écritures CJK sont encodées à environ 1.5–1.8 caractères par token au lieu de 1 caractère par token. Pour les équipes payant des coûts d'API par token en japonais, coréen ou chinois, cette différence est mesurable sur les factures.

Le modèle Qwen-MT (Qwen3-MT) est un spécialiste dédié à la traduction couvrant 92 langues à l'aide d'une architecture MoE, au prix d'environ $0.50 par million de tokens. Dans le benchmark d'Alibaba, les évaluateurs humains ont préféré Qwen3-MT à GPT-4.1-mini et Gemini-2.5-Flash sur 10 langues majeures. Pour les organisations effectuant un fine-tuning sur des données propriétaires, la licence Apache 2.0 et la prise en charge de QLoRA via Unsloth (entraînement 2x plus rapide, 70% de VRAM en moins) font de Qwen3-8B et Qwen3-14B des points de départ pratiques.

Les limites de Qwen et les problèmes fréquents des utilisateurs

Le problème le plus lourd de conséquences en production est la fiabilité de l'appel d'outils (tool calling) dans les piles d'inférence locales. La famille Qwen3 utilise un formatage d'appel d'outils basé sur XML. La plupart des serveurs d'inférence s'attendent à du JSON. Ce décalage nécessite une configuration manuelle du modèle de chat (chat template) qui ne se fait pas automatiquement. De plus, Ollama ignore silencieusement les paramètres presence_penalty et repetition_penalty, bien que les propres fiches de modèle de Qwen recommandent explicitement presence_penalty=1.5 pour éviter les boucles de répétition en mode réflexion. Ce problème a été suivi dans l'issue GitHub #14493 d'Ollama, qui a accumulé de nombreux votes de la communauté, et n'était toujours pas résolu fin avril 2026.

"Trois bugs dans Ollama rendent ses capacités agentiques complètement non fonctionnelles. Les paramètres de pénalité sont acceptés par l'API sans erreur et ignorés silencieusement, bien que la fiche du modèle recommande explicitement presence_penalty=1.5 pour éviter les boucles de répétition pendant la réflexion.". Issue GitHub Ollama #14493, 2026

La qualité de la quantification est le deuxième mode de défaillance pratique. Le consensus de la communauté : Q4_K_M est le niveau minimum viable ; Q8 pour tout ce qui est critique en termes de fiabilité. Un bug de CUDA 13.2 en avril 2026 a fait que les quantifications GGUF en 4 bits et moins sur les modèles Qwen3.x produisaient du charabia. La quantification du cache KV en e5m2 provoque des boucles de répétition. Ce sont des problèmes actifs dans la fenêtre d'avril 2026, suivez r/LocalLLaMA plutôt que de vous fier aux paramètres par défaut.

La fragmentation des régions de l'API crée des frictions pour les utilisateurs non chinois. Le niveau gratuit est exclusif à Singapour. Les clés d'API pour Singapour, la Virginie (États-Unis) et Pékin ne sont pas interchangeables. La différence de prix entre la Chine continentale ($0.345/M pour l'entrée Qwen-Max) et Singapour ($1.60/M) représente un écart de 4.6x, légitime sur le plan commercial, mais source persistante de confusion pour la communauté.

Qwen vs. DeepSeek-V3/R1 vs. Llama 4

La licence est le différenciateur mécanique auquel la plupart des équipes devraient penser en premier. Les poids ouverts de Qwen3+ sont sous Apache 2.0, permettant un usage commercial totalement permissif, sans restrictions basées sur la taille, sans plafonds d'utilisation et sans obligation d'attribution. La licence Llama de Meta contient des restrictions qui s'activent au-dessus de certains seuils commerciaux et ont généré une incertitude juridique récurrente. DeepSeek utilise une licence personnalisée nécessitant une lecture plus attentive. Pour les déploiements à très grande échelle (hyperscale) ou en marque blanche, la licence Apache 2.0 de Qwen est la plus claire du groupe.

DeepSeek-V3.2 exécute 685B de paramètres au total avec 37B activés par token et utilise la Multi-Head Latent Attention (MLA) pour une compression du cache KV plus agressive que la Grouped Query Attention de Qwen, un véritable avantage d'efficacité sur les très longs contextes. La plus grande différence architecturale réside dans le raisonnement : DeepSeek maintient des branches séparées pour R1 (raisonnement) et V3 (instruction). Le basculement hybride de Qwen3 permet à un seul fichier de poids de gérer les deux modes, un seul déploiement, sans ramification.

Llama 4 (Scout : 109B au total, 17B actifs) active 2 experts plus grands par token contre 8 experts plus petits pour Qwen, une conception plus conventionnelle. Le tokenizer de Llama est compétitif en anglais mais moins efficace sur les écritures CJK que le BBPE à vocabulaire de 151K de Qwen. Pour les marchés de langues asiatiques, la différence de tokenizer se reflète directement dans les coûts d'API par token. Qwen3.5 couvre 201 langues lors de l'entraînement ; Llama 4 est principalement optimisé pour l'anglais.

Censure : ce que font les poids par rapport à ce que fait l'API

En janvier 2025, le chercheur @xlr8harder a posé plusieurs centaines de questions politiquement sensibles à des modèles d'IA chinois open source exécutés localement, sans la couche API d'Alibaba. Le constat sur Qwen2.5-72B était sans ambiguïté :

"J'ai vérifié les biais et la censure sur deux modèles d'IA chinois open source, en utilisant plusieurs centaines de questions sur divers sujets, et j'ai quelques premières observations à partager : Le plus intéressant pour moi : qwen 2.5 72b n'a pratiquement aucune censure, bien que deepseek-v3 en ait certainement." , @xlr8harder, X/Twitter, 27 janvier 2025

Le contraste avec le comportement de l'API hébergée est saisissant. Le chercheur leonardlin, écrivant sur le blog de Hugging Face en juin 2024, a analysé Qwen2-7B-Instruct après abliteration (une technique qui supprime les vecteurs de refus des poids du modèle). Les résultats documentent une asymétrie dépendante de la langue : le modèle exécuté en chinois répond aux questions sur les camps d'internement du Xinjiang avec un récit explicitement aligné sur le PCC, les soi-disant camps sont décrits comme des fabrications par des forces hostiles. Le même modèle exécuté en anglais refuse tout simplement de répondre. Il ne s'agit pas d'une censure symétrique appliquée aux deux langues. C'est de la propagande en chinois et du silence en anglais, deux types différents de suppression de contenu opérant simultanément, dans des directions opposées.

La conclusion pratique : les poids sont nettement plus propres que l'API hébergée. La couche API d'Alibaba applique des contrôles d'alignement post-entraînement qui ne sont pas présents dans les poids de modèle téléchargés. Si vous créez des produits qui doivent aborder l'histoire politique chinoise, Taïwan, le Xinjiang ou la place Tian'anmen avec une quelconque exactitude factuelle, la solution est de tester localement avec la génération de modèle spécifique que vous avez l'intention d'utiliser, et de comprendre que l'API et le modèle local ne sont pas le même produit du point de vue de la politique de contenu. La série Dolphin Qwen2, maintenue par la communauté, supprime entièrement la couche d'alignement pour les applications qui l'exigent. Notez que les tests de @xlr8harder portaient sur Qwen2.5, et non sur Qwen3 ; la nouvelle génération n'a pas été systématiquement retestée avec une méthodologie équivalente en date d'avril 2026.

À qui s'adresse Qwen

Le profil idéal est un développeur disposant d'une RTX 4090 ou d'une A100 qui souhaite des performances de codage proches de l'état de l'art fonctionnant entièrement sur du matériel local, sans payer de coûts d'API, sous une licence permettant un usage commercial sans conditions. La sortie de Qwen3.6-27B change la donne par rapport à il y a six mois. Avant avril 2026, faire tourner un modèle rivalisant avec les meilleures API hébergées nécessitait soit une configuration multi-GPU, soit d'accepter des compromis importants sur les capacités. L'histoire du 27B sur une 4090 comble considérablement cet écart.

Le deuxième profil idéal concerne les équipes s'étendant sur les marchés de langues asiatiques. Le corpus d'entraînement de Qwen (36T de tokens, 119 langues), la conception de son tokenizer et le modèle de traduction dédié Qwen-MT sont conçus pour ce cas d'usage d'une manière que les modèles axés sur l'anglais ne sont pas. L'avantage de coût par token lié à l'efficacité du tokenizer est réel et se cumule à grande échelle.

Le troisième profil correspond aux organisations qui ont besoin de la licence Apache 2.0 pour des raisons de clarté juridique, de produits en marque blanche, d'achats d'entreprise ne pouvant accepter de restrictions d'utilisation, ou de projets où les conditions de licence de Llama de Meta ou la licence personnalisée de DeepSeek créent des frictions. Qwen3+ est la famille ouverte proche de l'état de l'art avec la licence la plus claire actuellement disponible.

Qwen n'est pas adapté si votre produit nécessite un comportement fiable et testé sur des sujets politiques chinois via l'API hébergée. La nuance de censure décrite ci-dessus signifie que vous devez savoir dans quel mode de déploiement vous vous trouvez et l'avoir testé. Il est également inadapté si vous avez besoin d'une compatibilité transparente avec l'API OpenAI dès le départ ; les différences de format d'appel d'outils, les paramètres du mode réflexion et les bugs d'intégration d'Ollama impliquent de réelles frictions de configuration. Les équipes disposant de budgets d'infrastructure serrés et ayant besoin d'un modèle qui "fonctionne tout simplement" dans une pile locale peuvent trouver que le travail d'intégration l'emporte sur les gains de capacité par rapport à des modèles dotés d'outils d'inférence locale plus matures.

La sortie de QwQ-32B en mars 2025, qui a égalé DeepSeek-R1 (671B de paramètres) avec seulement 32B de paramètres et a entraîné un bond de 8% de l'action d'Alibaba en une seule journée, a défini le modèle pour ce qui a suivi : des sorties répétées compressant ce que les performances de pointe exigent en termes de calcul et de coût. Qwen3.6-27B en est le dernier exemple. Un modèle de 27B, sur votre GPU, pour $0, sous licence Apache 2.0.

Avis des utilisateurs

Aucun avis pour l'instant. Soyez le premier à partager votre expérience !

Se connecter pour écrire un avis.

Articles associés

Guides et articles en lien avec Qwen.