

Falcon est la famille de LLM à poids ouverts soutenue par le gouvernement des Émirats arabes unis et développée par le Technology Innovation Institute, couvrant les transformateurs denses, les modèles d'espace d'état Mamba et les architectures hybrides. C'est la principale option open source pour le NLP en arabe, téléchargeable et hébergeable gratuitement.
Falcon est une famille de grands modèles de langage à poids ouverts conçue par le Technology Innovation Institute (TII), un centre de recherche soutenu par le gouvernement des Émirats arabes unis et opérant sous l'égide de l'Advanced Technology Research Council d'Abou Dabi. L'AI and Digital Science Research Center du TII dirige le développement avec une équipe de 64 chercheurs dont l'objectif affiché est de rendre l'IA de pointe accessible à l'échelle mondiale, indépendamment de la domination des laboratoires occidentaux ou chinois. La famille Falcon s'étend des modèles edge de moins de 1B de paramètres jusqu'à un modèle phare hybride de 34B, tous téléchargeables gratuitement depuis l'organisation tiiuae sur Hugging Face, sans aucun abonnement requis.
La famille couvre plusieurs architectures distinctes : la gamme originale de transformateurs denses (de Falcon 1 à Falcon 3), le modèle d'espace d'état Falcon Mamba 7B sorti en août 2024, le Falcon 2 11B VLM pour les tâches de vision-langage, Falcon Arabic ciblant le NLP en arabe, et la série hybride Falcon H1 lancée en mai 2025, qui combine l'attention des transformateurs avec des couches SSM fonctionnant en parallèle pour des fenêtres de contexte allant jusqu'à 262K tokens. Tous les poids sont publiés sous la Falcon License du TII (basée sur Apache 2.0) avec une politique d'utilisation acceptable, ce qui les rend utilisables à des fins commerciales avec certaines réserves abordées ci-dessous.
Falcon en un coup d'œil, avril 2026
Les gammes de modèles Falcon actives en avril 2026, avec leurs principales caractéristiques :
Falcon 3 (déc. 2024) : Transformateurs denses de 1B, 3B, 7B et 10B. Entraînés sur 14 billions de tokens. Fenêtre de contexte de 32K. Falcon3-10B a occupé la première place du classement des LLM ouverts de Hugging Face pour les modèles de moins de 13B de paramètres lors de son lancement. Variantes Base et Instruct, plus des versions quantifiées GPTQ-Int4/Int8 et AWQ pour le matériel à mémoire limitée.
Falcon Mamba 7B (août 2024) : Un modèle d'espace d'état pur utilisant l'architecture Mamba, s'éloignant entièrement de l'attention des transformateurs. Sept milliards de paramètres, une surcharge mémoire constante quelle que soit la longueur du contexte, vérifié par Hugging Face comme le meilleur SSLM open source à son lancement.
Falcon 2 11B VLM (mai 2024) : Onze milliards de paramètres, contexte de 8K, encodeur de vision CLIP ViT-L/14 intégré au modèle de base. Traite conjointement les entrées d'images et de textes pour la compréhension de documents, le sous-titrage d'images et les tâches de Q&A visuelles.
Falcon Arabic (mai 2025) : Sept milliards de paramètres, construit sur la base de Falcon 3-7B avec 32 000 tokens spécifiques à l'arabe ajoutés au vocabulaire et une nouvelle initialisation des embeddings à partir d'un mappage de similarité textuelle. Atteint un contexte de 32K et surpasse les modèles arabes dédiés jusqu'à 4 fois sa taille sur les benchmarks Arabic MMLU, MadinahQA et Aratrust.
Falcon H1 (mai 2025) : Architecture hybride : l'attention des transformateurs et le SSM s'exécutent simultanément par couche, les sorties étant concaténées avant la projection. Tailles de 0.5B à 34B. Contexte jusqu'à 262K tokens. Disponible sur AWS Bedrock Marketplace et NVIDIA NIM. La variante de raisonnement H1R 7B a obtenu un score de 88.1% sur les benchmarks mathématiques AIME-24.
Ce pour quoi Falcon excelle vraiment
L'avantage concurrentiel le plus évident de Falcon en avril 2026 est le NLP en arabe. Falcon Arabic 7B est le seul modèle arabe à poids ouverts spécialement conçu qui domine systématiquement les classements OALL (Open Arabic LLM benchmark) parmi les modèles de moins de 30B de paramètres. Il gère l'arabe standard moderne ainsi que les dialectes régionaux, prend en charge la génération augmentée par la recherche (RAG) via sa fenêtre de contexte de 32K, et est véritablement gratuit à exécuter localement, ce qui est crucial pour les déploiements dans la région MENA soumis à des exigences de résidence des données.
Les gammes Mamba et hybride H1 comblent une véritable lacune dans la recherche. L'inférence Mamba est en O(1) en mémoire quelle que soit la longueur de la séquence, ce qui rend Falcon Mamba 7B pratique pour les tâches à contexte long qui rendent la croissance du cache KV des transformateurs prohibitive sur les petits GPU. Falcon H1 prolonge cela avec une conception hybride qui préserve l'attention pour le contexte local tandis que Mamba gère la mémoire de séquence globale, produisant des fenêtres de contexte allant jusqu'à 262K tokens dans un modèle de la classe 7B.
"Falcon 3 repousse encore les limites des petits LLM, contribuant à la communauté open source en offrant l'accès à une IA plus performante. Nous sommes convaincus que cette dernière version ouvrira un éventail illimité d'opportunités." -- Dr. Hakim Hacid, Chercheur en chef, AIDRC/TII, décembre 2024
Les performances de Falcon 3-10B en raisonnement mathématique (83.0 GSM8K) et en codage (73.8 MBPP) sont compétitives dans sa catégorie de paramètres. La famille de modèles prend également en charge le déploiement quantifié (1.58-bit, GPTQ, AWQ) de manière plus exhaustive que nombre de ses pairs, ciblant les cas d'usage d'inférence sur ordinateur portable et en périphérie (edge) pour lesquels le TII l'a explicitement conçue.
Les limites de Falcon et les problèmes récurrents des utilisateurs
La plainte la plus fréquente des développeurs en production concerne la licence. La Falcon License du TII est basée sur Apache 2.0, mais elle inclut une politique d'utilisation acceptable (AUP) que le TII peut mettre à jour unilatéralement et que les utilisateurs sont tenus de surveiller par eux-mêmes. C'est tout le contraire de ce qu'implique normalement la formulation d'une licence "perpétuelle et irrévocable".
"Ils peuvent refuser votre cas d'usage à tout moment sans même vous en informer." -- JimDabell, Hacker News, mai 2024
Le fil de discussion sur Hacker News lors du lancement de Falcon 2 a suscité un débat de fond sur la question de savoir si ces conditions sont même applicables, compte tenu de la contradiction interne entre une concession irrévocable et une AUP modifiable. Dans la pratique, la plupart des équipes juridiques d'entreprise considèrent cela comme un point de blocage et se tournent par défaut vers Llama ou Qwen.
Une deuxième frustration persistante est la faiblesse de l'écosystème. L'organisation tiiuae sur Hugging Face compte 136 modèles publiés, mais la communauté en aval pour les fine-tunes, les adaptateurs LoRA, les quantifications et les intégrations d'applications ne représente qu'une fraction de ce qui existe pour Llama ou Qwen. Les développeurs qui s'appuient sur Falcon constatent souvent qu'ils doivent accomplir un travail que la communauté aurait déjà réalisé pour un modèle de base plus populaire.
L'écart entre les benchmarks et la qualité réelle des conversations est le troisième thème récurrent. Les membres de la communauté qui testent Falcon 2 et les premiers modèles Falcon 3 notent que les chiffres des classements semblent meilleurs que la qualité subjective des échanges, en particulier pour l'écriture créative et le raisonnement à tours multiples. Un commentateur sur Hacker News a observé lors du lancement de Falcon 2 que le résultat du 11B était "à peu près au même niveau que Mistral 7B et Llama 3 8B" malgré un nombre de paramètres plus élevé, ce qui fragilise les arguments de positionnement du TII.
Enfin, le renouvellement rapide des modèles crée un risque d'obsolescence pour les développeurs. Le TII a publié six familles d'architectures distinctes depuis 2023 : Falcon 1, Falcon 2 (avec VLM), Falcon Mamba, Falcon 3, Falcon Arabic et Falcon H1 (avec la variante de raisonnement H1R). Chaque lancement remplace la recommandation précédente. Les équipes qui ont construit des pipelines sur Falcon 40B en 2023 se sont retrouvées avec un modèle obsolète en moins d'un an.
Falcon vs. Llama 4 vs. Qwen 3
Llama 4 (Meta) : La différence mécanique la plus critique est l'architecture. Llama 4 Scout utilise un mélange d'experts (Mixture of Experts) avec 109 milliards de paramètres au total, mais seulement 17 milliards actifs par token, ce qui réduit considérablement le coût d'inférence à grande échelle. Llama 3-8B utilise un transformateur dense avec 8 milliards de paramètres, plus simple à affiner mais proportionnel en termes de calcul. Llama 4 est entraîné sur plus de 40 billions de tokens dans plus de 200 langues, contre 14 billions de tokens pour Falcon 3 avec quatre langues principales. L'écosystème en aval de Llama est le facteur dominant dans la pratique : des centaines de milliers de fine-tunes communautaires, de LoRA et d'intégrations d'applications existent pour les modèles Llama, ce qui n'est tout simplement pas le cas pour Falcon. Les licences Llama (Llama 4 Community License) ont leurs propres restrictions au-delà de 700 millions d'utilisateurs actifs mensuels, mais les conditions sont stables et prévisibles, contrairement à l'AUP modifiable de Falcon. Là où Falcon l'emporte : la spécialisation en arabe, les architectures Mamba/hybrides pour l'efficacité des contextes longs, et les niveaux de modèles plus petits (1B) que Llama 4 ne propose pas actuellement.
Qwen 3 (Alibaba) : Qwen 3 est le concurrent le plus direct de Falcon sur l'axe multilingue, à poids ouverts et sous licence Apache 2.0. Les versions de Qwen 3 bénéficient d'une véritable licence Apache 2.0 (sans AUP modifiable), d'une gamme de modèles allant de 0.6B à 235B (y compris des variantes MoE), et de plus de 300 millions de téléchargements à la mi-2025. Qwen 3.5-9B a obtenu un score de 81.7 sur GPQA Diamond, surpassant des modèles ayant 13 fois plus de paramètres. La profondeur multilingue de Qwen couvre plus de 29 langues avec un solide support du chinois ; Falcon Arabic est plus spécialisé pour les déploiements axés sur l'arabe, mais Qwen manque d'un modèle dédié équivalent pour l'arabe. Sur les benchmarks de code (HumanEval, MBPP), Qwen surpasse systématiquement Falcon à nombre de paramètres comparable. Le choix fondamental : Qwen pour une licence claire, une sélection de modèles plus large et un meilleur support du code et du chinois ; Falcon pour les applications axées sur l'arabe et la recherche sur les architectures Mamba/hybrides.
La version payante en vaut-elle la peine ?
Il n'y a pas de version payante proposée par le TII. Les modèles Falcon sont gratuits à télécharger et à auto-héberger, sans aucune API fournisseur requise. L'hébergement par des tiers est disponible via AWS Bedrock Marketplace (Falcon H1), NVIDIA NIM et AI71 (une société d'IA distincte basée à Abou Dabi), chacun avec sa propre tarification basée sur la puissance de calcul.
Pour la plupart des utilisateurs, le coût de Falcon réside dans la puissance de calcul nécessaire pour l'exécuter. Falcon 3-1B et Falcon H1-0.5B fonctionnent sur des GPU grand public et même sur des CPU d'ordinateurs portables sous forme quantifiée. Falcon 3-10B nécessite un GPU de milieu de gamme (RTX 3090 ou équivalent) pour l'inférence fp16, ou peut fonctionner quantifié sur 8 Go de VRAM. Falcon H1-34B nécessite une configuration multi-GPU ou une instance cloud.
Le compromis de coût pratique par rapport aux services d'API hébergés (OpenAI, Anthropic) favorise Falcon pour les applications NLP en arabe à fort volume et sensibles aux coûts, où un équivalent hébergé serait coûteux et pourrait ne pas égaler les benchmarks de Falcon Arabic dans ce domaine linguistique.
Meilleurs cas d'usage (et quand l'éviter)
Optez pour Falcon lorsque : vous développez des applications en langue arabe (Falcon Arabic 7B est la meilleure option à poids ouverts de sa catégorie), vous effectuez des recherches ou déployez des architectures non basées sur des transformateurs (Mamba, hybride H1), vous avez besoin d'un modèle souverain ou régi par les Émirats arabes unis pour des raisons de conformité régionale, ou vous ciblez l'inférence en périphérie (edge) ou hors ligne avec de petits modèles quantifiés (Falcon 3-1B, H1-0.5B).
Évitez Falcon lorsque : votre équipe juridique a besoin de conditions open source stables et prévisibles (l'AUP modifiable bloque l'adoption en entreprise), vous avez besoin d'un vaste écosystème communautaire d'adaptateurs et de fine-tunes (Llama ou Qwen en ont beaucoup plus), vous développez principalement en chinois ou pour des tâches axées sur le code (Qwen surpasse Falcon sur les deux tableaux), ou vous avez besoin d'un modèle unique gérant nativement plus de 200 langues (Llama 4 a été entraîné sur plus de langues que n'importe quel modèle Falcon 3).
Premiers pas avec Falcon
Tous les modèles Falcon sont disponibles sur huggingface.co/tiiuae. Le modèle Falcon 3-7B-Instruct est le point de départ recommandé pour une utilisation générale en mode chat : entraînement sur 14T de tokens, contexte de 32K, compatible avec l'architecture Llama pour une intégration facile dans les frameworks (Hugging Face Transformers, Ollama, llama.cpp). Pour les applications en arabe, Falcon-Arabic-7B-Instruct est le choix dédié. Pour les déploiements à contexte long ou à mémoire limitée, Falcon H1-7B est l'option actuellement recommandée.
Le TII maintient un terrain de jeu (playground) hébergé sur falconllm.tii.ae pour des tests interactifs sans configuration locale. Pour l'auto-hébergement en production, les modèles Falcon 3 sont compatibles avec les outils de quantification standards (GPTQ, AWQ, llama.cpp GGUF), et le TII publie des checkpoints pré-quantifiés, y compris une variante 1.58-bit pour les contraintes de mémoire extrêmes.
Consultez la Falcon License et la politique d'utilisation acceptable sur falconllm.tii.ae/terms-and-conditions.html avant de développer des applications commerciales. Compte tenu de l'AUP modifiable, un examen juridique est recommandé pour toute utilisation dans un produit intégré ou hébergé.
Avis des utilisateurs
Aucun avis pour l'instant. Soyez le premier à partager votre expérience !
Se connecter pour écrire un avis.
Présent dans les collections
Listes sélectionnées incluant Falcon.
Articles associés
Guides et articles en lien avec Falcon.

Nous Hermes 4: The Self-Hosted Open-Weight Agent Brain (2026)

Grok 4.3 API for Agents (May 2026): Pricing, Benchmarks, Migration

Google Vision AI Explained (2026): Pricing Per 1,000 Units, Free Tier, and Alternatives

Run Open Source AI Models Locally: Battle-Tested Guide

Mistral Medium 3.5 Self Host: 77.6% SWE-Bench on 4 GPUs (2026)
