

Fireworks AI est une plateforme d'inférence qui exécute des modèles open source et personnalisés via une API rapide et compatible avec OpenAI. Conçu par d'anciens ingénieurs PyTorch de Meta, son moteur FireAttention vise le meilleur débit de sa catégorie, ce qui explique pourquoi des produits sensibles à la latence comme Cursor et Notion l'utilisent.
Fireworks AI est une plateforme d'inférence qui exécute des modèles d'IA open source et personnalisés derrière une API rapide et compatible avec OpenAI, permettant aux équipes d'ingénierie de déployer des modèles de qualité production sans posséder ni gérer de GPU. Fondée en 2022 par sept anciens ingénieurs PyTorch de Meta dirigés par la PDG Lin Qiao, son choix déterminant est technique : au lieu de servir des modèles sur des logiciels standards comme vLLM, Fireworks a écrit son propre moteur d'inférence au niveau du noyau CUDA, appelé FireAttention. Vous envoyez des requêtes dans le même format que pour OpenAI, et le modèle s'exécute sur le cluster de Fireworks au lieu du vôtre. Il n'y a pas d'application grand public ni de tableau de bord pour les utilisateurs finaux. Il s'agit d'une infrastructure qu'un développeur intègre dans un produit.
La plateforme couvre l'inférence serverless facturée au token, les déploiements sur GPU dédiés et le fine-tuning géré (LoRA, DPO, paramètres complets et renforcement), à travers un catalogue de plus de 400 modèles de texte, de vision, d'audio et d'embedding. Les nouveaux modèles à poids ouverts tels que DeepSeek V4, Qwen 3.7 et Kimi K2.7 apparaissent généralement le jour de leur lancement, ce que Fireworks considère comme un argument de vente délibéré. L'avantage de ce moteur sur mesure est le débit : sur un modèle comme DeepSeek V4 Pro, Fireworks sert environ 167 à 174 tokens par seconde contre les 40 à 80 qu'une pile vLLM standard gère, à un coût par token comparable. C'est pourquoi des produits sensibles à la latence comme Cursor, Notion et Vercel y exécutent leur inférence, et pourquoi la plateforme est conforme aux normes SOC 2, HIPAA et GDPR pour les acheteurs réglementés.
Ce que fait réellement Fireworks AI en juin 2026
Fireworks se situe carrément au niveau de la couche d'infrastructure. L'unité centrale est l'appel d'API : vous choisissez un modèle, envoyez une requête de type OpenAI, et Fireworks l'exécute sur un matériel optimisé. Le moteur FireAttention est la véritable valeur ajoutée, car il convertit l'expertise des fondateurs sur le noyau PyTorch en une vitesse mesurable plutôt qu'en argument marketing. Pour les équipes qui ont déjà choisi un modèle ouvert et qui ont juste besoin qu'il soit servi rapidement, c'est là que réside tout l'intérêt.
Autour de l'inférence serverless, la plateforme ajoute des déploiements dédiés où vous réservez des GPU spécifiques, un fine-tuning géré avec plusieurs méthodes, un décodage spéculatif pour plus de vitesse, et l'appel de fonctions avec des sorties structurées pour les charges de travail des agents. L'entreprise qui la soutient est saine et en forte croissance : Fireworks a levé 250 millions de dollars en série C pour une valorisation de 4 milliards de dollars le 28 octobre 2025, avec la participation de NVIDIA et AMD. À la mi-2026, des estimations indépendantes situent son chiffre d'affaires annuel récurrent près de 800 millions de dollars, avec des rapports évoquant une valorisation de 15 milliards de dollars en discussion. Rien de tout cela ne garantit que la solution vous conviendra, mais cela signifie qu'il ne s'agit pas d'un fournisseur risquant de disparaître.
Où se situe Fireworks par rapport à Groq et Together AI
Groq remporte le débat sur la latence brute grâce à son matériel : son processeur LPU personnalisé atteint environ 456 tokens par seconde sur Llama 3.3 70B avec un délai d'obtention du premier token inférieur à 300 ms, une conception centrée sur la mémoire que les logiciels ne peuvent pas reproduire. Le bémol est l'étendue de l'offre. Groq sert environ vingt modèles et ne propose pas de fine-tuning, donc si votre modèle n'est pas dans son catalogue, ce n'est tout simplement pas une option. De plus, NVIDIA a acquis Groq en décembre 2025, ce qui assombrit sa feuille de route indépendante. Fireworks échange un peu de vitesse de pointe contre plus de 400 modèles, des lancements le jour même et une suite complète de fine-tuning. Together AI est la comparaison la plus proche, également basée sur des GPU avec un vaste catalogue, mais sur les modèles de pointe de type mixture-of-experts, l'écart est réel : ce même benchmark DeepSeek V4 Pro a montré Fireworks à près de 170 tokens par seconde contre environ 41 pour Together, soit une différence de débit de 4x à des prix similaires. L'avantage de Together réside dans une plus longue expérience en matière de fine-tuning et une couverture occasionnelle de modèles de niche que Fireworks ignore.
Le coût réel de l'utilisation de Fireworks
La tarification serverless se fait par million de tokens, échelonnée selon la taille du modèle : environ $0.10 pour les modèles de moins de 4B de paramètres, $0.20 de 4B à 16B, et $0.90 au-delà de 16B, avec des modèles de pointe nommés tarifés individuellement (DeepSeek V4 Pro à $1.74 en entrée et $3.48 en sortie). Les entrées en cache et l'inférence par lots sont facturées à moitié prix, ce qui réduit considérablement les coûts pour les tâches répétitives ou non urgentes. Le fine-tuning commence à $0.50 par million de tokens d'entraînement pour LoRA sur les petits modèles, et les GPU dédiés sont facturés à l'heure, avec un H100 à $7.00 de l'heure.
« 20 à 30 % d'amélioration de la latence et 15 à 25 % d'économies. » Hussain Gagan, développeur FullStack, PeerSpot, 2025.
Deux réalités de coûts sont importantes. Premièrement, ce H100 à $7.00 se situe dans le haut de gamme, car la location de GPU bruts sur RunPod n'en représente qu'une fraction ; vous payez donc pour le moteur géré et la conformité, pas pour le silicium. Deuxièmement, seul $1 de crédit gratuit est offert à l'inscription, et les limites de débit sont strictes : 10 requêtes par minute sans carte enregistrée, 6 000 avec une carte, et tout ce qui dépasse nécessite de contacter le service commercial.
Où Fireworks frustre les équipes
La plainte la plus fréquente concerne ce plafond de 6 000 requêtes par minute. Les équipes qui le dépassent se heurtent à l'obligation de contacter les ventes au lieu de pouvoir évoluer en libre-service, ce qui freine les produits en forte croissance à un moment inopportun. La deuxième concerne l'obsolescence des modèles : comme Fireworks héberge des modèles tiers, le remplacement d'un modèle en amont signifie que le point de terminaison disparaît, et le code de production qui l'appelait par son nom se brise. Une agrégation d'avis de novembre 2025 a signalé les suppressions soudaines de modèles sans avertissement comme un problème récurrent.
« La tarification à grande échelle peut devenir coûteuse avec le temps, en particulier pour les équipes. » Ingénieur ML, secteur de l'énergie, PeerSpot, 2025.
Au-delà de cela, la facturation par token est difficile à prévoir et s'accumule rapidement à fort volume, la documentation est en retard sur l'ensemble des fonctionnalités pour le fine-tuning avancé et les options de déploiement, et il n'y a pas d'interface pour quiconque n'est pas ingénieur. Fireworks est une API et rien de plus, ce qui est une force pour son public cible et un mur pour tous les autres.
À qui s'adresse Fireworks, et à qui il ne s'adresse pas
C'est un excellent choix pour les équipes d'ingénierie qui créent des fonctionnalités d'IA en temps réel telles que le chat, l'assistance au code, la recherche et la saisie semi-automatique sur des modèles ouverts, pour les équipes qui ont besoin d'un fine-tuning géré sans mettre en place leur propre MLOps, et pour les entreprises soumises aux exigences SOC 2 ou HIPAA qui excluent les fournisseurs non vérifiés. Les scale-ups qui ont dépassé le stade d'une simple API hébergée mais qui ne sont pas prêtes à gérer leur propre flotte de GPU constituent la cible idéale.
C'est le mauvais outil pour les équipes non techniques, car il n'y a pas d'interface utilisateur ni de parcours no-code. Si le coût par token est votre seule métrique, il existe des fournisseurs moins chers, puisque DeepInfra le concurrence fortement sur le prix brut. La génération d'images à fort volume n'est pas son point fort, donc un hub de modèles comme Hugging Face ou un hébergeur d'images dédié couvrira mieux ce besoin. Et les premiers prototypes trouveront le crédit de $1 et les limites de débit strictes frustrants avant même que les forces de la plateforme ne se manifestent.
Avis des utilisateurs
Aucun avis pour l'instant. Soyez le premier à partager votre expérience !
Se connecter pour écrire un avis.
Articles associés
Guides et articles en lien avec Fireworks AI.

Grok 4.3 API for Agents (May 2026): Pricing, Benchmarks, Migration

Does API Cost More Than a Subscription for Claude Opus 4.8, GPT-5.5, and Grok?

Google Vision AI Explained (2026): Pricing Per 1,000 Units, Free Tier, and Alternatives

Vantaige Launches the LLM VRAM Calculator: A Free GPU Compatibility Finder for Open-source and Open-Weight AI

Mistral Medium 3.5 Self Host: 77.6% SWE-Bench on 4 GPUs (2026)
