Aller au contenu principal
Vantaige
Cerebras screenshot
Cerebras logo

Cerebras

Payant

Cerebras Inference est une API cloud pour LLM propulsée par la puce à l'échelle du wafer WSE-3, le plus grand processeur d'IA jamais conçu. Elle délivre 2,000 à 3,000 tokens par seconde sur des modèles ouverts, soit 10 à 20 fois plus vite que les alternatives basées sur GPU, à partir de $0.10 par million de tokens.

Fonctionnalités :API

Cerebras Systems est une entreprise de matériel d'IA basée à Santa Clara qui a conçu la WSE-3, la plus grande puce jamais fabriquée : un wafer de silicium unique mesurant 46,225 millimètres carrés, contenant 4 billions de transistors et 900,000 cœurs de calcul optimisés pour l'IA. Au lieu de découper un wafer de silicium en dizaines de petites puces, Cerebras traite le wafer entier comme un processeur unifié, stockant les matrices de poids complètes des LLM dans 44 GB de SRAM intégrée avec une bande passante mémoire de 21 pétaoctets par seconde. Le système commercial CS-3 intègre cette puce sous forme d'appareil refroidi par eau. Cerebras Inference, lancée le 27 août 2024, est l'API cloud publique qui donne aux développeurs accès à ce matériel pour l'inférence LLM à des vitesses qu'aucun cluster GPU ne peut égaler.

L'API d'inférence propose un catalogue rotatif de modèles ouverts de pointe, incluant GPT-OSS-120B (atteignant environ 3,000 tokens par seconde), Qwen3-235B (jusqu'à 2,500 tokens par seconde avec un contexte de 262K), Llama 4 Maverick (~2,522 tokens par seconde) et Llama 3.1 8B (2,337 tokens par seconde à $0.10 par million de tokens). L'API est compatible avec OpenAI, son intégration nécessite donc uniquement de modifier l'URL de base et la clé API. Une offre gratuite fournit 1 million de tokens par jour sans liste d'attente. Les niveaux Enterprise et développeur débloquent des limites de requêtes plus élevées et une planification prioritaire. En janvier 2026, OpenAI a signé un accord de $10 milliards pour 750 mégawatts de puissance de calcul Cerebras jusqu'en 2028, et AWS a déployé des appareils CS-3 dans ses centres de données, rendant Cerebras disponible via AWS Bedrock.

Ce que fait réellement Cerebras Inference en avril 2026

Cerebras Inference est une API d'inférence pure, et non une plateforme d'entraînement ou un service de fine-tuning. Elle exécute des modèles de langage à poids ouverts à des vitesses qui bouleversent l'économie des applications d'IA en temps réel. Lorsqu'un cluster GPU renvoie une réponse Llama 70B en 12-15 secondes, Cerebras renvoie la même réponse en moins de 2 secondes. Lorsqu'un cluster GPU termine une trace de raisonnement 405B en 45 secondes, Cerebras la termine en 3-4 secondes. Les débits issus des benchmarks d'Artificial Analysis (2025) ne sont pas théoriques : GPT-OSS-120B à ~3,000 tokens par seconde, Llama 3.1 8B à ~2,337 tokens par seconde.

Le catalogue actuel de modèles (avril 2026) comprend GPT-OSS-120B en variantes haute et basse, GLM-4.7 (contexte de 131K), Qwen3-235B et Qwen3-32B, ainsi que Llama 4 Scout. Les fenêtres de contexte varient de 33K à 262K tokens selon le modèle. Tous les modèles s'exécutent nativement avec une précision de 16-bit, ce qui signifie qu'il n'y a aucun compromis de quantification sur la qualité de sortie. L'API suit le format Chat Completions d'OpenAI, prend en charge l'appel de fonctions et le streaming, et est accessible via OpenRouter et HuggingFace ainsi qu'en accès direct. Meta s'est associé à Cerebras pour propulser l'API Llama, offrant aux développeurs des vitesses d'inférence jusqu'à 18 fois plus rapides que les solutions GPU traditionnelles pour l'accès aux modèles Llama.

"Cerebras a été une véritable révélation en matière d'inférence. J'ai beaucoup de respect pour leur fondateur, leur équipe, leur innovation et leur technologie.", maz1b, Hacker News, octobre 2025

Où se situe Cerebras par rapport à Groq et SambaNova

Trois entreprises ont conçu des puces sur mesure spécifiquement pour battre NVIDIA sur l'inférence : Cerebras, Groq et SambaNova. Leurs architectures de puces sont fondamentalement différentes, et ces différences ont un impact sur la façon dont vous utiliseriez chacune d'elles.

Cerebras vs. Groq : Le Language Processing Unit (LPU) de Groq est une conception en pipeline linéaire où les données circulent à travers des unités fonctionnelles de manière synchronisée. Chaque puce Groq ne contient que 230 MB de SRAM, donc l'exécution d'un modèle 70B nécessite des centaines de puces Groq mises en réseau via une architecture propriétaire, et un modèle 400B nécessite des milliers de puces, poussant la consommation électrique au niveau du rack à des centaines de kilowatts. Groq optimise pour le déterminisme et l'inférence 8-bit ; le 16-bit s'exécute beaucoup plus lentement sur le matériel Groq. La WSE-3 de Cerebras élimine totalement la mise en réseau inter-puces : 44 GB de SRAM intégrée maintiennent le modèle sur un seul wafer, et la précision 16-bit s'exécute nativement. Les benchmarks indépendants d'Artificial Analysis (2025) montrent que Cerebras est 6x plus rapide que Groq sur des modèles identiques : GPT-OSS-120B à ~3,000 contre ~493 tokens par seconde, Llama 3.3 70B à plus de 2,500 contre ~403 tokens par seconde. NVIDIA a acquis Groq fin 2025 pour $20 milliards ; l'indépendance de Groq en tant que concurrent a pris fin, bien que le produit continue de fonctionner.

Cerebras vs. SambaNova : La puce SN40L de SambaNova utilise une Reconfigurable Dataflow Unit (RDU) avec une hiérarchie mémoire à trois niveaux : SRAM, HBM et DRAM. La RDU mappe le graphe de calcul complet d'un modèle d'IA directement sur la puce sous forme de pipeline de flux de données personnalisé. Cette mémoire hiérarchisée signifie que SambaNova peut héberger plusieurs grands modèles simultanément et les servir sans recharger les poids. Un système SambaNova complet tient sur 16 puces consommant environ 10 kW en moyenne, contre Cerebras qui nécessite des appareils CS-3 complets refroidis par eau consommant 20-27 kW chacun. SambaNova revendique des performances par surface 40x supérieures à celles de Groq et 10x supérieures à celles de Cerebras sur Llama 3.1 70B. La différence cruciale pour les acheteurs : SambaNova prend en charge le déploiement sur site ; Cerebras est exclusivement cloud. Le débit par utilisateur de SambaNova pour les requêtes individuelles est inférieur à celui de Cerebras en termes de tokens bruts par seconde, mais SambaNova peut servir plus d'utilisateurs simultanés sans la surcharge liée au rechargement des modèles.

À quoi ressemble la réalité de l'API d'inférence au quotidien

L'avantage de vitesse est réel et immédiatement observable. Les développeurs créant des assistants de codage (Cline a ajouté le support de Cerebras dans la v3.20.4, Roo Code dans la v3.25.5) signalent des réponses de modèle quasi instantanées par rapport aux fournisseurs basés sur GPU. Pour les applications interactives, la différence entre une réponse de 2 secondes et une réponse de 0.15 seconde n'est pas qu'une statistique de benchmark. Cela change la nature même des interactions produit possibles. À 2,337 tokens par seconde pour Llama 3.1 8B, une réponse de 500 tokens arrive en environ 0.2 seconde.

Cependant, la réalité quotidienne comporte des frictions que les benchmarks ne capturent pas. Le plafond de 30 requêtes par minute de l'offre gratuite signifie que toute application avec plus d'un utilisateur simultané atteindra immédiatement ses limites. L'inférence étant si rapide, les clients peuvent par inadvertance envoyer des pics de trafic qui déclenchent les limites de requêtes avant même qu'un humain n'ait lu la réponse précédente. Les développeurs doivent intégrer une logique de nouvelle tentative explicite avec des délais. Le prompt caching, qu'Anthropic et OpenAI proposent tous deux pour réduire les coûts sur les contextes répétés, n'existe pas sur Cerebras. Pour les boucles agentiques qui reconstruisent l'historique complet des messages à chaque appel d'outil, les coûts en tokens s'accumulent au prix fort à chaque aller-retour. Un développeur a signalé : sans mise en cache, vous envoyez l'intégralité de l'historique des messages précédents sous forme de tokens d'entrée à chaque appel. Il ne s'agit pas d'une préoccupation théorique, c'est le principal facteur de coût pour les déploiements d'agents complexes sur la plateforme.

"Les limites de requêtes semblent s'activer extrêmement vite et les résultats sont moins bons que Claude Code, ce qui finit par coûter plus cher.". Commentateur sur Hacker News, fil Cerebras Code, 2025

La disponibilité des modèles est également moins stable que chez les fournisseurs cloud GPU. Cerebras effectue une rotation active du support des modèles à mesure que son équipe d'ingénierie optimise de nouveaux checkpoints. Llama 3.1 8B et Qwen3-235B portent tous deux un avis d'obsolescence pour le 27 mai 2026. Les développeurs créant des applications en production doivent surveiller la disponibilité des modèles et gérer les obsolescences. Le catalogue de modèles est également plus restreint que les alternatives cloud GPU : cinq modèles actifs contre des dizaines disponibles sur Together AI ou Replicate.

À qui s'adresse Cerebras

Cerebras Inference est spécialement conçu pour les cas d'usage où la latence est le goulot d'étranglement, et non le coût ou la diversité des modèles. Les agents vocaux en temps réel qui nécessitent des temps de réponse du modèle inférieurs à 200 ms, les assistants de codage en direct où les utilisateurs perçoivent la différence entre des complétions de 2 secondes et de 0.1 seconde, et les systèmes agentiques qui enchaînent des dizaines d'appels de modèles en séquence. Ce sont les charges de travail où la vitesse de Cerebras change ce qui est possible, et pas seulement ce qui est pratique. La liste des premiers clients le confirme : GlaxoSmithKline pour la découverte de médicaments (inférence complexe de domaines protéiques), Cognition pour les agents de code, et maintenant OpenAI pour le service en production de ChatGPT à très grande échelle.

Les chercheurs et les data scientists menant des expériences d'inférence à grande échelle bénéficient de l'offre gratuite de 1M de tokens par jour, qui permet un véritable prototypage d'applications sensibles à la vitesse sans aucun coût. La tarification de $0.10/M tokens pour Llama 3.1 8B est parmi les plus basses de l'industrie pour tout modèle hébergé, rendant les expériences à haut débit réalisables.

À éviter si : vous avez besoin d'entrées multimodales (images, audio, vidéo) : Cerebras est uniquement textuel. À éviter pour un déploiement sur site, ce qui est physiquement peu pratique compte tenu du format et des exigences énergétiques du système CS-3. À éviter pour les applications agentiques s'appuyant sur le prompt caching pour contrôler les coûts. À éviter si une disponibilité constante des modèles est critique pour votre stack de production : le calendrier de rotation des modèles est suffisamment agressif pour nécessiter une surcharge de maintenance. Les équipes ayant besoin d'un fine-tuning approfondi, d'une personnalisation de modèle spécialisée ou d'un vaste catalogue de modèles devraient plutôt se tourner vers les clouds GPU ou la plateforme d'entreprise de SambaNova.

Ce que Cerebras n'est pas

Cerebras n'est pas une entreprise de modèles d'IA. Elle n'entraîne pas de modèles fondateurs et ne possède pas de poids de modèles. Elle sert des modèles ouverts conçus par Meta, Alibaba et d'autres, en les exécutant plus rapidement que n'importe quelle autre plateforme. Si l'écosystème des modèles ouverts cessait de produire des poids compétitifs, Cerebras n'aurait aucun modèle à servir. L'entreprise est entièrement dépendante de la publication continue de modèles à poids ouverts qu'elle peut optimiser pour son matériel.

Cerebras n'est pas un écosystème compatible GPU. Sa stack logicielle est propriétaire et n'est pas basée sur CUDA. Bien que les développeurs accèdent à l'API via l'interface standard compatible OpenAI, les noyaux personnalisés, les schémas de quantification ou les modifications de modèles optimisés pour CUDA ne seront pas transférables. C'est un point important pour les équipes disposant de pipelines d'inférence existants optimisés pour GPU qu'elles souhaitent migrer.

Cerebras n'est pas un fournisseur de matériel sur site pour la plupart des acheteurs. Le CS-3 est un appareil refroidi par eau consommant 20-27 kW, nécessitant une infrastructure de centre de données spécialement conçue. À moins d'avoir l'envergure d'AWS, vous utilisez Cerebras comme une API cloud, et non en déployant son matériel. Cela signifie que votre latence et votre débit d'inférence dépendent des conditions réseau vers les centres de données de Cerebras (six à travers l'Amérique du Nord et l'Europe début 2026).

Avis des utilisateurs

Aucun avis pour l'instant. Soyez le premier à partager votre expérience !

Se connecter pour écrire un avis.

Articles associés

Guides et articles en lien avec Cerebras.