Aller au contenu principal
Vantaige
SambaNova screenshot
SambaNova logo

SambaNova

Freemium

SambaNova Cloud est une API d'inférence IA qui exécute de grands modèles open source à des vitesses inégalées par les fournisseurs basés sur GPU, en utilisant l'architecture de puce RDU propre à SambaNova. Conçue pour les charges de travail des entreprises et des développeurs nécessitant une inférence rapide et rentable sur des modèles allant jusqu'à 671B de paramètres.

Cas d'usage :Entreprise
Fonctionnalités :API

SambaNova Systems est une entreprise de la Silicon Valley spécialisée dans le matériel et le cloud pour l'IA, qui conçoit ses propres puces spécifiquement pour l'inférence IA. Fondée en 2017 par d'anciens professeurs de Stanford, Kunle Olukotun et Chris Re, aux côtés du PDG Rodrigo Liang, l'entreprise a développé la Reconfigurable Dataflow Unit (RDU), aujourd'hui dans sa quatrième génération (SN40L), avec la cinquième génération SN50 annoncée en février 2026. Contrairement aux fournisseurs d'inférence basés sur GPU, la RDU de SambaNova utilise une architecture mémoire à trois niveaux combinant HBM3, DDR DRAM et SRAM sur puce, ce qui permet à un seul rack de 16 puces d'exécuter des modèles comme DeepSeek-R1 671B ou GPT-OSS 120B en continu, sans le mur de la mémoire qui limite le débit des GPU.

SambaNova Cloud est la surface d'API publique : un service de paiement par jeton offrant un accès à DeepSeek V3, Llama 4 Maverick, GPT-OSS 120B, Gemma 3, MiniMax M2.5 et d'autres modèles open source. La tarification en entrée commence à $0.15 par million de jetons sur DeepSeek-V3.1-cb, avec un niveau gratuit (200K jetons/jour, sans carte bancaire requise) pour l'évaluation. Le Developer Tier, lancé le 8 février 2025, ajoute des limites de requêtes plus élevées et une facturation à la consommation. Pour les entreprises nécessitant un déploiement sur site, SambaManaged livre des racks physiques SN40L sans qu'aucune donnée ne quitte l'environnement du client. Le produit Samba-1 de l'entreprise, annoncé le 28 février 2024, est un modèle Composition of Experts d'un billion de paramètres conçu pour un déploiement sur site dans les entreprises réglementées.

Ce que fait réellement SambaNova en avril 2026

SambaNova opère à la fois comme un fabricant de puces et un cloud d'inférence, ce qui la distingue des fournisseurs d'API purs. La conception mémoire de la RDU SN40L place 64GB de HBM3, 1.5TB de DDR DRAM et 520MB de SRAM sur puce sur chaque puce, avec 16 puces dans un rack standard de 19 pouces refroidi par air. Cette architecture signifie que la plateforme n'a pas besoin de partitionner les grands modèles sur des dizaines d'accélérateurs comme le font les clusters de GPU.

Les benchmarks d'Artificial Analysis (mars 2026) montrent que SambaNova délivre 711 jetons/seconde en sortie sur gpt-oss-120B et 250 jetons/seconde sur DeepSeek R1 671B, contre une moyenne d'environ 19 jetons/seconde chez les fournisseurs basés sur GPU pour le même modèle 671B. La latence jusqu'au premier jeton sur gpt-oss-120B tourne autour de 1.25 seconde.

Sur l'API cloud, le catalogue de modèles couvre environ 8 à 10 modèles activement suivis en avril 2026 : plusieurs variantes de DeepSeek, Llama 3.3 70B, Llama 4 Maverick, GPT-OSS 120B, Gemma 3 12B et MiniMax M2.5. L'API est compatible avec OpenAI, ce qui signifie que la plupart du code existant utilisant le SDK OpenAI peut être redirigé vers le point de terminaison de SambaNova par un simple changement d'URL de base.

Le 26 février 2026, SambaNova a annoncé la SN50, sa RDU de cinquième génération. L'entreprise affirme que la SN50 offre 5 fois la vitesse maximale et plus de 3 fois le débit des GPU Nvidia Blackwell B200 pour l'inférence agentique, avec une puissance moyenne par rack de 20kW (permettant un déploiement dans des centres de données refroidis par air sans nécessiter de mises à niveau vers le refroidissement liquide). SoftBank Corp. est le premier client annoncé pour la SN50, avec un déploiement prévu pour des services d'IA souveraine dans la région Asie-Pacifique. La SN50 sera livrée au second semestre 2026.

"Toute l'industrie de l'IA parle de construire le smartphone de l'IA, un système matériel et logiciel intégré, et aujourd'hui, SambaNova est la première à en livrer une version aux entreprises.". Rodrigo Liang, PDG de SambaNova Systems, communiqué de presse BusinessWire, 28 février 2024

Où se situe SambaNova par rapport à Cerebras et Groq

Ces trois entreprises conçoivent des puces spécifiquement pour l'inférence IA plutôt que d'adapter des architectures GPU à usage général. Les différences sont architecturales, et non cosmétiques.

Cerebras (WSE-3) utilise un moteur à l'échelle de la tranche (wafer-scale engine) : une puce unique couvrant une tranche entière de semi-conducteur, avec 4 billions de transistors, 900 000 cœurs de calcul et 44GB de SRAM sur puce avec une bande passante mémoire de 21 PB/s. Cette conception permet d'atteindre le nombre de jetons par seconde par utilisateur le plus rapide de toutes les plateformes. Le compromis : 44GB de SRAM sur puce limitent la taille native du modèle. L'exécution de modèles dépassant cette capacité nécessite un partitionnement sur plusieurs systèmes de tranches. Le WSE-3 nécessite également un refroidissement liquide spécialisé à 23kW par système, comparé au refroidissement par air standard de SambaNova à environ 10kW. Cerebras est principalement fourni via le cloud ; les options sur site sont disponibles mais rares.

Groq (LPU) utilise une Language Processing Unit conçue comme un processeur de flux tensoriel avec une architecture mémoire exclusivement SRAM. Chaque puce LPU ne contient que 230 MiB de mémoire. Cette conception offre une inférence très rapide sur des modèles de petite à moyenne taille (Llama 3.3 70B à environ 350 jetons/seconde), mais le fait d'utiliser uniquement de la SRAM signifie que l'exécution d'un modèle 70B nécessite de répartir la charge de travail sur des centaines de puces : environ 576 puces LPU réparties sur 9 racks pour la même charge de travail 70B que SambaNova exécute sur 16 puces SN40L dans un seul rack. À l'échelle de 671B de paramètres, Groq ne peut pas rivaliser efficacement. Aucun déploiement sur site n'est proposé.

La conception mémoire à trois niveaux de SambaNova gère les plus grands modèles sur un matériel minimal et prend en charge le trafic d'entreprise multi-utilisateurs simultanément sur de nombreux modèles. Le compromis par rapport à Cerebras est la vitesse de pointe par utilisateur unique ; le compromis par rapport à Groq est la maturité de l'écosystème de développeurs et la transparence des prix.

"Si les GPU pouvaient véritablement utiliser leur bande passante mémoire, ils seraient beaucoup plus rapides, mais ils ne le peuvent pas.". Anton McGonnell, responsable des produits logiciels, SambaNova Systems, The Register, septembre 2024

À quoi ressemble la réalité de l'API pour les développeurs

Le niveau gratuit de SambaNova Cloud offre 200 000 jetons par jour, ce qui est suffisant pour évaluer des modèles mais pas pour exécuter une application en production. Le Developer Tier lancé le 8 février 2025 débloque la facturation à la consommation par jeton et des limites de requêtes plus élevées, avec un crédit gratuit de $5 à l'inscription. L'API est compatible avec OpenAI, l'intégration est donc simple pour les développeurs travaillant déjà avec des API de LLM.

C'est au niveau des limites de requêtes que les frictions s'accumulent. Même sur le Developer Tier, certains modèles sont plafonnés à 20 requêtes par minute malgré une documentation annonçant des limites plus élevées. Une migration du système de facturation sur plusieurs semaines début 2026 a laissé de nombreux développeurs bloqués sur les limites du niveau gratuit, même après l'ajout de méthodes de paiement. Des utilisateurs sur le forum communautaire ont signalé des erreurs 429 interrompant des applications en production, le journal d'un développeur montrant 3,3 millions de jetons utilisés face à un plafond quotidien de 200K qui n'a pas pu être mis à niveau malgré une carte bancaire liée. SambaNova a reconnu que le problème était dû à un bug de migration de facturation et a résolu la plupart des cas via des ajustements manuels de niveau, mais n'a proposé aucun calendrier d'achèvement ferme.

Le catalogue de modèles est plus restreint que celui d'OpenAI ou d'Anthropic. Il n'y a pas de modèles de fondation propriétaires de SambaNova disponibles via l'API cloud ; Samba-1 est exclusivement destiné aux entreprises sur site. Pas de GPT-4, pas de Claude, pas de Gemini. Si votre cas d'usage nécessite quoi que ce soit en dehors de l'ensemble de modèles open source hébergés par SambaNova, vous ne pourrez pas le couvrir au sein de la plateforme.

Pour les équipes d'entreprise qui vont de l'avant avec le déploiement sur site SambaManaged, la portée de l'intégration s'étend bien au-delà de l'accès à l'API : la logique métier, l'automatisation des flux de travail, la surveillance et la récupération de contexte relèvent toutes de l'ingénierie sur mesure. Une analyse externe a décrit l'expérience comme "acheter un moteur de Formule 1 alors que ce dont vous avez vraiment besoin, c'est d'une voiture", soulignant l'écart entre la capacité matérielle brute et un système de production déployable.

Pour qui SambaNova est conçu

SambaNova Cloud correspond à un profil de développeur spécifique : les équipes exécutant une inférence à haut débit sur de grands modèles open source où les jetons par seconde se traduisent par de réelles économies de coûts ou des différences d'expérience utilisateur. Les équipes de services financiers créant des analyses de trading en temps réel, les ingénieurs ML dans des laboratoires nationaux ou des industries réglementées nécessitant une confidentialité sur site, et les développeurs concevant des agents de recherche approfondie qui traitent des millions de jetons par session représentent tous des cas d'usage réalistes. La tarification par jeton défie considérablement les fournisseurs basés sur GPU à grande échelle : $0.22 en entrée / $0.59 en sortie par million de jetons pour gpt-oss-120B contre des tarifs nettement plus élevés sur des points de terminaison GPU comparables.

L'Argonne National Laboratory de l'US Department of Energy a déployé un cluster d'inférence SN40L complet en novembre 2024, l'utilisant pour alimenter AuroraGPT et la recherche scientifique pilotée par l'IA en biologie, chimie et science des matériaux. Accenture a désigné Samba-1 comme étant adapté aux clients d'entreprise nécessitant une IA sur site complète (full-stack). Ce sont là les archétypes de clients que SambaNova sert véritablement bien.

Ce que SambaNova n'est pas

Ignorez SambaNova Cloud si vous avez besoin de modèles frontières propriétaires. Il n'y a pas de GPT-4, pas de Claude, pas de Gemini, aucun accès API au propre Samba-1 de SambaNova. Si votre cas d'usage nécessite l'accès à un vaste catalogue de modèles incluant des modèles fermés, vous avez besoin d'un autre fournisseur.

Ignorez-le si vous prototypez en solo ou dans une petite équipe sans ressources d'ingénierie. Les limites de requêtes du niveau gratuit sont vite atteintes. Le système de facturation a connu des échecs de mise à niveau documentés. La documentation, bien qu'en amélioration, est plus mince que celle d'OpenAI. Le produit d'entreprise sur site nécessite des mois de travail d'implémentation et un engagement commercial complet.

Ignorez-le si vous avez besoin d'un contexte complet de 128K sur de grands modèles. Lors de son lancement en septembre 2024, le modèle 405B était limité à un contexte de 8K pour des raisons de gestion du trafic. Les limites de la fenêtre de contexte sur les plus grands modèles restent une contrainte connue.

La plus grande valeur de SambaNova se révèle lorsque vous exécutez de grands modèles open source à grande échelle, que la latence est importante et que vous êtes prêt à effectuer un véritable travail d'ingénierie pour construire par-dessus la capacité d'inférence brute qu'elle offre.

Avis des utilisateurs

Aucun avis pour l'instant. Soyez le premier à partager votre expérience !

Se connecter pour écrire un avis.

Articles associés

Guides et articles en lien avec SambaNova.