Aller au contenu principal
Vantaige
Baseten screenshot
Baseten logo

Baseten

Freemium

Baseten est une plateforme d'inférence gérée permettant de déployer des modèles d'IA personnalisés et affinés en production sous forme d'API à mise à l'échelle automatique. Avec l'empaquetage Truss, les pipelines Chains et la conformité HIPAA, elle cible les équipes ML qui déploient leurs propres modèles, et est soutenue par une levée de fonds menée par NVIDIA en 2026.

Fonctionnalités :API

Baseten est une plateforme d'inférence gérée permettant de mettre en production des modèles d'IA personnalisés et open source sous forme d'API rapides et à mise à l'échelle automatique. Fondée en 2019 à San Francisco par quatre ingénieurs qui se sont rencontrés en créant des systèmes de détection de fraude par machine learning chez Gumroad, avec Tuhin Srivastava au poste de PDG, toute sa proposition de valeur se résume dans son slogan : « l'inférence est tout » (inference is everything). Vous empaquetez un modèle, et Baseten l'exécute sur des GPU réservés en gérant pour vous la mise à l'échelle automatique, la surveillance, la journalisation et la conformité, réduisant ainsi à néant les mois de travail d'infrastructure qui séparent normalement un modèle entraîné d'un point de terminaison en production. Contrairement à un simple revendeur d'API de modèles, Baseten est conçu autour de vos modèles, y compris ceux qui sont affinés et entièrement propriétaires, avec des options d'auto-hébergement et de déploiement dans un VPC pour les équipes qui ne peuvent pas envoyer de données vers un cloud partagé.

Le produit s'articule autour de quatre éléments principaux : les Déploiements Dédiés (Dedicated Deployments), qui sont des GPU réservés à mise à l'échelle automatique facturés à la minute ; les API de Modèles (Model APIs), qui offrent un accès par jeton à des modèles ouverts populaires comme DeepSeek et Llama ; Baseten Chains, qui exécute des pipelines multi-modèles où chaque étape tourne sur un matériel spécifiquement adapté ; et Baseten Loops, un SDK de 2026 pour l'apprentissage par renforcement et l'affinage (fine-tuning). La porte d'entrée est Truss, le framework open source d'empaquetage de modèles de Baseten. Parmi ses clients en production figurent Cursor, Notion, l'entreprise d'IA médicale Abridge et l'entreprise d'IA juridique Harvey. La plateforme est certifiée SOC 2 Type II et conforme à la loi HIPAA. NVIDIA a investi directement dans la levée de fonds de Baseten en janvier 2026, un signal fort quant à la direction que prend la demande en inférence selon le fabricant de GPU.

Ce que vous déployez réellement sur Baseten en juin 2026

L'unité centrale est le déploiement de modèle. Vous enveloppez un modèle avec Truss, vous le poussez, et Baseten le sert sur des GPU allant d'un modeste T4 jusqu'à un B200, en ajustant le nombre de réplicas en fonction du trafic, et même jusqu'à zéro en cas d'inactivité. Pour les équipes qui ne souhaitent rien empaqueter, les API de Modèles offrent un accès instantané par jeton aux modèles ouverts courants, tandis que Chains permet d'assembler plusieurs modèles (par exemple, une reconnaissance vocale alimentant un LLM qui alimente un résumeur), chaque étape s'exécutant sur le matériel approprié. Loops, ajouté en 2026, comble le fossé entre l'entraînement et le service, permettant de promouvoir un point de contrôle (checkpoint) affiné vers un point de terminaison en direct avec une seule commande.

La dynamique de la plateforme est difficile à exagérer. Le 23 janvier 2026, Baseten a levé $300 million pour une valorisation de $5 billion, avec NVIDIA parmi les investisseurs. Des estimations indépendantes montrent que les revenus ont triplé, passant d'environ $200 million à $600 million annualisés entre décembre 2025 et mars 2026, portés par un volume d'inférence multiplié par 100 d'une année sur l'autre. C'est une entreprise qui est tirée par la demande plutôt que de devoir la chercher.

Baseten face à Modal et Replicate, d'un point de vue mécanique

Modal et Baseten résolvent des problèmes qui se chevauchent, mais par des approches opposées. Modal vous offre des fonctions Python serverless définies avec des décorateurs et facture à la seconde d'exécution, ce qui est idéal pour les tâches par lots irrégulières et le calcul général que vous construisez vous-même. Baseten est un modèle en tant que service (model-as-a-service) : l'unité est le déploiement, et non la fonction, et les optimisations d'inférence telles que le réglage du noyau (kernel tuning) et la mise en cache des poids sont intégrées. Le réseau de distribution de Baseten peut mettre en ligne un modèle de moins de 20 Go en moins de dix secondes, mais un réplica à chaud est facturé en continu, tandis que le modèle à la seconde de Modal récompense le trafic irrégulier. Sur le matériel brut, le H100 de Modal coûte environ $3.95 par heure contre $6.50 pour Baseten ; vous payez donc Baseten pour la couche de service gérée. Replicate est l'autre point de référence, bien qu'il ait été acquis par Cloudflare début 2026 et intégré à Workers AI. Il a toujours ciblé les développeurs individuels réalisant des prototypes à partir d'un vaste catalogue de modèles communautaires, plutôt que les entreprises déployant des modèles propriétaires sous contraintes de conformité, ce qui est précisément le territoire de Baseten.

Ce que coûte réellement la facturation basée sur les réplicas

Les Déploiements Dédiés sont facturés à la minute de temps de réplica actif, ce qui revient à environ $0.63 par heure pour un T4, $4.00 pour un A100, $6.50 pour un H100 et $9.98 pour un B200. Il n'y a pas de frais pour le temps d'inactivité, mais le mot important est réplica, car chaque réplica en cours d'exécution coûte de l'argent en continu. Ainsi, une configuration à deux réplicas pour la redondance double immédiatement la facture. Les API de Modèles sont quant à elles facturées par jeton, avec DeepSeek V4 à $1.74 en entrée et $3.48 en sortie par million, ce qui est plus simple pour les modèles standards. Les nouveaux comptes bénéficient de crédits gratuits, et les startups éligibles (de l'amorçage à la série A) peuvent réclamer jusqu'à $25,000 via le programme pour startups.

« Baseten joue un rôle central dans notre infrastructure d'IA pour l'hébergement et le service de notre moteur de recommandation de modèles. » Tomas Hernando Kofman, Not Diamond, Product Hunt, 2024.

La tension structurelle se situe entre le démarrage à froid (cold start) et le coût. Si vous réduisez l'échelle à zéro, vous économisez de l'argent, mais vous subissez un démarrage à froid de 30 à 90 secondes lors de la requête suivante pour un grand modèle. Si vous gardez un réplica à chaud, la latence disparaît, mais les économies du serverless aussi. Pour du temps GPU brut et bon marché sans la couche gérée, RunPod coûte une fraction du prix, mais vous renoncez à la mise à l'échelle automatique, à l'optimisation et à la conformité qui justifient le choix de Baseten en premier lieu.

Les frictions que les équipes Baseten rencontrent régulièrement

Le modèle de facturation est la source de surprise la plus courante. Les coûts par minute et par réplica sont difficiles à prévoir, la redondance les multiplie, et il n'y a pas de plafond budgétaire bien visible. Ainsi, les équipes ayant un trafic en dents de scie signalent des factures qui grimpent sans avertissement. Truss, le framework même qui facilite l'intégration, crée également un coût de changement, car quitter Baseten implique de réécrire les enveloppes de modèles pour vLLM ou SGLang. La qualité du support semble inconstante selon les avis publics, un utilisateur décrivant un calvaire de dix jours pour un changement de routine.

« Tout ce dont j'avais besoin, c'était d'une simple mise à jour de l'adresse de facturation, une chose que toute plateforme normale permet de modifier directement dans l'interface utilisateur. » Valerio, Product Hunt, 2025.

Enfin, Baseten est conçu exclusivement pour l'ingénierie. Il n'y a pas de tableau de bord en libre-service pour les utilisateurs non techniques, et sa surveillance met en évidence l'utilisation des GPU et les temps de réponse plutôt que des indicateurs commerciaux. C'est tout à fait adapté à son public, mais cela représente un mur pour quiconque s'attend à une expérience no-code.

Qui devrait construire sur Baseten, et qui ne le devrait pas

Baseten est un choix solide pour les équipes d'ingénierie ML déployant des modèles personnalisés ou affinés, pour les entreprises dont les exigences de conformité (HIPAA, SOC 2 ou hébergement dans un VPC) excluent les clouds d'inférence partagés, pour les équipes construisant des pipelines multi-modèles avec Chains, et pour les laboratoires exécutant un post-entraînement par renforcement qui souhaitent une continuité de l'entraînement à l'inférence grâce à Loops. Les startups de l'amorçage à la série A qui se qualifient pour le programme de crédits bénéficient d'une rampe de lancement généreuse.

Il n'apporte pas grand-chose aux équipes qui se contentent d'appeler des API de modèles prêtes à l'emploi, où le fournisseur natif est plus simple. Les équipes sensibles aux prix qui exécutent des modèles ouverts standards à un volume modéré trouveront généralement Together AI ou un hébergeur facturant au jeton moins cher et moins lourd sur le plan opérationnel. Les développeurs solos et les amateurs trouveront les coûts par réplica et la charge d'ingénierie excessifs, et quiconque souhaite un prototypage rapide et avec peu de code ira plus vite sur Modal. Baseten ne justifie son prix premium que si vous avez véritablement besoin d'un service géré, conforme et optimisé pour vos propres modèles.

Avis des utilisateurs

Aucun avis pour l'instant. Soyez le premier à partager votre expérience !

Se connecter pour écrire un avis.

Articles associés

Guides et articles en lien avec Baseten.