

Vast.ai est une place de marché de location de GPU en peer-to-peer où des hôtes indépendants proposent de la puissance de calcul aux prix du marché. Les H100 sont disponibles à partir d'environ 0,90 $/h, les RTX 4090 à partir de 0,34 $/h. Bien moins cher que les clouds managés, avec des compromis sur la fiabilité et la complexité de configuration.
Vast.ai est une place de marché décentralisée de location de GPU fondée en 2018 par Jake Cannell. Plutôt que de posséder sa propre flotte de GPU, la plateforme met en relation des hôtes indépendants (particuliers, centres de données, fournisseurs de services managés) avec des locataires ayant besoin de puissance de calcul pour l'entraînement de l'IA, l'inférence et le rendu. Les prix sont fixés par l'offre et la demande, ce qui explique pourquoi Vast.ai est systématiquement 60 à 80 % moins cher que les clouds managés sur du matériel comparable. Début 2026, la plateforme répertorie plus de 20 000 GPU répartis sur 68 types de GPU provenant de plus de 1 400 fournisseurs, allant des cartes grand public RTX jusqu'au matériel d'entreprise H100, H200 et B200.
Le produit principal consiste en des instances GPU à la demande provisionnées via une console web, une CLI ou une API REST avec une facturation à la seconde. Les locataires effectuent des recherches, filtrent par type de GPU et score de fiabilité, puis déploient un conteneur Docker en quelques secondes. En décembre 2025, Vast.ai a lancé son produit Serverless, qui ajoute une mise à l'échelle des GPU entièrement automatisée pour les charges de travail d'inférence, incluant l'optimisation prédictive de la charge et des points de terminaison multi-groupes de travail (multi-workergroup). La plateforme détient les certifications SOC 2 Type I et II, avec un mode Secure Cloud en option (ISO 27001, HIPAA) pour les équipes manipulant des données sensibles.
Ce que fait réellement Vast.ai en mai 2026
Vast.ai exploite trois produits de calcul distincts. Le GPU Cloud d'origine est une place de marché à la demande où les locataires choisissent une machine, fixent une enchère maximale et lancent un conteneur Docker sur le matériel de cet hôte. La facturation se fait à la seconde, avec des lignes distinctes pour le temps de GPU actif, le stockage (facturé même lorsque l'instance est en pause) et la bande passante sortante.
Le deuxième produit est Clusters, qui fournit des configurations multi-nœuds dédiées avec un réseau InfiniBand pour les tâches d'entraînement distribuées trop volumineuses pour un seul nœud. Il s'agit d'une offre moins standardisée qui nécessite une coordination directe avec la plateforme.
Le troisième produit est Vast.ai Serverless, lancé le 10 décembre 2025. Cette couche gère automatiquement les démarrages à froid, l'autoscaling et le routage des tâches sur le réseau d'hôtes distribué. Un décorateur du SDK Python permet aux développeurs d'appeler des fonctions d'inférence comme s'il s'agissait de code local, tandis que l'infrastructure s'exécute à distance. La mise à jour du produit d'avril 2026 a ajouté des points de terminaison compatibles OpenAI et un chemin de déploiement natif Python sans dépendance au tableau de bord.
Les types de matériel disponibles en avril 2026 incluent toute la gamme grand public RTX (de la 3060 à la 5090), les variantes de centre de données A100 et H100, L40S, H200, B200, ainsi que le matériel AMD Radeon/Instinct ajouté en mai 2024 lorsque Vast est devenue la première grande place de marché de location de GPU à prendre en charge AMD. Cette annonce concernant AMD a coïncidé avec l'annonce par l'entreprise d'une croissance de 265 % d'une année sur l'autre depuis 2019 et d'un taux de croissance de 310 % spécifiquement en 2024. Le PDG Jake Cannell a présenté l'expansion vers AMD comme une stratégie délibérée axée sur l'offre : « L'ajout de la prise en charge d'AMD aide Vast à poursuivre la tendance et à continuer de dominer le secteur. » L'effet pratique a été que les fournisseurs de services managés disposant de matériel AMD inactif pouvaient désormais le proposer sur la place de marché, élargissant ainsi l'offre sans que Vast.ai n'ait à acheter de matériel elle-même.
Les plus de 700 000 transactions mensuelles et les plus de 123 000 clients payants de la plateforme reflètent une base d'utilisateurs orientée vers les profils techniques. L'utilisateur typique de Vast.ai n'est pas quelqu'un qui a cliqué sur un lien d'inscription et qui a besoin d'un tutoriel guidé. Il sait déjà de quel GPU il a besoin, quelle quantité de VRAM son modèle exige et comment écrire un Dockerfile. La plateforme récompense ces connaissances par un accès à des niveaux de prix que les clouds managés ne peuvent égaler. Cette même exigence de connaissances est également la principale raison pour laquelle Vast.ai ne convient pas à toutes les équipes.
Où se situe Vast.ai par rapport à RunPod et Lambda Labs
L'espace du cloud GPU se divise grosso modo en trois niveaux. Les clouds d'entreprise managés (Lambda Labs, CoreWeave) possèdent leur matériel, fournissent des SLA de fiabilité et facturent en conséquence. Les plateformes managées hybrides (RunPod) exploitent leurs propres centres de données tout en servant de courtiers pour des hôtes tiers. Les places de marché (Vast.ai) ne possèdent rien et laissent l'offre et la demande fixer les prix. Cette différence structurelle est ce qui explique à la fois l'avantage tarifaire de Vast.ai et son plafond de fiabilité.
Face à RunPod, Vast.ai l'emporte généralement sur le prix horaire brut, parfois avec une marge importante. A100 SXM 80GB : RunPod 0,79 $/h contre Vast.ai 0,67 $/h. L40 : RunPod 0,69 $/h contre Vast.ai 0,31 $/h. H100 80GB : RunPod 1,50-1,99 $/h contre Vast.ai 0,90-1,87 $/h selon le niveau de vérification de l'hôte. RunPod gère ses propres centres de données « Secure Cloud » avec une disponibilité d'environ 99,5 % et propose des modèles de déploiement en un clic pour les frameworks ML courants. Vast.ai n'a pas de niveau managé équivalent à moins d'opter pour Secure Cloud, ce qui réduit considérablement l'écart de prix. Le résumé honnête d'une analyse de prix de 2026 : « Vast.ai gagne généralement sur le prix horaire brut du GPU (parfois de beaucoup), tandis que RunPod gagne souvent sur la commodité du 'j'ai besoin que ça marche tout de suite'. »
Lambda Labs est l'autre comparaison courante, ciblant les équipes de recherche et les entreprises clientes qui souhaitent un cloud managé avec un personnel de support spécialisé en ML. Le A100 de Lambda coûte environ 1,29 $/h contre 0,52-0,80 $/h chez Vast.ai pour un matériel équivalent, soit une prime de 60 à 150 %. Le catalogue de GPU de Lambda est plus restreint (A100, H100, A10G, RTX 6000 Ada), les H100 peuvent être en rupture de stock lors des pics de demande, et la tarification est fixe plutôt que dictée par le marché. Ce que Lambda offre en retour : des ingénieurs de support dédiés, une intégration fluide et une infrastructure qui ne dépend pas du comportement d'hôtes tiers indépendants. Pour les équipes ayant des exigences strictes en matière de traitement des données ou aucune tolérance pour la variabilité de l'infrastructure, la prévisibilité de Lambda justifie le coût. Pour les chercheurs aux budgets limités qui maîtrisent Docker, Vast.ai l'emporte généralement sur le seul plan économique.
Face à CoreWeave, Crusoe, Modal et Replicate, Vast.ai occupe une position différente. CoreWeave est un fournisseur managé de niveau hyperscaler ; ses H100 tournent à plus de 3,90 $/h à la demande. Crusoe se concentre sur le calcul durable pour les contrats d'entreprise. Modal et Together AI font totalement abstraction de l'infrastructure, offrant des API d'inférence serverless où les utilisateurs ne provisionnent jamais d'instances. Le produit Serverless de Vast.ai chevauche désormais partiellement Modal et Together AI pour l'inférence, mais le produit principal de la place de marché reste axé sur l'infrastructure : les utilisateurs provisionnent toujours des conteneurs Docker et gèrent leurs propres dépendances.
« Vast m'a fait économiser des dizaines de milliers de dollars en exécutant des expériences ML. » - tehsauce, Hacker News, mars 2023
« Nous avons mis à l'échelle jusqu'à 46 serveurs H100, réalisant une tâche d'enrichissement LLM de 100 000 documents en 38 minutes à un quart des coûts habituels du cloud. » - Anna Bosch, VP Data Intelligence, Launchmetrics, décembre 2025
À quoi ressemble la réalité de la location au quotidien
Le flux de travail : ajoutez du crédit (minimum 5 $), recherchez les offres disponibles filtrées par type de GPU, VRAM, score de fiabilité, statut vérifié et prix, puis déployez une image Docker. La facturation à la seconde commence immédiatement ; la facturation du stockage continue même lorsque l'instance est arrêtée. La CLI et le SDK Python prennent en charge la recherche et le provisionnement programmatiques, ce qui est important pour les flux de travail par lots où vous souhaitez trouver automatiquement l'instance disponible la moins chère correspondant à vos critères.
Les instances interruptibles permettent aux hôtes de récupérer leur GPU avec un court préavis, généralement quelques minutes. Celles-ci sont 30 à 50 % moins chères que les instances à la demande du même hôte et sont judicieuses pour les tâches d'entraînement avec la sauvegarde de points de contrôle (checkpointing) activée. Sans points de contrôle, une interruption à la 8ème heure d'une exécution de 10 heures signifie qu'il faut tout recommencer à zéro.
Les hôtes de centres de données vérifiés coûtent plus cher (1,50-1,87 $/h pour les H100) mais réduisent l'écart de fiabilité à un surcoût de 3 à 13 % par rapport au tarif affiché. Les hôtes non vérifiés sont moins chers mais comportent une prime de coût effectif de 20 à 55 % après prise en compte des temps d'arrêt et des frais généraux de redémarrage. Le filtre de score de fiabilité dans l'interface de recherche met en évidence ce risque, mais il ne l'élimine pas. Conseil pratique de la communauté : filtrez pour obtenir des hôtes vérifiés lors de l'exécution de tâches de plus de 2 à 3 heures, et intégrez toujours des intervalles de points de contrôle quoi qu'il arrive.
La bande passante est une lacune connue. De nombreux utilisateurs ont signalé un débit réel systématiquement 10 fois inférieur à celui annoncé, ce qui affecte les temps de téléchargement des grands ensembles de données et ralentit les flux de travail dépendant de transferts de données fréquents. Il s'agit d'un problème d'infrastructure côté hôte que la plateforme ne peut pas entièrement contrôler via les mécanismes de la place de marché.
Pour qui Vast.ai est conçu
Vast.ai est bien adapté aux chercheurs en ML et aux étudiants réalisant des expériences avec des contraintes de coûts, aux développeurs indépendants exécutant des tâches de fine-tuning ou d'inférence par lots qui sont à l'aise avec Docker, et aux équipes effectuant du traitement par lots à grande échelle où les coûts par exécution importent plus que la fiabilité par exécution. Le checkpointing gère les redémarrages, et les économies sont réelles : à 0,34 $/h pour une RTX 4090 contre 0,79-1,00 $/h sur des alternatives managées, une exécution de fine-tuning de 40 heures peut coûter 14 $ sur Vast.ai contre 32 à 40 $ ailleurs. Cette différence se cumule à l'échelle d'un laboratoire de recherche exécutant des dizaines d'expériences par semaine.
La plateforme convient également parfaitement aux organisations qui créent des pipelines d'IA programmatiques. L'API REST et le SDK Python permettent la recherche, le provisionnement et la destruction automatisés d'instances, ce qui est important pour les tâches d'inférence par lots ou les pipelines d'évaluation de modèles qui doivent lancer des calculs à la demande sans intervention humaine. Le produit Serverless lancé en décembre 2025 a étendu cela encore plus loin, ciblant les équipes qui souhaitent un point de terminaison d'inférence sans gestion d'instance, plaçant désormais Vast.ai en concurrence partielle avec Modal et Together AI sur ce cas d'usage spécifique.
Les équipes de startups aux budgets limités utilisent souvent Vast.ai pour le développement et l'expérimentation, puis passent à un cloud managé pour la production. L'aspect économique favorise fortement cette répartition : prototyper sur Vast aux tarifs de la place de marché, déployer l'inférence de production sur RunPod Secure Cloud ou Lambda une fois que le modèle est validé et que les exigences de fiabilité sont fermes. Ce flux de travail évite de payer trop cher pour du calcul managé pendant la phase exploratoire tout en maintenant une fiabilité de niveau production là où cela compte.
Ce que Vast.ai n'est pas
Vast.ai n'est pas un cloud managé. Il n'y a pas de SLA de disponibilité sur les instances standard. Il n'y a pas d'équipe de support dédiée analogue au personnel d'ingénierie ML de Lambda Labs. Vast.ai décrit son support comme un chat humain, mais de nombreux retours de la communauté décrivent la profondeur des réponses comme étant basique plutôt qu'au niveau d'un expert en infrastructure.
La sécurité est la préoccupation la plus citée par les utilisateurs techniquement expérimentés. Étant donné que les hôtes ont un accès complet à l'environnement hôte Docker, ils peuvent théoriquement inspecter les charges de travail en cours d'exécution : « Vast est un marché gris avec très peu de mesures de sécurité en place. Un hôte peut espionner vos charges de travail très facilement car il a un accès complet à l'hôte docker. » - deserialized, Hacker News, mai 2023. L'option Secure Cloud avec la norme ISO 27001 atténue ce problème pour une utilisation en entreprise, mais les instances standard de la place de marché ne sont pas appropriées pour les charges de travail impliquant des poids de modèles propriétaires, des données d'entraînement privées ou des informations personnelles réglementées.
La contrainte du conteneur unique limite l'intégration avec les architectures multi-services. Vous ne pouvez pas brancher proprement Vast à un cluster Dagster ou Airflow existant ; la plateforme provisionne des conteneurs individuels, pas des couches d'orchestration. Pour les équipes dont les charges de travail d'IA sont étroitement intégrées aux outils d'infrastructure existants, RunPod ou un cloud managé est un meilleur choix opérationnel.
Évitez Vast.ai lorsque : votre tâche ne peut pas tolérer d'interruptions en cours d'exécution sans points de contrôle, vous manipulez des données sensibles/PII en dehors de Secure Cloud, vous avez besoin d'un point de terminaison d'inférence de production avec des garanties de SLA, ou votre équipe manque d'expérience avec Docker et a besoin d'un déploiement basé sur des modèles pour avancer rapidement.
Avis des utilisateurs
Aucun avis pour l'instant. Soyez le premier à partager votre expérience !
Se connecter pour écrire un avis.
Articles associés
Guides et articles en lien avec Vast.ai.

Mistral Medium 3.5 Self Host: 77.6% SWE-Bench on 4 GPUs (2026)

Google Vision AI Explained (2026): Pricing Per 1,000 Units, Free Tier, and Alternatives

Grok 4.3 API for Agents (May 2026): Pricing, Benchmarks, Migration

Vantaige Launches the LLM VRAM Calculator: A Free GPU Compatibility Finder for Open-source and Open-Weight AI

Run Open Source AI Models Locally: Battle-Tested Guide
