

Nebius est un cloud d'IA coté au Nasdaq offrant une puissance de calcul GPU NVIDIA à grande échelle, ainsi que l'API d'inférence Token Factory pour les modèles ouverts. La localisation des données dans l'UE, la gouvernance d'entreprise et un investissement de NVIDIA en font une option sérieuse pour l'entraînement et l'inférence en production.
Nebius est une entreprise de cloud d'IA full-stack, cotée au Nasdaq sous le symbole NBIS et basée à Amsterdam, qui loue de la puissance de calcul GPU NVIDIA à grande échelle et gère une API d'inférence par-dessus. Ce n'est pas une startup au sens classique du terme. Elle est issue de la restructuration de Yandex N.V. en 2024, a conservé environ 1 300 ingénieurs, un centre de données finlandais et la propriété intellectuelle en matière d'IA, s'est séparée de tous ses actifs russes et a repris sa cotation au Nasdaq sous le nom de Nebius Group en octobre 2024. Le problème qu'elle résout est simple : les laboratoires d'IA et les entreprises ont besoin de clusters de qualité NVIDIA pour l'entraînement et l'inférence sans avoir à construire leurs propres centres de données. Nebius offre cela sous forme de cloud managé, allant des GPU bruts facturés à l'heure jusqu'au point de terminaison d'API facturé au token, sans obliger les clients à surveiller Kubernetes ou l'état de santé des nœuds.
L'offre se divise en trois couches. Nebius AI Cloud représente la puissance de calcul GPU brute, avec des instances H100, H200, B200 et B300 sur des châssis connectés via InfiniBand, incluant gratuitement Kubernetes et Slurm managés. Token Factory, lancée en novembre 2025, est l'API d'inférence compatible OpenAI couvrant plus de 60 modèles ouverts dont DeepSeek, Llama et Qwen, avec des points de terminaison dédiés, un SLA de 99.9% et un fine-tuning en un clic. Aether est la couche de gouvernance d'entreprise ajoutant les certifications SOC 2 Type II, ISO 27001 et la localisation des données dans l'UE. NVIDIA a engagé un investissement stratégique de $2 milliards en mars 2026, et Nebius détient des accords de capacité de plusieurs milliards de dollars avec Meta et Microsoft.
Ce que Nebius vend réellement en juin 2026
Considérez Nebius comme deux portes d'entrée vers la même infrastructure. La première est le calcul brut : des instances GPU non virtualisées connectées via InfiniBand, à la demande ou préemptibles, avec Kubernetes managé, Slurm et le stockage inclus sans frais supplémentaires. C'est ici que s'exécutent le pré-entraînement, le fine-tuning à grande échelle et les charges de travail distribuées personnalisées. La seconde est Token Factory, l'API d'inférence managée, qui permet à un développeur de passer du nom d'un modèle à un point de terminaison en production en quelques minutes, au lieu de l'après-midi de configuration qu'exige le calcul brut. Elle est facturée au token sans coût de GPU inactif, s'adapte automatiquement à d'énormes volumes de requêtes et offre une inférence sans conservation des données (zero-retention) dans les régions de l'UE et des États-Unis. Le contexte de l'entreprise est important ici, car l'infrastructure est un pari sur le long terme : l'investissement de $2 milliards de NVIDIA en mars 2026, un accord de $27 milliards avec Meta et un contrat avec Microsoft d'une valeur allant jusqu'à $19.4 milliards donnent à Nebius un carnet de commandes contractuel d'environ $45 milliards et une visibilité financière crédible, ce qui est rassurant pour quiconque y engage un pipeline d'entraînement.
Nebius face à CoreWeave et Together AI
CoreWeave est le concurrent cloud GPU le plus proche, et les différences sont structurelles. Tous deux proposent des H100, H200 et B200, mais Nebius met l'accent sur des châssis ODM personnalisés pour un coût total de possession inférieur et, surtout, intègre une API d'inférence managée (Token Factory) que CoreWeave n'égale pas. CoreWeave dispose d'une plus grande empreinte en Amérique du Nord et en Europe et s'appuie sur des contrats pluriannuels avec des hyperscalers, tandis que Nebius propose des GPU à l'heure en libre-service total sans engagement minimum, et était rentable en 2025 là où CoreWeave a enregistré de lourdes pertes. Face à Together AI, le contraste se situe au niveau de la profondeur de l'infrastructure : Together est principalement une API d'inférence avec des points de terminaison dédiés en option, tandis que Nebius possède des centres de données physiques et peut fournir à la fois des clusters multi-nœuds pour l'entraînement et de l'inférence depuis un seul compte, avec une localisation explicite des données dans l'UE que Together, centré sur les États-Unis, ne met pas en avant. Pour une équipe européenne soumise au RGPD, cette localisation est souvent le facteur décisif, et des besoins en GPU plus légers peuvent également être satisfaits par des alternatives directes comme Crusoe ou RunPod.
Combien coûtent le cloud GPU et Token Factory
La tarification des GPU est transparente et compétitive : un H100 coûte $3.85 par heure à la demande ou $2.15 en préemptible, un H200 est à $4.50 ou $2.45, et un B200 à $7.15 ou $3.95, avec des remises allant jusqu'à 35% sur les clusters réservés pour des engagements de plusieurs mois. L'inférence sur Token Factory va d'environ $0.08 par million de tokens pour les petits modèles jusqu'à près de $1.93 pour les modèles premium, avec des remises sur les lots et d'importantes économies de cache sur les contextes répétés. Il n'y a pas d'essai GPU gratuit, et un dépôt minimum de $25 active la facturation.
"En tirant parti des points de terminaison dédiés, nous avons obtenu des performances garanties. L'autoscaling a changé la donne, nous permettant de gérer 200 milliards de tokens par jour sans intervention manuelle." Zulkuf Genc, Directeur de l'IA chez Prosus, novembre 2025.
Des crédits sont disponibles, mais ils sont soumis à conditions plutôt qu'ouverts à tous : les startups du programme NVIDIA Inception peuvent demander jusqu'à $150,000 via le programme AI Lift, et les chercheurs universitaires peuvent postuler pour des subventions. Pour la plupart des équipes, le point d'entrée est simplement un dépôt et le compteur horaire ou par token.
Les contraintes d'utilisation de Nebius
Le problème le plus fréquemment signalé est la surprise liée à la facturation. Il n'y a pas de bouton unique pour mettre le compte en pause ni d'arrêt automatique en cas d'inactivité, de sorte que les ressources laissées en cours d'exécution accumulent discrètement des frais, et une expérience d'un soir peut se transformer en une facture de plusieurs mois si vous oubliez de supprimer chaque VM, disque et bucket. Le ton même de la plateforme y incite.
"L'interface semble conçue pour déployer d'abord, et optimiser ensuite." Avis Automateed, 2026.
Au-delà de la facturation, Nebius a reconnu que son matériel B300 le plus récent était moins stable jusqu'à la mi-2025 pendant le déploiement d'améliorations d'auto-réparation. Les temps de réponse du support en libre-service de 24 à 48 heures sont à la traîne par rapport aux hyperscalers, la documentation est en retrait par rapport à AWS et GCP pour les fonctionnalités avancées, et il n'y a pas de région Asie-Pacifique à la mi-2026, ce qui constitue un obstacle rédhibitoire pour les charges de travail APAC à faible latence plutôt qu'une simple préférence.
À qui s'adresse Nebius, et à qui il ne convient pas
Nebius est un excellent choix pour les équipes basées dans l'UE qui ont besoin d'une inférence conforme au RGPD avec une véritable localisation des données, pour les laboratoires d'IA exécutant des entraînements multi-nœuds ou du fine-tuning à grande échelle sur des clusters InfiniBand, pour les équipes qui souhaitent un fournisseur unique à la fois pour le calcul d'entraînement et une API d'inférence en production, et pour les entreprises nécessitant les normes SOC 2 Type II, ISO 27001 ou HIPAA. Les startups NVIDIA Inception éligibles aux crédits AI Lift bénéficient d'une rampe de lancement généreuse.
Ce n'est pas le bon choix pour les équipes ayant besoin d'une couverture dans la région APAC, pour les débutants qui pourraient ne pas surveiller et arrêter activement leurs ressources, pour les charges de travail nécessitant des modèles de fondation propriétaires comme GPT ou Claude (Token Factory est uniquement pour les modèles ouverts), ou pour quiconque recherche la vaste communauté, les tutoriels et la documentation mature d'un hyperscaler. Le produit est puissant mais encore en phase de maturation sur certains aspects.
Avis des utilisateurs
Aucun avis pour l'instant. Soyez le premier à partager votre expérience !
Se connecter pour écrire un avis.
Articles associés
Guides et articles en lien avec Nebius.

Mistral Medium 3.5 Self Host: 77.6% SWE-Bench on 4 GPUs (2026)

Grok 4.3 API for Agents (May 2026): Pricing, Benchmarks, Migration

Google Vision AI Explained (2026): Pricing Per 1,000 Units, Free Tier, and Alternatives

Nous Hermes 4: The Self-Hosted Open-Weight Agent Brain (2026)

Local Agentic Coding May 2026: Qwen 3.6 + BeeLlama.cpp + Star Elastic
