

Modal est une plateforme GPU serverless qui permet aux développeurs Python d'exécuter des charges de travail d'IA sur des GPU cloud sans toucher à l'infrastructure. Écrivez une fonction, ajoutez un décorateur, et Modal gère les conteneurs, la mise à l'échelle et la facturation à la seconde près.
Modal est une plateforme d'infrastructure d'IA serverless qui permet aux développeurs d'exécuter du code Python sur des GPU cloud sans gérer de conteneurs, de clusters Kubernetes ou de pilotes CUDA. Fondée en 2021 par Erik Bernhardsson, qui dirigeait auparavant les systèmes de machine learning à grande échelle chez Spotify et occupait le poste de CTO chez Better.com, Modal cible une frustration spécifique : le fossé entre l'écriture de code Python en local et son exécution à grande échelle sur des GPU dans le cloud. La plateforme a atteint le statut de licorne en septembre 2025 après une série B de $87M menée par Lux Capital pour une valorisation de $1.1 billion, avec des clients d'entreprise tels que Meta, Scale AI et Ramp exécutant des charges de travail en production sur la plateforme.
Le mécanisme central de Modal repose sur les décorateurs Python. Annotez une fonction avec @app.function(gpu="H100") et la plateforme construit le conteneur, provisionne le GPU, gère la mise à l'échelle automatique de zéro à des centaines d'instances, et détruit tout en cas d'inactivité. Au-delà de l'inférence, Modal gère les cycles d'entraînement, les pipelines de fine-tuning, les tâches de traitement par lots, l'exécution sécurisée de code en bac à sable (pour les agents IA exécutant du code non approuvé) et les notebooks collaboratifs. La facturation s'effectue à la seconde de calcul réellement utilisée, sans frais d'inactivité. Un niveau Starter gratuit inclut $30/month de crédits de calcul sans carte bancaire requise.
Ce que fait réellement Modal en avril 2026
Modal propose quatre produits principaux. Inference vous permet de déployer des LLM, des modèles de génération d'images et des pipelines audio derrière des points de terminaison web mis à l'échelle automatiquement. Training gère les clusters GPU à nœud unique et à nœuds multiples pour les cycles de fine-tuning. Sandboxes fournit des environnements isolés par gVisor, générables par programmation, pour les agents IA qui doivent exécuter du code non approuvé à grande échelle, avec restriction réseau et listes d'autorisation CIDR intégrées. Batch évolue jusqu'à des milliers de conteneurs pour le traitement de données et les charges de travail d'inférence hors ligne.
Les démarrages à froid (cold starts) des conteneurs varient de 2 à 4 secondes pour la plupart des charges de travail. En juillet 2025, Modal a lancé les snapshots de mémoire GPU en version alpha : la fonctionnalité sauvegarde l'état complet du GPU NVIDIA, y compris la mémoire de l'appareil, les noyaux CUDA et les contextes d'exécution, permettant aux restaurations ultérieures d'ignorer complètement le chargement des poids du modèle. Un déploiement vLLM de Qwen2.5 qui prenait auparavant 45 secondes pour démarrer à froid est tombé à 5 secondes avec les snapshots activés. Le modèle de transcription audio Parakeet est passé de 20 secondes à moins de 2 secondes.
La plateforme fonctionne sur un pool de capacité multi-cloud, principalement Oracle Cloud Infrastructure, avec une planification intelligente à travers les régions. La disponibilité des GPU s'étend du T4 ($0.59/hr) au H100 ($3.95/hr) et H200 ($4.54/hr) jusqu'au B200 ($6.25/hr). Le CPU et la mémoire sont facturés séparément à la seconde, en plus du temps GPU.
"Modal a le démarrage à froid le plus rapide que j'aie vu pour les modèles de plus de 10 Go." - AndresSRG, Hacker News, juin 2025
Où se situe Modal par rapport à Replicate et Lambda Labs
Modal vs. Replicate : Replicate est un registre de modèles avec une interface API REST. Il héberge des milliers de modèles open-source pré-conteneurisés (Stable Diffusion, SDXL, Flux, variantes de LLaMA, Whisper) que tout développeur peut appeler avec quelques lignes de code et sans travail de déploiement. L'outil Cog de Replicate gère la conteneurisation de modèles personnalisés, mais l'expérience principale consiste à pointer vers des modèles hébergés. Modal exige que vous écriviez et déployiez votre propre code Python, ce qui signifie une flexibilité totale (toutes dépendances, logique personnalisée, pipelines à plusieurs étapes) mais vous êtes responsable de la couche de service. Les démarrages à froid de Replicate peuvent dépasser 60 secondes pour les modèles moins populaires ; Modal maintient 2 à 4 secondes de manière constante. La distinction pratique : utilisez Replicate lorsque vous souhaitez appeler un modèle open-source connu immédiatement sans aucune configuration. Utilisez Modal lorsque vous avez besoin de code personnalisé, de dépendances non standard, ou que vous combinez des modèles dans un pipeline.
Modal vs. Lambda Labs : Lambda a abandonné le GPU serverless en septembre 2025 et propose désormais des VM GPU dédiées à la demande avec une facturation à l'heure. Vous vous connectez en SSH, configurez l'environnement et payez pour le temps réservé, que le GPU travaille ou non. L'approche de Lambda offre un contrôle maximal et le tarif par heure de GPU le moins cher possible pour les tâches d'entraînement continues 24h/24 et 7j/7, car il n'y a pas de multiplicateurs de plateforme. La facturation à la seconde de Modal avec mise à l'échelle à zéro est plus économique pour les charges de travail en rafale ou peu fréquentes. La différence fondamentale : Lambda vous donne un nœud bare metal ; Modal vous donne une interface function-as-a-service. Lambda cible les chercheurs exécutant des cycles d'entraînement sur plusieurs jours qui souhaitent minimiser le coût par heure de GPU et ne sont pas dérangés par la gestion d'infrastructure basée sur SSH. Modal cible les développeurs d'applications qui ont besoin d'itérations rapides et d'une mise à l'échelle automatique sans équipe opérationnelle.
"Chaque fois qu'une équipe pose des questions sur le calcul, nous leur disons toujours d'utiliser Modal." - Aakash Sabharwal, VP of Engineering chez Scale AI, septembre 2025
À quoi ressemble réellement l'utilisation quotidienne de Modal
Un flux de travail Modal typique commence par la CLI. Vous installez le package, vous vous authentifiez et écrivez une fonction Python. La syntaxe du décorateur regroupe la construction de l'image (packages pip, dépendances système, secrets) avec la définition de la fonction. L'exécution de modal deploy pousse les spécifications du conteneur et enregistre le point de terminaison. Les déploiements ultérieurs ne reconstruisent que les couches modifiées.
Pour l'inférence, le déploiement est généralement une classe avec une méthode @enter (exécutée une fois au démarrage du conteneur pour charger les poids du modèle) et une fonction d'inférence décorée avec @method. Le conteneur reste actif pendant un délai d'inactivité configurable, puis s'arrête. Les démarrages à froid au réveil sont là où se produit l'impact sur la latence, atténué par le paramètre keep_warm qui maintient un nombre spécifié de répliques actives au prix de frais de calcul continus.
La gestion des secrets, les montages de volumes pour le stockage persistant, la planification cron et le routage des points de terminaison web sont tous gérés via le SDK de Modal plutôt que par des services externes. Les équipes de Ramp ont utilisé Modal pour exécuter des pipelines de fine-tuning de LLM, signalant une réduction de 34 % des interventions manuelles et 79 % d'économies par rapport aux principaux fournisseurs de LLM. Scale AI exécute des Modal Sandboxes pour des expériences d'apprentissage par renforcement, générant des milliers d'environnements isolés simultanés à la demande.
Pour qui Modal est conçu
Modal convient aux ingénieurs ML et aux développeurs backend qui connaissent Python et souhaitent un accès GPU sans Kubernetes. La plateforme récompense les équipes ayant des modèles de charge de travail en rafale et imprévisibles : des API d'inférence qui subissent des pics de trafic, des tâches par lots qui s'exécutent la nuit, des bacs à sable d'agents qui évoluent vers des milliers d'environnements simultanés puis reviennent à zéro. Le modèle de facturation à la seconde profite directement aux charges de travail qui sont actives moins de 24h/24 et 7j/7.
Les startups créant des produits natifs en IA en tirent le meilleur parti : l'inférence, l'entraînement, le fine-tuning et les bacs à sable sur une seule plateforme signifient moins de dépendances d'infrastructure et des itérations plus rapides. Le niveau gratuit de $30/month rend le prototypage accessible. Les équipes d'entreprise sur les forfaits Team ou Enterprise bénéficient de la compatibilité HIPAA, de journaux d'audit, du SSO Okta et d'un proxy IP statique pour le contrôle de sortie.
Ce que Modal n'est pas
Modal n'est pas une place de marché de modèles. Il n'y a pas de bibliothèque de modèles pré-hébergés à appeler. Si vous souhaitez exécuter Flux ou Stable Diffusion sans aucun code de déploiement, Replicate le fait. Modal exige que vous écriviez vous-même le code de service.
Modal n'est pas optimal en termes de coûts pour les charges de travail continues 24h/24 et 7j/7. Des multiplicateurs de production s'appliquent aux tarifs de base des GPU : les multiplicateurs non préemptibles et régionaux se cumulent jusqu'à 3.75x le tarif affiché pour les charges de travail aux États-Unis. Si vous exécutez une tâche d'entraînement continue 24 heures sur 24, louer un nœud GPU dédié Lambda ou CoreWeave à l'heure sera moins cher. Le modèle serverless est efficace pour les modèles d'utilisation en rafale, pas pour une saturation soutenue.
Modal ne prend pas en charge les réseaux privés, les VPC personnalisés ou l'authentification de service à service au niveau du réseau. Les équipes ayant des exigences strictes en matière d'isolation réseau, ou les environnements réglementés nécessitant des flux de données verrouillés par VPC, se heurteront à cette limite.
Enfin, Modal n'est pas une plateforme full-stack. Il gère le calcul mais pas les bases de données, les files d'attente de messages ou l'hébergement frontend. Les équipes créant des produits complets ont besoin de Modal aux côtés d'autres services d'infrastructure. Le SDK crée également une dépendance significative vis-à-vis du fournisseur (vendor lock-in) : les fonctions décorées avec des primitives spécifiques à Modal nécessitent une réécriture pour migrer hors de la plateforme.
Avis des utilisateurs
Aucun avis pour l'instant. Soyez le premier à partager votre expérience !
Se connecter pour écrire un avis.
Articles associés
Guides et articles en lien avec Modal.

Replit Pricing Explained (2026): Core vs Pro and Effort-Based Agent Billing

Grok 4.3 API for Agents (May 2026): Pricing, Benchmarks, Migration

Does API Cost More Than a Subscription for Claude Opus 4.8, GPT-5.5, and Grok?

Google Vision AI Explained (2026): Pricing Per 1,000 Units, Free Tier, and Alternatives

Mistral Medium 3.5 Self Host: 77.6% SWE-Bench on 4 GPUs (2026)
