

Together AI est le cloud de référence pour l'inférence de modèles open source, proposant plus de 200 modèles dont Llama 4 Maverick, DeepSeek-R1 et Qwen avec des API compatibles OpenAI, une tarification par token, le fine-tuning LoRA et complet, la location de clusters GPU, ainsi qu'un Code Sandbox intégré pour les workflows d'agents IA.
Together AI est une plateforme cloud conçue spécifiquement pour l'hébergement de modèles open source. Fondée en 2022 et basée à San Francisco, Together Computer, Inc. exploite ce qu'elle appelle un « AI Native Cloud » : un environnement full-stack pour exécuter des inférences, affiner (fine-tuner) des modèles personnalisés, louer du matériel GPU dédié et créer des applications d'IA basées sur des agents. Avec sa levée de fonds en série B de $305 million en février 2025 pour une valorisation de $3.3 billion (menée par General Catalyst, avec NVIDIA et Kleiner Perkins parmi les investisseurs), Together AI s'est imposée comme la principale couche cloud neutre pour l'écosystème de l'IA open source, servant plus de 450,000 développeurs début 2025.
La plateforme offre aux développeurs un accès API à plus de 200 modèles open source soigneusement sélectionnés, notamment Llama 4 Maverick et Scout, DeepSeek-R1 et DeepSeek-V3.1, Qwen3.5, les variantes de Mistral, les modèles d'images FLUX et Whisper pour l'audio. L'API est entièrement compatible avec OpenAI, ce qui signifie que vous pouvez remplacer les appels au SDK OpenAI par une simple modification du point de terminaison (endpoint). Au-delà de l'inférence, Together AI propose le fine-tuning LoRA et à paramètres complets, des instances GPU dédiées (H100, H200, B200), la location de clusters GPU à la demande, ainsi qu'un environnement Code Sandbox intégré pour l'exécution sécurisée de code dans les workflows d'agents, acquis auprès de CodeSandbox en décembre 2024.
Ce que fait réellement Together AI en avril 2026
À la base, Together AI est une passerelle API et une couche de calcul pour les modèles open source. Vous appelez un endpoint, spécifiez un modèle et recevez des tokens à des vitesses atteignant 354 tokens par seconde sur des modèles optimisés comme Kimi K2.5 et 95 tokens par seconde sur Llama 3.3 70B dans des conditions serverless standard. Le mode Batch Inference réduit les coûts de 50% pour les charges de travail asynchrones, prenant en charge jusqu'à 30 milliards de tokens en file d'attente par exécution de modèle.
Le pipeline de fine-tuning accepte les jeux de données JSONL et prend en charge à la fois LoRA (efficace en paramètres, $0.48 par million de tokens pour les modèles jusqu'à 16B) et le fine-tuning complet ($1.20 par million de tokens), avec des poids entraînés exportables directement vers Hugging Face. Les endpoints d'inférence dédiés vous permettent d'allouer un GPU unique (H100 à $3.99/hour, H200 à $5.49/hour, B200 à $9.95/hour) à votre modèle personnalisé ou hébergé pour un débit garanti.
L'acquisition de CodeSandbox en décembre 2024 a ajouté une nouvelle capacité significative. Together Code Sandbox provisionne des machines virtuelles isolées en moins de 3 secondes, capables de sortir d'hibernation en 511 millisecondes (P95), avec des environnements sandbox pouvant évoluer jusqu'à 64 vCPUs et 128 GB de RAM. Cela permet aux agents de codage IA d'exécuter le code généré en toute sécurité sans toucher aux systèmes de production. HeroUI, par exemple, a utilisé Together Code Sandbox pour réduire le temps de développement de HeroUI Chat de 5 mois à 2 semaines, le démarrage des VM passant de 2 minutes à moins de 2 secondes.
La plateforme propose également un stockage géré (aucun frais de sortie à $0.16/GiB/month) et l'accès à la location de clusters GPU : NVIDIA HGX H100 à $3.49/hour, HGX H200 à $4.19/hour et HGX B200 à $7.49/hour à la demande, avec une tarification réservée pour des engagements de 6 mois disponible via le service commercial.
Côté recherche, Together publie des travaux sur les systèmes reconnus lors de l'ICLR, l'ICML, NeurIPS et MLSys. Leurs travaux sur FlashAttention-4 atteignent des performances jusqu'à 1.3x plus rapides que cuDNN sur NVIDIA Blackwell, et leurs accélérateurs d'apprentissage à l'exécution ATLAS offrent une inférence LLM jusqu'à 4x plus rapide selon des benchmarks internes.
« Nous nous appuyons sur l'API Batch Inference pour traiter de très grandes quantités de requêtes. Les limites de débit élevées, jusqu'à 30B de tokens en file d'attente, nous permettent de mener des expériences massives sans goulots d'étranglement, et les tâches se terminent systématiquement bien en deçà du SLA de 24 heures, souvent en quelques heures seulement. » - utilisateur d'entreprise, blog Together AI, 2025
Où se situe Together AI par rapport à Replicate et Fireworks AI
Trois plateformes dominent les discussions des développeurs concernant l'hébergement de modèles open source : Together AI, Replicate et Fireworks AI. Elles diffèrent sensiblement dans leur philosophie de sélection de modèles, la conception de leur API, la vitesse d'inférence et ce que signifie « au-delà de l'inférence ».
Replicate exploite une marketplace de modèles communautaires avec plus de 50,000 modèles packagés avec Cog, contre 200 modèles sélectionnés pour Together. Si vous avez besoin d'un modèle de recherche de niche, d'une variante fine-tunée de Stable Diffusion ou d'un pipeline publié par la communauté, Replicate a beaucoup plus de chances de l'avoir. Replicate héberge également des modèles propriétaires (GPT-4, Claude, Gemini) aux côtés d'options open source, ce que Together AI ne fait pas. Cependant, Replicate utilise un format d'API REST propriétaire qui n'est pas compatible avec OpenAI, ce qui signifie que la migration depuis une intégration OpenAI nécessite plus de modifications de code. Replicate facture par seconde de calcul GPU (T4 à $0.000225/sec, A100 à $0.001400/sec), ce qui est moins prévisible pour les charges de travail textuelles que la tarification par token de Together. Sous une charge simultanée à haut débit, Replicate évolue également moins efficacement : une comparaison de développeurs a révélé qu'elle « ralentissait considérablement à mesure que les requêtes simultanées augmentaient », tandis que Together AI « passait mieux à l'échelle pour les tâches à haut débit ». Replicate manque d'un pipeline de fine-tuning de niveau production équivalent au workflow LoRA ou de fine-tuning complet de Together.
Fireworks AI est le concurrent direct le plus proche de Together. Fireworks utilise des noyaux CUDA FireAttention personnalisés qui poussent la vitesse d'inférence au-delà de l'optimisation GPU générale de Together : dans les benchmarks du premier trimestre 2026 de TokenMix, Fireworks a atteint un TTFT P50 de 150ms contre 220ms pour Together sur Llama 3.3 70B, et un débit d'environ 145 tokens/second contre 95 tokens/second pour Together sur le même modèle. Pour les API de production sensibles à la latence, Fireworks possède un avantage de vitesse mesurable. Cependant, Together AI propose un catalogue plus large (plus de 200 modèles contre plus de 100 pour Fireworks) et offre un fine-tuning complet aux côtés de LoRA, tandis que Fireworks se spécialise dans LoRA avec le service multi-LoRA (plusieurs adaptateurs fine-tunés sur le même modèle de base simultanément). Le produit de location de clusters GPU de Together (clusters NVLink en libre-service, des milliers de GPU) n'a pas d'équivalent direct chez Fireworks. La tarification par token pour Llama 70B est presque identique : Together à $0.88/1M tokens contre Fireworks à $0.90/1M tokens.
« Together Enterprise Platform a permis de diviser par 2 la latence du délai d'obtention du premier token (TTFT) et a réduit nos coûts d'environ un tiers. » - utilisateur d'entreprise, étude de cas Together AI, 2025
À quoi ressemble la réalité du workflow
Pour la plupart des ingénieurs, l'expérience quotidienne commence par une modification d'API d'une seule ligne. Pointez l'URL de base de votre SDK OpenAI vers l'endpoint de Together AI, configurez votre clé API et appelez Llama 4 Maverick à $0.27 par million de tokens d'entrée au lieu de GPT-4o à $2.50. La latence est exploitable en production : TTFT P50 autour de 220ms, P95 autour de 450ms pour une réponse de 500 tokens.
Le fine-tuning nécessite une configuration plus réfléchie. Vous préparez un jeu de données JSONL, sélectionnez un modèle de base, choisissez entre LoRA (plus rapide, moins cher, idéal pour la plupart des adaptations spécifiques à une tâche) et le fine-tuning complet (plus lent, plus coûteux, meilleur pour le changement de domaine), puis soumettez une tâche d'entraînement via l'API ou l'interface web. La documentation pour les bases est solide ; la documentation pour le réglage avancé des hyperparamètres est suffisamment rare pour que les développeurs se tournent régulièrement vers les forums pour obtenir des conseils. L'exportation des poids vers Hugging Face est simple une fois l'entraînement terminé.
Le workflow Code Sandbox est plus récent et orienté vers les applications d'agents : votre LLM génère du code, le SDK Code Sandbox provisionne une VM isolée en moins de 3 secondes, exécute le code, renvoie la sortie standard (stdout) et les fichiers de sortie, puis détruit ou crée un snapshot de la VM. À $0.03 par session et $0.0446/hour par vCPU, le modèle économique est raisonnable pour les outils de codage IA.
Là où le workflow se complique, c'est au niveau de la surveillance. Together AI ne propose pas de tableau de bord LLMOps natif. Il n'y a pas de journalisation intégrée des prompts, d'attribution des coûts par utilisateur ou d'alerte d'anomalie. Les équipes créant des applications de production intègrent couramment LangSmith, Helicone ou Langfuse pour combler cette lacune. Le niveau gratuit atteint également des limites de débit (60 requêtes/minute) qui peuvent surprendre les développeurs testant une fonctionnalité et la trouvant soudainement bridée avant d'être passés à un forfait payant.
À qui s'adresse Together AI
Together AI s'adresse à un profil spécifique : les ingénieurs et les équipes ML qui ont déjà décidé de s'appuyer sur des modèles open source et qui souhaitent une infrastructure gérée plutôt que des serveurs GPU auto-hébergés. Cela couvre un large éventail : une startup remplaçant OpenAI par Llama 4 pour réduire les coûts d'API de 80%, une équipe ML fine-tunant un modèle spécifique à la santé sur des données cliniques propriétaires, une entreprise traitant 50 milliards de tokens par mois via l'inférence par lots pour le traitement de documents, ou une startup d'assistant de codage IA qui a besoin d'une sandbox d'exécution de code qu'elle n'a pas eu à construire en interne.
La plateforme convient également très bien aux équipes de data science. Les embeddings pour les pipelines RAG, les modèles de vision pour la compréhension d'images et le modèle multimodal Llama 4 Maverick pour les produits mélangeant des entrées texte et image sont tous disponibles sous la même clé API et le même compte de facturation. La couche de stockage sans frais de sortie rend pratique le stockage de jeux de données d'entraînement et de poids de modèles sur l'infrastructure de Together sans accumuler de coûts de transfert de données.
Ce que Together AI n'est pas
Together AI n'est pas un produit no-code. Il n'y a pas de constructeur de workflow visuel, pas de sélecteur de modèle par glisser-déposer et pas d'intégration guidée pour les utilisateurs non techniques. Si vous ne savez pas écrire en Python ou appeler une API REST, la plateforme ne vous apportera aucune valeur.
Ce n'est pas non plus un outil d'observabilité. Si vous avez besoin de LLMOps de production (tableaux de bord de coûts, journalisation par requête, histogrammes de latence, gestion des versions de prompts), vous avez besoin d'une intégration tierce. La surveillance native de Together est suffisamment basique pour que plusieurs sites d'évaluation la signalent comme une lacune importante.
Together AI n'héberge pas de modèles propriétaires à source fermée. Si votre équipe évalue GPT-4, Claude et Gemini aux côtés d'options open source et souhaite une passerelle API unique pour tous, vous avez besoin d'une couche de routage séparée ou d'un fournisseur différent. Le pari de Together repose entièrement sur l'écosystème open source.
Enfin, Together AI n'est pas le choix d'inférence optimisé pour la vitesse pour les applications où chaque 50 millisecondes compte. Si un TTFT P50 de 150ms contre 220ms est le facteur décisif, les noyaux d'inférence personnalisés de Fireworks AI l'emportent sur les benchmarks actuels. Together est le meilleur choix lorsque l'étendue des modèles, la profondeur du fine-tuning et la portée de l'infrastructure (clusters GPU, Code Sandbox, stockage) importent plus que la vitesse brute.
Avis des utilisateurs
Aucun avis pour l'instant. Soyez le premier à partager votre expérience !
Se connecter pour écrire un avis.
Articles associés
Guides et articles en lien avec Together AI.

Grok 4.3 API for Agents (May 2026): Pricing, Benchmarks, Migration

Does API Cost More Than a Subscription for Claude Opus 4.8, GPT-5.5, and Grok?

Replit Pricing Explained (2026): Core vs Pro and Effort-Based Agent Billing

Mistral Medium 3.5 Self Host: 77.6% SWE-Bench on 4 GPUs (2026)

Google Vision AI Explained (2026): Pricing Per 1,000 Units, Free Tier, and Alternatives
