Aller au contenu principal
Vantaige
Predibase logo

Predibase

Payant

Predibase est une plateforme gérée de fine-tuning et d'inférence pour les LLM open source, basée sur le service multi-adaptateurs LoRAX. Elle permet aux équipes d'exécuter des centaines de variantes de modèles fine-tunés sur un seul GPU, avec un déploiement VPC pour les entreprises qui ne peuvent pas transférer leurs données d'entraînement vers une infrastructure partagée.

Cas d'usage :Data Science
Fonctionnalités :API

Predibase est une plateforme de fine-tuning et de service de grands modèles de langage open source, conçue par l'équipe à l'origine de Horovod et Ludwig au sein du groupe d'infrastructure IA d'Uber. Fondée en 2021 par Travis Addair (CTO), Devvret Rishi (CEO) et Piero Molino (Chief Science Officer), l'entreprise a passé trois ans à développer une infrastructure qui résout un problème de production spécifique : comment déployer de nombreuses variantes de modèles fine-tunés sans payer pour un GPU dédié par modèle ? En juin 2025, Rubrik a fait l'acquisition de Predibase pour un montant estimé entre $100 million et $500 million, l'intégrant ainsi à une plateforme de cybersécurité des données axée sur l'adoption de l'IA agentique en entreprise.

Le cœur technique de la plateforme est LoRAX (LoRA eXchange), un framework open source de service multi-adaptateurs qui exécute simultanément des centaines d'adaptateurs fine-tunés LoRA sur un modèle de base partagé, le tout sur un seul GPU. À cela s'ajoute Turbo LoRA, une technique combinant LoRA et le décodage spéculatif pour multiplier par 2 à 3 le débit lors de l'inférence. Le fine-tuning est géré via le pipeline d'entraînement basé sur Ludwig, avec la prise en charge du fine-tuning supervisé standard et, depuis début 2025, du Reinforcement Fine-Tuning (RFT) utilisant l'optimisation des récompenses GRPO. La plateforme s'intègre à AWS, Azure et GCP pour un déploiement VPC, et un niveau gratuit serverless couvre jusqu'à 10M de tokens par mois pour l'expérimentation.

Ce que fait réellement Predibase en mai 2026

Predibase fonctionne comme un plan de contrôle géré reposant sur deux briques techniques : LoRAX pour le service et Ludwig pour l'entraînement. Le flux de travail d'entraînement est simple. Vous connectez un jeu de données, sélectionnez un modèle de base (Llama 3, Mistral et leurs dérivés sont officiellement pris en charge), configurez les hyperparamètres LoRA et soumettez une tâche. Les tâches s'exécutent sur des GPU gérés par Predibase ou hébergés en VPC. Après l'entraînement, vous créez un point de terminaison de déploiement qui charge votre ou vos adaptateurs sur le modèle de base partagé via LoRAX.

Cette dernière étape est plus importante qu'il n'y paraît. Contrairement à certains concurrents qui déploient automatiquement à la fin de l'entraînement, Predibase nécessite une étape explicite de création de déploiement. Un seul déploiement LoRAX peut héberger des dizaines d'adaptateurs simultanément, chacun routant vers une variante fine-tunée différente. C'est l'architecture que Checkr a utilisée pour remplacer GPT-4 sur plusieurs tâches de classification de vérification des antécédents : un modèle de base Llama 3 8B, plusieurs adaptateurs fine-tunés pour différents types de cas, tous servis depuis un seul point de terminaison GPU avec une inférence 30x plus rapide et un coût 5x inférieur à celui de l'API OpenAI.

Le Reinforcement Fine-Tuning, lancé début 2025 et disponible sur les niveaux Enterprise et VPC, va encore plus loin. Au lieu de nécessiter des milliers d'exemples étiquetés, le RFT fonctionne à partir d'une fonction de récompense : vous définissez à quoi ressemble une sortie correcte (un objet JSON valide, un test réussi, un score de confiance supérieur à un seuil), et le modèle itère en fonction de cette récompense. Le CTO de Predibase, Travis Addair, a décrit la limite pratique lors d'une interview en février 2025 :

« La fonction de récompense est sans aucun doute le plus gros goulot d'étranglement. Vous finissez par y consacrer environ 80 % de votre temps lorsque vous travaillez avec cela. » - Travis Addair, CTO de Predibase, NextWord Substack, février 2025

Le niveau serverless offre aux équipes une voie d'expérimentation sans infrastructure : jusqu'à 1M de tokens par jour, 10M par mois, sur des modèles de base hébergés par Predibase. Les charges de travail en production basculent vers des déploiements privés facturés à la seconde, avec un calcul GPU coûtant environ $2.14 à $4.80 par heure selon le matériel. Les tâches de fine-tuning sont facturées par million de tokens traités, avec des tarifs variant de $0.50 à $20.00 par million selon la taille du modèle et la méthode de fine-tuning.

Où se situe Predibase par rapport à OpenPipe et Together AI

Les plateformes de fine-tuning se divisent sur un axe fondamental : qui fournit les données d'entraînement, et quel niveau d'ingénierie ML est attendu de l'utilisateur. Predibase, OpenPipe et Together AI répondent chacun différemment à cette question.

OpenPipe (acquis par CoreWeave en septembre 2025) cible les développeurs d'applications qui ne veulent pas du tout se soucier des données d'entraînement. Son SDK enveloppe vos appels d'API LLM existants, capture les paires requête/réponse du trafic de production et les convertit automatiquement en un jeu de données de fine-tuning. Vous distillez à partir de l'utilisation en direct de votre application plutôt que de construire un corpus organisé. La sélection de modèles de base est plus restreinte (environ 10 modèles lors de l'acquisition), et les méthodes de fine-tuning sont limitées au SFT standard. Pour les équipes qui exécutent déjà un produit sur GPT-4 ou un autre LLM hébergé, OpenPipe représente une charge de travail moindre. Pour les équipes qui créent de nouvelles applications sans trafic de production pour le moment, il offre moins d'avantages. Le service multi-adaptateurs LoRAX de Predibase n'a pas d'équivalent dans la stack d'OpenPipe.

Together AI adopte une approche axée sur la diversité : plus de 200 modèles open source accessibles via une API compatible OpenAI, avec le fine-tuning comme fonctionnalité plutôt que comme produit principal. Together prend en charge le DPO (Direct Preference Optimization) aux côtés du fine-tuning supervisé, ce que Predibase n'expose pas nativement dans son interface utilisateur. La fenêtre de contexte de Together pour le fine-tuning de Llama 3.1-8B s'étend jusqu'à 131k tokens. La facturation se fait par token plutôt que par seconde de disponibilité du GPU, ce qui rend les coûts plus prévisibles pour les charges de travail variables. Le compromis : Together exécute un modèle par point de terminaison. Il n'y a pas d'équivalent au traitement par lots multi-adaptateurs de LoRAX, ce qui signifie que les équipes servant 20 variantes fine-tunées paient pour 20 déploiements distincts. Pour les flottes multi-modèles, la rentabilité de Predibase peut être nettement supérieure. Pour les équipes ayant besoin d'un seul modèle bien optimisé avec un large choix de base, Together AI est la voie la plus simple. Vous pouvez découvrir Together AI sur together.ai.

D'autres plateformes dans l'espace de l'infrastructure de fine-tuning méritent d'être connues : Modal et RunPod offrent du calcul GPU brut où vous contrôlez l'ensemble de la stack d'entraînement, offrant plus de flexibilité pour un coût d'ingénierie plus élevé. Anyscale adopte une approche native Ray pour le fine-tuning distribué à grande échelle. Replicate et fal.ai servent l'inférence à grande échelle mais offrent des outils de fine-tuning plus légers que Predibase.

À quoi ressemble réellement le flux de travail de fine-tuning

Mettre un modèle fine-tuné en production sur Predibase implique trois phases : la préparation et le téléchargement des données, la configuration de la tâche d'entraînement et la création du déploiement. L'interface web gère les flux de travail de base mais expose des contrôles d'hyperparamètres limités. Les utilisateurs avancés travaillent via le SDK Python ou l'API REST.

Les exigences en matière de données d'entraînement suivent les conventions de schéma de Ludwig : les colonnes sont nommées en fonction du type de tâche (le réglage des instructions nécessite des noms de colonnes différents de ceux de la complétion de texte). La plateforme fournit un volet de prévisualisation du jeu de données lors du téléchargement qui valide le format avant la soumission des tâches, ce qui permet de détecter les erreurs de schéma très tôt. Une session de fine-tuning Qwen2 lors d'un test pratique réalisé par le praticien ML Alex Strick van Linschoten a pris environ 53 minutes sur un GPU A100 en juin 2024. Une fois l'entraînement terminé, Strick a noté un point de friction :

« Je ne m'attendais pas à cette étape supplémentaire, et le démarrage prend un certain temps. » - Alex Strick van Linschoten, blog personnel, juin 2024, en référence à l'étape distincte de création de déploiement après la fin de l'entraînement

Lors de son test, un déploiement de modèle n'a pas réussi à s'initialiser après plusieurs heures, empêchant les tests d'inférence. Il s'agit d'un véritable mode de défaillance, et non d'un cas isolé. Les équipes de production doivent valider l'initialisation du déploiement dans le cadre de leur processus CI/CD avant de router le trafic. L'architecture de déploiement LoRAX introduit une latence lors du démarrage à froid lorsque les adaptateurs sont chargés du stockage vers la mémoire du GPU ; les requêtes ultérieures vers le même adaptateur sont rapides une fois qu'il est mis en cache.

Pour les flux de travail RFT, la complexité supplémentaire réside dans la conception de la fonction de récompense. Vous écrivez une fonction qui prend une complétion de modèle et renvoie une récompense scalaire. Les tâches bien définies (validation de schéma JSON, exécution de code, correspondance d'expressions régulières) s'y prêtent naturellement. Les tâches plus floues (ton, utilité, qualité du résumé) nécessitent la conception de grilles d'évaluation et souvent une logique de notation personnalisée. L'observation de Travis Addair selon laquelle la conception de la fonction de récompense consomme 80 % du temps d'un projet RFT correspond à ce que les équipes rapportent pour des flux de travail GRPO comparables. Predibase enveloppe l'infrastructure pour que vous n'ayez pas à gérer vous-même l'infrastructure d'entraînement RL distribuée, mais le travail de conception des récompenses ne disparaît pas.

À qui s'adresse Predibase

La cible la plus évidente est une équipe d'ingénierie en machine learning au sein d'une entreprise disposant de données propriétaires, de multiples exigences de modèles spécifiques à un domaine et du budget de calcul pour justifier des déploiements GPU dédiés. Le cas de Checkr est représentatif : un système de production gérant des millions de vérifications d'antécédents, où la précision de GPT-4 sur les cas limites était insuffisante et les coûts d'API à grande échelle étaient prohibitifs. Le fine-tuning d'un modèle Llama 3 8B avec des adaptateurs spécifiques aux tâches a produit une meilleure précision pour un cinquième du coût. LoRAX de Predibase a servi tous les adaptateurs de tâches à partir d'un seul déploiement sans payer de coûts GPU par variante.

La plateforme convient également naturellement aux secteurs réglementés. Les entreprises de services financiers comme Nubank utilisent le déploiement VPC pour s'assurer que les données d'entraînement ne quittent jamais leur périmètre cloud. Les équipes de santé effectuant du fine-tuning sur des dossiers de patients, les équipes juridiques sur l'historique des cas, les sous-traitants gouvernementaux travaillant avec des données sensibles : tous bénéficient des garanties de résidence des données du niveau VPC. L'acquisition par Rubrik renforce ce positionnement, en ajoutant la gouvernance des données d'entreprise et l'infrastructure de sécurité au flux de travail de fine-tuning.

Les équipes de développement d'agents IA créant des agents spécialisés sur des LLM open source personnalisés constituent un cas d'usage émergent. Le RFT est particulièrement bien adapté au façonnage des récompenses des agents, où vous pouvez définir si les appels d'outils d'un agent ont atteint le résultat cible comme signal de récompense direct. C'est la direction dans laquelle Rubrik pousse Predibase après l'acquisition, passant d'une « plateforme de fine-tuning » à un positionnement axé sur la « gouvernance de chaque agent ».

Ce que Predibase n'est pas

Predibase n'est pas un outil no-code. L'interface web est plus épurée que la création de votre propre stack de fine-tuning à partir de zéro, mais des tâches telles que la sélection du rang LoRA, la planification du taux d'apprentissage et la fusion d'adaptateurs nécessitent des connaissances en ML pour être configurées de manière pertinente. Les équipes sans ingénieur ML dédié trouveront la prise en main ardue.

Ce n'est pas une API facturée au token avec une inférence gratuite illimitée. Le niveau gratuit serverless couvre l'expérimentation, mais les charges de travail en production nécessitent des déploiements privés facturés à la seconde. Les équipes avec un trafic très variable (des pics séparés par des périodes d'inactivité) accumuleront des coûts pendant les temps morts. Le modèle de facturation favorise les charges de travail stables et cohérentes où les coûts de disponibilité du GPU sont amortis sur des requêtes constantes. La facturation par token de Together AI est plus avantageuse pour les modèles d'utilisation en dents de scie ou saisonniers.

Ce n'est pas une plateforme d'application complète. Predibase gère l'entraînement et le service. Vous devez toujours créer la passerelle API, le routage des requêtes, la surveillance et la logique d'application par-dessus. C'est délibéré : il s'agit d'une infrastructure, pas d'une solution clé en main.

Ignorez Predibase si vos besoins en modèles se situent en dehors des familles Llama et Mistral nativement. Les équipes nécessitant un fine-tuning à grande échelle de Qwen, Gemma, Phi-3.5 ou DeepSeek bénéficient d'un support officiel limité. Ignorez-le si votre équipe en est à ses débuts, sans trafic LLM en production pour le moment, et souhaite le chemin le plus rapide vers un modèle fine-tuné ; l'approche par distillation d'OpenPipe vous y amènera plus vite. Ignorez-le si l'incertitude liée à l'acquisition est un obstacle : la feuille de route produit de Rubrik pour Predibase n'a pas été détaillée publiquement en date d'avril 2026, et les discussions de la communauté des développeurs reflètent des inquiétudes quant à savoir si le produit de fine-tuning en libre-service reste une priorité au sein d'une entreprise de cybersécurité.

Avis des utilisateurs

Aucun avis pour l'instant. Soyez le premier à partager votre expérience !

Se connecter pour écrire un avis.

Articles associés

Guides et articles en lien avec Predibase.