

Stable Audio génère de la musique instrumentale et des effets sonores libres de droits à partir de prompts textuels, avec une qualité stéréo de 44,1 kHz. Conçu par Stability AI à partir d'un ensemble de données sous licence, il excelle dans les pistes d'ambiance, les fonds sonores et le sound design, mais ne génère pas de chansons avec voix.
Stable Audio est la plateforme de génération audio et musicale de Stability AI, conçue spécifiquement à partir d'un ensemble de données sous licence plutôt que d'enregistrements protégés par des droits d'auteur récupérés sur le web. L'outil accepte des prompts textuels et, dans ses versions payantes, des fichiers audio téléchargés, pour produire des pistes stéréo d'une qualité de 44,1 kHz. Ce n'est pas un générateur de chansons au sens où l'entend Suno : il n'y a ni voix, ni paroles, ni structures couplet-refrain. Ce qu'il produit en revanche — de la musique instrumentale, des paysages sonores ambiants et des effets sonores discrets — il le fait rapidement, légalement et à un niveau de qualité parfaitement adapté aux projets commerciaux de vidéos et de jeux vidéo.
Le produit existe sous deux formes parallèles. L'application web grand public sur stableaudio.com offre une interface de génération simple avec quatre niveaux d'abonnement (de Free à Max) et une limite de trois minutes par génération. La version entreprise, Stable Audio 2.5 sortie en septembre 2025, ajoute l'inpainting audio, la génération structurelle en plusieurs parties et des vitesses de génération inférieures à deux secondes sur les GPU H100 — accessible via l'API de Stability AI, Replicate, ComfyUI et Fal. Une variante open-source distincte, Stable Audio Open 1.0, propose des poids de modèle téléchargeables gratuitement, entraînés sur des enregistrements sous licence CC provenant de Freesound et de la Free Music Archive, bien que ses sorties soient limitées à 47 secondes et s'orientent davantage vers les effets sonores que vers la musique.
Ce que Stable Audio produit en avril 2026
L'application web commerciale génère jusqu'à trois minutes d'audio stéréo à 44,1 kHz par génération. Les utilisateurs saisissent des prompts textuels décrivant le genre, l'ambiance, le tempo, l'instrumentation et la structure de section souhaitée (intro, montée, drop, outro). Les générations s'achèvent en moins de 60 secondes pour la plupart des prompts. Le mode audio-to-audio, disponible dans tous les forfaits payants, permet aux utilisateurs de télécharger un fichier de référence pour guider le rythme et le caractère sonore du résultat, avec une détection automatique des droits d'auteur qui analyse les téléchargements et signale les contenus appartenant à des tiers.
Stable Audio 2.5 ajoute l'inpainting audio : téléchargez un extrait, sélectionnez une zone ou un point de départ, et le modèle génère une suite musicalement cohérente. C'est particulièrement utile pour le travail sur l'identité sonore des marques et la post-production, où l'objectif est de prolonger ou d'adapter un morceau existant plutôt que de créer à partir de zéro. La méthode d'entraînement ARC (Adversarial Relativistic-Contrastive) qui sous-tend la version 2.5 permet d'atteindre les vitesses de génération annoncées et produit un développement musical plus complexe à travers les sections d'intro, de transition et d'outro par rapport à la version 2.0.
Le modèle Stable Audio Open 1.0 sur Hugging Face utilise une architecture de diffusion DiT basée sur des transformers avec un conditionnement textuel basé sur T5 et un auto-encodeur compressif. Il a été entraîné sur 486 492 enregistrements audio : 472 618 provenant de Freesound et 13 874 de la Free Music Archive, tous sous licence CC0, CC BY ou CC Sampling+. Un modèle compagnon plus petit, Stable Audio Open Small (mai 2025), cible l'inférence sur appareil et le déploiement mobile. Les deux variantes ouvertes sont limitées à des sorties de 47 secondes et sont plus performantes sur les effets sonores et les enregistrements de terrain que sur la musique structurée.
Où se situe Stable Audio par rapport à Suno et Udio
La comparaison entre ces trois outils est souvent présentée comme une course de chevaux, mais il est plus juste de les considérer comme des outils différents pour des résultats différents. Suno v5.5 est avant tout un générateur de chansons vocales. Son architecture axée sur les LLM intègre les paroles et la synthèse vocale en une seule passe, produisant des chansons structurées complètes avec un phrasé naturel, du vibrato et une dynamique émotionnelle. Il génère des pistes natives de quatre minutes en environ 30 secondes et peut les prolonger jusqu'à 10 minutes via sa fonction Extend. Il ne propose pas de conditionnement d'entrée audio-to-audio. La situation de ses données d'entraînement fait l'objet de litiges actifs en matière de droits d'auteur.
« Pour la génération instantanée de chansons, Suno semble toujours en tête. » -- Critique d'Audiocipher, avril 2024, mise à jour en avril 2025
Udio 1.5 (avant octobre 2025) était le concurrent axé sur la qualité pour la musique avec paroles, utilisant un modèle basé sur la diffusion avec des paroles guidées par LLM et des extraits natifs de 32 secondes qui s'assemblent pour atteindre 15 minutes. Sa fidélité audio sur les pistes vocales longues était largement considérée comme légèrement supérieure à celle de Suno en termes de qualité brute, bien qu'il soit plus lent avec environ 90 secondes par génération. En octobre 2025, Udio a réglé son procès avec les grandes maisons de disques en désactivant les téléchargements pour les utilisateurs et en passant à un modèle restreint « Licensed-Only ». La réaction de la communauté a été vive — les créateurs qui avaient passé des mois à peaufiner des sons ont découvert qu'ils ne pouvaient plus exporter leurs propres générations.
« De nombreux utilisateurs de Reddit ont souligné comment Udio est devenu un système verrouillé puisque les créateurs ne peuvent plus télécharger leurs chansons, une fonctionnalité qui a été supprimée silencieusement. » -- AI Tool Discovery, Suno AI Reddit Review 2026
Stable Audio occupe un créneau distinct. C'est l'outil dédié à l'instrumental et au sound design. Là où Suno et Udio rivalisent pour savoir qui générera la meilleure chanson pop, Stable Audio génère le fond d'ambiance sous cette chanson, le clic d'interface dans le jeu vidéo et le bourdonnement atmosphérique derrière la scène de film. Sa limite de trois minutes est une contrainte pour les producteurs de musique, mais elle est largement hors de propos pour les cas d'usage en sound design où les boucles de 30 à 60 secondes sont la norme. Sa fonctionnalité d'exportation de stems, soulignée par de multiples communautés de producteurs comme un différenciateur adapté aux DAW, est absente des sorties grand public de Suno et d'Udio.
La réalité des licences et des droits d'auteur
L'argument le plus solide de Stable Audio est la provenance de ses données d'entraînement. Le modèle commercial a été entraîné exclusivement sur de la musique sous licence provenant de la bibliothèque AudioSparx dans le cadre d'un accord de partage des revenus : si le modèle fonctionne bien sur le plan commercial, AudioSparx — et à travers elle, les artistes contributeurs — partage ce succès. C'est la décision de conception fondamentale prise par Ed Newton-Rex, alors vice-président de l'audio chez Stability AI, lors de la création du produit.
En novembre 2023, Newton-Rex a démissionné publiquement de Stability AI, invoquant un désaccord avec la position de la société mère selon laquelle l'entraînement de modèles d'IA sur des œuvres protégées par le droit d'auteur constitue un « fair use » (usage loyal). Cette démission a été très médiatisée et a souligné une ironie particulière : il avait conçu Stable Audio pour éviter précisément le problème qu'il dénonçait. L'entreprise Stability AI dans son ensemble, à travers ses modèles d'images, défendait la position du fair use ; l'entraînement audio de Stable Audio, quant à lui, était irréprochable. Newton-Rex a depuis fondé Fairly Trained, un organisme de certification, et est apparu sur la liste des 100 personnes les plus influentes dans l'IA en 2025 du magazine TIME.
Pour les utilisateurs commerciaux, la conséquence est pratique. Les pistes générées avec les forfaits payants de Stable Audio sont assorties d'une licence Creator qui accorde des droits commerciaux pour un usage individuel, couvrant les réseaux sociaux, les sorties commerciales, les placements au cinéma et à la télévision en dessous de certains seuils de revenus, ainsi que les applications et les jeux jusqu'à 100 000 utilisateurs actifs mensuels. Les organisations dépassant ces seuils, ou celles ayant besoin d'un auto-hébergement, passent au forfait Enterprise. Les sorties générées peuvent être utilisées pour l'amélioration future des modèles par Stability AI, mais les fichiers téléchargés par les utilisateurs ne sont pas intégrés dans les ensembles de données d'entraînement.
Stable Audio Open est publié sous la Stability AI Community License, qui autorise la recherche et l'utilisation non commerciale ; l'utilisation commerciale nécessite un accord distinct via stability.ai/license.
Là où Stable Audio montre ses limites
La génération vocale est structurellement absente. Le modèle ne peut produire de chant humain cohérent, de diction de paroles ou de discours intelligible dans aucun de ses forfaits. Ce n'est pas un bug ; c'est une décision délibérée quant à la portée du produit. Mais cela signifie que quiconque arrive en espérant générer une chanson complète avec un chanteur se heurtera immédiatement à un mur.
Le mode audio-to-audio ne tient pas toutes ses promesses. La fonctionnalité applique le timbre et le caractère sonore de surface du fichier de référence à la sortie générée ; elle ne réarrange pas, ne reconstruit pas et n'utilise pas intelligemment l'entrée comme modèle musical. Des tests effectués par les critiques d'Audiocipher ont révélé que demander une instrumentation spécifique (batterie, basse) en mode audio-to-audio produit souvent des résultats où ces instruments sont totalement absents — le modèle applique une couleur sonore plutôt que de construire l'arrangement demandé. Un test convertissant un enregistrement d'accordéon en jazz manouche a produit un xylophone au lieu de la basse et de la batterie demandées.
« Le transfert de style n'a pas très bien fonctionné.. le résultat manque d'une instrumentation complète malgré le prompt demandant de la batterie et de la basse. » -- Audiocipher, testant le mode audio-to-audio de Stable Audio 2.0, avril 2024
La limite stricte de 3 minutes par génération est un point de friction persistant pour les producteurs de musique qui souhaitent des morceaux complets. L'assemblage via l'inpainting (disponible dans la version 2.5) nécessite un travail supplémentaire. Les limites de téléchargement du forfait Pro — 30 minutes par mois — sont faciles à épuiser lors de sessions actives de sound design, et les générations non utilisées ne sont pas reportées. La limite de 47 secondes de la variante open-source aggrave ce problème pour les développeurs qui pensaient que le modèle ouvert égalerait les capacités de l'application commerciale.
L'ingénierie des prompts pour le contrôle de la structure nécessite de véritables itérations. Les utilisateurs doivent encoder la structure des sections (« montée de deux minutes, drop à 1:40, fondu de fin ») directement dans le texte, et les prompts complexes produisent parfois des artefacts sonores hallucinés ou des transitions abruptes qui nécessitent une nouvelle génération. Le modèle ne prend pas en charge la saisie en langage naturel avec la flexibilité qu'offrent les outils basés sur des LLM comme Suno.
À qui s'adresse Stable Audio
Les producteurs de vidéos et les créateurs de contenu qui ont besoin de musiques de fond instrumentales libres de droits sont la cible la plus évidente. La combinaison de données d'entraînement entièrement sous licence, d'une qualité de sortie de 44,1 kHz et d'un temps de génération inférieur à 60 secondes le rend pratique pour la production vidéo à haut volume où chaque piste doit passer avec succès un contrôle Content ID.
Les développeurs de jeux vidéo créant des paysages sonores ambiants, de l'audio pour les interfaces utilisateur et du sound design environnemental y trouvent une réelle valeur, en particulier avec le forfait Pro où le mode audio-to-audio permet d'itérer à partir de documents de référence. Le forfait Enterprise débloque le fine-tuning sur des bibliothèques de sons propriétaires, ce qui est très utile pour les studios qui construisent des identités sonores cohérentes à travers plusieurs titres de jeux.
Les sound designers et les ingénieurs du son qui souhaitent une inférence locale et ouverte sur des ressources de format court devraient explorer Stable Audio Open 1.0 ou Open Small via Hugging Face et ComfyUI. La limite de 47 secondes n'est pas une contrainte pour des bruits de pas, des clics d'interface, des bruitages ou de courtes boucles atmosphériques.
Les marques et les agences ayant besoin de travailler sur leur identité sonore — logos sonores, branding audio cohérent sur tous les points de contact — constituent le public cible de l'API d'entreprise 2.5. Le partenariat de branding sonore avec WPP Amp annoncé lors du lancement de la version 2.5 indique qu'il s'agit du principal axe de croissance du produit.
Passez votre chemin si vous avez besoin de voix de quelque nature que ce soit, si vous souhaitez générer des chansons complètes avec une structure couplet-refrain, si votre flux de travail dépend de pistes de plus de trois minutes sans assemblage manuel, ou si vous avez besoin d'un transfert de style structurel profond à partir d'une référence audio plutôt que d'une transposition de timbre en surface.
Avis des utilisateurs
Aucun avis pour l'instant. Soyez le premier à partager votre expérience !
Se connecter pour écrire un avis.
Présent dans les collections
Listes sélectionnées incluant Stable Audio.
Articles associés
Guides et articles en lien avec Stable Audio.

OpenAI GPT-Realtime-2 (May 2026): Pricing, Latency & 30-Min Voice Agent

AI Video Generator Prompting: The Filmmaker's Real Workflow

Grok 4.3 API for Agents (May 2026): Pricing, Benchmarks, Migration

Sell AI-Generated Short Films on TikTok Shop, Instagram & YouTube (2026)

Replit Pricing Explained (2026): Core vs Pro and Effort-Based Agent Billing
