

AudioCraft est le framework d'IA audio open source de Meta, regroupant MusicGen pour la musique instrumentale à partir de texte, AudioGen pour les effets sonores et EnCodec pour la compression audio neuronale. Gratuit à auto-héberger, avec un code sous licence MIT, il est idéal pour les chercheurs et les développeurs qui créent des modèles audio sur mesure.
AudioCraft est une bibliothèque de recherche basée sur PyTorch, publiée par Meta AI le 2 août 2023. Il ne s'agit pas d'un produit hébergé ou d'une application grand public, mais d'un framework auto-hébergé qui regroupe trois modèles audio génératifs distincts : MusicGen, qui génère de la musique instrumentale à partir de prompts textuels ou de références mélodiques ; AudioGen, qui génère des sons d'ambiance et des effets sonores à partir de texte ; et EnCodec, un codec audio neuronal qui sert de base aux deux modèles en tant que compresseur et tokenizer haute fidélité. Le code est sous licence MIT et les poids des modèles pré-entraînés sont publiés sous licence CC-BY-NC 4.0, ce qui signifie qu'ils sont réservés à un usage non commercial, à moins de conclure un accord commercial distinct avec Meta.
MusicGen est disponible en variantes small (~300M de paramètres), medium (~1.5B) et large (~3.3B). Sa fonctionnalité de conditionnement mélodique accepte un fichier audio de référence, extrait une représentation sous forme de chromagramme à l'aide de la séparation de sources HT-Demucs de Meta, et utilise cette empreinte harmonique pour guider l'arrangement, permettant aux producteurs de transformer une mélodie fredonnée ou une ébauche au piano en un morceau instrumental complet. AudioGen gère les fonds sonores ambiants et le sound design de type bruitage à 16kHz. Deux ajouts plus récents viennent enrichir le framework : MAGNeT, un modèle non autorégressif ajouté en mai 2024 offrant une inférence plus rapide, et JASCO, ajouté en janvier 2025, qui introduit des contrôles précis des accords et du rythme via le Flow Matching. Ces quatre modèles s'exécutent localement sur du matériel GPU.
Ce que produit AudioCraft en avril 2026
Les modèles MusicGen de base génèrent jusqu'à 30 secondes d'audio instrumental par passe en mono à 32kHz, ou en stéréo avec les variantes stéréo sorties en janvier 2024. Les modèles medium et large produisent une structure musicale nettement plus cohérente que le modèle small, mais tous deux nécessitent au moins 16GB de VRAM GPU pour une inférence confortable. Le modèle small fonctionne sur des cartes de 8GB avec des compromis sur la qualité. AudioGen génère des effets sonores mono à 16kHz, et ses résultats sont plus fiables pour de courts clips d'ambiance que pour une synchronisation précise de bruitages.
JASCO, le modèle le plus récent, fonctionne en variantes de 400M et 1B de paramètres avec deux modes de conditionnement : texte plus accords et batterie, ou texte plus accords, batterie et mélodie. La variante 1B avec conditionnement complet est le modèle de génération musicale le plus contrôlable du framework. C'est aussi le moins documenté et, comme tous les poids d'AudioCraft, il est strictement non commercial. Les pages de démonstration de metademolab.com fournissent des interfaces Gradio pour tester MusicGen et AudioGen sans installation locale, bien que les démos publiques limitent la génération à 12 secondes.
EnCodec, indépendant des modèles de génération, est un codec neuronal entièrement en temps réel prenant en charge l'audio mono et stéréo à plusieurs débits. Il a été adopté en dehors d'AudioCraft, notamment dans les applications vocales et la recherche sur la parole, et constitue sans doute le composant le plus utile de la bibliothèque pour les ingénieurs de production qui ont besoin d'une compression audio de haute qualité.
Où se situe AudioCraft par rapport à Stable Audio Open et Suno
Les deux comparaisons les plus pertinentes sont Stable Audio Open (poids ouverts, développement actif) et Suno (fermé, commercial, capable de générer des voix).
Stable Audio Open (Stability AI, juillet 2024) utilise une architecture de diffusion latente plutôt qu'un transformateur autorégressif. Son modèle de base est un transformateur de diffusion (DiT) de 1.057B de paramètres conditionné par un encodeur de texte T5 de 109M de paramètres, plus un auto-encodeur de 156M de paramètres qui compresse les formes d'onde stéréo à 44.1kHz dans l'espace latent. La sortie peut atteindre 47 secondes d'audio stéréo à 44.1kHz, contre un plafond mono à 32kHz pour AudioCraft. Stable Audio Open a été entraîné sur 7,300 heures d'audio sous licence Creative Commons, ce qui lui confère une meilleure couverture des sons environnementaux et percussifs. MusicGen d'AudioCraft a été entraîné sur 20,000 heures de musique sous licence et appartenant à Meta, ce qui lui donne un avantage pour la structure musicale mélodique et harmonique. En pratique : Stable Audio Open est plus performant pour le sound design et les courts clips d'ambiance ; MusicGen est plus performant pour les compositions instrumentales plus longues avec une cohérence musicale. Stable Audio Open a également bénéficié d'une maintenance plus active en 2024-2025, incluant une variante mobile de 341M de paramètres publiée en partenariat avec Arm.
Suno (commercial, fermé) adopte une approche complètement différente. Son architecture hybride combine Bark, qui gère la synthèse vocale réaliste et la génération de paroles, avec Chirp, qui gère l'instrumentation. Le résultat est une chanson entièrement produite avec des voix principales, des harmonies et un fond musical, jusqu'à 4 minutes par clip. AudioCraft ne peut générer aucune voix. Meta a délibérément supprimé les voix des données d'entraînement de MusicGen en utilisant la séparation de sources HT-Demucs précisément pour éviter les problèmes de droits d'auteur liés au chant. Suno v5 (2025) affiche un score ELO de 1,293 dans des évaluations indépendantes de la qualité audio, le plaçant devant tous les concurrents testés publiquement. Cependant, en juillet 2024, la RIAA a intenté des poursuites contre Suno et Udio, alléguant l'utilisation de musique protégée par des droits d'auteur sans licence lors de l'entraînement, une ombre juridique qu'AudioCraft ne partage pas étant donné l'utilisation par Meta de données sous licence. Suno facture via des niveaux d'abonnement commençant à environ $8/month ; AudioCraft est gratuit.
"impossible de vendre ce résultat pour un jeu mobile clicker gratuit", commentateur anonyme, Hacker News, août 2023, discutant de l'audio de la démo de lancement d'AudioCraft
Cette réaction, bien que sévère, illustre ce qu'est et n'est pas AudioCraft. Au lancement, les résultats étaient de niveau recherche, et non de niveau production. L'écart entre AudioCraft et les générateurs de musique commerciaux s'est creusé depuis 2023, Suno et Udio ayant itéré de manière agressive tandis que les modèles MusicGen de base de Meta sont restés largement statiques.
La réalité des licences et des droits d'auteur
Le code d'AudioCraft est sous licence MIT, ce qui semble être l'ouverture maximale. Les poids des modèles, cependant, sont sous licence Creative Commons Attribution-NonCommercial 4.0 International (CC-BY-NC 4.0). Cette distinction a une importance significative. Vous pouvez lire, modifier et redistribuer librement le code d'entraînement et d'inférence. Vous ne pouvez pas, en vertu de la licence des poids, utiliser l'audio généré ou les modèles dans un produit commercial, un service ou un flux de travail monétisé sans un accord commercial distinct avec Meta, qui n'est pas proposé publiquement.
Plusieurs développeurs lors de la discussion de lancement d'août 2023 sur Hacker News ont signalé ce cadre : l'un d'eux a noté sans détour que "vous ne pouvez pas bâtir une entreprise dessus" en raison de la restriction non commerciale. L'écart entre "open source" (code) et "poids ouverts" (non commercial) est un schéma qui apparaît également dans les versions Llama de Meta, et cela crée de réelles frictions pour quiconque espère construire un produit commercial à partir des résultats d'AudioCraft.
Du côté des données d'entraînement, Meta a déclaré que MusicGen a été entraîné sur environ 400,000 enregistrements totalisant 20,000 heures, en utilisant de la musique interne appartenant à Meta et du matériel spécifiquement sous licence provenant de Shutterstock et Pond5. Cela positionne AudioCraft de manière plus défendable que Suno ou Udio, qui ont tous deux fait face à des poursuites de la RIAA en juillet 2024. Les affirmations concernant les données d'entraînement d'AudioCraft n'ont pas été contestées juridiquement en date d'avril 2026.
Les poids de JASCO portent la même restriction CC-BY-NC 4.0 que MusicGen et AudioGen. Les poids et le code d'EnCodec sont tous deux sous licence MIT, ce qui en fait le seul composant entièrement ouvert de la bibliothèque.
Là où AudioCraft montre systématiquement ses limites
La limite la plus évidente concerne les voix. MusicGen ne peut produire aucun chant, aucune parole, ni aucune voix humaine intelligible dans ses résultats. Il s'agit d'un choix de conception délibéré, et non d'une lacune temporaire. Le pipeline d'entraînement a fait passer tout l'audio par HT-Demucs pour séparer et supprimer la piste vocale avant la tokenisation. Les chercheurs qui ont besoin d'une synthèse vocale à partir de la famille AudioCraft sont orientés vers EnCodec en tant que couche de codec pour d'autres systèmes de vocodeur, et non vers MusicGen lui-même.
Les exigences matérielles constituent une deuxième barrière. Le modèle medium, qui est la configuration minimale pour un résultat musicalement cohérent, nécessite 16GB de VRAM. Les utilisateurs disposant de cartes de 8GB sont limités au modèle small, qui produit une structure musicale nettement plus simple. Un utilisateur sur le ticket GitHub #435 a signalé en mars 2024 que son ordinateur portable NVIDIA avec 16GB de VRAM n'affichait qu'une utilisation du GPU de 5 à 10 % pendant l'inférence MusicGen, tandis que les cœurs du processeur tournaient à pleine capacité, suggérant que le pipeline d'inférence n'exploite pas systématiquement l'accélération GPU sur toutes les configurations matérielles.
Le fine-tuning sur des jeux de données personnalisés est techniquement pris en charge mais difficile en pratique. Un utilisateur qui a tenté de fine-tuner un modèle personnalisé de 33M de paramètres sur 133 heures de musique avec une GTX 1060 a signalé après 20 heures d'entraînement que les échantillons générés "semblent ne presque rien faire", se comparant défavorablement à d'autres architectures de transformateurs qui montrent des progrès cohérents en 20 minutes sur un matériel équivalent. L'entraînement nécessite des ressources GPU substantielles qui mettent le fine-tuning sérieux hors de portée de la plupart des chercheurs individuels sans accès au calcul cloud.
La vitesse de développement a également visiblement ralenti. La dernière version substantielle était JASCO en janvier 2025. Avant cela, MAGNeT en mai 2024. Les modèles de base MusicGen et AudioGen sont effectivement figés à leur nombre de paramètres de 2023-2024, tandis que des concurrents comme Suno et Stable Audio continuent de publier des mises à jour de versions majeures avec des améliorations de qualité. Avec 362 tickets GitHub ouverts et l'attention de la recherche de Meta se tournant clairement vers d'autres projets, AudioCraft est dans un état de maintenance plutôt que de développement actif.
"le modèle progresse à une lenteur absurde, je l'entraîne depuis 20 heures, et les échantillons générés donnent l'impression qu'il ne fait presque rien". CDandRW, ticket GitHub #388, 15 janvier 2024
À qui s'adresse AudioCraft
AudioCraft est le bon outil pour les chercheurs en machine learning et les ingénieurs du son qui souhaitent étudier ou s'appuyer sur l'architecture audio générative de Meta. Si vous rédigez un article sur la génération de musique conditionnée par le texte, si vous avez besoin d'un modèle de référence pour comparaison, ou si vous souhaitez entraîner un modèle personnalisé sur un jeu de données de niche (instruments folkloriques, sound design industriel, packs audio de jeux), le code d'entraînement d'AudioCraft et la base EnCodec sont bien documentés et véritablement utiles. C'est également le bon outil pour les développeurs qui ont besoin d'une inférence audio générative non commerciale sur site sans plafond d'utilisation, sans coûts d'API et avec un contrôle total sur le modèle.
AudioCraft est le mauvais choix si vous souhaitez générer des chansons complètes avec des paroles et des voix, ce qui nécessite Suno ou Udio. C'est également le mauvais choix si vous avez besoin d'une génération audio open source rapide et bien maintenue pour du sound design non musical, où Stable Audio Open offre un développement plus actif et une meilleure qualité stéréo à 44.1kHz. Ignorez AudioCraft si vous avez besoin d'une licence commerciale, car la restriction de poids CC-BY-NC bloque tout déploiement monétisé. Et ignorez-le si vous ne disposez pas d'un GPU avec au moins 8GB de VRAM ou si vous n'êtes pas à l'aise pour installer des dépendances Python et gérer manuellement un environnement PyTorch.
Pour les développeurs de jeux indépendants, les étudiants en cinéma et les chercheurs universitaires en audio qui sont à l'aise avec l'exécution de code Python local et qui disposent d'un GPU NVIDIA de milieu de gamme, AudioCraft reste une option performante et gratuite pour générer de la musique instrumentale et des effets sonores non commerciaux. Sa position en tant que framework d'IA audio open source fondamental qui a précédé tout le reste lui confère une valeur de citation continue dans la littérature de recherche, même si des outils plus récents le surpassent sur la qualité brute des résultats.
Avis des utilisateurs
Aucun avis pour l'instant. Soyez le premier à partager votre expérience !
Se connecter pour écrire un avis.
Présent dans les collections
Listes sélectionnées incluant AudioCraft.
Articles associés
Guides et articles en lien avec AudioCraft.

Run Open Source AI Models Locally: Battle-Tested Guide

OpenAI GPT-Realtime-2 (May 2026): Pricing, Latency & 30-Min Voice Agent

Vantaige Launches the LLM VRAM Calculator: A Free GPU Compatibility Finder for Open-source and Open-Weight AI

Run a Company With AI Agents: The Open-Source Orchestration Setup (2026)

Nous Hermes 4: The Self-Hosted Open-Weight Agent Brain (2026)
