

AudioCraft es el framework de IA de audio de código abierto de Meta, que incluye MusicGen para música instrumental a partir de texto, AudioGen para efectos de sonido y EnCodec para compresión de audio neuronal. Gratuito para alojamiento propio, con código bajo licencia MIT, ideal para investigadores y desarrolladores que crean modelos de audio personalizados.
AudioCraft es una biblioteca de investigación basada en PyTorch lanzada por Meta AI el 2 de agosto de 2023. No es un producto alojado ni una aplicación para el consumidor, sino un framework de alojamiento propio que agrupa tres modelos de audio generativo distintos: MusicGen, que genera música instrumental a partir de indicaciones de texto o referencias melódicas; AudioGen, que genera sonidos ambientales y efectos de sonido a partir de texto; y EnCodec, un códec de audio neuronal que sustenta ambos modelos como un compresor y tokenizador de alta fidelidad. El código tiene licencia MIT y los pesos de los modelos preentrenados se publican bajo CC-BY-NC 4.0, lo que significa que solo se permite el uso no comercial a menos que se llegue a un acuerdo comercial independiente con Meta.
MusicGen se presenta en variantes pequeña (~300M de parámetros), mediana (~1.5B) y grande (~3.3B). Su función de condicionamiento melódico acepta un archivo de audio de referencia, extrae una representación de cromagrama utilizando la separación de fuentes HT-Demucs de Meta y utiliza esa huella armónica para guiar el arreglo, permitiendo a los productores transformar una melodía tarareada o un boceto de piano en una pista instrumental completa. AudioGen maneja fondos ambientales y diseño de sonido estilo foley a 16kHz. Dos incorporaciones más recientes amplían el framework: MAGNeT, un modelo no autorregresivo añadido en mayo de 2024 que ofrece una inferencia más rápida, y JASCO, añadido en enero de 2025, que introduce controles detallados de acordes y ritmos a través de Flow Matching. Los cuatro modelos se ejecutan localmente en hardware de GPU.
Lo que produce AudioCraft en abril de 2026
Los modelos principales de MusicGen generan hasta 30 segundos de audio instrumental por pasada a 32kHz en mono, o en estéreo con las variantes estéreo lanzadas en enero de 2024. Los modelos mediano y grande producen una estructura musical notablemente más coherente que el modelo pequeño, pero ambos requieren al menos 16GB de VRAM de GPU para una inferencia fluida. El modelo pequeño funciona en tarjetas de 8GB con concesiones en la calidad. AudioGen genera efectos de sonido mono a 16kHz, y sus resultados son más fiables para clips ambientales cortos que para una sincronización foley precisa.
JASCO, el modelo más reciente, opera en variantes de 400M y 1B de parámetros con dos modos de condicionamiento: texto más acordes y batería, o texto más acordes, batería y melodía. La variante de 1B con condicionamiento completo es el modelo de generación de música más controlable del framework. También es el menos documentado y, al igual que todos los pesos de AudioCraft, es solo para uso no comercial. Las páginas de demostración de metademolab.com proporcionan interfaces de Gradio para probar MusicGen y AudioGen sin instalación local, aunque las demostraciones públicas limitan la generación a 12 segundos.
EnCodec, independiente de los modelos de generación, es un códec neuronal totalmente en tiempo real que admite audio mono y estéreo a múltiples tasas de bits. Ha sido adoptado fuera de AudioCraft, incluso en aplicaciones de voz e investigación del habla, y es posiblemente el componente más útil de la biblioteca a nivel práctico para los ingenieros de producción que necesitan compresión de audio de alta calidad.
La posición de AudioCraft frente a Stable Audio Open y Suno
Las dos comparaciones más relevantes son Stable Audio Open (pesos abiertos, desarrollo activo) y Suno (cerrado, comercial, con capacidad vocal).
Stable Audio Open (Stability AI, julio de 2024) utiliza una arquitectura de difusión latente en lugar de un transformador autorregresivo. Su modelo central es un transformador de difusión (DiT) de 1.057B de parámetros condicionado por un codificador de texto T5 de 109M de parámetros, además de un autocodificador de 156M de parámetros que comprime formas de onda estéreo de 44.1kHz en el espacio latente. La salida alcanza hasta 47 segundos de audio estéreo a 44.1kHz, en comparación con el límite de 32kHz mono de AudioCraft. Stable Audio Open fue entrenado con 7,300 horas de audio de Creative Commons, lo que le otorga una mejor cobertura de sonidos ambientales y de percusión. MusicGen de AudioCraft se entrenó con 20,000 horas de música con licencia y propiedad de Meta, lo que le da una ventaja en la estructura musical melódica y armónica. En la práctica: Stable Audio Open funciona mejor para el diseño de sonido y clips ambientales cortos; MusicGen funciona mejor para composiciones instrumentales más largas con coherencia musical. Stable Audio Open también ha recibido un mantenimiento más activo en 2024-2025, incluyendo una variante móvil de 341M de parámetros lanzada en asociación con Arm.
Suno (comercial, cerrado) adopta un enfoque completamente diferente. Su arquitectura híbrida combina Bark, que maneja la síntesis vocal realista y la generación de letras, con Chirp, que maneja la instrumentación. El resultado es una canción completamente producida con voces principales, armonías y fondo musical, de hasta 4 minutos por clip. AudioCraft no puede generar voces en absoluto. Meta eliminó deliberadamente las voces de los datos de entrenamiento de MusicGen utilizando la separación de fuentes HT-Demucs precisamente para evitar problemas de derechos de autor con el canto. Suno v5 (2025) registra una puntuación ELO de 1,293 en evaluaciones independientes de calidad de audio, situándose por delante de todos los competidores probados públicamente. Sin embargo, en julio de 2024, la RIAA presentó demandas contra Suno y Udio alegando el uso de música con derechos de autor sin licencia en el entrenamiento, una sombra legal que AudioCraft no comparte dado el uso de datos con licencia por parte de Meta. Suno cobra a través de niveles de suscripción que comienzan en aproximadamente $8/mes; AudioCraft es gratuito.
"no podría vender este resultado ni para un juego de clics móvil gratuito", comentarista anónimo, Hacker News, agosto de 2023, sobre el audio de demostración del lanzamiento de AudioCraft
Esa reacción, aunque dura, ilustra lo que AudioCraft es y no es. En el momento del lanzamiento, los resultados eran de nivel de investigación, no de nivel de producción. La brecha entre AudioCraft y los generadores de música comerciales se ha ampliado desde 2023, ya que Suno y Udio iteraron agresivamente mientras que los modelos principales de MusicGen de Meta se han mantenido en gran medida estáticos.
La realidad de las licencias y los derechos de autor
El código de AudioCraft tiene licencia MIT, lo que suena sumamente abierto. Los pesos de los modelos, sin embargo, están bajo Creative Commons Attribution-NonCommercial 4.0 International (CC-BY-NC 4.0). Esa distinción importa significativamente. Puedes leer, modificar y redistribuir libremente el código de entrenamiento e inferencia. No puedes, bajo la licencia de los pesos, utilizar el audio generado o los modelos en ningún producto comercial, servicio o flujo de trabajo monetizado sin un acuerdo comercial independiente con Meta, el cual no se ofrece públicamente.
Múltiples desarrolladores en la discusión de lanzamiento de agosto de 2023 en Hacker News señalaron este planteamiento: uno notó sin rodeos que "no puedes construir un negocio sobre esto" debido a la restricción no comercial. La brecha entre el "código abierto" (código) y los "pesos abiertos" (no comercial) es un patrón que también aparece en los lanzamientos de Llama de Meta, y crea una fricción real para cualquiera que espere construir un producto comercial sobre los resultados de AudioCraft.
En cuanto a los datos de entrenamiento, Meta declaró que MusicGen fue entrenado con aproximadamente 400,000 grabaciones que suman 20,000 horas, utilizando música interna propiedad de Meta y material con licencia específica de Shutterstock y Pond5. Esto posiciona a AudioCraft de manera más defendible que Suno o Udio, los cuales enfrentaron demandas de la RIAA en julio de 2024. Las afirmaciones sobre los datos de entrenamiento de AudioCraft no han sido impugnadas legalmente hasta abril de 2026.
Los pesos de JASCO conllevan la misma restricción CC-BY-NC 4.0 que MusicGen y AudioGen. Los pesos y el código de EnCodec tienen licencia MIT, lo que lo convierte en el único componente totalmente abierto de la biblioteca.
Dónde AudioCraft se queda corto de manera constante
La limitación más clara son las voces. MusicGen no puede producir canto, habla ni ninguna voz humana inteligible en su salida. Esta es una elección de diseño deliberada, no una brecha temporal. El proceso de entrenamiento pasó todo el audio por HT-Demucs para separar y eliminar la pista vocal antes de la tokenización. A los investigadores que necesitan síntesis vocal de la familia AudioCraft se les dirige hacia EnCodec como una capa de códec para otros sistemas de vocoder, no a MusicGen en sí.
Los requisitos de hardware crean una segunda barrera. El modelo mediano, que es la configuración mínima para un resultado musicalmente coherente, requiere 16GB de VRAM. Los usuarios con tarjetas de 8GB están limitados al modelo pequeño, que produce una estructura musical notablemente más simple. Un usuario en el problema #435 de GitHub informó en marzo de 2024 que su portátil NVIDIA con 16GB de VRAM mostraba solo un 5-10% de utilización de la GPU durante la inferencia de MusicGen mientras que los núcleos de la CPU funcionaban a su máxima capacidad, lo que sugiere que el proceso de inferencia no aprovecha de manera consistente la aceleración de la GPU en todas las configuraciones de hardware.
El ajuste fino (fine-tuning) en conjuntos de datos personalizados es técnicamente compatible pero difícil en la práctica. Un usuario que intentó ajustar un modelo personalizado de 33M de parámetros con 133 horas de música en una GTX 1060 informó después de 20 horas de entrenamiento que las muestras generadas "suenan como si casi no hiciera nada", comparándose desfavorablemente con otras arquitecturas de transformadores que muestran un progreso coherente en 20 minutos en hardware equivalente. El entrenamiento requiere recursos de GPU sustanciales que ponen el ajuste fino serio fuera del alcance de la mayoría de los investigadores individuales sin acceso a computación en la nube.
La velocidad de desarrollo también se ha ralentizado visiblemente. El último lanzamiento sustancial fue JASCO en enero de 2025. Antes de eso, MAGNeT en mayo de 2024. Los modelos principales de MusicGen y AudioGen están efectivamente congelados en sus recuentos de parámetros de 2023-2024, mientras que competidores como Suno y Stable Audio continúan lanzando actualizaciones de versiones principales con mejoras de calidad. Con 362 problemas abiertos en GitHub y la atención de investigación de Meta claramente desplazándose hacia otros proyectos, AudioCraft se encuentra en un estado de mantenimiento en lugar de desarrollo activo.
"el modelo progresa absurdamente lento, he estado entrenando durante las últimas 20 horas, y las muestras generadas suenan como si casi no hiciera nada". CDandRW, problema #388 de GitHub, 15 de enero de 2024
Para quién es AudioCraft
AudioCraft es la herramienta adecuada para investigadores de aprendizaje automático e ingenieros de audio que desean estudiar o construir sobre la arquitectura de audio generativo de Meta. Si estás escribiendo un artículo sobre la generación de música condicionada por texto, necesitas un modelo de referencia para comparar, o quieres entrenar un modelo personalizado en un conjunto de datos de nicho (instrumentos folclóricos, diseño de sonido industrial, paquetes de audio para juegos), el código de entrenamiento de AudioCraft y la columna vertebral de EnCodec están bien documentados y son genuinamente útiles. También es la herramienta adecuada para desarrolladores que necesitan inferencia de audio generativo no comercial en sus propias instalaciones sin límite de uso, sin costos de API y con control total sobre el modelo.
AudioCraft es la elección equivocada si deseas generar canciones completas con letras y voces, lo cual requiere Suno o Udio. También es la elección equivocada si necesitas una generación de audio de código abierto rápida y bien mantenida para diseño de sonido no musical, donde Stable Audio Open ofrece un desarrollo más activo y una mejor calidad estéreo a 44.1kHz. Omite AudioCraft si necesitas licencias comerciales, ya que la restricción de pesos CC-BY-NC bloquea cualquier implementación monetizada. Y omítelo si careces de una GPU con al menos 8GB de VRAM o del nivel de comodidad para instalar dependencias de Python y gestionar un entorno PyTorch manualmente.
Para desarrolladores de juegos independientes, estudiantes de cine e investigadores académicos de audio que se sienten cómodos ejecutando código Python local y tienen una GPU NVIDIA de gama media, AudioCraft sigue siendo una opción capaz y gratuita para generar música instrumental y efectos de sonido no comerciales. Su posición como el framework fundamental de IA de audio de código abierto que precedió a todo lo demás le otorga un valor de citación continuo en la literatura de investigación, incluso cuando herramientas más nuevas lo superan en calidad de salida bruta.
Reseñas de usuarios
Aún no hay reseñas. ¡Sé el primero en compartir tu experiencia!
Inicia sesión para escribir una reseña.
Destacado en colecciones
Listas seleccionadas que incluyen AudioCraft.
Artículos relacionados
Guías y artículos relacionados con AudioCraft.

Run Open Source AI Models Locally: Battle-Tested Guide

OpenAI GPT-Realtime-2 (May 2026): Pricing, Latency & 30-Min Voice Agent

Vantaige Launches the LLM VRAM Calculator: A Free GPU Compatibility Finder for Open-source and Open-Weight AI

Run a Company With AI Agents: The Open-Source Orchestration Setup (2026)

Nous Hermes 4: The Self-Hosted Open-Weight Agent Brain (2026)
