

Stable Audio genera música instrumental y efectos de sonido libres de derechos a partir de indicaciones de texto con calidad estéreo de 44.1kHz. Desarrollado por Stability AI con un conjunto de datos totalmente licenciado, destaca en pistas de fondo, bases ambientales y diseño de sonido, no en canciones con voz.
Stable Audio es la plataforma de generación de audio y música de Stability AI, construida específicamente sobre un conjunto de datos licenciado en lugar de grabaciones extraídas con derechos de autor. La herramienta acepta indicaciones de texto y, en sus niveles de pago, archivos de audio subidos, devolviendo pistas estéreo con calidad de 44.1kHz. No es un generador de canciones al estilo de Suno: no hay voces, ni letras, ni estructuras de verso-estribillo. Lo que sí produce (música instrumental, paisajes sonoros ambientales y efectos de sonido discretos) lo hace de forma rápida, legal y con un nivel de calidad que se sostiene en proyectos comerciales de vídeo y videojuegos.
El producto existe en dos formas paralelas. La aplicación web para consumidores en stableaudio.com ofrece una interfaz de generación sencilla con cuatro niveles de suscripción (desde Free hasta Max) y un límite de salida de tres minutos por generación. La vía empresarial, Stable Audio 2.5 lanzada en septiembre de 2025, añade inpainting de audio, generación estructural de múltiples partes y velocidades de generación inferiores a dos segundos en GPU H100, accesible a través de la API de Stability AI, Replicate, ComfyUI y Fal. Una variante independiente de código abierto, Stable Audio Open 1.0, proporciona pesos del modelo de descarga gratuita entrenados con grabaciones bajo licencia CC de Freesound y Free Music Archive, aunque sus salidas están limitadas a 47 segundos y se inclinan más hacia los efectos de sonido que hacia la música.
Lo que produce Stable Audio en abril de 2026
La aplicación web comercial genera hasta tres minutos de audio estéreo a 44.1kHz por generación. Los usuarios introducen indicaciones de texto que describen el género, el estado de ánimo, el tempo, la instrumentación y la estructura de sección deseada (intro, desarrollo, caída, cierre). Las generaciones se completan en menos de 60 segundos para la mayoría de las indicaciones. El modo de audio a audio, disponible en todos los niveles de pago, permite a los usuarios subir un archivo de referencia para guiar el ritmo y el carácter sonoro del resultado, con una detección de derechos de autor que escanea automáticamente las subidas y marca el material de terceros.
Stable Audio 2.5 añade inpainting de audio: sube un clip, selecciona una región o punto de inicio, y el modelo genera una continuación musicalmente coherente. Esto es muy útil para el trabajo de audio de marcas y la posproducción, donde el objetivo es extender o adaptar una pieza existente en lugar de generar desde cero. El método de entrenamiento ARC (Adversarial Relativistic-Contrastive) detrás de la versión 2.5 permite alcanzar las velocidades de generación prometidas y produce un desarrollo musical más complejo a través de las secciones de intro, transición y cierre en comparación con la versión 2.0.
El modelo Stable Audio Open 1.0 en Hugging Face utiliza una arquitectura de difusión DiT basada en transformadores con condicionamiento de texto basado en T5 y un autoencoder compresivo. Fue entrenado con 486,492 grabaciones de audio: 472,618 de Freesound y 13,874 de Free Music Archive, todas con licencias CC0, CC BY o CC Sampling+. Un modelo complementario más pequeño, Stable Audio Open Small (mayo de 2025), está orientado a la inferencia en dispositivos y la implementación móvil. Ambas variantes abiertas están limitadas a salidas de 47 segundos y funcionan mejor en efectos de sonido y grabaciones de campo que en música estructurada.
Dónde se sitúa Stable Audio frente a Suno y Udio
La comparación a tres bandas a menudo se plantea como una carrera de caballos, pero es más preciso tratarlas como herramientas diferentes para resultados diferentes. Suno v5.5 es, ante todo, un generador de canciones con voz. Su arquitectura centrada en LLM integra letras y síntesis vocal en una sola pasada, produciendo canciones estructuradas completas con fraseo natural, vibrato y dinámica emocional. Genera pistas nativas de cuatro minutos en aproximadamente 30 segundos y se extiende hasta 10 minutos a través de su función Extend. No realiza condicionamiento de entrada de audio a audio. La situación de sus datos de entrenamiento es objeto de litigios activos por derechos de autor.
"Para la generación instantánea de canciones, Suno todavía parece estar a la cabeza." -- Reseña de Audiocipher, abril de 2024, actualizada en abril de 2025
Udio 1.5 (antes de octubre de 2025) era el contendiente que priorizaba la calidad para la música con letras, utilizando un modelo basado en difusión con letras guiadas por LLM y clips nativos de 32 segundos que se unen hasta alcanzar los 15 minutos. Su fidelidad de audio en pistas líricas extendidas fue ampliamente considerada como una ligera ventaja sobre Suno en calidad bruta, aunque más lenta, con unos 90 segundos por generación. En octubre de 2025, Udio resolvió su demanda con los principales sellos discográficos desactivando las descargas de los usuarios y cambiando a un modelo restringido "Solo con licencia". La reacción de la comunidad fue dura: los creadores que habían pasado meses perfeccionando sonidos descubrieron que ya no podían exportar sus propias generaciones.
"Muchos usuarios de Reddit han subrayado cómo Udio se convirtió en un sistema cerrado, ya que los creadores ya no pueden descargar sus canciones, una función que se eliminó silenciosamente." -- AI Tool Discovery, Reseña de Suno AI en Reddit 2026
Stable Audio ocupa un carril separado. Es la herramienta instrumental y de diseño de sonido. Mientras Suno y Udio compiten por quién puede generar la mejor canción pop, Stable Audio genera la base ambiental debajo de esa canción, el clic de la interfaz de usuario en el videojuego y el zumbido atmosférico detrás de la escena de la película. Su límite de tres minutos es una restricción para los productores musicales, pero en gran medida irrelevante para los casos de uso de diseño de sonido donde los bucles de 30-60 segundos son el estándar. Su funcionalidad de exportación de stems, destacada por múltiples comunidades de productores como un diferenciador amigable con los DAW, está ausente en las salidas para consumidores tanto de Suno como de Udio.
La realidad de las licencias y los derechos de autor
La afirmación más defendible de Stable Audio es la procedencia de sus datos de entrenamiento. El modelo comercial fue entrenado exclusivamente con música licenciada de la biblioteca de AudioSparx bajo un acuerdo de reparto de ingresos: si el modelo tiene un buen rendimiento comercial, AudioSparx (y a través de ella, los artistas contribuyentes) comparte ese éxito. Esta fue la decisión de diseño fundamental tomada por Ed Newton-Rex, entonces vicepresidente de Audio en Stability AI, al construir el producto.
En noviembre de 2023, Newton-Rex renunció públicamente a Stability AI, citando un desacuerdo con la posición de la empresa matriz de que entrenar modelos de IA con obras protegidas por derechos de autor constituye un "uso justo". La renuncia fue muy publicitada y subrayó una ironía específica: había construido Stable Audio para evitar exactamente el problema por el que protestaba. La empresa Stability AI en general, a través de sus modelos de imagen, mantenía la posición de uso justo; el entrenamiento de audio de Stable Audio era limpio por separado. Desde entonces, Newton-Rex ha fundado Fairly Trained, una organización de certificación, y apareció en la lista de las 100 personas más influyentes en IA de TIME en 2025.
Para los usuarios comerciales, la consecuencia es práctica. Las pistas generadas en los niveles de pago de Stable Audio vienen con una licencia Creator que otorga derechos comerciales para uso individual, cubriendo redes sociales, lanzamientos comerciales, ubicaciones en cine y televisión por debajo de ciertos umbrales de ingresos, y aplicaciones y juegos de hasta 100,000 usuarios activos mensuales. Las organizaciones que superan esos umbrales, o aquellas que necesitan autoalojamiento, pasan al nivel Enterprise. Las salidas generadas pueden ser utilizadas para futuras mejoras del modelo por parte de Stability AI, pero los archivos subidos por los usuarios no se incorporan a los conjuntos de datos de entrenamiento.
Stable Audio Open se publica bajo la Licencia Comunitaria de Stability AI, que permite la investigación y el uso no comercial; el uso comercial requiere un acuerdo separado a través de stability.ai/license.
Dónde se queda corto Stable Audio de forma constante
La generación de voz está estructuralmente ausente. El modelo no puede producir canto humano coherente, entrega de letras o habla inteligible en ningún nivel. Esto no es un error; es una decisión de alcance deliberada. Pero significa que cualquiera que llegue con la esperanza de generar una canción completa con un cantante se chocará inmediatamente contra un muro.
El modo de audio a audio no cumple con su promesa implícita. La función aplica el timbre y el carácter sonoro a nivel superficial del archivo de referencia a la salida generada; no reorganiza, reconstruye ni utiliza de forma inteligente la entrada como una plantilla musical. Las pruebas realizadas por los revisores de Audiocipher descubrieron que solicitar una instrumentación específica (batería, bajo) en el modo de audio a audio a menudo produce salidas en las que faltan esos instrumentos por completo: el modelo aplica un sabor sonoro en lugar de construir el arreglo solicitado. Una prueba que convertía una grabación de acordeón a gypsy jazz produjo un xilófono en lugar del bajo y la batería solicitados.
"La transferencia de estilo no funcionó muy bien... al resultado le falta la instrumentación completa a pesar de que la indicación solicitaba batería y bajo." -- Audiocipher, probando el modo de audio a audio de Stable Audio 2.0, abril de 2024
El límite estricto de 3 minutos por generación es un punto de fricción persistente para los productores musicales que desean pistas completas. La unión mediante inpainting (disponible en la versión 2.5) requiere una carga de trabajo adicional. Los límites de subida en el plan Pro (30 minutos al mes) son fáciles de agotar en sesiones activas de diseño de sonido, y las generaciones no utilizadas no se acumulan. El límite de 47 segundos de la variante de código abierto agrava esto para los desarrolladores que asumieron que el modelo abierto igualaría las capacidades de la aplicación comercial.
La ingeniería de indicaciones para el control de la estructura requiere una iteración real. Los usuarios deben codificar la estructura de la sección ("desarrollo de dos minutos, caída en el 1:40, cierre con desvanecimiento") directamente en el texto, y las indicaciones complejas a veces producen artefactos de audio alucinados o transiciones abruptas que requieren volver a generar. El modelo no admite la entrada de lenguaje natural con la flexibilidad que utilizan las herramientas respaldadas por LLM como Suno.
Para quién es Stable Audio
Los productores de vídeo y creadores de contenido que necesitan instrumentales de fondo libres de derechos son el perfil más claro. La combinación de datos de entrenamiento totalmente licenciados, calidad de salida de 44.1kHz y un tiempo de generación inferior a 60 segundos lo hace práctico para la producción de vídeo de alto volumen donde cada pista debe sobrevivir a una verificación de Content ID.
Los desarrolladores de videojuegos que construyen paisajes sonoros ambientales, audio de interfaz de usuario y diseño de sonido ambiental obtienen un valor real, particularmente en el nivel Pro, donde el modo de audio a audio permite iterar a partir de materiales de referencia. El nivel Enterprise desbloquea el ajuste fino en bibliotecas de sonido propietarias, lo cual es significativo para los estudios que construyen identidades de audio consistentes en todos sus títulos de juegos.
Los diseñadores de sonido y los ingenieros de audio que desean una inferencia local y abierta en activos de formato corto deberían explorar Stable Audio Open 1.0 u Open Small a través de Hugging Face y ComfyUI. El límite de 47 segundos no es una restricción para pasos, clics de interfaz de usuario, elementos Foley o bucles atmosféricos cortos.
Las marcas y agencias que necesitan trabajo de identidad de audio (logotipos sonoros, branding de audio consistente en todos los puntos de contacto) son el público objetivo de la API empresarial 2.5. La asociación de branding sonoro con WPP Amp anunciada con el lanzamiento de la versión 2.5 señala esto como la principal dirección de crecimiento del producto.
Evita Stable Audio si necesitas voces de cualquier tipo, si quieres generar canciones completas con una estructura de verso-estribillo, si tu flujo de trabajo depende de pistas de más de tres minutos sin unión manual, o si necesitas una transferencia de estilo estructural profunda a partir de una referencia de audio en lugar de una transposición de timbre superficial.
Reseñas de usuarios
Aún no hay reseñas. ¡Sé el primero en compartir tu experiencia!
Inicia sesión para escribir una reseña.
Destacado en colecciones
Listas seleccionadas que incluyen Stable Audio.
Artículos relacionados
Guías y artículos relacionados con Stable Audio.

OpenAI GPT-Realtime-2 (May 2026): Pricing, Latency & 30-Min Voice Agent

AI Video Generator Prompting: The Filmmaker's Real Workflow

Grok 4.3 API for Agents (May 2026): Pricing, Benchmarks, Migration

Sell AI-Generated Short Films on TikTok Shop, Instagram & YouTube (2026)

Replit Pricing Explained (2026): Core vs Pro and Effort-Based Agent Billing
