Saltar al contenido principal
Vantaige
Cartesia AI screenshot
Cartesia AI logo

Cartesia AI

Freemium

Cartesia AI desarrolla la API de texto a voz Sonic sobre una novedosa arquitectura de modelo de espacio de estados (SSM), logrando un tiempo hasta el primer audio de 90 ms para agentes de voz en tiempo real. Fundada por los investigadores detrás de Mamba y respaldada por NVIDIA y Kleiner Perkins con $122M recaudados.

Casos de uso:Audio y Música
Funciones:API

Cartesia es una empresa de IA de voz fundada en 2023 por los investigadores del Stanford AI Lab Albert Gu, Karan Goel, Chris Re y Arjun Desai, el mismo equipo que inventó la arquitectura de modelo de espacio de estados (SSM) Mamba, utilizada en todo el aprendizaje automático. Su producto estrella es Sonic, una API de texto a voz (TTS) construida no sobre transformadores, sino sobre SSM, que procesan secuencias actualizando un vector de estado comprimido en lugar de atender a cada token anterior. El resultado práctico es un modelo que alcanza los 90 ms de tiempo hasta el primer audio (TTFA) en la variante estándar Sonic-3, y 40 ms en Sonic Turbo, lo que la convierte en la API de TTS con calidad humana más rápida disponible para aplicaciones conversacionales en tiempo real. Cartesia ha recaudado aproximadamente $122M en total, con una ronda de $100M en noviembre de 2025 de Kleiner Perkins, Index Ventures, Lightspeed y NVIDIA.

Sonic-3, el modelo de producción actual, es compatible con 42 idiomas, ~130 voces preestablecidas y controles de prosodia detallados que incluyen velocidad, tono y etiquetas de emoción explícitas. Los desarrolladores pueden inyectar risas naturales utilizando una etiqueta [laughter] directamente en el prompt de texto. La clonación de voz funciona con tan solo 3 segundos de audio de origen, generando una voz adaptada al hablante que conserva el acento, la cadencia y el carácter tonal. Más allá del TTS, la plataforma de Cartesia ahora incluye Ink-Whisper (voz a texto), un endpoint de Voice Changer para la transformación de audio, un endpoint de Infill para la edición de audio y Line, un producto de agente de voz gestionado construido sobre Sonic. Las implementaciones empresariales admiten inferencia local (on-premise) y en el dispositivo (on-device), con cumplimiento SOC-2 e HIPAA para industrias reguladas.

Lo que Cartesia ofrece en abril de 2026

Sonic-3 es el modelo predeterminado actual. Genera salida de audio en streaming a partir de 90 ms de TTFA desde la llamada a la API hasta el primer byte de audio, medido bajo condiciones de red estándar. La variante Turbo se reduce a 40 ms a costa de un límite de entrada de 500 caracteres por solicitud y un techo de calidad más estrecho. Ambos modelos utilizan inferencia SSM, lo que significa que el audio se transmite token por token a velocidad de reproducción en lugar de generar un clip completo y devolverlo. Esta arquitectura nativa de streaming es la razón por la que los agentes de voz construidos en Cartesia se sienten conversacionalmente receptivos: el usuario escucha a la IA comenzar a hablar aproximadamente al mismo tiempo que lo haría un humano.

El soporte de idiomas a partir de Sonic-3 cubre 42 idiomas con voces de acento nativo, frente a los 15 del Sonic original y los 15 de Sonic-2 en su lanzamiento. La personalización de voz expone la velocidad (tasa de reproducción), el ajuste de tono, los diales de emoción (calmado, enojado, emocionado, triste y otros) y la etiqueta de inyección de risa. Pro Voice Cloning, disponible en el plan Startup y superiores, entrena un modelo de hablante a partir de una breve muestra de audio y factura a 1.5 créditos por carácter en lugar del estándar de 1 crédito por carácter. La plataforma publica acuerdos de nivel de servicio (SLA) de tiempo de actividad del 99.9% y afirma tener las latencias P90 más rápidas a nivel mundial en toda su implementación de CDN.

Goodcall, una empresa de agentes telefónicos de IA para empresas, implementó 2,217 agentes de voz únicos en Sonic en los tres meses posteriores al cambio. Su CEO describió el resultado directamente:

"Sonic es el único producto existente con una latencia de modelo inferior a 100 ms, superando a su siguiente mejor alternativa por un factor de cuatro." - Bob Summers, CEO de Goodcall, caso de estudio de cliente de Cartesia, 2025

Dónde se sitúa Cartesia frente a ElevenLabs y Resemble AI

El mercado de TTS en 2026 se divide a grandes rasgos entre herramientas de creación de contenido de propósito general e infraestructura de agentes en tiempo real. Cartesia compite en este último eje. Las diferencias mecánicas entre los tres principales competidores son importantes para elegir correctamente.

ElevenLabs ejecuta TTS basado en transformadores. La inferencia de transformadores atiende a cada token anterior en la secuencia, lo que escala bien para la calidad de narración de formato largo pero agrega sobrecarga por token. Su modelo Flash v2.5 alcanza ~75 ms de TTFA, lo que es competitivo con Cartesia Turbo. Sin embargo, los modelos de nivel de calidad de ElevenLabs se ejecutan a 300 ms o más de TTFA, y su biblioteca de voces es sustancialmente más amplia: más de 4,000 voces preestablecidas en más de 70 idiomas frente a las ~130 voces y 42 idiomas de Cartesia. En una prueba de preferencia a ciegas sobre 100 voces reservadas, los usuarios prefirieron Sonic-2 sobre ElevenLabs Flash V2 en un 61.4% frente a un 38.6% para fragmentos conversacionales. La clonación de voz para ElevenLabs requiere un mínimo de 10 segundos de audio; la clonación instantánea de Cartesia funciona a partir de 3 segundos. La división práctica: ElevenLabs para bibliotecas de voz ricas, doblaje, narración de formato largo y contenido multilingüe donde la amplitud del idioma es importante. Cartesia para infraestructura de agentes en tiempo real donde cada milisegundo de latencia es una métrica de calidad del producto.

Resemble AI toma un camino arquitectónico diferente. Su modelo Chatterbox Turbo utiliza un transformador de 350M de parámetros con un decodificador de difusión destilado de un solo paso, reduciendo la generación de 10 pasos de difusión a uno. La diferenciación de Resemble es la seguridad y la autenticidad: integran detección de deepfakes, marcas de agua de audio y herramientas de análisis forense de voz en la plataforma, lo que la convierte en la opción natural para industrias reguladas que necesitan demostrar la procedencia del audio. Chatterbox se lanza como código abierto, lo que no ocurre con Sonic de Cartesia. Los puntos de referencia de latencia de Resemble no coinciden con los números de TTFA publicados por Cartesia, y no lideran en velocidad como reclamo de posicionamiento. La comparación es la postura de seguridad empresarial y la capacidad de implementación de código abierto (Resemble) frente al rendimiento de latencia bruta para sistemas en tiempo real (Cartesia).

"Al usar la API de voz generativa de Cartesia, Sonic, hemos fortalecido a Cresta AI Agent para ir más allá de los guiones rígidos y avanzar hacia la entrega de conversaciones empáticas y similares a las humanas." - Tim Shi, cofundador y CTO de Cresta, caso de estudio de cliente de Cartesia, 2025

La realidad de las licencias y los derechos de autor

Los términos de Cartesia otorgan derechos comerciales a la salida de audio a partir del plan Pro ($4/mes facturado anualmente). El nivel Free restringe la salida a uso personal y no comercial. Pro Voice Cloning, que entrena un modelo de hablante a partir del audio enviado, requiere que los usuarios posean o tengan derechos sobre el audio que envían. La plataforma no publica las fuentes de datos de entrenamiento para las voces preestablecidas de Sonic, y no se ha presentado públicamente ningún litigio sobre datos de entrenamiento contra Cartesia hasta abril de 2026.

Las opciones de implementación en el dispositivo y local (on-premise) significan que las organizaciones pueden ejecutar la inferencia de Sonic localmente, lo que elude las preocupaciones de retención de datos en industrias reguladas. Cartesia comercializa el cumplimiento de HIPAA para implementaciones de agentes de voz en el sector de la salud, y la implementación del centro de contacto de Cresta en Brinks Home confirma el uso en producción empresarial. Veronica Moturi, vicepresidenta sénior de experiencia del cliente en Brinks Home, señaló que "Nuestro agente de IA de voz guía a los clientes a través de escenarios de resolución de problemas complejos y de múltiples pasos, y los comentarios positivos de estos clientes han sido reveladores", describiendo los resultados de la implementación de Cresta utilizando Sonic.

La estructura de derechos comerciales es sencilla: pague el nivel Pro o superior, y el audio generado es suyo para uso comercial. Los clones de voz entrenados a partir de sus propias grabaciones pertenecen a su cuenta. Cartesia no reclama propiedad ni derechos sobre el audio de salida generado a través de su API.

Dónde Cartesia se queda corto de manera constante

El límite de 500 caracteres en Sonic Turbo es la frustración más reportada por los desarrolladores. Construir una narración de formato largo o una conversación de múltiples turnos donde una sola respuesta del agente excede los 500 caracteres requiere fragmentar el texto, administrar los límites de los fragmentos para evitar divisiones a mitad de palabra y unir segmentos de audio. ElevenLabs Flash v2.5 acepta hasta 40,000 caracteres por solicitud. Para la producción de audiolibros, narración de podcasts o cualquier aplicación donde los segmentos individuales sean largos, este límite obliga a realizar un trabajo de ingeniería que los competidores evitan.

La cobertura de idiomas en 42 idiomas es real, pero sigue siendo más estrecha que los más de 70 de ElevenLabs. Los equipos que desarrollan para los mercados del sudeste asiático, idiomas africanos menos comunes o dialectos regionales con datos de entrenamiento limitados encontrarán lagunas. La biblioteca de voces preestablecidas de ~130 voces también es más reducida que el catálogo de más de 4,000 de ElevenLabs. Los equipos que desean variación de acentos regionales, voces de diversas edades o una amplia cobertura de personajes para la producción de juegos y medios se enfrentan a limitaciones de voz que requieren inversión en clonación personalizada.

Cartesia es una API para desarrolladores, no una herramienta empresarial. No hay un conector nativo de Salesforce, ni integración de flujo de trabajo de mesa de ayuda, ni enrutamiento de llamadas listo para usar. Los equipos que describen a Cartesia como su capa de voz señalan constantemente que maneja bien la voz pero no aporta nada a la arquitectura de la aplicación circundante. Un enfoque común: Cartesia proporciona el motor, no el chasis, la dirección o la navegación. Los desarrolladores que construyen un agente de voz completo deben ensamblar el resto de forma independiente.

El ajuste manual de emociones agrega sobrecarga en contextos conversacionales dinámicos. A diferencia de las plataformas con detección automática de prosodia, Cartesia requiere etiquetas de emoción explícitas o ajustes manuales de los diales de velocidad/tono. En un sistema con guion, esto es manejable; en una IA conversacional generativa que responde a entradas de usuario impredecibles, mantener precisos los controles de emoción requiere una ingeniería de prompts de LLM ajustada o una capa de clasificación que decida qué etiqueta de emoción aplicar.

Para quién es Cartesia

Cartesia se dirige a desarrolladores que construyen IA conversacional en tiempo real donde la latencia afecta directamente la calidad del producto. Si su aplicación es un agente de voz, un bot telefónico, un avatar de IA en un juego o cualquier sistema interactivo donde el usuario espera una respuesta de voz, 90 ms frente a 300 ms de TTFA es audiblemente diferente. La tasa de interacción de llamadas del 97% de Goodcall y los 2,217 agentes implementados representan el tipo de resultado que permite el TTS de baja latencia: los usuarios permanecen en la línea porque la IA se siente como un compañero de conversación natural.

Los equipos de atención médica y servicios financieros que ejecutan cargas de trabajo sensibles al cumplimiento se benefician de las opciones de implementación en el dispositivo y local. El cumplimiento de HIPAA sin transmisión de datos en la nube es un diferenciador significativo para ese sector. Las empresas a gran escala que necesitan soporte prioritario, alta concurrencia y SLA personalizados encontrarán que los niveles Scale y Enterprise son muy adecuados.

Omita Cartesia cuando sus necesidades principales sean la variedad de voces y la amplitud de idiomas para la creación de contenido. Si está produciendo podcasts multilingües, doblando contenido de video a más de 50 idiomas o necesita una biblioteca de más de 1,000 voces para una plataforma creativa, el catálogo de ElevenLabs le servirá mejor. Omita Cartesia si necesita una solución de voz sin código (no-code) o de bajo código (low-code): no hay una interfaz de apuntar y hacer clic para usuarios no técnicos, ni un creador de campañas, ni un reproductor integrado. La API es el producto. Y omita Sonic Turbo específicamente si su caso de uso genera segmentos de texto más largos que unas pocas oraciones a la vez, a menos que esté preparado para construir y mantener un flujo de trabajo de fragmentación.

Reseñas de usuarios

Aún no hay reseñas. ¡Sé el primero en compartir tu experiencia!

Inicia sesión para escribir una reseña.

Artículos relacionados

Guías y artículos relacionados con Cartesia AI.