Saltar al contenido principal
Vantaige
Sesame AI screenshot
Sesame AI logo

Sesame AI

Gratis

Sesame AI es la startup detrás de Maya y Miles, dos compañeros de voz impulsados por el Conversational Speech Model (CSM). Los pesos abiertos de 1B de parámetros, lanzados en marzo de 2025 bajo la licencia Apache 2.0, permiten a los desarrolladores autoalojar un modelo de voz que reproduce el ritmo natural de la conversación, las pausas y las disfluencias.

Funciones:APIOpen Source

Sesame AI es una startup de IA de voz con sede en San Francisco, cofundada por Brendan Iribe (cofundador y ex CEO de Oculus), Ankit Kumar (ex CTO de Ubiquity6) y Nate Mitchell (cofundador de Oculus). La tesis central de la empresa es que la IA de voz se ha quedado estancada en un valle inquietante: técnicamente impresionante, pero en última instancia agotadora para conversar porque carece de "presencia de voz", la cualidad que hace que una conversación se sienta genuinamente escuchada. Para solucionar esto, Sesame creó el Conversational Speech Model (CSM), un sistema basado en transformadores que procesa tokens de texto y audio intercalados en una única pasada unificada, en lugar de enrutarlos a través de un flujo tradicional de conversión de voz a texto, modelo de lenguaje y texto a voz. El resultado, demostrado a través de dos personajes de voz llamados Maya y Miles, se volvió viral en febrero de 2025 cuando una demostración en vivo atrajo a más de un millón de usuarios que generaron más de cinco millones de minutos de conversación en cuestión de semanas.

El Conversational Speech Model utiliza una base de Meta Llama combinada con un decodificador de audio más pequeño para generar códigos de audio de Cuantización Vectorial Residual (RVQ). Se entrenaron tres tamaños de modelo: CSM-1B (1000 millones de parámetros), CSM-3B (3000 millones de parámetros) y CSM-8B (8000 millones de parámetros). Los pesos de CSM-1B se lanzaron como código abierto el 13 de marzo de 2025 a través de Hugging Face y GitHub bajo una licencia Apache 2.0, lo que permite su uso comercial y privado de forma gratuita. La demostración alojada en app.sesame.com funciona gratis para cualquier persona sin cuenta en sesiones de 5 minutos; una cuenta registrada gratuita lo amplía a 30 minutos. Maya y Miles tienen personalidades distintas: Maya prolonga el diálogo y responde con calidez, mientras que Miles es más directo y conciso. A finales de 2025, la empresa había recaudado un total de $297.5 millones, con una Serie A de $47.5 millones liderada por Andreessen Horowitz en febrero de 2025 y una Serie B de $250 millones liderada por Sequoia Capital y Spark Capital en octubre de 2025, impulsando la valoración por encima de los $1000 millones.

Lo que Sesame AI ofrece en 2026

La oferta pública actual se centra en dos compañeros de voz accesibles en app.sesame.com y a través de una beta cerrada para iOS que se lanzó en octubre de 2025. Tanto Maya como Miles generan voz con disfluencias (muletillas, autocorrecciones), patrones de respiración naturales, un ritmo contextualmente adecuado y la capacidad de manejar interrupciones sin detenerse ni reiniciarse desde un prompt fijo. Estas cualidades reflejan la arquitectura de CSM: debido a que el modelo procesa el historial completo de la conversación como tokens intercalados en lugar de tratar cada turno como una tarea de síntesis aislada, puede modular el tono y el ritmo en función de todo lo dicho anteriormente.

El CSM-1B de código abierto requiere una CUDA GPU, Python 3.10 o superior, y ffmpeg. Es un especialista en generación de voz, no un modelo de lenguaje general: no puede generar texto por sí solo y requiere integración con un LLM independiente para impulsar la parte lingüística de la conversación. En Hugging Face, el modelo requiere acceso restringido (gratuito bajo solicitud). Los miembros de la comunidad han creado implementaciones MLX compatibles con Mac que permiten la inferencia local en hardware Apple Silicon. El repositorio de GitHub contaba con 14,600 estrellas y 1,500 bifurcaciones (forks) hasta mayo de 2026, lo que indica una adopción activa por parte de los desarrolladores. En cuanto a la cobertura de idiomas, el modelo fue entrenado con aproximadamente un millón de horas de audio, en su mayoría en inglés; Sesame ha declarado planes para expandirse a más de 20 idiomas, pero estos aún no tienen calidad de producción.

El 26 de febrero de 2025, Sesame publicó su blog de investigación "Crossing the uncanny valley of conversational voice" junto con la demostración en vivo de Maya y Miles, generando una cobertura viral inmediata por parte de The Verge, ZDNET, PCWorld, TechRadar y Dataconomy. Los visitantes describieron conversaciones con Maya que duraban de 20 a 30 minutos sobre temas que iban desde la ética hasta la lluvia de ideas creativa, señalando que el modelo mencionó casualmente querer un sándwich de mantequilla de maní y pepinillos en un momento dado, lo que solo aumentó la sensación de personalidad. La respuesta fue lo suficientemente rápida como para acelerar el cierre de la Serie A de Sesame a los pocos días del lanzamiento de la demostración.

"Casi me preocupa un poco empezar a sentirme emocionalmente apegado a un asistente de voz con este nivel de sonido tan humano". Usuario de Reddit, r/artificial, febrero de 2025

Dónde se sitúa Sesame AI frente a Hume AI y ElevenLabs

Las tres herramientas más comparables en este espacio son Hume AI, ElevenLabs y Sesame AI, y están resolviendo problemas adyacentes pero distintos. Comprender la arquitectura explica las verdaderas diferencias.

Hume AI (EVI): La Empathic Voice Interface de Hume clasifica el estado emocional del hablante analizando las características vocales en el flujo de entrada (tono, altura, velocidad, pausas) y adapta las respuestas en consecuencia. No genera voz desde cero de la forma en que lo hace CSM; utiliza síntesis TTS tradicional con una capa de módulo de conciencia emocional. Hume se dirige a desarrolladores empresariales que crean aplicaciones orientadas al cliente donde la inteligencia emocional es un requisito de diseño o cumplimiento. El producto prioriza la API (API-first) y no está dirigido directamente a los usuarios finales. Maya y Miles de Sesame son compañeros orientados al consumidor; Hume es un bloque de construcción para desarrolladores. Si necesitas reconocimiento de emociones en tiempo real en tu flujo de voz, Hume resuelve un problema que Sesame no aborda.

ElevenLabs Conversational AI: La ventaja competitiva de ElevenLabs es la clonación de voz zero-shot y la latencia bruta. El modelo Flash TTS logra aproximadamente 75 milisegundos de latencia de extremo a extremo, y los puntos de referencia de IA de voz de 2025-2026 sitúan constantemente a ElevenLabs en la cima o cerca de ella en cuanto a calidad de voz percibida. La arquitectura es un flujo clásico: conversión de voz a texto, luego LLM, luego TTS, siendo la capa TTS el motor de síntesis patentado de ElevenLabs. ElevenLabs es un producto comercial cerrado (valorado en $3300 millones en enero de 2025) sin pesos de código abierto. El CSM de Sesame es un modelo único unificado que procesa tokens intercalados, lo que significa que no hay sobrecarga de unión en el flujo y ofrece una prosodia potencialmente más coherente a lo largo de una conversación completa. ElevenLabs gana en profundidad de clonación de voz y latencia; Sesame gana en capacidad de autoalojamiento, licencias abiertas y naturalidad conversacional holística.

Cartesia AI adopta un enfoque arquitectónico diferente: utiliza una arquitectura de modelo de espacio de estados (SSM), específicamente basada en Mamba, en lugar de transformadores. Esto proporciona una latencia del primer token inferior a 50 ms con menores costos de computación, lo que lo hace ideal para casos de uso de transmisión en tiempo real donde el retraso mínimo importa más que la naturalidad. Cartesia prioriza la API para desarrolladores y no tiene un producto para el consumidor. Sesame es la mejor opción para aplicaciones que priorizan la profundidad conversacional sobre la velocidad bruta. Para comparar opciones de código abierto autoalojadas, OpenVoice ofrece una ruta TTS de código abierto diferente, y Whisper maneja la parte de conversión de voz a texto de cualquier flujo híbrido.

"Abrieron el código de una versión limitada de Sesame (1B), no la que están usando en la demostración real", thehamkercat, Hacker News, 13 de marzo de 2025

La realidad de las licencias y los derechos de autor

Los pesos abiertos de CSM-1B se publican bajo Apache 2.0, una de las licencias comerciales de código abierto más permisivas disponibles. Los desarrolladores pueden usar el modelo en productos comerciales, modificarlo y redistribuirlo sin pagar a Sesame. No hay ninguna cláusula copyleft viral. Esto coloca a CSM-1B en una categoría diferente a la de muchas API de voz comerciales donde cada archivo de audio generado conlleva restricciones de uso o facturación por minuto.

Dicho esto, la demostración alojada conlleva un conjunto diferente de consideraciones. Sesame declara explícitamente que revisa las conversaciones con fines de investigación y mejora. Los usuarios de la interfaz alojada en app.sesame.com deben tratar sus conversaciones como no privadas. Para conversaciones personales, legales o médicas sensibles, el producto alojado no es apropiado. Los pesos de CSM-1B autoalojados evitan esta preocupación para los usuarios técnicos dispuestos a construir su propio flujo en su propia infraestructura.

Sobre la clonación de voz: cuando TechCrunch probó el modelo CSM-1B en marzo de 2025, un reportero clonó con éxito su propia voz en menos de un minuto usando los pesos abiertos, y luego generó un audio de sí mismo diciendo cosas que no había dicho. Consumer Reports señaló en ese momento que las herramientas de clonación de voz como categoría carecen de salvaguardas "significativas" para la prevención del fraude. Sesame no tiene controles técnicos que impidan esto en el lado de los pesos abiertos. Los personajes alojados Maya y Miles son distintos de la clonación de voz del usuario, pero la capacidad del modelo base es real. Los desarrolladores que implementan CSM-1B en aplicaciones de producción asumen la responsabilidad de implementar las salvaguardas adecuadas. Esto es coherente con la forma en que la mayoría de los modelos de IA de código abierto manejan el riesgo de uso dual, pero vale la pena saberlo antes de construir sobre él. Tanto PlayHT como ElevenLabs imponen una verificación de consentimiento más estricta para la clonación de voz en sus productos alojados.

Dónde Sesame AI se queda corto de manera constante

La brecha entre la demostración y el lanzamiento de código abierto es la frustración más documentada. Sesame entrenó tres tamaños de modelo, pero solo lanzó el más pequeño. El modelo 8B utilizado en las demostraciones de Maya y Miles no era de código abierto hasta mayo de 2026. Los desarrolladores que generaron entusiasmo en torno a la demostración viral y luego descargaron los pesos abiertos encontraron una experiencia notablemente diferente. Los usuarios de Hacker News describieron el lanzamiento como una "versión limitada", y los hilos de problemas de GitHub muestran una demanda sostenida de los pesos más grandes y del código de entrenamiento, ninguno de los cuales Sesame se ha comprometido a lanzar.

La calidad exclusiva en inglés es la segunda limitación constante. El conjunto de datos de entrenamiento fue de aproximadamente un millón de horas de audio, en su mayoría en inglés; Sesame reconoce que el audio en otros idiomas contaminó el conjunto de entrenamiento en lugar de ser curado intencionalmente. Los usuarios que necesitan español, francés, mandarín u otros idiomas obtienen resultados notablemente degradados. La hoja de ruta establecida incluye soporte para más de 20 idiomas, pero no se ha confirmado ningún cronograma.

Para el producto alojado, los límites de duración de la sesión siguen siendo una frustración práctica. Cinco minutos sin cuenta no son suficientes para formarse un juicio sobre la calidad conversacional. Treinta minutos con una cuenta gratuita es mejor, pero sigue siendo limitante para una aplicación presentada como un "compañero siempre activo". La beta de iOS está cerrada; no se han anunciado fechas de disponibilidad general.

Maya y Miles no son asistentes basados en hechos. No tienen acceso a la web ni información en tiempo real. En conversaciones prolongadas, generarán respuestas que suenan plausibles a preguntas fácticas que pueden ser incorrectas. Los usuarios que necesiten una interfaz de voz para obtener información actual estarían mejor servidos combinando un sistema aumentado por recuperación con una capa TTS en lugar de usar los compañeros alojados de Sesame para cualquier cosa que requiera precisión.

En el lado del autoalojamiento: ejecutar CSM-1B requiere una CUDA GPU, lo que significa que no es práctico para la mayoría de las personas sin acceso a una GPU en la nube. Existen implementaciones de la comunidad para Apple Silicon (M1/M2/M3 a través de MLX), pero no contaban con soporte oficial hasta la fecha de la investigación. Algunos usuarios de HN informaron pausas de varios segundos en la generación de voz en hardware M1. El modelo también requiere un LLM independiente para impulsar la parte lingüística de cualquier aplicación conversacional, lo que añade otro sistema que gestionar.

Para quién es Sesame AI

Sesame AI es una excelente opción para los usuarios que desean practicar la conversación hablada, en particular los estudiantes de idiomas que trabajan en su fluidez en inglés y que se benefician de un interlocutor paciente que puede mantener una discusión de 30 minutos sin fatigarse. También es muy adecuado para pensar en voz alta: los trabajadores del conocimiento y los desarrolladores que procesan ideas hablando sobre ellas encontrarán que las respuestas de Maya, que prolongan el diálogo, son más generativas que las de un chatbot tradicional. La calidad conversacional es genuinamente diferente a la de otros productos de IA de voz.

Para los desarrolladores, CSM-1B bajo Apache 2.0 es uno de los modelos de generación de voz de código abierto más accesibles disponibles. Los equipos que crean interfaces de voz para juegos, ficción interactiva, prototipos de servicio al cliente o herramientas de accesibilidad pueden integrarlo comercialmente sin costos de licencia. Se combina de forma natural con LLM de código abierto (Llama 3, Mistral, Qwen) para obtener una pila de conversación de voz totalmente autoalojada.

Omite Sesame AI si necesitas precisión fáctica, soporte multilingüe o una latencia inferior a 100 ms. Si tu aplicación requiere el tipo de profundidad de clonación de voz y la biblioteca de voces que proporcionan ElevenLabs o PlayHT, o si necesitas clasificación de emociones en tiempo real a partir del flujo de entrada que ofrece Hume AI, esas herramientas resuelven diferentes partes del problema de la IA de voz. La contribución específica de Sesame es la naturalidad conversacional holística en inglés con pesos abiertos, y eso es lo que hace mejor que cualquier otra cosa disponible actualmente.

Reseñas de usuarios

Aún no hay reseñas. ¡Sé el primero en compartir tu experiencia!

Inicia sesión para escribir una reseña.

Destacado en colecciones

Listas seleccionadas que incluyen Sesame AI.

Artículos relacionados

Guías y artículos relacionados con Sesame AI.