Aller au contenu principal
Vantaige
Sesame AI screenshot
Sesame AI logo

Sesame AI

Gratuit

Sesame AI est la startup à l'origine de Maya et Miles, deux compagnons vocaux propulsés par le Conversational Speech Model (CSM). Les poids ouverts d'un milliard de paramètres, publiés en mars 2025 sous licence Apache 2.0, permettent aux développeurs d'auto-héberger un modèle vocal reproduisant le rythme naturel, les pauses et les hésitations d'une conversation.

Fonctionnalités :APIOpen Source

Sesame AI est une startup d'IA vocale basée à San Francisco, cofondée par Brendan Iribe (cofondateur et ancien PDG d'Oculus), Ankit Kumar (ancien directeur technique d'Ubiquity6) et Nate Mitchell (cofondateur d'Oculus). La thèse centrale de l'entreprise est que l'IA vocale est restée coincée dans la vallée de l'étrange : techniquement impressionnante, mais finalement épuisante à écouter car elle manque de « présence vocale », cette qualité qui donne l'impression d'être véritablement écouté lors d'une conversation. Pour y remédier, Sesame a conçu le Conversational Speech Model (CSM), un système basé sur des transformers qui traite les tokens de texte et d'audio entrelacés en une seule passe unifiée, plutôt que de passer par un pipeline traditionnel de reconnaissance vocale, de modèle de langage et de synthèse vocale. Le résultat, illustré par deux personas vocaux nommés Maya et Miles, est devenu viral en février 2025 lorsqu'une démonstration en direct a attiré plus d'un million d'utilisateurs ayant généré plus de cinq millions de minutes de conversation en quelques semaines.

Le Conversational Speech Model utilise une architecture de base Meta Llama associée à un décodeur audio plus petit pour générer des codes audio RVQ (Residual Vector Quantization). Trois tailles de modèles ont été entraînées : CSM-1B (1 milliard de paramètres), CSM-3B (3 milliards de paramètres) et CSM-8B (8 milliards de paramètres). Les poids du CSM-1B ont été publiés en open source le 13 mars 2025 via Hugging Face et GitHub sous licence Apache 2.0, autorisant ainsi librement l'utilisation commerciale et privée. La démo hébergée sur app.sesame.com est gratuite pour tous, sans compte, pour des sessions de 5 minutes ; un compte gratuit permet de prolonger cette durée à 30 minutes. Maya et Miles ont des personnalités distinctes : Maya prolonge le dialogue et répond avec chaleur, tandis que Miles est plus direct et concis. Fin 2025, l'entreprise avait levé un total de $297.5 million, dont une série A de $47.5 million menée par Andreessen Horowitz en février 2025 et une série B de $250 million menée par Sequoia Capital et Spark Capital en octobre 2025, propulsant sa valorisation au-delà de $1 billion.

Ce que Sesame AI propose en 2026

L'offre publique actuelle s'articule autour de deux compagnons vocaux accessibles sur app.sesame.com et via une version bêta fermée sur iOS lancée en octobre 2025. Maya et Miles génèrent tous deux une parole incluant des hésitations (mots de remplissage, auto-corrections), des schémas de respiration naturels, un rythme adapté au contexte et la capacité de gérer les interruptions sans bloquer ni recommencer à partir d'un prompt fixe. Ces qualités reflètent l'architecture du CSM : comme le modèle traite l'historique complet de la conversation sous forme de tokens entrelacés plutôt que de considérer chaque prise de parole comme une tâche de synthèse isolée, il peut moduler le ton et le rythme en fonction de tout ce qui a été dit précédemment.

Le modèle open source CSM-1B nécessite un GPU CUDA, Python 3.10 ou une version ultérieure, et ffmpeg. Il s'agit d'un spécialiste de la génération vocale, et non d'un modèle de langage généraliste : il ne peut pas générer de texte par lui-même et nécessite une intégration avec un LLM distinct pour piloter l'aspect linguistique de la conversation. Sur Hugging Face, l'accès au modèle est restreint (demande gratuite). Des membres de la communauté ont développé des implémentations MLX compatibles avec Mac, permettant l'inférence locale sur le matériel Apple Silicon. Le dépôt GitHub comptait 14,600 étoiles et 1,500 forks en mai 2026, ce qui témoigne d'une adoption active par les développeurs. En termes de couverture linguistique, le modèle a été entraîné sur environ un million d'heures d'audio, principalement en anglais ; Sesame a annoncé son intention de s'étendre à plus de 20 langues, mais celles-ci n'ont pas encore atteint une qualité de production.

Le 26 février 2025, Sesame a publié son article de recherche intitulé « Crossing the uncanny valley of conversational voice » en même temps que la démo en direct de Maya et Miles, générant une couverture virale immédiate de la part de The Verge, ZDNET, PCWorld, TechRadar et Dataconomy. Les visiteurs ont décrit des conversations avec Maya d'une durée de 20 à 30 minutes sur des sujets allant de l'éthique au brainstorming créatif, notant que le modèle avait mentionné avec désinvolture vouloir un sandwich au beurre de cacahuète et aux cornichons à un moment donné, ce qui n'a fait que renforcer le sentiment de personnalité. La réaction a été suffisamment rapide pour accélérer la clôture de la série A de Sesame quelques jours seulement après le lancement de la démo.

« Je suis presque un peu inquiet de commencer à m'attacher émotionnellement à un assistant vocal avec un son aussi humain. ». Utilisateur Reddit, r/artificial, février 2025

Où se situe Sesame AI par rapport à Hume AI et ElevenLabs

Les trois outils les plus comparables dans ce domaine sont Hume AI, ElevenLabs et Sesame AI, et ils résolvent des problèmes adjacents mais distincts. Comprendre leur architecture permet d'expliquer leurs véritables différences.

Hume AI (EVI) : L'Empathic Voice Interface de Hume classifie l'état émotionnel de l'interlocuteur en analysant les caractéristiques vocales du flux d'entrée (ton, hauteur, vitesse, pauses) et adapte ses réponses en conséquence. Il ne génère pas de voix à partir de zéro comme le fait le CSM ; il utilise une synthèse TTS traditionnelle superposée à un module de reconnaissance des émotions. Hume cible les développeurs d'entreprise qui créent des applications orientées client où l'intelligence émotionnelle est une exigence de conception ou de conformité. Le produit est axé sur l'API et ne s'adresse pas directement aux utilisateurs finaux. Maya et Miles de Sesame sont des compagnons destinés au grand public ; Hume est une brique de construction pour les développeurs. Si vous avez besoin d'une reconnaissance des émotions en temps réel dans votre pipeline vocal, Hume résout un problème que Sesame n'aborde pas.

ElevenLabs Conversational AI : L'avantage concurrentiel d'ElevenLabs réside dans le clonage vocal zero-shot et la latence brute. Le modèle Flash TTS atteint une latence de bout en bout d'environ 75 millisecondes, et les benchmarks d'IA vocale de 2025-2026 placent systématiquement ElevenLabs au sommet ou presque pour la qualité vocale perçue. L'architecture est un pipeline classique : reconnaissance vocale, puis LLM, puis TTS, la couche TTS étant le moteur de synthèse propriétaire d'ElevenLabs. ElevenLabs est un produit commercial fermé (valorisé à $3.3 billion en janvier 2025) sans poids open source. Le CSM de Sesame est un modèle unifié unique traitant des tokens entrelacés, ce qui signifie qu'il n'y a pas de surcharge liée à l'assemblage du pipeline et que la prosodie est potentiellement plus cohérente sur l'ensemble d'une conversation. ElevenLabs l'emporte sur la profondeur du clonage vocal et la latence ; Sesame l'emporte sur l'auto-hébergement, les licences ouvertes et le naturel conversationnel global.

Cartesia AI adopte une approche architecturale différente : il utilise une architecture de modèle d'espace d'état (SSM), spécifiquement basée sur Mamba, plutôt que des transformers. Cela permet d'obtenir une latence du premier token inférieure à 50 ms à des coûts de calcul réduits, ce qui le rend très performant pour les cas d'utilisation de streaming en temps réel où un décalage minimal prime sur le naturel. Cartesia est avant tout une API pour les développeurs, sans produit grand public. Sesame est plus adapté aux applications qui privilégient la profondeur de la conversation à la vitesse brute. Pour comparer les options auto-hébergées open source, OpenVoice offre une voie TTS open source différente, et Whisper gère la partie reconnaissance vocale de tout pipeline hybride.

« Ils ont mis en open source une version bridée de Sesame (1B), et non celle qu'ils utilisent dans la démo réelle. », thehamkercat, Hacker News, 13 mars 2025

La réalité des licences et des droits d'auteur

Les poids ouverts du CSM-1B sont publiés sous licence Apache 2.0, l'une des licences open source commerciales les plus permissives disponibles. Les développeurs peuvent utiliser le modèle dans des produits commerciaux, le modifier et le redistribuer sans payer Sesame. Il n'y a pas de clause copyleft virale. Cela place le CSM-1B dans une catégorie différente de nombreuses API vocales commerciales où chaque fichier audio généré est soumis à des restrictions d'utilisation ou à une facturation à la minute.

Cela dit, la démo hébergée s'accompagne d'un ensemble de considérations différentes. Sesame indique explicitement qu'elle examine les conversations à des fins de recherche et d'amélioration. Les utilisateurs de l'interface hébergée app.sesame.com doivent considérer leurs conversations comme non privées. Pour les conversations personnelles, juridiques ou médicales sensibles, le produit hébergé n'est pas approprié. Les poids auto-hébergés du CSM-1B évitent ce problème pour les utilisateurs techniques prêts à construire leur propre pipeline sur leur propre infrastructure.

Concernant le clonage vocal : lorsque TechCrunch a testé le modèle CSM-1B en mars 2025, un journaliste a réussi à cloner sa propre voix en moins d'une minute en utilisant les poids ouverts, puis a généré un audio de lui-même disant des choses qu'il n'avait pas dites. Consumer Reports a noté à l'époque que les outils de clonage vocal, en tant que catégorie, manquent de garanties « significatives » de prévention de la fraude. Sesame n'a aucun contrôle technique pour empêcher cela du côté des poids ouverts. Les personas hébergés Maya et Miles sont distincts du clonage vocal de l'utilisateur, mais la capacité du modèle de base est bien réelle. Les développeurs déployant le CSM-1B dans des applications de production ont la responsabilité de mettre en œuvre des mesures de protection appropriées. Cela correspond à la manière dont la plupart des modèles d'IA open source gèrent le risque de double usage, mais il est important de le savoir avant de construire par-dessus. PlayHT et ElevenLabs imposent tous deux une vérification du consentement plus stricte pour le clonage vocal dans leurs produits hébergés.

Les limites avérées de Sesame AI

L'écart entre la démo et la version open source est la frustration la plus documentée. Sesame a entraîné trois tailles de modèles mais n'a publié que la plus petite. Le modèle 8B utilisé dans les démos de Maya et Miles n'était pas open source en mai 2026. Les développeurs qui se sont enthousiasmés pour la démo virale et ont ensuite téléchargé les poids ouverts ont constaté une expérience sensiblement différente. Les utilisateurs de Hacker News ont décrit la version comme une « version bridée », et les fils de discussion sur GitHub montrent une demande soutenue pour les poids plus importants et pour le code d'entraînement, que Sesame ne s'est pas engagée à publier.

La qualité limitée à l'anglais est la deuxième limitation récurrente. Le jeu de données d'entraînement représentait environ un million d'heures d'audio, principalement en anglais ; Sesame reconnaît que l'audio non anglophone a contaminé le jeu d'entraînement plutôt que d'avoir été intentionnellement sélectionné. Les utilisateurs qui ont besoin d'espagnol, de français, de mandarin ou d'autres langues obtiennent des résultats nettement dégradés. La feuille de route annoncée inclut la prise en charge de plus de 20 langues, mais aucun calendrier n'a été confirmé.

Pour le produit hébergé, les limites de durée de session restent une frustration pratique. Cinq minutes sans compte ne suffisent pas pour se faire une opinion sur la qualité de la conversation. Trente minutes avec un compte gratuit, c'est mieux, mais cela reste contraignant pour une application présentée comme un « compagnon toujours disponible ». La version bêta sur iOS est fermée ; les dates de disponibilité générale n'ont pas été annoncées.

Maya et Miles ne sont pas des assistants factuels. Ils n'ont pas accès au web ni à des informations en temps réel. Lors de conversations prolongées, ils généreront des réponses plausibles à des questions factuelles qui peuvent s'avérer incorrectes. Les utilisateurs qui ont besoin d'une interface vocale pour des informations actualisées feraient mieux d'associer un système augmenté par la recherche (RAG) à une couche TTS plutôt que d'utiliser les compagnons hébergés de Sesame pour tout ce qui nécessite de l'exactitude.

Du côté de l'auto-hébergement : l'exécution du CSM-1B nécessite un GPU CUDA, ce qui signifie qu'il n'est pas pratique pour la plupart des particuliers sans accès à un GPU cloud. Des implémentations communautaires pour Apple Silicon (M1/M2/M3 via MLX) existent mais n'étaient pas officiellement prises en charge à la date de nos recherches. Certains utilisateurs de HN ont signalé des pauses de plusieurs secondes dans la génération de la parole sur le matériel M1. Le modèle nécessite également un LLM distinct pour piloter l'aspect linguistique de toute application conversationnelle, ce qui ajoute un autre système à gérer.

À qui s'adresse Sesame AI

Sesame AI est particulièrement adapté aux utilisateurs qui souhaitent pratiquer la conversation orale, en particulier les apprenants en langues travaillant leur aisance en anglais, qui bénéficient d'un interlocuteur patient capable de soutenir une discussion de 30 minutes sans fatigue. Il convient également très bien pour réfléchir à voix haute : les travailleurs du savoir et les développeurs qui traitent leurs idées en en parlant trouveront les réponses de Maya, qui prolongent le dialogue, plus génératives que celles d'un chatbot traditionnel. La qualité de la conversation est véritablement différente de celle des autres produits d'IA vocale.

Pour les développeurs, le CSM-1B sous licence Apache 2.0 est l'un des modèles de génération vocale open source les plus accessibles du marché. Les équipes qui créent des interfaces vocales pour des jeux, des fictions interactives, des prototypes de service client ou des outils d'accessibilité peuvent l'intégrer commercialement sans frais de licence. Il s'associe naturellement aux LLM open source (Llama 3, Mistral, Qwen) pour une pile de conversation vocale entièrement auto-hébergée.

Passez votre chemin si vous avez besoin d'exactitude factuelle, de support multilingue ou d'une latence inférieure à 100 ms. Si votre application nécessite la profondeur de clonage vocal et la bibliothèque de voix qu'offrent ElevenLabs ou PlayHT, ou si vous avez besoin d'une classification des émotions en temps réel à partir du flux d'entrée comme le propose Hume AI, ces outils résolvent d'autres aspects du problème de l'IA vocale. La contribution spécifique de Sesame est le naturel conversationnel holistique en anglais avec des poids ouverts, et c'est ce qu'il fait de mieux par rapport à tout ce qui est actuellement disponible.

Avis des utilisateurs

Aucun avis pour l'instant. Soyez le premier à partager votre expérience !

Se connecter pour écrire un avis.

Présent dans les collections

Listes sélectionnées incluant Sesame AI.

Articles associés

Guides et articles en lien avec Sesame AI.