

Letta est le framework d'agents open source de l'équipe de recherche MemGPT de l'UC Berkeley. Il dote les agents IA d'une mémoire persistante et auto-éditable grâce à une architecture à trois niveaux inspirée des systèmes d'exploitation. Sous licence Apache 2.0 avec une option d'API hébergée dans le cloud.
Letta est une plateforme open source permettant de créer des agents IA avec état (stateful), c'est-à-dire des agents capables de se souvenir, d'apprendre et de s'adapter d'une session à l'autre au lieu de repartir de zéro à chaque conversation. Elle a été créée par Charles Packer et Sarah Wooders, chercheurs doctorants à Berkeley au sein du Sky Computing Lab, et est issue du projet de recherche MemGPT publié pour la première fois en octobre 2023. L'entreprise, Letta AI, Inc., est sortie de la furtivité le 23 septembre 2024 avec une levée de fonds d'amorçage de 10 millions de dollars menée par Felicis, pour une valorisation annoncée de 70 millions de dollars. Parmi les business angels notables figurent Jeff Dean (Chief Scientist chez Google DeepMind), Clem Delangue (PDG de HuggingFace) et Robert Nishihara (co-fondateur d'Anyscale). Le dépôt Apache 2.0 a accumulé plus de 22 400 étoiles sur GitHub et a atteint sa version v0.6.7 en mars 2026.
L'innovation principale du framework réside dans son modèle de mémoire à trois niveaux inspiré des systèmes d'exploitation : la mémoire centrale (toujours active dans la fenêtre de contexte du LLM, comme la RAM), la mémoire d'archivage (une base de données vectorielle interrogeable pour le stockage à froid à long terme, comme un disque dur) et la mémoire de rappel (l'historique indexé des conversations). Les agents ne reçoivent pas passivement un contexte injecté ; ils appellent des fonctions de gestion de la mémoire pendant leurs boucles de raisonnement pour déplacer les informations entre les niveaux. Cette édition autonome de la mémoire est la caractéristique architecturale déterminante qui distingue Letta des couches de mémoire ajoutées a posteriori, comme les modules de mémoire de LangChain. Le produit phare, Letta Code, applique cette architecture aux agents de codage, obtenant la première place parmi les agents open source agnostiques en matière de modèles sur Terminal-Bench. La plateforme prend en charge les SDK Python et TypeScript, une API REST, un environnement de développement d'agents (ADE) basé sur le web pour le débogage, ainsi que des déploiements hébergés dans le cloud ou entièrement auto-hébergés.
Ce que fait réellement Letta en avril 2026
Letta propose deux produits distincts construits sur le même framework sous-jacent. Le premier est l'API Letta, une plateforme côté serveur pour déployer et gérer des agents persistants à grande échelle. Les développeurs créent des agents de manière programmatique, y attachent des blocs de mémoire, connectent des outils et interrogent les agents via REST. Les agents conservent des blocs de mémoire centrale distincts pour différents domaines de connaissances, chaque bloc étant modifiable par l'agent pendant son fonctionnement. La mémoire d'archivage stocke un historique interrogeable accessible via des requêtes sémantiques, de sorte qu'un agent déployé depuis des mois peut récupérer des faits de ses toutes premières interactions sans que ces faits n'occupent en permanence la fenêtre de contexte.
Le deuxième produit est Letta Code, l'agent de codage axé sur la mémoire, disponible sous forme d'application de bureau, d'outil CLI et de SDK. Il s'exécute localement en utilisant vos propres clés d'API ou vos abonnements aux modèles existants. Letta Code suit les conventions du projet, les décisions architecturales et les sessions de débogage passées à travers chaque conversation, construisant ainsi une mémoire spécifique au projet qui évolue avec la base de code. Une API Conversations ajoutée en janvier 2026 permet de partager la mémoire de l'agent à travers des expériences parallèles avec plusieurs utilisateurs, autorisant plusieurs personnes à interagir avec le même agent tout en maintenant un contexte inter-utilisateurs cohérent. En mars 2026, les Remote Environments (environnements distants) ont permis l'accès aux agents sur plusieurs appareils via la commande letta server.
L'article de recherche MemGPT (arXiv:2310.08560, octobre 2023) a formellement établi le paradigme du LLM en tant que système d'exploitation. Il a recueilli plus de 154 citations académiques en deux ans et a introduit le vocabulaire architectural que le domaine utilise aujourd'hui : la fenêtre de contexte comme RAM, le stockage externe comme disque dur, et la gestion de la mémoire pilotée par les interruptions. L'impact de l'article est passé du monde académique au monde commercial directement grâce au changement de nom pour Letta et à la création de l'entreprise.
"La distinction entre sans état (stateless) et avec état (stateful) que vous avez soulignée est le point de décision critique. Choisissez dès le départ le paradigme qui correspond à votre cas d'usage." - Ezra, responsable du support Letta, forum de la Letta Developer Community, 2025
Où se situe Letta par rapport à LangGraph et Mem0
LangGraph et Letta résolvent des problèmes adjacents mais distincts. LangGraph modélise les workflows d'agents sous forme de graphes orientés : les nœuds sont des agents ou des fonctions, les arêtes définissent le routage conditionnel, et un objet d'état partagé circule tout au long de la séquence d'exécution. Sa fonctionnalité de persistance phare est la création de points de contrôle (checkpointing) à chaque transition d'état, ce qui permet le débogage par voyage dans le temps, les approbations avec intervention humaine (human-in-the-loop) et la récupération en cas d'échec en cours d'exécution. La mémoire de LangGraph est basée sur l'état, ce qui signifie qu'elle voyage avec l'exécution ; la mémoire de Letta est basée sur le stockage, ce qui signifie qu'elle existe indépendamment de tout cycle d'exécution unique. LangGraph est plus adapté lorsque votre problème est un workflow conditionnel complexe avec de nombreuses branches et des portes d'approbation explicites. Letta est plus adapté lorsque le problème est un agent à exécution longue qui doit accumuler et faire évoluer ses connaissances sur des mois de fonctionnement. Les deux frameworks ne sont pas strictement concurrents ; les équipes utilisant LangGraph intègrent souvent des primitives de mémoire de type Letta séparément, bien que cela nécessite un code de liaison personnalisé. Le SDK LangMem de LangChain (sorti début 2025) ajoute des types de mémoire épisodique, sémantique et procédurale à LangGraph, mais il s'agit d'ajouts modulaires plutôt que natifs à la boucle d'exécution, et ils ne fournissent pas la mécanique d'auto-édition par l'agent qui constitue la contribution fondamentale de Letta.
Mem0 est le concurrent le plus direct sur l'axe spécifique de la mémoire. Il fonctionne comme un service de mémoire autonome avec une API à deux appels : add() stocke les entrées de conversation ou de document, search() les récupère par similarité sémantique. La différence architecturale critique est l'agentivité : Mem0 extrait passivement les souvenirs de ce que vous lui fournissez ; les agents Letta décident activement de ce dont ils doivent se souvenir en appelant eux-mêmes des fonctions de mémoire pendant leur raisonnement. Cela signifie que la qualité de la mémoire de Mem0 est limitée par son pipeline d'extraction, tandis que celle de Letta est limitée par la qualité de raisonnement de l'agent (et les capacités du modèle). Mem0 prend environ dix minutes à intégrer dans une boucle d'agent existante ; Letta nécessite l'adoption de la plateforme complète. Sur le benchmark LongMemEval, des tests indépendants placent Letta à une précision d'environ 83,2 % contre 49,0 % pour Mem0, un écart substantiel sur les tâches de récupération à long terme. Le coût de changement de Mem0 est faible, remplaçant quelques appels d'API ; le coût de changement de Letta est élevé, nécessitant de manière réaliste deux à six semaines pour reconstruire la boucle de l'agent, l'exécution des outils et la gestion de l'état pour un projet de complexité moyenne. Pour les équipes construisant des workflows natifs avec CrewAI ou d'autres frameworks qui ont juste besoin de "se souvenir de l'utilisateur", la surface d'API étroite de Mem0 est le choix pratique. Pour les équipes dont le produit principal est la mémoire et le comportement évolutifs de l'agent, l'architecture de Letta est la seule option de production à ce niveau de profondeur.
"Letta n'est pas encore prêt pour la production dans le cadre d'applications critiques. Son efficacité dépend fortement des capacités du LLM sous-jacent." - Calvin Ku, Medium (Asymptotic Spaghetti Integration), 2025
À quoi ressemble la réalité de la boucle d'agent
Le déploiement d'un agent Letta suit un workflow cohérent. Vous instanciez un agent avec un persona initial et un bloc de mémoire humaine. Au fur et à mesure que l'agent interagit avec les utilisateurs, il appelle des outils de mémoire pour mettre à jour sa mémoire centrale en temps réel, déplacer le contenu long vers le stockage d'archivage et récupérer le contexte passé pertinent via une recherche sémantique. Cela se produit à chaque tour de conversation, et non comme une tâche en arrière-plan. L'agent est l'auteur de sa propre mémoire, et non le bénéficiaire passif d'un processus d'extraction externe. C'est à la fois la force de l'architecture et sa structure de coûts : chaque opération de mémoire consomme des tokens LLM, interrompant la mise en cache des prompts et ajoutant de la latence.
L'environnement de développement d'agents (ADE) fournit un débogueur visuel affichant l'état de la mémoire, les appels d'outils et les traces de raisonnement en temps réel, ce qui réduit considérablement le temps de débogage par rapport à l'introspection brute de l'API. La plateforme prend également en charge les configurations multi-agents où plusieurs agents spécialisés partagent un bloc de mémoire commun, ce qui est utile pour les assistants de recherche, la gestion des connaissances en entreprise ou les systèmes de support client nécessitant une continuité inter-sessions.
Letta Code, la variante dédiée au codage, ajoute une gestion de la mémoire spécifique au projet. Des commandes comme /init et /remember permettent aux développeurs d'enseigner explicitement à l'agent des faits sur la base de code. Entre les sessions, la compaction de la mémoire exécute une consolidation en arrière-plan pour éviter que la fenêtre de contexte ne gonfle. La plateforme se classe première sur Terminal-Bench parmi les agents de codage open source agnostiques en matière de modèles, bien qu'elle soit en concurrence dans une catégorie plus étroite que les pipelines de données de LlamaIndex ou l'optimisation de programmes de DSPy, qui résolvent tous deux des couches différentes de la pile d'agents.
À qui s'adresse Letta
Letta est conçu pour les ingénieurs ML et les développeurs backend qui créent des agents où l'identité persistante et la mémoire évolutive sont des fonctionnalités au niveau du produit, et non des détails d'implémentation. L'utilisateur typique construit un assistant de recherche qui doit se souvenir de six mois de résumés d'articles, un agent de support client qui doit se rappeler de chaque interaction passée avec chaque utilisateur, ou un assistant de codage qui s'adapte aux conventions spécifiques d'une équipe et à l'historique des bugs. Ce sont des cas d'usage où la mémoire est le produit, et non un état de session accessoire. Le framework récompense les équipes prêtes à s'engager dans son architecture : Letta gère la boucle de l'agent, l'exécution des outils, le routage de la mémoire et la couche de persistance en échange de la maîtrise de bout en bout de ces composants.
Les chercheurs et les universitaires explorant la cognition des agents trouveront l'architecture particulièrement lisible. Le modèle à trois niveaux correspond directement à la gestion classique de la mémoire des systèmes d'exploitation, l'ADE fournit des traces de raisonnement visibles, et la licence Apache 2.0 signifie un accès complet pour modifier et étudier les composants internes. Le cours "Intro to AI Agents with Letta" de Codecademy suggère une adoption croissante dans les contextes éducatifs. Les équipes utilisant déjà Pydantic AI ou d'autres frameworks Python typés apprécieront la conception du SDK de Letta axée sur Python, bien qu'une prise en charge de TypeScript existe pour les équipes orientées web.
Ce que Letta n'est pas
Letta n'est pas un module de mémoire prêt à l'emploi (plug-and-play). Vous ne pouvez pas ajouter la mémoire de Letta à un workflow LangGraph ou AutoGen existant en un après-midi ; vous adoptez la plateforme ou vous ne l'adoptez pas. Les équipes disposant d'architectures d'agents établies font face à deux à six semaines de refactorisation pour migrer, et ce coût est réel. Ne commencez pas avec Letta si vous n'êtes pas certain que votre cas d'usage nécessite une continuité de mémoire à long terme ; l'API plus étroite de Mem0 est le point de départ le moins risqué pour cette évaluation.
Letta n'est pas mature pour les fournisseurs de modèles autres qu'OpenAI. Les tickets GitHub et les fils de discussion sur les forums documentent des taux d'erreur de plus de 90 % lors de l'utilisation de modèles locaux via Ollama ou LiteLLM. Les outils de configuration suggèrent un ensemble restreint de wrappers de modèles par défaut, sans chemin évident pour les modèles plus récents. Cela s'est amélioré au fil des versions récentes, mais reste non résolu pour les équipes engagées dans des déploiements entièrement locaux ou à poids ouverts (open-weight). Si votre stack est principalement basée sur Ollama, attendez-vous à des frictions et à un temps de débogage auxquels la documentation ne vous prépare pas adéquatement.
Letta n'est pas un pipeline de données complet ni un framework RAG. Pour l'ingestion de documents, le découpage (chunking), l'intégration (embedding) et la récupération à grande échelle, LlamaIndex reste la solution la plus complète. La mémoire d'archivage de Letta couvre la couche de récupération mais pas le pipeline de prétraitement. Les équipes créant des applications riches en documents utilisent généralement Letta pour la mémoire de l'agent et une bibliothèque de récupération dédiée pour la recherche de documents.
Avis des utilisateurs
Aucun avis pour l'instant. Soyez le premier à partager votre expérience !
Se connecter pour écrire un avis.
Présent dans les collections
Listes sélectionnées incluant Letta.
Articles associés
Guides et articles en lien avec Letta.

Turn Any AI Agent Into a Superagent: The 12-Integration Stack (2026)

Run a Company With AI Agents: The Open-Source Orchestration Setup (2026)

Claude Code vs Cursor vs Codex vs Devin vs Replit Agent 3: 2026 Scorecard

How AI Agents Work: Architecture & Implementation Guide (2025)

Claude Code Dreaming (Memory Consolidation): 2026 Setup Guide
