

Letta 是由加州大学伯克利分校(UC Berkeley)MemGPT 研究团队推出的开源智能体框架。它采用受操作系统启发的三层架构,赋予 AI 智能体持久且可自我编辑的记忆能力。基于 Apache 2.0 协议开源,并提供云端托管 API 选项。
Letta 是一个用于构建有状态 AI 智能体的开源平台,这意味着智能体能够在不同会话中记忆、学习和适应,而不是在每次对话时都重置为零。它由来自 Sky Computing Lab 的伯克利博士研究员 Charles Packer 和 Sarah Wooders 创立,源于 2023 年 10 月首次发布的 MemGPT 研究项目。其背后的公司 Letta AI, Inc. 于 2024 年 9 月 23 日走出隐匿模式,宣布获得由 Felicis 领投的 1000 万美元种子轮融资,据报道估值达到 7000 万美元。知名天使投资人包括 Jeff Dean(Google DeepMind 首席科学家)、Clem Delangue(HuggingFace 首席执行官)和 Robert Nishihara(Anyscale 联合创始人)。其 Apache 2.0 开源仓库已积累了超过 22,400 颗 GitHub 星星,并于 2026 年 3 月发布了 v0.6.7 版本。
该框架的核心创新是受操作系统启发的三层记忆模型:核心记忆(core memory,在 LLM 上下文窗口中始终处于活跃状态,类似于 RAM)、归档记忆(archival memory,用于长期冷存储的可搜索向量库,类似于磁盘)和回溯记忆(recall memory,已建立索引的对话历史)。智能体不会被动接收注入的上下文;它们在推理循环中调用记忆管理函数,在不同层级之间移动信息。这种自主导向的记忆编辑是 Letta 区别于 LangChain 记忆模块等外挂式记忆层的决定性架构特征。其旗舰产品 Letta Code 将此架构应用于编程智能体,在 Terminal-Bench 上的模型无关开源智能体中排名第一。该平台支持 Python 和 TypeScript SDK、REST API、用于调试的基于 Web 的智能体开发环境(Agent Development Environment),以及云端托管和完全自托管部署。
Letta 在 2026 年 4 月的实际功能
Letta 提供了两款基于相同底层框架构建的独立产品。第一款是 Letta API,这是一个用于大规模部署和管理持久化智能体的服务端平台。开发者可以通过编程方式构建智能体、附加记忆块、连接工具,并通过 REST 查询智能体。智能体为不同的知识领域维护独立的核心记忆块,每个记忆块在运行期间均可由智能体进行编辑。归档记忆存储了可通过语义查询访问的可搜索历史记录,因此,部署了数月的智能体可以从其最早的交互中检索事实,而无需让这些事实永久占据上下文窗口。
第二款产品是 Letta Code,这是一款以记忆为优先的编程智能体,以桌面应用、CLI 工具和 SDK 的形式发布。它使用您自己的 API 密钥或现有的模型订阅在本地运行。Letta Code 在每次对话中跟踪项目规范、架构决策和过去的调试会话,构建随代码库演进的特定项目记忆。2026 年 1 月新增的 Conversations API 实现了跨多个用户并行体验的共享智能体记忆,允许多人与同一个智能体交互,同时保持连贯的跨用户上下文。2026 年 3 月,Remote Environments 实现了通过 letta server 命令跨设备访问智能体。
MemGPT 论文(arXiv:2310.08560,2023 年 10 月)正式确立了“LLM 即操作系统”(LLM-as-Operating-System)的范式。它在两年内获得了 154+ 次学术引用,并引入了该领域目前使用的架构词汇:将上下文窗口视为 RAM,将外部存储视为磁盘,以及中断驱动的记忆管理。通过 Letta 的品牌重塑和公司成立,该论文的影响力直接从学术界走向了商业化。
"你强调的无状态与有状态的区别是关键的决策点。从一开始就选择符合你用例的范式。" - Ezra,Letta 支持主管,Letta Developer Community 论坛,2025
Letta 与 LangGraph 和 Mem0 的定位对比
LangGraph 和 Letta 解决的是相邻但不同的问题。LangGraph 将智能体工作流建模为有向图:节点是智能体或函数,边定义条件路由,共享状态对象贯穿整个执行序列。其突出的持久化功能是在每次状态转换时进行检查点记录(checkpointing),这使得时间旅行调试、人在回路(human-in-the-loop)审批和执行中途的故障恢复成为可能。LangGraph 的记忆是基于状态的,这意味着它随执行而流动;Letta 的记忆是基于存储的,这意味着它独立于任何单一的执行周期而存在。当您的问题是具有许多分支和明确审批节点的复杂条件工作流时,LangGraph 是更好的选择。当问题是一个需要运行数月以积累和演进知识的长期智能体时,Letta 则是更好的选择。这两个框架并非严格的竞争关系;运行 LangGraph 的团队通常会单独集成 Letta 风格的记忆原语,尽管这样做需要自定义桥接代码。LangChain 的 LangMem SDK(于 2025 年初发布)为 LangGraph 添加了情景、语义和程序记忆类型,但这些是模块化的附加组件,而不是执行循环的原生部分,并且它们不提供作为 Letta 核心贡献的智能体自我编辑机制。
Mem0 是在特定记忆维度上最直接的竞争对手。它作为一个独立的记忆服务运行,提供双调用 API:add() 存储对话或文档输入,search() 通过语义相似度进行检索。关键的架构差异在于能动性:Mem0 被动地从您输入的内容中提取记忆;Letta 智能体在推理过程中通过自行调用记忆函数,主动决定要记住什么。这意味着 Mem0 的记忆质量受限于其提取管道,而 Letta 的记忆质量受限于智能体的推理质量(以及模型能力)。Mem0 大约需要十分钟即可集成到现有的智能体循环中;Letta 则需要采用整个平台。在 LongMemEval 基准测试中,独立测试显示 Letta 的准确率约为 83.2%,而 Mem0 为 49.0%,在长周期检索任务上存在巨大差距。Mem0 的切换成本很低,只需替换几个 API 调用;Letta 的切换成本很高,对于中等复杂度的项目,实际需要两到六周的时间来重建智能体循环、工具执行和状态管理。对于构建 CrewAI 或其他框架原生工作流且只需要“记住用户”的团队来说,Mem0 狭窄的 API 表面是实用的选择。对于核心产品是智能体不断演进的记忆和行为的团队来说,Letta 的架构是这种深度级别上唯一的生产级选项。
"Letta 尚未准备好用于关键任务应用的生产环境。其有效性在很大程度上取决于底层 LLM 的能力。" - Calvin Ku,Medium (Asymptotic Spaghetti Integration),2025
智能体循环的实际运作方式
部署 Letta 智能体遵循一致的工作流。您使用初始人设和人类记忆块实例化一个智能体。当智能体与用户交互时,它会调用记忆工具实时更新其核心记忆,将长内容移动到归档存储中,并通过语义搜索检索相关的过去上下文。这发生在每个对话轮次中,而不是作为后台任务。智能体是其自身记忆的作者,而不是外部提取过程的被动受益者。这既是该架构的优势,也是其成本结构所在:每次记忆操作都会消耗 LLM token,打破提示词缓存(prompt caching)并增加延迟。
Agent Development Environment 提供了一个可视化调试器,实时显示记忆状态、工具调用和推理轨迹,与原始 API 内省相比,这极大地减少了调试时间。该平台还支持多智能体配置,多个专用智能体可以共享一个公共记忆块,这对于需要跨会话连续性的研究助手、企业知识管理或客户支持系统非常有用。
编程变体 Letta Code 增加了特定于项目的记忆管理。像 /init 和 /remember 这样的命令允许开发者明确地教导智能体关于代码库的事实。在会话之间,记忆压缩(memory compaction)会运行后台整合,以防止上下文窗口膨胀。该平台在 Terminal-Bench 上的模型无关开源编程智能体中排名第一,尽管它竞争的类别比 LlamaIndex 数据管道或 DSPy 程序优化更窄,后两者解决的是智能体技术栈的不同层级问题。
Letta 专为谁打造
Letta 专为构建智能体的机器学习工程师和后端开发者设计,在这些智能体中,持久的身份和不断演进的记忆是产品级功能,而不仅仅是实现细节。典型用户正在构建一个需要记住六个月论文摘要的研究助手、一个应该回忆起与每个用户过去所有互动的客户支持智能体,或者一个适应团队特定规范和错误历史的编程助手。在这些用例中,记忆本身就是产品,而不是偶然的会话状态。该框架会回报那些愿意致力于其架构的团队:Letta 处理智能体循环、工具执行、记忆路由和持久层,作为交换,它端到端地接管这些组件。
探索智能体认知的研究人员和学者会发现该架构特别清晰易懂。三层模型直接映射到经典的操作系统内存管理,ADE 提供可见的推理轨迹,而 Apache 2.0 许可证意味着可以完全访问以修改和研究其内部机制。Codecademy 的“Intro to AI Agents with Letta”课程表明其在教育环境中的采用率正在增长。已经在使用 Pydantic AI 或其他类型化 Python 框架的团队会欣赏 Letta 优先支持 Python 的 SDK 设计,尽管它也为 Web 原生团队提供了 TypeScript 支持。
Letta 不是什么
Letta 不是一个即插即用的记忆模块。您无法在一个下午将 Letta 的记忆添加到现有的 LangGraph 或 AutoGen 工作流中;您要么采用整个平台,要么不采用。拥有成熟智能体架构的团队面临两到六周的重构迁移时间,这种成本是真实存在的。如果您不确定您的用例是否需要长周期的记忆连续性,请不要从 Letta 开始;Mem0 更窄的 API 是进行此类评估的低风险起点。
对于非 OpenAI 模型提供商,Letta 尚未成熟。GitHub issues 和论坛帖子记录了通过 Ollama 或 LiteLLM 使用本地模型时高达 90%+ 的错误率。配置工具提供了一组狭窄的默认模型包装器,且没有为新模型提供明显的集成路径。这在最近的版本中有所改善,但对于致力于完全本地化或开放权重部署的团队来说,问题仍未解决。如果您的技术栈以 Ollama 为主,请做好应对摩擦和调试时间的准备,官方文档并未对此提供充分的预警。
Letta 不是一个完整的数据管道或 RAG 框架。对于大规模的文档摄取、分块、嵌入和检索,LlamaIndex 仍然是更完整的解决方案。Letta 的归档记忆涵盖了检索层,但不包括预处理管道。构建重度依赖文档的应用的团队通常使用 Letta 作为智能体记忆,并使用专用的检索库进行文档搜索。
用户评价
暂无评价,快来分享你的第一条体验吧!
登录 后即可撰写评价。
收录于精选合集
包含 Letta 的精选合集。
相关文章
与 Letta 相关的指南和文章。

Turn Any AI Agent Into a Superagent: The 12-Integration Stack (2026)

Run a Company With AI Agents: The Open-Source Orchestration Setup (2026)

Claude Code vs Cursor vs Codex vs Devin vs Replit Agent 3: 2026 Scorecard

How AI Agents Work: Architecture & Implementation Guide (2025)

Claude Code Dreaming (Memory Consolidation): 2026 Setup Guide
