

Braintrust 是一个以评估为先(eval-first)的可观测性平台,专为交付 LLM 产品的团队打造,将追踪、数据集、评分器和 CI/CD 质量门禁整合到一个工作流中。它被 OpenAI、Stripe 和 Notion 所采用,属于优质的专有软件,从免费版到付费版的跨度较大。
Braintrust 是一个闭源的端到端评估与可观测性平台,专为构建 LLM 驱动产品的团队而设计。其核心理念非常直接:如果没有系统的测量,你根本无法判断 AI 功能是在变好还是变坏,而传统的软件测试并不适用于概率性输出。该公司由 Ankur Goyal 在旧金山创立(他之前的公司 Impira 被 Figma 收购),它为工程团队提供了一个结构化的闭环:捕获追踪记录,使用评分器定义“优秀”的标准,针对版本化数据集运行实验,并基于质量对发布进行门禁控制。对于一个新兴领域来说,其客户阵容异常强大,包括 OpenAI、Stripe、Notion、Vercel、Airtable 和 Zapier,这发出了一个最清晰的信号:以评估为先的方法引起了专业团队的强烈共鸣。
该平台将 Brainstore(公司称其在查询追踪数据时速度显著更快的专有数据库)上的日志记录和追踪,与评估框架、版本化数据集、提示词游乐场(prompt playground)以及涵盖 LLM-as-judge、代码和人工审查的自动化评分器结合在一起。当评分下降时,CI/CD 质量门禁可以阻止部署;Topics 会自动从生产流量中找出故障集群;而 2025 年 11 月推出的产品内 AI 代理 Loop,则能用自然语言分析追踪记录,并提出评估数据集和评分器建议。其 SDK 涵盖 Python、TypeScript、Go、Ruby 和 C#,开源的 autoevals 库可独立运行。此外,该公司在 2026 年 2 月以 $800 million 的估值完成了 $80 million 的 B 轮融资。
Braintrust 在 2026 年 6 月能为 AI 团队做什么
其重心在于评估(eval),而非追踪(trace)。大多数可观测性工具从生产日志开始,然后附加评估功能,而 Braintrust 则是从实验工作流向外构建。正因如此,它非常适合那些将质量视为需要测量和强制执行的指标,而不仅仅是观察对象的团队。
"我以前从未见过像这样将评估纳入主流工程流程的工作流变革。" Malte Ubl,Vercel 工程团队,2024 年 10 月。
在实践中,这意味着你要对应用进行插桩,将真实的对话提取到数据集中,定义评分器,并运行实验以生成具有统计学意义的并排差异对比。GitHub Actions 集成会在每个拉取请求上运行这些评估,并将结果作为评论发布,因此只有在达到质量标准时,提示词的更改才会被发布。2026 年 6 月全面上市的 Topics 无需手动标记即可发现故障模式;而 2025 年 11 月 24 日推出的 Loop 代理,则能将“本周幻觉是否增加了”这样的问题转化为实际的分析并提出修复建议。2026 年 2 月由 ICONIQ 领投,Andreessen Horowitz 和 Greylock 跟投的 $80 million B 轮融资,为这一切背后的路线图提供了资金支持。
Braintrust 与 Langfuse 和 Arize Phoenix 的对比
与 Langfuse 相比,两者的分歧在于理念和许可。Langfuse 以追踪为先,在 MIT 许可下完全开源,任何人都可以自托管,并于 2026 年 1 月被 ClickHouse 收购;而 Braintrust 以评估为先,基于其专有的 Brainstore 引擎闭源,没有免费的自托管版本。想要开源自由的团队会从 Langfuse 开始;想要最深度的原生评分和实验工具的团队会从 Braintrust 开始。与 Arize Phoenix 相比,两者的对比在于发现与执行。Phoenix 是原生支持 OpenTelemetry 的,可免费自托管,并继承了 Arize 监控根基中对机器学习漂移(ML-drift)的广泛覆盖,这使其在发现生产环境中的问题方面非常强大。而 Braintrust 在系统性修复问题方面更强,拥有更成熟的 CI/CD 门禁和数据集工作流。一个有用的简写是:Phoenix 暴露问题,Braintrust 闭环解决问题。
以评估为先的工作流成本如何
Braintrust 提供真正免费的 Starter 计划,支持无限用户,每月 1 GB 处理数据和 10,000 次评分,数据保留 14 天。付费版的跨度很大:Pro 计划每月固定收费 $249,同样支持无限用户,包含的数据量提升至 5 GB,评分次数提升至 50,000 次,数据保留 30 天,外加 RBAC 和优先支持。Enterprise 计划增加了自定义数据保留期限、混合或本地部署、以及高级 SLA。
"评估是系统化 AI 工程的核心。" Ankur Goyal,Braintrust 创始人,2024 年 10 月。
真正的问题在于使用模式。在固定费用之上,数据摄取和评分是按单位计费的,而每次运行都会生成大量跨度和评分的代理工作负载可能会迅速累积超额费用,超出 Pro 计划额度的 450,000 次评分将使账单增加约 $675。此外,在免费版和 $249 之间没有中间层,这使得小团队的升级显得非常突兀。
Braintrust 让团队感到沮丧的地方
最常见的抱怨集中在成本和支持上。在注册之前很难对定价进行建模,因为它混合了固定费用、按 GB 计费和按评分计费,而且从免费版直接跃升到 $249 且中间没有任何过渡,这让小团队措手不及。支持质量在第三方评论中屡遭批评,响应缓慢被描述为一种系统性模式,而非孤立事件,这对于一家在大约一年内增长到 165 人的公司来说很典型。追踪 UI 针对评分和实验进行了优化,而不是针对原始的生产环境调试,因此在包含 2,000 个跨度的代理运行中定位根本原因,比使用专用的追踪工具需要更多的导航操作。在企业级计划以下没有自托管选项,这对于预算有限或受数据驻留要求限制的团队来说是一个硬性障碍。此外,由于评估是事后进行的,Braintrust 不提供实时护栏来在不安全响应到达用户之前对其进行拦截。
Braintrust 适合谁,谁又该另寻他选
Braintrust 非常适合希望将评估接入 CI/CD 的工程团队,适合构建以评估为先的文化而非进行临时提示词测试的组织,适合能够接受每月 $249 费用的团队,以及任何基于任意 LLM 提供商进行构建而不希望被锁定在单一框架中的开发者。与框架无关的 SDK 和 GitHub 原生门禁是其主要吸引力。
对于主要需要实时护栏或内容过滤的团队来说,它并不适合,因为 Braintrust 是事后评估的;对于需要在企业合同以下提供自托管的受监管团队来说,它也不适合。如果组织在运行 LLM 的同时还运行传统机器学习(ML),并希望进行统一监控,那么 Arize 或 Weights and Biases 会是更好的选择。对于无法承担 $249 费用,且在代理工作负载上会很快耗尽免费额度的独立开发者和小团队,应该考虑像 Opik 或 Langfuse 这样的开源选项。
用户评价
暂无评价,快来分享你的第一条体验吧!
登录 后即可撰写评价。
相关文章
与 Braintrust 相关的指南和文章。

AI User Testing in 2026: The Tools That Test Your Product While You Sleep

Replit Pricing Explained (2026): Core vs Pro and Effort-Based Agent Billing

Grok 4.3 API for Agents (May 2026): Pricing, Benchmarks, Migration

The Personal AI Productivity Stack (2026): One Tool Per Job, Nothing Extra

Run a Company With AI Agents: The Open-Source Orchestration Setup (2026)
