

Weights & Biases 是超过一百万 AI 工程师使用的标准机器学习实验跟踪平台。它通过 W&B Models 涵盖模型训练工作流,并通过 W&B Weave 提供 LLM 可观测性,自 2025 年 5 月起归 CoreWeave 所有。
Weights & Biases (W&B) 是一个专为需要大规模跟踪、比较和重现机器学习实验的 ML 工程师和研究人员打造的 AI 开发者平台。该公司由 Lukas Biewald、Chris Van Pelt 和 Shawn Lewis 于 2017 年创立,现已发展成为定义该领域的实验跟踪工具,并随着 2024 年 W&B Weave 的推出扩展到 LLM 可观测性领域。2025 年 3 月,专注于 AI 的超大规模云服务商 CoreWeave 据报道以 $1.7B 的价格收购了 W&B。W&B 的品牌和产品线保持完整;Lukas Biewald 继续在 CoreWeave 旗下担任 W&B 的总经理,公司继续运营,并致力于多云、与基础设施无关的互操作性。
该平台分为两个主要产品。W&B Models 处理传统的 ML 生命周期:只需几行 Python 代码即可记录指标,在交互式仪表板中可视化运行情况,对模型工件进行版本控制,运行自动化的超参数扫描 (Sweeps),与利益相关者共享 Reports,并在 Model Registry 中注册生产就绪的检查点。W&B Weave 则涵盖了 GenAI 方面:追踪每一次 LLM 调用,使用可自定义的评分器评估输出,通过 Online Evaluations 实时监控生产环境中的代理,并通过在函数调用级别检查检索与生成来调试 RAG 管道。这两个产品共享一个帐户、一个 API 密钥和一个仪表板。
W&B 在 2026 年 5 月的实际功能
W&B Models 仍然是训练神经网络的团队的核心产品。您在训练运行开始时调用 wandb.init(),并使用 wandb.log() 推送指标。从那里,平台会自动捕获硬件利用率、损失曲线、样本输出和任意元数据。Sweeps 使用贝叶斯优化或网格搜索在数百种配置中运行超参数实验,并带有一个内置的协调器,可将工作分配给空闲代理。Model Registry 允许团队将特定的工件版本提升为“生产”或“暂存”状态,并具有追溯到原始运行的血缘跟踪功能。
于 2024 年 4 月 18 日推出的 W&B Weave 将这一范式扩展到了 LLM 应用程序。@weave.op 装饰器可包装任何 Python 函数,Weave 会捕获每次调用的输入、输出、Token 计数、延迟和成本。它自动修补常见的 LLM SDK(包括 OpenAI、Anthropic、Cohere、Groq、LangChain 和 LlamaIndex),因此只需一次 weave.init() 调用即可开始捕获追踪,而无需修改调用点。在 2025 年中收购后添加的 Online Evaluations 可在生产环境中对实时传入的追踪进行评分,以检测质量下降,而无需等待手动审查周期。该平台还在 2025 年 6 月添加了 W&B Inference,为由 CoreWeave 的 GPU 基础设施提供支持的开源模型(DeepSeek R1-0528、Llama 4 Scout、Phi 4 Mini)提供统一的端点。
“W&B 使我们能够将洞察力从一名研究人员扩展到整个团队。”—— Wojciech Zaremba,OpenAI 联合创始人(W&B 客户页面)
W&B 与 Comet ML 和 MLflow 的对比定位
最常见的三种比较是:在托管实验跟踪方面 W&B 与 Comet ML 的对比,以及在开源替代方案方面 W&B 与 MLflow 的对比。
Comet ML 是结构上最接近的同类产品。两者都需要代码插桩,都将运行记录到云仪表板,并且都提供团队协作。机制上的差异对采用决策很重要。Comet 的 Code Panels 允许在实验 UI 中内联运行任意 Matplotlib 或 Plotly 脚本,从而无需离开仪表板即可实现自定义可视化。W&B 的工作区使用了一个经过精心打磨的面板系统,但在实验级别的可脚本化程度较低。在性能方面,来自 MLtraq 的独立基准测试表明,在大规模高频指标记录方面,Comet 和 Neptune 优于 W&B。W&B 的上传管道可能会成为大型并行扫描中的瓶颈。Comet 原生集成的深度学习框架较少;W&B 具有 Comet 缺乏的 fastai 和 Catalyst 开箱即用集成。对于 LLM 可观测性,W&B Weave 相比 Comet 当前的产品具有显著的深度优势。在定价方面,Comet 采用按席位定价(Pro 版约为 $39/用户/月),而 W&B 的 Pro 层级收费为 $60/月,最多支持 10 个模型席位,外加存储超额费用。
MLflow(Apache 2.0,由 Databricks 管理)是需要零供应商依赖的团队的首选替代方案。MLflow 的跟踪服务器在架构上非常轻量:您可以将其部署在任何地方的 REST 或 gRPC 端点,无需云帐户。其 UI 将图表存储为静态工件而不是交互式小部件,这在视觉功能上较弱,但更具可移植性。MLflow 没有可与 W&B Reports 或工作区共享模型相媲美的团队协作功能。MLflow 针对 LLM 的 2024 年“Tracing”功能虽然存在,但在生产使用方面的能力远不及 W&B Weave。权衡在于完全控制与产品完善度:MLflow 需要更多的设置和运营所有权,而 W&B 提供了一个开箱即用且产品开发活跃的平台。对于已经在使用 Databricks 的团队,MLflow 直接集成到该生态系统中,这取决于您的情况,可能是一种锁定优势或劣势。
运行纯 GenAI 应用程序且没有传统 ML 训练的团队通常会将 W&B Weave 与专门的 LLM 可观测性工具进行比较。Langfuse 是开源的、可自托管的,并且在您可以自行托管的任何追踪量下都是免费的。Helicone 专注于 LLM 调用记录和成本跟踪,设置更简单。W&B Weave 的优势在于统一的平台:如果您的团队已经使用 W&B 进行模型训练,那么在推理/LLM 方面添加 Weave 不需要任何增量成本,并将所有可观测性集中在一个地方。
日常工作流的实际情况
设置过程确实阻力很小。执行 pip install wandb,运行 wandb login,在您的训练脚本中添加三行代码。对于 Weave,只需额外添加一行 (import weave; weave.init("project-name")),修补后的 LLM SDK 会处理其余部分。仪表板加载运行比较,允许您绘制任何记录的指标与其他指标的对比图,并生成可共享的 Report 文档,将运行表与书面分析结合起来,供无法访问代码的利益相关者使用。
阻力在大规模应用时显现。当团队运行数百个并发训练作业时,W&B 上传线程会与训练过程争夺 CPU 和网络资源。r/MachineLearning 和 W&B 社区论坛中的用户记录了在超参数搜索场景中,同步过程阻塞 GPU 训练长达数小时的案例,浪费了昂贵的计算资源。推荐的修复方法是使用离线模式 (WANDB_MODE=offline) 然后进行手动同步,但这会破坏实时仪表板的可见性。在边缘情况下,同步过程本身可能会进入无限循环,需要手动终止进程,据记录这会同时终止其他正在运行的训练作业。
“我想要一个能融入我工作流的轻量级工具,而不是一个强加给我新工作流的工具。Weave 通过轻松装饰几个函数实现了这一点。”—— Jonathan Whitaker,Answer.AI 的 AI 研究员(Weave 发布公告,2024 年 4 月)
当项目积累了大量实验时,UI 速度会明显变慢。自动生成的图表堆积如山,而 W&B 缺乏批量删除工具,导致用户即使在数据量不大的情况下,仪表板也需要 10-20 秒才能加载。这是一个已知问题,有多个开放的社区帖子和可追溯到 2022 年的 GitHub 问题,至今仍只得到部分解决。
W&B 是为谁打造的
W&B 专为经常运行训练实验的 ML 从业者打造。最佳适用场景是构建自定义模型的公司中由 3-20 名 ML 工程师组成的团队,无论这意味着微调基础模型、训练计算机视觉系统还是开发 RL 代理。该平台可扩展到企业研究实验室(OpenAI、Meta、NVIDIA、GlaxoSmithKline、Toyota 都在使用它),因为 Model Registry 和工件血缘跟踪可以处理大型组织的治理需求。
对于 LLM 应用程序团队,当团队已经使用 W&B Models 时,W&B Weave 最具吸引力。统一的平台减少了工具的蔓延,并在一个仪表板中提供了从训练到推理的可见性。完全基于预训练 API 构建且没有自定义模型训练的团队可能更喜欢更轻量级、特定于 LLM 的工具:用于开源自托管的 Langfuse,或专注于更简单成本跟踪的 Helicone。
该平台与 GPU 云提供商配合良好。在 RunPod、Modal 或 Anyscale 上运行训练作业的团队使用 W&B 记录分布式训练的指标,而无需更改其计算设置。收购后的 Mission Control 集成使 CoreWeave 客户的这种联系更加紧密,将 GPU 节点事件直接与训练运行仪表板相关联。
学术研究人员可以获得有意义的好处:W&B 的学术计划免费提供相当于 Pro 版的许可证,具有无限的跟踪小时数和 200GB 的存储空间。这是商业 ML 工具中较为慷慨的研究计划之一。
W&B 不是什么
W&B 不是一个完整的 MLOps 管道编排器。它跟踪实验并对工件进行版本控制,但它不调度训练作业、管理计算配置或编排多步管道。对于管道编排,您需要在 W&B 之外使用单独的工具(Prefect、ZenML、Metaflow 或 Kubeflow)。
对于需要零供应商依赖的团队来说,它不是合适的主要工具。虽然存在自托管选项,但在免费的 Personal 层级下“不允许企业使用”,而 Advanced Enterprise 自托管计划是定制化定价的。如果开源和自托管是硬性要求,MLflow 是正确的选择。
它没有针对运行纯基于 API 的应用程序且没有自定义模型训练的 GenAI 团队进行优化。Free 层级 1GB 和 Pro 层级 1.5GB 的 Weave 数据摄取限制对于具有实际流量的生产 LLM 应用程序来说是一个真正的约束。超额成本(超出层级限制后 $0.10/MB)在大规模应用时会迅速累积。自托管的 Langfuse 实例没有追踪量限制。
尽管推出了新的 W&B Inference 产品,但它不是一个实时推理服务平台。截至 2025 年中,该产品处于预览阶段,定位为模型评估的便利工具,而不是像 Anyscale 或 RunPod 这样的专用选项的生产服务基础设施替代品。
用户评价
暂无评价,快来分享你的第一条体验吧!
登录 后即可撰写评价。
相关文章
与 Weights & Biases 相关的指南和文章。

Run a Company With AI Agents: The Open-Source Orchestration Setup (2026)

Replit Pricing Explained (2026): Core vs Pro and Effort-Based Agent Billing

Turn Any AI Agent Into a Superagent: The 12-Integration Stack (2026)

Grok 4.3 API for Agents (May 2026): Pricing, Benchmarks, Migration

Google vs OpenAI vs Anthropic Agents: The May 2026 Platform Showdown
