
Baseten 是一个托管推理平台,用于将自定义和微调的 AI 模型作为自动扩展的 API 部署到生产环境中。凭借 Truss 打包、Chains 管道和 HIPAA 合规性,它专为交付自有模型的 ML 团队而设计,并获得了由 NVIDIA 领投的 2026 年融资支持。
Baseten 是一个托管推理平台,旨在将自定义和开源 AI 模型转化为快速、自动扩展的 API 并投入生产。它于 2019 年在旧金山成立,由四位在 Gumroad 构建机器学习欺诈系统时结识的工程师创立,Tuhin Srivastava 担任 CEO。其核心理念完全体现在它的标语中:“推理就是一切(inference is everything)”。您只需打包模型,Baseten 就会在预留的 GPU 上运行它,并为您处理自动扩展、监控、日志记录和合规性问题,从而省去了通常在训练模型和生产端点之间长达数月的基础设施搭建工作。与纯粹的模型 API 经销商不同,Baseten 围绕您的模型(包括微调和完全专有的模型)构建,并为无法将数据发送到共享云的团队提供自托管和 VPC 内(in-VPC)部署选项。
该产品主要包含四个部分:Dedicated Deployments(专用部署),即按分钟计费的预留自动扩展 GPU;Model APIs(模型 API),提供按 Token 计费的方式访问 DeepSeek 和 Llama 等流行开源模型;Baseten Chains,运行多模型管道,每一步都在专门匹配的硬件上执行;以及 Baseten Loops,这是一个 2026 年推出的用于强化学习和微调的 SDK。其入门工具是 Truss,即 Baseten 的开源模型打包框架。生产环境客户包括 Cursor、Notion、医疗 AI 公司 Abridge 以及法律 AI 公司 Harvey,该平台还拥有 SOC 2 Type II 和 HIPAA 合规认证。NVIDIA 直接投资了 Baseten 2026 年 1 月的融资轮,这发出了该 GPU 制造商对推理需求发展方向的明确信号。
2026 年 6 月您在 Baseten 上实际部署的内容
核心单元是模型部署。您使用 Truss 包装模型并推送,Baseten 会在从基础的 T4 到高端的 B200 等各种 GPU 上提供服务,根据流量自动扩展或缩减副本,甚至在空闲时缩减至零。对于不想打包任何内容的团队,Model APIs 提供对常见开源模型的即时按 Token 访问;而 Chains 则允许您将多个模型拼接在一起,例如将语音转文本输入给 LLM,再输入给摘要生成器,每个阶段都在最合适的硬件上运行。2026 年新增的 Loops 弥合了从训练到服务的差距,只需一条命令即可将微调后的检查点(checkpoint)提升为实时端点。
该平台的发展势头难以估量。2026 年 1 月 23 日,Baseten 以 $5 billion 的估值筹集了 $300 million,NVIDIA 也是投资者之一。独立估计显示,在推理量同比增长约 100x 的推动下,从 2025 年 12 月到 2026 年 3 月,其年化收入从约 $200 million 增加了两倍,达到 $600 million。这是一家被需求推着走,而不是在苦苦寻找需求的公司。
Baseten 与 Modal 和 Replicate 的机制对比
Modal 和 Baseten 从相反的两端解决重叠的问题。Modal 为您提供使用装饰器定义的无服务器 Python 函数,并按执行秒数计费,这非常适合突发性批处理作业和您自己构建的通用计算。Baseten 则是模型即服务(model-as-a-service):部署(而非函数)是基本单元,并且内置了内核调优和权重缓存等推理优化。Baseten 的交付网络可以在十秒内让一个小于 20GB 的模型上线,但热副本(warm replica)会持续计费,而 Modal 的按秒计费模式则更适合突发流量。在原始硬件上,Modal 的 H100 运行成本约为每小时 $3.95,而 Baseten 为 $6.50,因此您向 Baseten 支付的是托管服务层的费用。Replicate 是另一个参考点,尽管它在 2026 年初被 Cloudflare 收购并并入 Workers AI。它始终针对的是利用庞大社区模型目录进行原型设计的个人开发者,而不是在合规要求下部署专有模型的企业,而后者正是 Baseten 的核心领域。
基于副本的计费模式的真实成本
Dedicated Deployments 按活动副本时间的分钟数计费,折算下来 T4 约为每小时 $0.63,A100 为 $4.00,H100 为 $6.50,B200 为 $9.98。空闲时间不收费,但关键在于“副本”一词,因为每个运行中的副本都在持续消耗资金,因此为了冗余而设置的双副本会立即使账单翻倍。Model APIs 则按 Token 计费,DeepSeek V4 的输入价格为每百万 Token $1.74,输出为 $3.48,这对于标准模型来说更为简单。新账户可获得免费额度,符合条件的种子轮至 A 轮初创公司可通过初创公司计划申请高达 $25,000 的额度。
“Baseten 在我们的 AI 基础设施中扮演着核心角色,用于托管和提供我们的模型推荐引擎服务。” Tomas Hernando Kofman,Not Diamond,Product Hunt,2024。
结构性的矛盾在于冷启动与成本之间的权衡。缩减至零可以省钱,但在下一次请求大型模型时需要付出 30 到 90 秒的冷启动时间。保持热副本可以消除延迟,但无服务器带来的成本节约也随之消失。如果只需要没有托管层的廉价原始 GPU 时间,RunPod 的价格要低得多,但您将放弃自动扩展、优化和合规性,而这些正是选择 Baseten 的首要原因。
Baseten 团队不断遇到的摩擦
计费模式是最常见的意外来源。每副本分钟的成本很难预测,冗余会使其成倍增加,而且没有明显的预算上限,因此流量波动大的团队报告称账单会在毫无预警的情况下飙升。Truss 这个让入门变得顺畅的框架,同时也带来了转换成本,因为离开 Baseten 意味着要为 vLLM 或 SGLang 重写模型包装器。在公开评论中,支持服务的质量显得参差不齐,一位用户描述了一次常规更改竟经历了长达十天的煎熬。
“我需要的只是一个简单的账单地址更新,这是每个正常平台都允许您直接在 UI 中更改的操作。” Valerio,Product Hunt,2025。
最后,Baseten 在设计上仅面向工程人员。它没有为非技术用户提供自助服务仪表板,其监控界面显示的是 GPU 利用率和响应时间,而不是业务指标。这对于其目标受众来说是正确的,但对于任何期望获得无代码体验的人来说则是一堵高墙。
谁应该在 Baseten 上构建,谁不应该
对于部署自定义或微调模型的 ML 工程团队,对于因 HIPAA、SOC 2 或 VPC 内托管等合规要求而无法使用共享推理云的公司,对于使用 Chains 构建多模型管道的团队,以及对于运行强化后训练并希望通过 Loops 实现从训练到推理连续性的实验室来说,Baseten 是一个强有力的选择。符合额度计划条件的种子轮至 A 轮初创公司可以获得慷慨的入门支持。
对于仅调用现成模型 API 的团队来说,它几乎没有增加什么价值,因为原生提供商更简单。以中等规模运行标准开源模型且对价格敏感的团队通常会发现 Together AI 或按 Token 计费的主机更便宜,且操作更少。独立开发者和业余爱好者会发现每副本成本和工程开销过高,而任何想要快速、轻代码原型设计的人在 Modal 上会进展得更快。只有当您真正需要对自有模型进行托管、合规且优化的服务时,Baseten 才值得其高昂的溢价。
用户评价
暂无评价,快来分享你的第一条体验吧!
登录 后即可撰写评价。
相关文章
与 Baseten 相关的指南和文章。

Google Vision AI Explained (2026): Pricing Per 1,000 Units, Free Tier, and Alternatives

Mistral Medium 3.5 Self Host: 77.6% SWE-Bench on 4 GPUs (2026)

Replit Pricing Explained (2026): Core vs Pro and Effort-Based Agent Billing

OpenAI GPT-Realtime-2 (May 2026): Pricing, Latency & 30-Min Voice Agent

Does API Cost More Than a Subscription for Claude Opus 4.8, GPT-5.5, and Grok?
