跳到主要内容
Vantaige
SambaNova screenshot
SambaNova logo

SambaNova

免费增值

SambaNova Cloud 是一款 AI 推理 API,利用 SambaNova 自主的 RDU 芯片架构,以基于 GPU 的提供商无法匹敌的速度运行大型开源模型。专为需要对高达 671B 参数的模型进行快速、高性价比推理的企业和开发者工作负载而打造。

使用场景:商业
功能:API

SambaNova Systems 是一家硅谷 AI 硬件和云服务公司,专门为 AI 推理构建自主芯片。该公司由前斯坦福大学教授 Kunle Olukotun 和 Chris Re 以及首席执行官 Rodrigo Liang 于 2017 年创立,开发了可重构数据流单元(RDU),目前已发展至第四代(SN40L),并于 2026 年 2 月宣布推出第五代 SN50。与基于 GPU 的推理提供商不同,SambaNova 的 RDU 采用结合了 HBM3、DDR DRAM 和片上 SRAM 的三层内存架构,使单个 16 芯片机架能够持续运行 DeepSeek-R1 671B 或 GPT-OSS 120B 等模型,突破了限制 GPU 吞吐量的内存墙。

SambaNova Cloud 是其公共 API 接口:一项按 Token 计费的服务,提供对 DeepSeek V3、Llama 4 Maverick、GPT-OSS 120B、Gemma 3、MiniMax M2.5 及其他开源模型的访问。DeepSeek-V3.1-cb 的输入定价低至每百万 Token $0.15,并提供免费层(每天 200K Token,无需信用卡)供评估使用。2025 年 2 月 8 日推出的开发者层(Developer Tier)增加了更高的速率限制和按量计费功能。对于需要本地部署的企业,SambaManaged 提供物理 SN40L 机架,确保数据不会离开客户环境。该公司于 2024 年 2 月 28 日宣布推出的 Samba-1 产品,是一个拥有 1 万亿参数的专家组合(Composition of Experts)模型,专为受监管企业的本地部署而构建。

SambaNova 在 2026 年 4 月的实际表现

SambaNova 既是一家芯片公司,也是一家推理云服务商,这使其有别于纯 API 提供商。SN40L RDU 的内存设计在每个芯片上配置了 64GB HBM3、1.5TB DDR DRAM 和 520MB 片上 SRAM,16 个芯片安装在一个标准的风冷 19 英寸机架中。这种架构意味着该平台不需要像 GPU 集群那样将大型模型分割到数十个加速器上。

Artificial Analysis 的基准测试(2026 年 3 月)显示,SambaNova 在 gpt-oss-120B 上实现了 711 Token/秒的输出速度,在 DeepSeek R1 671B 上实现了 250 Token/秒的输出速度,而基于 GPU 的提供商在相同的 671B 模型上的平均速度约为 19 Token/秒。gpt-oss-120B 的首个 Token 延迟约为 1.25 秒。

在云 API 方面,截至 2026 年 4 月,模型目录涵盖了约 8-10 个活跃跟踪的模型:多个 DeepSeek 变体、Llama 3.3 70B、Llama 4 Maverick、GPT-OSS 120B、Gemma 3 12B 和 MiniMax M2.5。该 API 兼容 OpenAI,这意味着大多数使用 OpenAI SDK 的现有代码只需替换基础 URL 即可指向 SambaNova 的端点。

2026 年 2 月 26 日,SambaNova 宣布推出其第五代 RDU SN50。该公司声称,在代理推理(agentic inference)方面,SN50 的最高速度是 Nvidia Blackwell B200 GPU 的 5 倍,吞吐量是其 3 倍以上,而平均机架功率仅为 20kW(支持风冷数据中心部署,无需升级液冷)。SoftBank Corp. 是首个公布的 SN50 客户,将在亚太地区部署主权 AI 服务。SN50 将于 2026 年下半年发货。

“整个 AI 行业都在谈论构建 AI 领域的智能手机,即一个软硬件集成的系统,而今天,SambaNova 率先向企业交付了这样一个版本。”—— SambaNova Systems 首席执行官 Rodrigo Liang,BusinessWire 新闻稿,2024 年 2 月 28 日

SambaNova 与 Cerebras 和 Groq 的定位对比

这三家公司都在专门为 AI 推理构建芯片,而不是改造通用 GPU 架构。它们之间的差异是架构层面的,而非表面上的。

Cerebras (WSE-3) 采用晶圆级引擎:覆盖整个半导体晶圆的单块芯片,拥有 4 万亿个晶体管、900,000 个计算核心以及 44GB 的片上 SRAM,内存带宽高达 21 PB/s。这种设计实现了所有平台中最快的单用户 Token/秒速度。代价是:44GB 的片上 SRAM 限制了原生模型的大小。运行超过该容量的模型需要跨多个晶圆系统进行分割。WSE-3 还需要每个系统 23kW 的专用液冷,而 SambaNova 的标准风冷仅需约 10kW。Cerebras 主要通过云端交付;提供本地部署选项,但较为罕见。

Groq (LPU) 采用语言处理单元,作为张量流处理器构建,具有纯 SRAM 内存架构。每个 LPU 芯片仅包含 230 MiB 的内存。这种设计在中小模型上提供了极快的推理速度(Llama 3.3 70B 约为 350 Token/秒),但纯 SRAM 意味着运行 70B 模型需要将工作负载分散到数百个芯片上:对于 SambaNova 在一个机架的 16 个 SN40L 芯片上运行的相同 70B 工作负载,Groq 大约需要 9 个机架上的 576 个 LPU 芯片。在 671B 参数规模下,Groq 无法进行有效竞争。不提供本地部署。

SambaNova 的三层内存设计能够在最少的硬件上处理最大的模型,并支持跨多个模型同时处理多用户企业流量。与 Cerebras 相比,其代价是峰值单用户速度;与 Groq 相比,其代价是开发者生态系统的成熟度和定价透明度。

“如果 GPU 能够真正利用其内存带宽,它们会快得多,但它们做不到。”—— SambaNova Systems 软件产品主管 Anton McGonnell,The Register,2024 年 9 月

开发者 API 的实际情况

SambaNova Cloud 的免费层每天提供 200,000 个 Token,这足以评估模型,但不足以运行生产应用程序。2025 年 2 月 8 日推出的开发者层解锁了按 Token 计费的消费模式和更高的速率限制,注册即赠送 $5 免费额度。该 API 兼容 OpenAI,因此对于已经使用 LLM API 的开发者来说,集成非常简单。

速率限制是摩擦积累的地方。即使在开发者层,尽管文档声称有更高的限制,某些模型的上限仍为每分钟 20 次请求。2026 年初为期数周的计费系统迁移导致许多开发者即使添加了支付方式,也仍然停留在免费层的速率限制上。社区论坛上的用户报告称,429 错误导致生产应用中断,一位开发者的日志显示,尽管绑定了信用卡,但在每天 200K 的上限下使用了 330 万个 Token 却未能升级。SambaNova 承认该问题是计费迁移错误,并通过手动层级调整解决了大多数情况,但没有提供明确的完成时间表。

模型目录比 OpenAI 或 Anthropic 更窄。通过云 API 无法使用 SambaNova 专有的基础模型;Samba-1 仅限企业本地部署。没有 GPT-4,没有 Claude,没有 Gemini。如果您的用例需要 SambaNova 托管的开源模型集之外的任何内容,您将无法在该平台内实现。

对于确实推进 SambaManaged 本地部署的企业团队来说,集成范围远远超出了 API 访问:业务逻辑、工作流自动化、监控和上下文检索都需要定制工程。一项外部评估将这种体验描述为“就像你需要一辆车时却买了一台 F1 赛车引擎”,指出了原始硬件能力与可部署的生产系统之间的差距。

SambaNova 适合哪些用户

SambaNova Cloud 适合特定的开发者群体:在大型开源模型上运行高吞吐量推理的团队,在这些场景中,Token/秒的速度转化为实际的成本节约或用户体验差异。构建实时交易分析的金融服务团队、需要本地隐私保护的国家实验室或受监管行业的 ML 工程师,以及构建每次会话处理数百万 Token 的深度研究代理的开发者,都代表了现实的用例。在规模化应用时,其按 Token 计费的价格明显低于基于 GPU 的提供商:gpt-oss-120B 的输入/输出价格分别为每百万 Token $0.22 / $0.59,而同类 GPU 端点的费率要高得多。

美国能源部阿贡国家实验室(Argonne National Laboratory)于 2024 年 11 月部署了完整的 SN40L 推理集群,用于支持 AuroraGPT 以及跨生物学、化学和材料科学的 AI 驱动科学研究。Accenture 将 Samba-1 评为适合需要全栈本地 AI 的企业客户。这些都是 SambaNova 真正能够提供优质服务的典型客户。

SambaNova 不适合哪些场景

如果您需要专有的前沿模型,请跳过 SambaNova Cloud。这里没有 GPT-4,没有 Claude,没有 Gemini,也无法通过 API 访问 SambaNova 自己的 Samba-1。如果您的用例需要访问包括闭源模型在内的广泛模型目录,您需要选择其他提供商。

如果您是独立进行原型设计,或者是在没有工程资源的小型团队中,请跳过它。免费层的速率限制很快就会触顶。计费系统曾有记录在案的升级失败问题。文档虽然在不断改进,但仍不如 OpenAI 丰富。企业本地部署产品需要数月的实施工作和完整的销售流程。

如果您在大型模型上需要完整的 128K 上下文,请跳过它。在 2024 年 9 月发布时,出于流量管理的原因,405B 模型被限制为 8K 上下文。最大模型上的上下文窗口限制仍然是一个已知的约束条件。

当您大规模运行大型开源模型、对延迟有要求,并且愿意在它提供的原始推理能力之上进行实际的工程开发时,SambaNova 才能发挥其最强大的价值。

用户评价

暂无评价,快来分享你的第一条体验吧!

登录 后即可撰写评价。

相关文章

与 SambaNova 相关的指南和文章。