跳到主要内容
Vantaige
Cerebras screenshot
Cerebras logo

Cerebras

付费

Cerebras Inference 是一款由有史以来最大的 AI 处理器 WSE-3 晶圆级芯片驱动的云端 LLM API。它在开源模型上可提供每秒 2,000-3,000 个 token 的处理速度,比基于 GPU 的替代方案快 10-20 倍,起价为每百万 token $0.10。

使用场景:代码与开发
功能:API

Cerebras Systems 是一家位于圣克拉拉的 AI 硬件公司,打造了有史以来制造的最大芯片 WSE-3:这是一块面积达 46,225 平方毫米的单片硅晶圆,包含 4 万亿个晶体管和 900,000 个针对 AI 优化的计算核心。Cerebras 没有将硅晶圆切割成几十个小芯片,而是将整块晶圆作为一个统一的处理器,以每秒 21 PB 的内存带宽将整个 LLM 权重矩阵存储在 44 GB 的片上 SRAM 中。CS-3 商业系统将该芯片作为水冷设备出货。Cerebras Inference 于 2024 年 8 月 27 日推出,是一个公共云 API,让开发者能够以任何 GPU 集群都无法匹敌的速度访问该硬件进行 LLM 推理。

该推理 API 提供不断轮换的前沿开源模型目录,包括 GPT-OSS-120B(速度达到约每秒 3,000 个 token)、Qwen3-235B(在 262K 上下文下高达每秒 2,500 个 token)、Llama 4 Maverick(约每秒 2,522 个 token)以及 Llama 3.1 8B(每秒 2,337 个 token,价格为每百万 token $0.10)。该 API 兼容 OpenAI,因此集成时只需更改基础 URL 和 API 密钥。免费层每天提供 100 万个 token,无需排队等待。企业和开发者层级可解锁更高的速率限制和优先调度。2026 年 1 月,OpenAI 签署了一项价值 100 亿美元的协议,在 2028 年前使用 750 兆瓦的 Cerebras 算力,同时 AWS 在其数据中心部署了 CS-3 设备,使得用户可以通过 AWS Bedrock 使用 Cerebras。

2026 年 4 月 Cerebras Inference 的实际表现

Cerebras Inference 是一个纯粹的推理 API,而不是训练平台或微调服务。它以改变实时 AI 应用经济效益的速度运行开源权重语言模型。当 GPU 集群在 12-15 秒内返回 Llama 70B 的响应时,Cerebras 在不到 2 秒内就能返回相同的响应。当 GPU 集群在 45 秒内完成 405B 的推理轨迹时,Cerebras 只需 3-4 秒即可完成。来自 Artificial Analysis 基准测试(2025 年)的吞吐量数据绝非理论值:GPT-OSS-120B 约为每秒 3,000 个 token,Llama 3.1 8B 约为每秒 2,337 个 token。

目前的模型目录(2026 年 4 月)包括高低变体的 GPT-OSS-120B、GLM-4.7(131K 上下文)、Qwen3-235B 和 Qwen3-32B,以及 Llama 4 Scout。根据模型的不同,上下文窗口从 33K 到 262K token 不等。所有模型均原生以 16 位精度运行,这意味着在输出质量上没有量化妥协。该 API 遵循 OpenAI Chat Completions 格式,支持函数调用和流式传输,除了直接访问外,还可以通过 OpenRouter 和 HuggingFace 访问。Meta 与 Cerebras 合作驱动 Llama API,为开发者提供比传统 GPU 解决方案快达 18 倍的 Llama 模型推理速度。

"在推理方面,Cerebras 带来了真正的启示。我非常敬佩他们的创始人、团队、创新和技术。",maz1b,Hacker News,2025 年 10 月

Cerebras 与 Groq 和 SambaNova 的对比定位

有三家公司专门构建了定制芯片,旨在在推理领域击败 NVIDIA:Cerebras、Groq 和 SambaNova。它们的芯片架构有着根本的不同,而这些差异对你如何使用它们至关重要。

Cerebras vs. Groq:Groq 的语言处理单元 (LPU) 采用线性流水线设计,数据在功能单元中同步流转。每个 Groq 芯片仅搭载 230 MB 的 SRAM,因此运行 70B 模型需要数百个通过专有网络连接的 Groq 芯片,而 400B 模型则需要数千个芯片,将机架级功耗推高至数百千瓦。Groq 针对确定性和 8 位推理进行了优化;16 位在 Groq 硬件上运行速度明显变慢。Cerebras WSE-3 完全消除了芯片间网络:44 GB 的片上 SRAM 将模型保存在单块晶圆上,并原生运行 16 位精度。独立的 Artificial Analysis 基准测试(2025 年)显示,在相同模型上,Cerebras 比 Groq 快 6 倍:GPT-OSS-120B 约为每秒 3,000 对比 493 个 token,Llama 3.3 70B 超过每秒 2,500 对比 403 个 token。NVIDIA 在 2025 年底以 200 亿美元收购了 Groq;尽管产品仍在运营,但 Groq 作为竞争对手的独立性已经终结。

Cerebras vs. SambaNova:SambaNova 的 SN40L 芯片使用可重构数据流单元 (RDU),具有三层内存层次结构:SRAM、HBM 和 DRAM。RDU 将 AI 模型的完整计算图作为自定义数据流流水线直接映射到芯片上。这种分层内存意味着 SambaNova 可以同时容纳多个大型模型,并在不重新加载权重的情况下提供服务。整个 SambaNova 系统包含在 16 个芯片中,平均功耗约为 10 kW,而 Cerebras 则需要完整的水冷 CS-3 设备,每台功耗为 20-27 kW。SambaNova 声称在 Llama 3.1 70B 上,其单位面积性能比 Groq 高 40 倍,比 Cerebras 高 10 倍。对于买家而言,关键的区别在于:SambaNova 支持企业本地部署;而 Cerebras 仅限云端。在原始每秒 token 数方面,SambaNova 单个请求的单用户吞吐量低于 Cerebras,但 SambaNova 可以服务更多并发用户,且没有模型重新加载的开销。

推理 API 的日常实际体验

速度优势是真实且立竿见影的。构建编程助手的开发者(Cline 在 v3.20.4 中添加了 Cerebras 支持,Roo Code 在 v3.25.5 中添加)报告称,与基于 GPU 的提供商相比,模型响应几乎是瞬间的。对于交互式应用来说,2 秒响应和 0.15 秒响应之间的差异不仅仅是基准测试数据。它改变了产品交互的可能性。以 Llama 3.1 8B 每秒 2,337 个 token 的速度,一个 500 token 的响应大约在 0.2 秒内即可到达。

然而,日常现实中也包含基准测试无法捕捉到的摩擦。免费层每分钟 30 次请求的上限意味着任何拥有多个并发用户的应用都会立即触及限制。由于推理速度极快,客户端可能会在人类甚至还没读完上一个响应之前,无意中发送突发流量从而触发速率限制。开发者需要构建带有延迟的显式重试逻辑。Anthropic 和 OpenAI 都提供提示词缓存 (Prompt caching) 以降低重复上下文的成本,但 Cerebras 上并不存在此功能。对于在每次工具调用时重建完整消息历史的代理循环 (agentic loops),token 成本会在每次往返中以全价累积。一位开发者报告说:如果没有缓存,你在每次调用时都会将之前的整个消息历史作为输入 token 发送。这并非理论上的担忧,它是该平台上复杂代理部署的主要成本驱动因素。

"速率限制似乎触发得极快,结果不如 Claude Code,而且最终成本更高。",Hacker News 评论者,Cerebras Code 讨论帖,2025 年

模型的可用性也不如 GPU 云提供商稳定。随着工程团队优化新的检查点,Cerebras 会主动轮换模型支持。Llama 3.1 8B 和 Qwen3-235B 都带有 2026 年 5 月 27 日的弃用通知。构建生产应用的开发者需要监控模型可用性并处理弃用问题。模型目录也比 GPU 云替代方案更窄:只有五个活跃模型,而 Together AI 或 Replicate 上有几十个。

Cerebras 为谁而建

Cerebras Inference 专为延迟(而非成本或模型多样性)成为瓶颈的用例而构建。需要低于 200 毫秒模型轮转的实时语音代理、用户能感知到 2 秒和 0.1 秒补全差异的实时编程助手,以及按顺序链接数十次模型调用的代理系统。在这些工作负载中,Cerebras 的速度改变了可能性,而不仅仅是便利性。早期的客户名单证实了这一点:用于药物发现的 GlaxoSmithKline(复杂的蛋白质域推理)、用于代码代理的 Cognition,以及现在用于大规模生产级 ChatGPT 服务的 OpenAI。

运行大规模推理实验的研究人员和数据科学家可以从每天 100 万 token 的免费层中受益,这使得能够零成本对速度敏感的应用进行真正的原型设计。Llama 3.1 8B 每百万 token $0.10 的定价是业内所有托管模型中最低的之一,使得高吞吐量实验变得易于实现。

在以下情况请跳过:你需要多模态输入(图像、音频、视频):Cerebras 仅支持文本。对于本地部署请跳过,考虑到 CS-3 系统的外形尺寸和电源要求,这在物理上是不切实际的。对于依赖提示词缓存来控制成本的代理应用请跳过。如果一致的模型可用性对你的生产技术栈至关重要请跳过:其模型轮换计划非常激进,需要维护开销。需要广泛微调、专业模型定制或丰富模型目录的团队,应转而考虑 GPU 云或 SambaNova 的企业平台。

Cerebras 不是什么

Cerebras 不是一家 AI 模型公司。它不训练基础模型,也不拥有模型权重。它提供由 Meta、Alibaba 等构建的开源模型服务,并以比任何其他平台都快的速度运行它们。如果开源模型生态系统停止生产具有竞争力的权重,Cerebras 将没有模型可供服务。该公司完全依赖于它可以为其硬件优化的开源权重模型的持续发布。

Cerebras 不是一个兼容 GPU 的生态系统。它的软件栈是专有的,并非基于 CUDA。虽然开发者通过标准的兼容 OpenAI 的接口访问 API,但任何针对 CUDA 优化的自定义内核、量化方案或模型修改都无法迁移。这对于希望迁移现有 GPU 优化推理流水线的团队来说非常重要。

对于大多数买家而言,Cerebras 不是本地硬件供应商。CS-3 是一款功耗为 20-27 kW 的水冷设备,需要专门构建的数据中心基础设施。除非你拥有 AWS 级别的规模,否则你只是将 Cerebras 作为云 API 使用,而不是部署其硬件。这意味着你的推理延迟和吞吐量取决于连接到 Cerebras 数据中心(截至 2026 年初,在北美和欧洲有六个)的网络状况。

用户评价

暂无评价,快来分享你的第一条体验吧!

登录 后即可撰写评价。

相关文章

与 Cerebras 相关的指南和文章。