

CoreWeave 是一家专为企业级 AI 训练和推理打造的专业 GPU 云服务商。它在 32 个数据中心拥有超过 250,000 个 GPU,配备基于 InfiniBand 的集群以及 NVIDIA 最新的 Blackwell 硬件,为全球顶级的 AI 实验室提供算力支持,包括 OpenAI、Meta、IBM 和 Microsoft。
CoreWeave 是一家在纳斯达克上市的 GPU 云服务提供商(股票代码:CRWV),专为大规模 AI 训练和推理运营定制化基础设施。CoreWeave 成立于 2017 年,最初是一家加密货币挖矿企业,2019 年转型为云计算服务商,现已发展至拥有 32 个以上的数据中心和约 250,000 个 GPU,其中包括最新的 NVIDIA Blackwell 硬件。该公司于 2025 年 3 月 28 日上市,以约 $23 billion 的估值筹集了 $1.5 billion,此后与 OpenAI($12B,5 年期)、Meta(2025 年 10 月签署 $14.2B,后于 2026 年 4 月扩展至 $21B)、IBM、Microsoft 和 Anthropic 签订了重大合同。2025 年 5 月,CoreWeave 以约 $1.7 billion 的价格完成了对 Weights and Biases 的收购,为其基础设施平台增添了实验跟踪和模型监控功能。
CoreWeave 的平台基于 Kubernetes 原生的裸金属 GPU 集群构建,通过 InfiniBand 网络连接,旨在最大限度地减少分布式多节点训练期间的通信开销。GPU 产品涵盖 NVIDIA A100、L40、L40S、H100、H200、GH200 以及 Blackwell 架构系列(GB200 NVL72、HGX B200、HGX B300、GB300 NVL72)。定价范围从 L40 8-GPU 节点的 $10/hr 到 HGX B200 按需实例的 $68.80/hr 不等,多年期的预留承诺合同可提供高达 60% 的折扣。该平台针对企业级工作负载不提供自助服务:入驻需要客户经理协助,预留容量需要进行合同谈判。集成的 Weights and Biases 工具、托管对象存储和托管 Kubernetes 进一步完善了其产品矩阵。
2026 年的 CoreWeave 究竟能做什么
CoreWeave 的核心产品是大型 GPU 集群租赁,但仅称其为租赁服务低估了其架构的价值。该平台提供裸金属 GPU 节点,跳过了在标准云 VM 中会增加延迟的虚拟机管理程序层。节点之间通过高达 400Gb/s 的 InfiniBand 进行通信,这对于分布式训练中的 all-reduce 等集合通信操作至关重要,因为在多节点运行中,GPU 间的带宽往往是真正的瓶颈。Kubernetes 原生编排负责处理调度、自动扩展和工作负载管理,免去了您自行构建该层的开销。
其 GPU 目录涵盖了从主力机型(A100 8x,$21.60/hr)到最前沿的硬件:HGX B200 节点(8 个 GPU,180GB VRAM)按需价格为 $68.80/hr,GB200 NVL72 配置(4 个超级芯片,每个 186GB)为 $42.00/hr。GB300 NVL72 和 HGX B300 仅限联系销售获取,这意味着 CoreWeave 是极少数能够在生产规模上提供 NVIDIA 最新一代硬件的供应商之一。对于不需要完整集群的团队,单 GPU H100 推理实例的价格为 $6.16/hr。
收购完成后,Weights and Biases (W&B) 直接集成到平台中,用于实验跟踪、超参数扫描、模型版本控制和评估。此前有超过 1,400 家组织将 W&B 作为独立工具使用;现在它已原生内置于 CoreWeave 的托管环境中。CoreWeave 还提供 AI Object Storage(同期宣布)、托管网络和专用持久卷,使得无需外部云存储即可运行完整的训练管道成为可能。
"CoreWeave 帮助我们构建了真正大规模的计算集群,这促成了我们最著名的一些模型的诞生。" -- Sam Altman,OpenAI CEO(coreweave.com 客户案例)
CoreWeave 与 Lambda Labs 和 Crusoe 的定位对比
这三家供应商在 GPU 云市场中占据着不同的细分领域。它们在机制上的差异远不止“价格”或“规模”。
CoreWeave vs. Lambda Labs:在相同的 H100 SXM 硬件上,CoreWeave 每个 GPU 的收费约为 $6.16/hr,而 Lambda 为 $3.29/hr —— 溢价达 87%。在 GH200 上,差距达到 184%($6.50 vs $2.29)。Lambda 收费较低是因为它用标准的 NVLink/Ethernet 节点间架构取代了 InfiniBand。对于在单个 8-GPU 节点上运行的任务,这种差距几乎没有影响。但对于跨越数十或数百个节点的任务(从头开始训练 70B+ 参数模型,运行大批量分布式微调),CoreWeave 的 InfiniBand 架构可显著减少 all-reduce 通信时间。Lambda 的优势在于平易近人的定价、一键式 Jupyter 笔记本、预装框架以及无需销售沟通的透明自助服务界面。Lambda 是研究团队和初创公司的正确选择;而当您突破了单节点限制时,CoreWeave 则是更合适的选择。
CoreWeave vs. Crusoe:Crusoe 的显著特征是其能源模型:该公司利用搁浅和浪费的能源(包括火炬气和过剩的可再生能源),通过垂直集成的“能源到云”架构为其数据中心供电。CoreWeave 使用标准的并网设施,没有特定的清洁能源定位。对于有严格 ESG 或可持续性要求的组织,Crusoe 具有 CoreWeave 难以轻易复制的结构性优势。在成本方面,Crusoe 的 H100 起价约为 $1.71/hr,大约是 CoreWeave 同等费率的一半。在规模和网络方面,CoreWeave 明显胜出:在 32 个以上的全球数据中心拥有超过 250,000 个 GPU,而 Crusoe 的业务主要集中在美国且规模较小。Crusoe 不提供 InfiniBand;其网络是标准 Ethernet,这使其局限于不需要紧密 GPU 间耦合的工作负载。如果您需要在 1,000 个 GPU 上以低延迟集合通信训练基础模型,Crusoe 无法与 CoreWeave 的架构相媲美。如果您需要具有 ESG 报告的稳态、中等规模推理或微调,Crusoe 则更有意义。在成本上,两者都优于超大规模云服务商,但它们服务于不同的设计核心。
对于进行推理而非训练的团队,RunPod 和 Modal 提供无服务器和按需 GPU 访问,且没有集群承诺的开销。对于托管推理 API 而非原始计算,AWS Bedrock、Azure OpenAI 和 Groq 在内部处理配置和扩展。
集群的日常实际运行情况
企业客户签署的预留合同通常为期两到四年,在此期间定价锁定为每 GPU 每小时的美元价格。60% 的承诺折扣是真实的,但要求无论实际利用率如何,每月都必须承诺该消耗率。截至 2024 年 12 月,加权平均合同期限约为四年。对于明确知道将持续进行训练的组织来说,这是合理的。但对于需求波动的团队而言,这构成了重大的财务风险。
按需访问无需承诺,但按全额标价收费。一个完整的 8x H100 HGX 节点按需运行价格为 $49.24/hr。连续运行一个月大约需要 $35,000。大多数企业客户会预留容量,并将按需实例作为突发溢出的补充。竞价实例(Spot)存在于有限的硬件上(RTX PRO 6000 Blackwell 竞价为 $9.24/hr,按需为 $20.00/hr),但最新的 Blackwell 旗舰硬件没有竞价层级。
Kubernetes 原生架构为能够驾驭它的团队带来了真正的优势。裸金属 GPU 节点意味着没有虚拟机管理程序开销,这在基准测试中表现为计算密集型工作负载的吞吐量显著提高。InfiniBand 架构使得在多节点规模下的集合操作真正快于 Ethernet 替代方案。IBM 记录的模型训练性能提升 80% 证实了这一点。问题在于操作的复杂性:在这种规模下管理 Kubernetes 需要经验丰富的工程师。CoreWeave 不是一个让你随便扔个 Jupyter 笔记本上去的平台;它是一个让你构建生产级 ML 管道的平台。
"CoreWeave 给了我们更大胆思考和更快速行动的自由。他们了解扩展突破性技术的挑战,并为我们提供了让我们能够专注于创新的支持。" -- Naeem Talukdar,Moonvalley 联合创始人兼 CEO(coreweave.com 客户案例)
CoreWeave 为谁而建
CoreWeave 的设计核心是企业级 AI 实验室。这意味着训练前沿模型的 OpenAI 级别组织、超大规模云服务商级别的 AI 研究部门、拥有 B 轮以上融资且需要在可预测时间线上获得 500+ GPU 容量的 AI 初创公司,以及每天运行数百万次请求且需要强有力 SLA 保障的生产推理运营商。IBM 使用 CoreWeave 进行模型训练,并报告了 80% 的性能提升。Mistral 使用它将其推理模型的训练时间缩短了一半。这些组织都拥有专门的基础设施团队,并将 Kubernetes 视为基本技能。
该平台也适合资源充足的研究团队,这些团队曾因超大规模云服务商的可用性限制而受挫(众所周知,AWS、GCP、Azure 的 GPU 队列在规模化时极难应对),并希望在 SLA 保障下获得专用的预留容量。CoreWeave 相对于超大规模云服务商的优势在于,同等 GPU 代际的成本降低了 50-80%,能更快地访问新的 NVIDIA 硬件,以及专为 ML 构建而非从通用云改造而来的基础设施。
CoreWeave 不适合什么
CoreWeave 不是为独立开发者、学者或小型团队准备的平台。它没有免费层,没有针对探索性工作负载的信用卡自助服务,也没有调用端点并按 Token 付费的托管推理 API。如果您正在寻找这方面的服务,Replicate 或 RunPod 可以满足这些用例。如果您想要一个无需管理集群的完整无服务器推理层,Modal 或 Groq 会更合适。
如果您的组织有与能源采购相关的 ESG 或可持续性要求,CoreWeave 也不是正确的选择。其数据中心依靠标准电网供电;对于该细分市场,Crusoe 的搁浅能源模型是一个真正的结构性差异化优势。
缺乏强大 Kubernetes 和 DevOps 能力的团队应谨慎对待。该平台的强大之处在于其裸金属 Kubernetes 编排,但同样的架构也带来了陡峭的设置和运营负担。CoreWeave 的支持是企业级的,但它不是一个抽象了基础设施决策的托管 ML 服务。
如果您正在进行单节点微调、构建原型、在没有多年计算承诺的初创预算下运营,或者主要需要推理而非训练基础设施,请跳过 CoreWeave。Lambda Labs、RunPod 和 Modal 将以极低的成本和运营开销满足这些需求。
用户反复遇到的挫折
在社区讨论和评论中,最一致的抱怨是缺乏自助服务路径。要在任何有意义的规模上开始使用 CoreWeave,都需要与客户经理接洽,对于预留容量,还需要进行合同谈判。这对于企业细分市场是合适的,但对于希望快速评估平台的团队来说,这是一个难以逾越的障碍。
只有在签订承诺合同的情况下,规模化定价才是可预测的。按需费率是公开列出的,但企业级工作负载是定制报价的。团队报告称,如果不经过销售流程,很难预测实际的每月成本,这给需要在会议前拿到具体数字的预算审批工作流带来了摩擦。
需求激增期间的 GPU 可用性是一个反复出现的问题,特别是对于最新的 Blackwell 硬件。B300 和 GB300 NVL72 需要联系销售,且没有公布可用性时间表,这意味着为前沿硬件制定容量计划的团队即使在签订合同后也面临着不确定性。
Kubernetes 的复杂性障碍绊倒了低估 DevOps 开销的团队。CoreWeave 提供的是 Kubernetes 原生基础设施,而不是托管的笔记本环境或无服务器推理层。没有在 GPU 规模上运营过 Kubernetes 集群的组织会发现,他们将大量的工程时间花在了基础设施上,而不是模型工作上。
2025 年末悬而未决的证券诉讼(针对德克萨斯州 Denton 数据中心建设延误的集体诉讼,导致市值损失 $14 billion)给将供应商稳定性纳入基础设施决策的采购团队带来了不确定性。截至 2026 年 4 月,关于 CoreWeave 向投资者隐瞒已知延误的指控仍未解决。
用户评价
暂无评价,快来分享你的第一条体验吧!
登录 后即可撰写评价。
相关文章
与 CoreWeave 相关的指南和文章。

OpenAI GPT-Realtime-2 (May 2026): Pricing, Latency & 30-Min Voice Agent

Grok 4.3 API for Agents (May 2026): Pricing, Benchmarks, Migration

Mistral Medium 3.5 Self Host: 77.6% SWE-Bench on 4 GPUs (2026)

Does API Cost More Than a Subscription for Claude Opus 4.8, GPT-5.5, and Grok?

Coding Ate Enterprise AI (2026): The $4B Use Case, Anthropic’s Share, and Seat vs API Math
