

Lambda Labs 为 AI 研究人员和机器学习工程师提供 GPU 云计算服务:预装 PyTorch 的按需 H100 和 B200 实例,以及配备 InfiniBand 网络、专为大规模分布式训练打造的 1-Click Clusters。
Lambda Labs(现已简称为 Lambda)是一家成立于 2012 年的 GPU 云平台,由 Stephen 和 Michael Balaban 创立,总部位于加利福尼亚州圣何塞。该公司的核心产品非常直接:按小时计费出租 NVIDIA GPU 硬件的访问权限,并预装深度学习框架,让您无需配置驱动程序即可开始训练或运行推理。Lambda 拥有并运营自己的数据中心,这使其有别于聚合第三方算力的市场模式提供商。2026 年初,该公司将其品牌定位重塑为“The Superintelligence Cloud”,这反映了在 2025 年 2 月获得 $480M D 轮融资和 2025 年 11 月获得 $1.5B E 轮融资后,其向大规模 AI 工厂基础设施的战略转型。
目前的 GPU 产品线包括 NVIDIA B200 SXM6(8-GPU 节点起价为 $6.69/GPU/hr)、H100 SXM(8-GPU 配置起价为 $3.99/GPU/hr)、H100 PCIe($3.29/hr)、GH200($2.29/hr)、A100,以及低至 $0.69/hr 的老一代显卡。每个实例启动时都配备了 Lambda Stack:已预装 Ubuntu Linux、PyTorch、TensorFlow、CUDA toolkit 和 cuDNN。其旗舰集群产品 1-Click Clusters 可配置 16 到 2,000+ 个 H100 或 B200 GPU,通过 NVIDIA Quantum-2 InfiniBand 连接,专为分布式训练工作负载打造。按需实例免收出站流量费,且无最低消费要求。托管的 Inference API 和 Lambda Chat 产品已于 2025 年 9 月下线;Lambda 现在完全专注于 GPU 计算基础设施。
2026 年 4 月 Lambda 的核心业务
剥离掉非核心部分,Lambda 的产品集主要包含三项:按需 GPU 虚拟机、预留多节点集群以及 Lambda Stack 软件环境。通过 Web 仪表板或 REST API,按需实例可在几分钟内启动。您将获得对 Linux 实例的 root SSH 访问权限,且 CUDA、PyTorch 和 TensorFlow 均已配置就绪。JupyterLab 可在浏览器中直接访问。持久化 NFS 存储可附加并共享给同一区域内的多个实例。
1-Click Cluster 产品是 Lambda 在前沿实验室层级参与竞争的利器。集群规模从 16 到 2,000+ 个 GPU 不等,运行 HGX B200 或 H100 硬件,配备 Quantum-2 InfiniBand 和用于集合通信的 SHARP 加速。您可以自由选择编排方式:托管的 Kubernetes 或 Slurm。SOC 2 Type II 认证使其能够满足企业合规性要求。最低租期为两周,最长可达一年,超出部分支持定制化定价。截至 GTC 2026,Lambda 已成为 NVIDIA Vera CPU 平台的首发合作伙伴,并宣布建设一个拥有 10,000+ 个 Blackwell Ultra GPU 的设施。
Lambda 不再提供的服务:托管推理 API 端点。兼容 OpenAI 的 Inference API 和托管了 DeepSeek-R1 等开源模型的 Lambda Chat 均已于 2025 年 9 月 25 日关闭。在这些产品上构建服务的团队在服务切断前仅收到了大约两周的警告通知。
Lambda 与 CoreWeave 和 RunPod 的定位对比
CoreWeave 是最大的专用 GPU 云,其 Kubernetes 原生架构专为大规模企业基础模型训练而设计。CoreWeave 提供 GB200 实例(截至 2026 年初,Lambda 拥有 B200 SXM6,但没有 GB200 NVL72 机架级单元),多区域覆盖(包括 2026 年启用的伦敦数据中心),并与 NVIDIA 的软件栈深度集成。CoreWeave H100 按需定价约为 $6.16/hr,明显高于 Lambda $3.99-4.29/hr 的 SXM 价格区间。权衡之处在于:CoreWeave 需要大量的合同承诺,不适合仅凭信用卡的独立研究人员使用,而 Lambda 则支持按小时计费的单 GPU 租赁。CoreWeave 的财务结构也备受关注:该公司在 2024 年营收 $1.9B 的情况下背负了 $8B 的债务,据报道当年亏损达 $863M。
RunPod 采用市场模式,在其 Community Cloud 中聚合了来自第三方数据中心运营商的算力,同时提供由经过验证的提供商组成的 Secure Cloud 层。RunPod 的 Community Cloud 提供低至 $1.99/hr 的 H100 实例,比 Lambda 的 H100 PCIe 价格便宜约 40-50%,这使其成为能够容忍硬件质量波动和潜在抢占风险的预算敏感型研究人员的首选。RunPod 还提供用于推理的 Serverless GPU 端点(按秒计费),而 Lambda 已不再提供此服务。关键的机制差异在于:Lambda 拥有自己的硬件并持有 SOC 2 Type II 认证,这使其适合 RunPod 社区层无法满足的企业级和高合规性工作负载。Lambda 还提供基于 InfiniBand 网络的多节点集群;而 RunPod 最高仅支持无 InfiniBand 的 8-GPU 单节点配置。
"The reliability of the throughout is something I can't find on other OpenRouter offerings." - mpapili,Lambda DeepTalk 论坛,2025 年 9 月(对 Inference API 下线的反应,承认 Lambda 在托管模型上的质量确实难以替代)
实际工作流体验
研究人员典型的 Lambda 工作流如下:登录仪表板,选择 GPU 类型和数量,附加或创建持久化存储,然后启动。实例在不到两分钟内即可就绪。使用密钥通过 SSH 登录,PyTorch 已可运行,CUDA 已配置完毕,Jupyter 可通过浏览器 URL 访问。对于独立研究人员或小型团队来说,这省去了自托管设置中令人头疼的数天驱动调试和 CUDA 冲突解决时间。
当规模扩大和达到容量极限时,摩擦便会显现。按需 GPU 的可用性一直是 Lambda 记录中最持久的问题。一位拥有六个月 Lambda 使用数据的 Medium 评论员发现,当天 A100 的配置成功率仅为 64%,这意味着大约三分之一的请求当场失败。在 2024 年底的一个客户项目中,H100 出现了长达 26 小时的“暂时不可用”状态,这一事件成为了促使该评论员转向竞争对手的转折点。据报道,随着 Lambda 扩大基础设施投资,2026 年的可用性有所改善,但对于时间敏感型工作负载而言,风险依然存在。
对于集群工作负载,1-Click Cluster 产品更接近于托管服务:Lambda 负责 InfiniBand 架构配置、Kubernetes 或 Slurm 设置以及存储配置。权衡之处在于最低租期为两周,且定价(预留条款下 H100 为 $6.16/GPU/hr,B200 为 $9.86/GPU/hr)明显高于按需实例。Lambda 的产品线中没有任何竞价或可抢占式定价选项。
"Over six months, my success rate for same-day A100 provisioning was about 64%, meaning roughly one in three times I couldn't get compute on-demand." - Alexa V.,Medium,2024 年底(记录了反复出现的可用性故障,最终促使其转向 vast.ai)
Lambda 的目标用户
Lambda 最适合需要可靠、合规级 GPU 访问权限,但又不想面对超大规模云设置复杂性的 ML 研究人员和中小型 AI 团队。Lambda Stack 的价值主张是实打实的:从刷信用卡到运行 PyTorch 训练任务,整个过程不到五分钟。对于大学、研究实验室和获得融资的 AI 初创公司来说,Lambda 处于价格优势(与 AWS 或 Google Cloud 相比,尽管后者在 2025 年中进行了降价,但在同等硬件上的费率仍是 Lambda 的 2-3 倍)和操作简便性的完美交汇点。
对于前沿规模的分布式训练,如果团队希望获得托管的 InfiniBand,又不想受限于 CoreWeave 的最低合同要求或财务复杂性,1-Click Clusters 是 CoreWeave 的可靠替代方案。据报道,Lambda 的客户群包括美国排名前 10 的所有大学以及十大科技公司中的五家,这充分证明了其获得 SOC 2 认证的基础设施在企业级的可信度。
2025 年 2 月由 Andra Capital 和 SGW 领投,NVIDIA、Andrej Karpathy、ARK Invest 和 In-Q-Tel 参投的 $480M D 轮融资,验证了 Lambda 作为重量级基础设施参与者的地位。随后在 2025 年 11 月由 TWG Global 领投的 $1.5B E 轮融资,进一步证实了该公司建设千兆瓦级 AI 工厂的雄心。
Lambda 不适合的场景
Lambda 不是通用云。它没有托管数据库、没有无服务器计算、没有 CDN、没有负载均衡器、没有身份和访问管理原语,也没有多区域 VPC 网络。如果您的技术栈在 GPU 计算之外还需要上述任何功能,您将需要与超大规模云提供商进行混合部署,并且必须自行管理其中的复杂性。
截至 2025 年 9 月,Lambda 已不再是托管推理 API 提供商。Inference API 和 Lambda Chat 在仅提前两周通知的情况下突然关闭,让在该层级上构建生产服务的开发人员失去了明确的迁移路径。社区论坛的反应非常激烈:"How can you just announce that the Inference API will be sunsetted and that's it?"(dmatic,DeepTalk,2025 年 9 月 4 日)。对于任何将 Lambda 评估为构建平台而不仅仅是算力租赁平台的人来说,这一事件都值得深思。
在市场的最底层,Lambda 并不具备价格竞争力。RunPod 的 Community Cloud 在社区硬件上提供 $1.99/hr 的 H100 实例和低于 $1/hr 的 A100 实例。Vast.ai 聚合了更便宜的算力供应。有记录显示,一位用户通过将同等工作负载迁移到 vast.ai,将其每月的 Lambda 账单从 $1,400 降至 $590。Lambda 相对于市场层的溢价在于其数据中心所有权、SOC 2 认证和硬件一致性,但对于将价格作为首要考量因素的团队来说,应该评估其他替代方案。
在以下情况下请跳过 Lambda:您需要竞价/可抢占式定价来优化成本,您需要托管推理端点而不是原始计算能力,您的工作负载需要欧洲或亚洲的低延迟访问,或者您需要 GPU 计算以外的云服务。
用户评价
暂无评价,快来分享你的第一条体验吧!
登录 后即可撰写评价。
相关文章
与 Lambda Labs 相关的指南和文章。

Mistral Medium 3.5 Self Host: 77.6% SWE-Bench on 4 GPUs (2026)

Grok 4.3 API for Agents (May 2026): Pricing, Benchmarks, Migration

Run Open Source AI Models Locally: Battle-Tested Guide

Does API Cost More Than a Subscription for Claude Opus 4.8, GPT-5.5, and Grok?

OpenAI GPT-Realtime-2 (May 2026): Pricing, Latency & 30-Min Voice Agent
