跳到主要内容
Vantaige
Vast.ai screenshot

Vast.ai 是一个点对点 GPU 租赁市场,独立主机提供商按市场价格列出算力。H100 约 $0.90/小时起,RTX 4090 约 $0.34/小时起。价格远低于托管云,但在可靠性和设置复杂性上需要做出权衡。

功能:API

Vast.ai 是一个去中心化的 GPU 租赁市场,由 Jake Cannell 于 2018 年创立。该平台本身不拥有 GPU 集群,而是将独立主机提供商(个人、数据中心、托管服务提供商)与需要算力进行 AI 训练、推理和渲染的租户连接起来。定价由供需关系决定,这就是为什么在同等硬件下,Vast.ai 的价格始终比托管云低 60-80%。截至 2026 年初,该平台列出了来自 1,400 多家提供商的 20,000 多张 GPU,涵盖 68 种 GPU 类型,从消费级 RTX 显卡到 H100、H200 和 B200 企业级硬件应有尽有。

其核心产品是按需 GPU 实例,可通过 Web 控制台、CLI 或 REST API 进行配置,并按秒计费。租户可以搜索、按 GPU 类型和可靠性评分进行过滤,然后在几秒钟内部署 Docker 容器。2025 年 12 月,Vast.ai 推出了其 Serverless 产品,为推理工作负载增加了全自动 GPU 扩展功能,包括预测性负载优化和多工作组(multi-workergroup)端点。该平台拥有 SOC 2 Type I 和 II 认证,并为处理敏感数据的团队提供可选的 Secure Cloud 模式(符合 ISO 27001 和 HIPAA 标准)。

2026 年 5 月的 Vast.ai 实际功能

Vast.ai 运营着三种不同的算力产品。最初的 GPU Cloud 是一个按需市场,租户选择一台机器,设置最高出价,并在该主机的硬件上启动 Docker 容器。计费按秒计算,包含活动 GPU 时间、存储(即使实例暂停也会收费)和出站带宽的独立计费项。

第二个产品是 Clusters,它提供带有 InfiniBand 网络的专用多节点设置,适用于单节点无法容纳的大型分布式训练任务。这属于非商品化服务,需要与平台直接协调。

第三个产品是 Vast.ai Serverless,于 2025 年 12 月 10 日推出。该层在分布式主机网络中自动处理冷启动、自动扩展和任务路由。Python SDK 装饰器允许开发者像调用本地代码一样调用推理函数,而基础设施则在远程运行。2026 年 4 月的产品更新增加了兼容 OpenAI 的端点以及无需依赖仪表板的 Python 原生部署路径。

截至 2026 年 4 月,可用的硬件类型包括全系列消费级 RTX(3060 至 5090)、数据中心 A100 和 H100 变体、L40S、H200、B200,以及 2024 年 5 月添加的 AMD Radeon/Instinct 硬件,当时 Vast 成为首个增加 AMD 支持的主要 GPU 租赁市场。在宣布支持 AMD 的同时,该公司报告称自 2019 年以来实现了 265% 的同比增长,其中 2024 年的增长率更是高达 310%。首席执行官 Jake Cannell 将 AMD 的扩张定位为一项深思熟虑的供应端策略:“增加对 AMD 的支持有助于 Vast 延续这一趋势并继续在行业中保持领先。”实际效果是,拥有闲置 AMD 硬件的托管服务提供商现在可以将其列在市场上,从而在不需要 Vast.ai 自行购买任何硬件的情况下扩大了供应端。

该平台每月 700,000 多笔交易和 123,000 多名付费客户反映了其偏向技术从业者的用户群。典型的 Vast.ai 用户不是那种点击注册链接后需要引导教程的人。他们已经知道自己需要什么 GPU、模型需要多少 VRAM,以及如何编写 Dockerfile。平台以托管云无法匹敌的价格优势来回报这种专业知识。同样,这种知识门槛也是 Vast.ai 并不适合所有团队的最大原因。

Vast.ai 与 RunPod 和 Lambda Labs 的定位对比

GPU 云领域大致分为三个层级。托管企业云(Lambda Labs、CoreWeave)拥有自己的硬件,提供可靠性 SLA,并据此收费。混合托管平台(RunPod)运营自己的数据中心,同时也代理第三方主机。市场平台(Vast.ai)不拥有任何硬件,让供需关系决定价格。这种结构性差异解释了 Vast.ai 的价格优势及其可靠性上限。

与 RunPod 相比,Vast.ai 通常在原始每小时价格上胜出,有时优势巨大。A100 SXM 80GB:RunPod $0.79/小时 vs Vast.ai $0.67/小时。L40:RunPod $0.69/小时 vs Vast.ai $0.31/小时。H100 80GB:RunPod $1.50-1.99/小时 vs Vast.ai $0.90-1.87/小时(取决于主机验证层级)。RunPod 运营自己的“Secure Cloud”数据中心,正常运行时间约为 99.5%,并为常见的 ML 框架提供一键部署模板。Vast.ai 没有同等的托管层级,除非你选择 Secure Cloud,但这会缩小大部分价格差距。2026 年定价分析的诚实总结是:“Vast.ai 通常在原始每小时 GPU 价格上胜出(有时优势很大),而 RunPod 通常在‘我只需要它能正常工作’的便利性上胜出。”

Lambda Labs 是另一个常见的比较对象,针对希望拥有专注于 ML 的支持人员的托管云的研究团队和企业客户。Lambda 的 A100 成本约为 $1.29/小时,而 Vast.ai 同等硬件的成本为 $0.52-0.80/小时,溢价达 60-150%。Lambda 的 GPU 目录较窄(A100、H100、A10G、RTX 6000 Ada),H100 在需求高峰期可能会售罄,且定价是固定的而非市场驱动。Lambda 提供的回报是:专门的支持工程师、清晰的入门流程,以及不依赖于独立第三方主机行为的基础设施。对于有严格数据处理要求或不愿承担基础设施可变性风险的团队来说,Lambda 的可预测性证明了其成本的合理性。对于预算有限且熟悉 Docker 的研究人员来说,Vast.ai 通常仅在经济性上就能胜出。

与 CoreWeave、Crusoe、Modal 和 Replicate 相比,Vast.ai 占据了不同的定位。CoreWeave 是一家超大规模的托管提供商;其 H100 按需运行价格为 $3.90+/小时。Crusoe 专注于企业合同的可持续算力。Modal 和 Together AI 完全抽象了基础设施,提供无服务器推理 API,用户无需配置实例。Vast.ai 的 Serverless 产品现在在推理方面与 Modal 和 Together AI 有部分重叠,但核心市场产品仍然是基础设施优先:用户仍然需要配置 Docker 容器并管理自己的依赖项。

“在运行 ML 实验时,Vast 为我节省了数万美元。” - tehsauce,Hacker News,2023 年 3 月
“我们扩展到了 46 台 H100 服务器,在 38 分钟内完成了一项 100,000 份文档的 LLM 丰富任务,成本仅为典型云成本的四分之一。” - Anna Bosch,Launchmetrics 数据智能副总裁,2025 年 12 月

日常租赁的真实情况

工作流程:充值(最低 $5),通过 GPU 类型、VRAM、可靠性评分、验证状态和价格过滤搜索可用报价,然后部署 Docker 镜像。按秒计费立即开始;即使实例停止,存储计费也会继续。CLI 和 Python SDK 支持编程式搜索和配置,这对于希望自动寻找符合条件的最便宜可用实例的批处理工作流非常重要。

可中断实例(Interruptible instances)允许主机在短时间通知(通常几分钟)后收回其 GPU。这些实例比同一主机的按需实例便宜 30-50%,非常适合启用了检查点(checkpoint)保存的训练任务。如果没有检查点,在 10 小时运行的第 8 小时发生中断意味着必须从头开始重新运行。

经过验证的数据中心主机成本更高(H100 为 $1.50-1.87/小时),但将可靠性差距缩小到标价之上 3-13% 的开销。未经验证的主机运行成本较低,但在计入停机和重启开销后,实际成本溢价达 20-55%。搜索界面中的可靠性评分过滤器揭示了这种风险,但并不能消除它。来自社区的实用建议:在运行超过 2-3 小时的任务时过滤出经过验证的主机,并且无论如何都要内置检查点间隔。

带宽是一个已知的短板。多位用户报告称,实际吞吐量始终比宣传的低 10 倍,这影响了大型数据集的下载时间,并减慢了依赖频繁数据传输的工作流。这是主机端的基础设施问题,平台无法通过市场机制完全控制。

Vast.ai 适合哪些人

Vast.ai 非常适合预算有限的 ML 研究人员和学生、熟悉 Docker 并运行微调或批量推理任务的独立开发者,以及进行大规模批处理且单次运行成本比单次运行可靠性更重要的团队。检查点机制可以处理重启,而节省的成本是实实在在的:RTX 4090 的价格为 $0.34/小时,而托管替代方案的价格为 $0.79-1.00/小时,在 Vast.ai 上进行 40 小时的微调运行可能只需 $14,而在其他地方则需要 $32-40。对于每周运行数十个实验的研究实验室来说,这种差异会不断累积。

该平台也非常适合构建编程式 AI 管道的组织。REST API 和 Python SDK 允许自动进行实例搜索、配置和拆除,这对于需要在没有人工干预的情况下按需启动算力的批量推理任务或模型评估管道非常重要。2025 年 12 月推出的 Serverless 产品进一步扩展了这一点,针对希望获得推理端点而无需进行实例管理的团队,现在使 Vast.ai 在该特定用例上与 Modal 和 Together AI 展开了部分竞争。

预算有限的初创团队通常使用 Vast.ai 进行开发和实验,然后过渡到托管云进行生产。经济效益强烈支持这种分离:以市场价格在 Vast 上进行原型设计,一旦模型锁定且可靠性要求明确,就在 RunPod Secure Cloud 或 Lambda 上部署生产推理。这种工作流避免了在探索阶段为托管算力支付过高费用,同时在关键环节保持了生产级的可靠性。

Vast.ai 不适合的场景

Vast.ai 不是托管云。标准实例没有正常运行时间 SLA。没有类似于 Lambda Labs 的 ML 工程人员的专门支持团队。Vast.ai 将其支持描述为人工聊天,但多份社区报告称其响应深度是基础级别的,而非基础设施专家级别。

安全性是技术经验丰富的用户最常提到的担忧。由于主机对 Docker 主机环境具有完全访问权限,理论上他们可以检查正在运行的工作负载:“Vast 是一个灰色市场,几乎没有采取任何安全措施。主机可以非常轻松地窥探你的工作负载,因为他们对 docker 主机拥有完全访问权限。” - deserialized,Hacker News,2023 年 5 月。带有 ISO 27001 的 Secure Cloud 选项为企业使用缓解了这一问题,但标准市场实例不适合涉及专有模型权重、私人训练数据或受监管个人信息的工作负载。

单容器限制了与多服务架构的集成。你无法将 Vast 干净地插入现有的 Dagster 或 Airflow 集群中;该平台配置的是单个容器,而不是编排层。对于其 AI 工作负载与现有基础设施工具紧密集成的团队来说,RunPod 或托管云在操作上更为合适。

在以下情况下请避开 Vast.ai:你的任务无法容忍在没有检查点的情况下中途运行中断,你在 Secure Cloud 之外处理敏感/PII 数据,你需要具有 SLA 保证的生产推理端点,或者你的团队缺乏 Docker 经验并需要基于模板的部署来快速推进。

用户评价

暂无评价,快来分享你的第一条体验吧!

登录 后即可撰写评价。

相关文章

与 Vast.ai 相关的指南和文章。