跳到主要内容
Vantaige
Anyscale screenshot
Anyscale logo

Anyscale

付费

Anyscale 是由创建 Ray 的加州大学伯克利分校(UC Berkeley)团队构建的托管式 Ray 集群平台。它能够跨多云 GPU 集群处理分布式机器学习训练、批量推理、微调和模型服务,且无需进行基础设施管理。

功能:API

Anyscale 是一个基于 Ray 构建的托管云平台。Ray 是由 Robert Nishihara、Ion Stoica 和 Philipp Moritz 在加州大学伯克利分校(UC Berkeley)最初开发的开源分布式计算框架。该公司由编写 Ray 的同一批研究人员于 2019 年创立,使其成为需要托管 Ray 基础设施的团队的权威商业产品。它解决的核心问题是运维层面的:如果没有专门的平台团队,跨多节点 GPU 集群运行分布式 Python 工作负载很难进行配置、监控和调试。Anyscale 负责处理这一层,让机器学习工程师可以专注于代码。

该平台涵盖了完整的机器学习计算生命周期:通过 Ray Train 进行分布式训练,通过 Ray Data 进行大规模数据预处理,通过 Ray Serve 进行在线和批量模型服务,通过 Ray RLlib 进行强化学习,以及跨数百个 GPU 编排微调流水线。2025 年,Anyscale 推出了 Anyscale Runtime:这是一个基于开源 Ray 构建的 API 兼容引擎,具有专有优化功能。与标准开源 Ray 相比,它可将特征预处理速度提高多达 10 倍,将图像批量推理成本降低 6 倍,并将模型服务的请求吞吐量提高 7 倍。已确认的生产客户包括 Coinbase、Runway、Character.ai、Physical Intelligence 等。OpenAI 和 Cohere 都曾公开讨论过大规模使用 Ray 进行 LLM 训练。

2026 年的 Anyscale 实际能做什么

Anyscale 位于原始云基础设施(AWS、GCP、Azure、CoreWeave、Nebius)和您的机器学习代码之间。您可以使用 Ray API 编写 Python 代码:使用 @ray.remote 装饰函数,使用 Ray Data 进行分布式 ETL,使用 Ray Train 进行多 GPU 模型训练,使用 Ray Serve 部署推理端点。Anyscale 负责配置和管理集群、处理自动扩展、提供可观测性仪表板,并在各个工作区执行安全和治理策略。

计算模型采用按需付费(pay-as-you-go)模式,无月度平台费:NVIDIA T4 为 $0.57/hour,A100 为 $4.96/hour,H100 为 $9.29/hour,H200 为 $10.68/hour。新账户可获得 $100 的入门赠金,并可访问免费的开发工作区(仅在作业运行时才需支付计算费用)。企业团队在 BYOC(Bring Your Own Cloud)部署模式下,可针对现有的云 GPU 预留实例使用具有批量折扣的承诺合同。

2025 年新增的产品功能意义重大。Lineage Tracking(截至 2025 年 10 月的 Ray Summit 仍处于内测阶段)允许团队将完整的数据到模型流水线可视化为交互式图表,并集成了 MLflow、Weights and Biases 和 Databricks Unity Catalog。Global Resource Scheduler 可跨预留容量、按需实例和竞价 GPU 管理作业优先级,这对于在训练运行中平衡成本和周转时间的团队非常有用。Anyscale on Azure 作为带有 Azure Entra ID 集成的第一方 Azure Portal 服务推出了内测版,超越了其最初的 AWS/GCP 阵地。

Anyscale 与 Modal 和 Databricks 的定位对比

Anyscale vs. Modal:Modal 是一个无服务器函数平台。您使用 @app.function() 装饰 Python 函数,Modal 会在每次调用时启动容器,具有亚秒级冷启动和按秒计费的特点。没有需要配置或维护的持久集群。这种模式非常适合突发性推理端点、短期批处理作业以及不想学习分布式计算原语的开发人员。Anyscale 则要求您了解 Ray 的 actor 模型、对象存储、放置组和任务调度,因为这些概念直接映射到您的训练作业的运行方式。回报是,对于在 H100 集群上持续数小时或数天的多节点训练运行,Anyscale 的集群管理和性能优化能力远远超过 Modal 的无服务器模型所能支持的范围。目标团队也不同:Modal 吸引运行推理 API 和数据流水线的 Python 优先开发人员;Anyscale 则吸引运行大规模训练的机器学习平台工程师。

Anyscale vs. Databricks:vLLM 及类似的推理框架通常与基于 Spark 的数据流水线一起在 Databricks 上运行。Databricks 是一个端到端的数据智能平台:它涵盖了数据摄取(Delta Lake)、SQL 分析(Photon 引擎)、特征工程(Spark)、实验跟踪(MLflow)和模型服务(Mosaic AI)。对于需要在单一受管平台中进行数据工程和机器学习的组织来说,Databricks 具有 Anyscale 无法比拟的深度。Anyscale 没有 SQL 层、数据仓库或原生 Spark 支持。但对于纯机器学习团队来说,优势则截然相反:Anyscale 具有更轻量的运维足迹、更快的集群启动时间,以及在 LLM 训练和强化学习等以 Python 为中心的分布式工作负载上优于 Spark 的 Ray 原生编程模型。已经为 Databricks 付费的团队有时会并行运行 Anyscale,用于 Spark 不适用的训练后流水线。

第三个值得比较的是:通过 KubeRay(开源 Kubernetes 运算符)自托管 Ray。KubeRay 是免费的:您只需支付云计算成本。Anyscale 增加了平台费用,以换取消除对 Kubernetes 专业知识的要求、提供 Anyscale Runtime 性能提升以及提供支持 SLA。对于拥有强大基础设施团队的团队来说,KubeRay 是一个真正的替代方案。对于没有此类团队的团队来说,Anyscale 带来的运维节省往往足以证明其溢价是合理的。

“Ray 和 Anyscale 与我们的愿景不谋而合:更快地迭代、更智能地扩展以及更高效地运营。” - Coinbase 高级机器学习平台工程师,anyscale.com,2025

在 Anyscale 上运行集群的实际体验

开发体验始于 Anyscale Workspace,这是一个连接到 Ray 集群的持久云开发环境。您可以在类似 VS Code 的界面中编写代码,或从本地 IDE 连接,运行作业并进行迭代,而无需重新配置。当您提交生产作业时,Anyscale 会根据您配置的资源池对其进行调度。

难点在于 Ray 的编程模型本身。分布式计算概念渗透到了抽象层中。当整个集群的工作内存被尚未垃圾回收的对象填满时,就会出现 ObjectStoreFullError。序列化开销是真实存在的:在远程任务之间传递 5-10 MB 的 Python 字典会遇到 Ray GitHub 问题跟踪器中记录的性能瓶颈。在 Anyscale 2025 年增加可观测性功能之前,调试分布式故障意味着要在各个工作节点之间关联日志,而没有统一的追踪。截至 2025 年,Anyscale 现已全面提供 Ray Data、Ray Train 和 Task Dashboards,将大部分内容整合到单一视图中,但刚接触分布式计算的团队在最初几周仍会面临陡峭的学习曲线。

Anyscale 自己的文档也坦诚地承认了这一点:“Ray 的新用户通常会因为从第一天起就需要理解多个复杂的概念而感到不知所措。” 新的 Agent Skills 产品(于 2026 年全面上市)利用 AI 帮助工程师诊断集群故障、规划 GPU 内存分配以及解答 Ray API 问题,这在一定程度上自动化了最常见的摩擦点。

“Anyscale Endpoints 为我们提供了比替代方案高 5 到 8 倍的成本优势。” - Siddartha Saxena,Merlin 首席技术官,Anyscale Endpoints 发布会,2023 年 9 月

Anyscale 是为谁构建的

Anyscale 面向定期运行分布式工作负载的公司的机器学习平台工程师和机器学习基础设施团队。主要用例包括多节点分布式训练(LLM 预训练、后训练、微调)、大规模批量推理(处理数百万张图像或文档)、具有自动扩展功能的实时模型服务以及强化学习流水线。像 RunPod 或 Lambda Labs 这样的公司服务于按小时租用单个 GPU 的个人研究人员;而 Anyscale 则专为需要跨数十或数百个 GPU 进行集群编排的团队而设计。

企业级打包方案在这里至关重要。BYOC 允许大型组织将数据保留在自己的云账户中,这满足了安全和合规团队的要求。24x7 SLA 支持层、无限制的支持案例以及 Unity Catalog 治理集成,这些都是个人 GPU 租赁平台所不具备的功能。Physical Intelligence、Runway 和 Character.ai 等计算密集型 AI 公司都在生产环境中使用 Anyscale。

正在将 Anyscale 与 Replicate 或 Together AI 一起评估用于纯推理工作负载的团队应注意,这些平台更简单但灵活性较差:它们非常适合通过 API 提供预训练模型服务,但不支持多节点分布式训练或自定义 Ray 流水线。除非您还在进行大规模训练或微调,否则对于纯推理用例来说,Anyscale 显得大材小用。

Anyscale 不是什么

Anyscale 不是一个无服务器推理平台。如果您需要部署单个模型端点并接收 API 请求,Modal 的起步成本更低且更简单。它也不是一个完整的数据平台:没有 SQL 引擎,没有 Delta Lake,也没有跨结构化和非结构化数据的统一数据治理。它不是一个通用的云提供商:您仍然需要 AWS、GCP、Azure 或专业的 GPU 云作为底层支持。

如果您的团队以前没有接触过 Ray,并且工作负载本质上不是分布式的,请跳过 Anyscale。在租用的 A100 上进行的单 GPU 微调作业不需要集群编排。一个为几百个日活跃用户提供单一模型服务的小团队不需要 Ray Serve。只有在必须进行分布式执行(而不仅仅是为了方便)的规模下,对 Ray 编程模型的学习投资才会获得回报。对于达到这种规模的团队来说,Anyscale 可能是 2026 年可用的最强大的托管选项。

用户评价

暂无评价,快来分享你的第一条体验吧!

登录 后即可撰写评价。

相关文章

与 Anyscale 相关的指南和文章。