

Modal 是一个无服务器 GPU 平台,让 Python 开发者无需接触底层基础设施即可在云端 GPU 上运行 AI 工作负载。只需编写一个函数并添加一个装饰器,Modal 就会自动处理容器、扩展以及精确到秒的计费。
Modal 是一个无服务器 AI 基础设施平台,让开发者无需管理容器、Kubernetes 集群或 CUDA 驱动程序,即可在云端 GPU 上运行 Python 代码。Modal 由 Erik Bernhardsson 于 2021 年创立(他曾领导 Spotify 的大规模机器学习系统,并担任 Better.com 的 CTO),旨在解决一个特定的痛点:在本地编写 Python 与在云端 GPU 上大规模运行之间的鸿沟。该平台在 2025 年 9 月由 Lux Capital 领投的 8700 万美元 B 轮融资后,以 11 亿美元的估值跻身独角兽行列,其企业客户包括 Meta、Scale AI 和 Ramp,均在该平台上运行生产级工作负载。
Modal 的核心机制是 Python 装饰器。只需使用 @app.function(gpu="H100") 注解一个函数,平台就会自动构建容器、配置 GPU、处理从零到数百个实例的自动扩展,并在空闲时销毁所有资源。除了推理,Modal 还能处理训练任务、微调流水线、批处理作业、安全的沙盒代码执行(适用于运行不受信任代码的 AI 智能体)以及协作式笔记本。计费按实际使用的计算秒数计算,不收取空闲费用。免费的 Starter 计划包含每月 $30 的计算额度,且无需绑定信用卡。
截至 2026 年 4 月,Modal 的实际功能
Modal 提供四大核心产品。Inference(推理)让您可以在自动扩展的 Web 端点后部署 LLM、图像生成模型和音频流水线。Training(训练)可处理用于微调任务的单节点和多节点 GPU 集群。Sandboxes(沙盒)为需要大规模执行不受信任代码的 AI 智能体提供可通过编程方式生成的、基于 gVisor 隔离的环境,并内置网络限制和 CIDR 白名单。Batch(批处理)可扩展至数千个容器,用于数据处理和离线推理工作负载。
对于大多数工作负载,容器的冷启动时间在 2-4 秒之间。2025 年 7 月,Modal 发布了处于 Alpha 阶段的 GPU 内存快照功能:该功能可对完整的 NVIDIA GPU 状态(包括设备内存、CUDA 内核和执行上下文)进行检查点保存,从而使后续恢复完全跳过模型权重加载过程。启用快照后,原本需要 45 秒冷启动的 Qwen2.5 vLLM 部署降至 5 秒。Parakeet 音频转录模型则从 20 秒降至 2 秒以内。
该平台运行在多云容量池上(主要为 Oracle Cloud Infrastructure),并支持跨区域的智能调度。GPU 可用性涵盖从 T4($0.59/hr)到 H100($3.95/hr)、H200($4.54/hr)直至 B200($6.25/hr)。CPU 和内存与 GPU 时间一起按秒级粒度单独计费。
"对于 10GB 以上的模型,Modal 拥有我见过的最快冷启动速度。" - AndresSRG,Hacker News,2025 年 6 月
Modal 与 Replicate 和 Lambda Labs 的定位对比
Modal vs. Replicate:Replicate 是一个带有 REST API 前端的模型注册表。它托管了数千个预容器化的开源模型(Stable Diffusion、SDXL、Flux、LLaMA 变体、Whisper),任何开发者只需几行代码即可调用,无需任何部署工作。Replicate 的 Cog 工具可处理自定义模型容器化,但主要体验仍是指向托管模型。Modal 则要求您编写并部署自己的 Python 代码,这意味着完全的灵活性(任何依赖项、自定义逻辑、多步流水线),但您需要自行管理服务层。对于不太受欢迎的模型,Replicate 的冷启动时间可能超过 60 秒;而 Modal 始终保持在 2-4 秒。实际的选择标准是:当您想在零设置的情况下立即调用已知的开源模型时,请使用 Replicate。当您需要自定义代码、非标准依赖项或将多个模型组合成流水线时,请使用 Modal。
Modal vs. Lambda Labs:Lambda 在 2025 年 9 月弃用了无服务器 GPU,现在提供按小时计费的专用按需 GPU 虚拟机。您需要通过 SSH 登录、配置环境,并为预留时间付费,无论 GPU 是否在执行工作。Lambda 的方法提供了最大的控制权,并且对于持续 24/7 的训练任务来说,由于没有平台乘数,其每 GPU 小时费率是最低的。Modal 采用按秒计费且可缩放至零的模式,对于突发性或不频繁的工作负载更为经济。根本区别在于:Lambda 提供的是裸金属节点;而 Modal 提供的是功能即服务(FaaS)接口。Lambda 面向的是运行多日训练任务、希望将每 GPU 小时成本降至最低且不介意基于 SSH 进行基础设施管理的研究人员。Modal 则面向需要快速迭代和自动扩展且没有运维团队的应用程序开发者。
"每当有团队询问计算资源时,我们总是告诉他们使用 Modal。" - Aakash Sabharwal,Scale AI 工程副总裁,2025 年 9 月
Modal 的日常使用体验
典型的 Modal 工作流从 CLI 开始。您安装包、进行身份验证并编写 Python 函数。装饰器语法将镜像构建(pip 包、系统依赖项、密钥)与函数定义捆绑在一起。运行 modal deploy 会推送容器规范并注册端点。后续部署仅重建已更改的层。
对于推理,部署通常是一个包含 @enter 方法(在容器启动时运行一次以加载模型权重)和带有 @method 装饰器的推理函数的类。容器在可配置的空闲超时时间内保持预热状态,然后缩减。唤醒时的冷启动是产生延迟的地方,可以通过 keep_warm 参数来缓解,该参数会保留指定数量的预热副本,代价是持续的计算费用。
密钥管理、用于持久化存储的卷挂载、cron 调度和 Web 端点路由均通过 Modal 的 SDK 处理,而非外部服务。Ramp 的团队使用 Modal 运行 LLM 微调流水线,据报道,与主要 LLM 提供商相比,人工干预减少了 34%,成本节省了 79%。Scale AI 运行 Modal Sandboxes 进行强化学习实验,按需生成数千个并发的隔离环境。
Modal 适合哪些人群
Modal 适合熟悉 Python 且希望在不使用 Kubernetes 的情况下访问 GPU 的 ML 工程师和后端开发者。该平台非常适合具有突发性、不可预测工作负载模式的团队:流量激增的推理 API、每晚运行的批处理作业、扩展至数千个并发环境然后归零的智能体沙盒。按秒计费模式直接使活跃时间少于 24/7 的工作负载受益。
构建 AI 原生产品的初创公司能获得最大的杠杆效应:在一个平台下进行推理、训练、微调和沙盒操作,意味着更少的基础设施依赖和更快的迭代速度。每月 $30 的免费额度让原型设计变得触手可及。使用 Team 或 Enterprise 计划的企业团队可获得 HIPAA 兼容性、审计日志、Okta SSO 以及用于出口控制的静态 IP 代理。
Modal 不适合的场景
Modal 不是一个模型市场。它没有可供调用的预托管模型库。如果您想在零部署代码的情况下运行 Flux 或 Stable Diffusion,Replicate 可以做到。Modal 要求您自己编写服务代码。
对于持续 24/7 的工作负载,Modal 并非成本最优解。生产乘数适用于基础 GPU 费率:非抢占式加上区域乘数,对于美国工作负载,最高可达标价的 3.75 倍。如果您全天候运行连续的训练任务,按小时租用专用的 Lambda 或 CoreWeave GPU 节点会更便宜。无服务器模式对于突发使用模式是高效的,但不适合持续饱和的状态。
Modal 不支持私有网络、自定义 VPC 或网络级别的服务间身份验证。具有严格网络隔离要求的团队,或需要 VPC 锁定数据流的受监管环境,将会遇到这一瓶颈。
最后,Modal 不是一个全栈平台。它处理计算,但不处理数据库、消息队列或前端托管。构建完整产品的团队需要将 Modal 与其他基础设施服务结合使用。其 SDK 也会造成明显的供应商锁定:使用 Modal 特定原语装饰的函数需要重写才能迁移出该平台。
用户评价
暂无评价,快来分享你的第一条体验吧!
登录 后即可撰写评价。
相关文章
与 Modal 相关的指南和文章。

Replit Pricing Explained (2026): Core vs Pro and Effort-Based Agent Billing

Grok 4.3 API for Agents (May 2026): Pricing, Benchmarks, Migration

Does API Cost More Than a Subscription for Claude Opus 4.8, GPT-5.5, and Grok?

Google Vision AI Explained (2026): Pricing Per 1,000 Units, Free Tier, and Alternatives

Mistral Medium 3.5 Self Host: 77.6% SWE-Bench on 4 GPUs (2026)
