

DeepInfra 是一个低成本、兼容 OpenAI 的推理 API,支持 150 多种开源模型,每周在其自有的 GPU 堆栈上处理数万亿个 token。它是目前价格最低的提供商之一,但在价格稳定性和技术支持方面存在一些需要权衡的已知问题。
DeepInfra 是一个云端推理平台,专为以低成本、高吞吐量运行开源 AI 模型而构建。它不是模型制造商,而是推理托管方:您向其兼容 OpenAI 的端点发送请求,模型在 DeepInfra 自有且垂直整合的 GPU 堆栈上运行,并在几毫秒内返回结果。该公司由 Nikola Borisov、Yessen Kanapin 和 Georgios Papoutsis 于 2022 年 9 月在帕洛阿尔托(Palo Alto)创立,这支团队曾开发了拥有超过 2 亿用户的消息应用 imo。到 2026 年中,该平台在八个美国数据中心每周处理近五万亿个 token,这是真正的生产级规模,而不仅仅是发布时的宣传指标。
只需一个 API 密钥即可访问 150 多种模型,涵盖文本生成、推理、嵌入、图像、语音转文本等,模型来自 DeepSeek、Llama、Qwen、Mistral、Gemma 等。对于已经在使用 OpenAI SDK、LiteLLM 或类似工具的用户来说,切换只需更改 base-URL。其最大的吸引力在于价格:Mistral Nemo 每百万 token 的输入价格为 $0.02,输出价格为 $0.04,几乎是市面上最便宜的;而专用的 H100 每小时仅需 $1.79,只是高端竞争对手价格的一小部分。DeepInfra 获得了 SOC 2 和 ISO 27001 认证,并实行零保留政策,其在 2026 年 5 月的 B 轮融资中引入了 NVIDIA 作为战略投资者。
DeepInfra 在 2026 年 6 月的运行状况
该产品的定位刻意保持“窄而深”:在精选的 150 多种模型目录上提供无服务器推理,完全按使用量计费,没有订阅费或席位许可证。文本生成是核心,但目录也涵盖了嵌入、FLUX 等图像模型、语音转文本以及重排器(rerankers),因此多模态应用可以只依赖这一家供应商。对于需要隔离的团队,DeepCluster 提供带有私有端点的专用 GPU 实例,并支持自定义或微调权重,尽管它没有托管的微调管道。公司的发展轨迹非常迅猛:2025 年 4 月 1800 万美元的 A 轮融资披露,其 token 吞吐量自种子轮以来增长了 8,000 倍;2026 年 5 月 4 日,由 500 Global 领投、NVIDIA 作为署名投资者的 1.07 亿美元 B 轮融资,伴随着在 Nemotron 推理优化方面的合作以及对 Blackwell 级 GPU 的访问权限。与 NVIDIA 的这种关系是最明确的信号,表明 DeepInfra 绝不仅仅是一个廉价 API 的噱头。
DeepInfra 对比 Groq 和 Together AI
与 Groq 相比,这是成本与速度的权衡。Groq 的定制 LPU 芯片在运行 120B 模型时速度约为每秒 476 个 token,而 DeepInfra 为 161 个,但 DeepInfra 的收费仅为前者的一小部分,且模型选择是其十倍,因为 Groq 仅在纯推理硬件上运行少数几个模型。当每一百毫秒都至关重要时,请选择 Groq;当成本和广度更重要时,请选择 DeepInfra。与 Together AI 相比,DeepInfra 显然更便宜,在相同的 Llama 模型上通常便宜 67% 到 76%,但 Together 在微调方面具有明显优势,提供了 DeepInfra 所缺乏的完整训练和部署管道,以及更深度的混合专家(MoE)模型目录。需要从一个 API 进行微调和部署的团队倾向于 Together;而优化纯推理成本的团队则倾向于 DeepInfra。在可靠性方面,来自 OpenRouter 等聚合器的路由数据表明,DeepInfra 的一些冷门端点正常运行时间较弱,这是需要反复注意的警告。
DeepInfra 让开发者感到沮丧的地方
最大的抱怨在于价格稳定性。由于模型是单独定价的,并且可能在没有太多警告的情况下发生变化,因此您的工作负载的经济成本可能会突然发生改变。
“他们用低价引诱你,然后将价格提高 400%,或者删除模型,迫使你使用更昂贵的版本。”—— Simon M.,SourceForge,2025 年 9 月。
该评论者记录了不到一个月内的三次价格变动,包括删除一个模型且没有提供替代方案。第二个问题是小众模型的性能:热门端点保持快速,但较少使用的端点在负载下性能会严重下降,而且错误报告并不总是能得到回复。
“DeepInfra 慢得像蜗牛爬一样。我真的很喜欢 DeepInfra,但似乎有些不对劲。”—— wolttam,Hacker News,2026 年 4 月。
技术支持主要通过销售表单而不是技术渠道进行,模型弃用时没有提供迁移路径,而且预付费计费层级会随着您的规模扩大而悄悄提高最低充值额,最高层级可达 $10,000。考虑到它的价格,这些都不足以成为一票否决的理由,但这也是生产团队始终配置备用提供商的原因。
谁应该使用 DeepInfra,谁不应该
DeepInfra 非常适合处理高 token 吞吐量且对成本敏感的团队;适合已经使用 OpenAI SDK 并希望通过更改 base-URL 来使用更便宜的开源模型的开发者;适合希望从单一供应商获取广泛模型目录的多模态产品;以及需要 SOC 2 或 ISO 27001 认证且要求零数据保留的买家。获得融资的初创公司还可以利用 DeepStart 计划获取十亿个免费 token。
如果您无法容忍突发且没有通知的价格或模型变动,或者您需要托管的微调管道(Together AI 更适合),或者您需要保证每个模型在结构化输出上的可靠性(Fireworks AI 在这方面更强),又或者延迟是产品的核心且 Groq 的硬件优势值得您支付溢价,那么 DeepInfra 就是错误的选择。任何在全新或小众模型上进行构建的人,在做出承诺之前都应在实际负载下测试其可靠性。
用户评价
暂无评价,快来分享你的第一条体验吧!
登录 后即可撰写评价。
相关文章
与 DeepInfra 相关的指南和文章。

Grok 4.3 API for Agents (May 2026): Pricing, Benchmarks, Migration

Google Vision AI Explained (2026): Pricing Per 1,000 Units, Free Tier, and Alternatives

Mistral Medium 3.5 Self Host: 77.6% SWE-Bench on 4 GPUs (2026)

Does API Cost More Than a Subscription for Claude Opus 4.8, GPT-5.5, and Grok?

DeepSeek V4 Pro vs Claude Opus 4.7: 5-PR Refactor Test (2026)
