跳到主要内容
Vantaige
Fireworks AI screenshot
Fireworks AI logo

Fireworks AI

付费

Fireworks AI 是一个推理平台,通过快速且兼容 OpenAI 的 API 运行开源和自定义模型。该平台由前 Meta PyTorch 工程师团队打造,其 FireAttention 引擎致力于提供业界顶尖的吞吐量,这也是 Cursor 和 Notion 等对延迟敏感的产品选择在其上运行的原因。

使用场景:模型推理与服务
功能:API

Fireworks AI 是一个推理平台,通过快速且兼容 OpenAI 的 API 运行开源和自定义 AI 模型,让工程团队无需拥有或运维 GPU 即可交付生产级的模型服务。该公司由首席执行官 Lin Qiao 带领的七位前 Meta PyTorch 工程师于 2022 年创立,其决定性优势在于技术:Fireworks 没有使用 vLLM 等通用软件来提供模型服务,而是在 CUDA 内核级别编写了自家的推理引擎 FireAttention。您可以像向 OpenAI 发送请求一样发送相同格式的请求,模型会在 Fireworks 的集群而非您的集群上运行。这里没有面向最终用户的消费者应用或仪表板。这是供开发者接入产品的纯基础设施。

该平台涵盖无服务器按 Token 计费推理、专属 GPU 部署以及托管微调(LoRA、DPO、全参数和强化学习),支持超过 400 种文本、视觉、音频和嵌入模型。DeepSeek V4、Qwen 3.7 和 Kimi K2.7 等全新开源权重模型通常会在发布当天上线,Fireworks 将此作为其核心卖点。定制引擎带来的回报是极高的吞吐量:在 DeepSeek V4 Pro 等模型上,Fireworks 每秒可处理约 167 到 174 个 Token,而原生 vLLM 堆栈仅为 40 到 80 个,且两者的每 Token 成本相当。这就是为什么 Cursor、Notion 和 Vercel 等对延迟敏感的产品会在这里运行推理,也是该平台为受监管买家提供 SOC 2、HIPAA 和 GDPR 合规认证的原因。

Fireworks AI 的核心价值(截至 2026 年 6 月)

Fireworks 稳居基础设施层。其核心单元是 API 调用:您选择一个模型,发送 OpenAI 风格的请求,Fireworks 就会在优化的硬件上运行它。FireAttention 引擎是其备受瞩目的原因,因为它将创始团队在 PyTorch 内核方面的专业知识转化为了可衡量的速度,而非单纯的营销噱头。对于已经选定开源模型且只需快速提供服务的团队来说,这就是它的全部价值所在。

围绕无服务器推理,该平台还增加了可预留特定 GPU 的专属部署、支持多种方法的托管微调、用于进一步提速的投机解码(speculative decoding),以及针对智能体工作负载的结构化输出函数调用。其背后的业务健康且正在快速扩张:Fireworks 于 2025 年 10 月 28 日以 $4 billion 的估值完成了 $250 million 的 C 轮融资,NVIDIA 和 AMD 均有参与;到 2026 年中,独立机构估计其年度经常性收入(ARR)接近 $800 million,并有报道称其正在讨论 $15 billion 的估值。这些数据并不能保证它一定适合您,但确实意味着这家供应商不会轻易倒闭。

Fireworks 与 Groq 和 Together AI 的对比

Groq 凭借硬件在原始延迟方面胜出:其定制的 LPU 芯片在 Llama 3.3 70B 上达到了每秒约 456 个 Token,首个 Token 延迟低于 300ms,这种以内存为中心的设计是软件无法复制的。缺点在于广度。Groq 仅提供约 20 种模型,且不支持微调,因此如果您的模型不在其目录中,它就完全不适用;此外,NVIDIA 在 2025 年 12 月收购了 Groq,这让其独立发展路线图变得扑朔迷离。Fireworks 牺牲了一点峰值速度,换取了 400 多种模型、首发日上线以及完整的微调套件。Together AI 是更接近的竞品,同样基于 GPU 且拥有丰富的模型目录,但在前沿的混合专家(MoE)模型上,差距是真实存在的:同样的 DeepSeek V4 Pro 基准测试显示,Fireworks 的速度接近每秒 170 个 Token,而 Together 约为 41 个,在价格相近的情况下吞吐量相差 4 倍。Together 的优势在于更长久的微调记录,以及偶尔会覆盖 Fireworks 忽略的小众模型。

在 Fireworks 上运行的真实成本

无服务器定价按每百万 Token 计算,并根据模型大小分级:参数低于 4B 的模型约为 $0.10,4B 到 16B 之间为 $0.20,16B 以上为 $0.90,特定的前沿模型单独定价(DeepSeek V4 Pro 的输入为 $1.74,输出为 $3.48)。缓存输入和批处理推理均按半价收费,这大幅降低了重复性或非紧急任务的成本。微调方面,较小模型的 LoRA 微调起价为每百万训练 Token $0.50,专属 GPU 按小时计费,H100 的价格为每小时 $7.00。

“延迟改善了 20% 到 30%,成本节省了 15% 到 25%。”—— Hussain Gagan,全栈开发者,PeerSpot,2025 年。

有两个成本现实需要注意。首先,$7.00 的 H100 处于溢价区间,因为在 RunPod 上租用裸 GPU 的价格仅为其一小部分,所以您支付的是托管引擎和合规性费用,而不是芯片本身。其次,注册时仅赠送 $1 的免费额度,且速率限制严格:未绑定信用卡的速率限制为每分钟 10 次请求,绑定后为 6,000 次,超出此限制则需要联系销售团队。

Fireworks 让团队感到受挫的地方

最常见的抱怨是 6,000 RPM 的上限。规模超过该限制的团队会遇到必须联系销售的障碍,而不是自助式的扩展空间,这会让快速增长的产品在尴尬的时刻停滞不前。其次是模型弃用:由于 Fireworks 托管的是第三方模型,上游模型被取代意味着端点消失,按名称调用该模型的生产代码就会崩溃。2025 年 11 月的一份评论汇总指出,毫无预警地突然移除模型是一个反复出现的痛点。

“随着时间的推移,大规模使用的定价可能会变得昂贵,尤其是对于团队而言。”—— 机器学习工程师,能源行业,PeerSpot,2025 年。

除此之外,按 Token 计费很难预测,且在处理高并发量时成本会迅速叠加;高级微调和部署选项的文档更新滞后于功能集;并且没有为非工程师人员提供任何界面。Fireworks 只是一个纯粹的 API,这对其目标受众来说是优势,但对其他人来说则是一堵高墙。

Fireworks 适合谁,不适合谁

它非常适合在开源模型上构建聊天、代码辅助、搜索和自动补全等实时 AI 功能的工程团队;适合需要托管微调而无需自行搭建 MLOps 的团队;以及有 SOC 2 或 HIPAA 合规要求、无法使用未经认证供应商的公司。对于那些已经超越了简单的托管 API,但尚未准备好运行自有 GPU 集群的成长型企业来说,它是最理想的选择。

它不适合非技术团队,因为没有 UI 或无代码路径。如果每 Token 成本是您的唯一指标,那么还有更便宜的供应商,例如 DeepInfra 在原始价格上就大幅低于它。高并发量的图像生成不是它的强项,因此像 Hugging Face 这样的模型中心或专门的图像托管服务能更好地满足需求。此外,在平台的优势显现之前,早期原型开发阶段可能会因为仅有 $1 的额度和严格的速率限制而感到受挫。

用户评价

暂无评价,快来分享你的第一条体验吧!

登录 后即可撰写评价。

相关文章

与 Fireworks AI 相关的指南和文章。