SiliconFlow 是一家总部位于中国的推理平台,通过一个兼容 OpenAI 的 API 提供对 200 多种模型的访问,包括 DeepSeek、Qwen、GLM 和 Kimi 系列。该平台价格低廉且模型丰富,但由于数据存储在中国且需要实名认证,西方团队在选择时需谨慎评估。
SiliconFlow 是一家总部位于中国的 AI 基础设施公司,其旗舰产品 SiliconCloud 为开发者提供了一个兼容 OpenAI 的统一 API,可调用涵盖文本、图像、视频、音频、嵌入(embeddings)和重排(reranking)的 200 多种模型。该公司由深度学习框架 OneFlow 的前首席执行官袁进辉和潘洋于 2023 年创立,作为中国开源模型系列(DeepSeek、Qwen、GLM、Kimi、MiniMax 和 Step)领先的商业托管平台而闻名。该平台在 NVIDIA GPU 和 Huawei Ascend 芯片上运行其自研的 SiliconLLM 推理引擎,并于 2025 年完成了由 Alibaba Cloud 领投的 A 轮融资。如果您曾尝试从中国境外调用中国的前沿模型却屡屡碰壁,SiliconFlow 通常就是解决该问题的平台。
只需一个密钥,即可访问 DeepSeek 和 Qwen 等推理和聊天模型,包括 FLUX 和免费的 Kolors 在内的图像模型,通过 Wan2.2 生成视频,使用 CosyVoice2 和 Fish-Speech 处理语音,以及用于检索的全套嵌入和重排模型。新账户可获得 $1 的免费额度以及几个永久免费的模型,小型模型的定价约为每百万 token $0.10,此外还提供用于微调 Qwen2.5 变体的托管流水线。由于 API 兼容 OpenAI,大多数团队只需将现有客户端指向 SiliconFlow 的基础 URL,即可在不修改代码的情况下运行。但与这些优势并存的是一个重要的注意事项:推理过程在中国的基础设施上进行,自 2026 年 5 月起强制要求实名认证,且没有 SOC2 或 GDPR 文档,因此数据驻留是一个需要认真考量的决策,而不仅仅是一个脚注。
SiliconFlow 概览(2026 年 6 月)
SiliconCloud 是一个模型即服务(MaaS)平台,而不是聊天应用或 IDE。您只需注册、获取 API 密钥,即可通过 HTTP 调用模型。其最引人注目的优势在于广度:一个账户下包含 200 多种模型。语言模型目录是其脱颖而出的地方,涵盖了 DeepSeek V4、从 9B 到大型混合专家(MoE)变体的 Qwen 3.5 系列、GLM 5.x、来自 Moonshot AI 的 Kimi、MiniMax 和 Step,其中许多模型很难或根本无法通过西方提供商访问。除了语言模型,还提供 BAAI 和 Qwen 嵌入模型、Qwen3 重排模型、用于图像的 FLUX 和 Kolors、用于视频的 Wan2.2,以及用于音频的 CosyVoice2 和 Fish-Speech。
有两个操作细节会影响您的使用方式。首先,它有两个 API 端点,一个是 .com 域名的国际端点,另一个是 .cn 域名的中国大陆端点,目前平台一直在引导用户使用 .cn 端点。其次,兼容 OpenAI 的接口意味着从其他提供商迁移的成本主要只是更改基础 URL 和密钥。平台同时提供无服务器按需付费和专用预留端点,并为几种 Qwen2.5 指令变体提供微调服务。
SiliconFlow 的真正优势
该平台真正的护城河在于大规模提供中国模型的访问权限。它的爆发点出现在 2025 年 1 月,当时 DeepSeek-R1 和 V3 在全球范围内爆红,而 SiliconFlow 是首个除了 NVIDIA 之外,还在 Huawei Ascend 硬件上大规模提供这两种模型服务的平台。这一时刻为其带来了商业回报与市场认可。
“随着包括阿里巴巴的 Qwen 和 DeepSeek 在内的开源大模型的崛起,以及对 AI 推理算力需求的激增,自今年年初以来,我们的业务呈爆炸式增长。”—— SiliconFlow 创始人袁进辉,Yicai Global,2025 年 6 月 10 日。
除了模型的广度,SiliconFlow 在小型模型上的价格确实非常便宜,支持在一个账单下实现完全的多模态,并且通过兼容 OpenAI 对现有代码非常友好。运行检索流水线的团队可以从单一供应商处获得聊天、嵌入和重排服务,而永久免费的小型模型加上 $1 的初始额度,使得评估过程几乎没有任何阻力。对于特别需要不依赖 NVIDIA 硬件的 DeepSeek 推理的用户来说,SiliconFlow 与华为云的合作使其成为有据可查的首选方案。
SiliconFlow 的局限性与用户痛点
最实际的痛点是速率限制。免费层的限制非常严格且执行力度大,触发并发请求的集成框架可能会在几乎没有警告的情况下导致账户级别的封禁。
“为了避免被封禁,请为 siliconflow 的嵌入模型设置每秒最大请求数。系统没有施加任何限制,我从后端日志中看到了大量被拦截的请求。”—— ukhack,GitHub Dify issue,2024 年 9 月。
对于非中国用户来说,更大的障碍是身份验证。自 2026 年 5 月起,实名认证成为强制要求,未认证的账户无法充值或申请发票。认证仅接受特定的中国身份证件,在线系统不接受标准的外国护照,因此许多西方开发者可以使用免费额度进行评估,但如果不联系客服支持,就无法真正扩大规模。此外,模型列表的变动非常频繁。在 2025 年至 2026 年期间,发布说明显示频繁有模型被弃用,且几个以前免费的模型转为付费,如果您将工作流绑定到某个特定模型,这将是一个风险。独立的基准测试还指出某些模型缺少 JSON 模式,这对于结构化输出流水线来说是一个实际问题,而且该平台的隐私声明没有得到任何独立审计的支持。这些问题都不是隐藏的,但都需要提前规划。
SiliconFlow vs Together AI vs DeepInfra
与 Together AI 相比,权衡点在于地理位置和模型目录。Together 在美国运行自己的 GPU 集群,提供约每秒 900 个 token 的强大吞吐量,支持微调,并且没有实名认证或数据驻留的摩擦,但它不提供中国独有的模型。SiliconFlow 通常是在 API 规模上访问 GLM、Kimi、MiniMax 和 Step 的唯一实用途径。与 DeepInfra 相比,对比点在于价格与功能:DeepInfra 总部位于美国,定位为低成本领导者,在 DeepSeek 和 Qwen 等共享模型上的价格可能低于 SiliconFlow,但它不提供微调或中国系列模型目录。Fireworks AI 是第三个参考点,它针对西方开源模型进行了优化,通过提示词缓存实现了极低的首字延迟(TTFT),但同样没有中国模型,也没有 SiliconFlow 在图像、视频和音频方面的广度。模式是一致的:对于监管摩擦较低的西方开源模型,美国托管商或像 OpenRouter 这样的路由层更简单。而对于中国模型和多模态广度,SiliconFlow 则是默认的赢家。
SiliconFlow 真的更便宜吗?
对于其中小型模型来说,是的。Qwen3.5-9B 的价格约为每百万输入 token $0.10,即使是像 DeepSeek-V4-Pro 这样的大型模型,每百万 token 的输入价格也仅约为 $1.60,输出约为 $3.14,而缓存输入的成本则低得多。图像生成的起价为 Z-Image-Turbo 的半美分,FLUX 1.1 pro 为 4 美分,而生成一段 Wan2.2 视频约为 $0.29。免费模型和 $1 的初始额度意味着评估成本为零,而从 L0 到 L5 的速率限制层级会随着每月支出的增加自动提高您的吞吐量。客观地说,对于您在其他地方也能获取的相同模型,像 DeepInfra 这样的美国竞争对手可能会在没有认证和数据驻留开销的情况下,提供持平或更优的综合价格。因此,只有当您真正需要中国模型目录时,节省成本的理由才最为充分。
最佳用例(以及何时应避免使用)
对于在中国的开发者或构建面向中国产品的开发者,对于任何在 API 规模上评估或运行 DeepSeek、Qwen、GLM、Kimi 或 MiniMax 的人,对于希望从单一供应商处获得文本、图像、音频和检索的多模态流水线,以及对于特别需要 Ascend 托管推理的团队来说,SiliconFlow 是一个强大的默认选择。如果要求数据驻留在中国境外,请避免使用它,因为所有推理都在中国的基础设施上运行,且没有西方的合规文档。如果您无法完成实名认证,也请避免使用,因为这会限制账户功能。如果您只需要西方开源模型,美国托管商或路由层可以在花费相近的情况下完全避免监管问题。
开始使用 SiliconFlow
在 SiliconCloud 控制台注册,领取 $1 的免费额度,并创建一个 API 密钥。由于 API 与 OpenAI 的格式一致,您通常只需将基础 URL 更改为 SiliconFlow 的端点并填入您的密钥,然后通过名称调用模型即可。从永久免费的模型或廉价的 Qwen 变体开始验证您的集成,尽早添加请求节流以避免触发速率限制,并在打算充值或转移到生产环境之前规划好实名认证。绑定到特定模型的团队应密切关注发布说明中的弃用信息。
用户评价
暂无评价,快来分享你的第一条体验吧!
登录 后即可撰写评价。
相关文章
与 SiliconFlow 相关的指南和文章。

Grok 4.3 API for Agents (May 2026): Pricing, Benchmarks, Migration

Vantaige Launches the LLM VRAM Calculator: A Free GPU Compatibility Finder for Open-source and Open-Weight AI

Google Vision AI Explained (2026): Pricing Per 1,000 Units, Free Tier, and Alternatives

DeepSeek V4 Pro vs Claude Opus 4.7: 5-PR Refactor Test (2026)

OpenAI GPT-Realtime-2 (May 2026): Pricing, Latency & 30-Min Voice Agent
