Aller au contenu principal
Vantaige
SiliconFlow screenshot
SiliconFlow logo

SiliconFlow

Freemium

SiliconFlow est une plateforme d'inférence basée en Chine proposant une API compatible OpenAI pour plus de 200 modèles, incluant les familles DeepSeek, Qwen, GLM et Kimi. Elle est économique et exhaustive, mais la localisation des données en Chine et l'exigence de vérification d'identité en font un choix à évaluer avec précaution pour les équipes occidentales.

Fonctionnalités :API

SiliconFlow est une entreprise d'infrastructure IA basée en Chine dont le produit phare, SiliconCloud, offre aux développeurs une API unique compatible OpenAI pour plus de 200 modèles couvrant le texte, l'image, la vidéo, l'audio, les embeddings et le reranking. Fondée en 2023 par Yuan Jinhui, l'ancien directeur général du framework de deep learning OneFlow, et Pan Yang, elle est surtout connue comme le principal hébergeur commercial des familles de modèles open source chinois : DeepSeek, Qwen, GLM, Kimi, MiniMax et Step. La plateforme fonctionne sur son propre moteur d'inférence SiliconLLM, exploitant à la fois des GPU NVIDIA et des puces Huawei Ascend, et a clôturé une levée de fonds de série A menée par Alibaba Cloud en 2025. Si vous avez déjà essayé d'appeler un modèle de pointe chinois depuis l'étranger et que vous vous êtes heurté à un mur, SiliconFlow est généralement la plateforme qui résout le problème.

Une seule clé permet d'accéder à des modèles de raisonnement et de chat comme DeepSeek et Qwen, à des modèles d'image incluant FLUX et le modèle gratuit Kolors, à la vidéo via Wan2.2, à la synthèse vocale avec CosyVoice2 et Fish-Speech, ainsi qu'à un ensemble complet de modèles d'embedding et de reranker pour la recherche d'informations. Les nouveaux comptes bénéficient d'un dollar de crédit gratuit et de plusieurs modèles gratuits à vie. La tarification commence à environ $0.10 par million de tokens pour les petits modèles, et un pipeline géré permet d'affiner (fine-tuning) les variantes de Qwen2.5. L'API étant compatible OpenAI, la plupart des équipes se contentent de pointer un client existant vers l'URL de base de SiliconFlow et d'exécuter leur code sans modification. La mise en garde importante accompagne cette promesse : l'inférence s'effectue sur une infrastructure chinoise, la vérification d'identité est devenue obligatoire en mai 2026, et il n'existe aucune documentation SOC2 ou GDPR. La localisation des données est donc une véritable décision stratégique et non un simple détail.

SiliconFlow en un coup d'œil, juin 2026

SiliconCloud est une plateforme de modèles en tant que service (MaaS), et non une application de chat ou un IDE. Vous vous inscrivez, obtenez une clé API et appelez les modèles via HTTP. Le chiffre clé est l'exhaustivité : plus de 200 modèles sous un seul compte. Son catalogue linguistique est ce qui la distingue, proposant DeepSeek V4, la famille Qwen 3.5 (du 9B jusqu'aux grandes variantes mixture-of-experts), GLM 5.x, Kimi de Moonshot AI, MiniMax et Step, dont beaucoup sont difficiles voire impossibles à atteindre via un fournisseur occidental. Autour des modèles de langage s'articulent les embeddings BAAI et Qwen, les rerankers Qwen3, FLUX et Kolors pour les images, Wan2.2 pour la vidéo, ainsi que CosyVoice2 et Fish-Speech pour l'audio.

Deux détails opérationnels façonnent son utilisation. Premièrement, il existe deux points de terminaison API : un international sur le domaine .com et un pour la Chine continentale sur le .cn, la plateforme orientant de plus en plus les utilisateurs vers le .cn. Deuxièmement, cette même interface compatible OpenAI signifie que le coût de migration depuis un autre fournisseur se résume principalement à changer une URL de base et une clé. Des points de terminaison serverless avec paiement à l'usage (pay-as-you-go) et des points de terminaison dédiés réservés sont disponibles, et le fine-tuning est proposé pour plusieurs variantes instruct de Qwen2.5.

Les véritables points forts de SiliconFlow

Le véritable avantage concurrentiel de la plateforme est l'accès à grande échelle aux modèles chinois. Sa percée a eu lieu en janvier 2025, lorsque DeepSeek-R1 et V3 sont devenus viraux dans le monde entier et que SiliconFlow a été la première plateforme à servir les deux à grande échelle sur du matériel Huawei Ascend en plus de NVIDIA. Ce moment s'est transformé en revenus et en validation pour l'entreprise.

"Notre activité a connu une croissance explosive depuis le début de cette année avec l'essor des grands modèles open source, notamment Qwen d'Alibaba et DeepSeek, ainsi que la demande fulgurante en puissance d'inférence IA." Yuan Jinhui, fondateur de SiliconFlow, Yicai Global, 10 juin 2025.

Au-delà de la diversité des modèles, SiliconFlow est véritablement économique sur ses petits modèles, entièrement multimodale sous une seule facturation, et s'intègre facilement au code existant grâce à sa compatibilité OpenAI. Les équipes gérant des pipelines de recherche d'informations peuvent obtenir le chat, les embeddings et le reranking auprès d'un seul fournisseur. De plus, les petits modèles gratuits à vie et le dollar de crédit de départ rendent l'évaluation presque sans friction. Pour quiconque a spécifiquement besoin d'une inférence DeepSeek ne dépendant pas du matériel NVIDIA, le partenariat de SiliconFlow avec Huawei Cloud en fait l'option principale documentée.

Les failles de SiliconFlow et les limites rencontrées par les utilisateurs

Le problème le plus concret est la limitation de débit (rate limiting). Les plafonds du niveau gratuit sont stricts et appliqués rigoureusement, et les frameworks d'intégration qui lancent des requêtes simultanées peuvent déclencher des blocages au niveau du compte avec très peu d'avertissement.

"Pour éviter d'être banni, définissez le nombre maximum de requêtes par seconde pour l'embedding de siliconflow. Le système n'a imposé aucune restriction et je peux voir un grand nombre de requêtes bloquées dans les journaux du backend." ukhack, ticket GitHub Dify, septembre 2024.

Le plus grand obstacle pour les utilisateurs non chinois est l'identité. Depuis mai 2026, la vérification d'identité est obligatoire, et les comptes non vérifiés ne peuvent ni ajouter de fonds ni demander de factures. La vérification accepte des documents d'identité chinois spécifiques, et les passeports étrangers standards ne sont pas acceptés en ligne. Ainsi, de nombreux développeurs occidentaux peuvent évaluer la plateforme avec le crédit gratuit, mais ne peuvent pas réellement passer à l'échelle sans contacter le support. De plus, le catalogue de modèles évolue de manière agressive. Tout au long de 2025 et jusqu'en 2026, les notes de mise à jour montrent de fréquentes dépréciations et plusieurs modèles auparavant gratuits devenus payants, ce qui représente un risque si vous liez un workflow à un modèle précis. Des benchmarks indépendants ont également signalé l'absence du mode JSON sur certains modèles, un vrai problème pour les pipelines à sortie structurée, et les affirmations de la plateforme en matière de confidentialité ne sont étayées par aucun audit indépendant. Rien de tout cela n'est caché, mais tout nécessite d'être anticipé.

SiliconFlow vs Together AI vs DeepInfra

Face à Together AI, le compromis se situe au niveau de la géographie et du catalogue. Together gère ses propres clusters de GPU aux États-Unis, affiche un débit solide d'environ 900 tokens par seconde, prend en charge le fine-tuning et ne présente aucune friction liée à l'identité ou à la localisation des données, mais ne propose pas les exclusivités chinoises. SiliconFlow est souvent le seul moyen pratique d'accéder à GLM, Kimi, MiniMax et Step à l'échelle d'une API. Face à DeepInfra, le contraste se situe entre le prix et les fonctionnalités : DeepInfra est basé aux États-Unis, se positionne comme un leader à bas coût et peut proposer des tarifs inférieurs à SiliconFlow sur des modèles partagés comme DeepSeek et Qwen, mais n'offre pas de fine-tuning ni le catalogue des familles chinoises. Fireworks AI est un troisième point de référence, optimisé pour un délai d'obtention du premier token (time-to-first-token) très faible sur les modèles ouverts occidentaux avec mise en cache des prompts, mais là encore sans les modèles chinois ni l'étendue de SiliconFlow en matière d'image, de vidéo et d'audio. Le schéma est constant. Pour les modèles ouverts occidentaux avec une faible friction réglementaire, un hébergeur américain ou une couche de routage comme OpenRouter est plus simple. Pour les modèles chinois et l'exhaustivité multimodale, SiliconFlow s'impose par défaut.

SiliconFlow est-il vraiment moins cher ?

Pour ses modèles de petite et moyenne taille, oui. Qwen3.5-9B tourne autour de $0.10 par million de tokens en entrée, et même un grand modèle comme DeepSeek-V4-Pro se situe à environ $1.60 en entrée et $3.14 en sortie par million, avec des entrées en cache beaucoup moins chères. La génération d'images commence à un demi-centime pour Z-Image-Turbo et va jusqu'à quatre centimes pour FLUX 1.1 pro, et une vidéo Wan2.2 coûte environ $0.29. Les modèles gratuits et le dollar de crédit de départ signifient que l'évaluation ne coûte rien, et les niveaux de limitation de débit de L0 à L5 augmentent automatiquement votre capacité de traitement à mesure que vos dépenses mensuelles augmentent. La nuance honnête est que sur les modèles exacts que vous pouvez également obtenir ailleurs, un concurrent américain tel que DeepInfra peut égaler ou battre le prix global sans les contraintes de vérification et de localisation, l'argument des économies est donc le plus fort lorsque vous avez réellement besoin du catalogue chinois.

Meilleurs cas d'usage (et quand l'éviter)

SiliconFlow est un excellent choix par défaut pour les développeurs en Chine ou ceux qui créent des produits destinés au marché chinois, pour quiconque évalue ou exécute DeepSeek, Qwen, GLM, Kimi ou MiniMax à l'échelle d'une API, pour les pipelines multimodaux nécessitant du texte, de l'image, de l'audio et de la recherche d'informations auprès d'un seul fournisseur, et pour les équipes qui ont spécifiquement besoin d'une inférence hébergée sur Ascend. Évitez-le si la localisation des données en dehors de la Chine est une exigence, car toute l'inférence s'exécute sur une infrastructure chinoise sans documentation de conformité occidentale. Évitez-le si vous ne pouvez pas effectuer la vérification d'identité, car cela limite les fonctionnalités du compte. Et si vous n'avez besoin que de modèles ouverts occidentaux, un hébergeur américain ou une couche de routage permet d'éviter totalement les questions réglementaires pour un budget similaire.

Premiers pas avec SiliconFlow

Inscrivez-vous sur la console SiliconCloud, réclamez le dollar de crédit gratuit et créez une clé API. L'API reflétant celle d'OpenAI, il vous suffit généralement de remplacer l'URL de base par le point de terminaison de SiliconFlow et d'y insérer votre clé, puis d'appeler un modèle par son nom. Commencez par les modèles gratuits à vie ou une variante économique de Qwen pour valider votre intégration, ajoutez rapidement une limitation des requêtes (throttling) pour éviter de déclencher les limites de débit, et prévoyez la vérification d'identité avant d'avoir l'intention d'ajouter des fonds ou de passer à un volume de production. Les équipes qui se lient à un modèle spécifique doivent surveiller les notes de mise à jour pour anticiper les dépréciations.

Avis des utilisateurs

Aucun avis pour l'instant. Soyez le premier à partager votre expérience !

Se connecter pour écrire un avis.

Articles associés

Guides et articles en lien avec SiliconFlow.