

DeepSeek offre des performances de raisonnement et de codage de pointe à des coûts d'API 10 à 30 fois inférieurs à ceux de GPT-4o. Le compromis est réel : censure politique sur le produit hébergé, hébergement des données en RPC et une exposition documentée de la base de données. L'ouverture des poids (open weights) signifie qu'un déploiement local est possible, mais à un certain prix.
Nous avons soumis à DeepSeek R1 un problème de logique à plusieurs étapes, une faille argumentative de type LSAT dissimulée dans trois paragraphes, et avons observé ce qui s'est passé avant l'apparition de la réponse. Dans le bloc <think>, entièrement visible, le modèle a repéré sa propre erreur à la deuxième étape, a signalé une incertitude explicite concernant une clause conditionnelle, puis a corrigé le tir avant de produire une réponse finale claire. Aucun autre modèle de pointe ne vous montre cela. GPT-o1 masque entièrement son cheminement de pensée. Claude résume son approche. DeepSeek R1 extériorise tout son monologue intérieur, ses fausses pistes, ses auto-corrections, ses indicateurs de confiance et le reste. Cette transparence est soit la fonctionnalité la plus sous-estimée de DeepSeek, soit son outil de diagnostic le plus révélateur, selon le contenu du raisonnement. Ce que cela vous indique sur la pertinence d'intégrer DeepSeek à votre stack technique en 2026 dépend fortement de ce que vous construisez et de l'endroit où résident vos données.
DeepSeek R1 a été lancé le 20 janvier 2025, revendiquant des coûts d'entraînement d'environ $5.5 millions, soit environ 20 fois moins que les modèles américains comparables, et a provoqué une chute de 16.9% de l'action NVIDIA en une seule journée, effaçant $589 milliards de capitalisation boursière. DeepSeek V4, sorti début 2026 et prétendument entraîné sur des puces Huawei Ascend contournant les contrôles d'exportation américains, n'a fait qu'approfondir les questions soulevées par cet événement. Les capacités du modèle sont réelles. Les complications le sont tout autant.
DeepSeek en un coup d'œil. Avril 2026
Le produit grand public sur deepseek.com est entièrement gratuit en date d'avril 2026, il n'y a pas d'abonnement payant. Le modèle auquel vous accédez via l'application web est DeepSeek V4, qui a introduit des modes de raisonnement hybrides : un mode « réflexion » (thinking) qui produit un cheminement de pensée étendu visible dans les balises <think>, et un mode « sans réflexion » (non-thinking) pour des réponses plus rapides sans la surcharge liée au raisonnement. Le même modèle gère les deux modes, ce qui le rend plus flexible que la précédente séparation V3/R1.
L'API s'appuie sur deux modèles actifs. deepseek-v4-flash est facturé à $0.14 par million de tokens en entrée (sans cache) et $0.28 par million de tokens en sortie, les succès de cache (cache hits) réduisant les coûts d'entrée à $0.028, soit une remise de 80% appliquée automatiquement sans aucune modification de code requise. deepseek-v4-pro fonctionne à $1.74 par million de tokens en entrée et $3.48 par million de tokens en sortie, avec des succès de cache à $0.145. Les fenêtres de contexte pour les deux modèles atteignent 1 million de tokens avec une sortie maximale de 384K tokens. Les anciens noms de modèles deepseek-chat et deepseek-reasoner sont obsolètes.
Du côté des poids ouverts (open-weights), DeepSeek R1 (671B paramètres) et V3 sont sous licence MIT sur Hugging Face. Les variantes distillées, 8B, 14B, 32B et 70B, tournent sur du matériel grand public via Ollama. Le modèle complet de 671B nécessite entre $40,000–$80,000 de matériel. DeepSeek V3.1 est disponible sur Amazon Bedrock, Azure AI Foundry et Google Cloud Vertex AI avec des déploiements dans la région UE, une solution de contournement partielle pour la résidence des données destinée aux équipes n'ayant pas le capital nécessaire pour une infrastructure sur site.
Les véritables points forts de DeepSeek
La preuve la plus évidente de la valeur de DeepSeek réside dans les mathématiques, le raisonnement et le code à un faible coût d'API. DeepSeek R1 atteint une précision d'environ 90% sur les benchmarks mathématiques AIME 2024, contre environ 83% pour GPT-4o. Sur des tâches de codage de type LeetCode : un évaluateur de ProductHunt a testé la version distillée R1 70B sur huit problèmes de migration de Kotlin vers TypeScript et a constaté « des scores d'exactitude supérieurs par rapport aux modèles concurrents ». La version distillée 70B s'exécute localement via Ollama sans frais d'API ni transfert de données hors de votre infrastructure.
La trace de raisonnement est utile au-delà de la simple obtention de réponses correctes. Comme l'a écrit un développeur sur mccormickml.com en février 2025 : « Vous pouvez apprendre beaucoup sur le problème que vous essayez de résoudre à partir des tokens de raisonnement, et pas seulement à partir de la sortie finale du modèle. » Pour déboguer le comportement du modèle, construire des exemples résolus ou comprendre où le raisonnement échoue, le bloc <think> exposé est un outil qualitativement différent des modèles qui ne montrent que leur conclusion.
L'avantage financier pour les utilisateurs d'API à fort volume n'est pas marginal. Les équipes exécutant le traitement de documents par lots, des pipelines RAG ou des inférences à haute fréquence signalent une baisse des coûts de 50 à 95% en passant de GPT-4o ou GPT-5. À $0.14 par million de tokens en entrée, le calcul est simple. Pour les applications sensibles à la confidentialité, les poids ouverts sous licence MIT offrent une alternative totale aux API hébergées. Un commentateur sur Hacker News a cité « la sécurité et la protection de la propriété intellectuelle comme l'avantage principal, en évitant complètement les API distantes. » Les équipes juridiques et les entreprises ayant des exigences strictes en matière de résidence des données qui exécutent des variantes distillées sur une infrastructure privée obtiennent une qualité de raisonnement de pointe avec zéro télémétrie.
Les limites de DeepSeek : les échecs récurrents rencontrés par les utilisateurs
Le problème de la censure n'est pas une préoccupation mineure. DeepSeek refuse d'aborder la place Tian'anmen, le statut politique de Taïwan ou les critiques envers le Parti communiste chinois. Testé directement début 2025, le modèle a répondu à une question sur la place Tian'anmen en 1989 par : « Désolé, cela dépasse mon champ d'action actuel. Parlons d'autre chose. » Sur Taïwan, il a déclaré « Taïwan, en tant que partie de la Chine, n'est pas un pays » avant de supprimer la réponse et de répéter le message hors de portée. Il ne s'agit pas de cas isolés impliquant des sujets obscurs ; cela affecte les chercheurs sur la Chine, les journalistes, les défenseurs des droits de l'homme, les entreprises basées à Taïwan et quiconque développant des produits susceptibles de faire référence à l'histoire géopolitique moderne. Ron Deibert, directeur de Citizen Lab à l'Université de Toronto, a noté que ce qui est inhabituel ici, c'est qu'« il est rare que des applications basées en Chine censurent des utilisateurs internationaux », le filtrage s'étendant au-delà des requêtes en langue chinoise pour toucher les utilisateurs anglophones du monde entier.
L'exposition de la confidentialité du produit hébergé est documentée, et non théorique. Le 29 janvier 2025, Wiz Research a découvert une base de données ClickHouse accessible publiquement sur des sous-domaines de DeepSeek contenant plus d'un million d'enregistrements de flux de journaux, y compris des historiques de chat d'utilisateurs, des clés API en texte clair, des détails d'infrastructure backend et des métadonnées opérationnelles, sans aucune authentification requise. L'exposition a été divulguée de manière responsable et corrigée rapidement, mais elle a confirmé que l'infrastructure sécurisant les données des utilisateurs présentait des failles matérielles. Par ailleurs, NowSecure a découvert que l'application iOS de DeepSeek transmettait des données d'appareil non chiffrées à Volcengine, la plateforme cloud de ByteDance. Toutes les données des utilisateurs traitées via l'API ou l'application grand public sont stockées sur des serveurs de la RPC soumis à la loi nationale sur le renseignement de la Chine de 2017.
En matière de performances, le mode de raisonnement verbeux crée une catégorie d'échec spécifique pour les tâches simples. Le mode réflexion produit un long cheminement de pensée pour des questions qui ne le justifient pas, et le modèle peut s'enfermer dans de mauvaises réponses à partir de points de départ corrects :
« Tellement bavard sur des questions classiques, même après avoir ajusté les paramètres pour plus de concision. Efficace uniquement pour les extraits de code. ». Évaluateur sur ProductHunt, 2025
« Le modèle compte correctement trois 'R' dans 'strawberry', puis débat à plusieurs reprises avec lui-même pour conclure que la réponse doit être deux, refusant finalement de faire confiance à son propre raisonnement. ». Commentateur sur Hacker News, fil de discussion id 42768072, 2025
Le bloc <think> rend ces effondrements visibles, ce qui est utile pour le diagnostic mais ne l'est pas lorsque vous avez besoin de réponses fiables sur des requêtes simples.
La disponibilité des serveurs est un problème récurrent depuis le pic de lancement de janvier 2025. L'infrastructure a absorbé une attaque DDoS de 230 millions de requêtes sur cinq jours début 2025, et les erreurs 429 « serveur occupé » ont été fréquentes tout au long de l'année 2025. Les développeurs testant des intégrations et ayant besoin de fiabilité ne peuvent pas dépendre du produit grand public gratuit en cas de forte charge.
DeepSeek vs. GPT-4o vs. Llama
ChatGPT (GPT-4o / GPT-5) : L'argument de DeepSeek est le coût. V4-flash est 10 à 30 fois moins cher par token, et le produit grand public est gratuit sans abonnement. ChatGPT ne censure pas les sujets géopolitiquement sensibles, stocke les données sous juridiction américaine et offre une fiabilité d'infrastructure nettement supérieure. Pour les équipes développant des produits internationaux ou tout ce qui touche à l'histoire géopolitique, l'absence de censure politique de ChatGPT est une exigence fonctionnelle. Pour les pipelines d'inférence apolitiques à fort volume, l'avantage financier de DeepSeek est cumulatif.
Llama (Meta) : La comparaison porte sur le déploiement local. Llama 3.1 70B de Meta et la version distillée DeepSeek R1 70B sont en concurrence directe pour une utilisation auto-hébergée. La version distillée de DeepSeek R1 surpasse Llama 3.1 70B sur les tâches de raisonnement, mais Llama ne présente aucun problème de censure et dispose d'un écosystème de fine-tuning plus mature. Les deux modèles sont à poids ouverts et gratuits. Les équipes qui ont besoin de l'écosystème d'auto-hébergement le plus éprouvé en production choisissent Llama ; les équipes privilégiant les performances des benchmarks de raisonnement et à l'aise avec le compromis de la censure se tournent vers la version distillée de DeepSeek R1.
Le cas d'usage qui penche nettement en faveur de DeepSeek est l'inférence apolitique à fort volume via API, en particulier pour les produits SaaS sensibles aux coûts où les factures OpenAI sont devenues un poste de dépense important.
Le niveau payant en vaut-il la peine ?
Le produit grand public de DeepSeek ne propose aucun niveau payant en date d'avril 2026, les applications web et mobiles sont entièrement gratuites. La question du coût se pose au niveau de l'API, où le choix se fait entre v4-flash et v4-pro.
V4-flash à $0.14/1M de tokens en entrée est l'option par défaut pour la plupart des cas d'usage. Pour le traitement de documents par lots, la récupération RAG, les pipelines de résumé et l'assistance générale au codage, le rapport qualité-prix du modèle flash est difficile à égaler. La remise automatique pour succès de cache, réduisant les coûts d'entrée à $0.028/1M lorsque les prompts partagent des préfixes, signifie que les applications avec des prompts système constants ou un contexte répété bénéficient d'une réduction de 80% des coûts d'entrée sans aucune modification d'implémentation requise.
V4-pro à $1.74/1M de tokens en entrée est le bon choix pour les équipes qui ont évalué la qualité de raisonnement sur leur type de tâche spécifique et qui ont besoin de la profondeur de cheminement de pensée étendue du niveau premium. À ce prix, GPT-4o et Claude Sonnet sont des options concurrentes, et leur politique plus transparente en matière de résidence des données peut faire pencher la balance pour les charges de travail professionnelles. Pour la plupart des développeurs, le point de départ est v4-flash avec l'optimisation du cache. La fenêtre de contexte (1M de tokens) et la limite de sortie (384K tokens) prennent en charge les flux de travail sur des documents longs sans avoir besoin de les tronçonner (chunking).
Meilleurs cas d'usage (et quand l'éviter)
DeepSeek est performant pour : l'inférence API à fort volume où les coûts d'OpenAI ou d'Anthropic impactent matériellement les marges ; les applications à forte composante mathématique, y compris les plateformes de tutorat, les outils de programmation compétitive et les assistants de calcul scientifique ; la révision de code et le débogage où la trace de raisonnement aide les utilisateurs à comprendre pourquoi un correctif fonctionne ; et les déploiements auto-hébergés sur une infrastructure privée où les données ne quittent jamais l'organisation.
Le cas d'usage inattendu qui refait surface à plusieurs reprises dans les communautés de développeurs est l'exécution locale de variantes distillées en tant que moteur de raisonnement non censuré pour des recherches juridiquement ou concurrentiellement sensibles. Les poids sous licence MIT peuvent être modifiés et la couche d'alignement post-entraînement supprimée, ce qui signifie qu'un modèle exécuté localement répondra aux questions que la version hébergée refuse. Des équipes ont documenté ce flux de travail pour l'intelligence économique impliquant la dynamique du marché chinois, l'examen de documents juridiques couvrant l'analyse réglementaire transfrontalière et la recherche académique sur l'histoire chinoise. La configuration pratique : une version distillée quantifiée de 14B ou 32B via Ollama pour les tâches sensibles, et l'API hébergée pour l'inférence courante à $0.14/1M de tokens pour le reste.
Évitez DeepSeek pour les flux de travail impliquant la politique de la Chine, de Taïwan, du Tibet ou de Hong Kong, la censure est systématique et non configurable. Évitez-le pour les applications d'entreprise où la résidence des données en RPC constitue un obstacle de conformité, pour les équipes qui ont besoin de garanties de fiabilité de l'infrastructure (le niveau gratuit n'est pas de qualité production sous charge), et pour l'écriture créative ou les conversations ouvertes où l'écart de qualité par rapport à ChatGPT et Claude reste constant.
Premiers pas avec DeepSeek
L'application grand public ne nécessite qu'une inscription par e-mail. Pour l'API, inscrivez-vous sur platform.deepseek.com, l'API est compatible avec OpenAI, de sorte que les intégrations SDK OpenAI existantes basculent en modifiant uniquement l'URL de base et le nom du modèle. Utilisez deepseek-v4-flash ou deepseek-v4-pro ; les anciens noms deepseek-chat et deepseek-reasoner sont obsolètes.
Pour un déploiement local, les variantes distillées R1 sont sur Hugging Face à l'adresse github.com/deepseek-ai/DeepSeek-R1 sous licence MIT. Ollama les prend en charge nativement : ollama pull deepseek-r1:70b. Une version quantifiée 32B tient sur un seul GPU de 24GB. Dernier test : avril 2026.
Avis des utilisateurs
Aucun avis pour l'instant. Soyez le premier à partager votre expérience !
Se connecter pour écrire un avis.
Présent dans les collections
Listes sélectionnées incluant DeepSeek.
Articles associés
Guides et articles en lien avec DeepSeek.

DeepSeek V4 Pro vs Claude Opus 4.7: 5-PR Refactor Test (2026)

Grok 4.3 API for Agents (May 2026): Pricing, Benchmarks, Migration

Does API Cost More Than a Subscription for Claude Opus 4.8, GPT-5.5, and Grok?

Coding Ate Enterprise AI (2026): The $4B Use Case, Anthropic’s Share, and Seat vs API Math

Google Vision AI Explained (2026): Pricing Per 1,000 Units, Free Tier, and Alternatives
