Aller au contenu principal
Vantaige
MiniMax (Modèles de texte) screenshot
MiniMax (Modèles de texte) logo

MiniMax (Modèles de texte)

Payant

MiniMax est un laboratoire d'IA basé à Shanghai proposant une série de modèles de texte de pointe, du M1 à 456 milliards de paramètres au modèle phare M2.7. Reconnu pour son contexte de 1 million de tokens, ses poids ouverts sous licence Apache 2.0 et ses solides capacités de codage agentique à des prix bien inférieurs à ceux des alternatives occidentales.

Fonctionnalités :API

MiniMax est une société de recherche en IA basée à Shanghai, fondée début 2022, qui exploite une gamme de grands modèles de langage rivalisant directement avec les systèmes à poids ouverts les plus performants au monde. La série de modèles de texte du laboratoire, qui comprend MiniMax-Text-01, M1, M2 et l'actuel modèle phare M2.7, couvre le raisonnement à contexte long, l'ingénierie logicielle et l'exécution de tâches agentiques en plusieurs étapes. Cette page concerne uniquement l'API des modèles de texte, distincte de la plateforme vidéo Hailuo de MiniMax et de ses produits de génération audio et musicale, qui répondent à des cas d'usage totalement différents.

L'API de texte MiniMax est accessible sur platform.minimax.io, via un point de terminaison compatible Anthropic, ou via OpenRouter. La gamme comprend des modèles à poids ouverts sous licence Apache 2.0 (M1, M2) et des variantes propriétaires. Les fenêtres de contexte vont de 66K tokens sur la variante de jeu de rôle M2-Her jusqu'à 1 million de tokens sur M1 et MiniMax-01, avec une capacité d'extrapolation annoncée de 4 millions de tokens lors de l'inférence. Les tarifs vont de $0.15 par million de tokens en entrée (M2.5) à $0.40 par million (M1), plaçant MiniMax parmi les API de pointe les moins chères pour le code et le traitement de longs documents. Principaux cas d'usage : pipelines logiciels agentiques, analyse de vastes bases de code, suivi d'instructions à tours multiples et traitement de contenu en masse où le coût par token est déterminant.

MiniMax en un coup d'œil, mai 2026

La gamme actuelle de modèles de texte MiniMax, du plus ancien au plus récent :

  • MiniMax-Text-01 / MiniMax-01 (janvier 2025) : 456 milliards de paramètres au total, 45.9 milliards activés par token grâce à une architecture Mixture-of-Experts. A introduit le mécanisme de « lightning attention » permettant un contexte natif de 1 million de tokens et une extrapolation d'inférence de 4 millions de tokens. Lors de son lancement, ses benchmarks égalaient ceux de GPT-4o et Claude 3.5 Sonnet tout en offrant une fenêtre de contexte 20 à 32 fois plus longue. Open source sur HuggingFace sous licence Apache 2.0.

  • MiniMax-M1 (16 juin 2025) : 456 milliards de paramètres au total, modèle de raisonnement à attention hybride, contexte de 1 million, jusqu'à 80K tokens en sortie. Disponible en variantes M1-40k et M1-80k. L'entraînement RL complet a coûté $534,700 sur 512 GPU H800 pendant trois semaines, en utilisant l'algorithme d'apprentissage par renforcement propriétaire CISPO de MiniMax. Scores SWE-bench : 55.6% (40k) et 56.0% (80k).

  • MiniMax-M2 (23 octobre 2025) : 230 milliards de paramètres au total, 10 milliards actifs par inférence via MoE. Classé premier parmi tous les systèmes à poids ouverts sur l'Artificial Analysis Intelligence Index lors de son lancement. LiveCodeBench ~83%, SWE-bench verified 69.4%. Contexte de 197K. Vitesse de sortie de 114.5 tokens/seconde.

  • MiniMax-M2.1 : Axé sur le codage multilingue et multitâche. Fenêtre de contexte de 1 million. Cible les tâches de programmation en plusieurs étapes et la couverture linguistique en entreprise.

  • MiniMax-M2.5 : SWE-bench 70.40%, AIME 88.75%. Le prix le plus bas de la gamme à $0.15/1M de tokens en entrée. Environ 16 fois moins cher que les tarifs d'entrée de Claude Opus 4.6 pour des tâches équivalentes.

  • MiniMax-M2.7 (18 mars 2026) : Modèle phare actuel. SWE-Pro 56.22%, VIBE-Pro 55.6%, Terminal Bench 2 57.0%. ELO GDPval-AA de 1495, le plus élevé parmi les modèles open source dans cette évaluation. Contexte de 205K.

  • MiniMax-M2-Her : Variante spécialisée pour le jeu de rôle et l'interaction immersive multi-personnages. Contexte de 66K.

Les options d'accès incluent le HTTP direct, le SDK OpenAI ou le point de terminaison compatible Anthropic de MiniMax (https://api.minimax.io/anthropic), ce qui en fait une solution de remplacement immédiate pour les bases de code déjà construites sur les outils Anthropic.

Ce que MiniMax fait vraiment bien

La série M se classe systématiquement première ou ex æquo parmi les modèles à poids ouverts sur les benchmarks d'ingénierie logicielle. Lors de la sortie de M1 en juin 2025, il a devancé tous les modèles ouverts sur TAU-bench (utilisation d'outils par des agents), surpassant Gemini 2.5 Pro et OpenAI o3 sur les tâches à contexte long. Les M2 et M2.5 ont poursuivi cette trajectoire, le M2.5 atteignant 70.40% sur SWE-bench verified, égalant les scores de modèles coûtant plusieurs fois plus cher par token.

Le véritable élément différenciateur est la combinaison d'un contexte long et d'un faible nombre de paramètres actifs. Le MiniMax M1, avec sa fenêtre de 1 million de tokens, nécessite environ 70% de ressources de calcul en moins que le DeepSeek R1 à 100K tokens, selon les propres mesures de MiniMax. Pour les équipes effectuant des analyses de vastes bases de code, des révisions de documents ou des boucles d'agents à long horizon, ce calcul a toute son importance.

« L'intégration de la série MiniMax M2 dans notre plateforme a été une victoire majeure pour nos utilisateurs. Nous avons constaté que le M2.1 gère les nuances des tâches de programmation complexes en plusieurs étapes avec un niveau de cohérence rare dans ce domaine. » - équipe de plateforme de développement, citée lors de la couverture du lancement de MiniMax M2.1, janvier 2026

Les poids ouverts constituent un réel avantage pour les équipes qui ont besoin d'auto-héberger ou d'affiner (fine-tune) les modèles. M1 et M2 sont tous deux sous licence Apache 2.0, permettant une utilisation commerciale et des modifications. L'article sur MiniMax-01 (arXiv:2501.08313) fournit des détails architecturaux complets, ce qui en fait l'une des publications de modèles de pointe les plus transparentes de tous les laboratoires à l'échelle mondiale.

« Nous sommes ravis de voir des modèles open source puissants comme le M2.1 qui apportent des performances de pointe, et dans certains cas les dépassent, pour une grande variété de tâches de développement logiciel. Les développeurs méritent d'avoir le choix, et le M2.1 offre cette alternative tant attendue. » - développeur cité dans la presse lors du lancement de MiniMax M2.1, janvier 2026

Les limites de MiniMax : les problèmes récurrents rencontrés par les utilisateurs

Le système de limitation de débit (rate limit) est le point de friction le plus fréquemment cité. MiniMax utilise des fenêtres fixes de 5 heures plutôt que des limites glissantes. Si vous épuisez votre quota à 9h45, vous devez attendre 10h00 pour que la prochaine fenêtre fixe s'ouvre. Les développeurs habitués aux fenêtres glissantes d'OpenAI ou d'Anthropic trouvent cela déroutant, et ces fenêtres fixes s'adaptent mal aux charges de travail agentiques en rafale. Les utilisateurs ayant créé un compte après le 23 mars 2026 sont également soumis à des plafonds de quotas hebdomadaires que les anciens utilisateurs n'ont pas, créant ainsi des niveaux d'accès inégaux au sein du même produit.

Les modèles sont verbeux. Artificial Analysis a mesuré que le M2 générait « 70 millions de tokens en sortie lors de l'évaluation, ce qui est un peu plus élevé que la moyenne », ce qui se traduit directement par des coûts de sortie élevés en production. Pour les tâches de résumé ou de classification nécessitant des sorties courtes, cette verbosité peut considérablement gonfler les factures.

L'inférence locale est impraticable pour la plupart des équipes. Le MiniMax-M1, avec ses 456 milliards de paramètres, nécessite un matériel auquel la plupart des développeurs n'ont pas accès. Les discussions de la communauté sur HuggingFace fin 2025 ont soulevé des incertitudes quant à la compatibilité avec llama.cpp. Le M2 à 230 milliards est plus réalisable, mais reste hors de portée sans un cluster.

Des restrictions de contenu s'appliquent. Les exigences réglementaires chinoises (une loi de 2023 interdisant les contenus « portant atteinte à l'unité nationale et à l'harmonie sociale ») impliquent que les modèles filtrent les sujets politiques, en particulier ceux touchant à la gouvernance et aux questions territoriales chinoises. Pour les tâches générales de codage et de rédaction, cela se manifeste rarement, mais c'est une contrainte documentée que les équipes travaillant dans l'actualité, la recherche politique ou l'analyse géopolitique rencontreront.

Sur le raisonnement mathématique pur, le MiniMax M2 est à la traîne par rapport aux modèles de raisonnement plus spécialisés. AIME-25 : MiniMax M2 à 78% contre Kimi K2 Thinking à 94-99%. Si les mathématiques étape par étape ou la génération de preuves formelles constituent le cas d'usage principal, Kimi ou Qwen3.5 seront plus adaptés.

MiniMax vs. Qwen vs. DeepSeek

Tous trois sont des laboratoires chinois majeurs de modèles à poids ouverts qui ont publié des modèles en succession rapide tout au long de 2025-2026. Les différences sont architecturales et opérationnelles, et pas seulement d'ordre marketing.

MiniMax vs. Qwen (Alibaba) : Tous deux utilisent une architecture Mixture-of-Experts avec activation clairsemée. Qwen3.5 active environ 37 milliards de paramètres par passage (forward pass) ; MiniMax M2.7 en active 10 milliards sur un total de 230 milliards, ce qui rend les coûts de calcul par token inférieurs pour MiniMax. La fenêtre de contexte de Qwen3.5 atteint ~991K tokens, comparable au million de MiniMax M1. En programmation compétitive, Qwen3.5 est en tête (LiveCodeBench 85.33% vs. ~83% pour MiniMax M2). Sur les tâches à forte intensité de connaissances, Qwen3.5 obtient 87.37% sur GPQA Diamond. Le prix d'entrée des modèles phares est équivalent à $0.30/1M pour les deux, bien que le MiniMax M2.5 à $0.15 soit moins cher que les anciennes variantes de Qwen. Le choix entre les deux pour la plupart des tâches de codage et d'analyse est vraiment serré ; Qwen prend l'avantage sur la recherche de connaissances et les mathématiques compétitives, tandis que MiniMax se démarque sur la longueur du contexte et l'utilisation brute d'outils agentiques.

MiniMax vs. DeepSeek V3.2 : L'écart mécanique se situe entre le débit et la profondeur du contexte. DeepSeek V3.2 génère environ 230 tokens par seconde ; MiniMax M2 en génère 114.5. Si la vitesse est la contrainte principale, DeepSeek est environ deux fois plus rapide. Lors du lancement de MiniMax M1 en juin 2025, son contexte de 1 million de tokens était 8 fois plus grand que la fenêtre de 128K de DeepSeek R1, un écart architectural concret. DeepSeek V3.2 a depuis étendu son contexte, mais MiniMax M1 et MiniMax-01 restent les références pour le traitement de très longues entrées. La conception des limites de débit diffère également : DeepSeek utilise des fenêtres glissantes, MiniMax utilise des fenêtres fixes de 5 heures. Les équipes ayant des modèles d'utilisation en rafale signalent généralement que le système de DeepSeek est plus facile à utiliser.

Pour être complet, Kimi K2 de Moonshot AI est le troisième concurrent majeur dans cette catégorie. Kimi utilise 1 billion de paramètres au total (32 milliards actifs), surpasse MiniMax M2 sur BrowseComp (60.2% vs. 44.0%) et égale Claude Opus 4.6 sur les mathématiques AIME. MiniMax est moins cher que Kimi ($0.30 vs. $0.60/1M en entrée pour le modèle phare). Il convient également de comparer : Zhipu GLM et Llama en tant qu'alternatives à poids ouverts à différents niveaux de capacités et de coûts.

Le niveau d'API payant en vaut-il la peine ?

À $0.15/1M de tokens en entrée (M2.5), MiniMax est environ 16 fois moins cher que Claude Opus 4.6 pour l'entrée et représente environ 8% du coût total de l'API par token selon une analyse indépendante. Pour le traitement en masse, les pipelines de révision de code ou l'analyse de documents à grande échelle, l'aspect économique est très attractif.

La principale mise en garde : MiniMax n'offre pas de niveau d'inférence véritablement gratuit comme le font certains services d'hébergement open source. Le Token Plan est un forfait de volume prépayé ; l'Unlimited Monthly Plan existe pour une utilisation intensive en entreprise. Pour l'évaluation et le prototypage, OpenRouter héberge la plupart des modèles MiniMax avec un accès à l'usage (pay-as-you-go) commençant aux tarifs par token indiqués ci-dessus, ce qui constitue le moyen le plus simple de tester avant de s'engager avec un compte direct sur la plateforme.

La variante MiniMax M2.7-highspeed est à $0.60/1M en entrée, soit le double du tarif standard du M2.7. Les développeurs doivent vérifier quelle variante est appelée par défaut lors de l'utilisation d'intégrations tierces, car la nomenclature peut être ambiguë dans la documentation des wrappers d'API.

Les modèles à poids ouverts sous licence Apache 2.0 (M1, M2) peuvent être auto-hébergés par les équipes disposant d'une infrastructure suffisante, éliminant ainsi totalement les coûts par token après le déploiement. C'est la voie la plus rentable pour les utilisateurs à grande échelle, mais elle nécessite une capacité de déploiement de 230 à 456 milliards de paramètres.

Meilleurs cas d'usage (et quand l'éviter)

Idéal pour :

  • Les pipelines d'ingénierie logicielle agentiques, l'automatisation CI/CD et la génération de code en plusieurs étapes. Les performances sur TAU-bench soutiennent ce cas d'usage avec des données vérifiables.

  • L'analyse de documents longs où une fenêtre de contexte de 200K à 1 million de tokens élimine le besoin de découpage (chunking). Bases de code entières, documents juridiques, corpus de recherche.

  • Les charges de travail en production sensibles aux coûts, où les tarifs de Claude ou GPT-4 sont insoutenables et où la qualité des réponses sur les tâches de code doit rester proche des modèles de pointe.

  • Les cas d'usage d'auto-hébergement ou de fine-tuning nécessitant une licence Apache 2.0.

  • Les équipes développant déjà sur le SDK Anthropic qui souhaitent intégrer un modèle moins cher au niveau du point de terminaison sans modifier leur code.

Évitez MiniMax quand :

  • Un débit de sortie supérieur à 150 tokens/seconde est une exigence stricte. DeepSeek V3.2 gère mieux l'inférence à grande vitesse en rafale.

  • Le cas d'usage implique des sujets politiques, géopolitiques ou sensibles pour la juridiction chinoise, où le filtrage de contenu est susceptible d'interférer.

  • La tâche principale est la génération de preuves mathématiques ou les mathématiques de compétition. Kimi K2 Thinking et Qwen3.5 obtiennent des scores nettement supérieurs sur AIME et les benchmarks de raisonnement formel.

  • Des limites de débit glissantes et prévisibles sont requises. La conception en fenêtres fixes de 5 heures nécessite de repenser la logique de nouvelle tentative (retry) pour les flux de travail des agents.

  • Une inférence locale sur du matériel grand public est nécessaire. Le nombre de paramètres est trop important pour tout autre matériel que des clusters de GPU d'entreprise.

Premiers pas avec MiniMax

La voie la plus rapide : créez un compte sur platform.minimax.io, achetez un pack Token Plan et appelez l'API via le point de terminaison compatible Anthropic (https://api.minimax.io/anthropic) en utilisant votre code SDK Anthropic existant. Définissez l'URL de base et la clé d'API ; la chaîne du modèle devient « MiniMax-M2.7 » ou « MiniMax-M2.5 » selon votre objectif de coût-performance.

Pour une évaluation sans création de compte, OpenRouter propose MiniMax M2 et M2.7 en tant que modèles à l'usage (pay-as-you-go) accessibles avec une clé OpenRouter. C'est la première étape recommandée avant de s'engager avec un compte sur la plateforme MiniMax et un Token Plan.

Les modèles à poids ouverts M1 et M2 sont sur HuggingFace sous MiniMaxAI. Pour l'auto-hébergement, commencez par la variante M2 (230 milliards au total, 10 milliards actifs) qui constitue une cible de déploiement plus gérable que les 456 milliards du M1. vLLM et SGLang ont tous deux été utilisés avec succès par la communauté pour le service d'inférence.

Planification des limites de débit : partez du principe qu'il s'agit de fenêtres fixes de 5 heures et configurez un backoff exponentiel en conséquence. Le Coding Plan (basé sur un quota de prompts) et la facturation directe des crédits API ont des modèles économiques différents selon la forme de la charge de travail ; les équipes exécutant des boucles d'agents soutenues préfèrent généralement la facturation par crédits pour éviter les blocages liés aux fenêtres du forfait.

Avis des utilisateurs

Aucun avis pour l'instant. Soyez le premier à partager votre expérience !

Se connecter pour écrire un avis.

Articles associés

Guides et articles en lien avec MiniMax (Modèles de texte).