Aller au contenu principal
Vantaige

Guide de Dimensionnement & Achat Matériel

Le Guide GPU Ultime pour les LLM Locaux

Oubliez les benchmarks de jeux vidéo. Découvrez pourquoi la bande passante mémoire dicte votre vitesse de génération, quel palier de VRAM choisir selon vos modèles et comment se compare Apple Silicon face à Nvidia.

1. La Règle d'Or du Matériel IA : La Bande Passante Avant la Puissance Brute

Lors de l'inférence autorégressive de LLM, le facteur limitant est très rarement la puissance de calcul brute (TFLOPS). Il s'agit presque toujours de la bande passante mémoire : la vitesse à laquelle les poids du modèle peuvent être transférés de la VRAM vers les cœurs de calcul.

Pendant la génération, la totalité des poids du modèle doit être lue en mémoire pour chaque token produit. Une carte graphique dotée d'une grande puissance mais d'un bus mémoire étroit restera inactive en attendant les données.

Vitesse Maximale (tokens/sec) = Bande Passante Mémoire (Go/s) / Taille du Modèle en VRAM (Go)

Exemple : Un modèle 70B quantifié en Q4 occupe environ 40 Go de VRAM. Sur une RTX 3090 (936 Go/s de bande passante), la vitesse théorique maximale est de 936 / 40 = 23,4 tokens/seconde. Sur de la mémoire RAM système DDR5 (60 Go/s), ce même modèle tourne à seulement 60 / 40 = 1,5 token/seconde.

2. Les 4 Paliers de Capacité VRAM : Que Pouvez-Vous Réellement Faire Tourner ?

Entrée de Gamme8-12 Go Mémoire
Palier 8 Go à 12 Go de VRAM

Modèles de 7B à 8B en Q4_K_M (Llama 3 8B, Mistral 7B, Qwen 2.5 7B). Contexte court jusqu'à 8k tokens.

RTX 3060 12 Go (la référence économique), RTX 4060 Ti 16 Go, ou RTX 5060 Ti 16 Go.

Idéal pour : Débutants, étudiants, assistants de code légers et expérimentations locales à budget maîtrisé.
Le Choix Idéal16-24 Go Mémoire
Palier 16 Go à 24 Go de VRAM

Modèles de 14B à 32B en Q4_K_M (Qwen 2.5 32B, Command-R), ou modèles 70B avec quantification agressive (IQ2/Q3).

RTX 3090 24 Go (occasion, rapport qualité/prix imbattable), RTX 4090 24 Go, ou RTX 5090 32 Go.

Idéal pour : Développeurs confirmés, fine-tuning local (LoRA/QLoRA) et modèles de programmation 32B très précis.
Standard Passionné32-48 Go Mémoire
Palier 32 Go à 48 Go (Dual GPU / Mac)

Modèles complets 70B à 72B en Q4_K_M avec un large contexte de 32k tokens et cache KV en FP8.

Dual RTX 3090 (48 Go cumulés), dual RTX 4090, ou Apple Mac Studio M2/M3/M4 Max (48 Go à 64 Go).

Idéal pour : Prototypage de production, analyse de longs documents et raisonnement sur modèles 70B sans compromis.
Paradis des 70B+64-128+ Go Mémoire
Palier 64 Go à 128 Go+ (Mac Studio / Multi-GPU Pro)

Llama 3.3 70B en Q8_0, Qwen 2.5 72B en FP16, versions distillées de DeepSeek R1/V3, et Llama 405B en Q2/Q3.

Apple Mac Studio M2/M3 Ultra (128 Go à 192 Go de mémoire unifiée) ou stations de travail multi-GPU.

Idéal pour : Équipes d'entreprise, chercheurs en IA et passionnés exigeant une IA de pointe entièrement hors ligne.

3. Apple Silicon Mac vs PC Nvidia : Que Devez-Vous Acheter ?

Apple Silicon (Mémoire Unifiée)
  • Capacité VRAM Gigantesque : Jusqu'à 128 Go ou 192 Go de mémoire unifiée sur un bureau silencieux.
  • Consommation Faible et Silencieuse : 80W à 120W en charge maximale contre 850W+ pour les configurations PC multi-GPU.
  • Bande Passante Modérée : 300 à 800 Go/s offrant une vitesse pratique de 15 à 25 tokens/s sur les modèles 70B.
  • Écosystème Logiciel : Excellent avec MLX natif et llama.cpp Metal ; les outils CUDA et vLLM ne sont pas compatibles.
Station de Travail Nvidia (Écosystème CUDA)
  • Vitesse de Génération Maximale : Bande passante de 1 008 Go/s sur RTX 4090 pour des débits fulgurants de 30 à 60 tokens/s.
  • Standard de l'Industrie : Compatibilité totale avec CUDA, PyTorch, vLLM, TensorRT-LLM et FlashAttention-2.
  • Plafond de VRAM : Limite stricte de 24 Go par carte grand public. Faire tourner du 70B requiert une installation multi-GPU.
  • Consommation et Chaleur : Nécessite une alimentation de 1 000W+, un boîtier très ventilé et un refroidissement adapté.

4. Construire une Station de Travail Dual-GPU pour Modèles 70B

Si votre objectif est de faire tourner des modèles 70B à pleine vitesse sur PC, la configuration à deux cartes reste la plus économique :

1. Lignes PCIe de la Carte Mère

Vérifiez que votre carte mère gère la bifurcation x8 / x8 sur les lignes CPU, avec un espacement de 3 à 4 slots pour le refroidissement.

2. Alimentation Électrique (PSU)

Prévoyez au minimum un bloc de 1 200W ou 1 500W certifié Platinum ou Titanium pour encaisser les pics de tension de deux RTX 3090 ou 4090.

3. Moteur d'Inférence

Utilisez vLLM avec Tensor Parallelism (--tensor-parallel-size 2) ou le multi-GPU de llama.cpp pour répartir les couches entre les deux cartes.

Foire Aux Questions

Pour les modèles 7B ou 8B en quantification standard (Q4_K_M), prévoyez au moins 8 à 12 Go de VRAM. Pour les modèles 14B à 32B, comptez 16 à 24 Go. Pour les modèles 70B, il faut au moins 40 à 48 Go de VRAM répartis sur deux GPU ou sur un Mac Studio à mémoire unifiée.

Dans l'inférence de texte mot à mot, le processeur graphique passe l'essentiel de son temps à charger les poids du modèle depuis la mémoire vers les unités de calcul. La vitesse de génération est donc strictement bridée par les Go/s de votre mémoire plutôt que par vos TFLOPS bruts.

Oui, via des moteurs comme llama.cpp. Cependant, la vitesse de génération s'effondre drastiquement (souvent de 35 tokens/s à 2 ou 3 tokens/s) en raison du débit très inférieur de la mémoire DDR4/DDR5 et du passage par le bus PCIe.

La RTX 4090 est nettement plus rapide pour les modèles qui tiennent dans ses 24 Go. Mais le Mac Studio 64 Go ou 128 Go permet de faire tourner des modèles géants de 70B qui ne peuvent tout simplement pas démarrer sur une carte de 24 Go sans offload CPU.

Pour les modèles 70B, oui sans hésiter. Deux RTX 3090 d'occasion cumulent 48 Go de VRAM pour un tarif similaire à une RTX 4090, permettant de faire tourner Llama 3.3 70B entièrement en mémoire à plus de 25 tokens/s.

Besoin de plus de VRAM que votre GPU local ?

Louez des instances RTX 4090 ou H100 à la demande sur Scaleway, RunPod ou Vast.ai à partir de 0,34 $/h.

Voir les Tarifs GPU Cloud

Knowledge & Deep Dives

Centre de Connaissances VRAM & LLM Locaux

Guides approfondis, analyses architecturales et manuels de dimensionnement matériel pour déployer et exécuter vos modèles d'IA en local sans mauvaise surprise.

50+ Termes8 min de référence
Maîtrisez le vocabulaire technique: GGUF vs Safetensors, K-quants, cache KV, GQA, paramètres actifs MoE et mémoire unifiée Apple Silicon.
Recherche et filtrage interactif par catégorie
Enseignements matériels concrets pour chaque terme
Définitions claires sans jargon inutile
Index alphabétique de consultation rapide
Consulter le Guide
Outil Interactif6 min de lecture
Comprenez pourquoi la longueur de contexte sature la VRAM, la formule mathématique exacte et comment économiser de 50% à 75% de mémoire.
Calculateur interactif de mémoire de contexte
Architectures MHA vs GQA vs DeepSeek MLA
Gains de la quantification du cache en FP8 et INT4
Consommation mémoire en dialogue multi-tours
Consulter le Guide
Décodeur de Configuration7 min de lecture
Examinez les dépôts Hugging Face comme un ingénieur ML: déchiffrez config.json, identifiez les vraies limites de contexte et évitez le piège des paramètres MoE.
Inspecteur interactif des paramètres config.json
Nomenclature des quantifications GGUF expliquée
Règles de mémoire des paramètres actifs vs totaux MoE
Fenêtres de contexte et mise à l'échelle RoPE
Consulter le Guide
Matrice des Licences5 min de lecture
Les distinctions juridiques et pratiques entre le véritable Open Source OSI et les modèles à poids ouverts comme Llama 3, DeepSeek, Qwen 2.5 et Gemma 2.
Matrice comparative interactive des licences
Seuils d'utilisateurs et de chiffre d'affaires
Restrictions sur la distillation de données synthétiques
Grille de conformité juridique pour entreprises
Consulter le Guide