Guide de Dimensionnement & Achat Matériel
Le Guide GPU Ultime pour les LLM Locaux
Oubliez les benchmarks de jeux vidéo. Découvrez pourquoi la bande passante mémoire dicte votre vitesse de génération, quel palier de VRAM choisir selon vos modèles et comment se compare Apple Silicon face à Nvidia.
1. La Règle d'Or du Matériel IA : La Bande Passante Avant la Puissance Brute
Lors de l'inférence autorégressive de LLM, le facteur limitant est très rarement la puissance de calcul brute (TFLOPS). Il s'agit presque toujours de la bande passante mémoire : la vitesse à laquelle les poids du modèle peuvent être transférés de la VRAM vers les cœurs de calcul.
Pendant la génération, la totalité des poids du modèle doit être lue en mémoire pour chaque token produit. Une carte graphique dotée d'une grande puissance mais d'un bus mémoire étroit restera inactive en attendant les données.
Exemple : Un modèle 70B quantifié en Q4 occupe environ 40 Go de VRAM. Sur une RTX 3090 (936 Go/s de bande passante), la vitesse théorique maximale est de 936 / 40 = 23,4 tokens/seconde. Sur de la mémoire RAM système DDR5 (60 Go/s), ce même modèle tourne à seulement 60 / 40 = 1,5 token/seconde.
2. Les 4 Paliers de Capacité VRAM : Que Pouvez-Vous Réellement Faire Tourner ?
Modèles de 7B à 8B en Q4_K_M (Llama 3 8B, Mistral 7B, Qwen 2.5 7B). Contexte court jusqu'à 8k tokens.
RTX 3060 12 Go (la référence économique), RTX 4060 Ti 16 Go, ou RTX 5060 Ti 16 Go.
Modèles de 14B à 32B en Q4_K_M (Qwen 2.5 32B, Command-R), ou modèles 70B avec quantification agressive (IQ2/Q3).
RTX 3090 24 Go (occasion, rapport qualité/prix imbattable), RTX 4090 24 Go, ou RTX 5090 32 Go.
Modèles complets 70B à 72B en Q4_K_M avec un large contexte de 32k tokens et cache KV en FP8.
Dual RTX 3090 (48 Go cumulés), dual RTX 4090, ou Apple Mac Studio M2/M3/M4 Max (48 Go à 64 Go).
Llama 3.3 70B en Q8_0, Qwen 2.5 72B en FP16, versions distillées de DeepSeek R1/V3, et Llama 405B en Q2/Q3.
Apple Mac Studio M2/M3 Ultra (128 Go à 192 Go de mémoire unifiée) ou stations de travail multi-GPU.
3. Apple Silicon Mac vs PC Nvidia : Que Devez-Vous Acheter ?
- Capacité VRAM Gigantesque : Jusqu'à 128 Go ou 192 Go de mémoire unifiée sur un bureau silencieux.
- Consommation Faible et Silencieuse : 80W à 120W en charge maximale contre 850W+ pour les configurations PC multi-GPU.
- Bande Passante Modérée : 300 à 800 Go/s offrant une vitesse pratique de 15 à 25 tokens/s sur les modèles 70B.
- Écosystème Logiciel : Excellent avec MLX natif et llama.cpp Metal ; les outils CUDA et vLLM ne sont pas compatibles.
- Vitesse de Génération Maximale : Bande passante de 1 008 Go/s sur RTX 4090 pour des débits fulgurants de 30 à 60 tokens/s.
- Standard de l'Industrie : Compatibilité totale avec CUDA, PyTorch, vLLM, TensorRT-LLM et FlashAttention-2.
- Plafond de VRAM : Limite stricte de 24 Go par carte grand public. Faire tourner du 70B requiert une installation multi-GPU.
- Consommation et Chaleur : Nécessite une alimentation de 1 000W+, un boîtier très ventilé et un refroidissement adapté.
4. Construire une Station de Travail Dual-GPU pour Modèles 70B
Si votre objectif est de faire tourner des modèles 70B à pleine vitesse sur PC, la configuration à deux cartes reste la plus économique :
Vérifiez que votre carte mère gère la bifurcation x8 / x8 sur les lignes CPU, avec un espacement de 3 à 4 slots pour le refroidissement.
Prévoyez au minimum un bloc de 1 200W ou 1 500W certifié Platinum ou Titanium pour encaisser les pics de tension de deux RTX 3090 ou 4090.
Utilisez vLLM avec Tensor Parallelism (--tensor-parallel-size 2) ou le multi-GPU de llama.cpp pour répartir les couches entre les deux cartes.
Foire Aux Questions
Pour les modèles 7B ou 8B en quantification standard (Q4_K_M), prévoyez au moins 8 à 12 Go de VRAM. Pour les modèles 14B à 32B, comptez 16 à 24 Go. Pour les modèles 70B, il faut au moins 40 à 48 Go de VRAM répartis sur deux GPU ou sur un Mac Studio à mémoire unifiée.
Dans l'inférence de texte mot à mot, le processeur graphique passe l'essentiel de son temps à charger les poids du modèle depuis la mémoire vers les unités de calcul. La vitesse de génération est donc strictement bridée par les Go/s de votre mémoire plutôt que par vos TFLOPS bruts.
Oui, via des moteurs comme llama.cpp. Cependant, la vitesse de génération s'effondre drastiquement (souvent de 35 tokens/s à 2 ou 3 tokens/s) en raison du débit très inférieur de la mémoire DDR4/DDR5 et du passage par le bus PCIe.
La RTX 4090 est nettement plus rapide pour les modèles qui tiennent dans ses 24 Go. Mais le Mac Studio 64 Go ou 128 Go permet de faire tourner des modèles géants de 70B qui ne peuvent tout simplement pas démarrer sur une carte de 24 Go sans offload CPU.
Pour les modèles 70B, oui sans hésiter. Deux RTX 3090 d'occasion cumulent 48 Go de VRAM pour un tarif similaire à une RTX 4090, permettant de faire tourner Llama 3.3 70B entièrement en mémoire à plus de 25 tokens/s.
Besoin de plus de VRAM que votre GPU local ?
Louez des instances RTX 4090 ou H100 à la demande sur Scaleway, RunPod ou Vast.ai à partir de 0,34 $/h.
Knowledge & Deep Dives
Centre de Connaissances VRAM & LLM Locaux
Guides approfondis, analyses architecturales et manuels de dimensionnement matériel pour déployer et exécuter vos modèles d'IA en local sans mauvaise surprise.