Aller au contenu principal
PHARE · GRATUITCalculateur VRAM, quel GPU pour quel modèle ? →
À la une Pack modèles IA & mode →
Vantaige
MATÉRIEL COMPACT. GRANDES POSSIBILITÉS.

Grandes idées.
Empreinte mémoire réduite.Calculateur VRAM LLM : vérifiez quels modèles votre GPU peut exécuter

Choisissez un vrai modèle ouvert, pas seulement un nombre de paramètres, et obtenez une estimation claire de la mémoire, le matériel local compatible et les offres de location de GPU correspondantes.

Votre prochaine configuration IA
est peut-être déjà sur votre bureau.

Découvrir
64 modèles prêts · recherchez dans le catalogue quotidien en cache
01

Configurer

Choisissez ce que vous voulez exécuter

ESTIMATION EN DIRECT
Modèles populaires et abordables
Apache-2.0 · Open source: Licence open source permissive (ex. Apache-2.0 ou MIT). Permet généralement l'utilisation commerciale, la modification et l'auto-hébergement sous réserve des mentions légales.
Apache-2.0 · Open source: Licence open source permissive (ex. Apache-2.0 ou MIT). Permet généralement l'utilisation commerciale, la modification et l'auto-hébergement sous réserve des mentions légales.
Apache-2.0 · Open source: Licence open source permissive (ex. Apache-2.0 ou MIT). Permet généralement l'utilisation commerciale, la modification et l'auto-hébergement sous réserve des mentions légales.
Apache-2.0 · Open source: Licence open source permissive (ex. Apache-2.0 ou MIT). Permet généralement l'utilisation commerciale, la modification et l'auto-hébergement sous réserve des mentions légales.
Apache-2.0 · Open source: Licence open source permissive (ex. Apache-2.0 ou MIT). Permet généralement l'utilisation commerciale, la modification et l'auto-hébergement sous réserve des mentions légales.
MIT · Open source: Licence open source permissive (ex. Apache-2.0 ou MIT). Permet généralement l'utilisation commerciale, la modification et l'auto-hébergement sous réserve des mentions légales.
8.2B paramètresGQAJusqu’à 128K de contexteOpen sourceFiche du modèle Comment vérifier vos spécifications

Notice d'utilisation commerciale: Licence open source permissive (ex. Apache-2.0 ou MIT). Permet généralement l'utilisation commerciale, la modification et l'auto-hébergement sous réserve des mentions légales.

Glossaire de quantification

Choisissez une carte pour comparer l'ajustement VRAM, la marge restante et la vitesse estimée du modèle ci-dessus.

8K tokens
Hypothèses avancées
VOTRE ESTIMATION MÉMOIRE
CompatibleTaille de fichier exacte

Oui, Qwen3 8B devrait fonctionner sur RTX 4090 avec 17.3 GiB de marge brute.

6.7 GiB

Qwen3 8B · Q4_K_M · 8K tokens

Estimation de mémoire accélérateur requiseRTX 4090 · capacité de 24 GiB
Poids
4.7 GiB
Cache KV
1.1 GiB
Runtime
0.9 GiB
Vitesse estimée:
~140 tok/s(1008 Go/s - estimation basée sur la bande passante)

RTX 4060

8 GiB · 1.3 GiB de marge

Lien affilié · Vantaige peut recevoir une commission.

RTX 5060

8 GiB · 1.3 GiB de marge

Lien affilié · Vantaige peut recevoir une commission.

RTX 3060

12 GiB · 5.3 GiB de marge

Lien affilié · Vantaige peut recevoir une commission.

RTX 4070 Super

12 GiB · 5.3 GiB de marge

Lien affilié · Vantaige peut recevoir une commission.

RTX 5070

12 GiB · 5.3 GiB de marge

Lien affilié · Vantaige peut recevoir une commission.

RTX 4060 Ti

16 GiB · 9.3 GiB de marge

Lien affilié · Vantaige peut recevoir une commission.

RTX 4070 Ti Super

16 GiB · 9.3 GiB de marge

Lien affilié · Vantaige peut recevoir une commission.

RTX 4080 Super

16 GiB · 9.3 GiB de marge

Lien affilié · Vantaige peut recevoir une commission.

RTX 5070 Ti

16 GiB · 9.3 GiB de marge

Lien affilié · Vantaige peut recevoir une commission.

RTX 5080

16 GiB · 9.3 GiB de marge

Lien affilié · Vantaige peut recevoir une commission.

RTX 5060 Ti

16 GiB · 9.3 GiB de marge

Lien affilié · Vantaige peut recevoir une commission.

RX 7800 XT

16 GiB · 9.3 GiB de marge

Lien affilié · Vantaige peut recevoir une commission.

Les résultats sûrs incluent une réserve pour le système ou l’accélérateur ; la capacité brute seule n’est pas suffisante.

LE JUSTE CHOIX, SANS EXCÈS

Le prochain foyer de votre modèle.

46 options locales compatibles avec Qwen3 8B avec ces réglages. Commencez petit. Évoluez au besoin.

Compatibilité mémoire vérifiée selon vos réglages
PLUS D’ESPACE POUR EXPÉRIMENTERS

Apple 512 GB

Apple Silicon 512 GB unified memory

Passe confortablement+505 GiB
~111 tok/sest. décodage512 GiB435 GiB GiB utilisables
Vérifier le prixordinateur complet · référence
Vérifier le prix
PLUS D’ESPACE POUR EXPÉRIMENTERS

Apple 256 GB

Apple Silicon 256 GB unified memory

Passe confortablement+249 GiB
~111 tok/sest. décodage256 GiB218 GiB GiB utilisables
Vérifier le prixordinateur complet · référence
Vérifier le prix
PLUS D’ESPACE POUR EXPÉRIMENTERS

Apple 192 GB

Apple Silicon 192 GB unified memory

Passe confortablement+185 GiB
~111 tok/sest. décodage192 GiB163 GiB GiB utilisables
Vérifier le prixordinateur complet · référence
Vérifier le prix
PRO / CLOUDS

H200

NVIDIA H200 141 GB

Passe confortablement+134 GiB
~666 tok/sest. décodage141 GiB134 GiB GiB utilisables
Vérifier le prixGPU seul · référence
Vérifier le prix
PLUS D’ESPACE POUR EXPÉRIMENTERS

Apple 128 GB

Apple Silicon 128 GB unified memory

Passe confortablement+121 GiB
~111 tok/sest. décodage128 GiB109 GiB GiB utilisables
Amazon · Apple MacBook Pro 16 M4 Max 128GB unified memoryordinateur complet · référence
Vérifier le prix
PRÊT POUR CUDAS

RTX PRO 6000

NVIDIA RTX PRO 6000 Blackwell 96 GB

Passe confortablement+89.3 GiB
~250 tok/sest. décodage96 GiB90.2 GiB GiB utilisables
Newegg · PNY RTX PRO 6000 Blackwell 96GBGPU seul · référence
Vérifier le prix
PLUS D’ESPACE POUR EXPÉRIMENTERS

Apple 96 GB

Apple Silicon 96 GB unified memory

Passe confortablement+89.3 GiB
~56 tok/sest. décodage96 GiB81.6 GiB GiB utilisables
Amazon · Apple Mac Studio M3 Ultra 96GB unified memoryordinateur complet · référence
Vérifier le prix
PRO / CLOUDS

H100 NVL

NVIDIA H100 NVL 94 GB

Passe confortablement+87.3 GiB
~541 tok/sest. décodage94 GiB89.3 GiB GiB utilisables
Vérifier le prixGPU seul · référence
Vérifier le prix
PRO / CLOUDS

A100 80 GB

NVIDIA A100 80 GB

Passe confortablement+73.3 GiB
~283 tok/sest. décodage80 GiB76.0 GiB GiB utilisables
Vérifier le prixGPU seul · référence
Vérifier le prix
PRO / CLOUDS

H100 80 GB

NVIDIA H100 80 GB

Passe confortablement+73.3 GiB
~465 tok/sest. décodage80 GiB76.0 GiB GiB utilisables
Vérifier le prixGPU seul · référence
Vérifier le prix
PLUS D’ESPACE POUR EXPÉRIMENTERS

Ryzen Mini 64 GB

AMD Ryzen Mini PC 64 GB unified memory

Passe confortablement+57.3 GiB
~12 tok/sest. décodage64 GiB54.4 GiB GiB utilisables
Amazon · Minisforum UM890 Pro Mini PC 64GB DDR5 OCuLinkordinateur complet · référence
Vérifier le prix
PLUS D’ESPACE POUR EXPÉRIMENTERS

Apple 64 GB

Apple Silicon 64 GB unified memory

Passe confortablement+57.3 GiB
~56 tok/sest. décodage64 GiB54.4 GiB GiB utilisables
Amazon · Apple MacBook Pro 16 M4 Max 64GB unified memoryordinateur complet · référence
Vérifier le prix
PRÊT POUR CUDAS

RTX 6000 Ada

NVIDIA RTX 6000 Ada 48 GB

Passe confortablement+41.3 GiB
~133 tok/sest. décodage48 GiB45.1 GiB GiB utilisables
Newegg · PNY RTX 6000 Ada Generation 48GBGPU seul · référence
Vérifier le prix
PRÊT POUR CUDAS

RTX A6000

NVIDIA RTX A6000 48 GB

Passe confortablement+41.3 GiB
~107 tok/sest. décodage48 GiB45.1 GiB GiB utilisables
Amazon · PNY RTX A6000 48GB GDDR6GPU seul · référence
Vérifier le prix
PRO / CLOUDS

A40

NVIDIA A40 48 GB

Passe confortablement+41.3 GiB
~97 tok/sest. décodage48 GiB45.6 GiB GiB utilisables
Vérifier le prixGPU seul · référence
Vérifier le prix
PRO / CLOUDS

L40S

NVIDIA L40S 48 GB

Passe confortablement+41.3 GiB
~120 tok/sest. décodage48 GiB45.6 GiB GiB utilisables
Vérifier le prixGPU seul · référence
Vérifier le prix
PLUS D’ESPACE POUR EXPÉRIMENTERS

Apple 48 GB

Apple Silicon 48 GB unified memory

Passe confortablement+41.3 GiB
~42 tok/sest. décodage48 GiB40.8 GiB GiB utilisables
Amazon · Apple Mac mini M4 Pro 48GB unified memoryordinateur complet · référence
Vérifier le prix
PRO / CLOUDS

A100 40 GB

NVIDIA A100 40 GB

Passe confortablement+33.3 GiB
~216 tok/sest. décodage40 GiB38.0 GiB GiB utilisables
Vérifier le prixGPU seul · référence
Vérifier le prix
PLUS D’ESPACE POUR EXPÉRIMENTERS

Apple 36 GB

Apple Silicon 36 GB unified memory

Passe confortablement+29.3 GiB
~21 tok/sest. décodage36 GiB30.6 GiB GiB utilisables
Amazon · Apple MacBook Pro 16 M4 36GB unified memoryordinateur complet · référence
Vérifier le prix
PRÊT POUR CUDAS

RTX 5090

NVIDIA RTX 5090 32 GB

Passe confortablement+25.3 GiB
~249 tok/sest. décodage32 GiB29.4 GiB GiB utilisables
Amazon · ASUS TUF Gaming RTX 5090 32GBGPU seul · référence
Vérifier le prix
PRÊT POUR CUDAS

RTX 5000 Ada

NVIDIA RTX 5000 Ada 32 GB

Passe confortablement+25.3 GiB
~80 tok/sest. décodage32 GiB30.1 GiB GiB utilisables
Amazon · PNY RTX 5000 Ada Generation 32GBGPU seul · référence
Vérifier le prix
PLUS D’ESPACE POUR EXPÉRIMENTERS

Ryzen Mini 32 GB

AMD Ryzen Mini PC 32 GB unified memory

Passe confortablement+25.3 GiB
~12 tok/sest. décodage32 GiB27.2 GiB GiB utilisables
Amazon · Beelink SER8 Mini PC AMD Ryzen 7 32GB DDR5ordinateur complet · référence
Vérifier le prix
PRÊT POUR CUDAS

RTX 3090

NVIDIA RTX 3090 24 GB

Passe confortablement+17.3 GiB
~130 tok/sest. décodage24 GiB22.1 GiB GiB utilisables
Amazon · ASUS TUF Gaming OC RTX 3090 24GBGPU seul · référence
Vérifier le prix
PRÊT POUR CUDAS

RTX 4090

NVIDIA RTX 4090 24 GB

Passe confortablement+17.3 GiB
~140 tok/sest. décodage24 GiB22.1 GiB GiB utilisables
Amazon · ASUS ROG Strix LC RTX 4090 24GBGPU seul · référence
Vérifier le prix
PLUS D’ESPACE POUR EXPÉRIMENTERS

RX 7900 XTX

AMD Radeon RX 7900 XTX 24 GB

Passe confortablement+17.3 GiB
~133 tok/sest. décodage24 GiB22.1 GiB GiB utilisables
Amazon · PowerColor Red Devil RX 7900 XTX 24GBGPU seul · référence
Vérifier le prix
PRO / CLOUDS

L4

NVIDIA L4 24 GB

Passe confortablement+17.3 GiB
~42 tok/sest. décodage24 GiB22.8 GiB GiB utilisables
Vérifier le prixGPU seul · référence
Vérifier le prix
PRO / CLOUDS

A10

NVIDIA A10 24 GB

Passe confortablement+17.3 GiB
~83 tok/sest. décodage24 GiB22.8 GiB GiB utilisables
Vérifier le prixGPU seul · référence
Vérifier le prix
PRO / CLOUDS

A30

NVIDIA A30 24 GB

Passe confortablement+17.3 GiB
~130 tok/sest. décodage24 GiB22.8 GiB GiB utilisables
Vérifier le prixGPU seul · référence
Vérifier le prix
PLUS D’ESPACE POUR EXPÉRIMENTERS

Apple 24 GB

Apple Silicon 24 GB unified memory

Passe confortablement+17.3 GiB
~21 tok/sest. décodage24 GiB20.0 GiB GiB utilisables
Amazon · Apple Mac mini M4 24GB unified memoryordinateur complet · référence
Vérifier le prix
PLUS D’ESPACE POUR EXPÉRIMENTERS

RX 7900 XT

AMD Radeon RX 7900 XT 20 GB

Passe confortablement+13.3 GiB
~111 tok/sest. décodage20 GiB18.4 GiB GiB utilisables
Amazon · Sapphire Pulse RX 7900 XT 20GBGPU seul · référence
Vérifier le prix
PRÊT POUR CUDAS

RTX 4060 Ti

NVIDIA RTX 4060 Ti 16 GB

Passe confortablement+9.3 GiB
~40 tok/sest. décodage16 GiB14.7 GiB GiB utilisables
Amazon · GIGABYTE Gaming OC RTX 4060 Ti 16GBGPU seul · référence
Vérifier le prix
PRÊT POUR CUDAS

RTX 4070 Ti Super

NVIDIA RTX 4070 Ti Super 16 GB

Passe confortablement+9.3 GiB
~93 tok/sest. décodage16 GiB14.7 GiB GiB utilisables
Amazon · GIGABYTE Gaming OC RTX 4070 Ti Super 16GBGPU seul · référence
Vérifier le prix
PRÊT POUR CUDAS

RTX 4080 Super

NVIDIA RTX 4080 Super 16 GB

Passe confortablement+9.3 GiB
~102 tok/sest. décodage16 GiB14.7 GiB GiB utilisables
Amazon · GIGABYTE Windforce OC RTX 4080 Super 16GBGPU seul · référence
Vérifier le prix
PRÊT POUR CUDAS

RTX 5070 Ti

NVIDIA RTX 5070 Ti 16 GB

Passe confortablement+9.3 GiB
~124 tok/sest. décodage16 GiB14.7 GiB GiB utilisables
Amazon · ASUS Prime RTX 5070 Ti 16GBGPU seul · référence
Vérifier le prix
PRÊT POUR CUDAS

RTX 5080

NVIDIA RTX 5080 16 GB

Passe confortablement+9.3 GiB
~139 tok/sest. décodage16 GiB14.7 GiB GiB utilisables
Amazon · ASUS Prime RTX 5080 16GBGPU seul · référence
Vérifier le prix
PRÊT POUR CUDAS

RTX 5060 Ti

NVIDIA RTX 5060 Ti 16 GB

Passe confortablement+9.3 GiB
~62 tok/sest. décodage16 GiB14.7 GiB GiB utilisables
Amazon · ASUS Prime RTX 5060 Ti 16GBGPU seul · référence
Vérifier le prix
PLUS D’ESPACE POUR EXPÉRIMENTERS

RX 7800 XT

AMD Radeon RX 7800 XT 16 GB

Passe confortablement+9.3 GiB
~87 tok/sest. décodage16 GiB14.7 GiB GiB utilisables
Amazon · ASRock Steel Legend RX 7800 XT 16GB OCGPU seul · référence
Vérifier le prix
PLUS D’ESPACE POUR EXPÉRIMENTERS

RX 9060 XT

AMD Radeon RX 9060 XT 16 GB

Passe confortablement+9.3 GiB
~67 tok/sest. décodage16 GiB14.7 GiB GiB utilisables
Amazon · ASUS Dual RX 9060 XT 16GBGPU seul · référence
Vérifier le prix
PLUS D’ESPACE POUR EXPÉRIMENTERS

RX 9070

AMD Radeon RX 9070 16 GB

Passe confortablement+9.3 GiB
~89 tok/sest. décodage16 GiB14.7 GiB GiB utilisables
Amazon · ASRock Challenger RX 9070 16GB OCGPU seul · référence
Vérifier le prix
PLUS D’ESPACE POUR EXPÉRIMENTERS

RX 9070 XT

AMD Radeon RX 9070 XT 16 GB

Passe confortablement+9.3 GiB
~107 tok/sest. décodage16 GiB14.7 GiB GiB utilisables
Amazon · PowerColor Red Devil RX 9070 XT 16GBGPU seul · référence
Vérifier le prix
LE CHOIX DU QUOTIDIENS

Apple 16 GB

Apple Silicon 16 GB unified memory

Passe confortablement+9.3 GiB
~17 tok/sest. décodage16 GiB12.0 GiB GiB utilisables
Amazon · Apple Mac mini M4 16GB unified memoryordinateur complet · référence
Vérifier le prix
PRÊT POUR CUDAS

RTX 3060

NVIDIA RTX 3060 12 GB

Passe confortablement+5.3 GiB
~50 tok/sest. décodage12 GiB11.0 GiB GiB utilisables
Amazon · MSI Gaming GeForce RTX 3060 12GB Ventus 2X OCGPU seul · référence
Vérifier le prix
PRÊT POUR CUDAS

RTX 4070 Super

NVIDIA RTX 4070 Super 12 GB

Passe confortablement+5.3 GiB
~70 tok/sest. décodage12 GiB11.0 GiB GiB utilisables
Amazon · GIGABYTE Windforce OC RTX 4070 Super 12GBGPU seul · référence
Vérifier le prix
PRÊT POUR CUDAS

RTX 5070

NVIDIA RTX 5070 12 GB

Passe confortablement+5.3 GiB
~93 tok/sest. décodage12 GiB11.0 GiB GiB utilisables
Amazon · GIGABYTE Windforce OC RTX 5070 12GBGPU seul · référence
Vérifier le prix
PRÊT POUR CUDAC

RTX 4060

NVIDIA RTX 4060 8 GB

Passe · marge limitée+1.3 GiB
~38 tok/sest. décodage8 GiB7.0 GiB GiB utilisables
Amazon · MSI Ventus 2X Black RTX 4060 8GB OCGPU seul · référence
Vérifier le prix
PRÊT POUR CUDAC

RTX 5060

NVIDIA RTX 5060 8 GB

Passe · marge limitée+1.3 GiB
~40 tok/sest. décodage8 GiB7.0 GiB GiB utilisables
Amazon · GIGABYTE AERO OC RTX 5060 8GBGPU seul · référence
Vérifier le prix
PRÊT POUR CUDAF

RTX 2060

NVIDIA RTX 2060 6 GB

Dépasse le budget sûr-0.7 GiB
Déchargement CPU requisvitesse non prédite6 GiB5.0 GiB GiB utilisables
Vérifier le prixGPU seul · référence
Vérifier le prix

Prix de référence en USD, non des devis en temps réel. Vérifiez les prix et la disponibilité auprès du vendeur. Certains liens peuvent générer une commission.

De « est-ce que ça passe ? » à votre première requête.

Commencez par la quantification par défaut d’Ollama. Confirmez la mémoire réelle avec ollama ps.

La vitesse désigne le décodage estimé (génération de tokens), et non le traitement du prompt. Elle repose sur la bande passante mémoire, la taille active et une hypothèse d’efficacité, pas sur un benchmark. Le déchargement CPU peut être nettement plus lent. Le support AMD varie ; vérifiez la compatibilité avant achat.

UN PEU DE CONTEXTE CHANGE TOUT

Comprendre l’IA locale.

Pour votre premier modèle, votre prochaine mise à niveau et tout le reste.

Connaissances & analyses approfondies

Centre de Connaissances VRAM & LLM Locaux

Guides approfondis, analyses architecturales et manuels de dimensionnement matériel pour déployer et exécuter vos modèles d'IA en local sans mauvaise surprise.

50+ Termes8 min de référence
Maîtrisez le vocabulaire technique: GGUF vs Safetensors, K-quants, cache KV, GQA, paramètres actifs MoE et mémoire unifiée Apple Silicon.
Recherche et filtrage interactif par catégorie
Enseignements matériels concrets pour chaque terme
Définitions claires sans jargon inutile
Index alphabétique de consultation rapide
Consulter le Guide
Outil Interactif6 min de lecture
Comprenez pourquoi la longueur de contexte sature la VRAM, la formule mathématique exacte et comment économiser de 50% à 75% de mémoire.
Calculateur interactif de mémoire de contexte
Architectures MHA vs GQA vs DeepSeek MLA
Gains de la quantification du cache en FP8 et INT4
Consommation mémoire en dialogue multi-tours
Consulter le Guide
Décodeur de Configuration7 min de lecture
Examinez les dépôts Hugging Face comme un ingénieur ML: déchiffrez config.json, identifiez les vraies limites de contexte et évitez le piège des paramètres MoE.
Inspecteur interactif des paramètres config.json
Nomenclature des quantifications GGUF expliquée
Règles de mémoire des paramètres actifs vs totaux MoE
Fenêtres de contexte et mise à l'échelle RoPE
Consulter le Guide
Matrice des Licences5 min de lecture
Les distinctions juridiques et pratiques entre le véritable Open Source OSI et les modèles à poids ouverts comme Llama 3, DeepSeek, Qwen 2.5 et Gemma 2.
Matrice comparative interactive des licences
Seuils d'utilisateurs et de chiffre d'affaires
Restrictions sur la distillation de données synthétiques
Grille de conformité juridique pour entreprises
Consulter le Guide
Guide Matériel8 min de lecture
Découvrez pourquoi la bande passante mémoire surpasse la puissance brute, comment choisir entre Apple Silicon et Nvidia, et la VRAM requise de 8B à 70B.
Paliers de VRAM (de 8 Go à 128 Go+)
Formule bande passante mémoire vs calcul
Comparatif Apple Silicon Mac vs PC Nvidia
Configuration station de travail Dual-GPU pour 70B
Consulter le Guide

Quelques bonnes questions.

Les estimations sont utiles. En connaître les limites est encore mieux.

Il faut les poids du modèle, le cache KV de votre contexte, et un peu de surcharge runtime. En Q4, ordre de grandeur : 5 à 8 Go pour un 7B/8B, 8 à 12 Go pour un 13B/14B, 18 à 24 Go pour un 32B, 42 à 50 Go pour un 70B dense, puis le contexte. Utilisez le calculateur avec le modèle, la quantification et le contexte exacts plutôt qu'une règle de trois.

On dimensionne d'abord la VRAM, pas les TFLOPS. Environ 8 Go pour du 7B/8B en Q4, 12 Go pour du 13B/14B, 16 à 24 Go pour beaucoup de 20B-32B et de MoE, ~48 Go au total pour un 70B dense en Q4. Vérifiez le cache KV dans le calculateur, puis les onglets Acheter et Louer.

Oui pour du 7B à 14B en Q4 avec un peu de contexte, et pour certains MoE avec précaution. Un 32B ou 70B dense nécessite un déchargement sur CPU. Pour l'inférence locale, 12 Go battent presque toujours 8 Go plus rapides (3060 12 Go plutôt qu'une 3070 8 Go).

La 4090 est le choix idéal grand public pour du ~27B-32B en Q4 et de bons MoE. Un 70B dense en Q4 ne tient pas entier : déchargement lent, ou deux cartes / 48 Go+ / Mac très doté en mémoire / GPU cloud. Faire tenir un modèle n'est pas la même chose que le faire tourner vite.

GGUF est le format de llama.cpp / Ollama / LM Studio. Q4_K_M est le compromis qualité/taille le plus recommandé. FP16 nécessite ~2 octets/paramètre, Q4 ~0,5 à 0,6 : un 7B passe d'environ 14 Go de poids à 4-5 Go. La quantification des poids ne réduit pas le cache KV, sauf si vous quantifiez aussi le cache.

Souvent une partie des couches est en mémoire RAM système (n-gpu-layers / offload). Un 70B Q4 ~40 Go ne tient pas sur 24 Go, donc la vitesse chute à quelques tokens/s. Réduisez la taille du modèle ou la quantification, baissez num_ctx, ou ajoutez de la VRAM. Mesurez avec nvidia-smi ou ollama ps.

Oui. Le cache KV grossit avec les tokens et les conversations simultanées. À 32K ou 128K il peut rivaliser avec les poids. Un modèle qui tient à 4K peut saturer la mémoire à 32K. Réglez num_ctx sur ce que vous utilisez vraiment, ou quantifiez le cache KV.

Oui. La mémoire unifiée forme un seul pool : un gros GGUF peut charger sans plafond VRAM dédié. Laissez de la marge à macOS. Ordre de grandeur : 16 Go pour les petits modèles, 32 Go pour le milieu de gamme, 64 Go+ avant qu'un 70B soit réaliste. La bande passante dicte la vitesse en tokens/s.

Sur NVIDIA/AMD, la VRAM est un plafond strict. Sur Mac, RAM et GPU partagent la mémoire unifiée, donc un Mac 64 Go peut charger ce qu'une 4090 24 Go ne peut pas. En revanche le support CUDA et souvent les tokens/s restent du côté NVIDIA. Comparez la capacité (Mac) et l'écosystème/vitesse (NVIDIA).

LM Studio est la solution la plus simple sans terminal. Ollama est le standard CLI/API (scripts, Open WebUI). llama.cpp reste l'outil pour utilisateurs avancés (déchargement, cache KV, multi-GPU). Les trois lisent le format GGUF : le calculateur estime la VRAM, pas l'interface.

Le fichier GGUF ne contient que les poids. Le cache KV, les activations, l'affichage de l'écran, la fragmentation et un long prompt s'y ajoutent. Laissez de la marge, réduisez le contexte, quantifiez le cache KV, ou choisissez une quantification plus petite. La taille du fichier n'est pas la VRAM d'une conversation complète.

Achetez si vous utilisez vos modèles fréquemment et privilégiez la confidentialité et la disponibilité permanente. Louez pour des besoins ponctuels, des configurations de 48-80 Go, ou pour tester un 70B avant d'acheter deux GPU. L'approche hybride est courante : une carte locale pour le quotidien en 8B-32B, et le cloud pour les modèles plus volumineux.

Surtout la VRAM : 48 Go est la configuration grand public de référence pour un 70B Q4. La vitesse ne double pas automatiquement ; la répartition par couches fonctionne sans NVLink, tandis que le tenseur parallèle préfère des liaisons rapides. Prévoyez une alimentation puissante, un bon refroidissement et une configuration adaptée.

En Q4 avec contexte modéré : ~5-8 Go (7B/8B), ~8-12 Go (13B/14B), ~18-24 Go (32B), ~42-50 Go (70B dense). Ajoutez toujours le cache KV. Sélectionnez l'artefact exact ci-dessus pour afficher le détail poids vs cache.

Choisissez le checkpoint, la quantification et le contexte dans le calculateur : poids + cache KV + runtime. La taille du GGUF n'est qu'un plancher. Après chargement, vérifiez avec nvidia-smi, ollama ps ou le Moniteur d'activité sur Mac.

En quantification Q4_K_M, les poids requièrent environ 5,5 Go. En ajoutant un contexte de 8k tokens et la surcharge CUDA, il faut compter entre 7 et 8 Go de VRAM. Une carte de 8 Go (RTX 4060) ou de 12 Go (RTX 3060) permet une exécution 100 % GPU sans déchargement vers la RAM système.

L'inférence d'un LLM est limitée par la bande passante mémoire. Une RTX 3090 délivre environ 936 Go/s, alors que la RAM DDR5 dual-channel plafonne à 60-80 Go/s. Cet écart d'un facteur 12 fait chuter la vitesse de 25 tokens/s à 1,5 token/s dès que des couches sont déchargées sur le processeur.

Le fichier de poids pèse environ 42 Go. Avec un contexte de 32 000 tokens et l'architecture GQA, le cache KV requiert environ 4,5 Go, auxquels s'ajoute 1 Go de mémoire tampon CUDA. Il faut prévoir environ 48 Go de VRAM totale, ce qui correspond exactement à une configuration double RTX 3090 ou un Mac Studio 64 Go.

Ollama alloue la mémoire pour les poids, mais réserve également les tenseurs d'activation CUDA et préalloue l'espace du cache KV selon le paramètre num_ctx. Si votre Modelfile définit un contexte de 32k, plusieurs gigaoctets supplémentaires sont immédiatement réservés pour garantir la stabilité.

Pour un petit budget, la RTX 3060 12 Go neuve reste la référence d'entrée de gamme. Pour les passionnés et les développeurs, la RTX 3090 24 Go d'occasion offre le meilleur rapport prix/VRAM/bande passante du marché, introuvable sur les cartes de génération plus récente à prix équivalent.

Comment dimensionner un GPU pour un LLM local

Faire tourner un grand modèle de langage en local signifie faire tenir deux choses à la fois dans la mémoire du GPU : les poids du modèle, et un cache KV qui grossit avec la quantité de contexte actif. La taille des poids est simple, nombre de paramètres multiplié par les octets par paramètre, donc quantifier un modèle de FP16 à Q4 divise à peu près par quatre son empreinte mémoire. Le cache KV est facile à oublier : un modèle qui tient tout juste à un contexte de 4K peut manquer de mémoire à 32K, car le cache s'agrandit avec la longueur du contexte. Ce calculateur estime les deux et ajoute un petit facteur de surcharge pour le framework et la mémoire d'activation, puis compare le total à des GPU courants, du 12 Go de la RTX 3060 jusqu'aux 80 Go de la H100.

Pour qui est-ce fait ?

Découvrez si votre rôle, votre activité ou votre flux de travail correspond à la façon dont cet outil est réellement utilisé.

Local LLM hobbyist / self-hoster

You found a model on Hugging Face and want to know before downloading gigabytes of weights whether your exact GPU can run it, so you search can I run this LLM on my GPU.

PC builder shopping for an AI GPU

You are about to spend $800-2000 on a graphics card and want proof of which quantized models it will actually handle before buying, searching best GPU for local LLM VRAM.

ML engineer / data scientist sizing a deployment

You need to pick the right quantization level to fit a model on available inference hardware without OOM errors, searching GGUF quantization VRAM calculator.

Indie developer running a local AI coding assistant

You want Continue.dev or a similar VS Code plugin talking to Ollama instead of paying for Copilot, and search how much VRAM for local coding assistant to see what fits on your dev machine.

Plus d'outils gratuits

Vous voulez plutôt construire un prompt que dimensionner du matériel ? Essayez le Générateur de Prompts IA ou parcourez tous les Outils IA gratuits.