Apple 512 GB
Apple Silicon 512 GB unified memory
Choisissez un vrai modèle ouvert, pas seulement un nombre de paramètres, et obtenez une estimation claire de la mémoire, le matériel local compatible et les offres de location de GPU correspondantes.
Configurer
Notice d'utilisation commerciale: Licence open source permissive (ex. Apache-2.0 ou MIT). Permet généralement l'utilisation commerciale, la modification et l'auto-hébergement sous réserve des mentions légales.
Choisissez une carte pour comparer l'ajustement VRAM, la marge restante et la vitesse estimée du modèle ci-dessus.
Qwen3 8B · Q4_K_M · 8K tokens
RTX 4060
8 GiB · 1.3 GiB de marge
Lien affilié · Vantaige peut recevoir une commission.
RTX 5060
8 GiB · 1.3 GiB de marge
Lien affilié · Vantaige peut recevoir une commission.
RTX 3060
12 GiB · 5.3 GiB de marge
Lien affilié · Vantaige peut recevoir une commission.
RTX 4070 Super
12 GiB · 5.3 GiB de marge
Lien affilié · Vantaige peut recevoir une commission.
RTX 5070
12 GiB · 5.3 GiB de marge
Lien affilié · Vantaige peut recevoir une commission.
RTX 4060 Ti
16 GiB · 9.3 GiB de marge
Lien affilié · Vantaige peut recevoir une commission.
RTX 4070 Ti Super
16 GiB · 9.3 GiB de marge
Lien affilié · Vantaige peut recevoir une commission.
RTX 4080 Super
16 GiB · 9.3 GiB de marge
Lien affilié · Vantaige peut recevoir une commission.
RTX 5070 Ti
16 GiB · 9.3 GiB de marge
Lien affilié · Vantaige peut recevoir une commission.
RTX 5080
16 GiB · 9.3 GiB de marge
Lien affilié · Vantaige peut recevoir une commission.
RTX 5060 Ti
16 GiB · 9.3 GiB de marge
Lien affilié · Vantaige peut recevoir une commission.
RX 7800 XT
16 GiB · 9.3 GiB de marge
Lien affilié · Vantaige peut recevoir une commission.
Les résultats sûrs incluent une réserve pour le système ou l’accélérateur ; la capacité brute seule n’est pas suffisante.
46 options locales compatibles avec Qwen3 8B avec ces réglages. Commencez petit. Évoluez au besoin.
Apple Silicon 512 GB unified memory
Apple Silicon 256 GB unified memory
Apple Silicon 192 GB unified memory
NVIDIA H200 141 GB
Apple Silicon 128 GB unified memory
NVIDIA RTX PRO 6000 Blackwell 96 GB
Apple Silicon 96 GB unified memory
NVIDIA H100 NVL 94 GB
NVIDIA A100 80 GB
NVIDIA H100 80 GB
AMD Ryzen Mini PC 64 GB unified memory
Apple Silicon 64 GB unified memory
NVIDIA RTX 6000 Ada 48 GB
NVIDIA RTX A6000 48 GB
NVIDIA A40 48 GB
NVIDIA L40S 48 GB
Apple Silicon 48 GB unified memory
NVIDIA A100 40 GB
Apple Silicon 36 GB unified memory
NVIDIA RTX 5090 32 GB
NVIDIA RTX 5000 Ada 32 GB
AMD Ryzen Mini PC 32 GB unified memory
NVIDIA RTX 3090 24 GB
NVIDIA RTX 4090 24 GB
AMD Radeon RX 7900 XTX 24 GB
NVIDIA L4 24 GB
NVIDIA A10 24 GB
NVIDIA A30 24 GB
Apple Silicon 24 GB unified memory
AMD Radeon RX 7900 XT 20 GB
NVIDIA RTX 4060 Ti 16 GB
NVIDIA RTX 4070 Ti Super 16 GB
NVIDIA RTX 4080 Super 16 GB
NVIDIA RTX 5070 Ti 16 GB
NVIDIA RTX 5080 16 GB
NVIDIA RTX 5060 Ti 16 GB
AMD Radeon RX 7800 XT 16 GB
AMD Radeon RX 9060 XT 16 GB
AMD Radeon RX 9070 16 GB
AMD Radeon RX 9070 XT 16 GB
Apple Silicon 16 GB unified memory
NVIDIA RTX 3060 12 GB
NVIDIA RTX 4070 Super 12 GB
NVIDIA RTX 5070 12 GB
NVIDIA RTX 4060 8 GB
NVIDIA RTX 5060 8 GB
NVIDIA RTX 2060 6 GB
Prix de référence en USD, non des devis en temps réel. Vérifiez les prix et la disponibilité auprès du vendeur. Certains liens peuvent générer une commission.
Commencez par la quantification par défaut d’Ollama. Confirmez la mémoire réelle avec ollama ps.
La vitesse désigne le décodage estimé (génération de tokens), et non le traitement du prompt. Elle repose sur la bande passante mémoire, la taille active et une hypothèse d’efficacité, pas sur un benchmark. Le déchargement CPU peut être nettement plus lent. Le support AMD varie ; vérifiez la compatibilité avant achat.
Pour votre premier modèle, votre prochaine mise à niveau et tout le reste.
Comprenez la mémoire GPU, la mémoire unifiée Apple et ce qui vaut son prix.
Lire le guide COMPRENDRE LES CHIFFRESDécouvrez pourquoi les longues conversations demandent plus de mémoire, même avec le même modèle.
Lire le guide CONNAÎTRE SA LICENCESachez ce que vous pouvez télécharger, modifier et exploiter commercialement avant de créer.
Lire le guideConnaissances & analyses approfondies
Guides approfondis, analyses architecturales et manuels de dimensionnement matériel pour déployer et exécuter vos modèles d'IA en local sans mauvaise surprise.
Les estimations sont utiles. En connaître les limites est encore mieux.
Il faut les poids du modèle, le cache KV de votre contexte, et un peu de surcharge runtime. En Q4, ordre de grandeur : 5 à 8 Go pour un 7B/8B, 8 à 12 Go pour un 13B/14B, 18 à 24 Go pour un 32B, 42 à 50 Go pour un 70B dense, puis le contexte. Utilisez le calculateur avec le modèle, la quantification et le contexte exacts plutôt qu'une règle de trois.
On dimensionne d'abord la VRAM, pas les TFLOPS. Environ 8 Go pour du 7B/8B en Q4, 12 Go pour du 13B/14B, 16 à 24 Go pour beaucoup de 20B-32B et de MoE, ~48 Go au total pour un 70B dense en Q4. Vérifiez le cache KV dans le calculateur, puis les onglets Acheter et Louer.
Oui pour du 7B à 14B en Q4 avec un peu de contexte, et pour certains MoE avec précaution. Un 32B ou 70B dense nécessite un déchargement sur CPU. Pour l'inférence locale, 12 Go battent presque toujours 8 Go plus rapides (3060 12 Go plutôt qu'une 3070 8 Go).
La 4090 est le choix idéal grand public pour du ~27B-32B en Q4 et de bons MoE. Un 70B dense en Q4 ne tient pas entier : déchargement lent, ou deux cartes / 48 Go+ / Mac très doté en mémoire / GPU cloud. Faire tenir un modèle n'est pas la même chose que le faire tourner vite.
GGUF est le format de llama.cpp / Ollama / LM Studio. Q4_K_M est le compromis qualité/taille le plus recommandé. FP16 nécessite ~2 octets/paramètre, Q4 ~0,5 à 0,6 : un 7B passe d'environ 14 Go de poids à 4-5 Go. La quantification des poids ne réduit pas le cache KV, sauf si vous quantifiez aussi le cache.
Souvent une partie des couches est en mémoire RAM système (n-gpu-layers / offload). Un 70B Q4 ~40 Go ne tient pas sur 24 Go, donc la vitesse chute à quelques tokens/s. Réduisez la taille du modèle ou la quantification, baissez num_ctx, ou ajoutez de la VRAM. Mesurez avec nvidia-smi ou ollama ps.
Oui. Le cache KV grossit avec les tokens et les conversations simultanées. À 32K ou 128K il peut rivaliser avec les poids. Un modèle qui tient à 4K peut saturer la mémoire à 32K. Réglez num_ctx sur ce que vous utilisez vraiment, ou quantifiez le cache KV.
Oui. La mémoire unifiée forme un seul pool : un gros GGUF peut charger sans plafond VRAM dédié. Laissez de la marge à macOS. Ordre de grandeur : 16 Go pour les petits modèles, 32 Go pour le milieu de gamme, 64 Go+ avant qu'un 70B soit réaliste. La bande passante dicte la vitesse en tokens/s.
Sur NVIDIA/AMD, la VRAM est un plafond strict. Sur Mac, RAM et GPU partagent la mémoire unifiée, donc un Mac 64 Go peut charger ce qu'une 4090 24 Go ne peut pas. En revanche le support CUDA et souvent les tokens/s restent du côté NVIDIA. Comparez la capacité (Mac) et l'écosystème/vitesse (NVIDIA).
LM Studio est la solution la plus simple sans terminal. Ollama est le standard CLI/API (scripts, Open WebUI). llama.cpp reste l'outil pour utilisateurs avancés (déchargement, cache KV, multi-GPU). Les trois lisent le format GGUF : le calculateur estime la VRAM, pas l'interface.
Le fichier GGUF ne contient que les poids. Le cache KV, les activations, l'affichage de l'écran, la fragmentation et un long prompt s'y ajoutent. Laissez de la marge, réduisez le contexte, quantifiez le cache KV, ou choisissez une quantification plus petite. La taille du fichier n'est pas la VRAM d'une conversation complète.
Achetez si vous utilisez vos modèles fréquemment et privilégiez la confidentialité et la disponibilité permanente. Louez pour des besoins ponctuels, des configurations de 48-80 Go, ou pour tester un 70B avant d'acheter deux GPU. L'approche hybride est courante : une carte locale pour le quotidien en 8B-32B, et le cloud pour les modèles plus volumineux.
Surtout la VRAM : 48 Go est la configuration grand public de référence pour un 70B Q4. La vitesse ne double pas automatiquement ; la répartition par couches fonctionne sans NVLink, tandis que le tenseur parallèle préfère des liaisons rapides. Prévoyez une alimentation puissante, un bon refroidissement et une configuration adaptée.
En Q4 avec contexte modéré : ~5-8 Go (7B/8B), ~8-12 Go (13B/14B), ~18-24 Go (32B), ~42-50 Go (70B dense). Ajoutez toujours le cache KV. Sélectionnez l'artefact exact ci-dessus pour afficher le détail poids vs cache.
Choisissez le checkpoint, la quantification et le contexte dans le calculateur : poids + cache KV + runtime. La taille du GGUF n'est qu'un plancher. Après chargement, vérifiez avec nvidia-smi, ollama ps ou le Moniteur d'activité sur Mac.
En quantification Q4_K_M, les poids requièrent environ 5,5 Go. En ajoutant un contexte de 8k tokens et la surcharge CUDA, il faut compter entre 7 et 8 Go de VRAM. Une carte de 8 Go (RTX 4060) ou de 12 Go (RTX 3060) permet une exécution 100 % GPU sans déchargement vers la RAM système.
L'inférence d'un LLM est limitée par la bande passante mémoire. Une RTX 3090 délivre environ 936 Go/s, alors que la RAM DDR5 dual-channel plafonne à 60-80 Go/s. Cet écart d'un facteur 12 fait chuter la vitesse de 25 tokens/s à 1,5 token/s dès que des couches sont déchargées sur le processeur.
Le fichier de poids pèse environ 42 Go. Avec un contexte de 32 000 tokens et l'architecture GQA, le cache KV requiert environ 4,5 Go, auxquels s'ajoute 1 Go de mémoire tampon CUDA. Il faut prévoir environ 48 Go de VRAM totale, ce qui correspond exactement à une configuration double RTX 3090 ou un Mac Studio 64 Go.
Ollama alloue la mémoire pour les poids, mais réserve également les tenseurs d'activation CUDA et préalloue l'espace du cache KV selon le paramètre num_ctx. Si votre Modelfile définit un contexte de 32k, plusieurs gigaoctets supplémentaires sont immédiatement réservés pour garantir la stabilité.
Pour un petit budget, la RTX 3060 12 Go neuve reste la référence d'entrée de gamme. Pour les passionnés et les développeurs, la RTX 3090 24 Go d'occasion offre le meilleur rapport prix/VRAM/bande passante du marché, introuvable sur les cartes de génération plus récente à prix équivalent.
Faire tourner un grand modèle de langage en local signifie faire tenir deux choses à la fois dans la mémoire du GPU : les poids du modèle, et un cache KV qui grossit avec la quantité de contexte actif. La taille des poids est simple, nombre de paramètres multiplié par les octets par paramètre, donc quantifier un modèle de FP16 à Q4 divise à peu près par quatre son empreinte mémoire. Le cache KV est facile à oublier : un modèle qui tient tout juste à un contexte de 4K peut manquer de mémoire à 32K, car le cache s'agrandit avec la longueur du contexte. Ce calculateur estime les deux et ajoute un petit facteur de surcharge pour le framework et la mémoire d'activation, puis compare le total à des GPU courants, du 12 Go de la RTX 3060 jusqu'aux 80 Go de la H100.
Découvrez si votre rôle, votre activité ou votre flux de travail correspond à la façon dont cet outil est réellement utilisé.
Local LLM hobbyist / self-hoster
You found a model on Hugging Face and want to know before downloading gigabytes of weights whether your exact GPU can run it, so you search can I run this LLM on my GPU.
PC builder shopping for an AI GPU
You are about to spend $800-2000 on a graphics card and want proof of which quantized models it will actually handle before buying, searching best GPU for local LLM VRAM.
ML engineer / data scientist sizing a deployment
You need to pick the right quantization level to fit a model on available inference hardware without OOM errors, searching GGUF quantization VRAM calculator.
Indie developer running a local AI coding assistant
You want Continue.dev or a similar VS Code plugin talking to Ollama instead of paying for Copilot, and search how much VRAM for local coding assistant to see what fits on your dev machine.
Plus d'outils gratuits
Vous voulez plutôt construire un prompt que dimensionner du matériel ? Essayez le Générateur de Prompts IA ou parcourez tous les Outils IA gratuits.