Apple 512 GB
Apple Silicon 512 GB unified memory
Elige un modelo abierto real, no solo una cantidad de parámetros, y obtén una estimación transparente de memoria, hardware local compatible y opciones de alquiler de GPU.
Configurar
Aviso de uso comercial: Licencia de código abierto permisiva (ej. Apache-2.0 o MIT). Generalmente permite uso comercial, modificación y autohospedaje sujeto a avisos de autoría.
Elige cualquier tarjeta para comparar el ajuste de VRAM, el margen libre y la velocidad estimada del modelo anterior.
Qwen3 8B · Q4_K_M · 8K tokens
RTX 4060
8 GiB · 1.3 GiB de margen
Enlace de afiliado · Vantaige puede recibir una comisión.
RTX 5060
8 GiB · 1.3 GiB de margen
Enlace de afiliado · Vantaige puede recibir una comisión.
RTX 3060
12 GiB · 5.3 GiB de margen
Enlace de afiliado · Vantaige puede recibir una comisión.
RTX 4070 Super
12 GiB · 5.3 GiB de margen
Enlace de afiliado · Vantaige puede recibir una comisión.
RTX 5070
12 GiB · 5.3 GiB de margen
Enlace de afiliado · Vantaige puede recibir una comisión.
RTX 4060 Ti
16 GiB · 9.3 GiB de margen
Enlace de afiliado · Vantaige puede recibir una comisión.
RTX 4070 Ti Super
16 GiB · 9.3 GiB de margen
Enlace de afiliado · Vantaige puede recibir una comisión.
RTX 4080 Super
16 GiB · 9.3 GiB de margen
Enlace de afiliado · Vantaige puede recibir una comisión.
RTX 5070 Ti
16 GiB · 9.3 GiB de margen
Enlace de afiliado · Vantaige puede recibir una comisión.
RTX 5080
16 GiB · 9.3 GiB de margen
Enlace de afiliado · Vantaige puede recibir una comisión.
RTX 5060 Ti
16 GiB · 9.3 GiB de margen
Enlace de afiliado · Vantaige puede recibir una comisión.
RX 7800 XT
16 GiB · 9.3 GiB de margen
Enlace de afiliado · Vantaige puede recibir una comisión.
Los resultados seguros incluyen una reserva para el sistema operativo o acelerador; la capacidad bruta por sí sola no se considera suficiente.
46 opciones locales compatibles con Qwen3 8B con estos ajustes. Empieza poco a poco. Escala cuando lo necesites.
Apple Silicon 512 GB unified memory
Apple Silicon 256 GB unified memory
Apple Silicon 192 GB unified memory
NVIDIA H200 141 GB
Apple Silicon 128 GB unified memory
NVIDIA RTX PRO 6000 Blackwell 96 GB
Apple Silicon 96 GB unified memory
NVIDIA H100 NVL 94 GB
NVIDIA A100 80 GB
NVIDIA H100 80 GB
AMD Ryzen Mini PC 64 GB unified memory
Apple Silicon 64 GB unified memory
NVIDIA RTX 6000 Ada 48 GB
NVIDIA RTX A6000 48 GB
NVIDIA A40 48 GB
NVIDIA L40S 48 GB
Apple Silicon 48 GB unified memory
NVIDIA A100 40 GB
Apple Silicon 36 GB unified memory
NVIDIA RTX 5090 32 GB
NVIDIA RTX 5000 Ada 32 GB
AMD Ryzen Mini PC 32 GB unified memory
NVIDIA RTX 3090 24 GB
NVIDIA RTX 4090 24 GB
AMD Radeon RX 7900 XTX 24 GB
NVIDIA L4 24 GB
NVIDIA A10 24 GB
NVIDIA A30 24 GB
Apple Silicon 24 GB unified memory
AMD Radeon RX 7900 XT 20 GB
NVIDIA RTX 4060 Ti 16 GB
NVIDIA RTX 4070 Ti Super 16 GB
NVIDIA RTX 4080 Super 16 GB
NVIDIA RTX 5070 Ti 16 GB
NVIDIA RTX 5080 16 GB
NVIDIA RTX 5060 Ti 16 GB
AMD Radeon RX 7800 XT 16 GB
AMD Radeon RX 9060 XT 16 GB
AMD Radeon RX 9070 16 GB
AMD Radeon RX 9070 XT 16 GB
Apple Silicon 16 GB unified memory
NVIDIA RTX 3060 12 GB
NVIDIA RTX 4070 Super 12 GB
NVIDIA RTX 5070 12 GB
NVIDIA RTX 4060 8 GB
NVIDIA RTX 5060 8 GB
NVIDIA RTX 2060 6 GB
Precios de referencia en USD, no son cotizaciones en vivo. Verifique precios y disponibilidad con el distribuidor. Algunos enlaces pueden generar comisión.
Comienza con la cuantización predeterminada de Ollama. Confirma la memoria real con ollama ps.
La velocidad se refiere a decodificación estimada (generación de tokens), no al procesamiento del prompt. Se basa en ancho de banda de memoria, peso activo y una suposición de eficiencia; no es un benchmark. La descarga a CPU puede ser mucho más lenta. La compatibilidad de AMD varía; revísala antes de comprar.
Para tu primer modelo, tu próxima mejora y todo lo demás.
Comprende la memoria de la GPU, la memoria unificada de Apple y qué vale la pena pagar.
Leer la guía COMPRENDE LOS NÚMEROSDescubre por qué las conversaciones largas requieren más memoria, incluso con el mismo modelo.
Leer la guía CONOCE TU LICENCIAAverigua qué puedes descargar, modificar y usar comercialmente antes de construir.
Leer la guíaConocimiento y análisis profundos
Guías técnicas exhaustivas, análisis de arquitecturas y manuales de hardware para configurar y ejecutar modelos de lenguaje locales con total precisión.
Las estimaciones son útiles. Conocer sus límites es aún mejor.
Suma pesos + caché KV + 1 o 2 GB de margen. En Q4_K_M, orientativo: unos 4–6 GB (7–8B), 8–12 GB (13–14B), 20–24 GB (32B), 42–50 GB (70B denso), y luego el contexto. Usa la calculadora con cuantización y ventana de contexto, no solo el tamaño del archivo.
Los pesos Q4_K_M de un 70B denso ya van por ~40 GB. Con contexto corto y overhead, planifica 45–50 GB en GPU. FP16 ronda los 140 GB. Una sola tarjeta de 24 GB no lo carga entero en Q4 usable sin offload pesado.
No entero en GPU a calidad Q4. Cabe en híbrido (VRAM + RAM) pero irá lento, a pocos tok/s. Caminos reales: doble 24 GB, 48 GB+, un Mac con mucha memoria unificada, un MoE más pequeño, o alquilar GPU.
GGUF es el formato de Ollama, LM Studio y llama.cpp. Q4_K_M es el punto dulce calidad/tamaño. FP16 ~2 bytes/parámetro; Q4 ~0,5–0,6. Un 7B pasa de ~14 GB de pesos a 4–5 GB. Cuantizar pesos no reduce la caché KV salvo que también la cuantices.
Elige el checkpoint, la cuantización y el contexto arriba: pesos + KV + runtime. El tamaño del GGUF es solo un suelo. Después de cargar, mide con nvidia-smi u ollama ps.
Sí. La caché KV crece con los tokens y las conversaciones a la vez. A 32K o 128K puede igualar o superar los pesos. Un modelo que cabe a 4K puede provocar un error de OOM a 32K. Define el contexto que uses realmente o cuantiza la caché KV.
Sirven para aprender y para 7B/8B en Q4 con contexto corto. Quedan justos para coding/agentes y contexto largo. Si compras, 12–16 GB+ es un suelo más seguro.
Para inferencia local, más VRAM gana. 12 GB casi siempre superan 8 GB más rápidos. La 3060 12 GB abre 13B/14B en Q4; 8 GB se quedan en 7B/8B con contexto contenido.
macOS y las aplicaciones ya consumen varios GB. Orientativo: 16 GB modelos pequeños, 32 GB rango medio cómodo, 64 GB+ antes de que un 70B sea práctico. No trates la memoria unificada como VRAM dedicada al 100%.
Compra si usas muchas horas a la semana y quieres privacidad. Alquila (o renta) para picos, pruebas de 48–80 GB, o validar un 70B antes de un PC de dos GPU. Híbrido habitual: tarjeta local para el 8B–32B diario, nube cuando hace falta más.
Sí, con GGUF/llama.cpp si VRAM más RAM cubren el modelo. La velocidad suele caer a pocos tok/s: resulta viable para lotes, pero no para un chat interactivo. Prefiere un quant más pequeño o un modelo que quepa entero en GPU si te importan los tok/s.
Por VRAM, no por TFLOPS: ~8 GB → 7–8B Q4; ~12 GB → 13–14B; 16–24 GB → ~20–32B; ~48 GB total → 70B denso Q4. Incluye siempre la caché KV y confirma en la calculadora.
El GGUF son solo los pesos. Caché KV, activaciones, el escritorio, fragmentación y prompts largos van encima. Deja margen, baja contexto, cuantiza la KV o elige un quant menor. Que quepa el archivo no es que quepa la conversación.
La memoria sigue los parámetros totales (guardas todos los expertos); la velocidad sigue los activos. El MoE brilla si descargas expertos a RAM, no porque la VRAM se encoja al tamaño activo.
El quant más alto que aún quepa con margen de contexto. Q4_K_M es el punto dulce para chat y código. Q5/Q6/Q8 si te sobra VRAM. Evita Q2/Q3 salvo que no quepa nada más.
En cuantización Q4_K_M, los pesos ocupan aproximadamente 5.5 GB. Con un contexto de 8k tokens y los buffers de CUDA, necesitas al menos 7 a 8 GB de VRAM. Una tarjeta de 8 GB (RTX 4060) o de 12 GB (RTX 3060) lo ejecuta al 100% en la GPU sin recurrir a la RAM del sistema.
La generación de tokens depende estrictamente del ancho de banda de la memoria. Una RTX 3090 ofrece ~936 GB/s, mientras que la memoria RAM DDR5 en doble canal solo alcanza 60 a 80 GB/s. Esta diferencia de más de 12 veces hace que descargar capas a la CPU desplome la velocidad de 30 tok/s a solo 1 o 2 tok/s.
Los pesos en Q4_K_M ocupan unos 42 GB. A 32k tokens de contexto con atención GQA, el caché KV en FP16 requiere cerca de 4.5 GB, más 1 GB de memoria de trabajo de CUDA. El consumo total real es de ~48 GB de VRAM, ideal para una configuración Dual RTX 3090 (48 GB) o un Mac Studio con 64 GB de memoria unificada.
El archivo descargado solo contiene los pesos estáticos. Al arrancar, Ollama inicializa el contexto CUDA y preasigna espacio para el caché KV según el parámetro num_ctx. Si tu Modelfile define un contexto largo (como 32k), se reservan varios gigabytes adicionales inmediatamente para evitar fallos durante la conversación.
Para presupuestos ajustados, la RTX 3060 de 12 GB es la mejor opción de entrada para modelos 7B a 14B. Para entusiastas y desarrolladores, una RTX 3090 de 24 GB de segunda mano ofrece un ancho de banda inigualable de 936 GB/s por una fracción del precio de una RTX 4090, siendo el estándar de oro.
Ejecutar un modelo de lenguaje grande en local significa hacer que dos componentes quepan simultáneamente en la memoria de la GPU: los pesos del modelo y una caché KV que crece según el contexto activo. El cálculo de los pesos es directo: número de parámetros multiplicado por bytes por parámetro; por ello, cuantizar un modelo de FP16 a Q4 reduce aproximadamente a una cuarta parte su huella en memoria. La caché KV se pasa por alto con facilidad: un modelo que apenas cabe con un contexto de 4K puede quedarse sin memoria a 32K, ya que la caché escala con la longitud del contexto. Esta calculadora estima ambos componentes y añade un margen operativo para la memoria del framework y las activaciones, comparando el total con GPUs habituales, desde la RTX 3060 de 12 GB hasta la H100 de 80 GB.
Mira si tu rol, negocio o flujo de trabajo coincide con cómo la gente usa realmente esta herramienta.
Local LLM hobbyist / self-hoster
You found a model on Hugging Face and want to know before downloading gigabytes of weights whether your exact GPU can run it, so you search can I run this LLM on my GPU.
PC builder shopping for an AI GPU
You are about to spend $800-2000 on a graphics card and want proof of which quantized models it will actually handle before buying, searching best GPU for local LLM VRAM.
ML engineer / data scientist sizing a deployment
You need to pick the right quantization level to fit a model on available inference hardware without OOM errors, searching GGUF quantization VRAM calculator.
Indie developer running a local AI coding assistant
You want Continue.dev or a similar VS Code plugin talking to Ollama instead of paying for Copilot, and search how much VRAM for local coding assistant to see what fits on your dev machine.
Más herramientas gratuitas
¿Prefieres construir un prompt en lugar de dimensionar hardware? Prueba el Creador de Prompts de IA o explora todo el catálogo de Herramientas de IA gratis.