Saltar al contenido principal
DESTACADO · GRATISCalculadora VRAM, ¿qué GPU ejecuta qué modelo? →
Destacado Pack modelos de IA y moda →
Vantaige
HARDWARE COMPACTO. GRANDES POSIBILIDADES.

Grandes ideas.
Huella de memoria reducida.Calculadora VRAM de LLM: verifica qué modelos puede ejecutar tu GPU

Elige un modelo abierto real, no solo una cantidad de parámetros, y obtén una estimación transparente de memoria, hardware local compatible y opciones de alquiler de GPU.

Tu próxima configuración de IA
podría estar ya en tu escritorio.

Descúbrelo
64 modelos listos · busca en el catálogo diario en caché
01

Configurar

Elige lo que quieres ejecutar

ESTIMACIÓN EN VIVO
Modelos populares y accesibles
Apache-2.0 · Código abierto: Licencia de código abierto permisiva (ej. Apache-2.0 o MIT). Generalmente permite uso comercial, modificación y autohospedaje sujeto a avisos de autoría.
Apache-2.0 · Código abierto: Licencia de código abierto permisiva (ej. Apache-2.0 o MIT). Generalmente permite uso comercial, modificación y autohospedaje sujeto a avisos de autoría.
Apache-2.0 · Código abierto: Licencia de código abierto permisiva (ej. Apache-2.0 o MIT). Generalmente permite uso comercial, modificación y autohospedaje sujeto a avisos de autoría.
Apache-2.0 · Código abierto: Licencia de código abierto permisiva (ej. Apache-2.0 o MIT). Generalmente permite uso comercial, modificación y autohospedaje sujeto a avisos de autoría.
Apache-2.0 · Código abierto: Licencia de código abierto permisiva (ej. Apache-2.0 o MIT). Generalmente permite uso comercial, modificación y autohospedaje sujeto a avisos de autoría.
MIT · Código abierto: Licencia de código abierto permisiva (ej. Apache-2.0 o MIT). Generalmente permite uso comercial, modificación y autohospedaje sujeto a avisos de autoría.
8.2B parámetrosGQAHasta 128K de contextoCódigo abiertoFicha del modelo Cómo verificar especificaciones

Aviso de uso comercial: Licencia de código abierto permisiva (ej. Apache-2.0 o MIT). Generalmente permite uso comercial, modificación y autohospedaje sujeto a avisos de autoría.

Glosario de cuantización

Elige cualquier tarjeta para comparar el ajuste de VRAM, el margen libre y la velocidad estimada del modelo anterior.

8K tokens
Supuestos avanzados
TU ESTIMACIÓN DE MEMORIA
CompatibleTamaño de archivo exacto

Sí, Qwen3 8B debería ejecutarse en RTX 4090 con 17.3 GiB de margen bruto.

6.7 GiB

Qwen3 8B · Q4_K_M · 8K tokens

Estimación de memoria de acelerador requeridaRTX 4090 · capacidad de 24 GiB
Pesos
4.7 GiB
Caché KV
1.1 GiB
Runtime
0.9 GiB
Velocidad estimada:
~140 tok/s(1008 GB/s - estimación por ancho de banda)

RTX 4060

8 GiB · 1.3 GiB de margen

Enlace de afiliado · Vantaige puede recibir una comisión.

RTX 5060

8 GiB · 1.3 GiB de margen

Enlace de afiliado · Vantaige puede recibir una comisión.

RTX 3060

12 GiB · 5.3 GiB de margen

Enlace de afiliado · Vantaige puede recibir una comisión.

RTX 4070 Super

12 GiB · 5.3 GiB de margen

Enlace de afiliado · Vantaige puede recibir una comisión.

RTX 5070

12 GiB · 5.3 GiB de margen

Enlace de afiliado · Vantaige puede recibir una comisión.

RTX 4060 Ti

16 GiB · 9.3 GiB de margen

Enlace de afiliado · Vantaige puede recibir una comisión.

RTX 4070 Ti Super

16 GiB · 9.3 GiB de margen

Enlace de afiliado · Vantaige puede recibir una comisión.

RTX 4080 Super

16 GiB · 9.3 GiB de margen

Enlace de afiliado · Vantaige puede recibir una comisión.

RTX 5070 Ti

16 GiB · 9.3 GiB de margen

Enlace de afiliado · Vantaige puede recibir una comisión.

RTX 5080

16 GiB · 9.3 GiB de margen

Enlace de afiliado · Vantaige puede recibir una comisión.

RTX 5060 Ti

16 GiB · 9.3 GiB de margen

Enlace de afiliado · Vantaige puede recibir una comisión.

RX 7800 XT

16 GiB · 9.3 GiB de margen

Enlace de afiliado · Vantaige puede recibir una comisión.

Los resultados seguros incluyen una reserva para el sistema operativo o acelerador; la capacidad bruta por sí sola no se considera suficiente.

EL AJUSTE CORRECTO, SIN EXCESOS

El próximo hogar de tu modelo.

46 opciones locales compatibles con Qwen3 8B con estos ajustes. Empieza poco a poco. Escala cuando lo necesites.

Ajuste de memoria verificado según tus parámetros
MÁS MARGEN PARA EXPERIMENTARS

Apple 512 GB

Apple Silicon 512 GB unified memory

Cabe cómodamente+505 GiB
~111 tok/sest. decodificación512 GiB435 GiB GiB utilizables
Consultar precioordenador completo · referencia
Consultar precio
MÁS MARGEN PARA EXPERIMENTARS

Apple 256 GB

Apple Silicon 256 GB unified memory

Cabe cómodamente+249 GiB
~111 tok/sest. decodificación256 GiB218 GiB GiB utilizables
Consultar precioordenador completo · referencia
Consultar precio
MÁS MARGEN PARA EXPERIMENTARS

Apple 192 GB

Apple Silicon 192 GB unified memory

Cabe cómodamente+185 GiB
~111 tok/sest. decodificación192 GiB163 GiB GiB utilizables
Consultar precioordenador completo · referencia
Consultar precio
PRO / NUBES

H200

NVIDIA H200 141 GB

Cabe cómodamente+134 GiB
~666 tok/sest. decodificación141 GiB134 GiB GiB utilizables
Consultar preciosolo GPU · referencia
Consultar precio
MÁS MARGEN PARA EXPERIMENTARS

Apple 128 GB

Apple Silicon 128 GB unified memory

Cabe cómodamente+121 GiB
~111 tok/sest. decodificación128 GiB109 GiB GiB utilizables
Amazon · Apple MacBook Pro 16 M4 Max 128GB unified memoryordenador completo · referencia
Consultar precio
LISTO PARA CUDAS

RTX PRO 6000

NVIDIA RTX PRO 6000 Blackwell 96 GB

Cabe cómodamente+89.3 GiB
~250 tok/sest. decodificación96 GiB90.2 GiB GiB utilizables
Newegg · PNY RTX PRO 6000 Blackwell 96GBsolo GPU · referencia
Consultar precio
MÁS MARGEN PARA EXPERIMENTARS

Apple 96 GB

Apple Silicon 96 GB unified memory

Cabe cómodamente+89.3 GiB
~56 tok/sest. decodificación96 GiB81.6 GiB GiB utilizables
Amazon · Apple Mac Studio M3 Ultra 96GB unified memoryordenador completo · referencia
Consultar precio
PRO / NUBES

H100 NVL

NVIDIA H100 NVL 94 GB

Cabe cómodamente+87.3 GiB
~541 tok/sest. decodificación94 GiB89.3 GiB GiB utilizables
Consultar preciosolo GPU · referencia
Consultar precio
PRO / NUBES

A100 80 GB

NVIDIA A100 80 GB

Cabe cómodamente+73.3 GiB
~283 tok/sest. decodificación80 GiB76.0 GiB GiB utilizables
Consultar preciosolo GPU · referencia
Consultar precio
PRO / NUBES

H100 80 GB

NVIDIA H100 80 GB

Cabe cómodamente+73.3 GiB
~465 tok/sest. decodificación80 GiB76.0 GiB GiB utilizables
Consultar preciosolo GPU · referencia
Consultar precio
MÁS MARGEN PARA EXPERIMENTARS

Ryzen Mini 64 GB

AMD Ryzen Mini PC 64 GB unified memory

Cabe cómodamente+57.3 GiB
~12 tok/sest. decodificación64 GiB54.4 GiB GiB utilizables
Amazon · Minisforum UM890 Pro Mini PC 64GB DDR5 OCuLinkordenador completo · referencia
Consultar precio
MÁS MARGEN PARA EXPERIMENTARS

Apple 64 GB

Apple Silicon 64 GB unified memory

Cabe cómodamente+57.3 GiB
~56 tok/sest. decodificación64 GiB54.4 GiB GiB utilizables
Amazon · Apple MacBook Pro 16 M4 Max 64GB unified memoryordenador completo · referencia
Consultar precio
LISTO PARA CUDAS

RTX 6000 Ada

NVIDIA RTX 6000 Ada 48 GB

Cabe cómodamente+41.3 GiB
~133 tok/sest. decodificación48 GiB45.1 GiB GiB utilizables
Newegg · PNY RTX 6000 Ada Generation 48GBsolo GPU · referencia
Consultar precio
LISTO PARA CUDAS

RTX A6000

NVIDIA RTX A6000 48 GB

Cabe cómodamente+41.3 GiB
~107 tok/sest. decodificación48 GiB45.1 GiB GiB utilizables
Amazon · PNY RTX A6000 48GB GDDR6solo GPU · referencia
Consultar precio
PRO / NUBES

A40

NVIDIA A40 48 GB

Cabe cómodamente+41.3 GiB
~97 tok/sest. decodificación48 GiB45.6 GiB GiB utilizables
Consultar preciosolo GPU · referencia
Consultar precio
PRO / NUBES

L40S

NVIDIA L40S 48 GB

Cabe cómodamente+41.3 GiB
~120 tok/sest. decodificación48 GiB45.6 GiB GiB utilizables
Consultar preciosolo GPU · referencia
Consultar precio
MÁS MARGEN PARA EXPERIMENTARS

Apple 48 GB

Apple Silicon 48 GB unified memory

Cabe cómodamente+41.3 GiB
~42 tok/sest. decodificación48 GiB40.8 GiB GiB utilizables
Amazon · Apple Mac mini M4 Pro 48GB unified memoryordenador completo · referencia
Consultar precio
PRO / NUBES

A100 40 GB

NVIDIA A100 40 GB

Cabe cómodamente+33.3 GiB
~216 tok/sest. decodificación40 GiB38.0 GiB GiB utilizables
Consultar preciosolo GPU · referencia
Consultar precio
MÁS MARGEN PARA EXPERIMENTARS

Apple 36 GB

Apple Silicon 36 GB unified memory

Cabe cómodamente+29.3 GiB
~21 tok/sest. decodificación36 GiB30.6 GiB GiB utilizables
Amazon · Apple MacBook Pro 16 M4 36GB unified memoryordenador completo · referencia
Consultar precio
LISTO PARA CUDAS

RTX 5090

NVIDIA RTX 5090 32 GB

Cabe cómodamente+25.3 GiB
~249 tok/sest. decodificación32 GiB29.4 GiB GiB utilizables
Amazon · ASUS TUF Gaming RTX 5090 32GBsolo GPU · referencia
Consultar precio
LISTO PARA CUDAS

RTX 5000 Ada

NVIDIA RTX 5000 Ada 32 GB

Cabe cómodamente+25.3 GiB
~80 tok/sest. decodificación32 GiB30.1 GiB GiB utilizables
Amazon · PNY RTX 5000 Ada Generation 32GBsolo GPU · referencia
Consultar precio
MÁS MARGEN PARA EXPERIMENTARS

Ryzen Mini 32 GB

AMD Ryzen Mini PC 32 GB unified memory

Cabe cómodamente+25.3 GiB
~12 tok/sest. decodificación32 GiB27.2 GiB GiB utilizables
Amazon · Beelink SER8 Mini PC AMD Ryzen 7 32GB DDR5ordenador completo · referencia
Consultar precio
LISTO PARA CUDAS

RTX 3090

NVIDIA RTX 3090 24 GB

Cabe cómodamente+17.3 GiB
~130 tok/sest. decodificación24 GiB22.1 GiB GiB utilizables
Amazon · ASUS TUF Gaming OC RTX 3090 24GBsolo GPU · referencia
Consultar precio
LISTO PARA CUDAS

RTX 4090

NVIDIA RTX 4090 24 GB

Cabe cómodamente+17.3 GiB
~140 tok/sest. decodificación24 GiB22.1 GiB GiB utilizables
Amazon · ASUS ROG Strix LC RTX 4090 24GBsolo GPU · referencia
Consultar precio
MÁS MARGEN PARA EXPERIMENTARS

RX 7900 XTX

AMD Radeon RX 7900 XTX 24 GB

Cabe cómodamente+17.3 GiB
~133 tok/sest. decodificación24 GiB22.1 GiB GiB utilizables
Amazon · PowerColor Red Devil RX 7900 XTX 24GBsolo GPU · referencia
Consultar precio
PRO / NUBES

L4

NVIDIA L4 24 GB

Cabe cómodamente+17.3 GiB
~42 tok/sest. decodificación24 GiB22.8 GiB GiB utilizables
Consultar preciosolo GPU · referencia
Consultar precio
PRO / NUBES

A10

NVIDIA A10 24 GB

Cabe cómodamente+17.3 GiB
~83 tok/sest. decodificación24 GiB22.8 GiB GiB utilizables
Consultar preciosolo GPU · referencia
Consultar precio
PRO / NUBES

A30

NVIDIA A30 24 GB

Cabe cómodamente+17.3 GiB
~130 tok/sest. decodificación24 GiB22.8 GiB GiB utilizables
Consultar preciosolo GPU · referencia
Consultar precio
MÁS MARGEN PARA EXPERIMENTARS

Apple 24 GB

Apple Silicon 24 GB unified memory

Cabe cómodamente+17.3 GiB
~21 tok/sest. decodificación24 GiB20.0 GiB GiB utilizables
Amazon · Apple Mac mini M4 24GB unified memoryordenador completo · referencia
Consultar precio
MÁS MARGEN PARA EXPERIMENTARS

RX 7900 XT

AMD Radeon RX 7900 XT 20 GB

Cabe cómodamente+13.3 GiB
~111 tok/sest. decodificación20 GiB18.4 GiB GiB utilizables
Amazon · Sapphire Pulse RX 7900 XT 20GBsolo GPU · referencia
Consultar precio
LISTO PARA CUDAS

RTX 4060 Ti

NVIDIA RTX 4060 Ti 16 GB

Cabe cómodamente+9.3 GiB
~40 tok/sest. decodificación16 GiB14.7 GiB GiB utilizables
Amazon · GIGABYTE Gaming OC RTX 4060 Ti 16GBsolo GPU · referencia
Consultar precio
LISTO PARA CUDAS

RTX 4070 Ti Super

NVIDIA RTX 4070 Ti Super 16 GB

Cabe cómodamente+9.3 GiB
~93 tok/sest. decodificación16 GiB14.7 GiB GiB utilizables
Amazon · GIGABYTE Gaming OC RTX 4070 Ti Super 16GBsolo GPU · referencia
Consultar precio
LISTO PARA CUDAS

RTX 4080 Super

NVIDIA RTX 4080 Super 16 GB

Cabe cómodamente+9.3 GiB
~102 tok/sest. decodificación16 GiB14.7 GiB GiB utilizables
Amazon · GIGABYTE Windforce OC RTX 4080 Super 16GBsolo GPU · referencia
Consultar precio
LISTO PARA CUDAS

RTX 5070 Ti

NVIDIA RTX 5070 Ti 16 GB

Cabe cómodamente+9.3 GiB
~124 tok/sest. decodificación16 GiB14.7 GiB GiB utilizables
Amazon · ASUS Prime RTX 5070 Ti 16GBsolo GPU · referencia
Consultar precio
LISTO PARA CUDAS

RTX 5080

NVIDIA RTX 5080 16 GB

Cabe cómodamente+9.3 GiB
~139 tok/sest. decodificación16 GiB14.7 GiB GiB utilizables
Amazon · ASUS Prime RTX 5080 16GBsolo GPU · referencia
Consultar precio
LISTO PARA CUDAS

RTX 5060 Ti

NVIDIA RTX 5060 Ti 16 GB

Cabe cómodamente+9.3 GiB
~62 tok/sest. decodificación16 GiB14.7 GiB GiB utilizables
Amazon · ASUS Prime RTX 5060 Ti 16GBsolo GPU · referencia
Consultar precio
MÁS MARGEN PARA EXPERIMENTARS

RX 7800 XT

AMD Radeon RX 7800 XT 16 GB

Cabe cómodamente+9.3 GiB
~87 tok/sest. decodificación16 GiB14.7 GiB GiB utilizables
Amazon · ASRock Steel Legend RX 7800 XT 16GB OCsolo GPU · referencia
Consultar precio
MÁS MARGEN PARA EXPERIMENTARS

RX 9060 XT

AMD Radeon RX 9060 XT 16 GB

Cabe cómodamente+9.3 GiB
~67 tok/sest. decodificación16 GiB14.7 GiB GiB utilizables
Amazon · ASUS Dual RX 9060 XT 16GBsolo GPU · referencia
Consultar precio
MÁS MARGEN PARA EXPERIMENTARS

RX 9070

AMD Radeon RX 9070 16 GB

Cabe cómodamente+9.3 GiB
~89 tok/sest. decodificación16 GiB14.7 GiB GiB utilizables
Amazon · ASRock Challenger RX 9070 16GB OCsolo GPU · referencia
Consultar precio
MÁS MARGEN PARA EXPERIMENTARS

RX 9070 XT

AMD Radeon RX 9070 XT 16 GB

Cabe cómodamente+9.3 GiB
~107 tok/sest. decodificación16 GiB14.7 GiB GiB utilizables
Amazon · PowerColor Red Devil RX 9070 XT 16GBsolo GPU · referencia
Consultar precio
LA ELECCIÓN DIARIAS

Apple 16 GB

Apple Silicon 16 GB unified memory

Cabe cómodamente+9.3 GiB
~17 tok/sest. decodificación16 GiB12.0 GiB GiB utilizables
Amazon · Apple Mac mini M4 16GB unified memoryordenador completo · referencia
Consultar precio
LISTO PARA CUDAS

RTX 3060

NVIDIA RTX 3060 12 GB

Cabe cómodamente+5.3 GiB
~50 tok/sest. decodificación12 GiB11.0 GiB GiB utilizables
Amazon · MSI Gaming GeForce RTX 3060 12GB Ventus 2X OCsolo GPU · referencia
Consultar precio
LISTO PARA CUDAS

RTX 4070 Super

NVIDIA RTX 4070 Super 12 GB

Cabe cómodamente+5.3 GiB
~70 tok/sest. decodificación12 GiB11.0 GiB GiB utilizables
Amazon · GIGABYTE Windforce OC RTX 4070 Super 12GBsolo GPU · referencia
Consultar precio
LISTO PARA CUDAS

RTX 5070

NVIDIA RTX 5070 12 GB

Cabe cómodamente+5.3 GiB
~93 tok/sest. decodificación12 GiB11.0 GiB GiB utilizables
Amazon · GIGABYTE Windforce OC RTX 5070 12GBsolo GPU · referencia
Consultar precio
LISTO PARA CUDAC

RTX 4060

NVIDIA RTX 4060 8 GB

Cabe · margen limitado+1.3 GiB
~38 tok/sest. decodificación8 GiB7.0 GiB GiB utilizables
Amazon · MSI Ventus 2X Black RTX 4060 8GB OCsolo GPU · referencia
Consultar precio
LISTO PARA CUDAC

RTX 5060

NVIDIA RTX 5060 8 GB

Cabe · margen limitado+1.3 GiB
~40 tok/sest. decodificación8 GiB7.0 GiB GiB utilizables
Amazon · GIGABYTE AERO OC RTX 5060 8GBsolo GPU · referencia
Consultar precio
LISTO PARA CUDAF

RTX 2060

NVIDIA RTX 2060 6 GB

Supera el presupuesto seguro-0.7 GiB
Descarga a CPU requeridavelocidad no prevista6 GiB5.0 GiB GiB utilizables
Consultar preciosolo GPU · referencia
Consultar precio

Precios de referencia en USD, no son cotizaciones en vivo. Verifique precios y disponibilidad con el distribuidor. Algunos enlaces pueden generar comisión.

De “¿cabrá?” a tu primera instrucción.

Comienza con la cuantización predeterminada de Ollama. Confirma la memoria real con ollama ps.

La velocidad se refiere a decodificación estimada (generación de tokens), no al procesamiento del prompt. Se basa en ancho de banda de memoria, peso activo y una suposición de eficiencia; no es un benchmark. La descarga a CPU puede ser mucho más lenta. La compatibilidad de AMD varía; revísala antes de comprar.

UN POCO DE CONTEXTO APORTA MUCHO

Comprende la IA local.

Para tu primer modelo, tu próxima mejora y todo lo demás.

Conocimiento y análisis profundos

Centro de Conocimiento sobre VRAM e IA Local

Guías técnicas exhaustivas, análisis de arquitecturas y manuales de hardware para configurar y ejecutar modelos de lenguaje locales con total precisión.

50+ Términos8 min de referencia
Domina la terminología clave: GGUF frente a Safetensors, K-quants, KV cache, GQA, parámetros activos en MoE y memoria unificada de Apple.
Búsqueda y filtrado interactivo por categorías
Conclusiones prácticas de hardware por cada término
Definiciones rigurosas sin tecnicismos innecesarios
Índice alfabético de consulta rápida
Leer Guía
Herramienta Interactiva6 min de lectura
Aprende cómo el KV Cache consume VRAM en contextos largos, la fórmula matemática exacta y cómo reducir su huella de memoria entre un 50% y un 75%.
Calculadora interactiva de memoria de contexto
Evolución arquitectónica: MHA vs GQA vs MLA
Ahorro con cuantización FP8 e INT4 de caché
Consumo de memoria en conversaciones multi-turno
Leer Guía
Decodificador de Config7 min de lectura
Analiza repositorios como un ingeniero de ML: descifra archivos config.json, detecta límites de contexto reales y evita la trampa de parámetros en modelos MoE.
Inspector interactivo de parámetros config.json
Decodificación de nomenclaturas GGUF
Cálculo de parámetros activos vs totales en MoE
Parámetros de ventana de contexto y escalado RoPE
Leer Guía
Matriz de Licencias5 min de lectura
Entiende las diferencias legales y prácticas entre el código abierto OSI genuino y los modelos de pesos abiertos como Llama 3, DeepSeek, Qwen 2.5 y Gemma 2.
Matriz comparativa de licencias populares
Límites de uso comercial y umbrales de usuarios
Restricciones para destilación de datos sintéticos
Guía de cumplimiento normativo para empresas
Leer Guía
Guía de Hardware8 min de lectura
Descubre por qué el ancho de banda supera al cómputo, qué nivel de VRAM necesitas para cada clase de modelo y cómo se compara Apple Silicon con Nvidia.
Tramos de VRAM (8GB a 128GB+)
Fórmula de ancho de banda vs cómputo
Comparativa Apple Silicon Mac vs PC Nvidia
Configuración Workstation Dual-GPU para 70B
Leer Guía

Preguntas clave.

Las estimaciones son útiles. Conocer sus límites es aún mejor.

Suma pesos + caché KV + 1 o 2 GB de margen. En Q4_K_M, orientativo: unos 4–6 GB (7–8B), 8–12 GB (13–14B), 20–24 GB (32B), 42–50 GB (70B denso), y luego el contexto. Usa la calculadora con cuantización y ventana de contexto, no solo el tamaño del archivo.

Los pesos Q4_K_M de un 70B denso ya van por ~40 GB. Con contexto corto y overhead, planifica 45–50 GB en GPU. FP16 ronda los 140 GB. Una sola tarjeta de 24 GB no lo carga entero en Q4 usable sin offload pesado.

No entero en GPU a calidad Q4. Cabe en híbrido (VRAM + RAM) pero irá lento, a pocos tok/s. Caminos reales: doble 24 GB, 48 GB+, un Mac con mucha memoria unificada, un MoE más pequeño, o alquilar GPU.

GGUF es el formato de Ollama, LM Studio y llama.cpp. Q4_K_M es el punto dulce calidad/tamaño. FP16 ~2 bytes/parámetro; Q4 ~0,5–0,6. Un 7B pasa de ~14 GB de pesos a 4–5 GB. Cuantizar pesos no reduce la caché KV salvo que también la cuantices.

Elige el checkpoint, la cuantización y el contexto arriba: pesos + KV + runtime. El tamaño del GGUF es solo un suelo. Después de cargar, mide con nvidia-smi u ollama ps.

Sí. La caché KV crece con los tokens y las conversaciones a la vez. A 32K o 128K puede igualar o superar los pesos. Un modelo que cabe a 4K puede provocar un error de OOM a 32K. Define el contexto que uses realmente o cuantiza la caché KV.

Sirven para aprender y para 7B/8B en Q4 con contexto corto. Quedan justos para coding/agentes y contexto largo. Si compras, 12–16 GB+ es un suelo más seguro.

Para inferencia local, más VRAM gana. 12 GB casi siempre superan 8 GB más rápidos. La 3060 12 GB abre 13B/14B en Q4; 8 GB se quedan en 7B/8B con contexto contenido.

macOS y las aplicaciones ya consumen varios GB. Orientativo: 16 GB modelos pequeños, 32 GB rango medio cómodo, 64 GB+ antes de que un 70B sea práctico. No trates la memoria unificada como VRAM dedicada al 100%.

Compra si usas muchas horas a la semana y quieres privacidad. Alquila (o renta) para picos, pruebas de 48–80 GB, o validar un 70B antes de un PC de dos GPU. Híbrido habitual: tarjeta local para el 8B–32B diario, nube cuando hace falta más.

Sí, con GGUF/llama.cpp si VRAM más RAM cubren el modelo. La velocidad suele caer a pocos tok/s: resulta viable para lotes, pero no para un chat interactivo. Prefiere un quant más pequeño o un modelo que quepa entero en GPU si te importan los tok/s.

Por VRAM, no por TFLOPS: ~8 GB → 7–8B Q4; ~12 GB → 13–14B; 16–24 GB → ~20–32B; ~48 GB total → 70B denso Q4. Incluye siempre la caché KV y confirma en la calculadora.

El GGUF son solo los pesos. Caché KV, activaciones, el escritorio, fragmentación y prompts largos van encima. Deja margen, baja contexto, cuantiza la KV o elige un quant menor. Que quepa el archivo no es que quepa la conversación.

La memoria sigue los parámetros totales (guardas todos los expertos); la velocidad sigue los activos. El MoE brilla si descargas expertos a RAM, no porque la VRAM se encoja al tamaño activo.

El quant más alto que aún quepa con margen de contexto. Q4_K_M es el punto dulce para chat y código. Q5/Q6/Q8 si te sobra VRAM. Evita Q2/Q3 salvo que no quepa nada más.

En cuantización Q4_K_M, los pesos ocupan aproximadamente 5.5 GB. Con un contexto de 8k tokens y los buffers de CUDA, necesitas al menos 7 a 8 GB de VRAM. Una tarjeta de 8 GB (RTX 4060) o de 12 GB (RTX 3060) lo ejecuta al 100% en la GPU sin recurrir a la RAM del sistema.

La generación de tokens depende estrictamente del ancho de banda de la memoria. Una RTX 3090 ofrece ~936 GB/s, mientras que la memoria RAM DDR5 en doble canal solo alcanza 60 a 80 GB/s. Esta diferencia de más de 12 veces hace que descargar capas a la CPU desplome la velocidad de 30 tok/s a solo 1 o 2 tok/s.

Los pesos en Q4_K_M ocupan unos 42 GB. A 32k tokens de contexto con atención GQA, el caché KV en FP16 requiere cerca de 4.5 GB, más 1 GB de memoria de trabajo de CUDA. El consumo total real es de ~48 GB de VRAM, ideal para una configuración Dual RTX 3090 (48 GB) o un Mac Studio con 64 GB de memoria unificada.

El archivo descargado solo contiene los pesos estáticos. Al arrancar, Ollama inicializa el contexto CUDA y preasigna espacio para el caché KV según el parámetro num_ctx. Si tu Modelfile define un contexto largo (como 32k), se reservan varios gigabytes adicionales inmediatamente para evitar fallos durante la conversación.

Para presupuestos ajustados, la RTX 3060 de 12 GB es la mejor opción de entrada para modelos 7B a 14B. Para entusiastas y desarrolladores, una RTX 3090 de 24 GB de segunda mano ofrece un ancho de banda inigualable de 936 GB/s por una fracción del precio de una RTX 4090, siendo el estándar de oro.

Cómo dimensionar una GPU para un LLM local

Ejecutar un modelo de lenguaje grande en local significa hacer que dos componentes quepan simultáneamente en la memoria de la GPU: los pesos del modelo y una caché KV que crece según el contexto activo. El cálculo de los pesos es directo: número de parámetros multiplicado por bytes por parámetro; por ello, cuantizar un modelo de FP16 a Q4 reduce aproximadamente a una cuarta parte su huella en memoria. La caché KV se pasa por alto con facilidad: un modelo que apenas cabe con un contexto de 4K puede quedarse sin memoria a 32K, ya que la caché escala con la longitud del contexto. Esta calculadora estima ambos componentes y añade un margen operativo para la memoria del framework y las activaciones, comparando el total con GPUs habituales, desde la RTX 3060 de 12 GB hasta la H100 de 80 GB.

¿Para quién es esto?

Mira si tu rol, negocio o flujo de trabajo coincide con cómo la gente usa realmente esta herramienta.

Local LLM hobbyist / self-hoster

You found a model on Hugging Face and want to know before downloading gigabytes of weights whether your exact GPU can run it, so you search can I run this LLM on my GPU.

PC builder shopping for an AI GPU

You are about to spend $800-2000 on a graphics card and want proof of which quantized models it will actually handle before buying, searching best GPU for local LLM VRAM.

ML engineer / data scientist sizing a deployment

You need to pick the right quantization level to fit a model on available inference hardware without OOM errors, searching GGUF quantization VRAM calculator.

Indie developer running a local AI coding assistant

You want Continue.dev or a similar VS Code plugin talking to Ollama instead of paying for Copilot, and search how much VRAM for local coding assistant to see what fits on your dev machine.

Más herramientas gratuitas

¿Prefieres construir un prompt en lugar de dimensionar hardware? Prueba el Creador de Prompts de IA o explora todo el catálogo de Herramientas de IA gratis.