Saltar al contenido principal
Vantaige

Guía de Selección y Compra de Hardware

La Guía Definitiva de GPU para LLM Locales

Olvida los benchmarks tradicionales de videojuegos. Descubre por qué el ancho de banda de memoria determina tu velocidad de generación, qué nivel de VRAM necesitas para cada clase de modelo y cómo se compara Apple Silicon con Nvidia.

1. La Regla de Oro del Hardware para IA: Ancho de Banda sobre Cómputo

En la inferencia de LLM autorregresivos, el cuello de botella casi nunca radica en la potencia bruta de cálculo (TFLOPS). Radica en el ancho de banda de la memoria: la velocidad a la que los pesos del modelo pueden transferirse desde la VRAM a los núcleos de cómputo.

Durante la generación, cada peso del modelo debe leerse de la memoria hacia los núcleos por cada token generado. Una GPU con enorme cómputo pero bus de memoria estrecho se quedará esperando la llegada de datos.

Velocidad Máxima (tokens/seg) = Ancho de Banda de Memoria (GB/s) / Tamaño del Modelo en VRAM (GB)

Ejemplo: Un modelo de 70B cuantizado a Q4 requiere aproximadamente 40 GB de VRAM. En una RTX 3090 con 936 GB/s de ancho de banda, el límite teórico es 936 / 40 = 23.4 tokens/segundo. En memoria RAM de sistema DDR5 a 60 GB/s, ese mismo modelo generará a tan solo 60 / 40 = 1.5 tokens/segundo.

2. Los 4 Niveles de Capacidad de VRAM: ¿Qué Puedes Ejecutar Realmente?

Nivel Básico8-12 GiB Memoria
Nivel de 8GB a 12GB VRAM

Modelos de 7B a 8B en Q4_K_M (Llama 3 8B, Mistral 7B, Qwen 2.5 7B). Contextos cortos de hasta 8k tokens.

RTX 3060 12GB (la reina económica), RTX 4060 Ti 16GB, o RTX 5060 Ti 16GB.

Ideal para: Principiantes, estudiantes, asistentes ligeros de código y chat local con presupuesto ajustado.
El Punto Óptimo16-24 GiB Memoria
Nivel de 16GB a 24GB VRAM

Modelos de 14B a 32B en Q4_K_M (Qwen 2.5 32B, Command-R), o modelos de 70B con cuantización agresiva (IQ2/Q3).

RTX 3090 24GB (segunda mano, valor insuperable), RTX 4090 24GB, o RTX 5090 32GB.

Ideal para: Desarrolladores serios, fine-tuning local (LoRA/QLoRA) y modelos de programación de 32B de alta precisión.
Estándar Entusiasta32-48 GiB Memoria
Nivel de 32GB a 48GB (Dual GPU / Mac)

Modelos completos de 70B a 72B en Q4_K_M con ventanas amplias de contexto (32k) y KV cache en FP8.

Dual RTX 3090 (48GB total), dual RTX 4090, o Apple Mac Studio M2/M3/M4 Max (48GB a 64GB).

Ideal para: Prototipos de producción, análisis de documentos extensos y razonamiento 70B sin concesiones.
Paraíso para 70B64-128+ GiB Memoria
Nivel de 64GB a 128GB+ (Mac Studio / Multi-GPU Pro)

Llama 3.3 70B en Q8_0, Qwen 2.5 72B en FP16, versiones destiladas de DeepSeek R1/V3, y Llama 405B en Q2/Q3.

Apple Mac Studio M2/M3 Ultra (128GB a 192GB memoria unificada) o estaciones multi-GPU profesionales.

Ideal para: Equipos empresariales, investigadores de IA y usuarios avanzados que requieren modelos de frontera 100% offline.

3. Apple Silicon Mac vs. Nvidia PC: ¿Cuál Deberías Comprar?

Apple Silicon (Memoria Unificada)
  • Enorme Capacidad de VRAM: Hasta 128GB o 192GB de memoria unificada en un solo equipo de escritorio silencioso.
  • Consumo Silencioso y Eficiente: Consume 80W a 120W a plena carga frente a los 850W+ de PCs multi-GPU.
  • Ancho de Banda Moderado: 300 a 800 GB/s ofrece velocidades de 15 a 25 tokens/seg en modelos de 70B.
  • Ecosistema de Software: Excelente rendimiento con MLX nativo y llama.cpp Metal; vLLM y CUDA no están disponibles.
Workstation Nvidia (Ecosistema CUDA)
  • Máxima Velocidad de Generación: Ancho de banda de 1,008 GB/s en RTX 4090 para velocidades de 30 a 60 tokens/seg.
  • Estándar de la Industria: 100% compatible con CUDA, PyTorch, vLLM, TensorRT-LLM y FlashAttention-2.
  • Barrera de VRAM: Límite estricto de 24GB por tarjeta de consumo. Ejecutar 70B exige configuraciones dual-GPU.
  • Consumo y Calor: Requiere fuentes de 1,000W+, cajas de gran flujo de aire y refrigeración dedicada.

4. Construcción de una Workstation Dual-GPU para Modelos de 70B

Si tu objetivo es ejecutar modelos de 70B a máxima velocidad en PC, una configuración de dos tarjetas es la alternativa más rentable:

1. Líneas PCIe de la Placa Base

Asegúrate de que tu placa base admita bifurcación x8 / x8 en líneas del procesador, con espacio de 3 a 4 ranuras entre tarjetas para refrigeración.

2. Fuente de Alimentación (PSU)

Instala al menos una fuente Platinum o Titanium de 1,200W a 1,500W para soportar los picos transitorios de dos RTX 3090 o 4090.

3. Motor de Inferencia

Utiliza vLLM con Tensor Parallelism (--tensor-parallel-size 2) o llama.cpp multi-GPU para repartir los pesos entre ambas tarjetas.

Preguntas Frecuentes

Porque en LLMs locales, la capacidad de VRAM manda. Una RTX 3090 de 24GB puede alojar modelos de 32B en Q4 o modelos densos de 14B en FP16 con contexto de 32k tokens completamente en memoria. La tarjeta de 16GB no puede cargar modelos de 32B a máxima velocidad y se ve obligada a derivar capas a la lenta RAM del sistema. Además, la RTX 3090 cuenta con un ancho de banda de 936 GB/s frente a los 717 GB/s de la RTX 4080.

8GB es suficiente para aprender y probar modelos de 7B u 8B en Q4_K_M con contextos cortos (hasta 4k u 8k tokens). Sin embargo, resulta limitado para agentes de programación modernos, análisis de documentos extensos o si usas la tarjeta para la pantalla al mismo tiempo. Al comprar nuevo, 12GB a 16GB es el umbral mínimo recomendado.

Sí. La arquitectura de memoria unificada de Apple permite a los núcleos GPU acceder a todo el espacio de RAM sin cuellos de botella de PCIe. Un Mac Studio con 64GB ejecuta Llama 3.3 70B en Q4_K_M con holgura (~45 GB totales) a 15-22 tokens/segundo. Con 128GB o 192GB puedes correr 70B en FP16 completo o modelos MoE enormes que requerirían más de $10,000 en hardware de PC.

Cuando un modelo cabe al 100% en VRAM, los datos viajan a 500-1,000 GB/s. Al delegar capas a la RAM del sistema, la información debe atravesar el bus PCIe (PCIe 4.0 x16 tiene un tope de ~31.5 GB/s y la DDR5 opera a 60-90 GB/s). Como la inferencia depende estrictamente del ancho de banda, delegar incluso unas pocas capas suele hundir la velocidad de 45 tokens/seg a apenas 3-6 tokens/seg.

Para modelos de 70B, definitivamente sí. Una sola RTX 4090 dispone de 24GB y no puede albergar un modelo 70B cuantizado sin recurrir al offload. Dos RTX 3090 suman 48GB de VRAM combinada (mediante Tensor Parallelism en vLLM o división de capas en llama.cpp), permitiéndote ejecutar 70B Q4_K_M completamente en VRAM a 25+ tokens/segundo por un costo total similar o menor al de una 4090.

¿Necesitas más VRAM de la que tiene tu GPU local?

Alquila instancias RTX 4090 o H100 bajo demanda en RunPod y Vast.ai desde $0.34/hora.

Ver Tarifas de GPU en la Nube

Knowledge & Deep Dives

Centro de Conocimiento sobre VRAM e IA Local

Guías técnicas exhaustivas, análisis de arquitecturas y manuales de hardware para configurar y ejecutar modelos de lenguaje locales con total precisión.

50+ Términos8 min de referencia
Domina la terminología clave: GGUF frente a Safetensors, K-quants, KV cache, GQA, parámetros activos en MoE y memoria unificada de Apple.
Búsqueda y filtrado interactivo por categorías
Conclusiones prácticas de hardware por cada término
Definiciones rigurosas sin tecnicismos innecesarios
Índice alfabético de consulta rápida
Leer Guía
Herramienta Interactiva6 min de lectura
Aprende cómo el KV Cache consume VRAM en contextos largos, la fórmula matemática exacta y cómo reducir su huella de memoria entre un 50% y un 75%.
Calculadora interactiva de memoria de contexto
Evolución arquitectónica: MHA vs GQA vs MLA
Ahorro con cuantización FP8 e INT4 de caché
Consumo de memoria en conversaciones multi-turno
Leer Guía
Decodificador de Config7 min de lectura
Analiza repositorios como un ingeniero de ML: descifra archivos config.json, detecta límites de contexto reales y evita la trampa de parámetros en modelos MoE.
Inspector interactivo de parámetros config.json
Decodificación de nomenclaturas GGUF
Cálculo de parámetros activos vs totales en MoE
Parámetros de ventana de contexto y escalado RoPE
Leer Guía
Matriz de Licencias5 min de lectura
Entiende las diferencias legales y prácticas entre el código abierto OSI genuino y los modelos de pesos abiertos como Llama 3, DeepSeek, Qwen 2.5 y Gemma 2.
Matriz comparativa de licencias populares
Límites de uso comercial y umbrales de usuarios
Restricciones para destilación de datos sintéticos
Guía de cumplimiento normativo para empresas
Leer Guía