Guía de Selección y Compra de Hardware
La Guía Definitiva de GPU para LLM Locales
Olvida los benchmarks tradicionales de videojuegos. Descubre por qué el ancho de banda de memoria determina tu velocidad de generación, qué nivel de VRAM necesitas para cada clase de modelo y cómo se compara Apple Silicon con Nvidia.
1. La Regla de Oro del Hardware para IA: Ancho de Banda sobre Cómputo
En la inferencia de LLM autorregresivos, el cuello de botella casi nunca radica en la potencia bruta de cálculo (TFLOPS). Radica en el ancho de banda de la memoria: la velocidad a la que los pesos del modelo pueden transferirse desde la VRAM a los núcleos de cómputo.
Durante la generación, cada peso del modelo debe leerse de la memoria hacia los núcleos por cada token generado. Una GPU con enorme cómputo pero bus de memoria estrecho se quedará esperando la llegada de datos.
Ejemplo: Un modelo de 70B cuantizado a Q4 requiere aproximadamente 40 GB de VRAM. En una RTX 3090 con 936 GB/s de ancho de banda, el límite teórico es 936 / 40 = 23.4 tokens/segundo. En memoria RAM de sistema DDR5 a 60 GB/s, ese mismo modelo generará a tan solo 60 / 40 = 1.5 tokens/segundo.
2. Los 4 Niveles de Capacidad de VRAM: ¿Qué Puedes Ejecutar Realmente?
Modelos de 7B a 8B en Q4_K_M (Llama 3 8B, Mistral 7B, Qwen 2.5 7B). Contextos cortos de hasta 8k tokens.
RTX 3060 12GB (la reina económica), RTX 4060 Ti 16GB, o RTX 5060 Ti 16GB.
Modelos de 14B a 32B en Q4_K_M (Qwen 2.5 32B, Command-R), o modelos de 70B con cuantización agresiva (IQ2/Q3).
RTX 3090 24GB (segunda mano, valor insuperable), RTX 4090 24GB, o RTX 5090 32GB.
Modelos completos de 70B a 72B en Q4_K_M con ventanas amplias de contexto (32k) y KV cache en FP8.
Dual RTX 3090 (48GB total), dual RTX 4090, o Apple Mac Studio M2/M3/M4 Max (48GB a 64GB).
Llama 3.3 70B en Q8_0, Qwen 2.5 72B en FP16, versiones destiladas de DeepSeek R1/V3, y Llama 405B en Q2/Q3.
Apple Mac Studio M2/M3 Ultra (128GB a 192GB memoria unificada) o estaciones multi-GPU profesionales.
3. Apple Silicon Mac vs. Nvidia PC: ¿Cuál Deberías Comprar?
- Enorme Capacidad de VRAM: Hasta 128GB o 192GB de memoria unificada en un solo equipo de escritorio silencioso.
- Consumo Silencioso y Eficiente: Consume 80W a 120W a plena carga frente a los 850W+ de PCs multi-GPU.
- Ancho de Banda Moderado: 300 a 800 GB/s ofrece velocidades de 15 a 25 tokens/seg en modelos de 70B.
- Ecosistema de Software: Excelente rendimiento con MLX nativo y llama.cpp Metal; vLLM y CUDA no están disponibles.
- Máxima Velocidad de Generación: Ancho de banda de 1,008 GB/s en RTX 4090 para velocidades de 30 a 60 tokens/seg.
- Estándar de la Industria: 100% compatible con CUDA, PyTorch, vLLM, TensorRT-LLM y FlashAttention-2.
- Barrera de VRAM: Límite estricto de 24GB por tarjeta de consumo. Ejecutar 70B exige configuraciones dual-GPU.
- Consumo y Calor: Requiere fuentes de 1,000W+, cajas de gran flujo de aire y refrigeración dedicada.
4. Construcción de una Workstation Dual-GPU para Modelos de 70B
Si tu objetivo es ejecutar modelos de 70B a máxima velocidad en PC, una configuración de dos tarjetas es la alternativa más rentable:
Asegúrate de que tu placa base admita bifurcación x8 / x8 en líneas del procesador, con espacio de 3 a 4 ranuras entre tarjetas para refrigeración.
Instala al menos una fuente Platinum o Titanium de 1,200W a 1,500W para soportar los picos transitorios de dos RTX 3090 o 4090.
Utiliza vLLM con Tensor Parallelism (--tensor-parallel-size 2) o llama.cpp multi-GPU para repartir los pesos entre ambas tarjetas.
Preguntas Frecuentes
Porque en LLMs locales, la capacidad de VRAM manda. Una RTX 3090 de 24GB puede alojar modelos de 32B en Q4 o modelos densos de 14B en FP16 con contexto de 32k tokens completamente en memoria. La tarjeta de 16GB no puede cargar modelos de 32B a máxima velocidad y se ve obligada a derivar capas a la lenta RAM del sistema. Además, la RTX 3090 cuenta con un ancho de banda de 936 GB/s frente a los 717 GB/s de la RTX 4080.
8GB es suficiente para aprender y probar modelos de 7B u 8B en Q4_K_M con contextos cortos (hasta 4k u 8k tokens). Sin embargo, resulta limitado para agentes de programación modernos, análisis de documentos extensos o si usas la tarjeta para la pantalla al mismo tiempo. Al comprar nuevo, 12GB a 16GB es el umbral mínimo recomendado.
Sí. La arquitectura de memoria unificada de Apple permite a los núcleos GPU acceder a todo el espacio de RAM sin cuellos de botella de PCIe. Un Mac Studio con 64GB ejecuta Llama 3.3 70B en Q4_K_M con holgura (~45 GB totales) a 15-22 tokens/segundo. Con 128GB o 192GB puedes correr 70B en FP16 completo o modelos MoE enormes que requerirían más de $10,000 en hardware de PC.
Cuando un modelo cabe al 100% en VRAM, los datos viajan a 500-1,000 GB/s. Al delegar capas a la RAM del sistema, la información debe atravesar el bus PCIe (PCIe 4.0 x16 tiene un tope de ~31.5 GB/s y la DDR5 opera a 60-90 GB/s). Como la inferencia depende estrictamente del ancho de banda, delegar incluso unas pocas capas suele hundir la velocidad de 45 tokens/seg a apenas 3-6 tokens/seg.
Para modelos de 70B, definitivamente sí. Una sola RTX 4090 dispone de 24GB y no puede albergar un modelo 70B cuantizado sin recurrir al offload. Dos RTX 3090 suman 48GB de VRAM combinada (mediante Tensor Parallelism en vLLM o división de capas en llama.cpp), permitiéndote ejecutar 70B Q4_K_M completamente en VRAM a 25+ tokens/segundo por un costo total similar o menor al de una 4090.
¿Necesitas más VRAM de la que tiene tu GPU local?
Alquila instancias RTX 4090 o H100 bajo demanda en RunPod y Vast.ai desde $0.34/hora.
Knowledge & Deep Dives
Centro de Conocimiento sobre VRAM e IA Local
Guías técnicas exhaustivas, análisis de arquitecturas y manuales de hardware para configurar y ejecutar modelos de lenguaje locales con total precisión.