Guía de Hugging Face
Cómo Leer Cualquier Tarjeta de Modelo en Hugging Face
Aprende a inspeccionar repositorios de modelos abiertos como un ingeniero de ML para estimar con certeza los requisitos de VRAM antes de descargar archivos gigantescos.
Interactive Hugging Face config.json Inspector
Click any line in the code block to see what it means, how it impacts your GPU, and the traps to avoid.
{
"model_type": "\"llama\"",weights "max_position_embeddings": 131072,context "num_hidden_layers": 32,attention "num_attention_heads": 32,attention "num_key_value_heads": 8,attention "head_dim": 128,attention "sliding_window": 4096,context "num_local_experts": 8,moe "num_experts_per_tok": 2,moe "torch_dtype": "\"bfloat16\"",weights}"num_key_value_heads": 8
Key-Value Heads (GQA Indicator)
The number of KV heads stored in the KV cache. When this value is smaller than num_attention_heads (here: 8 vs 32), the model uses Grouped-Query Attention (GQA).
In this example (8 KV heads vs 32 query heads), KV cache VRAM is slashed by 75%.
If num_key_value_heads equals num_attention_heads, the model uses legacy MHA and will consume 4x to 8x more VRAM for context!
1. Decodificar config.json: La Fuente Oficial de la Verdad
No te fíes exclusivamente del archivo README para estimar hardware. Revisa siempre config.json en la pestaña 'Files and versions'. Los campos esenciales son num_hidden_layers (capas), hidden_size (dimensión), num_attention_heads (cabezas de atención) y num_key_value_heads (arquitectura del KV cache).
2. Localizar el Límite Real de Contexto (max_position_embeddings y RoPE)
El parámetro max_position_embeddings establece la longitud de contexto nativa con la que fue entrenado el modelo. Si incluye un bloque rope_scaling, significa que utiliza técnicas de escalado de frecuencia (como YaRN o escalado lineal) para extender el contexto más allá del límite nativo.
3. La Trampa de los Modelos MoE: Parámetros Activos vs Totales
En arquitecturas Mixture of Experts (MoE) como Mixtral 8x7B, Qwen 2.5 57B A14B o DeepSeek V3 (671B totales, 37B activos), solo una parte de los expertos se activa por token. Sin embargo, TODOS los pesos deben residir en la VRAM. No es posible ejecutar un modelo MoE de 671B en una tarjeta de 48GB aunque su coste de cálculo activo sea moderado.
4. Entender los Sufijos de Cuantización GGUF (Q4_K_M, IQ4_XS, FP8)
En repositorios GGUF, los sufijos indican el método de compresión. Q4_K_M designa cuantización de 4 bits intermedia (el mejor equilibrio entre calidad y memoria). Los formatos IQ (como IQ3_M, IQ4_XS) emplean matrices de importancia para lograr menor perplejidad con tamaños mínimos.
Preguntas Frecuentes
El tamaño del archivo solo representa los pesos estáticos. Al ejecutar el modelo, se debe sumar la sobrecarga del entorno CUDA (500MB a 1GB), los buffers de activación y el espacio dinámico del KV Cache según crezca la conversación.
GGUF está optimizado para llama.cpp y Ollama con soporte mixto para CPU y GPU. AWQ y GPTQ están diseñados para inferencia pura en GPU mediante vLLM o TensorRT-LLM. EXL2 es específico para ExLlamaV2 en tarjetas Nvidia con precisión variable por capa.
Consulta la etiqueta de licencia en la cabecera del repositorio y el archivo LICENSE. Licencias como MIT, Apache 2.0 y BSD autorizan uso comercial irrestricto. Licencias comunitarias como Llama 3 imponen techos de usuarios y limitaciones de uso.
Indica el tipo de atención. Si coincide con num_attention_heads, el modelo utiliza MHA tradicional. Si es significativamente menor (ej. 8 frente a 32), emplea GQA, lo que reduce sustancialmente el consumo de VRAM en el caché.
En la clave architectures dentro de config.json (por ejemplo, LlamaForCausalLM, Qwen2ForCausalLM, DeepseekV3ForCausalLM), lo cual determina la compatibilidad con motores de inferencia.
Evalúa cualquier modelo en nuestra calculadora
Introduce los parámetros o explora nuestro catálogo para conocer los requisitos reales de VRAM de inmediato.
Knowledge & Deep Dives
Centro de Conocimiento sobre VRAM e IA Local
Guías técnicas exhaustivas, análisis de arquitecturas y manuales de hardware para configurar y ejecutar modelos de lenguaje locales con total precisión.