Saltar al contenido principal
Vantaige

Guía de Hugging Face

Cómo Leer Cualquier Tarjeta de Modelo en Hugging Face

Aprende a inspeccionar repositorios de modelos abiertos como un ingeniero de ML para estimar con certeza los requisitos de VRAM antes de descargar archivos gigantescos.

Interactive Hugging Face config.json Inspector

Click any line in the code block to see what it means, how it impacts your GPU, and the traps to avoid.

Interactive Code Walkthrough
config.json (Sample Architecture)Click a key to inspect
{
"model_type": "\"llama\"",weights
"max_position_embeddings": 131072,context
"num_hidden_layers": 32,attention
"num_attention_heads": 32,attention
"num_key_value_heads": 8,attention
"head_dim": 128,attention
"sliding_window": 4096,context
"num_local_experts": 8,moe
"num_experts_per_tok": 2,moe
"torch_dtype": "\"bfloat16\"",weights
}
Selected Parameterattention

"num_key_value_heads": 8

Key-Value Heads (GQA Indicator)

The number of KV heads stored in the KV cache. When this value is smaller than num_attention_heads (here: 8 vs 32), the model uses Grouped-Query Attention (GQA).

VRAM & Hardware Impact

In this example (8 KV heads vs 32 query heads), KV cache VRAM is slashed by 75%.

Common Pitfall / Confusion

If num_key_value_heads equals num_attention_heads, the model uses legacy MHA and will consume 4x to 8x more VRAM for context!

1. Decodificar config.json: La Fuente Oficial de la Verdad

No te fíes exclusivamente del archivo README para estimar hardware. Revisa siempre config.json en la pestaña 'Files and versions'. Los campos esenciales son num_hidden_layers (capas), hidden_size (dimensión), num_attention_heads (cabezas de atención) y num_key_value_heads (arquitectura del KV cache).

2. Localizar el Límite Real de Contexto (max_position_embeddings y RoPE)

El parámetro max_position_embeddings establece la longitud de contexto nativa con la que fue entrenado el modelo. Si incluye un bloque rope_scaling, significa que utiliza técnicas de escalado de frecuencia (como YaRN o escalado lineal) para extender el contexto más allá del límite nativo.

3. La Trampa de los Modelos MoE: Parámetros Activos vs Totales

En arquitecturas Mixture of Experts (MoE) como Mixtral 8x7B, Qwen 2.5 57B A14B o DeepSeek V3 (671B totales, 37B activos), solo una parte de los expertos se activa por token. Sin embargo, TODOS los pesos deben residir en la VRAM. No es posible ejecutar un modelo MoE de 671B en una tarjeta de 48GB aunque su coste de cálculo activo sea moderado.

4. Entender los Sufijos de Cuantización GGUF (Q4_K_M, IQ4_XS, FP8)

En repositorios GGUF, los sufijos indican el método de compresión. Q4_K_M designa cuantización de 4 bits intermedia (el mejor equilibrio entre calidad y memoria). Los formatos IQ (como IQ3_M, IQ4_XS) emplean matrices de importancia para lograr menor perplejidad con tamaños mínimos.

Preguntas Frecuentes

El tamaño del archivo solo representa los pesos estáticos. Al ejecutar el modelo, se debe sumar la sobrecarga del entorno CUDA (500MB a 1GB), los buffers de activación y el espacio dinámico del KV Cache según crezca la conversación.

GGUF está optimizado para llama.cpp y Ollama con soporte mixto para CPU y GPU. AWQ y GPTQ están diseñados para inferencia pura en GPU mediante vLLM o TensorRT-LLM. EXL2 es específico para ExLlamaV2 en tarjetas Nvidia con precisión variable por capa.

Consulta la etiqueta de licencia en la cabecera del repositorio y el archivo LICENSE. Licencias como MIT, Apache 2.0 y BSD autorizan uso comercial irrestricto. Licencias comunitarias como Llama 3 imponen techos de usuarios y limitaciones de uso.

Indica el tipo de atención. Si coincide con num_attention_heads, el modelo utiliza MHA tradicional. Si es significativamente menor (ej. 8 frente a 32), emplea GQA, lo que reduce sustancialmente el consumo de VRAM en el caché.

En la clave architectures dentro de config.json (por ejemplo, LlamaForCausalLM, Qwen2ForCausalLM, DeepseekV3ForCausalLM), lo cual determina la compatibilidad con motores de inferencia.

Evalúa cualquier modelo en nuestra calculadora

Introduce los parámetros o explora nuestro catálogo para conocer los requisitos reales de VRAM de inmediato.

Abrir Calculadora VRAM

Knowledge & Deep Dives

Centro de Conocimiento sobre VRAM e IA Local

Guías técnicas exhaustivas, análisis de arquitecturas y manuales de hardware para configurar y ejecutar modelos de lenguaje locales con total precisión.

50+ Términos8 min de referencia
Domina la terminología clave: GGUF frente a Safetensors, K-quants, KV cache, GQA, parámetros activos en MoE y memoria unificada de Apple.
Búsqueda y filtrado interactivo por categorías
Conclusiones prácticas de hardware por cada término
Definiciones rigurosas sin tecnicismos innecesarios
Índice alfabético de consulta rápida
Leer Guía
Herramienta Interactiva6 min de lectura
Aprende cómo el KV Cache consume VRAM en contextos largos, la fórmula matemática exacta y cómo reducir su huella de memoria entre un 50% y un 75%.
Calculadora interactiva de memoria de contexto
Evolución arquitectónica: MHA vs GQA vs MLA
Ahorro con cuantización FP8 e INT4 de caché
Consumo de memoria en conversaciones multi-turno
Leer Guía
Matriz de Licencias5 min de lectura
Entiende las diferencias legales y prácticas entre el código abierto OSI genuino y los modelos de pesos abiertos como Llama 3, DeepSeek, Qwen 2.5 y Gemma 2.
Matriz comparativa de licencias populares
Límites de uso comercial y umbrales de usuarios
Restricciones para destilación de datos sintéticos
Guía de cumplimiento normativo para empresas
Leer Guía
Guía de Hardware8 min de lectura
Descubre por qué el ancho de banda supera al cómputo, qué nivel de VRAM necesitas para cada clase de modelo y cómo se compara Apple Silicon con Nvidia.
Tramos de VRAM (8GB a 128GB+)
Fórmula de ancho de banda vs cómputo
Comparativa Apple Silicon Mac vs PC Nvidia
Configuración Workstation Dual-GPU para 70B
Leer Guía