Saltar al contenido principal
Vantaige
Llama screenshot

Llama es la familia de modelos de lenguaje de pesos abiertos de Meta, desde los originales de 2023 hasta los lanzamientos multimodales MoE de Llama 4. De descarga gratuita y con posibilidad de autoalojamiento, estos modelos impulsan miles de herramientas derivadas y flujos de trabajo empresariales en todo el mundo.

Funciones:APIOpen Source

Llama es la familia de grandes modelos de lenguaje de pesos abiertos (open-weight) creados y lanzados por Meta Platforms. Publicada por primera vez en febrero de 2023, la familia ha crecido a lo largo de cuatro generaciones principales y se ha convertido en el linaje de modelos con más bifurcaciones (forks) en la historia de la IA, impulsando más de 20,000 modelos derivados en Hugging Face. A diferencia de los proveedores de modelos cerrados, Meta publica los pesos reales del modelo para su descarga: investigadores, desarrolladores y empresas pueden ejecutar Llama localmente en su propio hardware, ajustarlo (fine-tune) con conjuntos de datos privados y redistribuir versiones modificadas sin pagar tarifas de API por token.

La actual generación insignia, Llama 4 (lanzada el 5 de abril de 2025), pasó de los transformadores densos a una arquitectura dispersa de Mezcla de Expertos (MoE) y añadió capacidad multimodal nativa. Llama 4 Scout ofrece 17 mil millones de parámetros activos de un total de 109 mil millones distribuidos en 16 expertos, con una ventana de contexto anunciada de 10 millones de tokens y la capacidad de ejecutarse en una sola GPU de nivel de servidor. Llama 4 Maverick escala a 400 mil millones de parámetros totales en 128 expertos, con 17 mil millones activos en el momento de la inferencia y una ventana de contexto de 1 millón de tokens. Ambos modelos procesan texto e imágenes de forma conjunta mediante fusión temprana (early fusion). El acceso es gratuito para el autoalojamiento; proveedores externos como Together AI, Fireworks y Groq ofrecen los modelos a través de API con tarifas que comienzan en torno a $0.08 por millón de tokens de entrada para Scout.

Llama de un vistazo, abril de 2025

El lanzamiento de Llama 4 el 5 de abril de 2025 hizo que la familia pasara de transformadores densos a una arquitectura dispersa de Mezcla de Expertos (MoE), donde cada token activa solo un subconjunto de subredes "expertas" especializadas en lugar del conjunto completo de parámetros. Hay dos modelos disponibles públicamente:

  • Llama 4 Scout (17B/109B): 17B activos, 109B en total, 16 expertos, contexto de 10M de tokens (ajustado por instrucciones). Cabe en una sola GPU H100 con cuantización. Entrenado con hasta 40 billones de tokens que abarcan 200 idiomas.

  • Llama 4 Maverick (17B/400B): 17B activos, 400B en total, 128 expertos, contexto de 1M de tokens (ajustado por instrucciones). Disponible en BF16 y FP8. Requiere múltiples GPU o servicio distribuido a máxima precisión.

  • Llama 4 Behemoth (~2 billones de parámetros en total): Anunciado en abril de 2025 pero no lanzado públicamente hasta abril de 2026. Diseñado como el modelo de investigación de frontera de Meta con ~288B de parámetros activos y comprensión de video nativa.

La generación anterior Llama 3.x sigue estando ampliamente implementada. Llama 3.3 70B y Llama 3.1 8B siguen siendo los preferidos por muchos desarrolladores para flujos de trabajo de programación, en parte porque su arquitectura densa tiene un comportamiento de servicio más predecible que la estructura MoE de Llama 4.

Lo que Llama realmente ofrece

Para los equipos con estrictos requisitos de privacidad de datos, el valor de Llama es claro: sus datos nunca salen de su infraestructura. Plataformas de descubrimiento legal, hospitales que procesan historiales de pacientes, contratistas de defensa que analizan documentos confidenciales e instituciones financieras con obligaciones regulatorias de manejo de datos implementan Llama exactamente por esta razón. Los pesos se descargan una vez; la inferencia se ejecuta completamente dentro de su propio entorno.

El ecosistema que Llama ha atraído es su segunda gran ventaja. Ollama, llama.cpp, vLLM y Text Generation Inference (TGI) son compatibles con Llama de forma nativa. AWS Bedrock, Google Vertex AI y Azure ofrecen endpoints alojados de Llama. Hugging Face aloja los pesos del modelo con integración nativa de Transformers. Si un desarrollador necesita ejecutar un modelo localmente, ajustarlo con datos de dominio o conectarlo a un backend de inferencia, existen tutoriales establecidos y herramientas probadas en producción para cada paso.

El ajuste fino (fine-tuning) es el tercer pilar. LoRA y QLoRA a través de Hugging Face PEFT permiten a los equipos adaptar Llama a dominios específicos: análisis de contratos, resumen de notas clínicas, cumplimiento normativo. Los proveedores de modelos cerrados no permiten esto.

"Ollama + Llama 3.1 8B. Si no hace lo que necesitas después de una semana de uso real, entonces entiendes la brecha lo suficientemente bien como para tomar una mejor decisión." -- Hilo de la comunidad r/LocalLLaMA, 2025

Dónde falla Llama: los problemas recurrentes de los usuarios

La recepción de la generación Llama 4 en la comunidad de desarrolladores fue marcadamente negativa en aspectos que merecen una cobertura honesta.

Degradación del contexto largo a escala. La afirmación de Llama 4 Scout de tener un contexto de 10 millones de tokens no se sostiene en la práctica más allá de los 256K tokens. Los modelos fueron preentrenados en secuencias de hasta 256K tokens; la cifra de 10M se aplica al ajuste fino por instrucciones que extiende la codificación posicional, pero no garantiza la calidad de razonamiento en toda su longitud. Evaluaciones independientes encontraron que la precisión cayó al 15.6% en tareas complejas de recuperación en longitudes extendidas. Gemini mantuvo un rendimiento superior al 90% en longitudes equivalentes en las mismas pruebas. Errores a nivel de implementación en el modo de paralelismo de canalización de vLLM causaron resultados basura en Llama 4 a más de 64K tokens, documentados en múltiples problemas de GitHub.

"Llama Scout y Llama Maverick parecen profundamente decepcionantes, decepcionantes al nivel de 'la gente piensa que tienen que estar mal configurados para ser tan malos'." -- Hilo de discusión en Hacker News, abril de 2025

Rendimiento de programación por debajo de las expectativas. Llama 4 Maverick obtuvo un 16% en el benchmark de programación Aider Polyglot, quedando por detrás de Qwen 2.5 Coder a pesar de ser 10 veces más grande en parámetros activos. En los benchmarks de programación centrados en SRE, quedó en último lugar con un 69.5% de precisión, un 6% por debajo de DeepSeek V3 y un 18% por detrás de GPT-4o. Los desarrolladores notaron que Llama 3.3 70B, la generación anterior, superó a Llama 4 Maverick en algunas tareas de programación. Los equipos con cargas de trabajo centradas en la programación encontraron pocas razones para migrar a la nueva versión.

Sin modelos pequeños para consumidores en Llama 4. La generación Llama 3.2 incluyó modelos de 1B y 3B que se ejecutaban en hardware de consumo y dispositivos móviles. Llama 4 se lanzó solo con Scout (109B en total) y Maverick (400B en total). El modelo Llama 4 más pequeño disponible públicamente requiere hardware de nivel de servidor, lo que excluye efectivamente a los segmentos de aficionados y desarrolladores de MacBook que impulsaron gran parte de la adopción de Llama 3. Esta es una brecha estructural, no un problema de configuración.

Calidad de salida descrita como insulsa. Múltiples análisis de desarrolladores señalaron que las respuestas de Llama 4 eran verbosas y genéricas en comparación con sus competidores. Una observación constante: los modelos producen respuestas largas y llenas de emojis en lugar de respuestas precisas y directas. Para casos de uso en producción que requieren un seguimiento estricto de instrucciones, algunos equipos encontraron que los modelos Llama 3.1 eran más predecibles.

Llama vs. Mistral vs. Qwen

Las tres son familias de modelos de pesos abiertos. Las diferencias son arquitectónicas, de licencias y a nivel de benchmarks.

Mistral (Mistral AI, Francia): Mistral Small 4 (marzo de 2026) utiliza una arquitectura MoE con 119B de parámetros totales, pero solo 4 expertos activos por token, lo que produce aproximadamente 6B de parámetros activos por inferencia, menos de la mitad de los 17B activos de Llama 4 Scout. Una huella activa más pequeña significa un menor costo de inferencia por token en hardware equivalente. La licencia es Apache 2.0: totalmente permisiva, sin límite de MAU (usuarios activos mensuales), sin restricciones posteriores, sin requisito de atribución. La ventana de contexto de Mistral es de 256K (más pequeña que la afirmación de Scout, pero más cercana a lo que el hardware realmente ofrece de manera confiable). Mistral no tiene el mismo volumen de modelos derivados de la comunidad, pero su licencia más limpia lo ha convertido en la opción predeterminada para las startups preocupadas por la cláusula de 700M de MAU de Llama.

Qwen (Alibaba, China): Qwen 3.5/3.6 también utiliza una arquitectura MoE con aproximadamente 397B de parámetros totales y 17B activos, lo que lo hace directamente comparable a Llama 4 Scout en cómputo activo. La licencia es Apache 2.0 sin restricciones. Qwen lidera en los benchmarks de programación a partir de 2025-2026: Qwen 2.5-Coder-32B encabezó las tablas de clasificación de programación, y Qwen 3.6 Plus obtiene un 78.8% en SWE-bench frente al aproximadamente 70% de Llama 4 Maverick. A principios de 2026, Qwen superó a Llama en descargas agregadas en Hugging Face con casi mil millones de descargas acumuladas. La cuota de modelos derivados en Hugging Face alcanzó el 69% para Qwen frente al 11% de Llama en febrero de 2026. La principal preocupación con Qwen es que está desarrollado por Alibaba, lo que plantea preguntas sobre el linaje de datos y el cumplimiento geopolítico para algunos compradores empresariales que no se aplican a Llama.

En resumen: el recuento de parámetros activos de Llama 4 supera al de Mistral a una escala total similar, y el ecosistema es más grande que el de ambos competidores. Pero tanto Mistral como Qwen utilizan Apache 2.0 sin restricciones comerciales, y Qwen lidera en programación con un cómputo activo comparable.

El truco de la licencia: lo que realmente significan 700M de MAU

El Acuerdo de Licencia Comunitaria de Llama 4 de Meta otorga derechos libres de regalías para usar, modificar y distribuir los pesos en productos comerciales, con un límite estricto: si su producto o servicio tiene más de 700 millones de usuarios activos mensuales (MAU), su licencia termina automáticamente y debe comunicarse con Meta para negociar un acuerdo por separado. Meta no tiene la obligación de otorgar ese acuerdo, puede imponer cualquier término y puede rechazarlo sin explicación.

Este umbral suena enorme hasta que se considera que se aplica al producto en su conjunto, no a la función de IA específicamente. Una empresa con 800 millones de usuarios que quiera agregar un chatbot de soporte impulsado por Llama a un rincón de su plataforma está técnicamente fuera de la licencia. La cláusula también se suma entre filiales: importa el recuento combinado de usuarios de un grupo corporativo, no solo el de una sola subsidiaria.

Los analistas legales han señalado que la restricción de 700M de MAU y la definición formal de código abierto de la OSI son incompatibles: Llama se describe con mayor precisión como "código disponible" (source available) que como código abierto (open source), a pesar del lenguaje de marketing de Meta. Esto es importante para los equipos de adquisiciones que requieren licencias aprobadas por la OSI para el software utilizado en sistemas de producción.

Mistral y Qwen, por el contrario, se lanzan bajo Apache 2.0. Sin límite de usuarios, sin requisito de atribución, sin necesidad de negociación.

Mejores casos de uso y cuándo evitar Llama

Dónde Llama se gana su lugar:

  • Flujos de trabajo de privacidad de datos empresariales: Equipos legales, de atención médica, finanzas y defensa que implementan RAG sobre documentos internos donde la soberanía de los datos no es negociable. Los pesos abiertos significan que la inferencia se ejecuta completamente dentro de su infraestructura.

  • Ajuste fino para dominios específicos: Equipos que necesitan un modelo que comprenda terminología patentada, lenguaje regulatorio específico o razonamiento de dominio específico. El ajuste fino con LoRA/QLoRA en Llama está bien documentado y respaldado por toda la cadena de herramientas de Hugging Face.

  • Aplicaciones de alto volumen con requisitos de bajo costo por token: Autoalojar Llama en su propio clúster de GPU cuesta mucho menos a escala que pagar tarifas de API propietarias. Para aplicaciones que generan cientos de millones de tokens al mes, la economía favorece a los pesos abiertos.

  • Investigación y experimentación: Investigadores de interpretabilidad, equipos de alineación y equipos de pruebas de penetración (red-teamers) que necesitan acceso de caja blanca a los pesos del modelo para sondear representaciones internas.

Cuándo evitar Llama:

  • Su necesidad principal es la asistencia de programación: Qwen 2.5-Coder y DeepSeek Coder superan a Llama 4 en los benchmarks de programación con recuentos de parámetros activos comparables. Si la programación es el caso de uso principal, la elección es clara.

  • Necesita una ventana de contexto confiable de más de 1M de tokens: Las afirmaciones de contexto de 10M de Scout y 1M de Maverick no se sostienen en benchmarks de recuperación reales más allá de los 256K tokens. Gemini 1.5/2.5 es la herramienta correcta para tareas genuinas de "aguja en un pajar" en contextos muy largos.

  • Desea una interfaz de chat sin ingeniería: Llama proporciona pesos, no una aplicación. Obtener una interfaz de chat funcional requiere Ollama, llama.cpp o un endpoint alojado por terceros. Los usuarios no técnicos deben usar Claude, Gemini o ChatGPT directamente.

  • Su empresa tiene o espera tener más de 700M de MAU: La estructura de la licencia requiere negociación con Meta por encima de este umbral. Mistral o Qwen bajo Apache 2.0 son estructuralmente más simples para plataformas grandes.

Primeros pasos con Llama

La ruta local más rápida es Ollama: instálelo, ejecute ollama pull llama3.2 para un modelo de 3B en hardware de consumo y acceda a él a través de ollama run llama3.2 o una API local en localhost:11434. Llama 4 Scout requiere una GPU de nivel de servidor; las versiones cuantizadas a través de llama.cpp se ejecutan en máquinas de consumo con alta VRAM. Para el acceso a la API en la nube sin autoalojamiento, Together AI y Fireworks ofrecen Scout a ~$0.08/M de tokens y Maverick a ~$0.15-$0.30/M de tokens. Hugging Face aloja los pesos bajo la organización meta-llama; Transformers v4.51.0+ es compatible con Llama 4 de forma nativa, incluyendo entradas multimodales.

Reseñas de usuarios

Aún no hay reseñas. ¡Sé el primero en compartir tu experiencia!

Inicia sesión para escribir una reseña.

Destacado en colecciones

Listas seleccionadas que incluyen Llama.

Artículos relacionados

Guías y artículos relacionados con Llama.