

Gemma es la familia de modelos de lenguaje de pesos abiertos de Google DeepMind, que se pueden descargar y alojar de forma gratuita. Gemma 4 (abril de 2026) ofrece capacidades de razonamiento y multimodales de vanguardia bajo una licencia Apache 2.0, desde modelos perimetrales (edge) de 2B hasta un modelo insignia denso de 31B.
Gemma es la familia de modelos de lenguaje de pesos abiertos de Google DeepMind, lanzada por primera vez en febrero de 2024 y que ahora se encuentra en su cuarta generación principal. A diferencia de la API cerrada de Gemini, los pesos de Gemma se pueden descargar y alojar de forma local por completo: sin suscripciones, sin límites de uso y, desde Gemma 4 (lanzado el 2 de abril de 2026), sin licencias personalizadas restrictivas. El nombre proviene de "gemstone" (piedra preciosa), con la idea de ser pequeño, preciso y valioso. La familia se sitúa entre los experimentos de aficionados y la inferencia local de nivel de producción, sirviendo a desarrolladores, investigadores y empresas que desean una inteligencia de la clase de Gemini sin depender de la nube.
Gemma 4 se presenta en cuatro tamaños: Effective 2B (E2B, 2.3B de parámetros activos), Effective 4B (E4B, 4.5B), una variante Mixture-of-Experts de 26B que activa 4B de parámetros por pasada hacia adelante (forward pass), y un modelo insignia denso de 31B. Todos los modelos manejan entradas de imagen y video de forma nativa; el E2B y el E4B también admiten entrada de audio a través de un codificador conformer USM, lo que los convierte en los únicos modelos abiertos de menos de 5B con comprensión de audio nativa. Las ventanas de contexto alcanzan los 256K tokens en los modelos más grandes. La familia es multilingüe por diseño, entrenada en más de 140 idiomas y construida sobre la misma base de investigación que Gemini 3. La licencia Apache 2.0 significa que no hay restricciones de MAU, ni requisitos de atribución, ni barreras para la redistribución comercial o el ajuste fino (fine-tuning) para productos de la competencia.
Gemma de un vistazo, abril de 2026
La línea actual de Gemma 4 cubre todo el espectro de implementación, desde la inferencia móvil en el dispositivo hasta estaciones de trabajo con una sola GPU y racks de servidores con múltiples GPU.
Gemma 4 E2B: 2.3B de parámetros efectivos. Contexto: 128K. Multimodal: imagen, video, audio. Orientado a dispositivos móviles y edge a través de MediaPipe/LiteRT. Alcanza ~60 tok/s en una RTX 3070.
Gemma 4 E4B: 4.5B de parámetros efectivos. Contexto: 128K. Misma pila multimodal que el E2B. El "mejor modelo pequeño" recomendado para la inferencia local de escritorio.
Gemma 4 26B-A4B: Mixture-of-Experts, 26B en total, 4B activos por token. Contexto: 256K. Se ejecuta a ~11 tok/s en una RTX 4090 Q4. Alcanza 1441 en LM Arena. 97% de la calidad del modelo denso de 31B con aproximadamente 8 veces menos cómputo por paso de inferencia.
Gemma 4 31B Dense: El modelo insignia. Contexto: 256K. Benchmarks: MMLU Pro 85.2%, AIME 2026 89.2%, GPQA Diamond 84.3%, LiveCodeBench 80.0%. Clasificado en el puesto #3 a nivel mundial en la tabla de clasificación de texto de modelos abiertos de LM Arena a partir de abril de 2026.
La arquitectura introduce Per-Layer Embeddings (PLE): cada token recibe vectores dedicados por capa que combinan la identidad del token con componentes conscientes del contexto en lugar de un único embedding inicial, lo que permite una especialización específica de la capa. Una caché KV compartida (las últimas N capas reutilizan tensores K/V de capas anteriores) reduce la presión de la memoria durante la inferencia de contexto largo. La atención alterna entre capas locales de ventana deslizante (512-1024 tokens) y capas globales de contexto completo, reduciendo el cómputo en entradas largas sin sacrificar la coherencia.
Las generaciones anteriores siguen estando disponibles. Gemma 3 (12 de marzo de 2025) en tamaños de 1B, 4B, 12B y 27B todavía se usa ampliamente para el ajuste fino, y Gemma 2 (2B, 9B, 27B) sigue siendo compatible en Hugging Face. Todas las generaciones están disponibles a través de Ollama, llama.cpp, MLX (Apple Silicon) y Hugging Face Transformers.
En qué es realmente bueno Gemma
Las áreas más fuertes de Gemma 4, respaldadas por benchmarks y pruebas de usuarios, son el razonamiento matemático, la generación de código y la comprensión multimodal. En AIME 2026, el modelo de 31B obtiene un 89.2%, superior a Llama 4 Scout o Qwen 3.5 en la misma clase de parámetros. En Codeforces, alcanza un ELO de 2150, liderando el nivel de 27-31B. El MoE de 26B produce código que los usuarios describen como cualitativamente indistinguible de los modelos de API de pago a una fracción del costo operativo.
"El tipo de calidad que te hace volver a leer la solicitud para comprobar si accidentalmente la enrutaste a través de Claude Sonnet de alguna manera." - PIXIPACE, Medium, abril de 2026
La historia multimodal es real y diferenciada. Todos los modelos de Gemma 4 manejan imágenes de resolución variable con presupuestos de tokens configurables (de 70 a 1120 tokens de visión), salida nativa de cuadros delimitadores (bounding boxes) para la detección de objetos, reconstrucción de HTML a partir de capturas de pantalla y análisis de gráficos. La capacidad de audio en E2B y E4B es única en la clase de menos de 5B. Para los equipos que construyen canales (pipelines) en el dispositivo que procesan entradas habladas junto con imágenes, actualmente no hay ningún modelo de pesos abiertos de la competencia en ese tamaño con la misma cobertura.
"Estoy impresionado, modelos extremadamente inteligentes, inteligencia de vanguardia sin acaparar recursos como los modelos de más de 70 mil millones... Esto iguala el campo de juego y permite que todos los que tienen un sistema medianamente decente tengan acceso a la IA." - DorkMckork1, Hugging Face, abril de 2026
El cambio a la licencia Apache 2.0 que vino con Gemma 4 tiene una importancia práctica: los equipos legales de las grandes empresas tienen Apache 2.0 preaprobada. Los Términos de Uso anteriores de Gemma, aunque razonables en espíritu, tenían excepciones vagas que ponían nerviosos a los departamentos de compras. Esa fricción ha desaparecido.
Dónde falla Gemma: los modos de error que los usuarios siguen encontrando
La queja más persistente es la presión de memoria de la caché KV en contextos más largos. Los usuarios que ejecutan los modelos de 26B o 31B a más de 40K tokens en 24GB de VRAM informan de bloqueos por falta de memoria y degradación de la calidad a medida que crece la caché. La arquitectura de caché KV compartida es eficiente en teoría, pero implacable cuando un modelo cuantizado grande llena la memoria disponible. Una solución alternativa (cuantización de la caché KV a Q4) ayuda, pero añade una sobrecarga de configuración.
La sobrecarga de enrutamiento del MoE es una sorpresa práctica. A pesar de activar solo 4B de parámetros por pasada hacia adelante, el MoE de 26B-A4B se ejecuta a aproximadamente 11 tokens/seg en una RTX 4090 Q4, más lento que el equivalente de Qwen 3.5 a unos 35 tok/s. Los usuarios que esperan una "velocidad de 4B" de un MoE de 26B a menudo se sienten decepcionados. Para aplicaciones sensibles a la latencia, el modelo denso de 31B o un modelo más pequeño es una mejor opción.
La fragilidad del ecosistema de inferencia en el lanzamiento es un patrón recurrente en Gemma. El lanzamiento de Gemma 4 el 2 de abril de 2026 estuvo acompañado de: salida incomprensible después de ~230 tokens con -nkvo habilitado en llama.cpp (problema de GitHub #21726), llamadas a herramientas rotas en Ollama v0.20.0, bloqueos de Flash Attention en prompts de Apple Silicon más allá de 500 tokens, y fallos con "arquitectura de modelo desconocida: 'gemma4'" en contenedores sin parchear. El modelo tuvo que ser resubido a Hugging Face cuatro veces a medida que llegaban las correcciones. La comunidad se decidió por un mensaje claro: esperar al menos una semana antes de juzgar la calidad de un nuevo lanzamiento de Gemma a través de una pila de inferencia inestable.
El OCR de visión en texto denso es inconsistente. Un hilo de discusión de Hugging Face sobre el modelo Gemma 4 31B-it señaló que el modelo "no puede reconocer todo el texto en la imagen" de manera confiable. El análisis de gráficos es más fuerte que el OCR de documentos. La precisión básica de recuperación de hechos se documentó como débil en Gemma 3 (puntuación SimpleQA de 10.0); Gemma 4 mejoró sustancialmente, pero la familia no sobresale en consultas de estilo de búsqueda memorística sin generación aumentada por recuperación (RAG).
Una voz crítica en Hugging Face de la semana de lanzamiento capturó una frustración real:
"Un lanzamiento algo decepcionante, en mi opinión... Solo desearía que las empresas tecnológicas más grandes tomaran ejemplo de OpenAI y lanzaran OSS realmente competitivo en lugar de sacar modelos genéricos..." - urroxyz, Hugging Face, abril de 2026
Esa crítica exagera el caso. Los benchmarks no son genéricos. Pero refleja a un segmento de la comunidad local de IA que encuentra a Gemma menos diferenciado de lo que les gustaría para flujos de trabajo específicos de agentes y llamadas a herramientas.
Gemma vs. Llama 4 vs. Qwen 3.5
Llama 4 (Meta) utiliza una arquitectura exclusivamente MoE a una escala diferente: Scout tiene 109B de parámetros en total con 17B activos por token; Maverick tiene 400B en total con 17B activos. La ventana de contexto de 10M de tokens de Scout es su principal diferenciador (Gemma 4 alcanza un máximo de 256K). Sin embargo, la licencia comunitaria personalizada de Llama 4 impone un límite de 700M de MAU, requiere la marca "Built with Llama" y prohíbe el uso de las salidas de Llama para entrenar modelos de la competencia. Para los equipos empresariales que envían productos comerciales, esta licencia requiere una revisión legal dedicada. La licencia Apache 2.0 de Gemma 4 no tiene tales condiciones. En los benchmarks, Gemma 4 31B supera a Llama 4 Scout en GPQA Diamond (84.3% frente a 74.3%), AIME 2026 y codificación. Llama 4 no tiene soporte de audio nativo; los modelos E2B/E4B de Gemma sí. Para necesidades de contexto en bruto superiores a 256K, Llama 4 Scout es la única opción en el nivel de pesos abiertos.
Qwen 3.5 (Alibaba) también se distribuye bajo Apache 2.0 y ofrece el espectro de modelos más amplio (de 0.8B a 397B MoE), con el 35B-A3B activando solo 3B de parámetros por token, la proporción de dispersión (sparsity) más agresiva en el nivel. Qwen 3.5 se ejecuta aproximadamente 3 veces más rápido que Gemma 4 31B denso en hardware equivalente (35 tok/s frente a 25 tok/s en RTX 4090 Q4). MMLU Pro favorece ligeramente a Qwen (86.1% frente a 85.2%). Ventajas clave de Gemma: entrada de audio en modelos pequeños, arquitectura de embedding por capa para una mejor coherencia de contexto largo, integración más estrecha con el ecosistema de Gemini (AI Studio, Vertex AI) y una gama más amplia de objetivos de implementación, incluidos MediaPipe/LiteRT para dispositivos. Ambos son genuinamente fuertes; la elección práctica a menudo se reduce a si necesita entrada de audio o un rendimiento de MoE más rápido.
El lanzamiento de Gemma 3 el 12 de marzo de 2025 fue el punto de inflexión. El modelo de 27B superó al modelo cerrado Gemini 1.5 Pro en todos los benchmarks, y el de 4B superó a todo el modelo de 27B de Gemma 2. LMSys colocó a Gemma 3 27B en el top 10 mundial. Eso estableció la credibilidad de la familia y marcó la trayectoria para el posicionamiento más agresivo de Gemma 4.
¿Vale la pena el nivel de pago?
No hay suscripción de pago para Gemma. Los pesos son gratuitos bajo Apache 2.0. La cuestión del costo se trata puramente de la elección de la infraestructura. El alojamiento propio es gratuito más allá del hardware (el MoE de 26B cabe en 16GB de VRAM en Q4; el de 31B necesita 24GB). Google AI Studio proporciona acceso gratuito a la API con límite de velocidad. OpenRouter enruta el modelo de 31B a $0/M tokens en su nivel gratuito, $0.13/$0.38 por millón de entrada/salida en el estándar. Vertex AI cuesta $0.15/$0.60 por millón para el MoE de 26B y es la opción correcta para los equipos que necesitan SLA gestionados y consolidación de facturación de GCP. Para la mayoría de los desarrolladores, Google AI Studio o el alojamiento propio cubren todo hasta que la escala de producción exija una infraestructura gestionada.
Mejores casos de uso (y cuándo omitirlo)
Mejores opciones:
Inferencia local en hardware de consumo sin costos de API en la nube. El MoE de 4B o 26B cubre la mayoría de las tareas de codificación y asistencia.
Aplicaciones móviles y edge en el dispositivo que requieren entrada multimodal (imágenes, audio, video) sin dependencia de la nube. Solo Gemma ofrece modelos de menos de 5B con entrada de audio nativa.
Ajuste fino (fine-tuning) para dominios especializados. Las integraciones de Unsloth y TRL admiten el ajuste fino multimodal con ejemplos de agentes al estilo CARLA. Un comentarista de Hugging Face señaló que "se adapta exactamente a nuestro dominio de educación infantil" y lo puso inmediatamente en producción.
Equipos empresariales que necesitan una licencia permisiva y legalmente preaprobada (Apache 2.0) y desean inteligencia con la calidad de Google sin los precios de la nube de Google.
Aplicaciones de asistentes multilingües en más de 140 idiomas donde la calidad de los datos de entrenamiento en la tokenización específica del idioma es importante.
Omítalo cuando:
Necesite contexto más allá de 256K tokens. Llama 4 Scout maneja hasta 10M.
La velocidad de inferencia en bruto sea la máxima prioridad. Qwen 3.5 se ejecuta más rápido en hardware equivalente y ofrece tamaños de modelo iniciales más pequeños (0.8B).
Necesite implementar dentro de la primera semana de un lanzamiento importante de Gemma y no pueda tolerar la inestabilidad del ecosistema de inferencia. El patrón de errores en la semana de lanzamiento es consistente en todas las generaciones.
Su caso de uso sea principalmente el OCR de documentos en texto denso. Las capacidades de visión son más fuertes en gráficos y comprensión de GUI que en el reconocimiento de páginas densas en texto.
Primeros pasos con Gemma
La ruta local más rápida es Ollama: ollama run gemma4 extrae el tamaño predeterminado automáticamente. Para Apple Silicon, MLX supera a Ollama en rendimiento. Para el control de cuantización, use llama.cpp con compilaciones GGUF de ggml-org desde Hugging Face. Google AI Studio (ai.google.dev) ofrece acceso gratuito a la API sin ninguna infraestructura. OpenRouter enruta al modelo de 31B a costo cero en su nivel gratuito. El ajuste fino está cubierto por Unsloth Studio, TRL y los contenedores gestionados de Vertex AI. Los tokens de llamada a funciones nativas del modelo funcionan con esquemas JSON o funciones de Python tipadas directamente.
Reseñas de usuarios
Aún no hay reseñas. ¡Sé el primero en compartir tu experiencia!
Inicia sesión para escribir una reseña.
Destacado en colecciones
Listas seleccionadas que incluyen Gemma.
Artículos relacionados
Guías y artículos relacionados con Gemma.

Gemma 4 on RTX 4090: Real Tokens/Sec, VRAM & Variant Pick (2026)

Nous Hermes 4: The Self-Hosted Open-Weight Agent Brain (2026)

Mistral Medium 3.5 Self Host: 77.6% SWE-Bench on 4 GPUs (2026)

Run Open Source AI Models Locally: Battle-Tested Guide

Grok 4.3 API for Agents (May 2026): Pricing, Benchmarks, Migration
