Hace unas semanas publicamos nuestro análisis de Gemma 2 9B y lo llamamos el mejor modelo pequeño para IA empresarial europea. Lo decíamos en serio. Ejecutaba nuestras tareas de planificación, cabía en hardware modesto y seguía instrucciones con una fiabilidad sorprendente. Luego Google anunció Gemma 4 el 2 de abril de 2026 y convirtió a Gemma 2 en un borrador.
Esta es la familia de modelos que estábamos esperando. No es perfecta, pero cierra la brecha entre lo que los modelos abiertos pequeños pueden hacer y lo que las empresas necesitan. Reemplazamos Gemma 2 en producción en 48 horas. Aquí está lo que pasó, lo que nos impresionó y dónde están los límites.

Cuatro Variantes, Cuatro Casos de Uso
Gemma 4 no es un modelo único. Es una familia de cuatro, cada uno diseñado para un nivel diferente de hardware y carga de trabajo. Esto es Google haciendo lo que mejor sabe: escalar una sola arquitectura a través de presupuestos de recursos radicalmente distintos.
| Variante | Params Totales | Efectivos / Activos | Contexto | Audio | Tamaño Ollama | Ranking Arena AI |
|---|---|---|---|---|---|---|
| E2B | 5,1B (con embeddings) | 2,3B efectivos | 128K | Si | 7,2 GB | — |
| E4B | 8B (con embeddings) | 4,5B efectivos | 128K | Si | 9,6 GB | — |
| 26B MoE | 25,2B total | 3,8B activos (8 de 128 expertos + 1 compartido) | 256K | No | 19 GB | #6 abierto |
| 31B Dense | 30,7B | 30,7B (todo denso) | 256K | No | 20 GB | #3 abierto |
Las variantes E2B y E4B son multimodales: aceptan texto, imágenes y audio como entrada y producen texto. Las 26B y 31B manejan texto e imágenes solamente. Las cuatro se preentrenaron en más de 140 idiomas y soportan modos de razonamiento configurables, llamadas a funciones nativas, salida JSON estructurada e instrucciones de sistema.
xychart-beta
title "Gemma 4 Variants — Parameters vs Memory"
x-axis ["E2B (2.3B)", "E4B (4B)", "26B MoE", "31B Dense"]
y-axis "Memory Required (GB)" 0 --> 25
bar [7.2, 9.6, 19, 20]Ese modelo 31B Dense en el puesto #3 del ranking Arena AI entre todos los modelos abiertos del mundo no es una errata. La variante 26B MoE ocupa el puesto #6. La afirmacion de Google de que Gemma 4 “supera a modelos 20 veces su tamaño” suena a marketing hasta que ves los benchmarks.
Como Ejecutar Cada Variante con Ollama
Empezar requiere un solo comando por variante. Los tamaños son las descargas Q4_K_M por defecto de la biblioteca de Ollama:
# E2B — ultraligero, nuestro motor de planificacion
ollama pull gemma4:e2b
# E4B — carga media, contenido y briefings
ollama pull gemma4:e4b
# 26B MoE — razonamiento pesado con activacion dispersa
ollama pull gemma4:26b
# 31B Dense — maxima calidad, necesita hardware potente
ollama pull gemma4:31bEl E2B descarga 7,2 GB y el E4B 9,6 GB: ambos caben en una máquina de 16 GB, el E4B con poco margen, y van cómodos en 32 GB. Las variantes 26B y 31B necesitan 19-20 GB de VRAM o memoria unificada, lo que las coloca en territorio de Mac Studio o GPU dedicada. Para orientación sobre hardware, consulta nuestra guía de hardware para IA edge.
Lo Que Ejecutamos en Producción
En VORLUX AI, ejecutamos Gemma 4 E2B y E4B en un Mac Mini M4 como parte de nuestra infraestructura de IA local. Así encajan:
Gemma 4 E2B es nuestro modelo principal de planificación. Gestiona 58 trabajos del orquestador: enrutamiento de tareas, actualizaciones de estado, clasificación ligera y salidas JSON estructuradas para agentes posteriores. Con 2,3B parámetros efectivos, es absurdamente rápido. Los tiempos de respuesta promedian menos de 800ms para prompts tipicos de planificación. Reemplazo a Gemma 2 9B para estas tareas.
Gemma 4 E4B es nuestro modelo de carga media para briefings, redacción de contenido y análisis de varios pasos. Cuando una tarea necesita más razonamiento del que E2B puede ofrecer pero no justifica un modelo de 26B+, E4B se encarga. La ventana de contexto de 128K significa que podemos alimentarlo con documentos completos sin fragmentarlos.
El Mac Mini M4 ejecuta ambos simultaneamente con margen de sobra. Esto habria sido impensable hace un año.
Lo Que Gemma 4 Hace Excepcionalmente Bien
Llamadas a funciones y salida estructurada. Soporte nativo, no añadido como parche. Le pasamos a Gemma 4 un esquema de herramientas y devuelve llamadas a funciones en JSON válido de forma consistente. Esto importa enormemente para la orquestacion de agentes, se acabaron los regex para parsear texto libre.
Seguimiento de instrucciones. Los modos de razonamiento configurables nos permiten alternar entre respuestas rápidas (pensamiento desactivado) y razonamiento deliberado (pensamiento activado) por solicitud. Para planificación, desactivamos el pensamiento. Para análisis de contenido, lo activamos.
Rendimiento multilingüe. Con más de 140 idiomas, nuestros flujos de trabajo en castellano e inglés funcionan sobre el mismo modelo sin fine-tuning. Para una consultora con sede en Valencia que atiende PYMEs españolas, esto no es un extra, es esencial.
Entrada de audio en E2B/E4B. Aun no lo hemos desplegado en producción, pero la capacidad de procesar audio de forma nativa abre puertas para transcripción de reuniones, flujos de trabajo por voz y funciones de accesibilidad sin necesitar un pipeline separado de speech-to-text.
Donde Se Queda Corto: Límites Honestos
Razonamiento profundo y código complejo. Para demostraciones matemáticas de varios pasos o desafios de programación competitiva, Gemma 4 31B es fuerte pero sigue detrás de Llama 3.3 70B y Qwen 2.5 72B Coder. Si tu carga de trabajo principal es generación de código, Qwen sigue siendo la mejor opción especializada. Gemma 4 es un generalista que programa bien, no es un especialista en código.
El trade-off del 26B MoE. La arquitectura Mixture-of-Experts es brillante para eficiencia, solo 3,8B de los 25,2B parámetros se activan por token. Pero los modelos MoE pueden ser impredecibles en tareas que caen entre las fronteras de los expertos. Hemos visto inconsistencia ocasional en tareas hibridas que el 31B Dense resuelve limpiamente.
Solo salida de texto. Gemma 4 puede entender imágenes (y, en E2B/E4B, audio) como entrada, pero solo genera texto. Si necesitas generación de imágenes o síntesis de audio, sigues necesitando modelos separados.
Presión de VRAM en las variantes grandes. El 31B Dense a 20 GB queda justo en un Mac de 32 GB. Ejecutarlo junto a otros modelos requiere gestión cuidadosa de memoria. Consulta nuestra comparativa de modelos Q2 2026 para presupuestos de VRAM lado a lado.
Gemma 4 vs Gemma 2: Merece la Pena Actualizar?
Sin ninguna duda. Solo el E2B hace redundante a Gemma 2 9B para la mayoría de tareas de planificación y clasificación, es más rápido, más pequeño y más capaz. La ventana de contexto de 128K (frente a 8K en Gemma 2) elimina los workarounds de fragmentacion que necesitabamos. El soporte de llamadas a funciones significo que borramos cientos de líneas de código de parseo de salida. Y la calidad multilingüe paso de “funcional” a “genuinamente buena.”
Si actualmente ejecutas Gemma 2, la ruta de migración es directa: descarga el modelo nuevo, prueba tus prompts y cambia. Nosotros lo hicimos en un fin de semana.
Quien Debería Usar Cada Variante?
- E2B: Dispositivos edge, planificación, clasificación, IoT, móvil. Todo donde la velocidad y el tamaño importan más que la profundidad.
- E4B: Estaciones de trabajo PYME, generación de contenido, briefings, soporte al cliente. El punto óptimo para la mayoría de casos de uso empresariales.
- 26B MoE: Investigacion, análisis, procesamiento de documentos largos. Ideal cuando necesitas 256K de contexto pero quieres mantener la memoria razonable.
- 31B Dense: Máxima calidad en tareas exigentes. Traducción, análisis complejo, razonamiento multi-turno. Merece la pena si tienes el hardware.
Lecturas relacionadas
- IA en la Nube vs Local: Análisis Real de Costes para PYMEs Españolas en 2026
- Llama 4 Scout y Maverick: Análisis Práctico para Despliegue Local de IA
- AESIA: Lo Que Toda Empresa Española que Usa IA Debe Saber en 2026
Como Empezar
Gemma 4 esta disponible ahora en Ollama y el anuncio oficial de Google tiene los detalles técnicos completos. Todas las variantes se publican bajo la licencia Apache 2.0, que permite uso comercial.
Nota: el 3 de junio de 2026 Google anadio un quinto tamaño, Gemma 4 12B Unified, con entrada de audio nativa. No lo cubre este análisis.
Si quieres ayuda desplegando Gemma 4 en tu propio hardware (ya sea un Mac Mini o una flota de dispositivos edge) eso es exactamente lo que hacemos. Construimos sistemas de IA local para organizaciones europeas que mantienen los datos en las instalaciones y los costes predecibles. Consulta nuestros servicios o contáctanos para una consulta gratuita.
La era de necesitar presupuestos masivos en la nube para IA capaz esta terminando. Gemma 4 es la prueba.
Siguientes pasos
- Prueba los comandos de descarga en tu propia máquina usando la biblioteca de Ollama.
- Evalúa la capacidad de Gemma 4 E2B para tus tareas de planificación y clasificación.
- Compara el rendimiento de las variantes con nuestro análisis de modelos locales.
- Revisa si necesitas actualizar tu infraestructura actual tras ver los límites de razonamiento profundo.
Trabaja con nosotros
Podemos hacer este análisis con tus datos reales antes de recomendar hardware. Una conversación de 30 minutos suele bastar para saber si tiene sentido en tu caso: reserva una llamada o mira cómo trabajamos en consultoría.