Hasta Gemma 3, si querías un modelo de IA que entendiera texto e imágenes, tenías dos opciones: enviar tus datos a una API en la nube o comprar un servidor con más de 48GB de VRAM. Google cambió esa ecuación en marzo de 2025 con Gemma 3: una familia de modelos abiertos donde incluso la variante de 4B maneja imágenes y texto, corre en un Mac Mini M4 con 16GB y soporta 128K tokens de contexto.
Para pymes europeas que buscan el cumplimiento RGPD y la soberanía de datos, esto es un avance. Es IA multimodal que nunca toca la nube.

Cuatro Tamaños, Una Arquitectura
Gemma 3 viene en cuatro variantes, cada una para un nivel de hardware diferente:
| Variante | Parámetros | Contexto | Modalidad | Memoria (Q4) | Mejor Hardware |
|---|---|---|---|---|---|
| 1B | 1.000 millones | 32K | Solo texto | ~1GB | Jetson Orin Nano, cualquier portátil |
| 4B | 4.000 millones | 128K | Texto + imágenes | ~3GB | Mac Mini M4 16GB |
| 12B | 12.000 millones | 128K | Texto + imágenes | ~8GB | Mac Mini M4 24GB |
| 27B | 27.000 millones | 128K | Texto + imágenes | ~16GB | Mac Mini M4 Pro 32GB+ |
xychart-beta
title "Gemma 3 — Memoria vs Capacidad"
x-axis ["1B (texto)", "4B (vision)", "12B (vision)", "27B (vision)"]
y-axis "Memoria Q4 (GB)" 0 --> 20
bar [1, 3, 8, 16]El salto de 1B a 4B es donde empieza lo multimodal, y 3GB no es nada. Tu teléfono tiene más RAM que eso.
Cómo funciona la visión: SigLIP por dentro
La capacidad multimodal de Gemma 3 viene de un codificador visual SigLIP: un sistema de procesamiento visual que convierte imágenes en secuencias de “tokens suaves” sobre los que el modelo puede razonar junto con el texto.
Una función llamada Pan & Scan (P&S) recorta y redimensiona adaptativamente formatos no estándar, así que no pierdes información al alimentar una foto vertical, un panorama ancho o un documento escaneado.
Qué significa esto en la práctica:
- Procesamiento de facturas: Sube una foto de una factura → Gemma 3 extrae proveedor, importe, fecha, líneas
- Inspección de calidad: Alimenta fotos de producto → el modelo identifica defectos, rayaduras, desalineaciones
- Análisis de documentos: Escanea un contrato firmado → el modelo lee texto, tablas, firmas, sellos
- Conteo de inventario: Fotografía una estantería → el modelo cuenta artículos e identifica productos
Benchmarks: El 27B da la Talla
La variante de 27B entrega resultados sólidos en razonamiento, matemáticas y fundamentación factual:
| Benchmark | Gemma 3 27B | Qué mide |
|---|---|---|
| MMLU-Pro | 67,5 | Conocimiento avanzado en 57 materias |
| MATH | 69,0 | Razonamiento matemático |
| GPQA Diamond | 42,4 | Preguntas de ciencia nivel posgrado |
| FACTS Grounding | 74,9 | Precisión factual (baja alucinación) |
| MMMU | 64,9 | Comprensión multimodal |
| LiveCodeBench | 29,7 | Tareas de código del mundo real |
| Bird-SQL | 54,4 | Generación SQL desde lenguaje natural |
La puntuación de FACTS Grounding (74,9) es particularmente relevante para uso empresarial: significa que el modelo está fuertemente fundamentado en respuestas factuales, no alucinando.
Ejecutar Gemma 3 con Ollama
# 4B — cabe en cualquier sitio, multimodal
ollama pull gemma3:4b
# 12B — mejor calidad, aun cabe en Mac Mini M4
ollama pull gemma3:12b
# 27B — maxima calidad, necesita 32GB+
ollama pull gemma3:27b
# Ejemplo de vision: analizar una factura
ollama run gemma3:4b "Describe el contenido de este documento" --image factura.jpgPara despliegues en producción, recomendamos empezar con la variante de 4B. Cabe cómodamente en hardware mínimo, soporta la ventana completa de 128K de contexto y maneja bien la mayoría de tareas de visión empresarial. Escala a 12B o 27B cuando la calidad lo justifique.
Dónde encaja Gemma 3 en la familia
| Característica | Gemma 2 9B | Gemma 3 27B | Gemma 4 E4B |
|---|---|---|---|
| Visión | No | Sí (SigLIP) | Sí |
| Contexto | 8K | 128K | 128K |
| Idiomas | ~10 | 140+ | 140+ |
| Menor multimodal | N/A | 4B (3GB) | E2B (4GB) |
| Mejor para | Tareas rápidas de texto | Visión + docs largos | Asistente general |
Gemma 3 llena el hueco entre Gemma 2 (solo texto, rápido, pequeño) y Gemma 4 (última generación, Arena #3). Si necesitas visión a coste mínimo, Gemma 3 4B es imbatible.
Casos de Uso Reales para PYMEs Europeas
Manufactura (inspección visual): Una fábrica de embalajes alimenta imágenes de productos a Gemma 3 4B corriendo en un Jetson Orin Nano. El modelo comprueba alineación de etiquetas, calidad de impresión e integridad de sellos. Los defectos disparan alertas: sin conexión a la nube, sin fotos saliendo de la planta.
Legal (escaneo de documentos): Un bufete escanea documentos entrantes con Gemma 3 12B. El modelo lee notas manuscritas, identifica tipo de contrato, extrae fechas clave y enruta al departamento correcto. Todo el procesamiento ocurre en un Mac Mini bajo el escritorio.
Retail (inventario): Una tienda fotografía estanterías semanalmente. Gemma 3 4B cuenta stock, identifica huecos vacíos y genera sugerencias de reposición. El sistema corre en hardware existente, no cuesta nada por consulta y protege datos de clientes por diseño.
128K de Contexto: Procesa Documentos Completos
El salto de los 8K de Gemma 2 a los 128K de Gemma 3 es transformador. Con 128K tokens, puedes alimentar al modelo:
- Un contrato completo de 100 páginas (~75.000 palabras)
- Un catálogo de productos entero
- Un año de actas de reuniones
- Una base de código completa para revisión
Sin fragmentación, sin pipeline de RAG, sin pérdida de información. Para documentos que caben en 128K tokens, esto elimina la complejidad de construir un sistema RAG, simplemente le das el documento completo.
La ecuación de privacidad
Cada imagen que alimentas a Gemma 3 se queda en tu hardware. Cuando una clínica procesa escaner de pacientes, cuando una fábrica inspecciona productos, cuando un bufete lee contratos, los datos nunca salen del edificio. Esto no es solo una funcionalidad; bajo la Ley de IA de la UE, es una ventaja de compliance que elimina categorías enteras de riesgo regulatorio.
¿Listo para desplegar IA multimodal localmente? Agenda tu evaluación gratuita de 15 minutos para ver cómo Gemma 3 puede procesar tus documentos e imágenes, privadamente, en tu hardware.
Más reviews de modelos: Mejores LLMs Locales Q2 2026 | Review Gemma 2 | Review Gemma 4 | Review DeepSeek R1
Fuentes: Gemma 3 en HuggingFace | Google DeepMind: Gemma 3 | Gemma 3 Model Card | Informe Técnico Gemma 3 (arXiv)
Lecturas relacionadas
- NVIDIA Releases AITune: An Open-Source Inference Toolkit That Automatically Finds the Fastest Inference Backend for Any PyTorch Model, Resumen en Español
- Construye un Pipeline RAG Local con n8n y Ollama: Consulta los Documentos de tu Empresa con IA
- Automatiza la revisión de código con IA: Tutorial n8n + Ollama
Trabaja con nosotros
Podemos hacer este análisis con tus datos reales antes de recomendar hardware. Una conversación de 30 minutos suele bastar para saber si tiene sentido en tu caso: reserva una llamada o mira cómo trabajamos en consultoría.