Ver todos los artículos
modeloscodigo-abiertomultimodaledge-aianalisis

Google Gemma 3: multimodal y abierto, cabe en un Mac Mini

JG
Jacobo González Jaspe
|

Revisado:

Ilustración abstracta: un poliedro de cristal que refracta un haz de luz ámbar en rayos blancos. Modelos
Ilustración generada con IA en nuestra máquina.
Este artículo también está en inglés:Google Gemma 3: Open, Multimodal, and It Fits a Mac Mini

Hasta Gemma 3, si querías un modelo de IA que entendiera texto e imágenes, tenías dos opciones: enviar tus datos a una API en la nube o comprar un servidor con más de 48GB de VRAM. Google cambió esa ecuación en marzo de 2025 con Gemma 3: una familia de modelos abiertos donde incluso la variante de 4B maneja imágenes y texto, corre en un Mac Mini M4 con 16GB y soporta 128K tokens de contexto.

Para pymes europeas que buscan el cumplimiento RGPD y la soberanía de datos, esto es un avance. Es IA multimodal que nunca toca la nube.

Gemma 3 modelo multimodal

Cuatro Tamaños, Una Arquitectura

Gemma 3 viene en cuatro variantes, cada una para un nivel de hardware diferente:

VarianteParámetrosContextoModalidadMemoria (Q4)Mejor Hardware
1B1.000 millones32KSolo texto~1GBJetson Orin Nano, cualquier portátil
4B4.000 millones128KTexto + imágenes~3GBMac Mini M4 16GB
12B12.000 millones128KTexto + imágenes~8GBMac Mini M4 24GB
27B27.000 millones128KTexto + imágenes~16GBMac Mini M4 Pro 32GB+
xychart-beta
    title "Gemma 3 — Memoria vs Capacidad"
    x-axis ["1B (texto)", "4B (vision)", "12B (vision)", "27B (vision)"]
    y-axis "Memoria Q4 (GB)" 0 --> 20
    bar [1, 3, 8, 16]
Diagrama

El salto de 1B a 4B es donde empieza lo multimodal, y 3GB no es nada. Tu teléfono tiene más RAM que eso.

Cómo funciona la visión: SigLIP por dentro

La capacidad multimodal de Gemma 3 viene de un codificador visual SigLIP: un sistema de procesamiento visual que convierte imágenes en secuencias de “tokens suaves” sobre los que el modelo puede razonar junto con el texto.

Una función llamada Pan & Scan (P&S) recorta y redimensiona adaptativamente formatos no estándar, así que no pierdes información al alimentar una foto vertical, un panorama ancho o un documento escaneado.

Qué significa esto en la práctica:

  • Procesamiento de facturas: Sube una foto de una factura → Gemma 3 extrae proveedor, importe, fecha, líneas
  • Inspección de calidad: Alimenta fotos de producto → el modelo identifica defectos, rayaduras, desalineaciones
  • Análisis de documentos: Escanea un contrato firmado → el modelo lee texto, tablas, firmas, sellos
  • Conteo de inventario: Fotografía una estantería → el modelo cuenta artículos e identifica productos

Benchmarks: El 27B da la Talla

La variante de 27B entrega resultados sólidos en razonamiento, matemáticas y fundamentación factual:

BenchmarkGemma 3 27BQué mide
MMLU-Pro67,5Conocimiento avanzado en 57 materias
MATH69,0Razonamiento matemático
GPQA Diamond42,4Preguntas de ciencia nivel posgrado
FACTS Grounding74,9Precisión factual (baja alucinación)
MMMU64,9Comprensión multimodal
LiveCodeBench29,7Tareas de código del mundo real
Bird-SQL54,4Generación SQL desde lenguaje natural

La puntuación de FACTS Grounding (74,9) es particularmente relevante para uso empresarial: significa que el modelo está fuertemente fundamentado en respuestas factuales, no alucinando.

Ejecutar Gemma 3 con Ollama

bash
# 4B — cabe en cualquier sitio, multimodal
ollama pull gemma3:4b

# 12B — mejor calidad, aun cabe en Mac Mini M4
ollama pull gemma3:12b

# 27B — maxima calidad, necesita 32GB+
ollama pull gemma3:27b

# Ejemplo de vision: analizar una factura
ollama run gemma3:4b "Describe el contenido de este documento" --image factura.jpg

Para despliegues en producción, recomendamos empezar con la variante de 4B. Cabe cómodamente en hardware mínimo, soporta la ventana completa de 128K de contexto y maneja bien la mayoría de tareas de visión empresarial. Escala a 12B o 27B cuando la calidad lo justifique.

Dónde encaja Gemma 3 en la familia

CaracterísticaGemma 2 9BGemma 3 27BGemma 4 E4B
VisiónNoSí (SigLIP)Sí
Contexto8K128K128K
Idiomas~10140+140+
Menor multimodalN/A4B (3GB)E2B (4GB)
Mejor paraTareas rápidas de textoVisión + docs largosAsistente general

Gemma 3 llena el hueco entre Gemma 2 (solo texto, rápido, pequeño) y Gemma 4 (última generación, Arena #3). Si necesitas visión a coste mínimo, Gemma 3 4B es imbatible.

Casos de Uso Reales para PYMEs Europeas

Manufactura (inspección visual): Una fábrica de embalajes alimenta imágenes de productos a Gemma 3 4B corriendo en un Jetson Orin Nano. El modelo comprueba alineación de etiquetas, calidad de impresión e integridad de sellos. Los defectos disparan alertas: sin conexión a la nube, sin fotos saliendo de la planta.

Legal (escaneo de documentos): Un bufete escanea documentos entrantes con Gemma 3 12B. El modelo lee notas manuscritas, identifica tipo de contrato, extrae fechas clave y enruta al departamento correcto. Todo el procesamiento ocurre en un Mac Mini bajo el escritorio.

Retail (inventario): Una tienda fotografía estanterías semanalmente. Gemma 3 4B cuenta stock, identifica huecos vacíos y genera sugerencias de reposición. El sistema corre en hardware existente, no cuesta nada por consulta y protege datos de clientes por diseño.

128K de Contexto: Procesa Documentos Completos

El salto de los 8K de Gemma 2 a los 128K de Gemma 3 es transformador. Con 128K tokens, puedes alimentar al modelo:

  • Un contrato completo de 100 páginas (~75.000 palabras)
  • Un catálogo de productos entero
  • Un año de actas de reuniones
  • Una base de código completa para revisión

Sin fragmentación, sin pipeline de RAG, sin pérdida de información. Para documentos que caben en 128K tokens, esto elimina la complejidad de construir un sistema RAG, simplemente le das el documento completo.

La ecuación de privacidad

Cada imagen que alimentas a Gemma 3 se queda en tu hardware. Cuando una clínica procesa escaner de pacientes, cuando una fábrica inspecciona productos, cuando un bufete lee contratos, los datos nunca salen del edificio. Esto no es solo una funcionalidad; bajo la Ley de IA de la UE, es una ventaja de compliance que elimina categorías enteras de riesgo regulatorio.


¿Listo para desplegar IA multimodal localmente? Agenda tu evaluación gratuita de 15 minutos para ver cómo Gemma 3 puede procesar tus documentos e imágenes, privadamente, en tu hardware.

Más reviews de modelos: Mejores LLMs Locales Q2 2026 | Review Gemma 2 | Review Gemma 4 | Review DeepSeek R1


Fuentes: Gemma 3 en HuggingFace | Google DeepMind: Gemma 3 | Gemma 3 Model Card | Informe Técnico Gemma 3 (arXiv)


Lecturas relacionadas

Trabaja con nosotros

Podemos hacer este análisis con tus datos reales antes de recomendar hardware. Una conversación de 30 minutos suele bastar para saber si tiene sentido en tu caso: reserva una llamada o mira cómo trabajamos en consultoría.

Diagrama
Compartir: LinkedIn X
Veredicto semanal

Recibe las guías nuevas antes que nadie

Suscríbete y te avisamos cuando publiquemos guías, plantillas y workflows nuevos. Un correo a la semana, sin spam.

Ya publicados: 66 guías y 25 plantillas. Todo gratis y sin registro.

Bonus: el kit de inicio de IA local en PDF al suscribirte
1x por semana Sin spam Cancela cuando quieras

Ver qué recibes

La Ley de IA de la UE ya aplica: una lista que puedes completar

Cuéntanos qué quieres ejecutar

Dinos qué quieres ejecutar y con qué presupuesto. Te decimos qué hardware necesitas, qué modelo encaja y qué puedes esperar de él, antes de que gastes nada.

Primera llamada gratis, 15 min Local-first: tus datos no salen de tu red Herramientas y guías abiertas

66 guías gratuitas · 17 plantillas de cumplimiento