El panorama de modelos open-source ha cambiado mucho en tres meses. Qwen 3 trajo MoE al alcance de todos, Gemma 4 subió la calidad de los modelos pequeños y Llama 4 Scout rompió el techo de la ventana de contexto. Así se comparan para despliegue local y cuál deberías elegir.

flowchart TD
START["Cual es tu tarea principal?"] --> CODE{"Generacion\nde codigo?"}
START --> OFFICE{"Asistente de oficina\n(emails, docs, Q&A)?"}
START --> REASON{"Razonamiento complejo\no matematicas?"}
START --> DOCS{"Documentos masivos\n(contratos, papers)?"}
START --> QUALITY{"Maxima calidad\n(sin limites de hardware)?"}
CODE -->|Si| CODER["Qwen 2.5 Coder 7B\n4.7 GB descarga"]
OFFICE --> LANG{"Necesitas multilingue\n(espanol, etc.)?"}
LANG -->|Si| QWEN["Qwen 3 8B\n5.2 GB descarga"]
LANG -->|No| GEMMA["Gemma 4 E4B\n9,5 GB descarga"]
REASON -->|Si| PHI["Phi-4 14B\n9.1 GB descarga"]
DOCS -->|Si| LLAMA["Llama 4 Scout 109B\n67 GB descarga — Contexto 10M"]
QUALITY -->|Si| DS["DeepSeek V3 671B\n404 GB descarga"]
style START fill:#DBEAFE,stroke:#2563EB,color:#000
style CODER fill:#D1FAE5,stroke:#059669,color:#000
style QWEN fill:#D1FAE5,stroke:#059669,color:#000
style GEMMA fill:#D1FAE5,stroke:#059669,color:#000
style PHI fill:#FEF3C7,stroke:#F5A623,color:#000
style LLAMA fill:#FECACA,stroke:#B91C1C,color:#000
style DS fill:#FECACA,stroke:#B91C1C,color:#000Los Contendientes
| Modelo | Parámetros | Descarga Ollama (Q4) | Fortaleza |
|---|---|---|---|
| Qwen 3 8B | 8B | 5,2 GB | Multilingüe: 119 idiomas y dialectos según el equipo de Qwen |
| Gemma 4 E4B | ~4B efectivos | 9,5 GB | Buena calidad para su tamaño; texto, imagen y audio |
| Phi-4 | 14B | 9,1 GB | Razonamiento y matemáticas (benchmarks de Microsoft) |
| Llama 4 Scout | 109B (17B activos) | 67 GB | 10M tokens de contexto (cifra de Meta) |
| DeepSeek V3 | 671B (37B activos) | 404 GB | Modelo abierto de nivel frontera; necesita un servidor |
| Qwen 2.5 Coder 7B | 7,6B | 4,7 GB | Generación de código |
Los tamaños son los de las etiquetas por defecto de la biblioteca de Ollama. Suma memoria para la ventana de contexto y el sistema operativo. La velocidad depende de tu hardware: mídela con ollama run <modelo> --verbose. Hasta Phi-4, todo corre en un Mac mini de 24 GB; Llama 4 Scout necesita un equipo de 96-128 GB y DeepSeek V3 un servidor con varias GPU.
Nuestra Recomendación por Caso de Uso
Para asistente de oficina en PYME española
Ganador: Qwen 3 8B
Por qué: buen soporte en español (el equipo de Qwen indica 119 idiomas y dialectos), descarga de 5,2 GB que corre cómodamente en 24GB, licencia Apache 2.0 para uso comercial. Maneja redacción de emails, atención al cliente, resúmenes de documentos y consultas internas sin problemas.
ollama pull qwen3:8bPara generación de código y trabajo técnico
Ganador: Qwen 2.5 Coder 7B
Por qué: construido específicamente para código, descarga de 4,7GB. Maneja Python, JavaScript, TypeScript, SQL y muchos otros lenguajes. Lo medimos en nuestro análisis práctico.
ollama pull qwen2.5-coder:7bPara razonamiento complejo y análisis
Ganador: Phi-4 (14B)
Por qué: Phi-4 de Microsoft rinde muy por encima de su tamaño: 80,4% en MATH según los benchmarks de Microsoft, por delante del 66,3% de Llama 3.3 70B en la misma tabla. Necesita 16 GB de RAM y razona bien para documentos de estrategia, análisis legal y modelado financiero.
ollama pull phi4Alternativa: DeepSeek R1 14B (destilado). El informe técnico de DeepSeek da a la versión destilada de 14B un 93,9% en MATH-500 (97,3% para el R1 completo). Es una descarga de 9 GB y muestra su razonamiento paso a paso, más lento pero más fácil de revisar.
ollama pull deepseek-r1:14bPara calidad máxima (si tienes un servidor)
Ganador: DeepSeek V3
Arquitectura MoE que activa solo 37B de 671B parámetros por token, así que genera más rápido de lo que sugiere su tamaño. Pero los 671B parámetros deben estar en memoria: solo la descarga Q4 ocupa 404 GB, lo que exige un servidor con varias GPU o un equipo con 512 GB de memoria unificada.
Para documentos masivos (contratos, papers)
Ganador: Llama 4 Scout
Meta lo anuncia con 10 millones de tokens de contexto. En la práctica, la memoria de un contexto largo se suma a los 67 GB del modelo, así que en local trabajarás con contextos mucho más cortos. Necesita un equipo de 96-128 GB.
Requisitos de Hardware
| Tu Hardware | Mejor Modelo | Qué Puedes Hacer |
|---|---|---|
| 8GB RAM (Jetson Orin Nano) | Qwen 2.5 3B | QA básico, clasificación |
| 24GB RAM (Mac Mini M4) | Qwen 3 8B o Gemma 4 E4B | Asistente completo de oficina |
| 48GB RAM (Mac Mini M4 Pro) | Phi-4 14B o Gemma 4 26B | Razonamiento complejo |
| 128GB RAM (DGX Spark / Jetson AGX Thor) | Llama 4 Scout 109B | Nivel enterprise |
Lecturas relacionadas
- SLM vs LLM: Por Qué los Modelos Pequeños Están Ganando la IA Empresarial en 2026
- AESIA: Lo Que Toda Empresa Española que Usa IA Debe Saber en 2026
Consejo para Empezar
Si es tu primer despliegue local, empieza con Ollama: gestiona descarga, cuantización y servicio en un solo comando. Instálalo desde ollama.com, luego ejecuta ollama pull qwen3:8b. En cinco minutos tendrás un modelo listo respondiendo consultas en localhost:11434. Desde ahí, conéctalo a n8n para automatización de flujos o construye un pipeline RAG sencillo para tus documentos internos.
Conclusión
Para un asistente de oficina típico de una PYME, Qwen 3 8B en un Mac Mini M4 es el punto óptimo: un coste único de hardware más electricidad, sin pago por consulta. Que salga más barato que una API cloud depende de tu volumen; nuestro análisis de costes explica cómo calcularlo.
Para tareas empresariales rutinarias, la distancia entre modelos locales y cloud ya es lo bastante pequeña como para que el control de los datos y el coste fijo suelan decidir. Prueba antes con tus propios documentos.
Recursos relacionados
- Catálogo de 50 Modelos IA: todos los modelos con VRAM y comandos
- Catálogo de Hardware: 17 dispositivos desde EUR 200
- Stack de Software: Ollama, MLX y más
- Calculadora ROI: compara costes local vs cloud
- Contacto: necesitas ayuda eligiendo?
Fuentes: Biblioteca de Ollama · Anuncio de Qwen3 · Ficha de Phi-4 · Informe técnico de DeepSeek-R1
Trabaja con nosotros
Podemos hacer este análisis con tus datos reales antes de recomendar hardware. Una conversación de 30 minutos suele bastar para saber si tiene sentido en tu caso: reserva una llamada o mira cómo trabajamos en consultoría.