Al terminar sabrás qué modelo descargar para tu tarea y tu memoria, y cómo comprobarlo con tus propios números en diez minutos. Empieza en cualquier portátil con 8 GB de RAM. La regla de fondo es simple: el modelo más pequeño que hace bien el trabajo.
Última revisión: 6 de octubre de 2026. Tamaños tomados de la biblioteca de Ollama ese día; velocidades medidas en nuestra NVIDIA DGX Spark. Revisamos esta tabla cuando cambia un modelo de la lista.
Qué necesitas
- Un ordenador con 8 GB de memoria o más. Una GPU ayuda, pero no es obligatoria.
- Ollama instalado. Es gratis y no pide cuenta.
- Diez prompts reales de tu trabajo, guardados en un archivo de texto.
- Entre 2 y 20 GB de disco libre, según la columna que elijas.
Paso 1: averigua cuánta memoria puede usar el modelo
El número que cuenta es la memoria a la que llega el modelo. En un Mac o en un portátil sin GPU es la RAM total, porque se comparte. En un PC con tarjeta gráfica es la VRAM de la tarjeta.
# Linux con GPU NVIDIA: VRAM total
nvidia-smi --query-gpu=memory.total --format=csv
# macOS: memoria unificada en bytes
sysctl hw.memsizeCon memoria compartida, el sistema operativo se queda una parte. Nuestro explorador de VRAM reserva 3 GB en equipos de hasta 16 GB, 4 GB hasta 32 GB y 6 GB por encima. Un portátil de 8 GB deja unos 5 GB para el modelo.
Paso 2: elige en la tabla
Cada celda da la etiqueta para ollama pull y el tamaño de descarga que muestra su página en la biblioteca de Ollama. Donde aparece un rango, Ollama sirve archivos distintos según la plataforma.
| Tarea | 8 GB | 16 GB | 24-32 GB | 64 GB o más |
|---|---|---|---|---|
| Chat y asistente | qwen3:4b (2,5 GB) | qwen3:8b (5,2 GB) | gemma4:26b (16-19 GB) | qwen3.6:35b (23-24 GB) |
| Código | qwen2.5-coder:3b (1,9 GB) | qwen2.5-coder:7b (4,7 GB) | qwen3-coder:30b (19 GB) | qwen3.6:35b-coding (23-24 GB) |
| Documentos y RAG | bge-m3 (1,2 GB) + qwen3:4b | bge-m3 + qwen3:8b | bge-m3 + gemma4:26b | bge-m3 + qwen3.6:35b |
| Razonamiento | qwen3:4b-thinking (2,5 GB) | deepseek-r1:14b (9,0 GB) | qwen3:30b-thinking (19 GB) | qwen3:30b-thinking con contexto largo |
| Visión (fotos, PDF escaneados) | qwen3-vl:2b (1,9 GB) | qwen3-vl:8b (6,1 GB) | qwen3-vl:30b (20 GB) | qwen3-vl:30b; qwen2.5vl:72b (49 GB) solo por lotes |
| Redacción en español | qwen3:4b | gemma4:e4b (6,6-9,5 GB) | gemma4:26b | qwen3.6:35b |
| Voz a texto (fuera de Ollama) | faster-whisper small | small | medium | large-v3 |
Cómo calculamos que cabe: tamaño de la biblioteca, más la caché de contexto, más 1,5 GB de runtime. Es la misma cuenta que usa src/lib/hardware-math.ts en este sitio. La caché de un modelo de 3 a 8B con 4.096 tokens ronda 0,5 GB.
Hay celdas que van justas. qwen3:4b necesita unos 4,5 GB en un portátil de 8 GB, así que cierra el navegador. La columna de 24-32 GB pide entre 17 y 22 GB: con una GPU de 24 GB o con 32 GB compartidos va cómoda, y con un Mac de 24 GB va al límite.
La voz a texto no pasa por Ollama. Usa faster-whisper: su README mide small en CPU con 1,5 GB de RAM en int8, y large-v2 en GPU con 2,9 GB en int8. large-v3 tiene el mismo número de parámetros que large-v2.
Por qué la columna de 64 GB repite modelos
Más memoria no significa un modelo más grande. Los modelos que tienen a3b o a4b en su etiqueta son de mezcla de expertos: guardan todos los parámetros pero activan unos 3 o 4 mil millones por token. Por eso qwen3.6:35b generó más rápido que deepseek-r1:14b en nuestra prueba.
Con 64 GB o más, lo que ganas es contexto largo y espacio para tener dos modelos cargados a la vez, por ejemplo un modelo de chat y otro de visión. Un modelo denso de 70B cabe, pero en nuestra máquina qwen2.5vl:72b dio unos 3 tokens por segundo. Sirve para lotes nocturnos, no para conversar.
Paso 3: descarga y mide en tu máquina
Descarga la etiqueta de tu celda y mide la velocidad con la misma llamada que usamos nosotros:
ollama pull qwen3:8b
curl -s localhost:11434/api/generate -d '{
"model": "qwen3:8b", "stream": false, "think": false,
"prompt": "Escribe un correo breve para mover una reunión del jueves al lunes.",
"options": {"num_predict": 200, "num_ctx": 4096}
}' | python3 -c "import json,sys; d=json.load(sys.stdin); print(round(d['eval_count']/d['eval_duration']*1e9,1),'tok/s')"
ollama ps # la columna SIZE es la memoria que ocupa de verdadSalida esperada: una línea con tokens por segundo y una tabla de ollama ps. Si PROCESSOR no dice 100% GPU en una máquina con GPU, el modelo no cabía entero. Baja a la celda de la izquierda o reduce num_ctx.
Por debajo de unos 10 tokens por segundo, leer la respuesta se hace lento. Para medir tu propia máquina con --verbose, sigue la guía para instalar Ollama.
Paso 4: prueba la calidad con tus diez prompts
La velocidad se mide en un segundo. La calidad solo la juzgas tú. Pasa tus diez prompts por la celda de tu memoria y por la de la izquierda, con temperature: 0, y compara las respuestas una al lado de la otra.
Si no distingues las respuestas, quédate con el modelo pequeño. Liberas memoria y ganas velocidad. Para redacción en español, mira acentos, concordancias y si el modelo cuela palabras en inglés.
Qué medimos
NVIDIA DGX Spark (GB10, 128 GB de memoria unificada), Ollama 0.30.10, contexto de 4.096 tokens. Es una máquina compartida con otros servicios, así que toma las cifras como un suelo.
| Modelo | Velocidad de generación | Memoria cargada | Fecha |
|---|---|---|---|
qwen2.5-coder:7b | 41,0 tok/s | 6,6 GB | 4-10-2026 |
gemma4:26b | 60,7 tok/s | 17 GB | 4-10-2026 |
deepseek-r1:14b (sin modo de pensamiento) | 21,6 tok/s, una ejecución | 9,5 GB | 6-10-2026 |
qwen2.5vl:7b (prompt de texto) | 42,3 tok/s, una ejecución | no medida | 6-10-2026 |
qwen3.6:35b | 71,0 tok/s, una ejecución | 23 GB | 6-10-2026 |
qwen2.5vl:72b | 2,7 a 3,2 tok/s | 49 GB con 8k de contexto | 9-9-2026 |
faster-whisper small | 0,252 x tiempo real | no medida | 4-10-2026 |
faster-whisper medium | 0,513 x tiempo real | no medida | 4-10-2026 |
Un factor de 0,252 significa que una reunión de 30 minutos se transcribe en unos 7,5. Una Spark no es tu portátil. En un equipo de 16 GB sin GPU dedicada espera cifras bastante más bajas, y por eso existe el Paso 3.
Cuándo es mejor una API en la nube
- Agentes de código sobre un repositorio grande. Un modelo de 7 a 30B completa funciones y explica código. Planificar cambios en cincuenta archivos sigue siendo terreno de los modelos grandes en la nube.
- Uso esporádico con datos no sensibles. Si haces veinte consultas al mes, pagar por uso sale más barato que cualquier equipo. Haz la cuenta con nube o local: tu punto de equilibrio.
- Razonamiento largo donde un error cuesta caro. Un modelo local de 14B razona bien en problemas acotados. Para análisis legal o financiero delicado, compara con un modelo grande antes de fiarte.
Lo local gana cuando los datos no deben salir de tu red, cuando el volumen es alto y constante, o cuando quieres un coste fijo. La electricidad y tu tiempo también cuentan como coste.
Siguientes pasos
- Antes de descargar, elige el archivo y la cuantización: cuantización GGUF, elige el archivo correcto.
- Análisis de los modelos de la tabla: Gemma 4, Qwen 2.5 Coder 7B, DeepSeek R1 y Qwen2.5-72B frente a qwen3.6:35b.
- ¿Te falta memoria? Compara equipos en el catálogo de hardware o prueba un ejercicio sin instalar nada en el playground.
Trabaja con nosotros
Si quieres ver tu tarea funcionando en hardware real antes de comprar nada, medimos el modelo y la máquina con tus prompts. Hablemos 15 minutos o mira cómo trabajamos en consultoría.