Ver todos los artículos
IA LocalOllamaHardwareCostesGuía

IA local: qué es, qué necesitas y cuándo compensa

JG
Jacobo González Jaspe
|
IA local: qué es, qué necesitas y cuándo compensa Medir y decidir
Este artículo también está en inglés:Local AI: what it is, what you need and when it pays off

Al terminar este artículo sabrás qué es la IA local, qué piezas necesitas para probarla esta tarde y cómo decidir si te compensa frente a una API en la nube. Puedes empezar con el portátil que ya tienes. Con 8 GB de memoria ya corre un modelo pequeño.

Qué es la IA local

IA local significa que el modelo corre en hardware que controlas tú. Puede ser tu portátil, un mini PC en la oficina o un servidor en tu armario. El prompt y la respuesta no salen de esa máquina.

Una aclaración que ahorra muchas confusiones: casi siempre hablamos de inferencia, no de entrenamiento. Inferencia es usar un modelo que ya está entrenado para que responda. Entrenar un modelo desde cero exige centros de datos y no es un proyecto para una pyme. Ajustar un modelo existente con tus datos (fine-tuning) sí es posible en local, pero es un segundo paso y la mayoría no lo necesita.

Si vienes de la hostelería, piénsalo así. La API en la nube es comer fuera: pagas por plato y la cocina no es tuya. La IA local es tu propia cocina: compras los fogones una vez y decides qué entra por la puerta.

Las tres piezas que necesitas

  1. Un modelo. Los de pesos abiertos (Llama, Qwen, Gemma, Mistral, DeepSeek) se descargan gratis. Suelen venir en formato GGUF, que define cuánta memoria ocupan. Lo explicamos en cuantización GGUF: elige el archivo correcto.
  2. Un runtime, el programa que carga el modelo y responde. Ollama es el más sencillo: gratis, sin cuenta y con una API local. llama.cpp es el motor que hay debajo y da más control.
  3. Memoria suficiente. El archivo del modelo tiene que caber en la RAM o en la VRAM, más un margen para el contexto de la conversación. Si no cabe, no va lento: casi no funciona.

Cuánta memoria hace falta depende del tamaño y de la cuantización. Estas cifras salen del README de quantize de llama.cpp y de la tabla de bartowski, recogidas en nuestra guía GGUF (septiembre de 2026):

ModeloArchivo Q4_K_M (4 bits)Archivo F16 (original)
Llama 3.1 8B4,58 GiB14,96 GiB
Llama 3.3 70B42,5 GB~141 GB

La regla práctica que se deduce: a 4 bits, algo más de medio GB por cada mil millones de parámetros, más el contexto. Antes de descargar nada, calcula tu caso en el explorador de VRAM.

Pruébalo en diez minutos

En Linux, Ollama se instala con una línea. En macOS y Windows, descárgalo desde ollama.com/download. La guía completa, paso a paso y con los problemas habituales: cómo instalar Ollama y ejecutar tu primer LLM en local.

bash
curl -fsSL https://ollama.com/install.sh | sh
ollama run llama3.1:8b "Explica en tres frases qué es la IA local."
ollama ps   # muestra cuánta memoria ocupa el modelo cargado

Si tu equipo tiene 8 GB, cambia llama3.1:8b por llama3.2:3b. Si la descarga falla, comprueba que tienes unos 5 GB libres en disco.

Qué medimos en nuestra máquina

Estas cifras salen de nuestra estación de trabajo, no de una ficha de fabricante. Es mucho más máquina de la que necesitas para empezar; está aquí para que tengas una referencia.

Modelo (Ollama)Memoria cargadoGeneraciónMáquina y fecha
llama3.1:8b9,2 GB41,3 tok/sDGX Spark GB10, 128 GB, 4-10-2026
qwen2.5-coder:7b6,6 GB41,0 tok/sDGX Spark GB10, 128 GB, 4-10-2026
gemma4:26b17 GB60,7 tok/sDGX Spark GB10, 128 GB, 4-10-2026
faster-whisper smalln/d30 min de audio en unos 7,5 minDGX Spark GB10, 128 GB, 4-10-2026

Fíjate en la tercera fila. El modelo de 26B generó más rápido que los de 7B y 8B. El número de parámetros no predice la velocidad por sí solo; por eso conviene medir. Para medirlo en tu máquina, usa --verbose como explica la guía para instalar Ollama.

En qué es buena hoy y en qué no

Funciona bien en tareas acotadas y repetitivas:

  • Resumir, clasificar y extraer datos de documentos.
  • Redactar borradores de correos, fichas o informes.
  • Responder sobre tus propios documentos con RAG (búsqueda más generación).
  • Autocompletar y revisar código con un modelo de 7B.
  • Transcribir reuniones con Whisper sin subir el audio a nadie.

Cuándo no hacerlo, o no solo en local: el razonamiento difícil de muchos pasos, los agentes largos y el conocimiento muy especializado. Ahí los mejores modelos de la nube siguen por delante. Además, en local el mantenimiento es tuyo: actualizaciones, copias y seguridad. El patrón que mejor funciona es híbrido: lo rutinario y privado en tu máquina, y una clave de nube con límite de gasto para lo excepcional.

Privacidad y RGPD, en un párrafo

Si el prompt y la respuesta no salen de tu perímetro, no hay un proveedor externo tratando esos datos ni una transferencia internacional que justificar. Eso encaja con la privacidad desde el diseño del artículo 25 del RGPD. No te hace cumplir de forma automática: sigues necesitando base legal, registro de actividades y medidas de seguridad. Lo desarrollamos en RGPD artículo 25: la IA local es privacidad desde el diseño y en RGPD e IA en 2026: el despliegue local como respuesta.

Local frente a API en la nube

CriterioIA localAPI en la nube
Dónde están los datosEn tu máquinaEn los servidores del proveedor
Forma del costeHardware una vez, más luz y tu tiempoVariable, por token consumido
LatenciaSin viaje por la red; depende de tu hardwareDepende de la red y de la carga del proveedor
MantenimientoTuyo: actualizar, vigilar, copiasDel proveedor
Techo de calidadEl mejor modelo abierto que quepa en tu memoriaLos modelos más capaces del mercado
Para empezarInstalar Ollama y descargar un modeloCrear cuenta, tarjeta y clave

Cuándo compensa

La nube cobra por token y la máquina propia es un coste fijo. Por eso la respuesta depende casi siempre del volumen.

  • Compensa cuando varias personas lo usan a diario, cuando el volumen es estable y cuando los datos no deben salir del edificio.
  • No compensa por coste si haces unas pocas peticiones cortas al día y un modelo pequeño de la nube resuelve la tarea. En ese caso, elige local solo si la privacidad o la previsibilidad pesan más.
  • La luz cuenta. Ejemplo: un equipo de 30 W encendido todo el mes consume 30 W × 24 h × 30 días = 21,6 kWh. Multiplícalo por el precio de tu tarifa.

Para poner tus números, usa el script de nube o local: calcula tu punto de equilibrio. Si necesitas un caso de negocio completo, sigue con el marco de ROI de la IA local. La página de hardware incluye una calculadora de amortización.

Veredicto. Compra si tienes volumen diario o datos sensibles. Espera si aún no sabes cuántos tokens usas: mídelo dos semanas. Sáltatelo si lo tuyo son diez preguntas a la semana.

Por dónde empezar, según tu perfil

  1. Curioso. Instala Ollama en tu portátil con el bloque de arriba y hazle preguntas de tu trabajo. Cuando quieras entender las piezas, el playground tiene ejercicios cortos en el navegador sobre la ventana de contexto, la similitud entre textos y si un modelo cabe en memoria.
  2. Desarrollador. Empieza por la zona de desarrolladores, elige archivo con la guía GGUF y mide la velocidad con ollama run <modelo> --verbose.
  3. Empresa. Mira qué compra cada presupuesto en el catálogo de hardware para IA local. Luego calcula el ahorro con el marco de ROI.

Análisis de modelos para seguir

Trabaja con nosotros

¿Esto para tu empresa? Hacemos el cálculo con tus volúmenes reales antes de recomendar hardware, y te decimos si la nube te basta. Hablemos 15 minutos o mira cómo trabajamos en consultoría.

Diagrama
Compartir: LinkedIn X
Veredicto semanal

Recibe las guías nuevas antes que nadie

Suscríbete y te avisamos cuando publiquemos guías, plantillas y workflows nuevos. Un correo a la semana, sin spam.

Ya publicados: 66 guías y 25 plantillas. Todo gratis y sin registro.

Bonus: el kit de inicio de IA local en PDF al suscribirte
1x por semana Sin spam Cancela cuando quieras

Ver qué recibes

La Ley de IA de la UE ya aplica: una lista que puedes completar

Cuéntanos qué quieres ejecutar

Dinos qué quieres ejecutar y con qué presupuesto. Te decimos qué hardware necesitas, qué modelo encaja y qué puedes esperar de él, antes de que gastes nada.

Primera llamada gratis, 15 min Local-first: tus datos no salen de tu red Herramientas y guías abiertas

66 guías gratuitas · 17 plantillas de cumplimiento