La pregunta no es si la IA te sirve. La pregunta es si tiene sentido pagar a un proveedor de nube por cada token o comprar el hardware una vez y pagar luego solo la electricidad. Al terminar tendrás las tablas y la fórmula, con precios de API de septiembre de 2026, para hablar con tu director financiero.
Qué necesitas
- Tu volumen mensual de consultas y una estimación de tokens por consulta (con un margen de error del doble basta para la primera pasada).
- Los precios de la nube: OpenAI y Anthropic.
- Una hoja de cálculo o Python. Un asistente de IA también puede hacerte las cuentas si le pegas las tablas.
Paso 1: calcula tu factura de la nube
Los proveedores cobran por token, aproximadamente por palabra procesada. Con poco volumen parece insignificante; a la escala de una empresa real, la aritmética cambia.
Un flujo típico de pyme hace 100.000 consultas al mes, con 500 tokens de entrada y 300 de salida cada una. Con GPT-5, a 1,25 $ por millón de tokens de entrada y 10 $ por millón de salida, genera esta factura. Tratamos 1 $ como 1 EUR, lo que favorece a la nube.
| Componente de coste | GPT-5 (nube) | Qwen3-8B (local) |
|---|---|---|
| Tokens de entrada (50M/mes) | 63 EUR | 0 EUR |
| Tokens de salida (30M/mes) | 300 EUR | 0 EUR |
| Electricidad (200 W, 8 h/día, 0,27 EUR por kWh) | 0 EUR | 13 EUR |
| Coste mensual de funcionamiento | 363 EUR | 13 EUR |
| Coste anual de funcionamiento | 4.356 EUR | 156 EUR |
| Hardware único (supuesto: una estación con GPU) | 0 EUR | 2.400 EUR |
Las líneas de API salen directamente de los precios publicados por OpenAI. La electricidad es 200 W × 8 h × 30 días = 48 kWh al mes. El primer año local suma el hardware, así que el total del año 1 ronda los 2.560 EUR. A partir del año 2 son unos 156 EUR más tu propio tiempo de mantenimiento. Añade a ambas columnas lo que solo tú puedes valorar: tiempo del equipo para actualizaciones, trabajo de integración y, en la nube, el papeleo de cumplimiento adicional.
Un modelo de 8B como Qwen3-8B, servido con Ollama, cubre muchas tareas cotidianas de una pyme: resumen de documentos, preguntas y respuestas internas, clasificación, redacción y extracción de datos. Para el razonamiento de primera línea, un enfoque híbrido envía a la nube solo las consultas difíciles; el ahorro es la parte de tus tokens que pasas a local.
Paso 2: calcula el coste total de propiedad
Las calculadoras de precios enseñan el coste de la API. Ninguna enseña el stack completo. Lista estas partidas y pide presupuesto o estima cada una:
Costes de la nube que no aparecen en la calculadora:
- Salida de datos, si tu proveedor o plataforma la cobra.
- Niveles superiores de límites de velocidad, si tu volumen los necesita.
- Trabajo RGPD: contratos de encargado, cláusulas contractuales tipo y documentación de transferencias.
- Coste de cambio si algún día cambias de proveedor: reescribir prompts, integraciones y pruebas.
Costes honestos de la IA local:
- Hardware, amortizado en tres años. Pon precio a la máquina exacta que necesitas; nuestro catálogo de hardware tiene precios con fuente por presupuesto.
- Instalación e integración inicial, interna o con un proveedor.
- Electricidad: vatios × horas × tu tarifa. Por ejemplo, una estación de 300 W doce horas al día consume unos 1.314 kWh al año, unos 369 EUR a 0,28 EUR por kWh.
- Tiempo de actualización de modelos y mantenimiento.
- Redundancia (una segunda máquina o repuestos) si el sistema es crítico.
TCO nube = (API mensual × 12) + cumplimiento + salida de datos
TCO local año 1 = hardware + instalación + (electricidad × 12) + (mantenimiento × 12)
TCO local año 2 = (electricidad × 12) + (mantenimiento × 12)Paso 3: encuentra tu punto de equilibrio
xychart-beta
title "Coste acumulado: nube frente a local (EUR, 24 meses)"
x-axis ["M1", "M2", "M3", "M4", "M5", "M6", "M7", "M8", "M9", "M10", "M11", "M12", "M18", "M24"]
y-axis "Coste acumulado (EUR)" 0 --> 10000
line [363, 726, 1089, 1452, 1815, 2178, 2541, 2904, 3267, 3630, 3993, 4356, 6534, 8712]
line [2413, 2426, 2439, 2452, 2465, 2478, 2491, 2504, 2517, 2530, 2543, 2556, 2634, 2712]Meses hasta el equilibrio = (hardware + instalación) / (coste mensual nube − operación local mensual)
Ejemplo: 2.400 EUR / (363 EUR − 13 EUR) = 6,9 meses| Consultas al mes | Nube al mes (GPT-5) | Electricidad local al mes | Equilibrio con 2.400 EUR de hardware |
|---|---|---|---|
| 10.000 | ~36 EUR | 13 EUR | ~103 meses: la nube gana a este volumen |
| 30.000 | ~109 EUR | 13 EUR | ~25 meses |
| 50.000 | ~182 EUR | 13 EUR | ~14 meses |
| 100.000 | ~363 EUR | 13 EUR | ~6,9 meses |
| 250.000 | ~908 EUR | 39 EUR (24 h/día) | ~2,8 meses |
Mismos supuestos que en el paso 1: 500 tokens de entrada y 300 de salida por consulta, precios de lista de GPT-5 y 1 $ tratado como 1 EUR. Si el mantenimiento te cuesta, por ejemplo, 50 EUR al mes en tiempo del equipo, réstalo también: con 100.000 consultas el equilibrio pasa de 6,9 a 8 meses.
Conclusión: la IA local no siempre es la respuesta. Con unas pocas decenas de miles de consultas al mes la nube es más barata, salvo que la privacidad, la latencia o la regulación pesen más que el coste. A partir de unas 100.000 consultas al mes el local se amortiza en menos de un año con estos supuestos. Si tu volumen es pequeño y sensible, la placa de 250 EUR o el PC que ya tienes son el punto de entrada con menos barreras.
Paso 4: sitúa tu empresa
| Perfil | Uso típico | Dónde suele encajar lo local |
|---|---|---|
| Autónomo o microempresa (1 a 3 personas) | Investigación, propuestas, documentos de clientes | Hoy casi todo son suscripciones; el beneficio principal de lo local es no enviar contratos de clientes a una API fuera de la UE, no el coste |
| Pyme (10 a 50 personas) | Base de conocimiento, RR. HH., soporte, actas | Una estación suele cubrir la carga; haz el paso 3 con tu volumen real |
| Mediana (50 a 500 personas) | Más de 100 usuarios, varios pipelines | Varias estaciones o un servidor pequeño; el volumen suele bastar para que el coste importe |
Más allá del coste
Los números captan la atención del director financiero; estos argumentos cierran la decisión.
- Latencia. Una llamada a la nube incluye un viaje de ida y vuelta por la red y a veces una cola; un modelo de 7 a 8B en una GPU local elimina ambos. Para chat en directo, asistentes de voz y anotación en línea, mide el tiempo hasta el primer token en ambas opciones con tus prompts reales.
- Soberanía de datos. Lo que se procesa en local no sale de tu infraestructura: sin transferencias internacionales (artículos 44 a 49 del RGPD), sin lista de subencargados, sin explicar a clientes y empleados adónde van sus datos. En sanidad, finanzas y derecho es un requisito, no una preferencia.
- Independencia del proveedor. Ningún corte de OpenAI, ningún fallo de región de AWS ni ningún aviso de retirada de API afecta a tus operaciones. Los precios de la nube han cambiado varias veces en 24 meses; un modelo en tu máquina no se reprecia solo.
- Costes predecibles. La factura de la nube es variable por diseño. La IA local tiene un coste operativo fijo tras el despliegue, y eso simplifica el presupuesto.
Paso 5: preséntalo al director financiero
- Empieza por su gasto actual. “¿Cuánto gastamos hoy en herramientas de IA y acceso a API entre todos los equipos?” Sumadas las suscripciones y las facturas de API, la cifra suele sorprender.
- Presenta tres escenarios. A: no hacer nada (la nube crece con el uso). B: híbrido (local para volumen y datos sensibles, nube para lo complejo). C: stack local completo (máximo ahorro, inversión inicial).
- Lidera con el punto de equilibrio, no con el ahorro. “Recuperamos la inversión en siete meses; a partir de ahí, cada mes es margen.” Los financieros desconfían de las cifras de ahorro y confían en el punto de equilibrio porque es comprobable.
- Cuantifica el riesgo que desaparece. Los datos de empleados y clientes dejan de salir de la empresa, y con ellos la parte de exposición RGPD ligada a transferencias.
- Propón un piloto. Treinta días, un caso de uso, alcance y presupuesto cerrados de antemano, entregable: integración funcionando e informe de ROI a 90 días con criterios de éxito pactados por escrito.
Siguientes pasos
- Haz el cálculo con tus propios tokens: IA en la nube o en local: calcula tu punto de equilibrio en 15 minutos.
- Elige la máquina: Mejores dispositivos para IA local en 2026.
- De dónde sale de verdad el retorno de los agentes: agentes de IA para automatización de pymes.
- Estimación guiada: nuestra calculadora de ROI genera un informe que puedes compartir con tu equipo.
Trabaja con nosotros
Podemos hacer este análisis de TCO con tus recuentos de tokens reales antes de recomendar hardware. Una conversación de 30 minutos suele bastar para saber si la IA local tiene sentido financiero en tu caso: reserva una llamada o mira cómo trabajamos en consultoría.