Cuando desplegamos IA localmente para empresas, la primera pregunta siempre es sobre hardware. En 2026, la respuesta está cambiando.
Las NPU (Neural Processing Units) son chips de IA dedicados integrados en portátiles, móviles y dispositivos edge. Se están encargando de la inferencia de bajo consumo que funciona todo el día. Consumen unos pocos vatios donde una GPU de sobremesa consume cientos. Eso importa en dispositivos que deben estar siempre encendidos.
No buscamos reemplazar las GPU por completo. Solo hay que saber cuándo usar cada una para desplegar el hardware correcto según la tarea.

La Diferencia Fundamental
Las GPU lanzan miles de núcleos de propósito general a un problema en paralelo. Son flexibles, potentes y pueden manejar desde gaming hasta entrenar modelos de 70B. Pero consumen mucha energía.
Las NPU tienen hardware dedicado de multiplicación-acumulación grabado en silicio: la operación matemática exacta del corazón de toda red neuronal. Tenerlo en hardware en lugar de instrucciones software en núcleos de propósito general marca una diferencia masiva en throughput por vatio.
xychart-beta
title "Rendimiento NPU declarado por cada fabricante (TOPS)"
x-axis ["Snapdragon X2 Elite", "AMD Ryzen AI 300", "Intel Core Ultra 200V", "Snapdragon X Elite", "Apple M4"]
y-axis "TOPS (cifra del fabricante)" 0 --> 90
bar [80, 50, 48, 45, 38]Las cifras TOPS son el pico que declara cada fabricante, medido con precisiones y condiciones distintas: sirven como orden aproximado, no como benchmark.
NPU vs GPU: cuándo usar cuál
| Carga de trabajo | Mejor acelerador | Por qué |
|---|---|---|
| Voz/cámara siempre activa | NPU | Ultra bajo consumo, inferencia continua |
| Asistente IA del sistema | NPU | Procesamiento en segundo plano, eficiente |
| Inferencia ligera (<7B) | NPU | Unos pocos vatios frente a los cientos de una GPU de sobremesa |
| Generación de imágenes (FLUX, SD) | GPU | Operaciones densas en cómputo, paralelas |
| Inferencia modelos grandes (27B+) | GPU | Necesita ancho de banda VRAM |
| Procesamiento video IA | GPU | Alto throughput requerido |
| Fine-tuning/entrenamiento | GPU | Memoria + cómputo intensivos |
Regla general: Si el modelo cabe en 8GB y corre continuamente, NPU gana. Si necesitas un modelo 27B+ o generas imágenes, GPU gana.
La ecuación energética
Aquí es donde el hardware de bajo consumo cambia la economía de la IA edge. Consumo máximo según la ficha técnica de cada fabricante:
| Dispositivo | Consumo máximo | Fuente |
|---|---|---|
| NVIDIA Jetson Orin Nano Super | 25 W (modo de máxima potencia) | NVIDIA |
| Mac mini (M4) | 4 W en reposo, 65 W máximo, equipo completo | Apple |
| GeForce RTX 3080 | 320 W, solo la tarjeta gráfica | NVIDIA |
Ejemplo, con un precio supuesto de EUR 0,20 por kWh y a máxima potencia 24/7 (el peor caso; la carga real de inferencia es menor): 25 W son 219 kWh al año, unos EUR 44; 65 W son 569 kWh, unos EUR 114; 320 W son 2.803 kWh, unos EUR 561 solo por la tarjeta. Pon tu propia tarifa y horas de uso.
Para empresas ejecutando inferencia IA 24/7 (bots de soporte, procesamiento de documentos, cámaras de seguridad) esa diferencia merece entrar en la decisión de hardware.
Panorama NPU 2026
| Plataforma | TOPS de la NPU (cifra del fabricante) | Mejor Para |
|---|---|---|
| Qualcomm Snapdragon X2 Elite | 80 (Qualcomm) | Portátiles, IA siempre activa |
| AMD Ryzen AI 300 | 50 | Workstations, híbrido |
| Intel Core Ultra 200V (Lunar Lake) | 48 (120 TOPS de plataforma con GPU y CPU) | Portátiles enterprise |
| Qualcomm Snapdragon X Elite | 45 (ficha de Qualcomm) | Portátiles |
| Apple M4 Neural Engine | 38 (Apple) | Despliegues Mac mini |
| NVIDIA Jetson Orin Nano Super | 67 dispersos, GPU + aceleradores (NVIDIA) | Dispositivos edge embebidos |
El enfoque de Apple es distinto: CPU, GPU y Neural Engine comparten memoria unificada, sin copiar datos entre chips.
Cómo afecta a los despliegues locales
Una advertencia antes de comprar pensando en la NPU: los motores de LLM local actuales casi no la usan. Ollama y llama.cpp ejecutan los modelos en la GPU (Metal en Mac, CUDA en NVIDIA) o en la CPU. La NPU la usan funciones del sistema operativo y apps hechas con el framework del fabricante. Para LLM, la GPU y la memoria siguen decidiendo qué puedes ejecutar.
Mac mini M4
- GPU (memoria unificada): ejecuta Qwen 2.5 7B, Gemma 3 4B y, con memoria suficiente, DeepSeek R1 14B mediante el backend Metal de Ollama
- Neural Engine (38 TOPS): lo usan macOS y las apps Core ML, no Ollama
- Consumo: 65 W máximo el equipo completo (Apple)
NVIDIA Jetson Orin Nano Super
- GPU + aceleradores (67 TOPS dispersos): pensado para visión por computador y modelos pequeños
- Consumo: hasta 25 W
Comprueba las Capacidades IA de tu Hardware
Ejecuta estos comandos para ver qué puede hacer tu dispositivo:
# macOS: Verifica Neural Engine y nucleos GPU
system_profiler SPDisplaysDataType | grep -A5 "Chipset\|Metal\|Total"
# Comprueba si Ollama usa tu hardware
ollama run qwen3:8b --verbose 2>&1 | grep "metal\|cuda\|cpu"
# Benchmark rapido: mide tokens por segundo
time ollama run qwen3:8b "Escribe una descripcion de producto de 100 palabras" --verboseMide en tu propia máquina: la salida de --verbose muestra la velocidad en tokens por segundo. Las cifras de terceros para placas similares están en nuestro catálogo de hardware.
El Caso de Negocio
Que un equipo local se amortice frente a una API en la nube depende de tu volumen, de los precios de la API y de tu tarifa eléctrica, así que no damos un plazo de amortización genérico. Nuestra guía de punto de equilibrio nube vs local incluye un script corto que lo calcula con tus cifras.
Lo Que Viene
La carrera NPU se acelera:
- Octubre 2025: Apple afirmó que su chip M5 ofrece más de 4 veces el cómputo máximo de GPU para IA del M4, con un acelerador neuronal en cada núcleo de GPU
- AI PCs: los grandes fabricantes de portátiles ya venden modelos “Copilot+” con NPU
- Qualcomm: el Snapdragon X2 Elite subió su NPU de 45 a 80 TOPS
- Mercado: Grand View Research, firma de estudios de mercado, proyecta que el mercado de edge AI alcanzará USD 118.690 millones en 2033, creciendo un 21,7% anual desde 2026
¿Listo para desplegar IA en el hardware correcto? Agenda una evaluación gratuita de 15 minutos: emparejaremos tu carga de trabajo con el dispositivo óptimo.
Relacionado: Guía Hardware | Guía Cuantización | Costes Cloud vs Local | Mejores LLMs Locales
Fuentes: Apple M4 | Apple M5 | Consumo Mac mini (Apple) | Snapdragon X2 Elite (Qualcomm) | Jetson Orin Nano Super (NVIDIA) | RTX 3080 (NVIDIA) | Mercado Edge AI (Grand View Research)
Lecturas relacionadas
- Ajusta Modelos IA en Tu Propio Hardware: Guía LoRA para PYMEs
- Los 3 Mejores Dispositivos para IA Local en 2026: Jetson vs NUC vs Mac Mini
- Cuantización: modelos de 70B en hardware de consumo
Siguientes pasos
- Revisa la comparativa de TOPS entre plataformas como Qualcomm y AMD para elegir tu hardware.
- Analiza cómo la cuantización permite ejecutar modelos de 70B en hardware limitado.
- Evalúa si el ahorro energético de la NPU justifica el cambio en tus despliegues locales.
- Consulta nuestra guía sobre cómo ajustar modelos en tu propio hardware con técnicas LoRA.
Trabaja con nosotros
Podemos hacer este análisis con tus datos reales antes de recomendar hardware. Una conversación de 30 minutos suele bastar para saber si tiene sentido en tu caso: reserva una llamada o mira cómo trabajamos en consultoría.