Ver todos los artículos
edge-aicuantizaciónhardwaretutorialmodelos

Cuantización: modelos de 70B en hardware de consumo

JG
Jacobo González Jaspe
|

Revisado:

Ilustración abstracta: cintas de luz ámbar y blanca que se entrelazan en una curva suave. Modelos
Ilustración generada con IA en nuestra máquina.

Artículo archivado, publicado el 20 de abril de 2026. Lo conservamos como registro; los datos y plazos pueden haber cambiado. Lee la versión actual.

Actualizado el 4 de octubre de 2026. Este artículo es de abril de 2026 y cita Qwen 2.5 como modelos actuales. El método y los consejos siguen valiendo; hoy lo harías con:

  • Gemma 4: puedes usar sus versiones pequeñas para probar la cuantización en hardware muy limitado.
  • Llama 4 Scout / Maverick: sus tamaños medianos siguen funcionando bien con los métodos GGUF y AWQ explicados.
  • DeepSeek V4: sus modelos grandes requieren una gestión de memoria más cuidadosa si usas cuantización extrema.

La pregunta que más escuchamos es cómo un modelo con 70.000 millones de parámetros puede correr en una caja que cabe en tu escritorio.

La respuesta es la cuantización. Es un conjunto de técnicas de compresión que reducen la huella de memoria de un modelo entre 4 y 8 veces. La pérdida de calidad es pequeña a 4 bits y apreciable por debajo. Es la tecnología que hace práctico el despliegue de Edge AI para PYMEs.

Cuantización de modelos IA

Qué hace la cuantización

Un modelo de IA estándar almacena cada parámetro como un número de punto flotante de 16 bits (FP16). Un modelo de 70B parámetros en FP16 necesita 140GB de memoria, muy por encima de cualquier dispositivo de consumo.

La cuantización reduce la precisión de esos números. En lugar de 16 bits por parámetro, usas 8 bits (la mitad de memoria), 4 bits (un cuarto), o incluso 2 bits. El modelo se hace más pequeño, rápido y barato de ejecutar, con sorprendentemente poca pérdida de calidad.

xychart-beta
    title "Modelo 70B — Memoria por Nivel de Cuantizacion"
    x-axis ["FP16", "INT8", "Q6_K", "Q5_K_M", "Q4_K_M", "Q3_K_M", "Q2_K"]
    y-axis "Memoria (GB)" 0 --> 150
    bar [140, 70, 56, 48, 40, 35, 25]
Diagrama

Con Q4_K_M (4 bits con calidad media), ese modelo de 70B baja de 140GB a ~40GB: cabiendo en un Mac Studio o un Mac Mini M4 Pro de gama alta con 48GB de memoria unificada.

Los Tres Métodos que Importan en 2026

GGUF (Lo que Usa Ollama)

GGUF es el formato usado por llama.cpp y Ollama. Es el estándar para despliegue local en hardware de consumo porque soporta inferencia hibrida CPU+GPU: el modelo se carga parcialmente en VRAM del GPU y parcialmente en RAM del sistema.

Por que importa: Aunque tu GPU tenga solo 8GB de VRAM, un modelo GGUF puede usar eso para las capas computacionalmente pesadas mientras mantiene el resto en RAM normal. Por esto Ollama funciona tan bien en Mac: usa la arquitectura de memoria unificada donde CPU y GPU comparten el mismo pool.

Nivel GGUFTamaño vs FP16CalidadCaso de Uso
Q2_K~18%ToscaSolo pruebas: degradacion notable
Q3_K_M~25%AceptableDispositivos muy limitados en memoria
Q4_K_M~28%BuenaDefault de producción: mejor balance
Q5_K_M~35%Muy buenaCuando tienes RAM extra
Q6_K~42%ExcelenteAplicaciones críticas en calidad
Q8_0~50%Casi originalCuando la calidad es lo primero

Nuestra recomendacion: Empieza con Q4_K_M. Si la calidad no es suficiente para tu caso de uso, sube a Q5_K_M. En nuestro propio uso, Q4_K_M ha sido difícil de distinguir de la precisión completa en tareas empresariales rutinarias; compruebalo con las tuyas.

AWQ (Inferencia GPU en Producción)

AWQ (Activation-Aware Weight Quantization) analiza que pesos importan más durante la inferencia real, y luego los protege de compresion agresiva. Los pesos menos importantes se comprimen más agresivamente.

Sus autores indican mejor precisión a 4 bits que la cuantización simple por redondeo. Las principales familias de modelos ahora vienen con checkpoints AWQ pre-cuantizados en HuggingFace.

Mejor para: Despliegues GPU dedicados donde quieres máximo throughput (vLLM, TensorRT-LLM).

GPTQ (Procesamiento por Lotes)

GPTQ usa un enfoque de calibracion única: procesa un pequeño dataset a través del modelo para determinar parámetros de cuantización óptimos. Funciona bien para escenarios de procesamiento por lotes.

Mejor para: Procesamiento offline por lotes, servidores API con colas de peticiones.

Comparación de calidad: ¿cuánto pierdes realmente?

MétodoCalidad vs FullAhorro MemoriaVelocidadMejor Para
GGUF Q4_K_M~92%~72%Buena (CPU+GPU)Ollama, Mac, despliegue local
AWQ INT4~95%~75%Excelente (GPU)Servidores GPU en producción
GPTQ INT4~90%~75%Buena (GPU)Procesamiento por lotes
FP8~98%~50%Mejor (H100+)Hardware NVIDIA enterprise

Los porcentajes de calidad son cifras aproximadas de artículos comparativos de Prem AI, que vende una plataforma de IA, y VRLA Tech, que vende estaciones de trabajo. No son un benchmark controlado y varían según modelo y tarea: tómalos como un orden, no como una medida. Para resumen de documentos, Q&A, clasificación y generación de código, la diferencia entre Q4_K_M y precisión completa es difícil de notar.

¿Qué cabe en tu hardware?

Tu HardwareMemoriaMayor Modelo (Q4_K_M)Ejemplo
Jetson Orin Nano8GB compartidos3B (7B muy justo)Qwen 2.5 3B
Mac Mini M4 16GB16GB14BDeepSeek R1 14B
Mac Mini M4 24GB24GB27BGemma 3 27B
Mac Mini M4 Pro 48GB48GB70BLlama 3.3 70B
Mac Studio 96GB96GB109B MoELlama 4 Scout

Comandos Prácticos: Ollama lo Maneja Todo

La belleza de Ollama es que nunca tocas la cuantización directamente. Cuando descargas un modelo, Ollama selecciona automáticamente la cuantización óptima para tu hardware:

bash
# Descargar cuantizacion default (normalmente Q4_K_M)
ollama pull llama3.3:70b

# Elegir explicitamente un nivel de cuantizacion
ollama pull llama3.3:70b-q4_K_M   # 40GB — equilibrado
ollama pull llama3.3:70b-q5_K_M   # 48GB — mayor calidad
ollama pull llama3.3:70b-q8_0     # 70GB — casi original

# Ver cuanta memoria usa un modelo
ollama show llama3.3:70b --modelfile

El Stack de Producción 2026

Un stack habitual:

  1. Descubrimiento: LM Studio: GUI para explorar y probar modelos
  2. Desarrollo + despliegue PYME: Ollama (GGUF): camino más simple, funciona en todo
  3. Producción alto throughput: vLLM (AWQ): máximo peticiones/segundo para servidores API

Para la mayoría de PYMEs, el paso 2 es donde un despliegue puede quedarse.

Por qué esto importa para tu negocio

La cuantización es lo que hace que la economía local funcione: un Mac mini o un mini PC usado ejecuta modelos que resuelven buena parte de las tareas diarias, la electricidad cuesta unos pocos euros al mes y tus datos nunca salen de tu edificio (RGPD por diseño). El límite honesto: un modelo de 7B cuantizado no es un modelo de frontera. Para el razonamiento difícil, conserva una clave de API en la nube con límite de gasto y lleva el volumen rutinario a local; los números están en Nube o local: calcula tu punto de equilibrio.


¿Quieres ver modelos cuantizados corriendo en hardware real? Reserva una demo gratuita de 15 minutos: te mostramos tu caso de uso corriendo localmente, en metal, sin dependencia cloud.

Relacionado: Mejores LLMs Locales Q2 2026 | Guía de Hardware | Análisis Costes Cloud vs Local


Fuentes: GGUF (Hugging Face) | Artículo AWQ | Artículo GPTQ | Cuantización Explicada (VRLA Tech) | Guía de Cuantización LLM (Prem AI)


Lecturas relacionadas

Siguientes pasos

  • Comprueba si tu hardware actual puede ejecutar modelos de mayor tamaño.
  • Prueba el formato GGUF usando Ollama para un despliegue local sencillo.
  • Evalúa el uso de vLLM si necesitas un alto throughput en producción.
  • Aprende a ajustar modelos de IA en tu propio hardware para mejorar resultados.
  • Revisa la comparativa de dispositivos para IA local para planificar tu próxima compra.

Trabaja con nosotros

Podemos hacer este análisis con tus datos reales antes de recomendar hardware. Una conversación de 30 minutos suele bastar para saber si tiene sentido en tu caso: reserva una llamada o mira cómo trabajamos en consultoría.

Diagrama
Compartir: LinkedIn X
Veredicto semanal

Recibe las guías nuevas antes que nadie

Suscríbete y te avisamos cuando publiquemos guías, plantillas y workflows nuevos. Un correo a la semana, sin spam.

Ya publicados: 66 guías y 25 plantillas. Todo gratis y sin registro.

Bonus: el kit de inicio de IA local en PDF al suscribirte
1x por semana Sin spam Cancela cuando quieras

Ver qué recibes

La Ley de IA de la UE ya aplica: una lista que puedes completar

Cuéntanos qué quieres ejecutar

Dinos qué quieres ejecutar y con qué presupuesto. Te decimos qué hardware necesitas, qué modelo encaja y qué puedes esperar de él, antes de que gastes nada.

Primera llamada gratis, 15 min Local-first: tus datos no salen de tu red Herramientas y guías abiertas

66 guías gratuitas · 17 plantillas de cumplimiento