Ver todos los artículos
fine-tuningloraedge-aitutorialhardware

Ajusta modelos de IA en tu propio hardware: guía LoRA para pymes

JG
Jacobo González Jaspe
|

Revisado:

Ilustración abstracta: esferas de vidrio anidadas con una luz ámbar en el centro. Modelos
Ilustración generada con IA en nuestra máquina.

Actualizado el 4 de octubre de 2026. Este artículo es de abril de 2026 y cita Qwen 2.5 como modelos actuales. El método y los consejos siguen valiendo; hoy lo harías con:

  • Gemma 4: Puedes usar sus versiones pequeñas para el mismo proceso de ajuste en hardware similar.
  • Llama 4 Scout / Maverick: Sus arquitecturas permiten aplicar las mismas técnicas de LoRA para tareas específicas.
  • DeepSeek V4: Sus modelos de tamaño medio también funcionan con la estrategia de cuantización explicada.

El fine-tuning suena a algo que requiere un cluster de GPUs y un equipo de machine learning. Para un modelo de 7B puede hacerse en un Mac Mini M4 o en una sola GPU de consumo. Las técnicas LoRA y QLoRA comprimen el proceso de entrenamiento tanto que un modelo con tus datos específicos corre en el mismo hardware que usas para inferencia.

Esta guía muestra cómo funciona, cuánto cuesta y cuándo tiene sentido para tu pyme.

Ajuste de modelos IA localmente

Qué hace realmente el fine-tuning

Un modelo pre-entrenado como Qwen 2.5 7B o Gemma 3 4B sabe mucho de todo. El fine-tuning le enseña a ser excepcional en tu tarea específica.

flowchart LR
    BASE["Modelo Base<br/>(Conocimiento General)"] --> LORA["Entrenamiento LoRA<br/>(Tus Datos)"]
    LORA --> CUSTOM["Modelo Personalizado<br/>(Experto en Tu Dominio)"]
    DATA["Tus Datos de Entrenamiento<br/>(500-5.000 ejemplos)"] --> LORA
    
    style BASE fill:#1E293B,color:#FAFAFA
    style LORA fill:#F5A623,color:#0B1628
    style CUSTOM fill:#059669,color:#FAFAFA
Diagrama

Antes del fine-tuning: “Resume este contrato” → resumen legal genérico Después del fine-tuning con los contratos de tu bufete: “Resume este contrato” → resumen en el formato de tu firma, destacando las cláusulas que importan a tus abogados, usando tu terminología

LoRA vs QLoRA: Las Técnicas que lo Cambiaron Todo

El fine-tuning tradicional actualiza cada parámetro del modelo. Para un modelo de 7B, son 7.000 millones de números. Con entrenamiento estándar en precisión mixta y el optimizador Adam, pesos, gradientes y estado del optimizador ocupan unos 16 bytes por parámetro: bastante más de 100 GB antes de contar activaciones.

LoRA (Low-Rank Adaptation) congela el modelo original y entrena solo pequeñas matrices “adaptadoras”. El artículo de LoRA indica que en GPT-3 redujo los parámetros entrenables 10.000 veces y la memoria de GPU 3 veces, igualando o superando la calidad del fine-tuning completo en los modelos que probaron. El adaptador LoRA de un modelo 7B suele pesar decenas de megabytes, según el rango elegido, en lugar de 14 GB.

QLoRA va más allá cuantizando el modelo base congelado a 4 bits durante el entrenamiento, una cuarta parte de su tamaño en 16 bits. El artículo de QLoRA describe el ajuste de un modelo de 65B en una sola GPU de 48 GB manteniendo el rendimiento del fine-tuning completo en 16 bits en sus benchmarks.

MétodoQué se entrenaModelo base en memoriaMejor Para
Full fine-tuneTodos los parámetrosPesos en 16 bits + gradientes + estado del optimizadorInvestigación, grandes presupuestos
LoRAMatrices adaptadoras pequeñasPesos en 16 bits, congeladosMejor calidad en GPU grande o Mac
QLoRAMatrices adaptadoras pequeñasPesos en 4 bits, congeladosPunto óptimo en hardware de consumo

Esos artículos midieron la calidad en sus propios benchmarks. Si un adaptador es suficiente para tu tarea lo compruebas con tus propios ejemplos reservados para evaluación.

Requisitos de Hardware

Tu HardwareTamaño de Modelo PrácticoHerramienta
Mac Mini M4 16GB7B (QLoRA)MLX-LM (LORA.md)
Mac con 32GB7B (LoRA) o 14B (QLoRA)MLX-LM
RTX 3080 10GB7B (QLoRA)Unsloth
RTX 3090 / 4090 24GB13B-14B (QLoRA)Unsloth

El tiempo de entrenamiento depende del número de ejemplos, su longitud y las iteraciones, así que no damos una cifra genérica. Lanza primero 50 iteraciones, mira en el log el tiempo por iteración y multiplica.

Paso a Paso: Fine-Tune en Mac con MLX

El framework MLX de Apple hace el fine-tuning nativo en Apple Silicon:

bash
# Instalar MLX-LM
pip install mlx-lm

# Preparar datos de entrenamiento: --data recibe un DIRECTORIO con train.jsonl
# (valid.jsonl es opcional y muestra la perdida de validacion)
mkdir -p datos
cat > datos/train.jsonl << 'EOF'
{"prompt": "Resume esta clausula contractual:", "completion": "Esta clausula establece..."}
{"prompt": "Extrae las condiciones de pago:", "completion": "El pago vence en..."}
EOF

# Fine-tune con LoRA (el adaptador se guarda en --adapter-path)
mlx_lm.lora \
  --model mlx-community/Qwen2.5-7B-Instruct-4bit \
  --train \
  --data ./datos \
  --batch-size 2 \
  --num-layers 16 \
  --iters 500 \
  --adapter-path ./mi-adaptador-personalizado

# Probar tu modelo ajustado
mlx_lm.generate \
  --model mlx-community/Qwen2.5-7B-Instruct-4bit \
  --adapter-path ./mi-adaptador-personalizado \
  --prompt "Resume esta clausula contractual: ..."

# Opcional: fusionar el adaptador en un modelo independiente
mlx_lm.fuse \
  --model mlx-community/Qwen2.5-7B-Instruct-4bit \
  --adapter-path ./mi-adaptador-personalizado \
  --save-path ./mi-modelo-fusionado

El adaptador (adapters.safetensors más adapter_config.json en la carpeta del adaptador) suele pesar decenas de megabytes. El modelo base no cambia. Puedes intercambiar adaptadores para diferentes tareas sin descargar nuevos modelos.

Cuándo tiene sentido el fine-tuning (y cuándo no)

Escenario¿Fine-tune?Por qué
”Responder preguntas sobre nuestro catálogo”No: usa RAGRAG recupera datos actuales; fine-tuning fija datos
”Escribir emails con nuestra voz de marca”SíEstilo y tono se aprenden con ejemplos
”Clasificar tickets de soporte en 12 categorías”SíLa clasificación específica encaja bien con ejemplos
”Extraer datos estructurados de nuestras facturas”SíPatrones de extracción consistentes son entrenables
”Resumir contratos en nuestro formato plantilla”SíEl formato de salida es una fortaleza del fine-tuning

Regla general: Fine-tune cuando el formato o estilo del output importa. Usa RAG cuando los datos necesitan estar actualizados.

La Economía

ConceptoFine-Tuning LocalServicio de Fine-Tuning en la Nube
HardwareEl equipo que ya usas para inferenciaN/A
Cómputo de entrenamientoElectricidad de la ejecuciónSe factura por token de entrenamiento (ver la página de precios de cada proveedor)
Coste por inferenciaSolo electricidadPrecio por token del modelo ajustado
Privacidad de datos100% localDatos enviados al proveedor
IteracionesTantas como te permita el tiempoCada ejecución se factura

La capacidad de iterar libremente es la ventaja oculta. Con entrenamiento cloud, cada experimento cuesta dinero. Con entrenamiento local, puedes hacer muchos experimentos en un día sin más coste que la electricidad.

Lo Que Ofrecemos

En VORLUX AI, el fine-tuning está disponible como complemento a nuestro despliegue Edge AI:

  1. Preparación de datos: Te ayudamos a estructurar tus ejemplos de entrenamiento
  2. Selección de modelo: Elegimos el modelo base correcto para tu tarea y hardware
  3. Entrenamiento: Fine-tuning LoRA/QLoRA en nuestro hardware o el tuyo
  4. Evaluación: Probamos el modelo ajustado contra tus criterios de calidad
  5. Despliegue: Exportamos a Ollama e integramos con tus workflows existentes

¿Quieres un modelo que hable el idioma de tu negocio? Agenda una evaluación gratuita de 15 minutos para discutir si el fine-tuning tiene sentido para tu caso de uso.

Relacionado: Guía de Cuantización | Mejores LLMs Locales | Guía Hardware | n8n RAG Pipeline


Fuentes: Artículo LoRA (Hu et al., 2021) | Artículo QLoRA (Dettmers et al., 2023) | MLX-LM (LORA.md) | Documentación de Unsloth | LoRA en Apple Silicon (Towards Data Science)


Lecturas relacionadas

Siguientes pasos

  • Revisa si tu hardware actual es suficiente consultando nuestra comparativa de dispositivos para IA local.
  • Analiza si necesitas ajustar un modelo o simplemente usar RAG para tus documentos.
  • Explora cómo la cuantización permite ejecutar modelos más grandes en equipos sencillos.
  • Comprueba la viabilidad de modelos específicos como Qwen 2.5 7B para tus tareas particulares.

Trabaja con nosotros

Podemos hacer este análisis con tus datos reales antes de recomendar hardware. Una conversación de 30 minutos suele bastar para saber si tiene sentido en tu caso: reserva una llamada o mira cómo trabajamos en consultoría.

Diagrama
Compartir: LinkedIn X
Veredicto semanal

Recibe las guías nuevas antes que nadie

Suscríbete y te avisamos cuando publiquemos guías, plantillas y workflows nuevos. Un correo a la semana, sin spam.

Ya publicados: 66 guías y 25 plantillas. Todo gratis y sin registro.

Bonus: el kit de inicio de IA local en PDF al suscribirte
1x por semana Sin spam Cancela cuando quieras

Ver qué recibes

La Ley de IA de la UE ya aplica: una lista que puedes completar

Cuéntanos qué quieres ejecutar

Dinos qué quieres ejecutar y con qué presupuesto. Te decimos qué hardware necesitas, qué modelo encaja y qué puedes esperar de él, antes de que gastes nada.

Primera llamada gratis, 15 min Local-first: tus datos no salen de tu red Herramientas y guías abiertas

66 guías gratuitas · 17 plantillas de cumplimiento