Actualizado el 4 de octubre de 2026. Este artículo es de abril de 2026 y cita Qwen 2.5 como modelos actuales. El método y los consejos siguen valiendo; hoy lo harías con:
- Gemma 4: Puedes usar sus versiones pequeñas para el mismo proceso de ajuste en hardware similar.
- Llama 4 Scout / Maverick: Sus arquitecturas permiten aplicar las mismas técnicas de LoRA para tareas específicas.
- DeepSeek V4: Sus modelos de tamaño medio también funcionan con la estrategia de cuantización explicada.
El fine-tuning suena a algo que requiere un cluster de GPUs y un equipo de machine learning. Para un modelo de 7B puede hacerse en un Mac Mini M4 o en una sola GPU de consumo. Las técnicas LoRA y QLoRA comprimen el proceso de entrenamiento tanto que un modelo con tus datos específicos corre en el mismo hardware que usas para inferencia.
Esta guía muestra cómo funciona, cuánto cuesta y cuándo tiene sentido para tu pyme.

Qué hace realmente el fine-tuning
Un modelo pre-entrenado como Qwen 2.5 7B o Gemma 3 4B sabe mucho de todo. El fine-tuning le enseña a ser excepcional en tu tarea específica.
flowchart LR
BASE["Modelo Base<br/>(Conocimiento General)"] --> LORA["Entrenamiento LoRA<br/>(Tus Datos)"]
LORA --> CUSTOM["Modelo Personalizado<br/>(Experto en Tu Dominio)"]
DATA["Tus Datos de Entrenamiento<br/>(500-5.000 ejemplos)"] --> LORA
style BASE fill:#1E293B,color:#FAFAFA
style LORA fill:#F5A623,color:#0B1628
style CUSTOM fill:#059669,color:#FAFAFAAntes del fine-tuning: “Resume este contrato” → resumen legal genérico Después del fine-tuning con los contratos de tu bufete: “Resume este contrato” → resumen en el formato de tu firma, destacando las cláusulas que importan a tus abogados, usando tu terminología
LoRA vs QLoRA: Las Técnicas que lo Cambiaron Todo
El fine-tuning tradicional actualiza cada parámetro del modelo. Para un modelo de 7B, son 7.000 millones de números. Con entrenamiento estándar en precisión mixta y el optimizador Adam, pesos, gradientes y estado del optimizador ocupan unos 16 bytes por parámetro: bastante más de 100 GB antes de contar activaciones.
LoRA (Low-Rank Adaptation) congela el modelo original y entrena solo pequeñas matrices “adaptadoras”. El artículo de LoRA indica que en GPT-3 redujo los parámetros entrenables 10.000 veces y la memoria de GPU 3 veces, igualando o superando la calidad del fine-tuning completo en los modelos que probaron. El adaptador LoRA de un modelo 7B suele pesar decenas de megabytes, según el rango elegido, en lugar de 14 GB.
QLoRA va más allá cuantizando el modelo base congelado a 4 bits durante el entrenamiento, una cuarta parte de su tamaño en 16 bits. El artículo de QLoRA describe el ajuste de un modelo de 65B en una sola GPU de 48 GB manteniendo el rendimiento del fine-tuning completo en 16 bits en sus benchmarks.
| Método | Qué se entrena | Modelo base en memoria | Mejor Para |
|---|---|---|---|
| Full fine-tune | Todos los parámetros | Pesos en 16 bits + gradientes + estado del optimizador | Investigación, grandes presupuestos |
| LoRA | Matrices adaptadoras pequeñas | Pesos en 16 bits, congelados | Mejor calidad en GPU grande o Mac |
| QLoRA | Matrices adaptadoras pequeñas | Pesos en 4 bits, congelados | Punto óptimo en hardware de consumo |
Esos artículos midieron la calidad en sus propios benchmarks. Si un adaptador es suficiente para tu tarea lo compruebas con tus propios ejemplos reservados para evaluación.
Requisitos de Hardware
| Tu Hardware | Tamaño de Modelo Práctico | Herramienta |
|---|---|---|
| Mac Mini M4 16GB | 7B (QLoRA) | MLX-LM (LORA.md) |
| Mac con 32GB | 7B (LoRA) o 14B (QLoRA) | MLX-LM |
| RTX 3080 10GB | 7B (QLoRA) | Unsloth |
| RTX 3090 / 4090 24GB | 13B-14B (QLoRA) | Unsloth |
El tiempo de entrenamiento depende del número de ejemplos, su longitud y las iteraciones, así que no damos una cifra genérica. Lanza primero 50 iteraciones, mira en el log el tiempo por iteración y multiplica.
Paso a Paso: Fine-Tune en Mac con MLX
El framework MLX de Apple hace el fine-tuning nativo en Apple Silicon:
# Instalar MLX-LM
pip install mlx-lm
# Preparar datos de entrenamiento: --data recibe un DIRECTORIO con train.jsonl
# (valid.jsonl es opcional y muestra la perdida de validacion)
mkdir -p datos
cat > datos/train.jsonl << 'EOF'
{"prompt": "Resume esta clausula contractual:", "completion": "Esta clausula establece..."}
{"prompt": "Extrae las condiciones de pago:", "completion": "El pago vence en..."}
EOF
# Fine-tune con LoRA (el adaptador se guarda en --adapter-path)
mlx_lm.lora \
--model mlx-community/Qwen2.5-7B-Instruct-4bit \
--train \
--data ./datos \
--batch-size 2 \
--num-layers 16 \
--iters 500 \
--adapter-path ./mi-adaptador-personalizado
# Probar tu modelo ajustado
mlx_lm.generate \
--model mlx-community/Qwen2.5-7B-Instruct-4bit \
--adapter-path ./mi-adaptador-personalizado \
--prompt "Resume esta clausula contractual: ..."
# Opcional: fusionar el adaptador en un modelo independiente
mlx_lm.fuse \
--model mlx-community/Qwen2.5-7B-Instruct-4bit \
--adapter-path ./mi-adaptador-personalizado \
--save-path ./mi-modelo-fusionadoEl adaptador (adapters.safetensors más adapter_config.json en la carpeta del adaptador) suele pesar decenas de megabytes. El modelo base no cambia. Puedes intercambiar adaptadores para diferentes tareas sin descargar nuevos modelos.
Cuándo tiene sentido el fine-tuning (y cuándo no)
| Escenario | ¿Fine-tune? | Por qué |
|---|---|---|
| ”Responder preguntas sobre nuestro catálogo” | No: usa RAG | RAG recupera datos actuales; fine-tuning fija datos |
| ”Escribir emails con nuestra voz de marca” | Sí | Estilo y tono se aprenden con ejemplos |
| ”Clasificar tickets de soporte en 12 categorías” | Sí | La clasificación específica encaja bien con ejemplos |
| ”Extraer datos estructurados de nuestras facturas” | Sí | Patrones de extracción consistentes son entrenables |
| ”Resumir contratos en nuestro formato plantilla” | Sí | El formato de salida es una fortaleza del fine-tuning |
Regla general: Fine-tune cuando el formato o estilo del output importa. Usa RAG cuando los datos necesitan estar actualizados.
La Economía
| Concepto | Fine-Tuning Local | Servicio de Fine-Tuning en la Nube |
|---|---|---|
| Hardware | El equipo que ya usas para inferencia | N/A |
| Cómputo de entrenamiento | Electricidad de la ejecución | Se factura por token de entrenamiento (ver la página de precios de cada proveedor) |
| Coste por inferencia | Solo electricidad | Precio por token del modelo ajustado |
| Privacidad de datos | 100% local | Datos enviados al proveedor |
| Iteraciones | Tantas como te permita el tiempo | Cada ejecución se factura |
La capacidad de iterar libremente es la ventaja oculta. Con entrenamiento cloud, cada experimento cuesta dinero. Con entrenamiento local, puedes hacer muchos experimentos en un día sin más coste que la electricidad.
Lo Que Ofrecemos
En VORLUX AI, el fine-tuning está disponible como complemento a nuestro despliegue Edge AI:
- Preparación de datos: Te ayudamos a estructurar tus ejemplos de entrenamiento
- Selección de modelo: Elegimos el modelo base correcto para tu tarea y hardware
- Entrenamiento: Fine-tuning LoRA/QLoRA en nuestro hardware o el tuyo
- Evaluación: Probamos el modelo ajustado contra tus criterios de calidad
- Despliegue: Exportamos a Ollama e integramos con tus workflows existentes
¿Quieres un modelo que hable el idioma de tu negocio? Agenda una evaluación gratuita de 15 minutos para discutir si el fine-tuning tiene sentido para tu caso de uso.
Relacionado: Guía de Cuantización | Mejores LLMs Locales | Guía Hardware | n8n RAG Pipeline
Fuentes: Artículo LoRA (Hu et al., 2021) | Artículo QLoRA (Dettmers et al., 2023) | MLX-LM (LORA.md) | Documentación de Unsloth | LoRA en Apple Silicon (Towards Data Science)
Lecturas relacionadas
- Cuantización: modelos de 70B en hardware de consumo
- Los 3 Mejores Dispositivos para IA Local en 2026: Jetson vs NUC vs Mac Mini
- NPU vs GPU: Por Qué las Unidades de Procesamiento Neural Son el Futuro de la IA Edge
Siguientes pasos
- Revisa si tu hardware actual es suficiente consultando nuestra comparativa de dispositivos para IA local.
- Analiza si necesitas ajustar un modelo o simplemente usar RAG para tus documentos.
- Explora cómo la cuantización permite ejecutar modelos más grandes en equipos sencillos.
- Comprueba la viabilidad de modelos específicos como Qwen 2.5 7B para tus tareas particulares.
Trabaja con nosotros
Podemos hacer este análisis con tus datos reales antes de recomendar hardware. Una conversación de 30 minutos suele bastar para saber si tiene sentido en tu caso: reserva una llamada o mira cómo trabajamos en consultoría.