Cuando les decimos a los clientes que su IA correrá localmente sin dependencia de la nube, la pregunta natural es: “Vale, pero ¿qué estás ejecutando exactamente?”. Pregunta justa. Si te pedimos que confíes en nosotros con tu infraestructura, mereces ver todo lo que hay debajo del capó.
Este post es nuestra divulgación tecnológica: cada componente, qué hace y por qué lo elegimos. La lista de modelos y los recuentos salen de nuestras propias máquinas, con la fecha y el comando que los produjo.
Los Componentes Principales
Esto es lo que impulsa VORLUX AI, desde la inferencia hasta la interfaz:
| Capa | Tecnología | Función | Por qué esta |
|---|---|---|---|
| Inferencia | Ollama | Sirve la mayoría de los modelos | Gestión sencilla de modelos, GPU, API estilo OpenAI |
| Inferencia | vLLM | Sirve Qwen2.5-7B-Instruct en el segundo Spark | Más rendimiento con peticiones concurrentes |
| Enrutado | LiteLLM | Una pasarela delante de todos los modelos | Cambias de modelo sin tocar a quien llama |
| API | FastAPI + Python | Orquestador en el puerto 8091 | Rápido, tipado, asíncrono |
| Base de datos | SQLite | Persistencia del orquestador | Cero configuración, cero red |
| Búsqueda | Qdrant, FAISS + BM25 | Recuperación RAG | Búsqueda híbrida vectorial + palabras clave |
| Embeddings | bge-m3, nomic-embed-text | Convierten documentos en vectores | Corren en local en Ollama |
| Sitio público | Astro | vorluxai.com | Estático primero, rápido |
| Automatización | n8n | Automatización de flujos | Flujos visuales, autoalojado |
| Programación | timers de systemd + APScheduler | Tareas recurrentes | Sobreviven a reinicios, el sistema las registra |
| Hardware | 2x NVIDIA DGX Spark | Servidor principal y asistente | 128 GB de memoria unificada cada uno, una GPU GB10 |
Cada componente corre en nuestro hardware o en el del cliente. La inferencia nunca sale de la máquina.
Cómo Encaja Todo
flowchart TB
subgraph CLIENT["Capa de Cliente"]
SITE["Sitio Astro<br/>vorluxai.com"]
N8N["Flujos n8n<br/>:5678"]
end
subgraph API_LAYER["API y Orquestación"]
ORCH["Orquestador FastAPI<br/>:8091"]
GW["Pasarela LiteLLM<br/>:4000"]
end
subgraph INFERENCE["Capa de Inferencia"]
OLLAMA["Ollama<br/>:11434"]
VLLM["vLLM en Spark 2<br/>:8200"]
RAG["Qdrant + FAISS/BM25<br/>Búsqueda RAG"]
end
subgraph DATA["Capa de Datos"]
SQLITE[("SQLite<br/>BD del orquestador")]
end
N8N --> ORCH
ORCH --> GW
GW --> OLLAMA
GW --> VLLM
ORCH --> RAG
ORCH --> SQLITE
style CLIENT fill:#0B1628,color:#FAFAFA
style INFERENCE fill:#059669,color:#fff
style DATA fill:#F5A623,color:#0B1628Los Modelos Que Usamos
No todas las tareas necesitan el mismo modelo. Guardamos una biblioteca en disco y enrutamos cada petición al adecuado con LiteLLM. El 2026-10-09, ollama list en nuestro DGX Spark principal (spark-43d5) mostraba 20 modelos, entre ellos:
| Modelo | Tamaño de descarga | Para qué lo usamos |
|---|---|---|
| qwen3.6:35b | 23 GB | Razonamiento general y redacción en español |
| gemma4:26b | 17 GB | Segunda opinión, borradores largos |
| qwen2.5vl:72b | 48 GB | Leer documentos escaneados e imágenes |
| deepseek-r1:14b | 9,0 GB | Razonamiento paso a paso |
| llama3.1:8b | 4,9 GB | Tareas rápidas y ligeras |
| qwen2.5-coder:7b | 4,7 GB | Generación y revisión de código |
| bge-m3, nomic-embed-text | 1,2 GB, 274 MB | Embeddings para búsqueda |
El resto son ajustes finos propios (las familias apprendere y j4sgon-finance) y modelos pequeños de visión y avatar. No están todos cargados a la vez. En el mismo momento, ollama ps mostraba tres modelos en memoria: llama3.1:8b, qwen2.5-coder:7b y bge-m3. Ollama carga un modelo con la primera petición y lo descarga tras un tiempo sin uso, así que la memoria va a lo que se está usando.
Un modelo de 72B que ocupa 48 GB no cabría junto a otros en un portátil de 32 GB. Aquí cabe porque cada Spark tiene 128 GB de memoria unificada compartida entre CPU y GPU.
Qué Corre de Forma Programada
El sistema no solo responde peticiones. El 2026-10-09, systemctl --user list-timers --all en el Spark principal listaba 68 timers. Cubren:
- Contenido: pasos de investigación, borrador, revisión y publicación, con una revisión humana antes de que nada salga en vivo
- Calidad: tests, comprobación de enlaces del sitio construido, actualizaciones de la base de conocimiento
- Monitorización: comprobaciones de salud y watchdogs que reinician un servicio tras varios fallos seguidos
- Copias de seguridad: bundles de git diarios de cada repositorio e instantáneas de las bases de datos
Un watchdog reinicia el orquestador solo tras tres comprobaciones fallidas seguidas, así una respuesta lenta no tumba un servicio que funciona. Contamos la parte de despliegue en nuestra guía de despliegue local.
Por Qué Importa el Open-Source
Cada componente de nuestro stack es open-source o construido por nosotros. No es ideología: es práctica.
- Sin licencias: nuestros clientes no pagan licencias de software por el stack. Los costes son el hardware y nuestro tiempo.
- Sin dependencia del proveedor: si Ollama desaparece mañana, cambiamos a llama.cpp o vLLM. Mismos modelos, otro motor.
- Auditabilidad: los clientes regulados pueden revisar el código que toca sus datos. Eso apoya el deber de protección de datos desde el diseño del artículo 25 del RGPD, aunque ese deber se refiere a todo tu proceso, no a tu licencia.
- Proyectos maduros: Ollama, vLLM, n8n y Astro son proyectos muy usados y mantenidos, no experimentos.
Comparado con Stacks en la Nube
| Aspecto | VORLUX AI (local) | Stack típico en la nube |
|---|---|---|
| Ubicación de los datos | Tu hardware | Los centros de datos del proveedor |
| Coste de funcionamiento | Electricidad y mantenimiento | Pago por token o por usuario |
| Internet necesario para inferir | No | Sí |
| Proveedor de IA como encargado RGPD | No | Sí, requiere contrato del art. 28 |
| Cambio de modelo | Cambiar una ruta de LiteLLM | Depende del catálogo del proveedor |
| Dependencia de disponibilidad | Tu electricidad y tu hardware | Su SLA |
| Registro de auditoría | Logs locales completos | Depende del proveedor |
El stack en la nube no es malo para todos. Para empresas que tratan datos sensibles bajo regulación europea, el despliegue local saca al proveedor de IA del flujo de datos. Analizamos los costes en nuestro análisis de costes.
Qué Significa Esto para Ti
Cuando desplegamos IA para tu negocio, obtienes esta misma arquitectura, dimensionada a tu hardware y tus cargas. Una oficina pequeña no necesita dos DGX Spark: un mini PC o un Mac con memoria para un modelo de 7-8B cubre muchas tareas. Lo dimensionamos probando tu carga, no adivinando.
Velo en Acción
Hacemos demos en vivo de este stack durante nuestras llamadas de evaluación gratuitas. Sin diapositivas, sin maquetas: el sistema real, con modelos reales, sobre tus consultas de ejemplo.
Reserva tu evaluación gratuita de 15 minutos y comprueba cómo es la IA local en la práctica.
Este es el post 2 de nuestra serie Semana de Lanzamiento. Ayer: Checklist de Preparación para IA Local. Mañana: Nuestros Servicios y Precios.
Referencias externas: Ollama | vLLM | LiteLLM | n8n | Astro | RGPD en EUR-Lex
Lecturas relacionadas
- Tus Primeros 3 Agentes IA: Guía de Despliegue Local para PYMEs (2026)
- IA en la Nube vs Local: Análisis Real de Costes para PYMEs Españolas en 2026
- Bienvenidos a VORLUX AI: IA Que Se Queda Donde Viven Tus Datos
Siguientes pasos
- Comprueba cuál de los modelos de arriba cabe en tu propio hardware.
- Convierte una tarea recurrente en un trabajo programado.
- Compara el coste de funcionamiento de un stack local con tus facturas actuales de la nube.
Trabaja con nosotros
Podemos hacer este análisis con tus datos reales antes de recomendar hardware. Una conversación de 30 minutos suele bastar para saber si tiene sentido en tu caso: reserva una llamada o mira cómo trabajamos en consultoría.