Ver todos los artículos
transparenciacodigo-abiertostackia-local

El stack de VORLUX AI: cada herramienta que usamos, sin nada oculto

JG
Jacobo González Jaspe
|

Revisado:

Ilustración abstracta: una cadena de bloques en arco unidos por enlaces de luz ámbar. Despliegue
Ilustración generada con IA en nuestra máquina.
Este artículo también está en inglés:The VORLUX AI Stack: Every Tool We Use, Nothing Hidden

Cuando les decimos a los clientes que su IA correrá localmente sin dependencia de la nube, la pregunta natural es: “Vale, pero ¿qué estás ejecutando exactamente?”. Pregunta justa. Si te pedimos que confíes en nosotros con tu infraestructura, mereces ver todo lo que hay debajo del capó.

Este post es nuestra divulgación tecnológica: cada componente, qué hace y por qué lo elegimos. La lista de modelos y los recuentos salen de nuestras propias máquinas, con la fecha y el comando que los produjo.

Los Componentes Principales

Esto es lo que impulsa VORLUX AI, desde la inferencia hasta la interfaz:

CapaTecnologíaFunciónPor qué esta
InferenciaOllamaSirve la mayoría de los modelosGestión sencilla de modelos, GPU, API estilo OpenAI
InferenciavLLMSirve Qwen2.5-7B-Instruct en el segundo SparkMás rendimiento con peticiones concurrentes
EnrutadoLiteLLMUna pasarela delante de todos los modelosCambias de modelo sin tocar a quien llama
APIFastAPI + PythonOrquestador en el puerto 8091Rápido, tipado, asíncrono
Base de datosSQLitePersistencia del orquestadorCero configuración, cero red
BúsquedaQdrant, FAISS + BM25Recuperación RAGBúsqueda híbrida vectorial + palabras clave
Embeddingsbge-m3, nomic-embed-textConvierten documentos en vectoresCorren en local en Ollama
Sitio públicoAstrovorluxai.comEstático primero, rápido
Automatizaciónn8nAutomatización de flujosFlujos visuales, autoalojado
Programacióntimers de systemd + APSchedulerTareas recurrentesSobreviven a reinicios, el sistema las registra
Hardware2x NVIDIA DGX SparkServidor principal y asistente128 GB de memoria unificada cada uno, una GPU GB10

Cada componente corre en nuestro hardware o en el del cliente. La inferencia nunca sale de la máquina.

Cómo Encaja Todo

flowchart TB
    subgraph CLIENT["Capa de Cliente"]
        SITE["Sitio Astro<br/>vorluxai.com"]
        N8N["Flujos n8n<br/>:5678"]
    end

    subgraph API_LAYER["API y Orquestación"]
        ORCH["Orquestador FastAPI<br/>:8091"]
        GW["Pasarela LiteLLM<br/>:4000"]
    end

    subgraph INFERENCE["Capa de Inferencia"]
        OLLAMA["Ollama<br/>:11434"]
        VLLM["vLLM en Spark 2<br/>:8200"]
        RAG["Qdrant + FAISS/BM25<br/>Búsqueda RAG"]
    end

    subgraph DATA["Capa de Datos"]
        SQLITE[("SQLite<br/>BD del orquestador")]
    end

    N8N --> ORCH
    ORCH --> GW
    GW --> OLLAMA
    GW --> VLLM
    ORCH --> RAG
    ORCH --> SQLITE

    style CLIENT fill:#0B1628,color:#FAFAFA
    style INFERENCE fill:#059669,color:#fff
    style DATA fill:#F5A623,color:#0B1628
Diagrama

Los Modelos Que Usamos

No todas las tareas necesitan el mismo modelo. Guardamos una biblioteca en disco y enrutamos cada petición al adecuado con LiteLLM. El 2026-10-09, ollama list en nuestro DGX Spark principal (spark-43d5) mostraba 20 modelos, entre ellos:

ModeloTamaño de descargaPara qué lo usamos
qwen3.6:35b23 GBRazonamiento general y redacción en español
gemma4:26b17 GBSegunda opinión, borradores largos
qwen2.5vl:72b48 GBLeer documentos escaneados e imágenes
deepseek-r1:14b9,0 GBRazonamiento paso a paso
llama3.1:8b4,9 GBTareas rápidas y ligeras
qwen2.5-coder:7b4,7 GBGeneración y revisión de código
bge-m3, nomic-embed-text1,2 GB, 274 MBEmbeddings para búsqueda

El resto son ajustes finos propios (las familias apprendere y j4sgon-finance) y modelos pequeños de visión y avatar. No están todos cargados a la vez. En el mismo momento, ollama ps mostraba tres modelos en memoria: llama3.1:8b, qwen2.5-coder:7b y bge-m3. Ollama carga un modelo con la primera petición y lo descarga tras un tiempo sin uso, así que la memoria va a lo que se está usando.

Un modelo de 72B que ocupa 48 GB no cabría junto a otros en un portátil de 32 GB. Aquí cabe porque cada Spark tiene 128 GB de memoria unificada compartida entre CPU y GPU.

Qué Corre de Forma Programada

El sistema no solo responde peticiones. El 2026-10-09, systemctl --user list-timers --all en el Spark principal listaba 68 timers. Cubren:

  • Contenido: pasos de investigación, borrador, revisión y publicación, con una revisión humana antes de que nada salga en vivo
  • Calidad: tests, comprobación de enlaces del sitio construido, actualizaciones de la base de conocimiento
  • Monitorización: comprobaciones de salud y watchdogs que reinician un servicio tras varios fallos seguidos
  • Copias de seguridad: bundles de git diarios de cada repositorio e instantáneas de las bases de datos

Un watchdog reinicia el orquestador solo tras tres comprobaciones fallidas seguidas, así una respuesta lenta no tumba un servicio que funciona. Contamos la parte de despliegue en nuestra guía de despliegue local.

Por Qué Importa el Open-Source

Cada componente de nuestro stack es open-source o construido por nosotros. No es ideología: es práctica.

  1. Sin licencias: nuestros clientes no pagan licencias de software por el stack. Los costes son el hardware y nuestro tiempo.
  2. Sin dependencia del proveedor: si Ollama desaparece mañana, cambiamos a llama.cpp o vLLM. Mismos modelos, otro motor.
  3. Auditabilidad: los clientes regulados pueden revisar el código que toca sus datos. Eso apoya el deber de protección de datos desde el diseño del artículo 25 del RGPD, aunque ese deber se refiere a todo tu proceso, no a tu licencia.
  4. Proyectos maduros: Ollama, vLLM, n8n y Astro son proyectos muy usados y mantenidos, no experimentos.

Comparado con Stacks en la Nube

AspectoVORLUX AI (local)Stack típico en la nube
Ubicación de los datosTu hardwareLos centros de datos del proveedor
Coste de funcionamientoElectricidad y mantenimientoPago por token o por usuario
Internet necesario para inferirNoSí
Proveedor de IA como encargado RGPDNoSí, requiere contrato del art. 28
Cambio de modeloCambiar una ruta de LiteLLMDepende del catálogo del proveedor
Dependencia de disponibilidadTu electricidad y tu hardwareSu SLA
Registro de auditoríaLogs locales completosDepende del proveedor

El stack en la nube no es malo para todos. Para empresas que tratan datos sensibles bajo regulación europea, el despliegue local saca al proveedor de IA del flujo de datos. Analizamos los costes en nuestro análisis de costes.

Qué Significa Esto para Ti

Cuando desplegamos IA para tu negocio, obtienes esta misma arquitectura, dimensionada a tu hardware y tus cargas. Una oficina pequeña no necesita dos DGX Spark: un mini PC o un Mac con memoria para un modelo de 7-8B cubre muchas tareas. Lo dimensionamos probando tu carga, no adivinando.

Velo en Acción

Hacemos demos en vivo de este stack durante nuestras llamadas de evaluación gratuitas. Sin diapositivas, sin maquetas: el sistema real, con modelos reales, sobre tus consultas de ejemplo.

Reserva tu evaluación gratuita de 15 minutos y comprueba cómo es la IA local en la práctica.


Este es el post 2 de nuestra serie Semana de Lanzamiento. Ayer: Checklist de Preparación para IA Local. Mañana: Nuestros Servicios y Precios.

Referencias externas: Ollama | vLLM | LiteLLM | n8n | Astro | RGPD en EUR-Lex


Lecturas relacionadas

Siguientes pasos

  • Comprueba cuál de los modelos de arriba cabe en tu propio hardware.
  • Convierte una tarea recurrente en un trabajo programado.
  • Compara el coste de funcionamiento de un stack local con tus facturas actuales de la nube.

Trabaja con nosotros

Podemos hacer este análisis con tus datos reales antes de recomendar hardware. Una conversación de 30 minutos suele bastar para saber si tiene sentido en tu caso: reserva una llamada o mira cómo trabajamos en consultoría.

Diagrama
Compartir: LinkedIn X
Veredicto semanal

Recibe las guías nuevas antes que nadie

Suscríbete y te avisamos cuando publiquemos guías, plantillas y workflows nuevos. Un correo a la semana, sin spam.

Ya publicados: 66 guías y 25 plantillas. Todo gratis y sin registro.

Bonus: el kit de inicio de IA local en PDF al suscribirte
1x por semana Sin spam Cancela cuando quieras

Ver qué recibes

La Ley de IA de la UE ya aplica: una lista que puedes completar

Cuéntanos qué quieres ejecutar

Dinos qué quieres ejecutar y con qué presupuesto. Te decimos qué hardware necesitas, qué modelo encaja y qué puedes esperar de él, antes de que gastes nada.

Primera llamada gratis, 15 min Local-first: tus datos no salen de tu red Herramientas y guías abiertas

66 guías gratuitas · 17 plantillas de cumplimiento