Ver todos los artículos
modeloscodigo-abiertomultimodalanalisis

Llama 4 Scout y Maverick: análisis para despliegue local

JG
Jacobo González Jaspe
|

Revisado:

Ilustración abstracta: una red de nodos blancos unidos por líneas ámbar, como una constelación. Modelos
Ilustración generada con IA en nuestra máquina.

El 5 de abril de 2025, Meta lanzó Llama 4 Scout y Llama 4 Maverick. Estos modelos usan una arquitectura Mixture-of-Experts (MoE) que mantiene bajo el número de parámetros activos, pero ofrece un rendimiento que compite con modelos propietarios. Ambos son nativamente multimodales: procesan texto e imágenes sin adaptadores añadidos.

Para empresas que ejecutan IA localmente (ya sea por cumplimiento del RGPD, control de costes o latencia), esto cambia las cosas. Scout ofrece una ventana de contexto de 10 millones de tokens y, según Meta, cabe en una sola H100 con cuantización Int4. Maverick, que Meta sitúa por delante de GPT-4o en sus benchmarks de lanzamiento, tiene 128 expertos y solo 17 mil millones de parámetros activos por inferencia.

Analizamos la arquitectura, los benchmarks y el despliegue práctico.

Arquitectura: Cómo MoE Cambia las Reglas del Juego

Tanto Scout como Maverick usan una arquitectura Mixture-of-Experts. En lugar de activar cada parámetro para cada token, los modelos MoE enrutan cada entrada a través de un subconjunto de sub-redes “expertas” especializadas. El resultado: conteos masivos de parámetros totales con costes de inferencia eficientes.

flowchart TB
    subgraph Entrada["Capa de Entrada"]
        T[Token / Parche de Imagen]
    end

    subgraph Router["Router de Seleccion"]
        R[Seleccion de Expertos]
    end

    subgraph ExpertosScout["Scout: 16 Expertos"]
        direction LR
        SE1[Experto 1]
        SE2[Experto 2]
        SE3["..."]
        SE16[Experto 16]
    end

    subgraph ExpertosMaverick["Maverick: 128 Expertos"]
        direction LR
        ME1[Experto 1]
        ME2[Experto 2]
        ME3["..."]
        ME128[Experto 128]
    end

    subgraph Activos["Parametros Activos: 17B"]
        AP[Expertos Seleccionados Procesan Token]
    end

    subgraph Salida["Salida"]
        O[Resultado Combinado]
    end

    T --> R
    R -->|"Scout"| ExpertosScout
    R -->|"Maverick"| ExpertosMaverick
    ExpertosScout --> AP
    ExpertosMaverick --> AP
    AP --> O

    style Entrada fill:#0B1628,stroke:#F5A623,color:#fff
    style Router fill:#0B1628,stroke:#F5A623,color:#fff
    style ExpertosScout fill:#1a2744,stroke:#4a90d9,color:#fff
    style ExpertosMaverick fill:#1a2744,stroke:#4a90d9,color:#fff
    style Activos fill:#0B1628,stroke:#2ecc71,color:#fff
    style Salida fill:#0B1628,stroke:#F5A623,color:#fff
Diagrama

La clave: ambos modelos activan solo 17 mil millones de parámetros por inferencia, independientemente de su tamaño total. Esto es lo que hace que los modelos MoE sean prácticos para despliegue local: pagas costes de inferencia proporcionales a los parámetros activos, no a los totales.

EspecificaciónScoutMaverick
Parámetros activos17B17B
Total de expertos16128
Parámetros totales109B400B
Ventana de contexto10M tokens1M tokens
Tokens de entrenamiento40T22T
ModalidadesTexto + ImagenTexto + Imagen
ArquitecturaMoEMoE
Fecha de lanzamiento5 de abril de 20255 de abril de 2025

Scout fue entrenado con 40 billones de tokens, casi el doble de los 22 billones de Maverick, lo que contribuye a su fuerte rendimiento en benchmarks intensivos en conocimiento a pesar de tener menos expertos. Maverick compensa con 8 veces más expertos, dándole mejor especialización en tipos de tareas diversos.

Comparación de Benchmarks: Dónde Destaca Cada Modelo

Las puntuaciones son de Meta, tomadas de la ficha del modelo Llama 4 en su versión instruct (consultada el 2026-10-09). Son cifras del fabricante, no mediciones nuestras.

BenchmarkScoutMaverick
MMMU (razonamiento con imagen)69,473,4
MathVista (matemáticas visuales)70,773,7
ChartQA (comprensión de gráficos)88,890,0
DocVQA (QA de documentos)94,494,4
LiveCodeBench (programación)32,843,4
MMLU Pro (razonamiento)74,380,5
GPQA Diamond (razonamiento)57,269,8

En su anuncio de lanzamiento, Meta afirma que Maverick supera a GPT-4o y Gemini 2.0 Flash en una amplia gama de benchmarks, y que Scout supera a Gemma 3, Gemini 2.0 Flash-Lite y Mistral 3.1. Tómalo como afirmación del fabricante y prueba con tus propios documentos.

La diferencia es mayor en programación y razonamiento, donde se notan los expertos extra de Maverick. En QA de documentos (DocVQA) empatan a 94,4, así que para procesar documentos en hardware moderado, Scout es la opción más barata.

La Ventana de Contexto de 10 Millones de Tokens

La ventana de contexto de 10 millones de tokens de Scout no es un número de marketing. Habilita casos de uso que antes eran imposibles con modelos de código abierto:

  • Análisis de código completo: Cargar un repositorio entero de tamaño medio (100.000+ líneas) en un solo prompt
  • Procesamiento de documentos extensos: Analizar contratos legales completos, manuales técnicos o marcos regulatorios sin fragmentación
  • Síntesis multi-documento: Cruzar referencias de decenas de documentos simultáneamente

Para cargas de trabajo de cumplimiento (donde podrías necesitar analizar un texto regulatorio completo contra la documentación de tu empresa) esto es transformador. Sin pipeline RAG, sin estrategia de fragmentación, sin pérdida de información por recuperación. Solo el documento completo en contexto.

El contexto de 1 millón de tokens de Maverick sigue siendo sustancial, cubriendo la mayoría de los casos de uso en producción. La compensación es clara: Scout para trabajo intensivo en contexto, Maverick para trabajo intensivo en calidad.

¿Qué Pasa con Muse Spark?

Meta Superintelligence Labs lanzó Muse Spark el 8 de abril de 2026 (blog de Meta AI), un modelo multimodal de razonamiento. Funciona dentro de Meta AI y se ofrece como API en preview privada, no como pesos descargables. Para despliegue local, Scout y Maverick siguen siendo las opciones de Meta.

Meta no ha anunciado pesos abiertos para un sucesor, así que Llama 4 es la familia más reciente de Meta que puedes ejecutar en tu hardware. Compárala con modelos abiertos más nuevos de otros laboratorios antes de decidir.

Consideraciones de Despliegue en Hardware Local

Ejecutar estos modelos localmente requiere una planificación cuidadosa del hardware:

Scout (109B total, 17B activos): Meta dice que cabe en una sola H100 con cuantización Int4. La versión por defecto llama4:scout de Ollama (Q4_K_M) pesa 67 GB, así que necesitas una GPU de 80 GB o una máquina con 96 GB o más de memoria unificada. Dos tarjetas de consumo de 24 GB (48 GB) no bastan. Los contextos largos añaden caché KV encima de los pesos.

Maverick (400B total, 17B activos): Aunque tiene 400B parámetros totales, solo 17B están activos por token, así que el cómputo por token es parecido al de Scout. La memoria no: Ollama lista la versión FP16 en 803 GB, Q8_0 en 428 GB y Q4_K_M en 245 GB (ollama.com/library/llama4, consultado el 2026-10-09). Eso exige un servidor multi-GPU, y la comparativa de modelos locales muestra opciones más pequeñas para la mayoría de las PYMEs.

Ambos modelos funcionan con vLLM, llama.cpp y Ollama. Las etiquetas de Ollama que existen son llama4:scout (alias llama4:16x17b, 67 GB) y llama4:maverick (alias llama4:128x17b, 245 GB):

bash
# Scout con Ollama (Q4_K_M, descarga de 67 GB)
ollama pull llama4:scout
ollama run llama4:scout "Resume los requisitos clave del EU AI Act"

En VORLUX AI, desplegamos estos modelos en hardware edge para nuestros clientes PYME, optimizados para sus cargas de trabajo específicas.

Lecturas relacionadas

Conclusión

Llama 4 Scout y Maverick, lanzados en abril de 2025, son los modelos de pesos abiertos de Meta para despliegue local. La ventana de contexto de 10M de Scout y su entrenamiento con 40T tokens lo hacen ideal para cargas de trabajo intensivas en conocimiento y documentos. Los 128 expertos de Maverick y sus mejores puntuaciones en programación y razonamiento lo convierten en la elección correcta cuando la calidad es la prioridad.

Ambos modelos comparten la misma ventaja fundamental: son de código abierto, se ejecutan localmente y mantienen tus datos en tu hardware. En un entorno regulatorio donde las multas del RGPD totalizan 7.100 millones de euros y el EU AI Act añade otra capa sancionadora, eso no es solo una preferencia técnica, es un requisito empresarial.


¿Quieres desplegar Llama 4 en tu propia infraestructura? Contacta con VORLUX AI para una evaluación de hardware y un plan de despliegue adaptado a tu carga de trabajo. Nosotros nos encargamos de la optimización para que obtengas rendimiento de producción en hardware que tú controlas.

Fuentes: anuncio de Meta, 5 de abril de 2025 · ficha del modelo Llama 4 · etiquetas llama4 en Ollama · Llama 4 Official (Meta) · Llama 4 on HuggingFace · Scout vs Maverick (RunPod)


Trabaja con nosotros

Podemos hacer este análisis con tus datos reales antes de recomendar hardware. Una conversación de 30 minutos suele bastar para saber si tiene sentido en tu caso: reserva una llamada o mira cómo trabajamos en consultoría.

Diagrama
Compartir: LinkedIn X
Veredicto semanal

Recibe las guías nuevas antes que nadie

Suscríbete y te avisamos cuando publiquemos guías, plantillas y workflows nuevos. Un correo a la semana, sin spam.

Ya publicados: 66 guías y 25 plantillas. Todo gratis y sin registro.

Bonus: el kit de inicio de IA local en PDF al suscribirte
1x por semana Sin spam Cancela cuando quieras

Ver qué recibes

La Ley de IA de la UE ya aplica: una lista que puedes completar

Cuéntanos qué quieres ejecutar

Dinos qué quieres ejecutar y con qué presupuesto. Te decimos qué hardware necesitas, qué modelo encaja y qué puedes esperar de él, antes de que gastes nada.

Primera llamada gratis, 15 min Local-first: tus datos no salen de tu red Herramientas y guías abiertas

66 guías gratuitas · 17 plantillas de cumplimiento