Ver todos los artículos
modeloscodigo-abiertoedge-aianalisis

Mistral Small 24B: el modelo europeo, multilingüe y abierto

JG
Jacobo González Jaspe
|

Revisado:

Ilustración abstracta: esferas de vidrio anidadas con una luz ámbar en el centro. Modelos
Ilustración generada con IA en nuestra máquina.
Este artículo también está en inglés:Mistral Small 24B: Europe's Multilingual, Open-Source Model

Actualizado el 9 de octubre de 2026. Este artículo es de abril de 2026 y compara con GPT-4o-mini, Llama 3.3 y Qwen 2.5. El método sigue valiendo; para opciones locales más nuevas según tu memoria, mira nuestra tabla por hardware y tarea.

Hay algo apropiado en que una empresa con sede en París construya un modelo abierto multilingüe para empresas europeas. Mistral AI lanzó Mistral Small 24B Instruct 2501 en enero de 2025, y es una buena opción por defecto para cualquier tarea que toque varios idiomas europeos.

Aquí van los números reales, los compromisos honestos y dónde encaja.

Open source AI model comparison

Los Benchmarks Reales (De HuggingFace, No de Marketing)

La mayoría de reseñas eligen benchmarks a conveniencia. Aquí va la imagen completa de la ficha oficial del modelo, mostrando cómo se compara con modelos más pequeños y más grandes:

Razonamiento y Conocimiento

BenchmarkMistral Small 24BGemma 2 27BLlama 3.3 70BQwen 2.5 32BGPT-4o-mini
MMLU-Pro (5-shot)66,3%53,6%66,6%68,3%61,7%
GPQA (5-shot)45,3%34,4%53,1%40,4%37,7%

Programación y Matemáticas

BenchmarkMistral Small 24BGemma 2 27BLlama 3.3 70BQwen 2.5 32BGPT-4o-mini
HumanEval (Pass@1)84,8%73,2%85,4%90,9%89,0%
Math Instruct70,6%53,5%74,3%81,9%76,1%

Seguimiento de Instrucciones y Conversación

BenchmarkMistral Small 24BGemma 2 27BLlama 3.3 70BQwen 2.5 32BGPT-4o-mini
MTBench Dev8,357,867,968,268,33
Arena Hard87,3%78,8%84,0%86,0%89,7%
IFEval82,9%80,7%88,4%84,0%85,0%

La negrita marca la mejor puntuación de cada fila. Fuente: ficha del modelo de Mistral, consultada el 2026-10-09.

Lo que esto nos dice: frente a GPT-4o-mini, Mistral Small 24B gana 2 de las 7 filas (MMLU-Pro, GPQA), empata en MT-Bench (8,35 frente a 8,33, dentro del ruido) y pierde las otras 4: HumanEval, Math Instruct, Arena Hard e IFEval. Así que se acerca a GPT-4o-mini, no lo iguala en todo, y corre en tu propio hardware. También queda por detrás de Llama 3.3 70B en razonamiento, pero Llama 3.3 70B es una descarga de 43 GB en Ollama frente a 14 GB de Mistral Small, unas 3 veces la memoria.

xychart-beta
    title "Mistral Small 24B — Efficiency Sweet Spot"
    x-axis ["MMLU-Pro", "HumanEval", "MATH"]
    y-axis "Score (%)" 0 --> 100
    bar [66.3, 84.8, 70.6]
Diagrama

La verdadera historia es el valor por parámetro: con 24B queda a pocos puntos de Llama 3.3 70B en MMLU-Pro y HumanEval, según la propia tabla de Mistral.

La Ventaja Multilingüe

Aquí es donde mejor encaja Mistral Small. La ficha dice que “soporta docenas de idiomas” y nombra inglés, francés, alemán, español, italiano, chino, japonés, coreano, portugués, neerlandés y polaco.

Para una empresa europea, esto no es un extra. Es la diferencia entre:

  • Un modelo que gestiona tus tickets de clientes en español, documentos de cumplimiento en alemán, marketing en francés y comunicaciones internas en inglés
  • Cuatro modelos separados (o APIs caras en la nube) cosidos con middleware de traducción

La ficha no incluye benchmarks de redacción empresarial en español o francés, así que pruébalo con tu propio contenido antes de decidir.

Hardware: Lo Que Realmente Necesitas

Tamaños de descarga de la biblioteca de Ollama, consultada el 2026-10-09. Suma unos pocos GB para el contexto.

CuantizaciónDescargaDispositivosNuestra recomendación
Q4_K_M14 GBGPU de 24 GB (RTX 4090), Mac de 24-32 GBLo mejor para la mayoría de pymes
Q8_025 GBGPU de 32 GB+, Mac de 48 GBMás cerca de la calidad completa
FP1647 GBGPU de 80 GB, Mac de 64 GBCalidad máxima, no necesaria para la mayoría

La versión Q4 es una compra única de hardware, no una factura mensual de API. Para la comparativa de costes, mira nuestro análisis de costes nube vs IA local.

Dónde Encaja

Las tareas donde compensa un modelo multilingüe de 24B:

  • Comunicaciones con clientes: redactar emails e informes en español e inglés
  • Base de conocimiento: generar y revisar artículos sobre regulación europea
  • Investigación: resumir perfiles de empresa y datos de mercado de fuentes en varios idiomas
  • Localización: primeros borradores en español e inglés del mismo documento

En nuestro DGX Spark usamos ahora qwen3.6:35b y gemma4:26b para este tipo de trabajo (ollama list, 2026-10-09), porque el equipo tiene memoria para ellos. En una máquina de 24-32 GB, Mistral Small es la opción multilingüe sensata.

Los Compromisos Honestos

Seamos justos sobre lo que NO hace bien:

  • Matemáticas y programación: Qwen 2.5 32B lo supera significativamente (81,9% vs 70,6% en matemáticas). Si tu caso de uso principal es generación de código, Qwen o Llama 3.3 son mejores opciones.
  • Razonamiento complejo: Llama 3.3 70B rinde más en GPQA (53,1% vs 45,3%). Para tareas analíticas profundas, necesitas un modelo más grande.
  • Longitud de contexto: 32K tokens es bueno pero no excepcional. Para procesar documentos muy largos, puede que necesites modelos con 128K+ de contexto.
  • Velocidad en hardware pequeño: Con 24B parámetros, es más lento que Gemma 2 9B o Phi-4 en el mismo dispositivo. Si la latencia importa más que la calidad, considera un modelo más pequeño.

Cómo Empezar (5 Minutos)

bash
# Instalar Ollama
curl -fsSL https://ollama.com/install.sh | sh

# Descargar Mistral Small (cuantizado para hardware típico)
ollama pull mistral-small

# Probar con un prompt multilingüe
ollama run mistral-small "Traduce esta cláusula contractual al inglés y resume los puntos clave: [tu texto aquí]"

# Servir como API para tus aplicaciones
ollama serve

¿Quién Debería Usar Este Modelo?

Elige Mistral Small 24B si necesitas soporte multilingüe para idiomas europeos, quieres licencia open-source (Apache 2.0) y tienes 14+ GB de VRAM disponible.

Elige otro si tu trabajo es principalmente programación/matemáticas solo en inglés (usa Qwen 2.5) o necesitas el mejor rendimiento absoluto en razonamiento (usa Llama 3.3 70B).

Para una comparativa más amplia, ve nuestra guía de modelos LLM locales Q2 2026.


¿Quieres ayuda desplegando Mistral Small en tu empresa? Nos especializamos en despliegues de IA local para pymes europeas: privados, asequibles, conformes con el RGPD. Reserva una evaluación gratuita →


Fuentes: Mistral Small 24B (HuggingFace) · MarkTechPost · Mistral AI


Lecturas relacionadas

  • Llama 3.3 70B Instruct: El gigante open-source que planta cara a GPT-4o de verdad
  • Qwen 2.5 72B Instruct: La potencia de 29 idiomas que merece estar en toda lista corta de IA local
  • Qwen2.5-Coder-7B-Instruct: Análisis Completo

Trabaja con nosotros

Podemos hacer este análisis con tus datos reales antes de recomendar hardware. Una conversación de 30 minutos suele bastar para saber si tiene sentido en tu caso: reserva una llamada o mira cómo trabajamos en consultoría.

Diagrama
Compartir: LinkedIn X
Veredicto semanal

Recibe las guías nuevas antes que nadie

Suscríbete y te avisamos cuando publiquemos guías, plantillas y workflows nuevos. Un correo a la semana, sin spam.

Ya publicados: 67 guías y 25 plantillas. Todo gratis y sin registro.

Bonus: el kit de inicio de IA local en PDF al suscribirte
1x por semana Sin spam Cancela cuando quieras

Ver qué recibes

La Ley de IA de la UE ya aplica: una lista que puedes completar

Cuéntanos qué quieres ejecutar

Dinos qué quieres ejecutar y con qué presupuesto. Te decimos qué hardware necesitas, qué modelo encaja y qué puedes esperar de él, antes de que gastes nada.

Primera llamada gratis, 15 min Local-first: tus datos no salen de tu red Herramientas y guías abiertas

67 guías gratuitas · 17 plantillas de cumplimiento