Ver todos los artículos
modeloscodigo-abiertoedge-aianalisis

Microsoft Phi-4: el pequeño gigante de las matemáticas

JG
Jacobo González Jaspe
|

Revisado:

Ilustración abstracta: cintas de luz ámbar y blanca que se entrelazan en una curva suave. Modelos
Ilustración generada con IA en nuestra máquina.
Este artículo también está en inglés:Microsoft Phi-4: The Tiny Giant That Beats 70B Models at Math

Actualizado el 4 de octubre de 2026. Este artículo es de abril de 2026 y cita GPT-4o, Qwen 2.5 como modelos actuales. El método y los consejos siguen valiendo; hoy lo harías con:

  • Gemma 4: Puedes usar sus versiones pequeñas para tareas de lógica similares si buscas mayor eficiencia en tu propio hardware.
  • DeepSeek V4: Si necesitas un rendimiento superior en matemáticas y no te importa usar un modelo de mayor tamaño.

Hay algo satisfactorio en un modelo pequeño que compite por encima de su categoría. Phi-4 de Microsoft, con solo 14 mil millones de parámetros, obtiene un 80,4 % en el benchmark MATH según la propia Microsoft, superando el 74,6 % de GPT-4o en la misma prueba. También alcanza un 56,1 % en GPQA, la puntuación más alta de la tabla comparativa de Microsoft, por encima del 50,6 % de GPT-4o y del 40,9 % de GPT-4o-mini.

Para las pymes que ejecutan IA en local, esto es utilidad real. Significa potencia de razonamiento en hardware que cuesta una fracción de lo que exige un modelo de 70B. Una GPU de gaming con 12 GB o más puede ejecutar Phi-4. Un Mac con 16GB de RAM también. Es IA que cabe en presupuestos existentes.

Open source AI model comparison

Por qué importan los datos de entrenamiento

Microsoft Research tomó un camino fundamentalmente diferente con la serie Phi. En lugar de escalar parámetros para forzar el rendimiento, se centraron en la calidad de los datos de entrenamiento. Phi-4 fue entrenado con 9,8 billones de tokens usando 1.920 GPUs H100 durante 21 días. La innovación clave: uso extensivo de datos de entrenamiento sintéticos, similares a libros de texto — ejemplos cuidadosamente generados diseñados para enseñar patrones de razonamiento en lugar de memorizar texto de internet.

El modelo soporta una ventana de contexto de 16K y se distribuye bajo licencia MIT, lo que significa que no hay restricciones de uso comercial. Puedes desplegarlo, modificarlo y construir productos sobre él sin preocupaciones de licencias.

Comparativa de benchmarks

BenchmarkPhi-4 (14B)Llama 3.3 70BQwen 2.5 72BGPT-4oGPT-4o-mini
MMLU84,8 %86,3 %85,3 %88,1 %81,8 %
GPQA56,1 %49,1 %49,0 %50,6 %40,9 %
MATH80,4 %66,3 %80,0 %74,6 %73,0 %
HumanEval (código)82,6 %78,9 %80,4 %90,6 %86,2 %
MGSM (matemáticas multilingüe)80,6 %89,1 %87,3 %90,4 %86,5 %

Fuente: todas las cifras proceden de la evaluación de la propia Microsoft (simple-evals), publicada en la ficha del modelo Phi-4 y en el informe técnico de Phi-4. Son benchmarks del fabricante; tus resultados en tus tareas serán distintos.

xychart-beta
    title "Phi-4 14B — Punches Above Its Weight"
    x-axis ["MMLU", "MATH", "HumanEval", "GPQA"]
    y-axis "Score (%)" 0 --> 100
    bar [84.8, 80.4, 82.6, 56.1]
Diagrama

Mira las columnas GPQA y MATH. En la tabla de Microsoft, un modelo de 14B supera a GPT-4o en matemáticas y tiene la puntuación GPQA más alta de todos los modelos listados. La puntuación de 84,8 % en MMLU se acerca al 86,3 % de Llama 3.3 70B — un modelo cinco veces más grande. La puntuación de 82,6 % en HumanEval demuestra que tampoco se queda atrás en generación de código.

La contrapartida se muestra en MGSM, donde el razonamiento matemático multilingüe del modelo queda por detrás de los modelos más grandes. Si tu caso de uso es muy multilingüe, modelos como Qwen 2.5 72B o Llama 3.3 70B te servirán mejor ahí.

Requisitos de hardware

Aquí es donde Phi-4 realmente brilla para las pymes:

ConfiguraciónMemoriaRendimientoNotas
Cuantizado Q4_K_M~9 GB (descarga de Ollama 9,1 GB)Bueno, listo para producciónRTX 3060 12GB, RTX 4060 Ti 16GB, Mac 16GB
Cuantizado Q5_K_M~10-11 GBMejor calidadGPU de 12-16 GB, Mac 16GB+
FP16 completo~30 GB (14.700 millones de parámetros × 2 bytes)Calidad máximaGPU de 32 GB+, Mac con 36GB+

Unos nueve gigabytes. Esa es la huella cuantizada. Una GPU de gaming con 12 GB puede ejecutar este modelo a calidad de producción. Un Mac con 16GB de memoria unificada lo maneja. Esto no es “técnicamente posible con advertencias” — funciona genuinamente bien en hardware de consumo.

Para una comparación detallada de los costes de despliegue local frente a APIs en la nube, consulta nuestro análisis de costes IA en la nube vs local.

Casos de uso prácticos para pymes europeas

Análisis financiero y contabilidad. El razonamiento matemático hace de Phi-4 ideal para procesar facturas, verificar cálculos, analizar estados financieros y generar resúmenes. Una asesoría contable puede ejecutarlo en cada estación de trabajo sin compras de hardware adicional.

Validación de datos y control de calidad. Cualquier empresa que procese datos estructurados — hojas de cálculo, formularios, bases de datos — puede usar Phi-4 para verificar cálculos, detectar anomalías y señalar inconsistencias. Funciona lo suficientemente rápido para validación en tiempo real.

Documentación técnica. Para firmas de ingeniería, consultorías y fabricantes que producen informes técnicos, Phi-4 ayuda con redacción estructurada, verificación de fórmulas y revisión de contenido. La capacidad de razonamiento significa que realmente entiende el material con el que trabaja.

Revisión de código y asistencia al desarrollo. Con un 82,6 % en HumanEval, Phi-4 es un asistente de programación capaz que funciona en una sola GPU. Equipos de desarrollo pequeños pueden desplegarlo como herramienta de revisión de código local sin enviar código propietario a APIs externas.

Despliegue edge en hardware pequeño. Phi-4 necesita unos 9 GB, así que no cabe en una placa de 8 GB como la Jetson Orin Nano; un mini PC o un Mac de 16 GB es el mínimo realista. Para dispositivos de 8 GB, mira modelos más pequeños como Phi-4-mini (3,8B).

Cómo empezar

Con Ollama, puedes estar funcionando en menos de dos minutos:

bash
# Instalar Ollama
curl -fsSL https://ollama.com/install.sh | sh

# Descargar Phi-4 (descarga cuantizada de 9,1 GB)
ollama pull phi4

# Empezar a usarlo
ollama run phi4

Para integración en flujos de trabajo existentes:

bash
# Servir como API
ollama serve

# Usar desde cualquier aplicacion
curl http://localhost:11434/api/generate -d '{
  "model": "phi4",
  "prompt": "Calcula la TIR para los siguientes flujos de caja: -100000, 25000, 30000, 35000, 40000, 50000"
}'

Para una visión más amplia de qué modelos funcionan mejor para diferentes tareas en diferente hardware, consulta nuestra comparativa de LLMs locales Q2 2026.

Contrapartidas honestas

Phi-4 no es perfecto. Su puntuación en matemáticas multilingües (MGSM 80,6 %) queda por detrás de modelos más grandes en la propia tabla de Microsoft, así que si necesitas fuertes capacidades en idiomas distintos al inglés, busca en otro lado. La ventana de contexto de 16K es adecuada para la mayoría de tareas pero limitante para documentos muy largos — modelos con 128K+ de contexto los manejarán mejor. Y aunque su razonamiento es excepcional para su tamaño, para los problemas más difíciles un modelo de 70B+ o una API de frontera seguirá superándolo.

La historia de licencias es excelente. La licencia MIT significa cero restricciones — úsalo como quieras, comercialmente o de cualquier otra forma.

Lecturas relacionadas

Conclusión

Microsoft Phi-4 es la prueba de que más grande no siempre es mejor. Con 14B parámetros, los benchmarks de la propia Microsoft sitúan su rendimiento en matemáticas y razonamiento por delante de modelos cinco veces más grandes. Supera a GPT-4o en MATH y encabeza la tabla comparativa de Microsoft en GPQA. Y funciona en hardware que probablemente ya tienes.

Para pymes europeas que quieren capacidad real de IA sin la factura de hardware de un modelo de 70B, Phi-4 es el punto de partida obvio — especialmente para trabajo analítico, cuantitativo y relacionado con código.

Trabaja con nosotros

Podemos hacer este análisis con tus datos reales antes de recomendar hardware. Una conversación de 30 minutos suele bastar para saber si tiene sentido en tu caso: reserva una llamada o mira cómo trabajamos en consultoría.

Diagrama
Compartir: LinkedIn X
Veredicto semanal

Recibe las guías nuevas antes que nadie

Suscríbete y te avisamos cuando publiquemos guías, plantillas y workflows nuevos. Un correo a la semana, sin spam.

Ya publicados: 66 guías y 25 plantillas. Todo gratis y sin registro.

Bonus: el kit de inicio de IA local en PDF al suscribirte
1x por semana Sin spam Cancela cuando quieras

Ver qué recibes

La Ley de IA de la UE ya aplica: una lista que puedes completar

Cuéntanos qué quieres ejecutar

Dinos qué quieres ejecutar y con qué presupuesto. Te decimos qué hardware necesitas, qué modelo encaja y qué puedes esperar de él, antes de que gastes nada.

Primera llamada gratis, 15 min Local-first: tus datos no salen de tu red Herramientas y guías abiertas

66 guías gratuitas · 17 plantillas de cumplimiento