Actualizado el 4 de octubre de 2026. Este artículo es de abril de 2026 y cita GPT-4o, Claude 3.5, Llama 3.1, Qwen 2.5, Qwen2.5 como modelos actuales. El método y los consejos siguen valiendo; hoy lo harías con:
- DeepSeek V4: puedes usarlo para tareas de código más pesadas si tu infraestructura soporta el nuevo tamaño de pesos.
- Gemma 4: es una opción más ligera para ejecutar en hardware local con menos VRAM.
- Llama 4 Scout / Maverick: te servirá para razonamiento rápido en servidores con menor latencia.
Cuando DeepSeek V3 apareció, cambió la conversación sobre lo que los modelos open-weight pueden lograr. Lo construyó un laboratorio chino de IA y se entrenó con 14,8 billones de tokens en 2.788 millones de horas GPU H800. Según la evaluación de la propia DeepSeek, iguala o supera a GPT-4o en varios benchmarks exigentes, sobre todo de programación y matemáticas. ¿El problema? Con 671 mil millones de parámetros, es demasiado grande para cualquier estación de trabajo local. Seamos claros desde el principio sobre lo que ofrece este modelo, lo que cuesta ejecutarlo y lo que las empresas europeas deben considerar antes de adoptarlo.

flowchart LR
INPUT["Token de Entrada"] --> ROUTER["Red de\nEnrutamiento"]
ROUTER --> E1["Experto 1"]
ROUTER --> E2["Experto 2"]
ROUTER -.->|inactivo| E3["Experto 3"]
ROUTER -.->|inactivo| E4["..."]
ROUTER -.->|inactivo| E128["Experto 128"]
E1 --> COMBINE["Combinar\nResultados"]
E2 --> COMBINE
subgraph TOTAL ["671B Parametros Totales"]
ROUTER
E1
E2
E3
E4
E128
end
subgraph ACTIVE ["37B Activos por Token"]
E1
E2
end
COMBINE --> MTP["Prediccion\nMulti-Token"]
MTP --> OUTPUT["Tokens de Salida"]
style INPUT fill:#DBEAFE,stroke:#2563EB,color:#000
style ROUTER fill:#FEF3C7,stroke:#F5A623,color:#000
style E1 fill:#D1FAE5,stroke:#059669,color:#000
style E2 fill:#D1FAE5,stroke:#059669,color:#000
style E3 fill:#FECACA,stroke:#B91C1C,color:#000
style E4 fill:#FECACA,stroke:#B91C1C,color:#000
style E128 fill:#FECACA,stroke:#B91C1C,color:#000
style COMBINE fill:#FEF3C7,stroke:#F5A623,color:#000
style MTP fill:#DBEAFE,stroke:#2563EB,color:#000
style OUTPUT fill:#D1FAE5,stroke:#059669,color:#000Cómo funciona Mixture-of-Experts (en términos simples)
La mayoría de los modelos de lenguaje son “densos” — cada parámetro participa en cada cálculo. DeepSeek V3 usa un enfoque diferente llamado Mixture-of-Experts (MoE). Imaginalo como una empresa con 671 mil millones de empleados, pero para cada tarea, solo 37 mil millones de ellos trabajan realmente en ella. Una red de enrutamiento decide que sub-redes “expertas” gestionan cada token.
El resultado: obtienes la profundidad de conocimiento de un modelo de 671B con una velocidad de inferencia más cercana a un modelo denso de 37B. DeepSeek también introdujo Multi-Token Prediction (MTP) para generación más rápida y entrenamiento en precisión mixta FP8 para reducir costes. El modelo soporta una ventana de contexto de 128K, que es generosa para tareas con documentos largos.
Benchmarks reales — números honestos
Estos números provienen directamente de la ficha oficial del modelo en HuggingFace y del informe técnico de DeepSeek.
| Benchmark | DeepSeek V3 | GPT-4o (0513) | Claude 3.5 Sonnet (1022) | Llama 3.1 405B | Qwen2.5 72B |
|---|---|---|---|---|---|
| MMLU (Chat) | 88,5 % | 87,2 % | 88,3 % | 88,6 % | 85,3 % |
| MMLU (Base, 5-shot) | 87,1 % | — | — | 84,4 % | — |
| MMLU-Pro | 75,9 % | 72,6 % | 78,0 % | 73,3 % | 71,6 % |
| GPQA Diamond | 59,1 % | 49,9 % | 65,0 % | 51,1 % | 49,0 % |
| MATH-500 | 90,2 % | 74,6 % | 78,3 % | 73,8 % | 80,0 % |
| AIME 2024 | 39,2 % | 9,3 % | 16,0 % | 23,3 % | 23,3 % |
| HumanEval-Mul (código) | 82,6 % | 80,5 % | 81,7 % | 77,2 % | 77,3 % |
| LiveCodeBench (Pass@1-COT) | 40,5 % | 33,4 % | 36,3 % | 28,4 % | 31,1 % |
| Codeforces (percentil) | 51,6 | 23,6 | 20,3 | 25,3 | 24,8 |
| Arena Hard | 85.5 | 80.4 | 85.2 | 69.3 | 81.2 |
Fuentes: DeepSeek V3 en HuggingFace, Informe técnico de DeepSeek (arXiv). Todas las columnas son mediciones de la propia DeepSeek, publicadas con el modelo en diciembre de 2024; las versiones más nuevas de los otros modelos puntúan distinto.
Los resultados destacados: DeepSeek V3 alcanza un 90,2 % en MATH-500 (muy por delante del 74,6 % de GPT-4o en la misma tabla), y percentil 51,6 en Codeforces frente al 23,6 de GPT-4o. En LiveCodeBench, logra un 40,5 % comparado con el 33,4 % de GPT-4o. Según las cifras de DeepSeek, en cargas intensivas en código y matemáticas superaba a los modelos comerciales más usados de su momento.
En conocimiento general (MMLU) y razonamiento científico (GPQA Diamond), es competitivo pero no dramáticamente superior — Claude 3.5 Sonnet le supera en GPQA (65,0 % frente a 59,1 %), y las puntuaciones de MMLU quedan a unos tres puntos entre los modelos comparados.
La realidad del hardware — esto NO es un modelo local
Seamos directos. DeepSeek V3 tiene 671 mil millones de parámetros. Incluso con MoE reduciendo los parámetros activos a 37B por token, los pesos completos del modelo aún deben cargarse en memoria.
| Configuración | VRAM necesaria | Viabilidad |
|---|---|---|
| FP16 completo | ~1,3 TB | Solo cluster de servidores (mínimo 16x A100 80GB) |
| Cuantizado Q4 | ~404 GB (descarga de Ollama) | Servidor multi-GPU de gama alta |
| Cuant. agresiva Q2/Q3 | ~200 GB | Posible pero con pérdida significativa de calidad |
| API en la nube | N/A | La opción más práctica para casi todos |
Si has oído hablar de ejecutar modelos en local vía Ollama, DeepSeek V3 tiene cuantizaciones contribuidas por la comunidad, pero necesitarías hardware que la mayoría de empresas simplemente no tienen:
# Disponible en Ollama, pero la descarga Q4 por defecto ocupa 404 GB
ollama pull deepseek-v3
# Para trabajo de programacion local practico, usa DeepSeek Coder V2 en su lugar
ollama pull deepseek-coder-v2:16bPara la mayoría de equipos, el camino realista es la API de DeepSeek, que usa un formato compatible con OpenAI y cuesta significativamente menos que GPT-4o por token.
Consideraciones geopolíticas para empresas europeas
DeepSeek es una empresa china de IA. Para empresas europeas que operan bajo el RGPD, esto plantea preguntas legítimas:
- Soberania de datos: Las consultas enviadas a la API de DeepSeek viajan a infraestructura china. Si procesas datos personales o información comercial confidencial, esto puede entrar en conflicto con tu postura de cumplimiento del RGPD.
- Incertidumbre regulatoria: El panorama de transferencia de datos UE-China esta menos consolidado que los acuerdos UE-EEUU. No existe una decisión de adecuacion para China bajo el RGPD.
- Código bajo MIT, pesos bajo la licencia de DeepSeek: El código en sí está disponible libremente bajo licencia MIT, y los pesos del modelo están bajo el Acuerdo de Modelo de DeepSeek. Si lo autoalojas en infraestructura europea, tu controlas donde van los datos — pero el autoalojamiento requiere el hardware masivo descrito arriba.
El enfoque pragmático para pymes europeas: usa DeepSeek V3 vía API para tareas no sensibles (análisis de datos públicos, asistencia en programación, síntesis de investigacion), y mantiene las cargas de trabajo sensibles en modelos locales o alternativas alojadas en Europa. Para una mirada más profunda a la economía del despliegue local, consulta nuestro análisis de costes nube vs local.
Cuándo usar DeepSeek V3 (y cuándo no)
Casos de uso solidos:
- Tareas complejas de programación y programación competitiva
- Matemáticas avanzadas, ciencia de datos y análisis cuantitativo
- Síntesis de investigacion y razonamiento científico
- Procesamiento por lotes de tareas analiticas no sensibles vía API
Piensalo dos veces cuando:
- Proceses datos personales sujetos al RGPD
- Necesites disponibilidad garantizada independiente de infraestructura china
- El despliegue local sea un requisito firme (el modelo es simplemente demasiado grande)
- Necesites el razonamiento científico más fuerte (Claude 3.5 Sonnet lidera en GPQA Diamond en la propia tabla de DeepSeek)
Lecturas relacionadas
- DeepSeek R1: El Mejor Modelo de Razonamiento Open-Source que Puedes Ejecutar Localmente
- AESIA: Lo Que Toda Empresa Española que Usa IA Debe Saber en 2026
Conclusión
DeepSeek V3 es un logro genuinamente impresionante. Demuestra que los modelos open-weight de fuera del eje EEUU-Reino Unido pueden competir en la frontera, y su arquitectura MoE es una lección magistral en eficiencia. Los benchmarks de matemáticas y código hablan por sí mismos — 90,2 % en MATH-500 y percentil 51,6 en Codeforces eran lo mejor de toda la tabla comparativa de DeepSeek en su lanzamiento.
Pero para pymes europeas, no es un reemplazo directo para IA local. Los 671B parámetros lo sitúan firmemente en territorio de nube o cluster, y su origen chino añade una capa de gobernanza de datos que las empresas deben evaluar honestamente. El enfoque más inteligente es híbrido: usa DeepSeek V3 vía API donde destaca y la sensibilidad de los datos lo permite, mientras mantienes modelos más prácticos como Qwen 2.5 72B o Llama 3.3 70B para despliegue local.
Fuentes: Ficha del modelo DeepSeek V3 en HuggingFace, Informe técnico de DeepSeek, Sitio oficial de DeepSeek.
Trabaja con nosotros
Podemos hacer este análisis con tus datos reales antes de recomendar hardware. Una conversación de 30 minutos suele bastar para saber si tiene sentido en tu caso: reserva una llamada o mira cómo trabajamos en consultoría.