Ver todos los artículos
modeloscodigo-abiertoiaanalisis

DeepSeek V3: un gigante open-weight de 671B para código

JG
Jacobo González Jaspe
|

Revisado:

Ilustración abstracta: un poliedro de cristal que refracta un haz de luz ámbar en rayos blancos. Modelos
Ilustración generada con IA en nuestra máquina.
Este artículo también está en inglés:DeepSeek V3: a 671B Open-Weight Giant for Code and Math

Actualizado el 4 de octubre de 2026. Este artículo es de abril de 2026 y cita GPT-4o, Claude 3.5, Llama 3.1, Qwen 2.5, Qwen2.5 como modelos actuales. El método y los consejos siguen valiendo; hoy lo harías con:

  • DeepSeek V4: puedes usarlo para tareas de código más pesadas si tu infraestructura soporta el nuevo tamaño de pesos.
  • Gemma 4: es una opción más ligera para ejecutar en hardware local con menos VRAM.
  • Llama 4 Scout / Maverick: te servirá para razonamiento rápido en servidores con menor latencia.

Cuando DeepSeek V3 apareció, cambió la conversación sobre lo que los modelos open-weight pueden lograr. Lo construyó un laboratorio chino de IA y se entrenó con 14,8 billones de tokens en 2.788 millones de horas GPU H800. Según la evaluación de la propia DeepSeek, iguala o supera a GPT-4o en varios benchmarks exigentes, sobre todo de programación y matemáticas. ¿El problema? Con 671 mil millones de parámetros, es demasiado grande para cualquier estación de trabajo local. Seamos claros desde el principio sobre lo que ofrece este modelo, lo que cuesta ejecutarlo y lo que las empresas europeas deben considerar antes de adoptarlo.

Open source AI model comparison
flowchart LR
    INPUT["Token de Entrada"] --> ROUTER["Red de\nEnrutamiento"]
    ROUTER --> E1["Experto 1"]
    ROUTER --> E2["Experto 2"]
    ROUTER -.->|inactivo| E3["Experto 3"]
    ROUTER -.->|inactivo| E4["..."]
    ROUTER -.->|inactivo| E128["Experto 128"]

    E1 --> COMBINE["Combinar\nResultados"]
    E2 --> COMBINE

    subgraph TOTAL ["671B Parametros Totales"]
        ROUTER
        E1
        E2
        E3
        E4
        E128
    end

    subgraph ACTIVE ["37B Activos por Token"]
        E1
        E2
    end

    COMBINE --> MTP["Prediccion\nMulti-Token"]
    MTP --> OUTPUT["Tokens de Salida"]

    style INPUT fill:#DBEAFE,stroke:#2563EB,color:#000
    style ROUTER fill:#FEF3C7,stroke:#F5A623,color:#000
    style E1 fill:#D1FAE5,stroke:#059669,color:#000
    style E2 fill:#D1FAE5,stroke:#059669,color:#000
    style E3 fill:#FECACA,stroke:#B91C1C,color:#000
    style E4 fill:#FECACA,stroke:#B91C1C,color:#000
    style E128 fill:#FECACA,stroke:#B91C1C,color:#000
    style COMBINE fill:#FEF3C7,stroke:#F5A623,color:#000
    style MTP fill:#DBEAFE,stroke:#2563EB,color:#000
    style OUTPUT fill:#D1FAE5,stroke:#059669,color:#000
Diagrama

Cómo funciona Mixture-of-Experts (en términos simples)

La mayoría de los modelos de lenguaje son “densos” — cada parámetro participa en cada cálculo. DeepSeek V3 usa un enfoque diferente llamado Mixture-of-Experts (MoE). Imaginalo como una empresa con 671 mil millones de empleados, pero para cada tarea, solo 37 mil millones de ellos trabajan realmente en ella. Una red de enrutamiento decide que sub-redes “expertas” gestionan cada token.

El resultado: obtienes la profundidad de conocimiento de un modelo de 671B con una velocidad de inferencia más cercana a un modelo denso de 37B. DeepSeek también introdujo Multi-Token Prediction (MTP) para generación más rápida y entrenamiento en precisión mixta FP8 para reducir costes. El modelo soporta una ventana de contexto de 128K, que es generosa para tareas con documentos largos.

Benchmarks reales — números honestos

Estos números provienen directamente de la ficha oficial del modelo en HuggingFace y del informe técnico de DeepSeek.

BenchmarkDeepSeek V3GPT-4o (0513)Claude 3.5 Sonnet (1022)Llama 3.1 405BQwen2.5 72B
MMLU (Chat)88,5 %87,2 %88,3 %88,6 %85,3 %
MMLU (Base, 5-shot)87,1 %——84,4 %—
MMLU-Pro75,9 %72,6 %78,0 %73,3 %71,6 %
GPQA Diamond59,1 %49,9 %65,0 %51,1 %49,0 %
MATH-50090,2 %74,6 %78,3 %73,8 %80,0 %
AIME 202439,2 %9,3 %16,0 %23,3 %23,3 %
HumanEval-Mul (código)82,6 %80,5 %81,7 %77,2 %77,3 %
LiveCodeBench (Pass@1-COT)40,5 %33,4 %36,3 %28,4 %31,1 %
Codeforces (percentil)51,623,620,325,324,8
Arena Hard85.580.485.269.381.2

Fuentes: DeepSeek V3 en HuggingFace, Informe técnico de DeepSeek (arXiv). Todas las columnas son mediciones de la propia DeepSeek, publicadas con el modelo en diciembre de 2024; las versiones más nuevas de los otros modelos puntúan distinto.

Los resultados destacados: DeepSeek V3 alcanza un 90,2 % en MATH-500 (muy por delante del 74,6 % de GPT-4o en la misma tabla), y percentil 51,6 en Codeforces frente al 23,6 de GPT-4o. En LiveCodeBench, logra un 40,5 % comparado con el 33,4 % de GPT-4o. Según las cifras de DeepSeek, en cargas intensivas en código y matemáticas superaba a los modelos comerciales más usados de su momento.

En conocimiento general (MMLU) y razonamiento científico (GPQA Diamond), es competitivo pero no dramáticamente superior — Claude 3.5 Sonnet le supera en GPQA (65,0 % frente a 59,1 %), y las puntuaciones de MMLU quedan a unos tres puntos entre los modelos comparados.

La realidad del hardware — esto NO es un modelo local

Seamos directos. DeepSeek V3 tiene 671 mil millones de parámetros. Incluso con MoE reduciendo los parámetros activos a 37B por token, los pesos completos del modelo aún deben cargarse en memoria.

ConfiguraciónVRAM necesariaViabilidad
FP16 completo~1,3 TBSolo cluster de servidores (mínimo 16x A100 80GB)
Cuantizado Q4~404 GB (descarga de Ollama)Servidor multi-GPU de gama alta
Cuant. agresiva Q2/Q3~200 GBPosible pero con pérdida significativa de calidad
API en la nubeN/ALa opción más práctica para casi todos

Si has oído hablar de ejecutar modelos en local vía Ollama, DeepSeek V3 tiene cuantizaciones contribuidas por la comunidad, pero necesitarías hardware que la mayoría de empresas simplemente no tienen:

bash
# Disponible en Ollama, pero la descarga Q4 por defecto ocupa 404 GB
ollama pull deepseek-v3

# Para trabajo de programacion local practico, usa DeepSeek Coder V2 en su lugar
ollama pull deepseek-coder-v2:16b

Para la mayoría de equipos, el camino realista es la API de DeepSeek, que usa un formato compatible con OpenAI y cuesta significativamente menos que GPT-4o por token.

Consideraciones geopolíticas para empresas europeas

DeepSeek es una empresa china de IA. Para empresas europeas que operan bajo el RGPD, esto plantea preguntas legítimas:

  • Soberania de datos: Las consultas enviadas a la API de DeepSeek viajan a infraestructura china. Si procesas datos personales o información comercial confidencial, esto puede entrar en conflicto con tu postura de cumplimiento del RGPD.
  • Incertidumbre regulatoria: El panorama de transferencia de datos UE-China esta menos consolidado que los acuerdos UE-EEUU. No existe una decisión de adecuacion para China bajo el RGPD.
  • Código bajo MIT, pesos bajo la licencia de DeepSeek: El código en sí está disponible libremente bajo licencia MIT, y los pesos del modelo están bajo el Acuerdo de Modelo de DeepSeek. Si lo autoalojas en infraestructura europea, tu controlas donde van los datos — pero el autoalojamiento requiere el hardware masivo descrito arriba.

El enfoque pragmático para pymes europeas: usa DeepSeek V3 vía API para tareas no sensibles (análisis de datos públicos, asistencia en programación, síntesis de investigacion), y mantiene las cargas de trabajo sensibles en modelos locales o alternativas alojadas en Europa. Para una mirada más profunda a la economía del despliegue local, consulta nuestro análisis de costes nube vs local.

Cuándo usar DeepSeek V3 (y cuándo no)

Casos de uso solidos:

  • Tareas complejas de programación y programación competitiva
  • Matemáticas avanzadas, ciencia de datos y análisis cuantitativo
  • Síntesis de investigacion y razonamiento científico
  • Procesamiento por lotes de tareas analiticas no sensibles vía API

Piensalo dos veces cuando:

  • Proceses datos personales sujetos al RGPD
  • Necesites disponibilidad garantizada independiente de infraestructura china
  • El despliegue local sea un requisito firme (el modelo es simplemente demasiado grande)
  • Necesites el razonamiento científico más fuerte (Claude 3.5 Sonnet lidera en GPQA Diamond en la propia tabla de DeepSeek)

Lecturas relacionadas

Conclusión

DeepSeek V3 es un logro genuinamente impresionante. Demuestra que los modelos open-weight de fuera del eje EEUU-Reino Unido pueden competir en la frontera, y su arquitectura MoE es una lección magistral en eficiencia. Los benchmarks de matemáticas y código hablan por sí mismos — 90,2 % en MATH-500 y percentil 51,6 en Codeforces eran lo mejor de toda la tabla comparativa de DeepSeek en su lanzamiento.

Pero para pymes europeas, no es un reemplazo directo para IA local. Los 671B parámetros lo sitúan firmemente en territorio de nube o cluster, y su origen chino añade una capa de gobernanza de datos que las empresas deben evaluar honestamente. El enfoque más inteligente es híbrido: usa DeepSeek V3 vía API donde destaca y la sensibilidad de los datos lo permite, mientras mantienes modelos más prácticos como Qwen 2.5 72B o Llama 3.3 70B para despliegue local.


Fuentes: Ficha del modelo DeepSeek V3 en HuggingFace, Informe técnico de DeepSeek, Sitio oficial de DeepSeek.


Trabaja con nosotros

Podemos hacer este análisis con tus datos reales antes de recomendar hardware. Una conversación de 30 minutos suele bastar para saber si tiene sentido en tu caso: reserva una llamada o mira cómo trabajamos en consultoría.

Diagrama
Compartir: LinkedIn X
Veredicto semanal

Recibe las guías nuevas antes que nadie

Suscríbete y te avisamos cuando publiquemos guías, plantillas y workflows nuevos. Un correo a la semana, sin spam.

Ya publicados: 66 guías y 25 plantillas. Todo gratis y sin registro.

Bonus: el kit de inicio de IA local en PDF al suscribirte
1x por semana Sin spam Cancela cuando quieras

Ver qué recibes

La Ley de IA de la UE ya aplica: una lista que puedes completar

Cuéntanos qué quieres ejecutar

Dinos qué quieres ejecutar y con qué presupuesto. Te decimos qué hardware necesitas, qué modelo encaja y qué puedes esperar de él, antes de que gastes nada.

Primera llamada gratis, 15 min Local-first: tus datos no salen de tu red Herramientas y guías abiertas

66 guías gratuitas · 17 plantillas de cumplimiento