DeepSeek V4: análisis completo de Pro y Flash — benchmarks, pricing y cuándo usar cada uno
TL;DR
- V4-Pro es el mejor modelo open-weight en coding (LiveCodeBench 93.5, Codeforces 3206) y empata a GPT-5.4 en conocimiento general (MMLU-Pro 87.5).
- V4-Flash a $0.14/M input es probablemente el modelo más rentable del mercado para tareas generales, con solo 1-3 puntos de gap frente a Pro en la mayoría de benchmarks.
- Actualización ago 2026: V4-Pro-0813 es GA. DSpark speculative decoding lleva a Pro a 80 tok/s (#23/106) — ya no es el modelo lento de la familia. Gains agentic masivos vs Preview (DeepSWE 12.8→62.7, Terminal-Bench 2.1: 87.9). Intelligence Index 53, #3/106.
- Pricing: Pro a $0.435/$0.87 (no $1.74/$3.48 como decía una versión anterior — era un error). Desde el 16 de agosto, peak/off-peak pricing: Pro sube a $0.66-$1.32/$1.98-$3.96.
- Las debilidades que persisten: solo texto, muy verbosos, un único provider API. Pero Pro lento ya no es una de ellas.
Contexto
El 23 de abril de 2026 DeepSeek soltó V4-Pro y V4-Flash, dos modelos Mixture-of-Experts con licencia MIT y 1M tokens de contexto. Es el primer release importante desde V3.2, y viene con una mejora arquitectónica significativa (atención híbrida CSA+HCA) que reduce el KV cache al 10% del tamaño de V3.2 a contexto máximo.
DeepSeek ya hizo esto con R1 — igualar a o1 de OpenAI a una fracción del precio y brevemente hundir las acciones de NVIDIA. V4 repite la jugada, pero esta vez el target son GPT-5.4 y Claude Opus 4.6.
¿Merece la pena? Vamos a los datos.
Actualización julio 2026: V4-Flash-0731
El 31 de julio de 2026, tres meses después del lanzamiento inicial, DeepSeek actualizó la API de V4-Flash al checkpoint V4-Flash-0731 y lo movió de Preview a release oficial (public beta). Es la actualización más relevante desde el lanzamiento, y cambia varias conclusiones del análisis original.
Qué cambió — y qué no
La arquitectura es la misma: 284B parámetros totales, 13B activos, 1M de contexto, 384K de output máximo. Lo único que se rehizo fue el post-training. El update afecta solo a la API (deepseek-v4-flash) — la app/web de DeepSeek y los pesos open-source publicados en abril siguen siendo el checkpoint Preview original.
Hay tres cosas que conviene saber antes de tocar nada:
-
Alias retirement (24 jul). DeepSeek retiró los alias
deepseek-chatydeepseek-reasonerel 24 de julio de 2026. Si tu integración sigue llamando a los nombres antiguos, ya está rota. Hay que migrar adeepseek-v4-flashodeepseek-v4-pro. Fuente: changelog oficial de DeepSeek. -
Sin pesos 0731 en Hugging Face. El repo de Hugging Face sigue siendo el de abril (Preview). No hay checkpoint open-weight del 0731 — es API-only. Si self-hosteas, sigues en el modelo de abril.
-
Responses API. El 0731 añade soporte nativo para la Responses API de OpenAI (adaptada para Codex), además de las interfaces de Chat Completions y Anthropic que ya tenía.
Gains agentic (vendor-stated)
DeepSeek reporta los siguientes scores en su propio harness, ejecutados en modo minimal a max reasoning effort:
| Benchmark | V4-Flash-0731 (vendor) | V4-Flash Preview | V4-Pro |
|---|---|---|---|
| Terminal-Bench 2.1 | 82.7 | — | — |
| Cybergym | 76.7 | — | — |
| Toolathlon (verified) | 70.3 | — | — |
| DSBench-FullStack | 68.7 | — | — |
| DSBench-Hard | 59.6 | — | — |
| DeepSWE | 54.4 | — | — |
| NL2Repo | 54.2 | — | — |
| Agents’ Last Exam | 25.2 | — | — |
⚠️ Todos estos números son vendor-stated. Vienen del harness propio de DeepSeek, ejecutados por DeepSeek. Ningún laboratorio independiente había reproducido estas cifras a fecha del lanzamiento. La única señal semi-independiente es el Artificial Analysis Intelligence Index de 50-52 (#3 de 101 modelos en su clase), que mide inteligencia general, no la suite agentic. Trátalo como corrobación direccional, no como validación.
Lo que sí está verificado independientemente
Artificial Analysis sí confirma dos cosas importantes que cambian la foto del análisis original:
- Velocidad: 141 tok/s — Flash es ahora rápido (#8 de 101), no el modelo lento que era en abril. Esto contradice directamente la debilidad #2 del análisis original (que aplicaba al Preview).
- Inteligencia: Intelligence Index de 50-52, muy por encima de la mediana (26) de modelos comparables.
- Verbosidad: sigue siendo un problema — 210M tokens generados en la evaluación del Intelligence Index, frente a una mediana de 100M (~3.4x). Más tokens = más coste real por tarea completada.
Concurrency: 5x más que Pro
El cambio operacional más subestimado: V4-Flash soporta 2,500 peticiones concurrentes vs las 500 de V4-Pro. Para fleets de agentes en paralelo, ese headroom 5x importa más que cualquier benchmark.
Actualización agosto 2026: V4-Pro-0813 GA
El 13 de agosto de 2026 DeepSeek sacó V4-Pro de Preview y lo pasó a GA (general availability) en APP, web y API simultáneamente. El checkpoint V4-Pro-0813 sustituye al Preview de abril en todas las superficies — a diferencia de Flash-0731, que solo afectó a la API. En la app/web, el modelo está disponible vía “Expert Mode”.
Qué cambió
La arquitectura base es la misma (1.6T parámetros totales, 49B activos, 1M contexto), pero con dos diferencias clave:
-
DSpark speculative decoding. El 0813 incluye un módulo de speculative decoding (DSpark) que acepta hasta 7 tokens especulativos por paso. Es el responsable directo del salto de velocidad: de 36.9 tok/s (Preview) a 80 tok/s (#23/106 según Artificial Analysis). Pro ya no es el modelo lento de la familia. Fuente: model card oficial, recipe de vLLM.
-
Post-training centrado en agentes. Igual que Flash-0731, el 0813 es un re-post-train del Preview. Los gains son dramáticos, especialmente en coding agents.
-
Pesos públicos. A diferencia de Flash-0731 (API-only), los pesos de V4-Pro-0813 están en Hugging Face bajo MIT. Si self-hosteas, tienes acceso al checkpoint GA — no al Preview de abril.
-
Responses API nativa. Pro ahora soporta la Responses API de OpenAI (adaptada para Codex) con configuración one-click, además de Chat Completions y Anthropic.
Gains agentic vs Preview (vendor-stated)
El salto respecto a Preview es enorme, especialmente en coding agents:
| Benchmark | V4-Pro-0813 | V4-Pro (Preview) | Salto |
|---|---|---|---|
| Terminal-Bench 2.1 | 87.9 | 72.1 | +15.8 |
| DeepSWE | 62.7 | 12.8 | +49.9 |
| Cybergym | 83.3 | 52.7 | +30.6 |
| DSBench-Hard † | 67.2 | 31.1 | +36.1 |
| DSBench-FullStack † | 71.1 | 41.8 | +29.3 |
| NL2Repo | 61.5 | 38.5 | +23.0 |
| AutomationBench | 31.8 | 12.8 | +19.0 |
| Toolathlon-Verified | 74.1 | 55.9 | +18.2 |
| HLE (w/ tools) | 60.0 | 48.2 | +11.8 |
| HLE (w/o tools) | 42.7 | 37.7 | +5.0 |
| Agents’ Last Exam | 25.7 | 16.5 | +9.2 |
† DSBench-FullStack y DSBench-Hard son test sets internos de DeepSeek.
DeepSWE pasa de 12.8 a 62.7 — un salto de 390%. No es un tweak; es un modelo diferente para tareas de coding agent.
⚠️ Vendor-stated, mismo harness. Estos números vienen del DeepSeek Harness en modo minimal, ejecutado por DeepSeek con
reasoning_effort: max,temperature=1.0,top_p=0.95. Misma caveat que con Flash-0731: sin reprodución independiente del paquete agentic completo. Los benchmarks de conocimiento (MMLU-Pro, LiveCodeBench) no se re-reportaron para 0813 — son los del Preview de abril.
Lo verificado independientemente
Artificial Analysis ya evaluó V4-Pro-0813, y confirma tres cosas que cambian el cuadro:
- Inteligencia: Intelligence Index de 53 (#3/106), arriba del 45 del Preview. Sigue siendo top-3 global.
- Velocidad: 80 tok/s (#23/106), por encima de la mediana (66). El DSpark speculative decoding funciona — Pro pasó de percentil 42 a estar por encima de la media.
- Verbosidad: 130M tokens en la evaluación del Intelligence Index (mediana: 100M). Mejor que los 190M del Preview, pero sigue siendo verboso (~1.3x la mediana). Más tokens = más coste real por tarea.
Paisaje competitivo: nueva hornada
La tabla del model card de 0813 compara contra una generación nueva de competidores: Opus-4.8, Fable-5, Kimi K3 y GLM-5.2. En Terminal-Bench 2.1, Pro-0813 (87.9) queda competitivo con Kimi K3 (88.3) y Fable-5 (88.0), y por encima de Opus-4.8 (85.0). En DeepSWE, Pro-0813 (62.7) queda por detrás de Fable-5 (70.0) y Kimi K3 (67.5).
El dominio de Pro en coding se reduce frente a esta hornada, pero el salto desde Preview mantiene a DeepSeek en la conversación frontier.
Arquitectura: qué cambia respecto a V3.2
Ambos modelos usan atención híbrida que combina Compressed Sparse Attention (CSA) y Heavily Compressed Attention (HCA), junto con manifold-constrained hyper-connections (mHC) y el optimizador Muon. La consecuencia práctica:
- KV cache al 10% del tamaño de V3.2 a 1M tokens de contexto (7% en Flash)
- 27% de los FLOPs por token respecto a V3.2 en contexto largo (10% en Flash)
- 1M tokens de contexto sin recargo — a diferencia de los labs occidentales que cobran premium por ventanas largas
| V4-Pro | V4-Flash | |
|---|---|---|
| Params totales | 1.6T | 284B |
| Params activos | 49B | 13B |
| Tokens entrenamiento | 33T | 32T |
| Contexto | 1M | 1M |
| Max output | 384K | 384K |
| Peso (FP4+FP8) | ~862GB | ~158GB |
| Licencia | MIT | MIT |
La diferencia clave entre Pro y Flash es la profundidad del pool de expertos — Pro enruta a través de muchos más sub-redes especializadas. Ambos se entrenaron con volúmenes de tokens casi idénticos (33T vs 32T), lo que sugiere que la brecha de rendimiento viene de la arquitectura, no de los datos.
Benchmarks: conocimiento y razonamiento
V4-Pro vs modelos frontier
| Benchmark | V4-Pro | GPT-5.4 | Claude Opus 4.6 | Gemini-3.1-Pro |
|---|---|---|---|---|
| MMLU-Pro | 87.5 | 87.5 | 89.1 | 91.0 |
| LiveCodeBench | 93.5 | — | 88.8 | 91.7 |
| Codeforces Rating | 3206 | 3168 | N/R | 3052 |
| Apex Shortlist | 90.2 | 78.1 | 85.9 | 89.1 |
| HLE | 37.7 | 39.8 | 40.0 | 44.4 |
| IMOAnswerBench | 89.8 | 91.4 | 75.3 | 81.0 |
| HMMT 2026 | 95.2 | 97.7 | 96.2 | — |
| SimpleQA-Verified | 57.9 | — | — | 75.6 |
Lectura: V4-Pro domina en coding — lidera LiveCodeBench, Codeforces y Apex Shortlist. Empata a GPT-5.4 en MMLU-Pro (conocimiento general). Pierde contra Gemini-3.1-Pro en factual recall (SimpleQA) y contra GPT-5.4 en matemáticas competitivas (HMMT, IMO). Estos scores son del Preview; el 0813 no re-reportó knowledge benchmarks, pero la mejora en HLE (37.7→42.7) sugiere gains también en conocimiento general.
V4-Pro vs V4-Flash: ¿cuánto se pierde con Flash?
| Benchmark | V4-Flash | V4-Pro | Gap |
|---|---|---|---|
| MMLU-Pro | 86.2 | 87.5 | -1.3 |
| LiveCodeBench | 91.6 | 93.5 | -1.9 |
| Codeforces | 3052 | 3206 | -154 |
| SWE-Verified | 79.0 | 80.6 | -1.6 |
| GPQA Diamond | ~86 | 90.1 | -4.1 |
| Terminal-Bench 2.0 | 56.9 | 67.9 | -11.0 |
| SimpleQA-Verified | 34.1 | 57.9 | -23.8 |
| MCPAtlas Public | ~65 | 73.6 | -8.6 |
Lectura: El gap es consistente de 1-3 puntos en tareas de conocimiento y coding básico. Pero se abre a 8-24 puntos en factual recall y tool use multi-step. Flash no es un modelo de segunda — es competitivo en la mayoría de tareas, pero no sustituye a Pro en agentes complejos.
“V4-Flash-Max alcanza rendimiento comparable a Pro con un thinking budget mayor, aunque su escala menor lo sitúa por detrás en recall factual y workflows agentic complejos.” — DeepSeek (model card oficial)
Benchmarks: capacidades agentic
| Benchmark | V4-Pro | GPT-5.4 | Claude Opus 4.6 | Gemini-3.1-Pro |
|---|---|---|---|---|
| SWE-Verified | 80.6 | N/R | 80.8 | 80.6 |
| Terminal-Bench 2.0 | 67.9 | 75.1 | 65.4 | 68.5 |
| MCPAtlas Public | 73.6 | 67.2 | 73.8 | 69.2 |
| Toolathlon | 51.8 | 54.6 | 47.2 | 48.8 |
| BrowseComp | 83.4 | — | 83.7 | 85.9 |
V4-Pro empata a Claude en SWE-Verified y supera a GPT-5.4 en MCPAtlas. Pero GPT-5.4 le gana en Terminal-Bench (tool use secuencial) y Toolathlon (uso general de herramientas). Para agentes que ejecutan 10+ tool calls en workflows largos, GPT-5.4 sigue siendo superior en fiabilidad.
Nota post-0813: Los scores agentic del Preview ya no reflejan la realidad. V4-Pro-0813 lleva Terminal-Bench 2.1 a 87.9 (vs 67.9 en Terminal-Bench 2.0 del Preview) y DeepSWE a 62.7 (era 12.8). La tabla de agentes de la sección de actualización de agosto es la referencia actual.
Pricing: la historia completa
Precios actuales (hasta el 16 de agosto, 16:00 UTC)
| Modelo | Input (miss) | Input (hit) | Output |
|---|---|---|---|
| V4-Flash-0731 | $0.14 | $0.0028 | $0.28 |
| V4-Pro-0813 | $0.435 | $0.003625 | $0.87 |
| GPT-5.4 | $2.50 | — | $15.00 |
| Claude Opus 4.6 | $5.00 | — | $25.00 |
| Gemini-3.1-Pro | $1.25 | — | $5.00 |
Corrección: Una versión anterior de este artículo listaba V4-Pro a $1.74/$3.48, asumiendo que el precio revertiría al nivel pre-promo tras el 5 de mayo. El pricing oficial confirma que Pro se mantuvo en $0.435/$0.87. Eso lo sitúa a 17-29x por debajo de Claude Opus 4.6 y GPT-5.4 en output, no 7-9x como decía el artículo original.
Pricing peak/off-peak (desde 16 ago, 16:00 UTC)
Con el GA de V4-Pro, DeepSeek pasa a facturación peak/off-peak:
| Modelo | Input (miss) | Input (hit) | Output | |
|---|---|---|---|---|
| V4-Pro | Peak | $1.32 | $0.044 | $3.96 |
| Off-peak | $0.66 | $0.022 | $1.98 | |
| V4-Flash | Peak | $0.44 | $0.014 | $1.32 |
| Off-peak | $0.22 | $0.007 | $0.66 |
Peak hours: 01:00-04:00 y 06:00-10:00 UTC (horario laboral de Beijing). Las 17 horas restantes son off-peak.
Esto es una subida. V4-Pro pasa de $0.435/$0.87 a $0.66-$1.32/$1.98-$3.96 — entre 1.5x y 4.5x más caro según la franja. Aún así, incluso a peak price, Pro es 1.9x más barato que GPT-5.4 en input y 3.8x en output. La ventaja de precio se reduce pero no desaparece.
Coste efectivo con cache hits
El cache hit price sigue siendo agresivo, incluso después de la subida del 16 de agosto. Con un cache hit ratio del 65-70% (típico en workloads conversacionales):
- V4-Flash off-peak: $0.007/M input con cache hit — un 97% más barato que el miss price
- V4-Pro off-peak: $0.022/M input con cache hit — un 97% más barato que el miss price
En el pricing actual (pre-16 ago), Flash ofrece $0.0028/M en cache hit — el #1 de 101 modelos según Artificial Analysis. Tras la subida seguirá siendo de los más baratos del mercado para alto volumen, pero el argumento de “el más barato por amplio margen” pierde fuerza.
Integraciones agentic
V4-Pro incluye adaptadores pre-ajustados para Claude Code, OpenClaw, OpenCode y CodeBuddy — basta cambiar la base URL para usarlo como drop-in replacement.
Detalles de implementación:
- Cuando DeepSeek detecta una petición de Claude Code u OpenCode, el thinking effort auto-escala a
maxsin intervención del usuario - Soporta hasta 128 function calls en paralelo
- Tres niveles de reasoning effort vía el parámetro
reasoning_effort:low(tareas simples),high(Agent workflows diarios),max(escenarios complejos). Este esquema reemplaza al anterior (non-think/think high/think max) y aplica a V4-Pro-0813 y V4-Flash-0731 por igual. Fuente: changelog oficial, Thinking Mode.
⚠️ Nota práctica: El auto-escalado a max thinking consume significativamente más tokens. Si controlas costes, es mejor setear
reasoning_effortexplícitamente en lugar de depender del auto-detect.
Debilidades honestas
No todo es perfecto. Estos son los problemas reales:
-
Solo texto. Sin visión ni multimodalidad. Si tus agentes analizan imágenes, screenshots o documentos escaneados, V4 no sirve.
-
Pro es lento→ Resuelto con 0813. El Preview era lento (36.9 tok/s, percentil 42). V4-Pro-0813 con DSpark speculative decoding alcanza 80 tok/s (#23/106), por encima de la mediana (66). Si self-hosteas, necesitas habilitar DSpark explícitamente en vLLM/SGLang para obtener el speedup — sin ese flag, el modelo corre a la velocidad del Preview. -
Verbosos. Pro-0813 generó 130M tokens en las evaluaciones de Artificial Analysis (mediana: 100M, ~1.3x). Flash-0731 fue peor: 210M (~3.4x la mediana). Más tokens = más coste real del que sugiere el pricing por token.
-
Un solo provider de inferencia. Artificial Analysis lista un único provider para V4-Pro-0813 (la API first-party de DeepSeek). OpenRouter ofrece acceso con routing entre providers, pero la inferencia subyacente sigue siendo DeepSeek. Si su infraestructura cae, no hay fallback real. Para workloads en producción, eso es un riesgo.
-
Auto-escalado silencioso. El thinking effort sube a max automáticamente con Claude Code/OpenCode. Más tokens, más lento, más caro — sin aviso.
¿Cuándo usar cada variante?
V4-Pro tiene sentido cuando
- Haces coding pesado (refactoring multi-fichero, debugging complejo) y quieres frontier quality sin pagar precios de Claude/GPT
- Ejecutas agentes con 10+ tool calls en workflows secuenciales
- Necesitas 1M tokens de contexto sin sobrecoste
- Post-0813: la latencia ya no es un bloqueador — Pro a 80 tok/s es más rápido que la mediana de la categoría
- Post-0813: quieres gains agentic frontier (Terminal-Bench 2.1: 87.9, DeepSWE: 62.7) a una fracción del precio de Opus-4.8 o Fable-5
- El budget lo permite y self-hosteas con DSpark habilitado
V4-Flash tiene sentido cuando
- Tienes alto volumen y necesitas controlar costes agresivamente
- Las tareas son generales: QA, resúmenes, clasificación, code completion simple, code review
- Quieres un baseline sólido para routing inteligente entre modelos
- Post-0731: ejecutas fleets de agentes en paralelo — 2,500 concurrency vs 500 de Pro
- Post-0731: la latencia importa — Flash a 141 tok/s es 1.8x más rápido que Pro (80 tok/s post-0813)
- Post-0731: quieres gains agentic sin pagar Pro (Terminal-Bench 2.1: 82.7 vendor-stated)
Busca alternativas cuando
- Necesitas multimodalidad (visión, audio) → Gemini-3.1-Pro o Claude Opus
- La velocidad de respuesta es crítica en single-token latency → GPT-5.4 o Claude Sonnet
- Quieres provider diversity y fallback → Claude + GPT combinados
- Las tareas requieren factual recall de alta precisión → Gemini-3.1-Pro (SimpleQA 75.6 vs 57.9 de V4-Pro)
- Necesitas el último grito en agentes → Fable-5 o Kimi K3 superan a Pro-0813 en DeepSWE y otros
Metodología
Este análisis se basa en:
- Model card oficial de DeepSeek V4-Pro-0813 y V4-Flash en Hugging Face
- Benchmarks públicos de los papers de DeepSeek, reproducidos por terceros
- Artificial Analysis Intelligence Index v4.1.1 para rankings comparativos de calidad, velocidad y precio
- Pricing oficial de la API de DeepSeek, incluyendo la transición a peak/off-peak billing (16 ago 2026)
- Actualización 0731 (jul 2026): datos verificados de Artificial Analysis (Intelligence Index, velocidad, verbosidad), changelog oficial de DeepSeek, y análisis de Digital Applied y DataLearner
- Actualización 0813 (ago 2026): GA release announcement, model card V4-Pro-0813, Artificial Analysis (Intelligence Index 53, velocidad 80 tok/s), Reuters, Baseten inference engineering
- Posts técnicos de Lushbinary, DataCamp y OfficeChai como fuentes secundarias
Conclusión
DeepSeek V4-Pro-0813 es, según Artificial Analysis, el #3 en inteligencia entre 106 modelos comparables (Intelligence Index 53). Es el mejor modelo open-weight en coding por margen claro. Y cuesta entre 4x y 29x menos que los modelos cerrados equivalentes, dependiendo de si comparas en peak u off-peak, y con Pro o Flash.
V4-Flash a $0.14/M input sigue siendo uno de los modelos con mejor ratio calidad/precio del mercado para tareas generales, aunque la subida del 16 de agosto reduce el margen.
El trade-off ha cambiado desde abril: Pro ya no es lento (80 tok/s con DSpark), pero sigue siendo solo texto y verboso. Para agentes que necesitan multimodalidad o provider diversity, los modelos de Anthropic, OpenAI y Google siguen siendo superiores. Para todo lo demás, V4 ha cerrado la distancia.
La pregunta ya no es si V4 es “lo bastante bueno”. Es si puedes permitirte no usarlo.
Fuentes: Model card DeepSeek V4-Pro-0813 (Hugging Face), GA Release — news oficial (13 ago 2026), Pricing oficial DeepSeek, Changelog oficial, Artificial Analysis — V4-Pro 0813, Artificial Analysis — V4-Flash 0731, Reuters — V4 Pro official release, Baseten — Inference engineering for V4-Pro-0813, Digital Applied — V4 Flash 0731 release, DataLearner — V4-Flash specs & benchmarks, MarkTechPost — V4-Flash-0731 gains, Lushbinary — V4 Pro vs Flash, OfficeChai — Benchmarks completos