GPT Diffusion

DeepSeek V4: análisis completo de Pro y Flash — benchmarks, pricing y cuándo usar cada uno

2026-04-26 (actualizado 2026-09-11) · Devs #deepseek#llm#benchmark#pricing#open-weights#coding-agents#agentes

TL;DR

  • V4-Pro es el mejor modelo open-weight en coding (LiveCodeBench 93.5, Codeforces 3206) y empata a GPT-5.4 en conocimiento general (MMLU-Pro 87.5).
  • Actualización 10 sept 2026 — V4.1-Flash: DeepSeek arranca la familia V4.1: arquitectura nueva (485B parámetros según la ficha de HF), visión multimodal nativa desde el día uno y precios a la BAJA — $0.15/$0.30/M input y $0.60/$1.20/M output (off-peak/peak), un 32% menos en input que el Flash anterior. Reemplaza a V4-Flash y Vision-Exp en la API con el nombre deepseek-flash; los pesos están en Hugging Face bajo MIT.
  • Actualización 11 sept 2026 — el retiro de V4 Pro se cancela: el changelog y el pie de la ficha de precios de DeepSeek revierten el aviso del 10-sep “en respuesta a la demanda de usuarios”: V4 Pro sigue en la API después del 14 de septiembre, con la facturación sin cambios y sin fecha de retirada. El endpoint grande de la casa no se muere (de momento); V4.1-Flash sigue siendo la vía barata.
  • Actualización ago 2026: V4-Pro-0813 es GA. DSpark speculative decoding lleva a Pro a 80 tok/s (#23/106) — ya no es el modelo lento de la familia. Gains agentic masivos vs Preview (DeepSWE 12.8→62.7, Terminal-Bench 2.1: 87.9). Intelligence Index 53, #3/106. En despedida, luego perdonada: el 10 sept se anunció que desde el 14 de septiembre de 2026 deepseek-v4-pro se enrutaría a V4.1-Flash a precio de Flash, hasta que exista V4.1-Pro; el 11 sept el changelog y el pie de la ficha de precios cancelaron el retiro — V4 Pro continúa con facturación intacta (ver actualización del 11 de septiembre).
  • Pricing: Pro a $0.435/$0.87 (no $1.74/$3.48 como decía una versión anterior — era un error). Desde el 16 de agosto, peak/off-peak pricing: Pro sube a $0.66-$1.32/$1.98-$3.96. Con V4.1-Flash (10 sept) DeepSeek vuelve a bajar: Flash pasa a $0.15-$0.30/$0.60-$1.20.
  • Actualización sept 2026: la familia ya tiene visión — V4-Flash-Vision-Exp (experimental, pesos MIT en HF desde el 1 sept): agentes multimodales cerca de Opus-4.8, al precio exacto de Flash. Pro sigue siendo solo texto. Esta vía experimental ya está obsoleta: el 10 sept V4.1-Flash hizo la visión nativa y GA — ver la actualización del 10 de septiembre.
  • Las debilidades que persisten: verbosidad sin evaluación independiente actualizada, un único provider de inferencia first-party, y Pro solo texto. Y una lección nueva del 11 sept: el retiro del endpoint Pro anunciado para el 14 de septiembre se canceló un día después de publicarse.

Contexto

El 23 de abril de 2026 DeepSeek soltó V4-Pro y V4-Flash, dos modelos Mixture-of-Experts con licencia MIT y 1M tokens de contexto. Es el primer release importante desde V3.2, y viene con una mejora arquitectónica significativa (atención híbrida CSA+HCA) que reduce el KV cache al 10% del tamaño de V3.2 a contexto máximo.

DeepSeek ya hizo esto con R1 — igualar a o1 de OpenAI a una fracción del precio y brevemente hundir las acciones de NVIDIA. V4 repite la jugada, pero esta vez el target son GPT-5.4 y Claude Opus 4.6.

¿Merece la pena? Vamos a los datos.

Actualización julio 2026: V4-Flash-0731

El 31 de julio de 2026, tres meses después del lanzamiento inicial, DeepSeek actualizó la API de V4-Flash al checkpoint V4-Flash-0731 y lo movió de Preview a release oficial (public beta). Es la actualización más relevante desde el lanzamiento, y cambia varias conclusiones del análisis original.

Qué cambió — y qué no

La arquitectura es la misma: 284B parámetros totales, 13B activos, 1M de contexto, 384K de output máximo. Lo único que se rehizo fue el post-training. El update afecta solo a la API (deepseek-v4-flash) — la app/web de DeepSeek y los pesos open-source publicados en abril siguen siendo el checkpoint Preview original.

Hay tres cosas que conviene saber antes de tocar nada:

  1. Alias retirement (24 jul). DeepSeek retiró los alias deepseek-chat y deepseek-reasoner el 24 de julio de 2026. Si tu integración sigue llamando a los nombres antiguos, ya está rota. Hay que migrar a deepseek-v4-flash o deepseek-v4-pro. Fuente: changelog oficial de DeepSeek.

  2. Sin pesos 0731 en Hugging Face. El repo de Hugging Face sigue siendo el de abril (Preview). No hay checkpoint open-weight del 0731 — es API-only. Si self-hosteas, sigues en el modelo de abril.

  3. Responses API. El 0731 añade soporte nativo para la Responses API de OpenAI (adaptada para Codex), además de las interfaces de Chat Completions y Anthropic que ya tenía.

Gains agentic (vendor-stated)

DeepSeek reporta los siguientes scores en su propio harness, ejecutados en modo minimal a max reasoning effort:

BenchmarkV4-Flash-0731 (vendor)V4-Flash PreviewV4-Pro
Terminal-Bench 2.182.7——
Cybergym76.7——
Toolathlon (verified)70.3——
DSBench-FullStack68.7——
DSBench-Hard59.6——
DeepSWE54.4——
NL2Repo54.2——
Agents’ Last Exam25.2——

⚠️ Todos estos números son vendor-stated. Vienen del harness propio de DeepSeek, ejecutados por DeepSeek. Ningún laboratorio independiente había reproducido estas cifras a fecha del lanzamiento. La única señal semi-independiente es el Artificial Analysis Intelligence Index de 50-52 (#3 de 101 modelos en su clase), que mide inteligencia general, no la suite agentic. Trátalo como corrobación direccional, no como validación.

Lo que sí está verificado independientemente

Artificial Analysis sí confirma dos cosas importantes que cambian la foto del análisis original:

  • Velocidad: 141 tok/s — Flash es ahora rápido (#8 de 101), no el modelo lento que era en abril. Esto contradice directamente la debilidad #2 del análisis original (que aplicaba al Preview).
  • Inteligencia: Intelligence Index de 50-52, muy por encima de la mediana (26) de modelos comparables.
  • Verbosidad: sigue siendo un problema — 210M tokens generados en la evaluación del Intelligence Index, frente a una mediana de 100M (~3.4x). Más tokens = más coste real por tarea completada.

Concurrency: 5x más que Pro

El cambio operacional más subestimado: V4-Flash soporta 2,500 peticiones concurrentes vs las 500 de V4-Pro. Para fleets de agentes en paralelo, ese headroom 5x importa más que cualquier benchmark.

Actualización agosto 2026: V4-Pro-0813 GA

El 13 de agosto de 2026 DeepSeek sacó V4-Pro de Preview y lo pasó a GA (general availability) en APP, web y API simultáneamente. El checkpoint V4-Pro-0813 sustituye al Preview de abril en todas las superficies — a diferencia de Flash-0731, que solo afectó a la API. En la app/web, el modelo está disponible vía “Expert Mode”.

Qué cambió

La arquitectura base es la misma (1.6T parámetros totales, 49B activos, 1M contexto), pero con dos diferencias clave:

  1. DSpark speculative decoding. El 0813 incluye un módulo de speculative decoding (DSpark) que acepta hasta 7 tokens especulativos por paso. Es el responsable directo del salto de velocidad: de 36.9 tok/s (Preview) a 80 tok/s (#23/106 según Artificial Analysis). Pro ya no es el modelo lento de la familia. Fuente: model card oficial, recipe de vLLM.

  2. Post-training centrado en agentes. Igual que Flash-0731, el 0813 es un re-post-train del Preview. Los gains son dramáticos, especialmente en coding agents.

  3. Pesos públicos. A diferencia de Flash-0731 (API-only), los pesos de V4-Pro-0813 están en Hugging Face bajo MIT. Si self-hosteas, tienes acceso al checkpoint GA — no al Preview de abril.

  4. Responses API nativa. Pro ahora soporta la Responses API de OpenAI (adaptada para Codex) con configuración one-click, además de Chat Completions y Anthropic.

Gains agentic vs Preview (vendor-stated)

El salto respecto a Preview es enorme, especialmente en coding agents:

BenchmarkV4-Pro-0813V4-Pro (Preview)Salto
Terminal-Bench 2.187.972.1+15.8
DeepSWE62.712.8+49.9
Cybergym83.352.7+30.6
DSBench-Hard †67.231.1+36.1
DSBench-FullStack †71.141.8+29.3
NL2Repo61.538.5+23.0
AutomationBench31.812.8+19.0
Toolathlon-Verified74.155.9+18.2
HLE (w/ tools)60.048.2+11.8
HLE (w/o tools)42.737.7+5.0
Agents’ Last Exam25.716.5+9.2

† DSBench-FullStack y DSBench-Hard son test sets internos de DeepSeek.

DeepSWE pasa de 12.8 a 62.7 — un salto de 390%. No es un tweak; es un modelo diferente para tareas de coding agent.

⚠️ Vendor-stated, mismo harness. Estos números vienen del DeepSeek Harness en modo minimal, ejecutado por DeepSeek con reasoning_effort: max, temperature=1.0, top_p=0.95. Misma caveat que con Flash-0731: sin reprodución independiente del paquete agentic completo. Los benchmarks de conocimiento (MMLU-Pro, LiveCodeBench) no se re-reportaron para 0813 — son los del Preview de abril.

Lo verificado independientemente

Artificial Analysis ya evaluó V4-Pro-0813, y confirma tres cosas que cambian el cuadro:

  • Inteligencia: Intelligence Index de 53 (#3/106), arriba del 45 del Preview. Sigue siendo top-3 global.
  • Velocidad: 80 tok/s (#23/106), por encima de la mediana (66). El DSpark speculative decoding funciona — Pro pasó de percentil 42 a estar por encima de la media.
  • Verbosidad: 130M tokens en la evaluación del Intelligence Index (mediana: 100M). Mejor que los 190M del Preview, pero sigue siendo verboso (~1.3x la mediana). Más tokens = más coste real por tarea.

Paisaje competitivo: nueva hornada

La tabla del model card de 0813 compara contra una generación nueva de competidores: Opus-4.8, Fable-5, Kimi K3 y GLM-5.2. En Terminal-Bench 2.1, Pro-0813 (87.9) queda competitivo con Kimi K3 (88.3) y Fable-5 (88.0), y por encima de Opus-4.8 (85.0). En DeepSWE, Pro-0813 (62.7) queda por detrás de Fable-5 (70.0) y Kimi K3 (67.5).

El dominio de Pro en coding se reduce frente a esta hornada, pero el salto desde Preview mantiene a DeepSeek en la conversación frontier.

Actualización septiembre 2026: Flash-Vision-Exp, la familia abre los ojos

El 21 de agosto DeepSeek lanzó V4-Flash-Vision-Exp, el primer modelo multimodal de la familia V4: la arquitectura de Flash más un vision encoder y continued training para entender imágenes. El 1 de septiembre publicaron los pesos en Hugging Face (305B params totales, licencia MIT). Hasta este release, “V4 no tiene visión” era la debilidad #1 de la familia — esto la matiza.

Qué ofrece

  • API: model='deepseek-v4-flash-vision-exp' — Chat Completions, Anthropic y Responses API. Imágenes vía base64, URL externa o la nueva Files API (gratuita: subes una vez, referencias por file_id). Concurrency de 2,500 peticiones, igual que Flash.
  • Pricing: idéntico a V4-Flash — $0.22/$0.44 input (off-peak/peak), $0.66/$1.32 output. Cada imagen se tokeniza hasta 384 tokens y se factura como input. No hay premium por visión.
  • Self-hosting: pesos MIT con recetas oficiales de vLLM (un nodo 4×GB300) y SGLang (DSpark speculative decoding). FIM no está soportado en este modelo.

Benchmarks (vendor-stated)

BenchmarkVision-ExpFlash-0731Opus-4.8
Agentes de texto
Terminal-Bench 2.183.982.785.0
DeepSWE59.354.458.0
Toolathlon-Verified75.970.376.2
NL2Repo57.754.269.7
DSBench-Hard63.659.671.7
Agentes multimodales
ApexBench (Pass@1)36.526.2 †39.4
Agents’ Last Exam27.325.2 †25.7
Chartography64.3—65.0
ZeroBench (Pass@5)35.0—34.0

† Flash-0731 ignora los elementos multimodales del input en esas evals.

Lectura: en texto apenas degrada vs Flash-0731 — DeepSWE incluso sube de 54.4 a 59.3 y supera a Opus-4.8. En multimodal el salto es real: +10 puntos en ApexBench sobre el Flash que ignoraba las imágenes. “Cerca de Opus-4.8” es la descripción correcta — cerca, no parity: Opus gana en NL2Repo, DSBench-Hard, ApexBench y Chartography.

La única señal semi-independiente: Artificial Analysis le asigna un Intelligence Index de 51 (max) — un punto por debajo del Flash-0731 (52) y del Pro-0813 (53), dentro del mismo cluster top-3 de DeepSeek. Misma caveat de siempre: la suite agentic viene del DeepSeek Harness, ejecutada por DeepSeek.

Lo que sigue sin resolver

Es un checkpoint experimental — puede mutar o desaparecer sin aviso — y la visión solo existe en tier Flash: Pro sigue siendo solo texto. Para visión production-grade con calidad Pro, Gemini y Claude siguen delante. Pero “si tus agentes miran screenshots, V4 no sirve” ya no es una frase publicable.

Actualización 10 de septiembre de 2026: V4.1-Flash — nueva arquitectura, precios a la baja y el adiós a V4 Pro que duró un día

Nueve días después de publicar los pesos de Vision-Exp, DeepSeek lanzó DeepSeek-V4.1-Flash, primer modelo de una familia nueva (V4.1). No es un re-post-train del Flash de abril: el changelog oficial describe una arquitectura nueva diseñada para “mayor techo de capacidad, inferencia más rápida, mayor throughput y escalado a modelos más grandes”. Y viene acompañada de la noticia operacional más grande del año para esta familia: V4 Pro se retira. (Actualización 11 sept: cancelado tres días antes de ejecutarse — ver la siguiente sección.)

Qué es y qué cambia

  • Familia V4.1, no otra iteración de V4. V4.1-Flash es el modelo más pequeño de la nueva arquitectura. La ficha de Hugging Face lista 485B parámetros totales (MoE, licencia MIT como toda la familia); DeepSeek no ha publicado el desglose de parámetros activos en el changelog. El repo público es de momento una referencia de prompt encoding e inferencia mínima — cubre el vision encoder, la atención deslizante + comprimida con su indexador de dos niveles, MoE, Hyper-Connections y el forward path DSpark — con los pesos servidos desde el repositorio de pesos de HF.
  • Visión nativa desde el día uno. Lo que en agosto fue un checkpoint experimental aparte (Vision-Exp) aquí es funcionalidad base. No hay tier experimental: visión multimodal nativa en deepseek-flash.
  • API: el nombre nuevo es deepseek-flash. Los antiguos deepseek-v4-flash y deepseek-v4-flash-vision-exp siguen aceptándose por compatibilidad, pero los modelos que nombraban están retirados: las peticiones se sirven con V4.1-Flash y se facturan a precio Flash.
  • V4 Pro, en despedida (anuncio revocado el 11 sept). Según DeepSeek, tras pruebas extensas “V4.1 Flash supera comprensivamente a V4 Pro en rendimiento, coste, velocidad y tiempo total”. El anuncio del 10 sept: desde las 12:00 (hora de Beijing) del 14 de septiembre de 2026, y hasta que exista V4.1-Pro, toda petición a deepseek-v4-pro se enrutaría a V4.1-Flash y se facturaría a precio Flash. El 11 de septiembre, el changelog oficial y el pie de la propia ficha de precios cancelaron el retiro — “In response to user demand, we have decided to continue providing API services for DeepSeek V4 Pro after September 14, 2026, with the billing method remaining unchanged”. V4 Pro sigue en catálogo, a su precio, sin fecha de retirada (hay cobertura de terceros de la reversa, p. ej. OrcaRouter).

Benchmarks (vendor-stated)

BenchmarkV4.1-FlashV4-Flash-0731V4-Pro-0813
GPQA Diamond90.9~86 †90.1 †
Codeforces (rating)34713052 †3206 †
Terminal-Bench 2.190.682.787.9
DeepSWE v1.174.254.462.7
NL2Repo-Bench65.454.261.5
CyberGym88.176.783.3
HLE (w/ tools)63.9—60.0
HLE (texto puro)39.1 ‡——
Automation-Bench54.825.131.8
Agents’ Last Exam31.825.225.7
MathArena Apex65.6——
Terminal-Bench 3.0 / 4.030.0 / 31.2——

† Scores del Preview de abril re-reportados en este artículo; V4.1-Flash los supera en los re-reportados por DeepSeek. ‡ DeepSeek reporta 36.8 sobre el set completo de HLE y 39.1 solo sobre el subconjunto de texto puro.

Lectura honesta: todos estos números son vendor-stated, del harness propio de DeepSeek — mismo patrón que en julio y agosto, sin reproducción independiente a fecha de este update. La comparación con 0731/0813 además cruza versiones de test (el “DeepSWE v1.1” del changelog no es el mismo test que el DeepSWE de julio). Lo único directamente comparable dentro del propio anuncio: en cada benchmark que DeepSeek re-reporta, V4.1-Flash supera a ambos predecesores. Si los números aguantan auditoría independiente, el “Flash” de la casa habría sustituido al “Pro” con creces — que es exactamente la razón que da el changelog para retirar Pro.

Actualización 26-sep — primera señal independiente, y es tibia: Artificial Analysis ya evaluó V4.1-Flash (max effort): Intelligence Index 39 — por debajo del cluster 51-53 de la familia V4 (Flash-0731: 52, Vision-Exp: 51, Pro-0813: 53) — a 222 tok/s y con 250M de tokens generados (~1.8x la mediana de 140M de su suite: verbosidad que empeora respecto al 0731, que fue ~3.4x sobre una mediana de 100M). El índice de AA no reproduce la suite agentic de DeepSeek, así que Terminal-Bench 90.6 o DeepSWE 74.2 siguen vendor-stated; pero el “supera comprensivamente a V4 Pro” no se sostiene hoy en el único dato externo disponible. Detalle adicional: AA lista 552B de parámetros totales (16B activos) frente a los 485B de la ficha de HF — DeepSeek no ha publicado desglose oficial.

Precios: bajan

ModeloInput miss (off/peak)Input hit (off/peak)Output (off/peak)
V4.1-Flash (deepseek-flash)$0.15 / $0.30$0.003 / $0.006$0.60 / $1.20
V4-Pro-0813 (se mantiene, sin fecha de retiro)$0.66 / $1.32$0.022 / $0.044$1.98 / $3.96

Comparado con el Flash anterior: el input baja un 32% (de $0.22/$0.44 a $0.15/$0.30), el output un 9% (de $0.66/$1.32 a $0.60/$1.20) y el cache hit casi a la mitad ($0.007/$0.014 → $0.003/$0.006). Se mantiene la estructura peak/off-peak del 16 de agosto (01:00-04:00 y 06:00-10:00 UTC, lunes a viernes), la concurrency de 2,500 peticiones, el contexto de 1M y el máximo de 384K de output. FIM beta queda limitado al modo non-thinking.

Cancelado el 11 de septiembre: la facturación de V4 Pro no cambia — sigue en $0.66-$1.32/$1.98-$3.96 (peak/off-peak), sin ruta a Flash. La confirmación literal, en la entrada del 10-sep del changelog (enmendada in situ): “In response to user demand, we have decided to continue providing API services for DeepSeek V4 Pro after September 14, 2026, with the billing method remaining unchanged.”

Actualización 11 de septiembre de 2026: el retiro de V4 Pro se cancela

Duró un día: anunciado el 10 de septiembre, revertido el 11 — tres días antes de la fecha de ejecución. La reversa apareció en dos sitios del vendor: una nota al pie (la segunda) de la ficha de precios y un párrafo nuevo en la entrada del 10-sep del changelog oficial, enmendada in situ: “In response to user demand, we have decided to continue providing API services for DeepSeek V4 Pro after September 14, 2026, with the billing method remaining unchanged.” Los snapshots de Wayback de la ficha de precios del 11 de septiembre (16:55 UTC) y del 12 de septiembre ya contienen la nota; no hay evidencia de que existiera el 13. La ficha de precios, consultada el 13 de septiembre, mantenía V4 Pro en catálogo con su facturación original — y así sigue a fecha del 26 de septiembre (re-verificado: deepseek-v4-pro sirve V4-Pro-0813 a precio Pro, sin ruta a Flash; a esa fecha la nota de continuación vive en el changelog, ya no en el pie de la ficha). Traducción operativa: deepseek-v4-pro sigue en la API con modelo y precio intactos ($0.66-$1.32/$1.98-$3.96 en peak/off-peak), sin fecha de retirada y sin ruta a Flash. La reversa sí tuvo cobertura de terceros desde el día 11: OrcaRouter la documentó con la cita verbatim, y también PacketNebula (“the V4 Pro retirement lasted a day”), que detalla nota al pie + párrafo en el changelog.

Tres lecturas:

  1. Para tu código, hoy no cambia nada. Si migraste a deepseek-flash por el deadline, no deshagas nada — sigue siendo la opción más barata y, según los números vendor-stated, la más capaz. Si te quedaste en deepseek-v4-pro, respiras: el modelo grande de la casa sigue siendo el modelo grande.
  2. El changelog de DeepSeek es propuesta, no compromiso. Un retiro anunciado “tras pruebas extensas” se revocó un día después de publicarse por presión de usuarios. La demanda real de V4 Pro existía — y pesó más que una decisión de producto ya publicada. Planificar contra esta API significa anclarse a la ficha de precios del día, no al último aviso del changelog.
  3. Encaja en el patrón de la casa. Precios que suben y bajan según franja, checkpoints que se sustituyen sin cambiar el nombre del endpoint, y ahora un retiro cancelado a tres días de ejecutarse. La familia V4 lleva todo el año moviendo la meta; esta vez la movió a favor del usuario.

Qué mirar antes de migrar

  1. Endpoint: usa deepseek-flash. Si llamas a deepseek-v4-flash o deepseek-v4-flash-vision-exp, ya estás en V4.1-Flash sin saberlo — mismo nombre, modelo distinto. Los tests de regresión que validaste contra 0731 pueden no aplicar.
  2. Código que usa deepseek-v4-pro: sigue funcionando tal cual — el retiro previsto para el 14 de septiembre se canceló el 11 (ver actualización anterior) y la facturación no cambia. El riesgo residual es de proceso, no de producto: DeepSeek ya demostró que puede reanudar el plan, así que mantén un plan B (pesos MIT en HF para self-hosting, o migración a deepseek-flash) listo por si vuelve el aviso.
  3. Visión: ya no hace falta el nombre -vision-exp. Visión nativa y GA en deepseek-flash; la guía de visión oficial cubre el uso.
  4. Self-hosting: pesos en la colección oficial de HF (485B, MIT). Las recetas oficiales de vLLM/SGLang específicas para V4.1 no estaban publicadas a fecha de este update — la referencia de inferencia mínima del repo es el punto de partida.

Para el desglose de costes por workload con los precios nuevos, ver la guía de costes reales de la API de DeepSeek.

Arquitectura: qué cambia respecto a V3.2

Ambos modelos usan atención híbrida que combina Compressed Sparse Attention (CSA) y Heavily Compressed Attention (HCA), junto con manifold-constrained hyper-connections (mHC) y el optimizador Muon. La consecuencia práctica:

  • KV cache al 10% del tamaño de V3.2 a 1M tokens de contexto (7% en Flash)
  • 27% de los FLOPs por token respecto a V3.2 en contexto largo (10% en Flash)
  • 1M tokens de contexto sin recargo — a diferencia de los labs occidentales que cobran premium por ventanas largas
V4-ProV4-Flash
Params totales1.6T284B
Params activos49B13B
Tokens entrenamiento33T32T
Contexto1M1M
Max output384K384K
Peso (FP4+FP8)~862GB~158GB
LicenciaMITMIT

La diferencia clave entre Pro y Flash es la profundidad del pool de expertos — Pro enruta a través de muchos más sub-redes especializadas. Ambos se entrenaron con volúmenes de tokens casi idénticos (33T vs 32T), lo que sugiere que la brecha de rendimiento viene de la arquitectura, no de los datos.

Benchmarks: conocimiento y razonamiento

V4-Pro vs modelos frontier

BenchmarkV4-ProGPT-5.4Claude Opus 4.6Gemini-3.1-Pro
MMLU-Pro87.587.589.191.0
LiveCodeBench93.5—88.891.7
Codeforces Rating32063168N/R3052
Apex Shortlist90.278.185.989.1
HLE37.739.840.044.4
IMOAnswerBench89.891.475.381.0
HMMT 202695.297.796.2—
SimpleQA-Verified57.9——75.6

Lectura: V4-Pro domina en coding — lidera LiveCodeBench, Codeforces y Apex Shortlist. Empata a GPT-5.4 en MMLU-Pro (conocimiento general). Pierde contra Gemini-3.1-Pro en factual recall (SimpleQA) y contra GPT-5.4 en matemáticas competitivas (HMMT, IMO). Estos scores son del Preview; el 0813 no re-reportó knowledge benchmarks, pero la mejora en HLE (37.7→42.7) sugiere gains también en conocimiento general.

V4-Pro vs V4-Flash: ¿cuánto se pierde con Flash?

BenchmarkV4-FlashV4-ProGap
MMLU-Pro86.287.5-1.3
LiveCodeBench91.693.5-1.9
Codeforces30523206-154
SWE-Verified79.080.6-1.6
GPQA Diamond~8690.1-4.1
Terminal-Bench 2.056.967.9-11.0
SimpleQA-Verified34.157.9-23.8
MCPAtlas Public~6573.6-8.6

Lectura: El gap es consistente de 1-3 puntos en tareas de conocimiento y coding básico. Pero se abre a 8-24 puntos en factual recall y tool use multi-step. Flash no es un modelo de segunda — es competitivo en la mayoría de tareas, pero no sustituye a Pro en agentes complejos.

“V4-Flash-Max alcanza rendimiento comparable a Pro con un thinking budget mayor, aunque su escala menor lo sitúa por detrás en recall factual y workflows agentic complejos.” — DeepSeek (model card oficial)

Benchmarks: capacidades agentic

BenchmarkV4-ProGPT-5.4Claude Opus 4.6Gemini-3.1-Pro
SWE-Verified80.6N/R80.880.6
Terminal-Bench 2.067.975.165.468.5
MCPAtlas Public73.667.273.869.2
Toolathlon51.854.647.248.8
BrowseComp83.4—83.785.9

V4-Pro empata a Claude en SWE-Verified y supera a GPT-5.4 en MCPAtlas. Pero GPT-5.4 le gana en Terminal-Bench (tool use secuencial) y Toolathlon (uso general de herramientas). Para agentes que ejecutan 10+ tool calls en workflows largos, GPT-5.4 sigue siendo superior en fiabilidad.

Nota post-0813: Los scores agentic del Preview ya no reflejan la realidad. V4-Pro-0813 lleva Terminal-Bench 2.1 a 87.9 (vs 67.9 en Terminal-Bench 2.0 del Preview) y DeepSWE a 62.7 (era 12.8). La tabla de agentes de la sección de actualización de agosto es la referencia actual.

Pricing: la historia completa

Precios actuales (hasta el 16 de agosto, 16:00 UTC)

ModeloInput (miss)Input (hit)Output
V4-Flash-0731$0.14$0.0028$0.28
V4-Pro-0813$0.435$0.003625$0.87
GPT-5.4$2.50—$15.00
Claude Opus 4.6$5.00—$25.00
Gemini-3.1-Pro$1.25—$5.00

Corrección: Una versión anterior de este artículo listaba V4-Pro a $1.74/$3.48, asumiendo que el precio revertiría al nivel pre-promo tras el 5 de mayo. El pricing oficial confirma que Pro se mantuvo en $0.435/$0.87. Eso lo sitúa a 17-29x por debajo de Claude Opus 4.6 y GPT-5.4 en output, no 7-9x como decía el artículo original.

Pricing peak/off-peak (desde 16 ago, 16:00 UTC)

Con el GA de V4-Pro, DeepSeek pasa a facturación peak/off-peak:

ModeloInput (miss)Input (hit)Output
V4-ProPeak$1.32$0.044$3.96
Off-peak$0.66$0.022$1.98
V4-FlashPeak$0.44$0.014$1.32
Off-peak$0.22$0.007$0.66

Peak hours: 01:00-04:00 y 06:00-10:00 UTC, lunes a viernes (horario laboral de Beijing). Todo lo demás —el resto del día y los fines de semana enteros— es off-peak. Si batchas workloads, desplázalos al fin de semana: mitad de precio en todas las franjas.

Esto es una subida. V4-Pro pasa de $0.435/$0.87 a $0.66-$1.32/$1.98-$3.96 — entre 1.5x y 4.5x más caro según la franja. Aún así, incluso a peak price, Pro es 1.9x más barato que GPT-5.4 en input y 3.8x en output. La ventaja de precio se reduce pero no desaparece.

Coste efectivo con cache hits

El cache hit price sigue siendo agresivo, incluso después de la subida del 16 de agosto. Con un cache hit ratio del 65-70% (típico en workloads conversacionales):

  • V4-Flash off-peak: $0.007/M input con cache hit — un 97% más barato que el miss price
  • V4-Pro off-peak: $0.022/M input con cache hit — un 97% más barato que el miss price

En el pricing actual (pre-16 ago), Flash ofrece $0.0028/M en cache hit — el #1 de 101 modelos según Artificial Analysis. Tras la subida seguirá siendo de los más baratos del mercado para alto volumen, pero el argumento de “el más barato por amplio margen” pierde fuerza.

Integraciones agentic

V4-Pro incluye adaptadores pre-ajustados para Claude Code, OpenClaw, OpenCode y CodeBuddy — basta cambiar la base URL para usarlo como drop-in replacement.

Detalles de implementación:

  • Cuando DeepSeek detecta una petición de Claude Code u OpenCode, el thinking effort auto-escala a max sin intervención del usuario
  • Soporta hasta 128 function calls en paralelo
  • Tres niveles de reasoning effort vía el parámetro reasoning_effort: low (tareas simples), high (Agent workflows diarios), max (escenarios complejos). Este esquema reemplaza al anterior (non-think / think high / think max) y aplica a V4-Pro-0813 y V4-Flash-0731 por igual. Fuente: changelog oficial, Thinking Mode.

⚠️ Nota práctica: El auto-escalado a max thinking consume significativamente más tokens. Si controlas costes, es mejor setear reasoning_effort explícitamente en lugar de depender del auto-detect.

Debilidades honestas

No todo es perfecto. Estos son los problemas reales:

  1. Solo texto → visión experimental desde ago 2026. Pro sigue siendo solo texto, pero V4-Flash-Vision-Exp añade visión al precio exacto de Flash (ver actualización de septiembre). Si tu caso de uso de visión es production-grade o necesitas calidad Pro con imágenes, Gemini-3.1-Pro y Claude Opus siguen siendo la respuesta. Audio: nada todavía.

  2. Pro es lento → Resuelto con 0813. El Preview era lento (36.9 tok/s, percentil 42). V4-Pro-0813 con DSpark speculative decoding alcanza 80 tok/s (#23/106), por encima de la mediana (66). Si self-hosteas, necesitas habilitar DSpark explícitamente en vLLM/SGLang para obtener el speedup — sin ese flag, el modelo corre a la velocidad del Preview.

  3. Verbosos. Pro-0813 generó 130M tokens en las evaluaciones de Artificial Analysis (mediana: 100M, ~1.3x). Flash-0731 fue peor: 210M (~3.4x la mediana). Más tokens = más coste real del que sugiere el pricing por token.

  4. Un solo provider de inferencia. Artificial Analysis lista un único provider para V4-Pro-0813 (la API first-party de DeepSeek). OpenRouter ofrece acceso con routing entre providers, pero la inferencia subyacente sigue siendo DeepSeek. Si su infraestructura cae, no hay fallback real. Para workloads en producción, eso es un riesgo.

  5. Auto-escalado silencioso. El thinking effort sube a max automáticamente con Claude Code/OpenCode. Más tokens, más lento, más caro — sin aviso.

¿Cuándo usar cada variante?

V4-Pro tiene sentido cuando

  • Haces coding pesado (refactoring multi-fichero, debugging complejo) y quieres frontier quality sin pagar precios de Claude/GPT
  • Ejecutas agentes con 10+ tool calls en workflows secuenciales
  • Necesitas 1M tokens de contexto sin sobrecoste
  • Post-0813: la latencia ya no es un bloqueador — Pro a 80 tok/s es más rápido que la mediana de la categoría
  • Post-0813: quieres gains agentic frontier (Terminal-Bench 2.1: 87.9, DeepSWE: 62.7) a una fracción del precio de Opus-4.8 o Fable-5
  • El budget lo permite y self-hosteas con DSpark habilitado — la base de 1.6T tiene vida propia más allá de la API: Nex la usó como base del mayor post-training trillion-scale en pesos abiertos hasta la fecha (análisis de Nex-N2.5)
  • Post-11 sept: el endpoint sigue vivo. El retiro anunciado el 10 sept para el 14 de septiembre se canceló por demanda de usuarios; deepseek-v4-pro mantiene nombre, modelo y factura. Vigila el changelog igualmente: que lo revocaran una vez no garantiza que no vuelvan a intentarlo.

V4-Flash tiene sentido cuando

  • Tienes alto volumen y necesitas controlar costes agresivamente
  • Las tareas son generales: QA, resúmenes, clasificación, code completion simple, code review
  • Quieres un baseline sólido para routing inteligente entre modelos
  • Post-0731: ejecutas fleets de agentes en paralelo — 2,500 concurrency vs 500 de Pro
  • Post-0731: la latencia importa — Flash a 141 tok/s es 1.8x más rápido que Pro (80 tok/s post-0813)
  • Post-0731: quieres gains agentic sin pagar Pro (Terminal-Bench 2.1: 82.7 vendor-stated)
  • Post-Vision-Exp: tus agentes necesitan leer screenshots, charts o documentos escaneados — visión al mismo precio que Flash (deepseek-v4-flash-vision-exp; nombre retirado el 10-sep: la vía actual es deepseek-flash, más barata — ver la actualización del 10 de septiembre)

Busca alternativas cuando

  • Necesitas multimodalidad → visión GA y a precio rebajado en deepseek-flash (V4.1-Flash) desde el 10 sept; para audio u otros modalities, Gemini-3.1-Pro o Claude Opus
  • La velocidad de respuesta es crítica en single-token latency → GPT-5.4 o Claude Sonnet
  • Quieres provider diversity y fallback → Claude + GPT combinados
  • Las tareas requieren factual recall de alta precisión → Gemini-3.1-Pro (SimpleQA 75.6 vs 57.9 de V4-Pro)
  • Necesitas el último grito en agentes → Fable-5 o Kimi K3 superan a Pro-0813 en DeepSWE y otros; el rejunte de rankings y precios de esa hornada está en el análisis del mercado LLM de julio 2026

Metodología

Este análisis se basa en:

Conclusión

Nota post-V4.1 (10 sept): esta sección ya no describe el mercado de la API de DeepSeek — describe la familia V4 que fue. La tabla de Pro vs frontier mantiene valor como histórico del Preview; para el estado actual, la actualización del 10 de septiembre manda en arquitectura: V4.1-Flash es el modelo nuevo de la casa. En catálogo, la actualización del 11 de septiembre corrige el tiro: V4 Pro no se retira — el anuncio se canceló antes de ejecutarse y Pro sigue disponible a su precio.

DeepSeek V4-Pro-0813 es, según Artificial Analysis, el #3 en inteligencia entre 106 modelos comparables (Intelligence Index 53). Es el mejor modelo open-weight en coding por margen claro. Y cuesta entre 4x y 29x menos que los modelos cerrados equivalentes, dependiendo de si comparas en peak u off-peak, y con Pro o Flash.

V4-Flash a $0.22/$0.44/M input (off-peak/peak) sigue siendo uno de los modelos con mejor ratio calidad/precio del mercado para tareas generales, aunque la subida del 16 de agosto reduce el margen.

El trade-off ha cambiado desde abril: Pro ya no es lento (80 tok/s con DSpark), la familia tiene visión experimental a precio de Flash, y queda la verbosidad como peaje. Para multimodalidad production-grade o provider diversity, los modelos de Anthropic, OpenAI y Google siguen siendo superiores. Para todo lo demás, V4 ha cerrado la distancia.

Epílogo (10 de septiembre de 2026, corregido el 11): DeepSeek decidió que la pregunta ya no tiene sentido. V4.1-Flash — nueva arquitectura, visión nativa, precios rebajados ($0.15/$0.30 input, $0.60/$1.20 output) — reemplaza a Flash y Vision-Exp, e iba a absorber también el endpoint de Pro desde el 14 de septiembre. Iba: el 11, con el deadline a tres días, el changelog y el pie de la ficha de precios cancelaron el retiro “en respuesta a la demanda de usuarios”. V4 Pro sigue vivo, a su precio, sin fecha de caducidad — y la jugada de “un modelo barato que supuestamente hace todo” queda aparcada, no descartada. La decisión de matar al modelo grande duró menos que un ciclo de verificación independiente. Y esa verificación, cuando llegó (Artificial Analysis, 26-sep: Intelligence Index 39, frente al 53 de Pro-0813), no confirmó la tesis del “supera comprensivamente” — la suite agentic del vendor sigue sin reproducir nadie. En esta familia, la ficha de precios se revisa antes de migrar — y probablemente también después.


Fuentes: Model card DeepSeek V4-Pro-0813 (Hugging Face), GA Release — news oficial (13 ago 2026), Model card DeepSeek V4-Flash-Vision-Exp (Hugging Face), Vision-Exp release — news oficial (21 ago 2026), Pricing oficial DeepSeek, Changelog oficial, Artificial Analysis — V4-Pro 0813, Artificial Analysis — V4-Flash 0731, Reuters — V4 Pro official release, Baseten — Inference engineering for V4-Pro-0813, Digital Applied — V4 Flash 0731 release, DataLearner — V4-Flash specs & benchmarks, MarkTechPost — V4-Flash-0731 gains, Lushbinary — V4 Pro vs Flash, OfficeChai — Benchmarks completos

Cargando comentarios...