NovedadIA
D

DeepSeek V4 Pro

De pagoValoracion editorial 4.3/5Modelos de IA

Modelo de IA insignia de DeepSeek lanzado el 13 de agosto de 2026. Con arquitectura MoE de 1,6 billones de parámetros totales y 49.000 millones activos, ofrece capacidades Agent de primer nivel mundial (Terminal Bench 2.1: 87,9; DeepSWE: 62,7), programación excelente (89,2 % HumanEval), contexto de 1M de tokens con 384K de salida y razonamiento nativo sobre imágenes. Supera en varias pruebas a Claude Fable 5 a aproximadamente 1/60 de su precio, aunque se acerca una subida de precios y su concurrencia está limitada a 500 solicitudes.

Herramientas relacionadas

DeepSeek-V4-Pro es el modelo insignia de la familia DeepSeek-V4. Apareció por primera vez como versión Preview el 24 de abril de 2026 y, tras 111 días de desarrollo y optimización, la versión estable, DeepSeek-V4-Pro-0813, se lanzó simultáneamente en la app, la versión web y la API el 13 de agosto.

Especificaciones principales:

  • 1,6T de parámetros totales y 49B de parámetros activos, con arquitectura MoE
  • Ventana de contexto de 1M de tokens y hasta 384K tokens de salida
  • Modos de razonamiento (thinking) y no razonamiento; el modo de razonamiento viene activado por defecto
  • Tres niveles de intensidad de razonamiento: low / high / max
  • Compatibilidad nativa con el formato OpenAI Responses API y adaptación específica para Codex
  • Compatibilidad con las interfaces OpenAI ChatCompletions y Anthropic

La verdadera posición de V4-Pro no es la de una “versión mejorada de Flash”, sino la de un “modelo insignia diseñado para tareas Agent de máximo nivel”. La descripción oficial es bastante clara: V4-Pro alcanza un nivel líder dentro de China y entre los modelos de pesos abiertos en capacidades Agent, conocimiento del mundo y rendimiento de razonamiento. En cuanto a la relación con Flash, ambos pueden rendir de forma similar en tareas sencillas, pero Pro mantiene una ventaja clara en las tareas de mayor dificultad.

El cambio fundamental no está en la arquitectura, sino en el post-training. La arquitectura y el tamaño del modelo son idénticos a los de la versión Preview, pero un proceso de post-training a gran escala orientado específicamente a escenarios de agentes de programación ha provocado un salto de magnitud en las capacidades Agent.

3. Capacidades principales

Capacidades Agent: el mayor salto

Este es, con diferencia, el cambio más llamativo de la versión estable de V4-Pro.

Los principales resultados publicados para sus benchmarks Agent son:

BenchmarkV4-Pro-0813V4-Flash-0731PreviewFable 5Qué mide
------:---:---:---:---
Terminal Bench 2.187,982,772,188,0Operaciones en terminal
Cybergym83,376,752,783,1Ciberseguridad
DeepSWE62,754,412,870,0Agentes de ingeniería de software
AutomationBench31,825,112,829,1Ejecución de tareas automatizadas
Toolathlon-Verified74,170,355,977,9Uso de herramientas
NL2Repo61,554,238,5Lenguaje natural a repositorio de código
DSBench-FullStack71,168,741,877,2Desarrollo full-stack
DSBench-Hard67,259,631,168,3Tareas de desarrollo avanzadas

¿Qué significa esto en la práctica? V4-Pro incluso supera a Fable 5 en AutomationBench y Cybergym. Sus 87,9 puntos en Terminal Bench 2.1 lo dejan a solo 0,1 puntos del líder mundial. En DeepSWE pasó de 12,8 puntos en la versión Preview a 62,7, un incremento de aproximadamente 4,9 veces. Esto significa que la versión estable ya no se limita a “saber escribir código”, sino que puede trabajar de forma continuada como un ingeniero de software.

Pero hay que interpretar estos datos con cautela: los resultados proceden de pruebas oficiales de DeepSeek realizadas con el framework DeepSeek Harness. Al tratarse de pruebas realizadas con herramientas propias, puede existir cierto sesgo. Será necesario esperar a validaciones independientes de terceros.

Capacidad de razonamiento

DeepSeek-V4-Pro supera a todos los modelos de pesos abiertos publicados hasta ahora en diversas evaluaciones de matemáticas, STEM y programación competitiva, y se acerca a los principales modelos propietarios del mundo. En SWE-Bench Verified obtuvo un 80,6 %, prácticamente al mismo nivel que el 80,8 % de Claude Opus 4.6.

En la práctica: para razonamiento lógico complejo, problemas matemáticos y asistencia en investigación científica, V4-Pro se encuentra en la primera división mundial. Sin embargo, según la puntuación Elo de la evaluación IRT del Gobierno de Estados Unidos, V4-Pro ronda los 800 puntos (±28), todavía por debajo de los 1260 de GPT-5.5 y los 999 de Claude Opus 4.6.

Programación

V4-Pro alcanza un 89,2 % en HumanEval, por encima del 88,7 % de GPT-5.5 y del 87,5 % de Claude Opus 4.7. En una prueba práctica, V4-Pro generó en aproximadamente 170 segundos 761 líneas de código HTML completamente funcional para simular el comportamiento colectivo de 200 objetos y consiguió ejecutarlo correctamente a la primera.

En la práctica: V4-Pro destaca especialmente en tareas que requieren generar de una sola vez código completo y ejecutable. Es especialmente adecuado para analizar repositorios completos, realizar modificaciones de código de varios pasos y trabajar con proyectos compuestos por múltiples archivos.

Contexto largo

V4-Pro admite una ventana de contexto de 1M de tokens y hasta 384K tokens de salida. En la prueba de recuperación de contexto largo MRCR 1M, V4-Pro obtuvo 83,5 puntos, frente a los 92,9 de Claude Opus 4.6.

En la práctica: 1M de contexto es suficiente para trabajar con una cantidad de texto comparable a toda la trilogía de El problema de los tres cuerpos. Combinado con 384K tokens de salida, resulta especialmente cómodo para grandes repositorios de código y documentos extensos.

Sin embargo, todavía existe una diferencia respecto a los mejores modelos en precisión de recuperación de información. Una ventana de contexto grande no significa necesariamente una mejor comprensión de textos largos.

Multimodalidad

La versión estable incorpora por primera vez razonamiento nativo sobre imágenes. El motor DeepThink puede ahora analizar imágenes, interpretar capturas de pantalla y procesar documentos mixtos dentro del mismo proceso de razonamiento.

Pero hay que distinguir dos capacidades: V4-Pro puede leer y comprender imágenes, pero no puede generar imágenes. La generación de imágenes requiere modelos generativos especializados.

Uso de herramientas y ecosistema Agent

V4-Pro admite de forma nativa el formato OpenAI Responses API y está adaptado específicamente para Codex, con scripts de configuración de un solo paso. También es compatible con la API de Anthropic, por lo que integrarlo con frameworks Agent como Claude Code solo requiere cambiar el base_url.

4. ¿Cómo interpretar los benchmarks?

V4-Pro obtiene resultados sobresalientes en múltiples benchmarks, pero cada prueba mide capacidades diferentes.

Terminal Bench 2.1 — 87,9 puntos: mide la capacidad del modelo para completar tareas complejas en un entorno de terminal real: modificar configuraciones, ejecutar scripts y solucionar errores. Una puntuación de 87,9 significa que V4-Pro ya se encuentra entre los modelos más avanzados del mundo para tareas en las que la IA debe interactuar directamente con un sistema operativo, quedándose a solo 0,1 puntos de Fable 5.

DeepSWE — 62,7 puntos: evalúa si el modelo puede “trabajar como un ingeniero” de manera continuada, no simplemente si sabe escribir un fragmento de código. El salto de 12,8 a 62,7 puntos respecto a la versión Preview demuestra una transformación importante en sus capacidades como agente de ingeniería de software.

Artificial Analysis Intelligence Index — 53 puntos: supone un aumento de 8 puntos respecto a la versión Preview. El coste por tarea es de solo 0,06 dólares, lo que lo convierte en el modelo más barato entre los que obtienen esos mismos 53 puntos.

Conclusión clave: V4-Pro ya alcanza un nivel de primer orden mundial en tareas Agent y de programación, aunque todavía presenta desventajas en la recuperación de información dentro de contextos extremadamente largos. Ningún benchmark puede representar por sí solo la “capacidad general” de un modelo: cada prueba mide habilidades diferentes.

5. Valor práctico

Escenario 1: desarrollo de aplicaciones Agent — muy recomendado

Este es el principal campo de batalla de V4-Pro.

Ya sea para comprender y modificar repositorios completos (NL2Repo: 61,5), operar en terminal (Terminal Bench: 87,9) o realizar tareas de ingeniería de software (DeepSWE: 62,7), V4-Pro ofrece un nivel de primer orden mundial.

Su compatibilidad nativa con Responses API y Codex lo convierte en una opción especialmente atractiva para construir aplicaciones basadas en agentes de IA.

Escenario 2: programación y desarrollo de software — muy recomendado

V4-Pro destaca en tareas que requieren generar de una sola vez código completo y funcional. También ofrece excelentes resultados en desarrollo full-stack (DSBench-FullStack: 71,1) y tareas avanzadas de desarrollo (DSBench-Hard: 67,2).

Es especialmente adecuado para trabajar con grandes repositorios, modificaciones de código de varios pasos y proyectos con múltiples archivos.

Escenario 3: documentos largos y análisis complejo — recomendado

La combinación de 1M de contexto y 384K tokens de salida permite procesar documentos extremadamente largos, repositorios completos y tareas Agent que requieren ejecutar numerosos pasos consecutivos.

Sin embargo, si el objetivo es recuperar información con extrema precisión dentro de grandes cantidades de texto, hay que tener en cuenta que V4-Pro obtuvo 83,5 puntos en MRCR 1M, frente a 92,9 de Claude Opus 4.6.

Escenario 4: tareas multimodales — utilizable

La versión estable incorpora por primera vez razonamiento sobre imágenes y puede analizar imágenes y documentos mixtos dentro del proceso de razonamiento.

Sin embargo, se trata de una capacidad relativamente nueva y su rendimiento práctico todavía necesita una evaluación más amplia.

Escenario 5: procesamiento masivo con alta concurrencia — no recomendado

El límite de concurrencia es de solo 500. Si necesitas procesar grandes volúmenes de solicitudes simultáneamente, V4-Flash, con una concurrencia de 2500, es una opción más adecuada.

6. Precio y relación calidad-precio

Precios consultados en agosto de 2026.

Precios vigentes antes del 17 de agosto de 2026

ConceptoV4-ProV4-Flash
------:---:
Entrada, caché activada0,025 yuanes/M0,02 yuanes/M
Entrada, sin caché3 yuanes/M1 yuan/M
Salida6 yuanes/M2 yuanes/M

El precio de salida de V4-Pro es exactamente 3 veces superior al de V4-Flash.

Nuevos precios desde el 17 de agosto de 2026

PeriodoEntrada, sin cachéSalida
------:---:
Horas valle4,5 yuanes/M13,5 yuanes/M
Horas punta9 yuanes/M27 yuanes/M

Horas punta: días laborables, de 09:00 a 12:00 y de 14:00 a 18:00, hora de Pekín.

El precio durante las horas valle equivale a la mitad del precio de las horas punta.

Después del ajuste, el precio de salida de V4-Pro durante las horas punta aumenta aproximadamente un 350 %, pasando de los 6 yuanes anteriores a 27 yuanes por millón de tokens.

Comparación con la competencia

Incluso después de la subida, la ventaja de precio de V4-Pro sigue siendo enorme. La API de Fable 5 cuesta aproximadamente 10 dólares por millón de tokens de entrada (unos 71 yuanes) y 50 dólares por millón de tokens de salida (unos 355 yuanes).

Tomando como referencia el precio de V4-Pro durante las horas valle, la entrada cuesta aproximadamente 1/16 que Fable 5 y la salida aproximadamente 1/26.

7. Modelo frente a alternativas

Frente a DeepSeek-V4-Flash

DimensiónV4-ProV4-Flash
Parámetros totales1,6T284B
Parámetros activos49B13B
Precio de salida6 yuanes, subirá a 13,5-272 yuanes
Límite de concurrencia5002500
Agent, tareas sencillasSimilarSimilar
Agent, tareas avanzadasClaramente superiorMás limitado
Razonamiento de imágenesNo, salvo Vision experimental

Conclusión: si solo necesitas chat, programación ligera y consultas cotidianas, Flash ofrece una relación calidad-precio claramente superior. Si necesitas trabajar con contextos extremadamente largos, tareas Agent complejas o una mayor calidad de salida, entonces merece la pena pagar el precio adicional de Pro.

Frente a Claude Fable 5

V4-Pro obtiene 87,9 puntos en Terminal Bench 2.1 frente a 88,0 de Fable 5, una diferencia de solo 0,1 puntos. Incluso supera a Fable 5 en AutomationBench y Cybergym.

Sin embargo, su precio es aproximadamente 1/60 del de Fable 5. Para quienes tienen un presupuesto limitado y centran su trabajo en agentes y programación, V4-Pro resulta una alternativa extremadamente atractiva.

Frente a GPT-5.4

En SWE-Bench Verified, V4-Pro alcanza el 80,6 % y ofrece un rendimiento cercano al de GPT-5.4. En HumanEval, V4-Pro logra un 89,2 %, por encima del 88,7 % de GPT-5.5.

Sin embargo, en capacidad general de razonamiento, la evaluación IRT sitúa a V4-Pro alrededor de 800 puntos, todavía por debajo de GPT-5.4.

8. Opiniones de los usuarios

Las opiniones públicas disponibles actualmente se concentran principalmente en las comunidades de desarrolladores.

Comentarios positivos:

  • Un desarrollador utilizó V4-Pro para crear una simulación del comportamiento colectivo de 200 objetos y generó 761 líneas de código completamente funcional en 170 segundos.
  • En tareas de análisis de datos y visualización, V4-Pro consiguió realizar correctamente el análisis y generar dashboards interactivos sencillos y claros.
  • En la comunidad se considera que “incluso después de la subida de precio, sigue ofreciendo una relación calidad-precio excelente”.
  • Algunos desarrolladores señalan que la estética del frontend ha experimentado un salto cualitativo y que las capacidades Agent son especialmente estables.

Comentarios negativos o cautelosos:

  • Existen opiniones discrepantes. Algunos desarrolladores consideran que la versión 0813 todavía está ligeramente por debajo de Luna MX, mientras que otros señalan que aproximadamente la mitad de los benchmarks todavía quedan por detrás de Kimi K3.
  • DeepSeek todavía no ha publicado un informe completo de benchmarks, por lo que las afirmaciones oficiales necesitan validación independiente.
  • La próxima subida de precios ha generado preocupación entre algunos desarrolladores.

Hay que aclarar: todavía no existen datos de encuestas independientes a gran escala sobre satisfacción de usuarios. Las opiniones anteriores deben considerarse únicamente como una primera muestra del sentimiento de la comunidad.

9. Ventajas y desventajas

Ventajas

  • Capacidades Agent de primer nivel mundial: 87,9 puntos en Terminal Bench, solo 0,1 por debajo de Fable 5, además de superar a Fable 5 en dos pruebas.
  • Excelente programación: 89,2 % en HumanEval, por encima de GPT-5.5 y Claude Opus 4.7.
  • Gran ventaja de precio: incluso después de la subida, el precio de salida será aproximadamente 1/26 del de Fable 5.
  • Contexto de 1M + salida de 384K: excelente para documentos largos y grandes repositorios de código.
  • Primer soporte para razonamiento sobre imágenes: incorpora capacidades multimodales por primera vez.
  • Abierto y compatible: licencia MIT y compatibilidad con los formatos de API de OpenAI y Anthropic.
  • Tres niveles de intensidad de razonamiento: low / high / max para adaptar el consumo al nivel de complejidad de cada tarea.

Desventajas

  • Gran subida de precio inminente: la salida llegará a 27 yuanes por millón de tokens durante las horas punta, aproximadamente un 350 % más que el precio actual.
  • Límite de concurrencia estricto: solo 500, muy por debajo de los 2500 de Flash.
  • Menor precisión en recuperación de contexto largo que los modelos líderes: MRCR 1M: 83,5 frente a 92,9 de Opus 4.6.
  • El razonamiento general todavía está por detrás de GPT-5.5: aproximadamente 800 puntos Elo frente a 1260 de GPT-5.5.
  • Los benchmarks deben interpretarse con cautela: algunos resultados proceden de frameworks desarrollados por la propia empresa.
  • El razonamiento sobre imágenes acaba de estrenarse: su rendimiento práctico todavía necesita más validación.

10. ¿Quién debería elegirlo?

Muy recomendado

  • Desarrolladores de aplicaciones Agent: quienes necesitan operaciones avanzadas en terminal, comprensión de repositorios y capacidades de ingeniería de software.
  • Ingenieros de software: profesionales que trabajan con grandes repositorios, modificaciones de código de varios pasos y proyectos con múltiples archivos.
  • Usuarios que exigen la máxima calidad de salida: escenarios en los que la calidad del código y de la ejecución del agente es prioritaria.
  • Empresas: aplicaciones comerciales con presupuesto suficiente que necesitan capacidades de nivel flagship.

Elegir con cautela

  • Desarrolladores individuales con presupuesto limitado: Flash ya es suficiente para la mayoría de las tareas cotidianas.
  • Usuarios que necesitan procesamiento masivo con alta concurrencia: el límite de 500 puede convertirse en un cuello de botella.
  • Escenarios que requieren una precisión extrema en la recuperación de textos largos: por ejemplo, revisión de documentos legales o investigación académica.

No recomendado

  • Usuarios que solo necesitan consultas cotidianas y programación ligera: Flash ofrece una relación calidad-precio claramente mejor.
  • Usuarios que necesitan generación de imágenes: V4-Pro no puede generar imágenes.
  • Usuarios extremadamente sensibles al precio: la próxima subida puede superar su presupuesto.

11. Puntuación final sobre 5,0

Lógica de la puntuación: esta valoración considera a V4-Pro como un modelo insignia. El principal criterio es su capacidad para ofrecer capacidades Agent de primer nivel, teniendo también en cuenta la próxima subida de precios.

DimensiónPuntuaciónComentario
------:---
Capacidades Agent4,8Nivel mundial de primer orden; supera a Fable 5 en dos pruebas
Programación4,7Supera a GPT-5.5 y Claude Opus 4.7
Razonamiento4,2Comparable a los mejores modelos propietarios, pero todavía por detrás de GPT-5.5
Contexto largo4,01M de contexto + 384K de salida, aunque la precisión de recuperación presenta margen de mejora
Multimodalidad3,5Primer soporte para razonamiento sobre imágenes, todavía en una etapa inicial
Relación calidad-precio4,3Ventaja de precio enorme, aunque está a punto de subir considerablemente
Valoración general4,3Excelente dentro de su posicionamiento como flagship

12. Conclusión final: ¿merece la pena?

Sí, para quienes necesitan lo mejor.

El mayor valor de DeepSeek-V4-Pro es que ofrece capacidades Agent cercanas e incluso superiores en algunos aspectos a las de Fable 5 por aproximadamente 1/60 de su precio. No es el modelo más barato ni el más potente en razonamiento general, pero sí es uno de los modelos Agent flagship con mejor relación calidad-precio del mercado en 2026.

El principal sacrificio es que el precio está a punto de aumentar alrededor de un 350 % y la concurrencia está limitada a solo 500 solicitudes. Si necesitas procesar grandes volúmenes con alta concurrencia, Flash es una opción más adecuada. Si buscas la máxima capacidad de razonamiento del mercado, GPT-5.5 sigue teniendo ventaja.

Si eres un desarrollador que necesita construir aplicaciones Agent de primer nivel, un ingeniero de software que trabaja con grandes repositorios o un usuario empresarial que exige la máxima calidad de salida, V4-Pro merece una evaluación seria y conviene probarlo antes de la subida de precios del 17 de agosto.

Si tienes un presupuesto limitado, solo necesitas consultas cotidianas y programación ligera o necesitas procesar solicitudes con alta concurrencia, elige V4-Flash: su relación calidad-precio es superior.

Si solo pudieras elegir un modelo para desarrollar agentes y realizar programación compleja, pero quieres mantener los costes bajo control dentro del segmento flagship, V4-Pro es una de las opciones más razonables del mercado en 2026. Eso sí, debes incorporar la próxima subida de precios a tu presupuesto.

13. FAQ

¿Qué es DeepSeek-V4-Pro?

DeepSeek-V4-Pro es el modelo de IA flagship que DeepSeek lanzó el 13 de agosto de 2026. Cuenta con 1,6 billones de parámetros totales y 49.000 millones de parámetros activos, admite un contexto de 1M de tokens y hasta 384K tokens de salida, y ofrece capacidades Agent de primer nivel mundial.

¿Cuánto cuesta DeepSeek-V4-Pro?

El precio vigente antes del 17 de agosto era de 0,025 yuanes por millón de tokens de entrada con caché, 3 yuanes para entrada sin caché y 6 yuanes para salida.

Desde el 17 de agosto de 2026 se aplica una tarifa por franjas horarias: durante las horas valle, la salida cuesta 13,5 yuanes por millón de tokens, mientras que durante las horas punta cuesta 27 yuanes por millón de tokens.

Los precios corresponden a la consulta realizada en agosto de 2026.

¿DeepSeek-V4-Pro tiene una versión gratuita?

No. V4-Pro se ofrece únicamente como servicio de pago mediante API y no dispone de una versión gratuita.

¿Qué tan bueno es DeepSeek-V4-Pro para programar?

Excelente. Obtiene un 89,2 % en HumanEval, por encima de GPT-5.5 y Claude Opus 4.7. En pruebas prácticas puede generar cientos de líneas de código completo y ejecutable de una sola vez. Es especialmente adecuado para analizar repositorios completos y realizar modificaciones de código de varios pasos.

¿Es DeepSeek-V4-Pro mejor que Claude Fable 5?

En algunos aspectos sí, pero no en todos. V4-Pro obtiene 87,9 puntos en Terminal Bench 2.1 frente a los 88,0 de Fable 5, una diferencia de solo 0,1 puntos. También supera a Fable 5 en AutomationBench y Cybergym.

Además, su precio es aproximadamente 1/60 del de Fable 5.

¿Quién debería usar DeepSeek-V4-Pro?

Está especialmente recomendado para desarrolladores de aplicaciones Agent, ingenieros de software y empresas que exigen la máxima calidad de salida.

No es la mejor opción para desarrolladores individuales con presupuesto limitado, usuarios que solo necesitan consultas cotidianas o escenarios que requieren procesamiento masivo con alta concurrencia.

Lo que hace DeepSeek V4 Pro

  • Capacidades Agent de primer nivel mundial: 87,9 puntos en Terminal Bench 2.1 (0,1 por debajo de Fable 5) y salto de 12,8 a 62,7 en DeepSWE
  • Programación excelente: 89,2 % en HumanEval, por encima de GPT-5.5 y Claude Opus 4.7, capaz de generar cientos de líneas de código funcional de una sola vez
  • Contexto largo de 1M de tokens con hasta 384K tokens de salida
  • Razonamiento nativo sobre imágenes incorporado por primera vez en la versión estable (DeepThink), aunque sin generación de imágenes
  • Compatibilidad nativa con OpenAI Responses API y ChatCompletions, adaptado para Codex y compatible con la API de Anthropic
  • Precio muy inferior a la competencia (≈1/60 respecto a Claude Fable 5) y tres niveles de intensidad de razonamiento (low/high/max)