NovedadIA
D

DeepSeek V4 Flash

De pagoValoracion editorial 4.2/5Modelos de IA

Modelo económico y ligero de DeepSeek basado en arquitectura MoE, con 284.000 millones de parámetros totales y 13.000 millones activos. Destaca por capacidades Agent y de programación cercanas al nivel insignia, por un coste extremadamente bajo. Una de las APIs con mejor relación calidad-precio de 2026.

Herramientas relacionadas

DeepSeek-V4-Flash es el modelo económico de DeepSeek, presentado inicialmente como versión preliminar el 24 de abril de 2026 y lanzado oficialmente el 31 de julio. Forma parte de la familia DeepSeek-V4 y se sitúa como alternativa económica al modelo insignia V4-Pro, que cuenta con 1,6 billones de parámetros totales y 49.000 millones de parámetros activos.

Ambos utilizan una arquitectura MoE (Mixture of Experts), admiten una ventana de contexto de 1 millón de tokens y permiten alternar entre modos con razonamiento y sin razonamiento. V4-Flash cuenta con 284.000 millones de parámetros totales, pero solo activa 13.000 millones durante la inferencia. Sus datos de preentrenamiento alcanzan los 32 billones de tokens.

La verdadera posición de V4-Flash no es ser una versión recortada de Pro, sino una solución optimizada para determinados escenarios donde la relación calidad-precio es prioritaria. La propia descripción oficial resulta bastante precisa: tiene «un conocimiento del mundo algo inferior, pero muestra una capacidad de razonamiento cercana».

Lo más importante es que la versión final volvió a realizar el post-training y consiguió multiplicar sus capacidades como agente sin modificar la arquitectura ni el número de parámetros del modelo.

¿Qué significa esto?

Que DeepSeek está mostrando al mercado que la carrera por aumentar el tamaño de los modelos podría estar dando paso a una competencia centrada en la eficiencia del post-training.

Un modelo con solo 13.000 millones de parámetros activos puede, mediante mejores métodos de entrenamiento, acercarse e incluso superar en tareas específicas a modelos con un orden de magnitud más de parámetros.

3. Capacidades principales

Capacidad de razonamiento

V4-Flash está diseñado para ofrecer una capacidad de razonamiento cercana a V4-Pro. Los datos oficiales de benchmark muestran:

  • MMLU-Pro (EM): 86,2 puntos
  • GPQA Diamond (Pass@1): 88,1 puntos
  • AIME 2026 (modo de razonamiento Max): 95,83 %

¿Qué significa en la práctica?

Para preguntas cotidianas, razonamiento lógico de complejidad media y problemas matemáticos, V4-Flash ofrece un rendimiento más que suficiente.

Sin embargo, si necesitas resolver problemas de razonamiento de máxima dificultad, como los del benchmark Apex, V4-Flash obtuvo únicamente 33,0 puntos frente a los 54,1 de GPT-5.4, por lo que no es la mejor opción.

Programación

La programación es uno de los principales puntos fuertes de V4-Flash.

Datos oficiales:

  • LiveCodeBench (Pass@1): 91,6 puntos
  • Codeforces Rating: 3052
  • DSBench-FullStack: 68,7
  • DSBench-Hard: 59,6

¿Qué significa en la práctica?

V4-Flash ofrece un rendimiento muy sólido tanto en programación competitiva como en tareas de desarrollo cotidianas.

Algunos desarrolladores han probado la combinación de la API oficial con Claude Code durante casi 4 horas consecutivas, consumiendo alrededor de 100 millones de tokens, con una tasa de aciertos de caché del 99 % y un coste total inferior a 1 yuan. Además, otro desarrollador señaló que el modelo pudo completar el código y corregir más de una decena de errores en una sola ejecución, con un coste total de aproximadamente 0,10 dólares.

Para proyectos pequeños y medianos, depuración, generación de código y refactorización, V4-Flash es una opción con una relación calidad-precio difícil de igualar.

Agent / uso de herramientas

Esta es probablemente la sorpresa más importante de la versión final de V4-Flash.

DeepSeek publicó resultados en nueve benchmarks de agentes, entre ellos:

BenchmarkPuntuaciónQué evalúa
------:---
Terminal Bench 2.182,7Operaciones en terminal
NL2Repo54,2Comprensión y modificación de repositorios
DeepSWE54,4Tareas de ingeniería de software
Cybergym76,7Tareas de ciberseguridad
Toolathlon-Verified70,3Uso de herramientas
Agent Last Exam25,2Evaluación general de agentes

Su puntuación de 82,7 en Terminal Bench 2.1 supera los 81,0 puntos de GLM-5.2 y queda solo ligeramente por debajo de los 85,0 de Claude Opus 4.8.

Pero hay que interpretar estos resultados con cautela.

Las puntuaciones fueron obtenidas utilizando el framework Harness desarrollado por DeepSeek, por lo que deben considerarse resultados comunicados por el propio fabricante, y no una evaluación completamente independiente de terceros.

Aun así, la evaluación independiente de Artificial Analysis también otorgó a V4-Flash un índice de inteligencia de 50 puntos, lo que proporciona cierta validación externa de la mejora en capacidades Agent.

V4-Flash incorpora de forma nativa el formato OpenAI Responses API y está adaptado específicamente para productos Agent populares como Codex. La API también admite los formatos de interfaz de OpenAI ChatCompletions y Anthropic.

Contexto largo

V4-Flash admite 1 millón de tokens de contexto y puede generar hasta 384.000 tokens de salida.

Pero aquí hay una diferencia fundamental:

Una ventana de contexto grande no significa necesariamente una gran capacidad para comprender textos largos.

DeepSeek reconoce explícitamente que V4-Flash tiene un conocimiento del mundo inferior al de su modelo insignia.

En la prueba SimpleQA-Verified, V4-Flash obtuvo solo 34,1 puntos, muy por debajo de los 57,9 puntos de V4-Pro.

Esto significa que, cuando trabajas con documentos largos que requieren una gran cantidad de conocimiento externo, V4-Flash puede ser menos fiable que un modelo insignia.

En la práctica: V4-Flash resulta especialmente adecuado para tareas estructuradas y de procesamiento de textos, como resumir, extraer información o traducir. Sin embargo, si necesitas localizar información específica dentro de enormes cantidades de texto y después utilizar conocimientos externos para razonar sobre ella, conviene evaluar cuidadosamente su rendimiento.

Multimodalidad

En agosto de 2026, DeepSeek ya había lanzado la versión multimodal experimental V4-Flash-Vision-Exp.

Esta versión mantiene las capacidades de texto de V4-Flash y consigue una mejora considerable en benchmarks de agentes multimodales, acercándose al nivel de Opus 4.8.

Pero hay una distinción importante: la versión estándar de V4-Flash sigue siendo un modelo exclusivamente de texto y no admite entradas de imagen.

No hay que confundir «puede leer imágenes» con «puede generar imágenes»: V4-Flash no admite ninguna de las dos funciones, salvo que se utilice la versión experimental Vision.

4. ¿Cómo interpretar sus benchmarks?

No te dejes impresionar simplemente porque aparezca un «primer puesto».

V4-Flash obtiene resultados excelentes en varios benchmarks, pero cada prueba mide capacidades diferentes.

Terminal Bench 2.1 — 82,7 puntos: evalúa la capacidad del modelo para completar tareas en un entorno de terminal real: modificar configuraciones, ejecutar scripts y corregir errores. Una puntuación de 82,7 indica que V4-Flash tiene un nivel considerablemente alto en tareas donde la IA debe interactuar directamente con un sistema operativo.

Artificial Analysis Intelligence Index — 50 puntos: es una prueba de capacidad general. Los 50 puntos sitúan a V4-Flash por encima de la mediana de modelos comparables, que es de 17 puntos, y solo 1 punto por debajo de GPT-5.6 Luna, con 51. Sin embargo, esta puntuación se obtuvo utilizando el nivel máximo de razonamiento. En condiciones reales, reducir la intensidad del razonamiento puede disminuir el resultado.

AIME 2026 — 95,83 %: en razonamiento matemático, V4-Flash prácticamente no presenta diferencias con V4-Pro, mientras que su coste es aproximadamente una novena parte. Para aplicaciones que necesitan realizar grandes cantidades de cálculos matemáticos, esto supone una ventaja considerable.

Conclusión clave: V4-Flash destaca especialmente en tareas Agent y de programación, se acerca al nivel de los modelos insignia en matemáticas, pero sigue teniendo una desventaja clara en conocimiento general del mundo y razonamiento complejo.

Ningún benchmark puede representar por sí solo la «capacidad general» de un modelo.

5. Valor práctico en el mundo real

Escenario 1: API y procesamiento masivo — ★★★★★

Este es el principal campo de batalla de V4-Flash.

  • Precio extremadamente bajo: $0,14 por millón de tokens de entrada y $0,28 por millón de tokens de salida
  • Alta velocidad: menos parámetros y menos parámetros activos permiten respuestas rápidas
  • Tasa de aciertos de caché muy elevada: algunos desarrolladores han medido hasta un 99 %

Para tareas que requieren procesar grandes cantidades de tokens, como etiquetado de datos, moderación de contenidos, traducción masiva o revisión de grandes volúmenes de código, la relación calidad-precio de V4-Flash es difícil de superar.

Escenario 2: asistencia para programación — ★★★★★

Tanto para depuración cotidiana como para generación de código o desarrollo de proyectos pequeños, los 91,6 puntos en LiveCodeBench y el Codeforces Rating de 3052 demuestran que V4-Flash puede asumir la mayoría de tareas habituales de programación.

La combinación con frameworks Agent como Claude Code puede mejorar todavía más la experiencia.

Escenario 3: desarrollo de aplicaciones Agent — ★★★★☆

Las capacidades Agent de V4-Flash ya son suficientes para soportar muchas tareas automatizadas de complejidad media.

El soporte nativo de Responses API y la adaptación a Codex lo convierten en una alternativa de gran relación calidad-precio para desarrollar aplicaciones basadas en agentes de IA.

Escenario 4: preguntas cotidianas y escritura — ★★★★☆

Para preguntas generales, creación de contenidos y resúmenes, V4-Flash ofrece un rendimiento estable.

Sin embargo, si necesitas escribir artículos largos de máxima calidad o realizar investigación y análisis profundos, su menor conocimiento general puede afectar a la calidad de los resultados.

Escenario 5: razonamiento complejo e investigación — ★★☆☆☆

Si necesitas resolver problemas de nivel Apex, realizar análisis de investigación que dependan de grandes cantidades de conocimiento general o trabajar en escenarios donde la precisión factual sea crítica, V4-Flash no es la mejor opción.

En estos casos, conviene considerar V4-Pro u otros modelos insignia.

6. Precio y relación calidad-precio

Los precios corresponden a las consultas realizadas en agosto de 2026.

DeepSeek-V4-Flash utiliza un sistema de precios diferenciados según horas punta y valle:

PeriodoEntrada (caché)Entrada (sin caché)Salida
------:---:---:
Horario valle0,05 yuanes1,5 yuanes4,5 yuanes
Horario punta0,10 yuanes3,0 yuanes9,0 yuanes

Horario punta: 09:00–12:00 y 14:00–18:00, hora de Pekín.

Tomando como referencia aproximadamente 7,2 yuanes por dólar:

  • Salida en horario valle: aproximadamente $0,625 por millón de tokens
  • Salida en horario punta: aproximadamente $1,25 por millón de tokens

Comparación con la competencia

  • Claude Opus 4.8: aproximadamente $25 por millón de tokens de salida
  • V4-Flash: aproximadamente 1/40 a 1/90 del coste de Opus 4.8
  • Frente a GPT-5.6 Luna, el coste por tarea puede ser aproximadamente 60 % inferior

Importante: los precios pueden variar ligeramente según la plataforma, por ejemplo Aliyun Bailian. Los usuarios internacionales deben comprobar la disponibilidad en su región y la moneda utilizada para la facturación.

7. V4-Flash frente a otros modelos

V4-Flash vs DeepSeek-V4-Pro

CaracterísticaV4-FlashV4-Pro
Parámetros totales284B1,6T
Parámetros activos13B49B
Precio de salida~$0,66–1,25/M~$1,98–3,96/M
RazonamientoCercano a ProNivel insignia
Conocimiento generalClaramente inferiorMás amplio
Agent — tareas sencillasSimilarSimilar
Agent — tareas difícilesTiene desventajaMás potente

Conclusión: si tienes presupuesto suficiente y necesitas la máxima calidad, elige Pro. Si priorizas la relación calidad-precio, Flash es suficiente para la mayoría de tareas cotidianas.

V4-Flash vs GPT-5.6 Luna

Índice de inteligencia de Artificial Analysis:

V4-Flash: 50 puntos vs GPT-5.6 Luna: 51 puntos.

La diferencia es mínima, mientras que V4-Flash tiene una ventaja considerable en precio.

Ambos tienen una posición similar dentro de sus respectivas familias: son opciones orientadas a ofrecer una buena relación entre coste y rendimiento.

La elección dependerá principalmente de tus preferencias por el ecosistema —OpenAI frente a DeepSeek—, la compatibilidad de la API y la disponibilidad regional.

V4-Flash vs Claude Opus 4.8

En Terminal Bench 2.1:

V4-Flash: 82,7 vs Opus 4.8: 85,0.

La diferencia de rendimiento es relativamente pequeña, pero la diferencia de precio es enorme.

Si tienes un presupuesto limitado y tus tareas se centran principalmente en programación y agentes de IA, V4-Flash es una alternativa especialmente atractiva.

8. Opiniones de los usuarios

Actualmente, los comentarios públicos se concentran principalmente en comunidades de desarrolladores.

Comentarios positivos

  • Algunos desarrolladores han utilizado Claude Code durante 4 horas consecutivas, procesando 100 millones de tokens, con una tasa de aciertos de caché del 99 % y un coste total inferior a 1 yuan.
  • Un ingeniero de sistemas embebidos considera que V4-Flash-0731 ofrece un nivel general cercano a V4-Pro Preview, pero a un precio muy inferior.
  • Usuarios internacionales lo describen como «barato y potente».

Comentarios negativos y aspectos a vigilar

  • Por ahora solo está disponible públicamente a través de la API; la versión web y la aplicación todavía no se han actualizado.
  • Algunos desarrolladores consideran que todavía puede mejorar en seguimiento de instrucciones.
  • El framework Harness desarrollado internamente por DeepSeek puede introducir cierto sesgo de evaluación al utilizarse para medir el propio modelo.

Hay que poner estos comentarios en contexto: actualmente no existen suficientes datos procedentes de grandes encuestas independientes de satisfacción de usuarios. Por tanto, estas opiniones deben considerarse todavía como una primera fotografía de la percepción de la comunidad.

9. Ventajas y desventajas

✅ Ventajas

  • Coste de API extremadamente bajo: el precio de salida es aproximadamente 1/40–1/90 del de Claude Opus 4.8.
  • Gran mejora en capacidades Agent: la versión final supera ampliamente a la versión preliminar en varias pruebas de agentes.
  • Excelente rendimiento en programación: 91,6 puntos en LiveCodeBench y 3052 en Codeforces.
  • Razonamiento matemático cercano al nivel insignia: 95,83 % en AIME 2026, sin diferencia significativa frente a V4-Pro.
  • Alta tasa de aciertos de caché: puede alcanzar el 99 % en pruebas reales, reduciendo todavía más el coste efectivo.
  • Código abierto y buena compatibilidad: licencia MIT y compatibilidad tanto con formatos de API de OpenAI como de Anthropic.

❌ Desventajas

  • Conocimiento general del mundo claramente inferior: solo 34,1 puntos en SimpleQA-Verified.
  • Razonamiento complejo limitado: 33,0 puntos en Apex.
  • Existe una brecha frente a los mejores modelos en tareas Agent de alta dificultad.
  • Modelo exclusivamente de texto: la versión estándar no admite imágenes, audio ni vídeo, salvo la versión experimental Vision.
  • Actualmente limitado a la API: la versión web y la aplicación todavía no se han actualizado.
  • Los benchmarks deben interpretarse con cautela: parte de los resultados procede de frameworks desarrollados por el propio fabricante.

10. ¿Quién debería elegir DeepSeek-V4-Flash?

⭐ Muy recomendable para

  • Desarrolladores que utilizan APIs: necesitan muchas llamadas a bajo coste y con alta concurrencia.
  • Usuarios sensibles al precio: desarrolladores independientes, startups y estudiantes.
  • Procesamiento masivo: etiquetado de datos, moderación de contenidos, traducción a gran escala y tareas similares.
  • Desarrolladores de aplicaciones Agent: especialmente si utilizan frameworks como Claude Code o Codex.
  • Programadores que buscan asistencia de IA: depuración, generación de código y desarrollo de proyectos pequeños.

⚠️ Elegir con cautela si

  • Necesitas analizar documentos largos con máxima calidad: sus limitaciones de conocimiento general pueden afectar al resultado.
  • La precisión factual es crítica: por ejemplo, en determinados contextos médicos o jurídicos.
  • Necesitas capacidades multimodales: salvo que utilices la versión experimental Vision.

❌ No recomendable si

  • Necesitas el máximo nivel de razonamiento complejo: considera V4-Pro u otros modelos insignia como GPT-5.4.
  • Necesitas generación de imágenes: V4-Flash no puede generar imágenes.
  • Eres un usuario final convencional: actualmente la disponibilidad está limitada a la API y la versión web todavía no se ha actualizado.

11. Puntuación final — escala de 5,0

Cómo hemos calculado la puntuación: esta valoración se basa en el posicionamiento de V4-Flash como modelo económico, y no en una comparación de rendimiento absoluto frente a modelos insignia.

El foco está en evaluar hasta qué punto cumple su principal objetivo: completar grandes cantidades de tareas con un coste muy bajo.

CategoríaPuntuaciónValoración
------:---
Razonamiento4,0/5Excelente para tareas cotidianas y de complejidad media, limitado en problemas complejos
Programación4,5/5Cerca del nivel superior, con una relación calidad-precio excepcional
Capacidades Agent4,2/5Gran mejora en la versión final, acercándose a los mejores modelos
Contexto largo3,5/5Admite 1M de contexto, pero la recuperación de conocimiento es menos fiable
Velocidad4,5/5Menos parámetros activos y respuestas rápidas
Relación calidad-precio5,0/5Prácticamente sin rivales en su rango de precio
Valoración global4,2/5Excelente dentro de su posicionamiento

12. Conclusión final: ¿Merece la pena?

Sí, para el usuario adecuado.

El principal valor de DeepSeek-V4-Flash es muy sencillo: ofrece capacidades Agent y de programación suficientemente buenas a un coste extremadamente bajo.

No es el modelo más inteligente del mercado ni el que posee más conocimiento general. Pero sí es uno de los modelos de API con mejor relación calidad-precio de 2026.

El principal compromiso es claro:

Obtienes «lo suficientemente bueno», no «lo mejor».

Conocimiento general, razonamiento complejo y recuperación de información en textos largos son áreas donde V4-Flash tiene límites evidentes. Si necesitas la máxima calidad posible, deberías optar por V4-Pro u otro modelo insignia.

Si eres desarrollador de APIs, un emprendedor con presupuesto limitado o formas parte de un equipo que necesita procesar grandes cantidades de tokens, V4-Flash merece una evaluación seria.

Si necesitas el máximo nivel de razonamiento, realizar investigaciones complejas o trabajar en escenarios donde la precisión factual sea crítica, es mejor elegir un modelo más potente.

Si solo pudieras elegir un modelo para programación cotidiana y tareas Agent y, al mismo tiempo, quisieras mantener los costes bajo control, V4-Flash es actualmente una de las opciones más razonables del mercado.

13. Preguntas frecuentes (FAQ)

¿Qué es DeepSeek-V4-Flash?

DeepSeek-V4-Flash es el modelo de IA económico y ligero de DeepSeek, lanzado oficialmente el 31 de julio de 2026. Utiliza una arquitectura MoE, con 284.000 millones de parámetros totales y 13.000 millones de parámetros activos, admite un contexto de 1 millón de tokens y está diseñado como una alternativa rápida y eficiente para tareas de bajo coste.

¿Cuánto cuesta DeepSeek-V4-Flash?

Utiliza un sistema de precios diferenciado según las horas punta y valle.

En horario valle, la entrada con caché cuesta 0,05 yuanes por millón de tokens y la salida 4,5 yuanes por millón de tokens. Durante las horas punta, los precios se duplican.

En términos aproximados, el coste comunicado equivale a unos $0,14–0,28 por millón de tokens en determinados esquemas de precios. Los precios indicados corresponden a las consultas realizadas en agosto de 2026.

¿DeepSeek-V4-Flash tiene una versión gratuita?

Actualmente no dispone de una versión gratuita. El servicio se ofrece mediante API de pago.

¿Qué tan bueno es DeepSeek-V4-Flash para programar?

Es muy bueno.

Obtiene 91,6 puntos en LiveCodeBench y un Codeforces Rating de 3052. Las pruebas realizadas por desarrolladores utilizando Claude Code también muestran buen rendimiento, buena calidad del código y un coste extremadamente bajo.

¿DeepSeek-V4-Flash es mejor que GPT-5.6 Luna?

En el índice de inteligencia de Artificial Analysis:

V4-Flash: 50 puntos vs GPT-5.6 Luna: 51 puntos.

La diferencia es muy pequeña y V4-Flash ofrece una ventaja considerable en precio. La elección concreta dependerá del ecosistema de API, la disponibilidad regional y las preferencias personales.

¿Quién debería usar DeepSeek-V4-Flash?

Está especialmente recomendado para desarrolladores que utilizan APIs, usuarios sensibles al precio, equipos que necesitan procesar grandes cantidades de tareas en paralelo y desarrolladores que quieren construir aplicaciones Agent a bajo coste.

No es la mejor opción para escenarios que requieren el máximo nivel de razonamiento complejo o un conocimiento general del mundo especialmente amplio.

14. Puntuación editorial

CategoríaPuntuación
------:
Razonamiento4,0/5
Programación4,5/5
Capacidades Agent4,2/5
Contexto largo3,5/5
Velocidad4,5/5
Relación calidad-precio5,0/5
Valoración global4,2/5

Criterio de puntuación: la valoración se realiza teniendo en cuenta el posicionamiento de V4-Flash como modelo económico, y no comparando directamente su rendimiento absoluto con modelos insignia.

El criterio principal es su capacidad para completar grandes volúmenes de tareas con un coste reducido.

Recomendación final en una frase

DeepSeek-V4-Flash es especialmente recomendable para desarrolladores que utilizan APIs y usuarios sensibles al precio: si necesitas realizar grandes cantidades de tareas de programación, Agent o procesamiento masivo a un coste extremadamente bajo, es una de las opciones con mejor relación calidad-precio del mercado en 2026. Sin embargo, si necesitas el máximo nivel de razonamiento o un conocimiento general del mundo más amplio, es mejor optar por un modelo insignia.

Lo que hace DeepSeek V4 Flash

  • Capacidades Agent mejoradas: 82,7 puntos en Terminal Bench 2.1, superando a GLM-5.2 y cerca de Claude Opus 4.8 (85,0)
  • Excelente rendimiento en programación: 91,6 en LiveCodeBench y Codeforces Rating de 3052, compatible con Claude Code
  • Razonamiento matemático cercano al nivel insignia: 95,83 % en AIME 2026, sin diferencia significativa frente a V4-Pro
  • Ventana de contexto de 1 millón de tokens y hasta 384.000 tokens de salida
  • Coste de API extremadamente bajo con alta tasa de aciertos de caché (hasta 99 %)
  • Código abierto con licencia MIT y compatibilidad con formatos API OpenAI y Anthropic