Qwen3.8 Flash Next
Modelo de código abierto de Qwen (Alibaba) lanzado el 26 de agosto de 2026 como vista previa de la arquitectura Qwen4. Con solo 6B de parámetros activos de 125B totales, ofrece capacidades de programación y tareas Agent cercanas a modelos insignia como Claude Opus, por una fracción del coste.
Herramientas relacionadas
Qwen3.8-Flash-Next no es lo mismo que Qwen3.8-Flash.
Esta es la primera distinción que hay que tener clara. Aunque sus nombres son muy parecidos, su posicionamiento es diferente:
- Qwen3.8-Flash-Next: modelo con pesos abiertos, versión técnica de vista previa de la arquitectura Qwen4, publicada en Hugging Face y ModelScope.
- Qwen3.8-Flash: versión de producción de la API de la plataforma Qwen, basada en la misma arquitectura pero optimizada para ofrecer el servicio.
Qwen3.8-Flash-Next tiene 125B de parámetros totales y añade otros 51B de N-gram Embedding, almacenados en la RAM del sistema en lugar de la VRAM. Si se suma el módulo de predicción de múltiples tokens, el almacenamiento total ronda los 180B de parámetros. Sin embargo, solo activa 6B de parámetros por token, lo que supone una esparsidad cercana al 95 %. Admite de forma nativa un contexto de 262.144 tokens, ampliable hasta 1 millón de tokens mediante YaRN.
El principal atractivo de su arquitectura es la combinación de Gated DeltaNet + Qwen Sparse Attention. Tres de cada cuatro capas utilizan Gated DeltaNet —un mecanismo de atención lineal que comprime el historial en un estado de tamaño fijo—, mientras que una capa utiliza Qwen Sparse Attention, que agrupa la secuencia en microbloques y aplica atención completa únicamente en las regiones consideradas relevantes.
El objetivo fundamental de este diseño es reducir drásticamente el coste de inferencia cuando se trabaja con contextos de hasta 1 millón de tokens.
Su verdadera posición en el mercado no es la de un “modelo pequeño”, sino la de un “experimento de eficiencia”. El equipo de Qwen ha decidido publicar por adelantado los cambios arquitectónicos para que la comunidad pueda probarlos antes de construir la familia Qwen4 completa.
Es, en esencia, un modelo “canario”: su misión no es convertirse necesariamente en el modelo más potente, sino demostrar que la nueva arquitectura funciona.
3. Capacidades principales
Programación: su mayor atractivo
El rendimiento de Qwen3.8-Flash-Next en programación resulta sorprendente. Obtuvo 91,9 % en LiveCodeBench v6, solo por detrás de la serie Sakana Fugu. En benchmarks de ingeniería de software:
- SWE-bench Pro: 62,5 — el coste de ejecución de Qwen3.8-Max es 12 veces superior.
- DeepSWE: 58,7
¿Qué significa esto en la práctica? Qwen3.8-Flash-Next se acerca al nivel de los modelos insignia en tareas reales de ingeniería de software, pero con un coste que representa solo una pequeña fracción del de estos modelos.
La reacción de algunos desarrolladores ha sido bastante directa: “Si esto es Flash, ¿por qué estamos pagando por Opus?”
Agentes y uso de herramientas
Las capacidades Agent son otro de los puntos fuertes de Qwen3.8-Flash-Next:
- Tool Use: 73,5
- JobBench: 55,7
- Agents' Last Exam: 51,2 %, solo por detrás de Qwen3.8 Max, con 52,4 %.
En los benchmarks publicados por el equipo de Qwen, Qwen3.8-Flash-Next supera a DeepSeek-V4-Flash-0731 y Claude Opus 4.6 (Max) en la gran mayoría de las evaluaciones relacionadas con agentes, programación, capacidades generales y multimodalidad.
Algunos desarrolladores han comprobado que el modelo puede completar en menos de 8 minutos un flujo de trabajo completo que combina programación en Python, análisis de múltiples tablas y generación de un informe de investigación.
Pero hay que tener una precaución importante: estos resultados proceden principalmente del fabricante y todavía no han sido validados a gran escala por terceros independientes.
Capacidad de razonamiento
Qwen3.8-Flash-Next obtuvo 56 puntos en el índice de inteligencia de Artificial Analysis, frente a una mediana de 28 puntos entre modelos comparables.
En 21 de las 22 evaluaciones lingüísticas y visuales analizadas, Qwen3.8-Flash-Next consiguió resultados iguales o superiores a Qwen3.8-27B. Durante la fase de preentrenamiento, superó a su modelo anterior 397B-A17B en 8 de 14 benchmarks.
Multimodalidad
Qwen3.8-Flash-Next admite entrada de texto, imágenes y vídeo, pero genera únicamente texto.
Es un modelo MoE multimodal, pero no puede generar imágenes ni vídeos. En otras palabras: puede “ver”, pero no “dibujar”.
El contexto nativo es de 262K tokens y puede ampliarse hasta 1M.
Velocidad
En una única RTX PRO 6000 Blackwell, la versión cuantizada con NVFP4 puede alcanzar entre 180 y 226 tokens por segundo en decodificación de flujo único.
En un M4 Max, la versión cuantizada a 4 bits alcanza aproximadamente 60 tokens por segundo, mientras que con MTP llega a 78 tokens por segundo.
En escenarios con un contexto de 1 millón de tokens y una tasa de aciertos de caché de prefijo del 90 %, el rendimiento de prefill alcanza 8,6 veces el de Qwen3.7-Plus.
4. ¿Cómo interpretar los benchmarks?
Los resultados de Qwen3.8-Flash-Next son muy llamativos, pero hay que leerlos con cierta cautela.
El índice de inteligencia de Artificial Analysis, con 56 puntos, es uno de los pocos datos procedentes de una evaluación independiente. Combina nueve evaluaciones, entre ellas Terminal-Bench v2.1 y GPQA Diamond.
Una puntuación de 56 sitúa al modelo entre las opciones líderes, mientras que la mediana de modelos comparables es de solo 28 puntos.
El 91,9 % de LiveCodeBench también procede de una clasificación independiente. El resultado demuestra que el modelo es realmente muy competitivo en generación de código a nivel de programación competitiva.
Sin embargo, datos como SWE-bench Pro (62,5), DeepSWE (58,7) y Tool Use (73,5) proceden actualmente principalmente de las pruebas publicadas por el fabricante.
Existe una diferencia potencial entre las pruebas internas de una compañía y una validación independiente. Es una situación habitual cuando aparece un modelo nuevo.
Conclusión clave: los benchmarks de Qwen3.8-Flash-Next apuntan claramente a que el modelo es muy competitivo en programación y tareas Agent. Pero hasta que exista una validación independiente más completa, todas las afirmaciones de que “supera a Opus” deberían considerarse afirmaciones del fabricante, no hechos definitivamente demostrados.
5. Valor práctico
Escenario 1: programación y desarrollo de software — muy recomendado
Ya sea en programación competitiva —LiveCodeBench 91,9 %—, ingeniería de software —SWE-bench Pro 62,5— o desarrollo full-stack, Qwen3.8-Flash-Next muestra un rendimiento de primer nivel.
Algunos desarrolladores han informado de buenos resultados en tareas de programación con PHP/MySQL y consideran que su diseño de esquemas de bases de datos es “comparable a SOL”.
Si necesitas asistencia de programación a diario, este modelo podría ser una de las opciones con mejor relación calidad-precio disponibles actualmente.
Escenario 2: desarrollo de aplicaciones Agent — muy recomendado
Tool Use 73,5, JobBench 55,7 y Agents' Last Exam 51,2 % indican que Qwen3.8-Flash-Next tiene unas capacidades Agent bastante maduras.
Más importante aún, el precio con caché puede bajar hasta 0,016 $ por millón de tokens. Para aplicaciones Agent que realizan llamadas frecuentes al modelo, el coste real puede ser extremadamente bajo.
Escenario 3: autoalojamiento y despliegue privado — recomendado
Qwen3.8-Flash-Next es un modelo de código abierto, y sus pesos están disponibles gratuitamente en Hugging Face y ModelScope.
También se ha publicado una versión cuantizada FP8. Algunos desarrolladores ya han conseguido ejecutarlo con éxito en 4 RTX 3090.
Para empresas y desarrolladores que necesitan proteger sus datos y no quieren depender de una API de terceros, resulta una alternativa especialmente atractiva.
Escenario 4: tareas multimodales — útil
Admite imágenes y vídeo como entrada, por lo que puede utilizarse para comprensión visual, análisis de capturas de pantalla, procesamiento de documentos mixtos y tareas similares.
Sin embargo, solo genera texto y no puede producir imágenes ni vídeos.
Escenario 5: tareas masivas y de alta concurrencia — recomendado
Su precio extremadamente bajo —0,15 $ por millón de tokens de entrada y 0,47 $ por millón de salida—, combinado con una elevada tasa de aciertos de caché, hace que Qwen3.8-Flash-Next resulte especialmente interesante para procesamiento a gran escala.
En escenarios con un 90 % de aciertos de caché de prefijo, su rendimiento de prefill llega a 8,6 veces el de Qwen3.7-Plus.
6. Precio y relación calidad-precio
Los precios indicados corresponden a las consultas realizadas en agosto de 2026.
Qwen3.8-Flash — versión de producción de la API
| Concepto | Precio anterior | Precio nuevo desde el 27/08/2026 |
| --- | ---: | ---: |
| Entrada | 1 yuan / millón de tokens | 0,8 yuanes / millón de tokens |
| Salida | 3 yuanes / millón de tokens | 2,7 yuanes / millón de tokens |
| Caché | — | 0,1 yuanes / millón de tokens |
Fuente: anuncio de Alibaba Cloud Model Studio.
En la versión internacional, el precio es de aproximadamente 0,15 $ por millón de tokens de entrada y 0,47 $ por millón de tokens de salida.
Comparación con DeepSeek-V4-Flash
| Modelo | Entrada | Salida |
| --- | ---: | ---: |
| Qwen3.8-Flash | 0,8 yuanes | 2,7 yuanes |
| DeepSeek-V4-Flash — horas valle | 1,5 yuanes | 4,5 yuanes |
| DeepSeek-V4-Flash — horas punta | 3,0 yuanes | 9,0 yuanes |
El precio de entrada de Qwen3.8-Flash es un 33,33 % inferior al de DeepSeek-V4-Flash durante las horas valle. La salida también cuesta un 33,33 % menos.
El precio de la caché, de solo 0,1 yuanes por millón de tokens, resulta todavía más competitivo.
Comparación con el Qwen3.8-Max
Qwen3.8-Max cuesta 2,00 $ por millón de tokens de entrada y 6,00 $ por millón de tokens de salida.
Qwen3.8-Flash cuesta aproximadamente 1/12 del precio del modelo insignia. Y, según los benchmarks publicados por el fabricante, la diferencia de capacidad es mucho menor que la diferencia de precio.
7. Qwen3.8-Flash-Next frente a modelos similares
Qwen3.8-Flash-Next vs DeepSeek-V4-Flash
| Dimensión | Qwen3.8-Flash-Next | DeepSeek-V4-Flash |
|---|---|---|
| Parámetros totales | 125B + 51B N-gram | 284B |
| Parámetros activos | 6B | 13B |
| Precio de entrada | 0,8 yuanes | 1,5–3,0 yuanes |
| Precio de salida | 2,7 yuanes | 4,5–9,0 yuanes |
| Multimodalidad | Texto + imagen + vídeo como entrada | Solo texto, excepto la versión Vision |
| Código abierto | Sí, Qwen Community 1.0 | Sí, MIT |
Según los benchmarks publicados por el equipo de Qwen, Qwen3.8-Flash-Next supera a DeepSeek-V4-Flash-0731 en la gran mayoría de las evaluaciones de agentes, programación y capacidades generales.
En el índice de inteligencia de Artificial Analysis, Qwen3.8-Flash-Next también obtiene 56 puntos, frente a 50 de DeepSeek-V4-Flash.
La principal ventaja de DeepSeek está en su licencia: MIT es más permisiva que Qwen Community 1.0.
Qwen3.8-Flash-Next vs Claude Opus 4.6
Los datos publicados por el fabricante muestran que Qwen3.8-Flash-Next supera a Claude Opus 4.6 (Max) en múltiples tareas.
La diferencia de precio, sin embargo, es enorme. Claude Opus 4.8 tiene un precio de salida de aproximadamente 25 $ por millón de tokens, mientras que Qwen3.8-Flash cuesta solo 0,47 $ por millón.
Eso significa que el coste de salida de Qwen3.8-Flash es aproximadamente 1/50 del de Opus.
8. Opiniones de los usuarios
Comentarios positivos:
- Qwen3.8-Flash-Next llegó al primer puesto de Hugging Face el mismo día de su lanzamiento.
- Los desarrolladores internacionales reaccionaron con entusiasmo en Twitter/X: “Es increíble”, “No necesitamos OpenAI”.
- Un desarrollador lo describió como “la mejor versión de Qwen que puedo ejecutar en una sola DGX Spark, tanto por velocidad como por inteligencia”.
- Algunos usuarios ya lo están utilizando profesionalmente y lo consideran “en general excelente y suficientemente rápido”.
Comentarios más cautelosos:
- AI Business señala que las empresas deberían analizar más indicadores además del precio antes de decidir si el modelo encaja con sus necesidades.
- La validación independiente todavía no está completa: las afirmaciones de que “supera a Opus” se basan actualmente en gran medida en datos del fabricante.
Hay que tenerlo en cuenta: todavía no existen suficientes encuestas independientes a gran escala sobre satisfacción de usuarios. Estas opiniones representan principalmente las primeras reacciones de la comunidad tras el lanzamiento.
9. Ventajas y desventajas
Ventajas
- Precio extremadamente bajo: 0,15 $/millón de entrada y 0,47 $/millón de salida, un 33 % menos que DeepSeek-V4-Flash.
- Programación de primer nivel: LiveCodeBench 91,9 %, SWE-bench Pro 62,5.
- Excelentes capacidades Agent: Tool Use 73,5 y Agents' Last Exam 51,2 %.
- Código abierto y autoalojable: pesos disponibles gratuitamente y versión FP8 publicada.
- Multimodalidad: entrada de texto, imágenes y vídeo.
- Alta velocidad: hasta 180–226 tokens por segundo con una sola GPU.
- Caché extremadamente barata: 0,016 $ por millón de tokens.
Desventajas
- Falta de validación independiente: gran parte de los resultados más llamativos proceden de pruebas del fabricante.
- Solo genera texto: no permite generar imágenes ni vídeos.
- Licencia más restrictiva: Qwen Community 1.0 es menos permisiva que MIT.
- Modelo muy reciente: el ecosistema y el soporte de la comunidad todavía están desarrollándose.
- Diferencia real frente al modelo insignia desconocida: la distancia real con Qwen3.8-Max necesita validación independiente.
10. ¿Quién debería elegirlo?
Muy recomendado
- Desarrolladores con presupuesto limitado: desarrolladores individuales, startups y estudiantes que quieran capacidades de programación y Agent de primer nivel al menor coste posible.
- Usuarios que necesitan autoalojamiento: empresas y desarrolladores que necesitan privacidad de datos y quieren ejecutar el modelo en su propio hardware.
- Desarrolladores de aplicaciones Agent: especialmente interesante en escenarios con muchas llamadas a herramientas gracias a su bajo coste de caché.
- Procesamiento masivo: revisión de grandes cantidades de código, etiquetado de datos, pruebas automatizadas y otras tareas a gran escala.
Elegir con cautela
- Usuarios que necesitan generación de imágenes o vídeo: el modelo solo admite estos formatos como entrada.
- Empresas con requisitos estrictos de cumplimiento de licencias: Qwen Community 1.0 debe revisarse cuidadosamente.
- Usuarios que necesitan una solución madura y ampliamente validada: el modelo apenas lleva unos días publicado y la validación independiente todavía no está completa.
No recomendado
- Usuarios con presupuesto suficiente que buscan la máxima calidad absoluta: deberían considerar Qwen3.8-Max o Claude Opus.
- Usuarios que necesitan entrada y salida de voz/audio: la versión actual no es compatible.
11. Puntuación final — escala de 5,0
Criterio de puntuación: esta valoración considera Qwen3.8-Flash-Next como un modelo de código abierto económico. El foco está en su capacidad para ofrecer programación y Agent suficientemente potentes al menor coste posible. Como todavía no existe una validación independiente completa, algunas puntuaciones se han mantenido deliberadamente prudentes.
| Dimensión | Puntuación | Explicación |
| --- | ---: | --- |
| Programación | 4,7 | LiveCodeBench 91,9 %, SWE-bench Pro 62,5, cerca del nivel de los modelos insignia |
| Capacidades Agent | 4,5 | Tool Use 73,5 y Agents' Last Exam 51,2 %, rendimiento destacado |
| Razonamiento | 4,3 | 56 puntos en el índice de inteligencia, muy por encima de la mediana, aunque pendiente de validación independiente |
| Multimodalidad | 3,5 | Admite imágenes y vídeo como entrada, pero no generación |
| Velocidad | 4,5 | 180–226 tok/s con una sola GPU y hasta 8,6 veces el throughput de prefill del modelo anterior |
| Relación calidad-precio | 5,0 | Prácticamente no tiene rival en su rango de precio |
| Valoración general | 4,4 | Excelente dentro de su posicionamiento |
12. Conclusión final: ¿merece la pena?
Sí, y es difícil encontrar una razón para no probarlo.
El mayor valor de Qwen3.8-Flash-Next es muy sencillo: ofrece capacidades de programación y Agent cercanas a las de modelos insignia a una fracción del coste.
Si eres desarrollador, formas parte de una startup o necesitas procesar grandes cantidades de código o tareas Agent, este modelo podría ser una de las opciones con mejor relación calidad-precio de 2026.
El mayor sacrificio es también evidente: es demasiado nuevo.
Los resultados más llamativos proceden actualmente principalmente del fabricante. Una validación independiente y exhaustiva necesitará tiempo.
Si necesitas una solución madura, ampliamente validada y con un ecosistema estable, quizá sea mejor esperar unas semanas.
Si tienes un presupuesto limitado, necesitas un modelo de código abierto que puedas autoalojar o quieres construir aplicaciones Agent con un coste extremadamente bajo, Qwen3.8-Flash-Next merece la pena probarlo ahora mismo.
Si necesitas generación de imágenes o vídeo, tienes requisitos estrictos de licencia o buscas la máxima calidad absoluta, es mejor elegir otro modelo.
Si solo pudieras elegir un modelo para programación y desarrollo Agent diario y, al mismo tiempo, quisieras reducir los costes al mínimo, Qwen3.8-Flash-Next es una de las opciones más razonables del mercado en 2026.
13. FAQ
¿Qué es Qwen3.8-Flash-Next?
Qwen3.8-Flash-Next es un modelo de código abierto lanzado por el equipo de Qwen de Alibaba el 26 de agosto de 2026 como vista previa de la arquitectura Qwen4.
Tiene 125B de parámetros totales, activa solo 6B por token, admite un contexto de 262K tokens —ampliable hasta 1M— y acepta texto, imágenes y vídeo como entrada.
¿Cuánto cuesta Qwen3.8-Flash-Next?
El modelo de código abierto es gratuito. La versión de producción de la API, Qwen3.8-Flash, cuesta 0,8 yuanes por millón de tokens de entrada y 2,7 yuanes por millón de tokens de salida desde el 27 de agosto de 2026.
En la versión internacional, el precio es de aproximadamente 0,15 $ por millón de tokens de entrada y 0,47 $ por millón de tokens de salida.
La caché cuesta solo 0,1 yuanes por millón de tokens.
¿Qwen3.8-Flash-Next tiene una versión gratuita?
Sí. Los pesos del modelo están disponibles gratuitamente en Hugging Face y ModelScope.
Puedes descargarlos y desplegar el modelo por tu cuenta sin pagar tarifas de API.
¿Qué tan bueno es Qwen3.8-Flash-Next para programar?
Excelente.
Obtiene 91,9 % en LiveCodeBench, 62,5 en SWE-bench Pro y 58,7 en DeepSWE.
En las pruebas publicadas por el fabricante, incluso supera a Claude Opus 4.6 (Max) en determinadas evaluaciones.
¿Qwen3.8-Flash-Next es mejor que DeepSeek-V4-Flash?
Según los datos publicados por el fabricante, sí.
En los benchmarks de Qwen, Qwen3.8-Flash-Next supera a DeepSeek-V4-Flash-0731 en la gran mayoría de las evaluaciones de agentes, programación y capacidades generales.
Además, su precio es aproximadamente un 33 % inferior al de DeepSeek-V4-Flash.
Sin embargo, hay que tener en cuenta que estos resultados proceden principalmente del fabricante y todavía necesitan una validación independiente más completa.
¿Quién debería usar Qwen3.8-Flash-Next?
Está especialmente recomendado para desarrolladores con presupuesto limitado, equipos que necesitan autoalojar un modelo de código abierto y startups que quieran desarrollar aplicaciones de programación y Agent con un coste extremadamente bajo.
No es la mejor opción para quienes necesitan generación de imágenes o vídeo, tienen requisitos estrictos sobre licencias o buscan absolutamente la máxima calidad posible.
14. Puntuación editorial
| Dimensión | Puntuación |
| --- | ---: |
| Programación | 4,7 |
| Capacidades Agent | 4,5 |
| Razonamiento | 4,3 |
| Multimodalidad | 3,5 |
| Velocidad | 4,5 |
| Relación calidad-precio | 5,0 |
| Valoración general | 4,4 |
Criterio de puntuación: la valoración se basa en el posicionamiento de Qwen3.8-Flash-Next como modelo de código abierto económico, prestando especial atención a su capacidad para proporcionar programación y Agent suficientemente potentes al menor coste posible.
La programación y las capacidades Agent reciben puntuaciones elevadas porque los benchmarks publicados son realmente llamativos, aunque algunos todavía necesitan validación independiente.
La relación calidad-precio obtiene la máxima puntuación porque resulta muy difícil encontrar un competidor directo en el mismo rango de precio.
La puntuación de multimodalidad es más baja porque el modelo admite imágenes y vídeo como entrada, pero no puede generarlos.
15. Recomendación final en una frase
Qwen3.8-Flash-Next es especialmente adecuado para desarrolladores con presupuesto limitado y equipos que necesitan un modelo de código abierto autoalojable: ofrece capacidades de programación y Agent cercanas al nivel de los modelos insignia por uno de los precios más bajos del mercado, lo que lo convierte en una de las opciones con mejor relación calidad-precio de 2026. Si necesitas una solución madura y ampliamente validada o capacidades de generación de imágenes y vídeo, es mejor esperar a los resultados de las evaluaciones independientes o elegir otro modelo.
Lo que hace Qwen3.8 Flash Next
- Programación de primer nivel: 91,9 % en LiveCodeBench v6 y 62,5 en SWE-bench Pro
- Excelentes capacidades Agent: Tool Use 73,5 y Agents’ Last Exam 51,2 %
- Solo 6B de parámetros activos de 125B totales, con ~95 % de esparsidad
- Contexto nativo de 262K tokens, ampliable hasta 1M mediante YaRN
- Multimodalidad de entrada: admite texto, imágenes y vídeo (solo genera texto)
- Precio extremadamente bajo: ~0,15 $ de entrada y 0,47 $ de salida por M de tokens