NovedadIA

Qwen3.8-Flash-Next: ¿merece la pena ejecutarlo en local?

Guia

Qwen3.8-Flash-Next destaca por su arquitectura MoE de 180B parámetros, de los que solo activa 6B por token, pero exige al menos 75 GB de memoria para ejecutarse en local. Analizamos sus requisitos de hardware, rendimiento con distintas configuraciones, métodos de despliegue y cuándo compensa frente a la API.

Herramientas relacionadas

Qwen3.8-Flash-Next es un modelo multimodal MoE con pesos abiertos presentado por el equipo de Qwen de Alibaba el 26 de agosto de 2026. Su característica más interesante es que se trata de una primera vista previa de la arquitectura Qwen4.

Parámetros clave:

  • Parámetros totales: unos 180B almacenados (125B del modelo principal + 51B de embeddings N-gram + 4B de MTP)

  • Parámetros activados por token: solo 6B

  • Contexto: 262.144 tokens de forma nativa, ampliable hasta 1M

  • Multimodalidad: admite entradas de texto, imágenes y vídeo

  • Coste de inferencia: 56 puntos en el índice de inteligencia de Artificial Analysis, frente a una mediana de 28 en modelos similares, con una velocidad de salida de 73 tokens/s

¿Para qué resulta especialmente adecuado? Para flujos de trabajo con agentes, generación de código, procesamiento de documentos largos y comprensión multimodal. Destaca especialmente en tareas de programación y Agent.

¿Por qué merece la pena ejecutarlo localmente?

Antes de responder a la pregunta de por qué merece la pena, hay un dato importante: Qwen3.8-Flash-Next tiene unos requisitos de hardware muy elevados: la versión cuantizada más pequeña necesita 75 GB de memoria. En comparación, el Qwen3.8-27B de la misma generación puede entrar en una única GPU de 24 GB utilizando cuantización de 4 bits.

Entonces, si el requisito de hardware es considerablemente mayor, ¿por qué algunos usuarios siguen optando por ejecutarlo localmente?

Razón principal 1: una arquitectura poco convencional que intercambia memoria del sistema por VRAM. La tabla de embeddings N-gram de 51B se almacena en la RAM del sistema en lugar de ocupar la memoria de la GPU. Esto significa que incluso una GPU con una cantidad relativamente pequeña de VRAM puede ejecutar un modelo de escala cercana a 180B. Algunos usuarios han conseguido desplegar la versión sin cuantizar en una configuración con RTX 4090 de 24 GB + 128 GB de RAM.

Razón principal 2: el rendimiento es realmente alto. En los 22 benchmarks publicados por Alibaba, supera al Qwen3.8-27B en 21 pruebas. En el benchmark de programación DeepSWE obtiene 58,7 puntos, muy por encima de los 16,5 del anterior Qwen3.7-Plus. Artificial Analysis le otorga 56 puntos en inteligencia y 71,8 puntos en coding.

Razón principal 3: bajo coste de entrenamiento e inferencia. El tiempo de entrenamiento es solo una novena parte del de la generación anterior. Además, solo activa 6B de parámetros por token, lo que permite una inferencia muy eficiente.

Pero también existen opiniones negativas: algunos usuarios de la comunidad señalan que «el verdadero cuello de botella para la ejecución local es la longitud del contexto y la capacidad de uso de herramientas, no la VRAM». Otro usuario lo resumió de forma más directa: «este modelo no puede entrar en una GPU de consumo de 24 GB como los Qwen locales anteriores».

Situaciones en las que merece la pena ejecutarlo localmente:

  • Ya tienes un equipo con 96 GB o más de RAM/memoria unificada, como una estación de trabajo de gama alta o un Mac con configuración avanzada de la serie M

  • Utilizas Agent y herramientas de programación con mucha frecuencia y el coste de la API empieza a ser considerable

  • Tienes requisitos estrictos de privacidad y no puedes enviar los datos a la nube

  • Necesitas trabajar completamente sin conexión

Situaciones en las que probablemente no compense:

  • Tienes menos de 64 GB de memoria: directamente no podrás ejecutarlo

  • Solo lo utilizas ocasionalmente: pagar la API según consumo resulta más económico

  • No tienes conocimientos técnicos o no quieres lidiar con un despliegue complejo

Resumen de las opciones de despliegue

Qwen3.8-Flash-Next admite diferentes métodos de despliegue. Como utiliza la nueva arquitectura qwen4_exp, es imprescindible utilizar versiones recientes de las herramientas compatibles con esta arquitectura.

Ollama (recomendado para usuarios normales): se puede ejecutar con un solo comando. Es necesario utilizar la versión más reciente de Ollama.

llama.cpp + Unsloth GGUF (recomendado para desarrolladores): Unsloth proporciona archivos GGUF cuantizados de 1 a 4 bits.

vLLM / SGLang: Alibaba proporciona ejemplos oficiales de despliegue tanto para vLLM como para SGLang.

Primera prueba después del despliegue: introduce «Hola, preséntate brevemente». Si el modelo responde correctamente, significa que el despliegue funciona.

Requisitos de hardware

Los requisitos de hardware de Qwen3.8-Flash-Next son bastante particulares: la memoria del sistema es más importante que la VRAM. Estas son las necesidades aproximadas según el nivel de cuantización:

CuantizaciónMemoria total necesaria (RAM + VRAM)
1 bit (mínima)75 GB
2 bits79 GB
3 bits90 GB
4 bits112 GB
5 bits200 GB
8 bits270 GB
BF16 (sin cuantizar)355 GB

Cómo interpretar estos datos:

  • La cuantización de 1 bit reduce el tamaño en 79 % frente a BF16 (355 GB), conservando aproximadamente el 80 % de la precisión top-1 %

  • Aproximadamente el 40 % del archivo de 1 bit corresponde a tablas de búsqueda; los embeddings N-gram se almacenan en 4 bits, mientras que los pesos densos reales ocupan solo unos 3,6 GB

  • Se recomienda contar con al menos 96 GB de RAM o memoria unificada

  • Para usuarios de Mac, la versión MLX de Ollama necesita aproximadamente 105 GB de memoria unificada

«Poder ejecutarlo» no significa necesariamente «que resulte cómodo de usar». Aunque la cuantización de 1 bit permite ejecutarlo con 75 GB de memoria, la velocidad es relativamente baja. La versión de 4 bits requiere 112 GB, pero ofrece una mayor velocidad a cambio de un requisito de hardware superior.

Rendimiento real según la configuración

RTX PRO 6000 Blackwell 96 GB — gama profesional

Con una única RTX PRO 6000 Blackwell de 96 GB de VRAM y la versión cuantizada en NVFP4, la velocidad de decodificación en un único flujo alcanza entre 180 y 226 tok/s, con soporte para el contexto completo de 262K.

Pruebas específicas:

Tipo de tareaVelocidad
Programación (1024 tokens de salida)216,9 tok/s
Llamada a herramientas de Agent (prompt de 1,7K)225,8 tok/s
Agent + 9 herramientas (prompt de 2,4K)210,1 tok/s
Generación de texto normal180,5 tok/s
Modo de razonamiento/pensamiento136,6 tok/s

Experiencia real: un prompt largo de 216K tokens puede recibir respuesta en 8,4 segundos. Generar 500 caracteres requiere aproximadamente 2-3 segundos, ofreciendo una experiencia extremadamente fluida.

RTX 4090 24 GB + 128 GB de RAM — gama alta de consumo

Esta es una de las configuraciones que más debate ha generado en la comunidad. Algunos usuarios han conseguido ejecutar la versión sin cuantizar con una RTX 4090 de 24 GB + 128 GB de RAM. Otras pruebas indican que en una RTX 4090 solo se necesitan aproximadamente 5,95 GB de VRAM para ejecutar el checkpoint completo.

Con una RTX 4090 + 96 GB de DDR5 y la versión cuantizada IQ3_XXS de aproximadamente 78 GB, la velocidad de decodificación medida es de unos 21 tok/s.

Experiencia real: 21 tok/s significa que generar 500 caracteres requiere aproximadamente 12-15 segundos. Para conversaciones cotidianas resulta suficientemente fluido, aunque los contextos largos generan cierta espera. Con vLLM y speculative decoding mediante MTP en una RTX 4090, un prompt híbrido típico alcanza aproximadamente 50 tok/s, con picos de 69,7 tok/s.

2× DGX Spark — clúster para desarrolladores

Con formato NVFP4 + SGLang + MTP4, la velocidad alcanza aproximadamente 52 tok/s, con picos de 69,7 tok/s. Sin MTP, la velocidad cae hasta unos 20 tok/s.

Experiencia real: 52 tok/s es suficiente para el uso diario y resulta especialmente interesante para flujos de trabajo con Agent.

4× RTX 3090 — configuración multicard

Utilizando GGUF + llama.cpp, se alcanzan aproximadamente 43 tok/s.

Experiencia real: el rendimiento es comparable al de 2× DGX Spark y puede ser una opción interesante para quienes ya disponen de varias RTX 3090.

M5 Max 64 GB — Mac

Con una versión cuantizada de 85 GB, las pruebas alcanzan 36 tok/s. La velocidad de prefill es de 517,9 tok/s y la generación de 128 tokens llega a 36,0 tok/s.

M1 Max 64 GB — Mac

Con Q4_K_M GGUF, la velocidad se sitúa entre 11 y 17 tok/s. El prefill ronda los 160 tok/s y la decodificación aproximadamente 16 tok/s.

Experiencia real: 11-17 tok/s es apenas suficiente para un uso cómodo y la espera resulta evidente con contextos largos.

Solo CPU — sin GPU

Con una CPU de escritorio se puede ejecutar la versión de 1 bit a aproximadamente 11 tokens/s. La velocidad de lectura del prompt aumenta al incrementar el número de hilos, pero la velocidad de generación tiende a estabilizarse después de 8 hilos.

Experiencia real: 11 tok/s significa que hay que esperar cada respuesta, pero el modelo realmente funciona. Para usuarios sin GPU, esta es la única opción viable.

Medición independiente de Artificial Analysis

La plataforma independiente Artificial Analysis registra una velocidad de salida combinada de 73 tokens/s, superior a la media de 66 tokens/s de modelos similares.

Resumen del rendimiento real

AspectoConfiguración básica (CPU / 64 GB)Configuración principal (4090 + 128 GB)Gama alta (RTX PRO 6000)
¿Puede ejecutarlo?✅ 1 bit, con dificultades✅ Puede ejecutar la versión sin cuantizar✅ Funcionamiento fluido
Velocidad~11 tok/s~21-50 tok/s~180-226 tok/s
Memoria necesaria75 GB+128 GB+96 GB VRAM
Tiempo para generar 500 caracteres~45 s~10-25 s~2-3 s
Experiencia realUtilizable, pero lentaFluidaExtremadamente fluida
Recomendación⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐

¿Merece la pena actualizar el hardware?

Si ya tienes 128 GB o más de RAM + una RTX 4090: merece mucho la pena probarlo. Los 24 GB de VRAM son suficientes para ejecutar la versión sin cuantizar y, actualmente, esta combinación ofrece una de las mejores experiencias de IA local disponibles para usuarios de consumo.

Si tienes 64 GB de RAM + una GPU de gama media: puedes probar la versión cuantizada de 1 bit, pero es posible que la experiencia no cumpla tus expectativas. La velocidad es relativamente baja y el despliegue requiere ciertos conocimientos técnicos.

Si estás pensando en montar un PC específicamente para este modelo: una configuración con 128 GB de RAM + RTX 4090 puede superar los 4.000 dólares. Salvo que utilices el modelo con mucha frecuencia y tengas requisitos de privacidad extremadamente altos, la API resulta más económica. El precio oficial de la API es de 0,16 $ por millón de tokens de entrada y 0,47 $ por millón de tokens de salida.

Usuarios que realmente pueden beneficiarse del despliegue local:

  • Desarrolladores o investigadores que ya disponen de 128 GB+ de RAM y una GPU de gama alta

  • Organizaciones que trabajan con datos extremadamente sensibles y no pueden subirlos a la nube

  • Usuarios con un volumen enorme de consultas, del orden de cientos de millones de tokens al mes, cuando el coste de la API supera el coste del hardware

  • Empresas que necesitan ejecutar Agent en entornos completamente offline

Usuarios para los que no recomendamos el despliegue local:

  • Usuarios normales con menos de 64 GB de memoria: no podrán ejecutarlo

  • Personas que lo utilizan ocasionalmente: la API bajo demanda resulta más económica

  • Usuarios sin conocimientos técnicos que no quieran complicarse con la configuración

FAQ

¿Cuánta memoria necesita como mínimo Qwen3.8-Flash-Next?

Como mínimo, 75 GB de memoria total (RAM + VRAM). Se recomienda disponer de al menos 96 GB de RAM o memoria unificada.

¿Puede funcionar en una RTX 4090?

Sí. Algunos usuarios han conseguido desplegar la versión sin cuantizar con una RTX 4090 de 24 GB + 128 GB de RAM. Las versiones cuantizadas pueden alcanzar aproximadamente entre 21 y 50 tok/s.

¿Puede funcionar únicamente con CPU?

Sí. La versión cuantizada de 1 bit alcanza aproximadamente 11 tokens/s en CPU. Es lenta, pero realmente puede ejecutarse.

¿Puede funcionar en Mac?

Sí. Alcanza aproximadamente 36 tok/s en un M5 Max de 64 GB y entre 11 y 17 tok/s en un M1 Max de 64 GB.

¿Cuánto espacio de almacenamiento necesito?

La versión de 1 bit ocupa aproximadamente 75 GB, mientras que la versión BF16 requiere unos 355 GB. Se recomienda reservar al menos 200 GB de espacio libre.

¿La cuantización reduce considerablemente la calidad?

La cuantización de 1 bit conserva aproximadamente el 80 % de la precisión top-1 %. El modelo de 180B en 1 bit presenta una perplejidad de 4,01, mejor que los 5,68 del modelo de 27B en 4 bits. Existe cierta pérdida de calidad, pero las ventajas de la arquitectura siguen siendo evidentes.

¿Cuál es la diferencia entre el despliegue local y la API?

El despliegue local no tiene coste por consulta, mantiene los datos en el dispositivo y permite trabajar offline, pero exige un hardware muy potente, con al menos 75 GB de memoria. La API cobra según el consumo (0,16 $/0,47 $ por millón de tokens) y no requiere hardware de gama alta.

¿Vale la pena comprar hardware nuevo específicamente para este modelo?

Si ya tienes 128 GB de RAM + una GPU de gama alta, merece la pena probarlo. Si tienes que comprar todo el hardware específicamente para ejecutarlo, el coste puede superar ampliamente el de varios años de uso de la API. Para la mayoría de los usuarios no recomendamos actualizar el hardware exclusivamente para este modelo.