Qwen3.8-Flash-Next: 125 mil millones de parámetros, 1 millón de tokens y un vistazo a Qwen4
Alibaba sigue avanzando en los modelos abiertos con Qwen3.8-Flash-Next, un nuevo modelo multimodal Mixture-of-Experts pensado como una vista previa avanzada de la arquitectura que servirá de base para Qwen4.
Sobre el papel, la propuesta es ambiciosa: 125 mil millones de parámetros para el modelo principal, 51 mil millones adicionales dedicados a los N-gram Embeddings, pero solo 6 mil millones de parámetros activados por token. Qwen afirma principalmente haber reducido drásticamente el costo de entrenamiento y mejorado el rendimiento en ciertas tareas de programación y ofimática.
Qwen3.8-Flash-Next, un vistazo a Qwen4
Qwen presenta claramente Qwen3.8-Flash-Next como un modelo de transición. El anterior Qwen3-Next ya había servido como laboratorio para varias ideas arquitectónicas que se retomaron en las generaciones Qwen3.5 a Qwen3.8.
La lógica se repite aquí.
Qwen3.8-Flash-Next introduce varias herramientas que el equipo planea utilizar y perfeccionar para la futura familia de Qwen4. El interés va más allá del rendimiento inmediato del modelo: Alibaba busca principalmente presentar sus elecciones arquitectónicas lo antes posible, permitiendo a la comunidad probarlas antes de la próxima generación importante.
125 mil millones de parámetros, pero solo 6 mil millones activados
El modelo principal cuenta con 125 mil millones de parámetros. Además, se suman 51 mil millones de parámetros N-gram Embedding. La particularidad radica en la funcionalidad MoE, o Mixture-of-Experts. Qwen3.8-Flash-Next solo activa alrededor de 6 mil millones de parámetros por token, lo que permite mantener una gran capacidad global sin tener que soportar el costo computacional de un modelo denso de tamaño equivalente en cada paso.
Esto es precisamente lo que permite a Qwen buscar un mejor equilibrio entre potencia y costo.
Según el equipo, el entrenamiento requeriría aproximadamente 9 veces menos cálculos que Qwen3.7-Plus, mientras que logra mejores resultados en varios usos relacionados con programación y tareas de oficina. Estas mejoras provienen de cifras presentadas por Qwen y se deberán evaluar con criterios independientes.

GDN y QSA reemplazan la atención clásica donde sea posible
El cambio más importante se refiere a la atención. Qwen3.8-Flash-Next se basa en una arquitectura híbrida que combina Gated DeltaNet, o GDN, y Qwen Sparse Attention, o QSA. Tres de las cuatro capas utilizan GDN. Su función es comprimir el historial de la conversación en un estado de tamaño fijo, en lugar de recalcular constantemente el contexto completo. La cuarta capa utiliza atención global capaz de buscar de manera precisa información en todo el contexto.
Esta combinación permite limitar el costo de las secuencias largas sin perder completamente la capacidad de recuperar un detalle antiguo.
QSA reduce el costo del contexto largo

El problema tradicional de la atención completa es bien conocido. A medida que el contexto se alarga, el coste de cálculo y el tamaño de la caché KV aumentan. QSA intenta reducir este crecimiento. En lugar de analizar todos los tokens individualmente, un indexador ligero divide la secuencia en micro-bloques, estima su importancia y selecciona únicamente las regiones relevantes para la atención global.
La arquitectura comprime, por tanto, el proceso de búsqueda en sí.
Qwen enfatiza que esta compresión se lleva a cabo de manera independiente en cada capa, lo que la hace especialmente adecuada para su arquitectura híbrida donde GDN y atención se intercalan.
Hasta 7.6 veces más rápido en prefill sobre un millón de tokens
Las mejoras anunciadas son especialmente impresionantes en contextos extremos. Con una ventana de 1 millón de tokens, Qwen indica que el kernel QSA puede alcanzar hasta 7.6 veces más velocidad en prefill y 4.9 veces en decode.
En un escenario de servicio en línea con una tasa de aciertos de Prefijo Cache del 90 %, Qwen3.8-Flash-Next alcanzaría incluso 8.6 veces el flujo de prefill de Qwen3.7-Plus.
Este tipo de mejora se vuelve estratégica para agentes. Los workflows modernos pueden acumular inmensos historiales de conversaciones, documentos, código, resultados de herramientas y etapas de razonamiento. Reducir el costo de esta memoria a largo plazo puede ser tan importante como aumentar el rendimiento bruto del modelo.
Una ventana nativa de 262,144 tokens
El modelo soporta 262,144 tokens de forma nativa. Esta capacidad puede extenderse hasta 1 millón de tokens con YaRN. La versión alojada en QwenCloud ofrece directamente este contexto de un millón de tokens por defecto.
Esto coloca a Qwen3.8-Flash-Next en la categoría de modelos diseñados para flujos de trabajo extensos: grandes repositorios de código, dossiers documentales completos o agentes capaces de mantener un historial significativo.
En este tipo de escenario, la eficacia del mecanismo de atención se vuelve mucho más importante que con un simple chatbot que opera con unos pocos miles de tokens.
Gated Residual añade cuatro caminos paralelos
Qwen también modifica la estructura residual de la red con Gated Residual, o GR. En lugar de mantener una sola rama residual, GR amplía el flujo en cuatro ramas paralelas. Un mecanismo de gating dinámico controla qué información se lee o se escribe en cada rama. Esta organización se inspira en trabajos sobre Hyper-Connection y GatedNorm, pero Qwen simplifica el diseño para reducir los accesos a memoria y algunos problemas de estabilidad.
El equipo también explica que una rama parece crear naturalmente una especie de camino de larga distancia entre la primera capa de atención y muchas capas más profundas.
Una arquitectura diseñada también para el FP8
El gating juega otro papel importante. Permite reducir ciertos picos de activación que podrían perturbar el entrenamiento o la inferencia. Qwen indica que el estado residual puede almacenarse así en FP8, una precisión más baja que reduce la cantidad de memoria y el ancho de banda necesarios.
El objetivo general sigue siendo el mismo: reducir el movimiento de datos. En los grandes modelos modernos, mover las activaciones y los parámetros a veces se vuelve tan costoso como las operaciones matemáticas en sí.
51 mil millones de parámetros de “memoria local”
La segunda innovación importante se refiere a los N-gram Embeddings. Un embedding clásico utiliza esencialmente el token actual para realizar una búsqueda en una tabla. Qwen3.8-Flash-Next utiliza el token actual, así como los tokens anteriores, para representar patrones locales más ricos. Esta tabla representa 51 mil millones de parámetros adicionales.
Sin embargo, Qwen afirma que estos parámetros casi no añaden coste de multiplicación matricial por token. Funcionan esencialmente como una gigantesca memoria de patrones locales.
Los embeddings pueden permanecer en la memoria del CPU
Uno de los aspectos más inteligentes de este enfoque es su ubicación. Los 51 mil millones de parámetros N-gram pueden almacenarse en la memoria del host, en lugar de monopolizar continuamente la memoria del GPU.
Dado que las ubicaciones necesarias pueden determinarse de antemano, los datos pueden precargarse de manera asíncrona mientras el resto del modelo realiza sus cálculos.
Esta organización permite aumentar significativamente la capacidad total del modelo sin aumentar proporcionalmente las necesidades de VRAM.
Es un enfoque particularmente interesante en un contexto donde la memoria de los aceleradores sigue siendo uno de los recursos más costosos de las infraestructuras de IA.
Qwen adopta el optimizador Muon
El entrenamiento también cambia. Qwen3.8-Flash-Next utiliza el optimizador Muon para una parte importante de sus parámetros. Los pesos principales de las capas de Atención, GDN y de los expertos MoE son entrenados con Muon. Los embeddings, el enrutador MoE y algunos parámetros de rango bajo continúan utilizando AdamW.
Qwen explica que también ha reformulado la manera en que ciertas matrices fusionadas se separan antes de la ortogonalización. Las proyecciones QKV, SwiGLU y GDN se descomponen así según sus transformaciones individuales.
Más necesidad de Batch Size Warmup
El equipo también afirma haber refinado sus scaling laws para esta arquitectura. Resultado: el modelo soportaría tasas de aprendizaje y tamaños de batch más altos, manteniendo un entrenamiento estable. Qwen indica incluso haber eliminado el Batch Size Warmup. Según sus experimentos, esta fase de aumento gradual del tamaño de batch no mejoraba los resultados finales, pero aumentaba en un 18.8 % el número de pasos de optimización necesarios.
El modelo comienza, por tanto, directamente con su tamaño de batch objetivo. Este tipo de optimización puede parecer secundaria, pero a la escala de un modelo de más de cien mil millones de parámetros, unos pocos por cientos de eficacia representan ya cantidades considerables de cálculo.
Un MoE extremadamente sparse
Qwen también mantiene un enfoque denominado ultra-sparse MoE. El modelo tiene un gran número de expertos, pero solo unos pocos son activados para cada token. Un experto compartido también permanece activo. El objetivo es aumentar notablemente la capacidad sin hacer explotar el costo de inferencia. Esta estrategia se vuelve cada vez más común en los grandes laboratorios chinos.
Permite construir modelos que presentan cientos de miles de millones de parámetros mientras mantienen un costo activo muy cercano al de un modelo más pequeño.
Buenos resultados con solo 6 mil millones de parámetros activos
Qwen indica que Qwen3.8-Flash-Next-Base logra la mejor puntuación en 8 de los 14 benchmarks presentados en sus evaluaciones internas. El modelo se destaca notablemente en MMLU-Pro, SuperGPQA, BBH, GSM8K, EvalPlus, SWEBench-Pretrain, MGSM y MMMLU. Además, se mantendría cerca de Qwen3.7-Plus-Base en varias otras pruebas como GPQA, MATH o MultiPL-E.

El elemento más notable es que estos resultados se logran con solo 6 mil millones de parámetros activados por token. Nuevamente, se requerirán más benchmarks independientes para evaluar con precisión la calidad del modelo en condiciones reales.
Un modelo abierto y ya integrado en herramientas de desarrollo
Qwen3.8-Flash-Next está disponible en pesos abiertos en Hugging Face y ModelScope. La versión de producción se ofrece bajo el nombre qwen3.8-flash en QwenCloud. Soporta API compatibles con OpenAI Chat Completions y Responses, así como una interfaz compatible con Anthropic.
Qwen también anuncia una integración con Claude Code, Codex, Qoder CLI, Qwen Code y OpenClaw. Para los desarrolladores, esta compatibilidad es estratégica. Permite reemplazar un modelo existente en ciertos flujos de trabajo sin reescribir toda la infraestructura circundante.
Hasta 65,536 tokens en salida para Codex
La configuración propuesta para Codex muestra hasta qué punto Qwen apunta a usos de agente. Soporta un contexto de un millón de tokens con 95% de uso efectivo, llamadas a herramientas paralelas, entrada de texto e imagen y múltiples niveles de razonamiento.
La salida puede alcanzar hasta 65,536 tokens.
Este tipo de capacidad se adapta especialmente a tareas de desarrollo de software largas, donde un agente debe leer grandes repositorios, ejecutar herramientas y producir numerosos cambios antes de finalizar.
Un precio especialmente agresivo
QwenCloud ofrece una tarifa de 0.16 dólares por millón de tokens de entrada y 0.47 dólares por millón de tokens de salida. Este posicionamiento es extremadamente agresivo frente a los grandes modelos fronterizos occidentales. La estrategia de Alibaba parece clara: reducir el costo lo suficiente para hacer posible el uso intensivo de agentes, copilotos y aplicaciones de muy alto volumen.
La reducción de los costos de inferencia no es solo un objetivo técnico, se convierte en un argumento comercial directo.
Qwen prepara una batalla en eficiencia, no solo en tamaño
Qwen3.8-Flash-Next ilustra una evolución importante en el mercado de los grandes modelos. La competencia ya no consiste solo en aumentar el número de parámetros o ganar unos pocos puntos en un benchmark. Los laboratorios buscan maximizar la relación entre capacidad, contexto, latencia, memoria y costo por token.
GDN reduce el costo de la memoria a largo plazo, QSA limita la atención global, el MoE reduce el número de parámetros activos, los N-gram Embeddings aumentan la capacidad sin sobrecargar la GPU, y Muon busca reducir el costo de entrenamiento. Todo converge hacia la misma idea: hacer más trabajo con mucho menos cálculo.
Qwen 4 podría heredar toda esta arquitectura
Finalmente, esto es lo que hace que este modelo sea particularmente interesante. Qwen3.8-Flash-Next no es solo un nuevo modelo Flash, es una vista técnica de lo que podría convertirse en Qwen4.
Alibaba está probando aquí una arquitectura que se aleja progresivamente del Transformer denso tradicional para convertirse en un sistema híbrido donde cada componente está especializado: memoria comprimida, búsqueda sparse, expertos MoE, embeddings externos y múltiples flujos residuales. Si estas elecciones cumplen con sus promesas a gran escala, Qwen4 podría ser menos una simple generación adicional y más un cambio de filosofía.
Y en una industria donde el costo de la inferencia se vuelve tan estratégico como la calidad del modelo, esta búsqueda de eficiencia podría ser una de las ventajas más importantes que Alibaba pueda construir.




