Alibaba lanza y abre el código del modelo Qwen 3.8 Flash, que utiliza una arquitectura MoE de 125B, activando solo aproximadamente 6B de parámetros por token, con soporte nativo para 262144 tokens de contexto y expansión hasta 1M tokens mediante YaRN. La innovación del modelo radica en su capacidad para ejecutarse en una tarjeta gráfica de consumo 4090, logrando la migración de modelos de texto largo de nivel de centro de datos a hardware de consumo. Además, su precio es más competitivo: 0.8 yuanes por millón de tokens de entrada y 2.7 yuanes por millón de tokens de salida, apenas un tercio del precio de DeepSeek-V4-Flash. Las pruebas reales muestran que el modelo puede completar la redacción de contenido para cuatro plataformas en 2 minutos, y extraer actas de reuniones, organizar tablas y generar correos electrónicos en 4 minutos. Qwen 3.8 Flash ya está disponible en la plataforma Qwen Office, con la API simultáneamente abierta. El mismo día, Zhipu también abrió el código de GLM-5.3-Flash, cuyo rendimiento en evaluaciones es comparable al de Claude Opus 4.8, pero a un precio una cuarentava parte.Autor del artículo, fuente: Quantum Bit
El nuevo modelo de Alibaba Qwen ha elevado el nivel nuevamente.
Lanzaron y abrieron el código de Qwen 3.8 Flash-Next, que no solo supera en precio a DeepSeek-V4-Flash, sino que también se ubicó en el primer lugar de Huggingface justo tras su lanzamiento.

La comunidad en Twitter también se entusiasmó, e incluso algunos ingenieros publicaron videos de pruebas reales exclamando: ¡Impresionante!
Qwen 3.8 Flash ha eliminado la barrera de la VRAM,¡el modelo de lenguaje de texto largo de nivel de centro de datos ahora puede ejecutarse en una tarjeta gráfica 4090 de consumo!
Alguien ya lo ha aplicado entusiasmado en su trabajo.
En menos de 8 minutos, completó todo el flujo de trabajo que abarca programación en Python, análisis de múltiples tablas y generación de informes de investigación:

¡Incluso los efectos de la torre de tesoro no son problema!

¡Vaya, ¿es realmente tan genial? ¡También nosotros debemos probarlo!

Solo 0.8 yuan por millón de tokens de entrada
Qwen3.8-Flash utiliza una arquitectura MoE de 125B, activando solo aproximadamente 6B parámetros por token, con soporte nativo para hasta 262144 tokens de contexto y ampliable hasta 1M tokens mediante YaRN.
Al mismo tiempo, también es una previa del nuevo arquitectura de Qwen4.
En comparación con Qwen 3.7 Plus, Qwen 3.8 Flash no solo reduce los parámetros activados a un tercio, sino que también reduce el costo de entrenamiento a solo una novena parte, además de ser significativamente más potente en capacidades generales, razonamiento matemático y programación.
Lo que es más sorprendente es el precio: solo 0.8 yuanes por millón de tokens de entrada y 2.7 yuanes por salida para Qwen 3.8 Flash, con 0.1 yuanes para aciertos en caché, alcanzando un precio mínimo de un tercio del DeepSeek-V4-Flash.
Es mucho más fuerte que el corte de拼多多 (bushi)

Bien, bien, como el precio ya ha llegado a este punto, no nos vamos a andar con rodeos; vamos directo al grano y probaremos la capacidad real de Qwen 3.8 Flash en escenarios de oficina con dos pruebas prácticas.
Prueba real 1: Diseñar cuatro textos adaptados a diferentes plataformas para productos de cámaras
Diseñamos un "Desafío de Redacción Cibernética" para que Qwen 3.8 Flash reescriba un documento de producto de cámara de casi diez mil caracteres con un presupuesto de 1 yuan, para ver cuántas tareas puede completar en plataformas como Xiaohongshu, Weibo, Douyin y Moments.
La instrucción es la siguiente:

Después de enviar la instrucción, fui a la cocina de la oficina a tomar agua, todo en menos de dos minutos.
Al regresar, vi que ya se habían escrito los textos para las cuatro plataformas, y @se etiquetaron correctamente las marcas, el estilo y los hashtags (excepto que yo no publicaría algo tan largo en mi timeline de WeChat hhh):




En menos de dos minutos terminé cuatro textos, la velocidad del "trabajador cibernético" ya es suficiente.
Pero en el entorno laboral, lo que realmente causa dolor de cabeza no es redactar textos, sino quién se encarga de ordenar el desorden después de una reunión.
Entonces, le asignamos un segundo trabajo para poner a prueba su capacidad práctica en el entorno laboral.
Prueba real 2: Convertir una reunión semanal de producto en un plan ejecutable
Con el tema "Reunión de revisión de requisitos y tecnología para el Agente de Atención al Cliente Inteligente V2.0", creamos fielmente un material de transcripción original de diez mil palabras, tal como lo recibirían después de una reunión semanal, lleno de errores fonéticos y charlas triviales, y logramos que Qwen3.8-Flash completara de una sola vez las tres tareas: extraer resúmenes, organizar tablas y redactar el correo de notificación posterior a la reunión.
△ La imagen fue generada por IA, escuchar "token" como "偷啃" es realmente muy cotidiano
La instrucción es la siguiente:

En el modo predeterminado, Qwen3.8-Flash completó todos los tasks en menos de 4 minutos, con resúmenes precisos de las cinco conclusiones clave, asignaciones correctas en la tabla y formato de correo electrónico normativo, con destinatarios que coinciden uno a uno con el contenido de la reunión.



△ Gráficos de algunos resultados de prueba
Incluso sin pedírselo, se encarga amablemente de organizarnos los temas que aún no se resolvieron en la reunión, para que podamos continuar discutiéndolos en la próxima reunión, be like:

Y hasta este punto, aún no he agotado mi límite.
Ahaha, esta sensación de libertad es realmente genial.
Ahora, Qwen 3.8 Flash ya está disponible en la plataforma "Qianwen Office", y la API también está disponible. ¡Vayan a probarlo!

Una cosa más
La guerra de precios entre los grandes modelos nacionales se ha intensificado.
Casi al mismo tiempo que se lanzó de código abierto Qwen 3.8 Flash, Zhipu también lanzó de código abierto GLM-5.3-Flash, el primer modelo multimodal nativo de la serie GLM-5, conocido previamente como el modelo grande "Niu Lai" Ox Alpha.
En la evaluación, el rendimiento de este modelo es comparable al de Claude Opus 4.8, pero su precio se redujo a la décima parte del de GLM-5.3.

Además, GLM-5.3-Flash ofrece generosamente una promoción de mitad de precio durante dos semanas, lo que significa que durante el período de la promoción, el precio de GLM-5.3-Flash es solo 1/20 del precio de GLM-5.3 y 1/40 del precio de Opus4.8.

Además, Qwen 3.8 Flash y GLM-5.3-Flash comparten otro punto en común: ambos sorprendieron a DeepSeek-V4-Flash con precios extremadamente bajos (DeepSeek se alejó murmurando):
△Gráfico de comparación de precios para DeepSeek-V4-Flash, Qwen 3.8 Flash, GLM-5.3-Flash
No hay nada que decir, demasiado competitivo.
