DeepSeek acaba de lanzar un modelo que procesa un millón de tokens de contexto mientras activa menos parámetros que algunos modelos de código abierto lanzados hace dos años. El V4.1-Flash, lanzado el 10 de septiembre, representa el último intento de la startup china de inteligencia artificial de reescribir la economía de los modelos de lenguaje grandes.
El modelo integra 552 mil millones de parámetros en una arquitectura Mixture-of-Experts (MoE), pero solo activa aproximadamente 8 mil millones para tareas de entrada y 16 mil millones para salida. El resultado es un modelo que supera ampliamente lo que sugeriría su huella de cómputo activa.
La arquitectura que lo hace funcionar
V4.1-Flash introduce lo que DeepSeek denomina una arquitectura asimétrica de codificador-decodificador causal, que procesa la entrada y genera la salida a través de rutas diferentes optimizadas para cada tarea, en lugar de ejecutar todo a través de un solo pipeline.
La ventana de contexto se extiende hasta 1 millón de tokens. Admitir este contexto masivo requiere una caché KV que consume aproximadamente 890 bytes por token, aproximadamente una cuarta parte de lo que requería el modelo anterior V4-Flash.
Esa reducción de caché importa más de lo que podría parecer. La caché KV es el cuello de botella de memoria que determina cuántos usuarios simultáneos puede atender un modelo y cuánto tiempo pueden durar sus conversaciones. Reducirla en un 75 % significa que los operadores pueden atender aproximadamente cuatro veces más usuarios con el mismo hardware, o manejar contextos cuatro veces más largos sin actualizar sus clústeres de GPU.
En pruebas, DeepSeek afirma que V4.1-Flash supera al modelo V4-Pro de la propia empresa y compite directamente con GPT-5.6 y Kimi K3. La empresa ya está redirigiendo las solicitudes de V4-Pro al nuevo modelo, con precios actualizados que entrarán en vigor el 14 de septiembre.
Pesos abiertos, estrategia abierta
DeepSeek lanzó los pesos del modelo bajo una licencia MIT en Hugging Face. El nuevo modelo está disponible a través de la API de DeepSeek bajo el endpoint “deepseek-flash”. La combinación de pesos abiertos y acceso a la API crea una vía de adopción en dos vías: los desarrolladores que deseen ejecutar inferencia en su propia infraestructura pueden descargar e implementar localmente, mientras que aquellos que prefieran servicios gestionados pueden llamar a la API en los nuevos niveles de precios de DeepSeek.
Implicaciones de la IPO y posicionamiento competitivo
La fecha de lanzamiento de V4.1-Flash no es casual. Se espera que DeepSeek se haga pública en el Mercado STAR de Shanghái, y demostrar un impulso técnico continuo es el tipo de cosa que hace que las presentaciones de rueda de inversionistas sean más convincentes.
La comprensión multimodal integrada en V4.1-Flash, que abarca tanto datos visuales como de texto, reduce las oportunidades de diferenciación disponibles para competidores como OpenAI y Moonshot AI, que desarrolla Kimi K3.
