MiniMax publica su primer informe semestral tras su listado en el mercado de Hong Kong, con ingresos que aumentan un 283,1 %, alcanzando 1,5 veces los ingresos totales de 2025, y una ganancia bruta que crece un 464,8 %. En agosto, el ARR superó los 800 millones de dólares, con ingresos B2B que representan el 80 %. En julio, el consumo de tokens alcanzó veinte veces el nivel de enero. El fundador Yan Junjie propone una línea tecnológica de "minimizar el costo de inferencia y maximizar la inteligencia", utilizando su arquitectura MSA propia para reducir el costo de cálculo por token en textos largos de un millón de caracteres a aproximadamente 1/20 del costo del mecanismo de atención completa tradicional, logrando un equilibrio entre inteligencia y costo bajo capacidad de cómputo limitada, y ofreciendo un nuevo camino para que los grandes modelos nacionales compitan globalmente.Autor y fuente del artículo: Zhi Dongxi
El 26 de agosto, MiniMax (Xiyu Technology), la empresa líder en modelos de inteligencia artificial en China, publicó su primer informe semestral desde su cotización en el mercado de valores de Hong Kong.
Los estados financieros muestran que los ingresos de MiniMax aumentaron un 283,1% interanual, y sus ingresos semestrales ya alcanzan 1,5 veces los ingresos totales de 2025; la utilidad bruta aumentó un 464,8% interanual.

En la reunión de resultados financieros, Yan Junjie, fundador, presidente del consejo, CEO y CTO de MiniMax, reveló que en agosto, el ARR de MiniMax superó los 800 millones de dólares, la proporción de ingresos B2B alcanzó el 80% y el consumo de tokens en julio fue 20 veces mayor que en enero.
Además de los datos, lo que llamó mi atención fue una frase que Yan Junjie dijo en la reunión de resultados de anoche: "Solo minimizando el costo inteligente por unidad es posible maximizar el nivel de inteligencia."
Hay que tener en cuenta que, en los últimos dos años, los grandes modelos han seguido básicamente dos caminos: o bien aumentar los parámetros según la ley de escalado para impulsar la inteligencia, con el costo de un alto gasto; o bien reducir la eficiencia para hacerla más accesible, pero la inteligencia siempre queda un poco por debajo.
La industria parece dar por sentado que esto es como intentar tener el pescado y la olla al mismo tiempo.
¿Por qué MiniMax eligió un camino que va en contra de la intuición de la industria? ¿Realmente puede funcionar este camino?
Inteligencia y costo, ¿por qué es difícil lograr ambos?
La Ley de Escalamiento ha impulsado la narrativa de la IA en los últimos años: cuanto mayores sean los parámetros, mayor será la inteligencia.
Siguiendo la Ley de Escalado, los parámetros del modelo ya han alcanzado el nivel de 2-3T, y la inteligencia del modelo ha aumentado proporcionalmente, provocando que todos exclamen que la IAG está a la vuelta de la esquina.
Detrás del auge, esta regla también ha sembrado una bomba: cuando los modelos alcanzan el nivel de billones de parámetros, los costos de inferencia comienzan a volverse ineludibles.
El CEO de NVIDIA, Jensen Huang, declaró en la conferencia GTC 2026: "La era en la que el gasto en entrenamiento era el principal factor impulsor de costos ha terminado. La inferencia es ahora la carga de trabajo, y está creciendo rápidamente."
La inflación de los costos de inferencia, junto con el auge de la carga de trabajo de los Agentes, está llevando a la IA de una pregunta-respuesta a la ejecución autónoma en múltiples pasos. Detrás de una sola solicitud del usuario pueden haber diez o incluso decenas de llamadas al modelo, lo que hace que la factura de capacidad de cómputo de toda la industria aumente a velocidad exponencial.
Como resultado, la industria se dividió gradualmente en dos bandos:
Por un lado, modelos pequeños con velocidad rápida y bajo costo, pero rendimiento inteligente promedio.
Google es un ejemplo típico de este camino. Entre julio y agosto de 2026, Google lanzó de forma consecutiva tres modelos ligeros: Gemini 3.7 Flash, Gemini 3.6 Flash, Gemini 3.5 Flash-Lite y Gemini 3.5 Flash Cyber.

3.5 Flash-Lite es el modelo más rápido y de menor costo de la serie 3.5, diseñado para cargas de trabajo de alto rendimiento y tareas pequeñas en sistemas de agentes de IA grandes. El uso de tokens de salida de Gemini 3.6 Flash se redujo un 17% en comparación con la generación anterior.
Pero el costo es evidente. Google aún no ha lanzado su modelo insignia Gemini 3.5 Pro, un producto originalmente programado para su lanzamiento en la conferencia I/O de mayo y que aún no ha visto la luz.
Por otro lado, están los grandes modelos con inteligencia funcional, pero con costos de implementación elevados y gastos crecientes.
Las empresas nacionales de modelos grandes están corriendo a toda velocidad por este camino. En julio de 2026, Moonshot AI lanzó Kimi K3, con un tamaño de parámetros de aproximadamente 2.8 billones, convirtiéndolo en el modelo abierto más grande del mundo en términos de parámetros.
Ali紧接着推出Qwen3.8 Max,参数量约2.4万亿;百度文心5.0同样达到2.4万亿参数;DeepSeek V4-Pro参数量为1.6万亿。
El aumento en el tamaño del parámetro trae una mejora inteligente visible a simple vista. Kimi K3 supera a Claude Fable 5 y GPT-5.6 Sol en varias listas de Agentes. Qwen3.8 Max se describe como "uno de los modelos abiertos con el tamaño de parámetros más grande y el rendimiento más potente".
But the costs have also risen accordingly.
El precio de la API de Kimi K3 aumenta de 6.5 yuanes por millón de tokens a 20 yuanes para entradas no almacenadas en caché, y de 27 yuanes a 100 yuanes para salidas, representando aumentos del 208% y 270%, respectivamente. Se recomienda oficialmente implementar supernodos con 64 tarjetas de aceleración o más.
Solo dos días después del lanzamiento, Moonshot anunció la suspensión de las suscripciones de nuevos usuarios finales y destinó toda la capacidad de cómputo a garantizar el servicio a los usuarios existentes.
Cuanto más avanzada sea la inteligencia, mayores serán los parámetros del modelo, más caro será su uso, más elevada será la barrera de implementación y más escasa será la capacidad de cómputo... Esto parece convertirse en un nudo difícil de desatar.
MiniMax, no hace elecciones
Para el dilema de elegir entre costo e inteligencia, la elección de MiniMax es: lo quiero todo.
Yan Junjie explicó claramente toda la lógica de MiniMax en la reunión de resultados:
La capacidad de cómputo es limitada para cada empresa. A través de “Minimize the Inference Cost, Maximize the Intelligence”, buscamos lograr “Intelligence with Everyone”. Esta es la línea tecnológica que hemos mantenido desde el inicio y también nuestro propósito original como emprendedores.
“Minimize the Inference Cost, Maximize the Intelligence” significa “Minimizar el costo de inferencia, maximizar la inteligencia”. MiniMax coloca la reducción de costos y el aumento de la inteligencia dentro del mismo marco narrativo.
¿Por qué se pueden mencionar juntas estas dos cosas? Porque MiniMax tiene una comprensión diferente de la "inferencia":
En primer lugar, el razonamiento es el medio de producción para crear la próxima generación de inteligencia.
Anteriormente, se consideraba que la inferencia era “usar un modelo” y el entrenamiento era “crear un modelo”. Pero ahora, los componentes esenciales como los datos sintéticos, el Rollout del aprendizaje por refuerzo, la evaluación y validación del modelo, y la interacción entre agentes y entornos, en esencia, ejecutan cargas de inferencia.
La fase de post-entrenamiento representa una proporción cada vez mayor del poder de cómputo total de entrenamiento. La inferencia ya no es una carga que surge solo después de finalizar el entrenamiento, sino un consumo que atraviesa todo el proceso de entrenamiento.
Por lo tanto, la eficiencia de inferencia no solo determina el espacio de precios del API, sino también hasta qué punto se podrá entrenar el próximo modelo.
En segundo lugar, la optimización del costo de inferencia es una condición necesaria para la iteración inteligente.
La potencia de cómputo tiene un límite físico, mientras que el tamaño de los modelos sigue creciendo. Si el costo de inferencia no disminuye, cuanto más avancemos, más el costo acabará ahogando el progreso inteligente.
Within a limited computational budget, whether every dollar can be converted into effective intelligent output determines how far model iteration can go.
Tercero, buscar el nivel más alto de inteligencia con el costo inteligente más bajo: ambas cosas son dos caras del mismo objetivo.
La industria solía considerar "prioridad inteligente" y "prioridad de costo" como dos caminos distintos. Pero si el costo de inferencia no se reduce, ninguna inteligencia, por muy alta que sea, podrá implementarse.
En términos sencillos, la estrategia de MiniMax es tratar la optimización de costos y la mejora inteligente como un mismo objetivo. Desde el primer día del diseño del modelo, la eficiencia de inferencia se convierte en un indicador clave que se mantiene贯穿 todo el ciclo de desarrollo.
Según Yan Junjie: "MiniMax no busca hacer un compromiso entre inteligencia y costo. El objetivo es lograr un nivel superior de inteligencia, y el medio para lograr una mejor relación costo-beneficio es optimizar continuamente el costo y la eficiencia del razonamiento."
El costo de cálculo se redujo a 1/20; MiniMax convirtió "reducir costos y aumentar inteligencia" en un ciclo tecnológico cerrado.
MiniMax siempre ha seguido este propósito original para establecer una base tecnológica.
Lo más fundamental es su arquitectura MSA (Atención Escasa) desarrollada internamente. En términos simples, reduce el costo de cálculo por token en textos de millones de palabras hasta aproximadamente 1/20 del costo del mecanismo de atención completa tradicional, lo que significa que el M3 requiere solo 1/20 de la cantidad de cálculo por token en un contexto de 1M en comparación con la generación anterior.

La clave de este avance es que el número total de parámetros determina el límite de capacidad de conocimiento del modelo, pero el número de parámetros activados determina el costo de inferencia por token. Estos dos factores pueden desacoplarse: el aumento del tamaño de los parámetros no necesariamente implica un aumento proporcional en el costo de inferencia.
Por lo tanto, M3 puede mejorar el nivel inteligente sin cambiar el precio, y M3 Pro puede lograr un tamaño de parámetros de aproximadamente 3T mientras avanza en el aprendizaje por refuerzo y el entrenamiento de tareas de largo plazo.
A nivel de infraestructura, MiniMax logra una ETTR (proporción de tiempo de entrenamiento efectivo) del 97%, siendo una de las primeras empresas independientes de modelos grandes en China en establecer un sistema de capacidad de cómputo escalable y estable a largo plazo.
Se ha construido una red de suministro de potencia de cálculo mediante una combinación de clústeres propios, proveedores de nube y TokenFactory. La potencia de cálculo actual y planificada ya puede respaldar la iteración continua de modelos de texto y video de hasta 3T.
Conclusión: Sin ventaja en poder de cómputo, ¿en qué se basan los modelos nacionales para alcanzar el ritmo?
Cada vez que se habla de la brecha entre los modelos grandes de EE. UU. y China, el hardware siempre es un tema inevitable.
Anteriormente, se daba por sentado que quien tuviera procesos de fabricación de chips más avanzados y mayor poder de cómputo podría crear modelos mejores. Según esta lógica, la IA china parecería mantener siempre una diferencia de varios meses a medio año con respecto a la IA estadounidense.
¿Debe ser así solamente?
MiniMax ofrece un nuevo camino: Minimizar el Costo de Inferencia, Maximizar la Inteligencia.
Reducir el costo por unidad de inteligencia también eleva el límite superior de la inteligencia. Porque el entrenamiento posterior, los datos sintéticos y el aprendizaje por refuerzo de hoy en día, en esencia, ejecutan cargas de inferencia. Cuanto más eficiente sea la inferencia, más experimentos se pueden realizar con la misma capacidad de cómputo, y más alto será el techo de la inteligencia.
Quien pueda producir inteligencia más alta con un costo más bajo podrá extender los límites dentro de la capacidad de cómputo limitada, permitiendo que una inteligencia más elevada entre en la vida de un mayor número de personas.
Esta podría ser la vía más prometedora para que los grandes modelos nacionales participen en la competencia global. Y MiniMax ya ha comenzado a validarla.
