Nueve modelos de IA insignia lanzados en un mes, señalando la era "desechable"

iconMetaEra
Compartir
AI summary iconResumen
Nueve modelos de IA insignia llegaron al mercado en julio de 2026, incluyendo Tencent Hunyuan Hy3, Kimi K3 y Qwen3.8-Max. Los lanzamientos rápidos muestran una competencia más intensa y una innovación más veloz. Kimi K3 lideró el ranking frontend de Code Arena, mientras que Hy3 utilizó menos parámetros activos. Ahora, el precio y el rendimiento del código son tan importantes como el poder bruto. Los operadores están observando cómo estos cambios afectan el índice de miedo y codicia y las principales altcoins.
La vida útil del "modelo más potente" se está acortando.

Autor del artículo, fuente: Dingjiao

En un mes, se lanzaron nueve modelos insignia en conjunto, lo cual no es común en la industria de los modelos grandes.

Desde el lanzamiento oficial y la apertura del código de Tencent Hunyuan Hy3 al inicio del mes, hasta el lanzamiento de Claude Opus 5 de Anthropic al final del mes, modelos como Kimi K3, Qwen3.8-Max en versión preliminar y Grok 4.5 aparecieron sucesivamente. Julio se convirtió en uno de los picos de lanzamientos más raros en el último año.

Los distintos fabricantes eligieron diferentes momentos. Algunos lanzaron sus productos tras la actualización de sus competidores, otros lo hicieron alrededor del Congreso Mundial de Inteligencia Artificial, y algunos respondieron a la competencia del mercado mediante ajustes de precios.

Pero julio no solo fue notable por la gran cantidad de modelos lanzados, sino también por los dos cambios que reflejan estos lanzamientos.

En primer lugar, la brecha de capacidad entre modelos se está reduciendo. El Índice de Inteligencia Integral más reciente de Artificial Analysis muestra que la diferencia entre los modelos líderes se ha reducido claramente. Con la rápida iteración de versiones, la posición del "mejor modelo" se vuelve cada vez más difícil de mantener a largo plazo, y las empresas comienzan a buscar ventajas en diferentes tareas en lugar de perseguir una ventaja absoluta en una sola dimensión.

En segundo lugar, los modelos de código abierto están ingresando al primer nivel. Entre los nuevos modelos lanzados en julio, Tencent Hunyuan Hy3, Kimi K3 y otros optaron por abrir sus pesos (poner a disposición los parámetros del modelo para que los desarrolladores puedan descargarlos y desplegarlos por su cuenta). En particular, Kimi K3 ocupa el primer lugar en la tabla de clasificación de programación frontal de Code Arena, superando a GPT-5.6 Sol y Claude Fable 5. Durante los últimos dos años, los modelos de código abierto se consideraban principalmente como seguidores de los modelos cerrados; sin embargo, esta nueva ronda de competencia muestra que los modelos de código abierto ya están compitiendo directamente con los modelos cerrados en ciertos escenarios de desarrollo.

Entonces, ¿qué cambios y qué implicaciones trajo esta intensa serie de lanzamientos este mes?

01. Ya no se trata solo de quién es más inteligente

En los últimos años, la industria de los grandes modelos se centró principalmente en comparar sus capacidades generales: quién tenía un conocimiento más amplio y quién daba respuestas más precisas. Pero ahora, los criterios de competencia han cambiado.

En esta ronda, la capacidad de programación se ha convertido en la dirección de competencia más evidente.

OpenAI continúa fortaleciendo la programación y el razonamiento complejo, y expandiendo constantemente el ecosistema Codex, con el objetivo de vincular a los programadores mediante herramientas de desarrollo. Anthropic apuesta por la comprensión del código y la auditoría de seguridad para ayudar a los desarrolladores a resolver problemas de ingeniería complejos en proyectos de gran escala. Grok 4.5 enfatiza la velocidad y el bajo costo, y se integra con la herramienta de programación AI Cursor, cubriendo escenarios de desarrollo diarios.

El investigador de modelos grandes Yao Yuhang le dijo a «Dingjiao One» que todas las empresas están invirtiendo intensamente en capacidades de programación, y la brecha se está reduciendo rápidamente; por ejemplo, la capacidad de código de Kimi K3 ha mejorado notablemente y se está acercando al nivel de los modelos cerrados líderes.

Fuente de la imagen / pexels

El agente es otra dirección en la que todas las empresas compiten. GPT-5.6 Sol, junto con Codex, explora la programación automatizada; Opus 5 enfatiza la ejecución de tareas a largo plazo; Kimi K3 demuestra la capacidad de ejecución continua para completar tareas complejas, y Tencent Hunyuan Hy3 intenta combinar el ecosistema WeChat para explorar aplicaciones de agentes inteligentes.

Sin embargo, los agentes aún no son maduros en el trabajo real. El desarrollador independiente Bei Cheng señaló que la debilidad actual de algunos productos de agentes no radica en si pueden o no llamar herramientas, sino en su capacidad de programación de tareas. Por ejemplo, el modo Ultra de Codex activa muchos subagentes, que leen repetidamente el mismo archivo y realizan análisis similares, lo que aumenta el consumo de tokens sin incrementar realmente el trabajo efectivo. En su opinión, mejorar la capacidad de los agentes no puede lograrse solo aumentando el número de subagentes; lo clave es poder determinar qué tareas merecen análisis y qué pasos se pueden omitir.

Yao Yuhang comparte una opinión similar. Considera que los agentes inteligentes son actualmente la dirección más值得关注, pero aún están lejos de madurar completamente. En su opinión, los agentes inteligentes en sectores verticales como la salud y las finanzas aún presentan grandes oportunidades; la clave para diferenciarse en la próxima fase no solo radica en la capacidad del modelo en sí, sino también en qué tan útiles sean los agentes en escenarios concretos y si los clientes están dispuestos a pagar por ellos.

Los modelos nacionales buscan puntos de ruptura mediante el mejoramiento de distintas capacidades. Kimi K3 se enfoca en fortalecer la comprensión de contexto largo, la programación frontend y las habilidades de diseño de productos, logrando posiciones destacadas en múltiples pruebas de programación y acercándose a las capacidades de los modelos cerrados líderes extranjeros.

La competencia entre el tamaño del modelo y la eficiencia de inferencia también se ha convertido en otra línea principal.

Varios modelos lanzados en julio ingresaron en el rango de billones e incluso varios billones de parámetros, pero el tamaño de los parámetros ya no puede equipararse directamente con el nivel de capacidad. Con el desarrollo de la arquitectura MoE, los modelos pueden tener una mayor capacidad de parámetros, activando solo una pequeña parte de ellos para realizar la inferencia, reduciendo así el costo de cálculo real.

La industria ha formado dos enfoques: uno continúa expandiendo la escala, intercambiando parámetros más grandes por mayor capacidad; el otro enfatiza la eficiencia, logrando resultados cercanos a los modelos insignia con parámetros de activación más pequeños.

El precio también se convierte en la variable más directa en la competencia de modelos de julio.

Los fabricantes extranjeros adoptan más estrategias de diferenciación de precios. OpenAI opta por细分 el mercado aún más, dividiendo GPT-5.6 en distintas versiones para que los usuarios elijan el modelo adecuado según la complejidad de la tarea; Anthropic continúa con su enfoque de modelos insignia de alto rendimiento, cubriendo escenarios de desarrollo de alto valor y empresariales mediante la serie Opus; Grok 4.5, por su parte, adopta una estrategia de precios bajos, con un precio de salida solo una cuarta parte del de la serie Opus, y atrae a desarrolladores mediante su vinculación con Cursor.

Las empresas nacionales enfatizan aún más la ventaja de costos. En los últimos seis meses, múltiples fabricantes de modelos nacionales han reducido continuamente los precios de las API, buscando reducir la barrera de entrada mediante costos bajos y ampliar la base de desarrolladores y usuarios empresariales.

En julio, la competencia entre grandes modelos se ha ampliado desde la comparación de capacidades individuales hasta múltiples dimensiones, como código, agentes inteligentes, eficiencia de parámetros y precio.

02. ¿Quién superó las expectativas y quién recibió evaluaciones divididas?

En comparación con las generaciones anteriores, el rendimiento en las listas y los comentarios de los desarrolladores, los modelos lanzados en julio se pueden clasificar aproximadamente en tres categorías.

Primero, veamos los que superan las expectativas: Kimi K3, Grok 4.5, Hunyuan Hy3.

El más destacado es Kimi K3. Este modelo utiliza la arquitectura MoE y cuenta con un tamaño total de parámetros en el nivel de billones, con un enfoque especial en mejorar las capacidades de contexto largo, programación frontend y diseño de productos. El día de su lanzamiento, Kimi K3 alcanzó el primer puesto en la tabla de programación frontend de Code Arena con 1679 puntos, mejorando 17 posiciones respecto al puesto 18 de su predecesor, Kimi K2.6. Una semana después, en la tabla general de Arena, Kimi K3 ingresó por primera vez al Top 10 mundial.

Pero Kimi K3 también tiene límites de capacidad evidentes. En la prueba de confiabilidad del conocimiento de Artificial Analysis, su tasa de alucinaciones aumentó del 39% en Kimi K2.6 al 51%, y su velocidad de salida es de aproximadamente 33 tokens/s, mucho más baja que la de modelos similares.

La experiencia práctica de los desarrolladores también confirma esta "desigualdad". Bei Cheng considera que Kimi K3 representa una mejora significativa respecto a la generación anterior, con ventajas principalmente en desarrollo frontend, diseño de interfaz de usuario y expresión de productos. Por ejemplo, en tareas como optimizar la interfaz de usuario de un sitio web o diseñar interfaces de aplicaciones móviles, Kimi K3 produce mejores resultados, pero su desempeño no es lo suficientemente estable en tareas de ingeniería complejas.

Fuente de la imagen / pexels

También ha llamado la atención Grok 4.5. Tras su lanzamiento el 9 de julio, ingresó entre los primeros lugares del índice inteligente Artificial Analysis y destacó en pruebas de llamada a herramientas, siendo considerado por muchos desarrolladores como una opción de excelente relación calidad-precio.

Beicheng coincide con esta percepción y considera que la mayor ventaja de Grok 4.5 es su velocidad: con él, una misma tarea puede completarse en tres o cinco minutos, mientras que con GPT-5.6 a veces se requieren veinte minutos o incluso media hora. Además, al ser más económico, es ideal para situaciones que requieren desarrollo rápido. Yao Yuhang opina que las capacidades de programación de Grok 4.5 han sido optimizadas específicamente, y que su combinación con Cursor ofrece una experiencia general excelente. Como contexto, SpaceX anunció previamente la adquisición de Anysphere, la empresa matriz de Cursor, con la transacción prevista para cerrarse en el tercer trimestre; la colaboración en datos entre xAI y Cursor también se considera que ha ayudado a optimizar la experiencia de programación de Grok 4.5.

Hunyuan Hy3 representa un avance en la línea de eficiencia. Este modelo tiene un total de 295 mil millones de parámetros, con solo 21 mil millones de parámetros activos, y logra resultados cercanos a los de modelos competidores de mayor tamaño en múltiples benchmarks públicos, a pesar de tener menos de una quinta parte de los parámetros del modelo insignia. Sin embargo, en SWE-Bench Pro, la puntuación de Hunyuan Hy3 de 57.9 aún presenta una diferencia notable con respecto a los 69.2 de Claude Opus, lo que indica que aún necesita mejorar en la capacidad de corrección de código complejo.

Yao Yuhang considera que Hy3 representa un avance en comparación con los modelos anteriores de Tencent, y junto con su diseño de código abierto y tamaño reducido, es una buena opción dentro del rango de tamaño medio.

Vuelva a observar la categoría que se mantiene estable en el primer grupo, pero con sorpresas limitadas: GPT-5.6 Sol y Claude Opus 5.

GPT-5.6 Sol y Claude Opus 5 mantienen su posición en el primer nivel, pero no generan cambios significativos. GPT-5.6 Sol fortaleció sus capacidades de razonamiento complejo y programación de agentes, alcanzando un 88,8% en la prueba Terminal-Bench 2.1 (un benchmark que evalúa la capacidad de los modelos para completar tareas prácticas en entornos de línea de comandos), y subiendo hasta un 91,9% en modo Ultra. Claude Opus 5 continúa destacando en tareas complejas, enfatizando aún más su confiabilidad en escenarios como ingeniería compleja, comprensión de código y análisis de seguridad. La ventaja de Opus 5 es que su rendimiento se acerca al de Fable 5, mientras que su precio es solo la mitad.

Ambos modelos aún se encuentran en el primer nivel, pero no han logrado avances significativos.

Bei Cheng mencionó que GPT-5.6 ya puede cubrir la mayoría de sus necesidades diarias de desarrollo, pero cuando se enfrenta a problemas especialmente complejos, recurre a Opus 5 para resolverlos. Sin embargo, una capacidad más potente también implica un costo más elevado. Para él, Opus 5 se posiciona más como un "experto" que se activa para resolver problemas críticos.

Finalmente, una categoría con retroalimentación dividida y aún por verificar: Gemini 3.6 Flash y Qwen3.8-Max versión preliminar.

El más representativo es Gemini 3.6 Flash, que obtiene una puntuación de 50 en la lista de índices inteligentes Artificial Analysis, igual que su predecesor 3.5 Flash. La comunidad de desarrolladores ha dado retroalimentación generalmente consistente: esta generación no muestra mejoras significativas respecto a la anterior y su desempeño es inferior al de sus competidores actuales. Sin embargo, algunos consideran que, como modelo ligero, la calidad de salida de Gemini 3.6 Flash es básicamente aceptable.

Para el desarrollador independiente Kapdim, la experiencia diaria con Gemini 3.6 Flash es buena; aunque su capacidad de programación no es destacada, su comprensión multimodal sigue siendo bastante excelente. Admite la entrada de archivos en cualquier formato, y el estilo y la experiencia de chat diario superan a muchos competidores.

Después del lanzamiento de la versión preliminar de Qwen3.8-Max en julio, el rendimiento del modelo fue inestable y las reacciones del mercado variaron. La experiencia más destacada de Beicheng fue que la versión preliminar de Qwen3.8-Max tiene una profundidad de razonamiento elevada, pero a veces se enreda en razonamientos prolongados, “como si se atrapara a sí misma”, sin llegar finalmente a una solución efectiva. Kapdim consideró que la versión preliminar de Qwen3.8-Max estuvo por debajo de las expectativas; al evaluarla con su propio conjunto de pruebas de estética frontend, descubrió que las capacidades reales presentaban una brecha notable con la publicidad. Como producto preliminar aún en ajuste, su rendimiento final deberá verificarse tras el lanzamiento de la versión oficial.

En julio no surgió un modelo que liderara en todas las dimensiones; diferentes modelos comenzaron a especializarse en escenarios específicos.

Por ejemplo, Norte Ciudad selecciona herramientas según la tarea: GPT-5.6 para el desarrollo diario, Grok 4.5 para completar rápidamente las necesidades, Kimi K3 para escenarios de producto y frontend, y Claude Opus 5 para resolver problemas complejos. La combinación de Capdim es diferente: utiliza los modelos Fable 5 o Opus 5 de Claude para la planificación, y luego ejecuta mediante GPT-5.6 Sol.

03. Las publicaciones se vuelven cada vez más rápidas, y el debate entre código abierto y código cerrado se intensifica

Detrás de esta ronda de lanzamientos intensos, hay varias preguntas que merecen análisis: ¿por qué las iteraciones del modelo se están acelerando, ¿por qué se concentran en julio, y ¿por qué el código abierto está afectando los modelos de negocio existentes?

En primer lugar, la forma de iterar los modelos está cambiando. Anteriormente, el aumento de la capacidad de los modelos grandes dependía principalmente de volver a entrenar modelos de mayor escala, lo que implicaba ciclos largos y costos elevados. Sin embargo, con la maduración de tecnologías como el aprendizaje por refuerzo y el post-entrenamiento (optimización continua del rendimiento del modelo mediante ajuste fino y aprendizaje por refuerzo tras el entrenamiento inicial), la actualización de los modelos ahora se basa más en la optimización posterior al entrenamiento.

Yao Yuhang le dijo a "Dingjiao One" que en los últimos dos años la velocidad de lanzamiento de modelos se ha acelerado notablemente, y una razón importante es que la industria ya ha dominado métodos de postentrenamiento más maduros. Actualmente, muchas mejoras en los modelos no requieren entrenar un modelo desde cero, sino que se optimizan continuamente sobre modelos base existentes mediante técnicas como el aprendizaje por refuerzo y la autoiteración.

Esto significa que el ciclo de competencia entre modelos se está acortando. Anteriormente, un modelo líder podía mantener su ventaja durante meses; ahora, la ventana de ventaja generada por actualizaciones de versión puede durar solo unas pocas semanas. Si no se mantiene el ritmo de lanzamiento, es posible ser rápidamente superado por nuevas versiones. Para los fabricantes, lanzar modelos no es solo una demostración técnica; el momento del lanzamiento se ha convertido en parte fundamental de la competencia.

Fuente de la imagen / pexels

En segundo lugar, julio es un período en el que se superponen varios eventos clave. Para los fabricantes nacionales, el Congreso Mundial de Inteligencia Artificial (WAIC) se celebra en julio, y las empresas suelen lanzar modelos y mostrar avances tecnológicos alrededor de esta fecha. Para los fabricantes internacionales, varias empresas líderes también eligen actualizar sus modelos en esta etapa, con el objetivo de ganar ventaja en el ecosistema de desarrolladores y en la competencia comercial.

Además, las reglas de la competencia en la industria están cambiando. Ya no basta con que el modelo sea lo suficientemente potente; la competencia se ha extendido a cómo se utiliza el modelo y cómo se convierte en ingresos.

Por eso, la disputa entre modelos de código abierto y cerrado se intensificó nuevamente en julio. Durante mucho tiempo, ha existido una brecha de capacidad entre los modelos de código abierto y los cerrados. Pero ahora que algunos modelos de código abierto han ingresado al primer nivel, surge una pregunta más realista: ¿se desviarán los ingresos por llamadas a API y suscripciones de las empresas de modelos cuando los modelos de alto rendimiento estén disponibles gratuitamente?

Los partidarios del código abierto sostienen que los pesos abiertos reducen la barrera tecnológica y permiten que más empresas y desarrolladores participen en la innovación de la IA. El código abierto significa que los proveedores de tecnología ceden activamente parte de sus intereses para impulsar el desarrollo del ecosistema; mientras que los defensores del código cerrado temen que sus usuarios sean desviados hacia modelos de código abierto. Empresas como Anthropic consideran que, a medida que aumenta la capacidad de los modelos, la apertura de los pesos podría generar riesgos de seguridad y requiere una gobernanza más estricta.

Detrás de este debate realmente se encuentran los intereses de diferentes empresas. Para empresas de infraestructura como NVIDIA, la apertura de modelos implica más demanda de despliegue y un mercado de capacidad de cómputo más grande. Para empresas de modelos como OpenAI y Anthropic, el modelo cerrado permite mantener los ingresos por llamadas a API y suscripciones. Sin embargo, también es importante ver el otro lado: la apertura abierta sí amplía la demanda de despliegue, pero con la mejora en la eficiencia de parámetros, el consumo de capacidad de cómputo por tarea unitaria también podría diluirse, por lo que el crecimiento del mercado de capacidad de cómputo no necesariamente avanza al mismo ritmo que el grado de apertura del modelo. Para las empresas locales, abrir los pesos no es solo una elección de ruta técnica, sino también una forma de ganar acceso al ecosistema de desarrolladores, servicios en la nube y futuras oportunidades de comercialización.

Después de julio, la competencia entre los modelos grandes continuará. La comunidad de desarrolladores espera en general que nuevos modelos como DeepSeek V4 versión oficial, Fable 5.1 y GPT-6 se lancen gradualmente en agosto.

La brecha en las capacidades de los modelos se está reduciendo, y ya es cada vez más difícil establecer una ventaja a largo plazo solo lanzando un modelo más potente. Los siguientes indicadores específicos merecen atención: ¿Hasta dónde puede llevar DeepSeek V4 la capacidad máxima de los modelos de código abierto?, ¿continuará bajando el precio de la API?, ¿podrán los agentes inteligentes generar escenarios de pago estables?, y ¿podrán los modelos de código abierto incorporarse a más implementaciones privadas empresariales? Las respuestas a estas preguntas explicarán mejor qué ha cambiado realmente en esta batalla que las posiciones en las clasificaciones.

*La imagen principal proviene de Pexels.

Descargo de responsabilidad: La información contenida en esta página puede proceder de terceros y no refleja necesariamente los puntos de vista u opiniones de KuCoin. Este contenido se proporciona solo con fines informativos generales, sin ninguna representación o garantía de ningún tipo, y tampoco debe interpretarse como asesoramiento financiero o de inversión. KuCoin no es responsable de ningún error u omisión, ni de ningún resultado derivado del uso de esta información. Las inversiones en activos digitales pueden ser arriesgadas. Evalúa con cuidado los riesgos de un producto y tu tolerancia al riesgo en función de tus propias circunstancias financieras. Para más información, consulta nuestras Condiciones de uso y la Declaración de riesgos.