Los modelos de IA grandes están mejorando rápidamente su inteligencia; Kimi K3 logró una puntuación de 57, ubicándose como el tercer modelo de código abierto a nivel mundial. La mediana de las puntuaciones de los 20 principales modelos aumentó de 34 a 43. Se están haciendo evidentes los cuellos de botella en la infraestructura de IA: el alquiler de GPUs Blackwell ha aumentado un 27% desde principios de año, los precios de los modelos前沿 en China saltaron un 45% en una semana, y laboratorios como SpaceX han invertido 1.000 millones de dólares en equipos de generación de energía. Citi señala que la próxima ventaja competitiva pasará de la obtención de capacidad de cómputo a la eficiencia y los datos propietarios, mientras que los riesgos de seguridad también aumentan simultáneamente: los agentes de IA autónomos han pasado de “interrumpir el almuerzo” a “infiltrarse en la infraestructura de Hugging Face”.Autor y fuente del artículo: Hard AI
Citigroup analiza que el retorno de la inversión (ROI) en la industria de la IA se está acelerando hacia la capa de infraestructura, y que las ventajas competitivas futuras pasarán de la obtención de potencia de cómputo a la eficiencia y los datos propietarios.
Los modelos de IA grandes se están volviendo cada vez más inteligentes, pero el mundo físico que los aloja está siendo llevado al límite.
En su informe más reciente publicado el 24 de julio, Citibank escribió que Moonshot's Kimi K3 obtuvo 57 puntos, ubicándose en el tercer lugar mundial, solo 3 puntos por detrás del líder cerrado, Claude Fable. Al mismo tiempo, los precios de los modelos前沿 chinos representados por Kimi K3 aumentaron un 45% en una semana, el alquiler de las GPU Blackwell ha subido un 27% desde principios de año, e incluso algunos laboratorios han invertido mil millones de dólares en comprar directamente grupos electrógenos.
Citigroup analiza que el retorno de la inversión (ROI) en la industria de la IA se está acelerando hacia la capa de infraestructura; y la ventaja competitiva de la próxima fase en la competencia de modelos pasará completamente de la "adquisición de capacidad de cómputo" a la "producción eficiente y datos propietarios".
01 La brecha es solo de 3 minutos
Citigroup mencionó en un informe de investigación que Kimi K3 es el modelo de código abierto más grande publicado hasta la fecha. Hace unas semanas, la puntuación más alta en código abierto era de solo 51 puntos (Z.ai GLM-5.2); Kimi K3 saltó directamente a 57 puntos, quedando por debajo de Claude Fable 5 (60 puntos) y OpenAI GPT-5.6 Sol (59 puntos).
La industria completa se está acelerando. La puntuación inteligente mediana de los 20 principales proveedores de modelos aumentó de 34 puntos hace seis semanas a 43 puntos. En el campamento de código abierto, DeepSeek V4 Pro (44 puntos) tiene un precio tan bajo como 0.03 por millón de tokens, ofreciendo un nivel de inteligencia cercano a la vanguardia, pero con un precio dos órdenes de magnitud más bajo.
El campamento de código cerrado tampoco ha ralentizado. Google acaba de lanzar Gemini 3.6 Flash (21 de julio) y al mismo tiempo reveló que Gemini 3.5 Pro aún se encuentra en prueba, y que la preentrenamiento de Gemini 4 ya ha comenzado: tres generaciones de modelos avanzando en paralelo. Sin embargo, Citi considera que el ritmo de lanzamiento, con el "Flash primero y el Pro retrasado", envía una señal: avanzar en modelos de vanguardia se está volviendo más difícil, lo que coincide con los retrasos que otras empresas han experimentado en la construcción de infraestructura y refleja la realidad del sector, que desea comprimir los ciclos de entrega pero no logra hacerlo.
Cuanto más grande y potente sea el modelo, mayores serán los recursos necesarios para ejecutarlo.
02 El cuello de botella se mudó
Los modelos de billones de parámetros están redefiniendo el significado de "potencia de cálculo".
Citigroup señala que, al ejecutar estos modelos ultra grandes, cada vez más tiempo se dedica a transferir pesos y datos de KV-cache entre la memoria HBM y la red de interconexión de GPU, en lugar de realizar operaciones matriciales. El cuello de botella ha pasado de "si se calcula rápido" (FLOPs) a "si se puede mover o no": ancho de banda de memoria, interconexión de GPU y suministro de energía.
La demanda de GPU sigue siendo fuerte, y los alquileres de la arquitectura Blackwell han aumentado un 27% desde principios de año. Pero simplemente acumular GPU ya no es suficiente.
Algunos laboratorios de IA han comenzado a ingresar directamente al sector de generación eléctrica: SpaceX invirtió 1.000 millones de dólares en la compra de un conjunto móvil de turbinas de 1 GW (15 de julio), y Georgia Power firmó un acuerdo de servicio la misma semana (22 de julio). Comprar equipos de generación eléctrica por parte de laboratorios de IA: algo que casi era impensable hace un año, ahora está sucediendo.
Los precios de los modelos reflejan directamente la tensión de la capacidad. Los precios mixtos de los modelos de vanguardia en China aumentaron de 0.87 por millón de tokens, con un alza del 45% semana a semana y mes a mes, marcando la primera gran fluctuación en dos meses. El precio promedio global de los modelos de vanguardia aumentó un 6.8% semana a semana y un 11.3% mes a mes. Estados Unidos y Europa se mantuvieron relativamente estables (semana a semana -0.5%), pero también registraron un aumento del 4.1% mes a mes.
Citigroup estima que, a medida que se vayan implementando infraestructuras incrementales, la presión sobre los precios finalmente se aliviará. En ese momento, los datos valiosos y el rendimiento específico para tareas constituirán una ventaja competitiva más duradera que el acceso a la potencia de cálculo.
03 Agente escapa del sandbox
Los modelos se vuelven más fuertes. Pero los agentes que se ejecutan sobre los modelos también se vuelven más peligrosos.
El informe de Citibank utilizó una expresión intrigante: el riesgo real de que un agente de IA autónomo escape del sandbox pasó de "interrumpir el almuerzo" en abril a "penetrar la infraestructura de Hugging Face" en julio.
Cuanto más potentes y普及 sean los modelos de código abierto, mayor será la extensión de los riesgos de seguridad. El debate sobre la regulación de la IA aún está en curso — NVIDIA (24 de julio) y el secretario del Tesoro de EE. UU., Bessent (22 de julio), han emitido recientemente declaraciones — pero es poco probable que se llegue a una conclusión a corto plazo. Incluso si el marco regulatorio aún no se ha implementado, las empresas que mantienen la arquitectura de funcionamiento de sus propios modelos ya enfrentan umbrales de cumplimiento más elevados.
Lo más complicado es que los propios proveedores que entrenan estos modelos aún no pueden examinar completamente por qué actúan de esa manera. El problema de la explicabilidad aún no se ha resuelto.
Pero las preocupaciones de seguridad no han ralentizado el proceso de comercialización de los agentes. Los datos de METR (21 de julio) muestran que la brecha económica entre los agentes de IA y los humanos se está reduciendo. A medida que los agentes sean más autónomos y más cercanos a la viabilidad económica, el consumo de tokens acelerará continuamente, lo que a su vez aumenta la demanda de infraestructura.
Cuanto mayor sea la capacidad, más estrictas serán las restricciones. Cuanto más estrictas sean las restricciones, mayores serán las necesidades de infraestructura. Este ciclo no muestra señales de desaceleración.
