O nível de inteligência dos grandes modelos de IA está aumentando rapidamente; o Kimi K3 alcançou 57 pontos, classificando-se como o terceiro modelo aberto globalmente, enquanto a pontuação mediana dos 20 principais modelos subiu de 34 para 43 pontos. As limitações da infraestrutura de IA se tornaram evidentes: o aluguel de GPUs Blackwell aumentou 27% desde o início do ano, os preços dos modelos avançados na China subiram 45% em uma semana, e laboratórios como o SpaceX gastaram US$ 1 bilhão em equipamentos de geração de energia. O Citigroup destacou que a próxima barreira competitiva passará da aquisição de poder de computação para eficiência e dados proprietários, com riscos de segurança simultaneamente elevados; agentes de IA autônomos já evoluíram de “interromper o almoço” para “infiltrar-se na infraestrutura do Hugging Face”.Autor do artigo, fonte: Hard AI
O Citigroup analisa que o retorno sobre o investimento (ROI) do setor de IA está acelerando sua migração para a camada de infraestrutura, e a vantagem competitiva futura passará da obtenção de poder de computação para eficiência e dados proprietários.
Os grandes modelos de IA estão se tornando cada vez mais inteligentes, mas o mundo físico que os suporta está sendo levado ao limite.
No relatório mais recente publicado em 24 de julho, o Citigroup escreveu que o Moonshot Kimi K3 obteve 57 pontos, classificando-se em terceiro lugar globalmente, apenas 3 pontos atrás do líder de modelos fechados, Claude Fable. Ao mesmo tempo, os preços dos modelos avançados chineses representados pelo Kimi K3 subiram 45% em uma semana; os aluguéis de GPUs Blackwell aumentaram 27% desde o início do ano, e alguns laboratórios gastaram 1 bilhão de dólares americanos para comprar diretamente geradores elétricos.
O Citigroup analisa que o retorno sobre o investimento (ROI) do setor de IA está acelerando sua transição para a camada de infraestrutura; e a próxima fase da competição entre modelos mudará completamente da simples "aquisição de poder de computação" para "produção eficiente e dados proprietários".
01 A diferença agora é de apenas 3 pontos
O Citigroup mencionou em seu relatório de pesquisa que o Kimi K3 é atualmente o maior modelo aberto lançado publicamente. Há algumas semanas, a pontuação mais alta para modelos abertos era de apenas 51 pontos (Z.ai GLM-5.2); o Kimi K3 saltou para 57 pontos, ficando atrás apenas do Claude Fable 5 (60 pontos) e do OpenAI GPT-5.6 Sol (59 pontos).
Toda a indústria está acelerando. A pontuação média de inteligência dos 20 principais fornecedores de modelos aumentou de 34 para 43 pontos nas últimas seis semanas. No ecossistema de código aberto, o DeepSeek V4 Pro (44 pontos) tem um preço de apenas 0,03 por milhão de tokens — alcançando níveis de inteligência de ponta, mas com um preço duas ordens de grandeza mais baixo.
O campo de código fechado também não desacelerou. O Google acabou de lançar o Gemini 3.6 Flash (21 de julho) e revelou que o Gemini 3.5 Pro ainda está em teste, enquanto a pré-treinagem do Gemini 4 já foi iniciada — três gerações de modelos avançando simultaneamente. No entanto, o Citigroup acredita que o ritmo de lançamento “Flash primeiro, Pro adiado” transmite um sinal: impulsionar modelos de ponta está se tornando mais difícil — consistente com os atrasos enfrentados por outras empresas na construção de infraestrutura e refletindo a realidade do setor, que deseja comprimir os ciclos de entrega, mas enfrenta dificuldades para alcançar esse objetivo.
Quanto maior e mais poderoso o modelo, maior é o aumento repentino nos recursos necessários para executá-lo.
02 O gargalo foi movido
Modelos com trilhões de parâmetros estão reescrevendo o significado de "poder de computação".
O Citigroup apontou que, durante a execução real desses modelos ultra grandes, cada vez mais tempo é gasto na transferência de pesos e dados de KV-cache entre a memória HBM e a rede interconectada de GPUs, em vez de nas próprias operações matriciais. O gargalo já passou de "se consegue calcular rápido" (FLOPs) para "se consegue mover os dados" — largura de banda da memória, interconexão de GPUs e fornecimento de energia.
A demanda por GPU permanece forte, e os aluguéis da arquitetura Blackwell aumentaram 27% desde o início do ano. Mas simplesmente acumular GPU já não é suficiente.
Alguns laboratórios já começaram a entrar diretamente no setor de geração de energia: a SpaceX investiu US$ 1 bilhão na compra de 1 GW de unidades móveis de turbina (15 de julho), e a Georgia Power assinou um acordo de serviço na mesma semana (22 de julho). Laboratórios de IA comprando equipamentos de geração de energia — algo quase impensável há um ano — está acontecendo agora.
Os preços dos modelos refletem diretamente a pressão da capacidade. O preço misto dos modelos de ponta na China subiu de 0,87 por milhão de tokens, aumentando 45% semanalmente e mensalmente, marcando a primeira grande flutuação em dois meses. O preço médio global dos modelos de ponta subiu 6,8% semanalmente e 11,3% mensalmente. EUA e Europa permaneceram relativamente estáveis (semanalmente -0,5%), mas também registraram aumento mensal de 4,1%.
Citibank avalia que, à medida que a infraestrutura incremental for sendo implementada, a pressão sobre os preços finalmente se aliviará. Nesse momento, dados valiosos e desempenho específico para tarefas constituirão uma vantagem competitiva mais duradoura do que o acesso à capacidade de processamento.
03 Agente escapando do sandbox
Os modelos estão ficando mais fortes. Mas os agentes que rodam nos modelos também estão se tornando mais perigosos.
O relatório do Citigroup usou uma expressão intrigante: o risco real de um agente de IA autônomo escapar do sandbox passou de "interromper o almoço" em abril para "infiltrar a infraestrutura da Hugging Face" em julho.
Quanto mais poderosos e普及 os modelos de código aberto, maior será a extensão dos riscos de segurança. O debate sobre a regulamentação da IA ainda está em andamento — a NVIDIA (24 de julho) e o secretário do Tesouro dos EUA, Bessent (22 de julho), fizeram declarações recentes — mas é difícil chegar a uma conclusão no curto prazo. Mesmo que o quadro regulatório ainda não tenha sido implementado, as empresas que mantêm a arquitetura de seus próprios modelos já enfrentam barreiras de conformidade mais altas.
Mais complicado ainda é que os próprios provedores que treinam esses modelos ainda não conseguem examinar completamente por que os modelos agem dessa maneira. O problema da explicabilidade ainda não foi resolvido.
Mas as preocupações de segurança não desaceleraram o processo de comercialização dos agentes. Dados da METR (21 de julho) mostram que a lacuna econômica entre agentes de IA e humanos está se reduzindo. À medida que os agentes se tornam mais autônomos e mais próximos da viabilidade econômica, o consumo de tokens continuará a acelerar — o que, por sua vez, aumenta a demanda por infraestrutura.
Quanto maior a capacidade, mais restritas as limitações. Quanto mais restritas as limitações, maior a demanda por infraestrutura. Esse ciclo não mostra sinais de desaceleração.
