Um experimento minimalista: cálculo de hash power escrito em 2 horas
Quero tentar uma abordagem minimalista: definir 2 horas para escrever rapidamente um post. Muitas questões importantes não terei tempo para explorar a fundo, mas se não fizer isso, muitos dos tópicos que me interessam continuarão parados, sem progresso.
Hoje quero discutir a situação da capacidade de processamento dos laboratórios de IA nos próximos anos.
A receita da Anthropic aumentou 10 vezes, enquanto a capacidade de processamento aumentou apenas 3 vezes
A receita da Anthropic cresce dez vezes por ano. Nessa tendência, a receita da Anthropic até o final deste ano provavelmente ficará entre 100 e 150 bilhões de dólares. Se essa tendência persistir, eles precisarão alcançar uma receita de 1 trilhão de dólares até o final do próximo ano. Claro, não há razão absoluta para acreditar que a tendência continuará — isso, em última análise, depende da capacidade da IA. Mas, supondo que ela realmente persista, quais condições devem ser verdadeiras nesse mundo?
A capacidade de processamento do laboratório cresce três vezes por ano. Para um laboratório alcançar um crescimento de receita de 10 vezes com apenas um aumento de três vezes na capacidade de processamento, três condições devem ocorrer simultaneamente: primeiro, o aumento da margem de lucro do laboratório; segundo, a alta no preço da capacidade de processamento; terceiro, o laboratório alocar uma proporção maior de sua capacidade de processamento para inferência.
Minha compreensão é que esses três eventos estão ocorrendo basicamente ao mesmo tempo: primeiro, a margem de lucro da Anthropic aumentou de 40% em 2025 para possivelmente mais de 80% no negócio de inferência do Fable este ano (embora a margem de lucro da capacidade marginal possa ser diferente, abordarei isso posteriormente); segundo, o preço à vista da capacidade de computação aumentou mais de 40% desde o pico de fevereiro deste ano, e o aumento real pago pelos laboratórios pode ser ainda maior (detalharei isso depois); terceiro, segundo os dados da Epoch, cerca de um quarto dos gastos em capacidade da OpenAI em 2024 foram destinados à inferência, e agora essa proporção certamente está mais próxima de 50%, ou até mais.
O laboratório não quer seguir o caminho da "inferência"
Os laboratórios, na verdade, não querem seguir o terceiro caminho (destinar cada vez mais capacidade de processamento à inferência). Existe uma piada que acerta plenamente: o propósito da receita de inferência é convencer investidores a lhe dar mais dinheiro para comprar mais capacidade de processamento e treinar modelos maiores. Se você alocar a maioria da sua capacidade de processamento para inferência, está, em certa medida, declarando que o progresso da IA está estagnado — porque continuar investindo em treinamento já não é mais rentável, e seu negócio se torna basicamente um provedor de nuvem. Os grandes laboratórios não concordam com isso — eles acreditam que os modelos que estão implantando agora parecerão muito obsoletos daqui a um ano, e que atualmente estão nesse negócio para acumular casos de uso comerciais que sustentem o treinamento contínuo de modelos mais inteligentes.
O aumento de preço é a resposta mais provável
Então restam dois caminhos: um, aumentar a margem de lucro dos laboratórios; dois, tornar a capacidade de processamento mais cara. Se as duas ou três principais laboratórios estiverem muito à frente da concorrência, o primeiro caminho será mais significativo. No mercado competitivo, a margem de lucro depende de quanto você é melhor do que a segunda melhor opção. Para que o primeiro efeito domine, a margem de lucro precisa atingir mais de 90% até o final do próximo ano. Isso me parece absurdo. Mas realmente acho possível que a receita dos laboratórios de IA continue crescendo a uma velocidade impressionante.
Portanto, explicar como o mundo se torna real onde a receita cresce loucamente para 1 trilhão de dólares até o final do próximo ano, resta um último efeito: o aumento drástico no preço da capacidade de processamento. Como disse, isso já começou a acontecer. Se olharmos para o tipo de capacidade que os laboratórios realmente precisam, o aumento de preço será ainda mais impressionante — eles claramente não podem depender de instâncias spot; precisam garantir a segurança dos pesos dos modelos e dos dados dos usuários, além de ter escala suficiente para obter boa utilização e flexibilidade. Veja o quão louco é esse mercado: o preço que o Google e a Anthropic pagam para alugar capacidade da SpaceX. Relatou-se que o Google gasta US$ 900 milhões por mês para alugar 110 mil GPUs, uma mistura de GB200 e GB300. Isso equivale a aproximadamente o dobro do preço spot dessas GPUs. E o próprio preço spot atual já está 40% acima do que era em fevereiro.
Quero enfatizar uma conclusão central: à medida que os modelos de IA se tornam mais poderosos, o valor gerado pela mesma quantidade de poder de computação também aumenta. Se um engenheiro de software verdadeiramente capaz, com nível humano, pudesse operar em um dispositivo da classe H100, com base nos salários de mercado atuais para engenheiros de software, o aluguel anual desse H100 deveria exceder 250 mil dólares — 15 vezes o preço à vista atual.
O que acontecerá se a capacidade de mineração ficar mais cara?
Claro, se de repente surgirem 10 milhões de engenheiros de software, o valor marginal dos engenheiros naturalmente cairá, portanto, aquele H100 talvez não gere realmente 15 vezes a receita atual. Mas na verdade, não tenho certeza se esse raciocínio é válido. Se aplicarmos esse argumento a seres humanos em vez de IA, isso seria o clássico "erro da quantidade de mão de obra". Economistas geralmente concordam que imigrantes altamente qualificados, a longo prazo, não reduzem os salários, pois a especialização e a inovação aumentam o valor da mão de obra. Talvez esta vez o choque na oferta de mão de obra seja tão grande e rápido que faça essa regra empírica falhar. Mas se acreditarmos no julgamento da economia padrão sobre a mão de obra, então o valor marginal da mão de obra (e o preço marginal da capacidade de processamento) deveria permanecer em níveis surpreendentemente altos.
O que vai acontecer neste mundo?
Os modelos líderes estão cada vez mais capazes de extrair valor da capacidade de processamento, tornando mais difícil a追赶. Se, até 2028, a engenharia de software já estiver automatizada e o preço da capacidade de processamento for 15 vezes maior do que hoje, será extremamente difícil competir com os principais laboratórios por capacidade de processamento sem nenhuma receita.
Se você conseguir treinar o modelo mais excelente e mais eficiente, a margem de lucro que poderá cobrar será muito maior do que hoje. Este é o efeito Alchian-Allen: quando um custo fixo é adicionado a dois bens de qualidade diferente, o de maior qualidade torna-se relativamente mais vantajoso, deslocando a demanda para ele. Quando o preço por hora do H100 subir para 20 dólares, usar um modelo mais fraco e menos eficiente torna-se extremamente caro e insensato — pois você precisará consumir mais tokens e executar mais poder de computação caro para obter o mesmo resultado. Portanto, quem conseguir treinar um modelo de topo mais econômico em termos de poder de computação poderá cobrar uma forte premium. Já que o poder de computação subjacente já custa tanto, por que não gastar um pouco mais e usar o modelo mais eficiente que opera com o mesmo poder de computação?
Muitas das aplicações de IA atualmente populares serão eliminadas pelo preço. A IA agora é relativamente barata, pelo menos mais barata que mão de obra humana, em parte porque ainda não consegue realizar muitas coisas que humanos de alto nível conseguem. Um dia, isso não será mais verdade. Nesse momento, produzir conteúdo de baixa qualidade em vídeos curtos com GPU será tão caro que não valerá a pena.
Lições da história: até as previsões de escassez podem estar erradas
No entanto, esse tipo de previsão é semelhante às previsões erradas históricas sobre escassez. Penso na aposta entre Simon-Ehrlich: Paul Ehrlich apostou que, na década anterior a 1990, o preço de uma cesta de commodities aumentaria, e não diminuiria. Essa aposta é bastante famosa em discussões de economia popular, pois supostamente refutou a visão de mundo malthusiana de Ehrlich — ele subestimou o papel dos sinais de mercado e da inteligência humana na economia de recursos escassos (embora algumas análises indiquem que, se a aposta fosse feita em outra década, Ehrlich venceria).
Quão baixa é a elasticidade da oferta de poder de mineração?
Suponho que o referencial de commodities não seja adequado para a capacidade de processamento, pois a elasticidade da oferta de capacidade de processamento é muito menor do que a da mineração de metais e sua capacidade de absorver choques de demanda em larga escala ou encontrar alternativas é muito mais fraca. O crescimento anual de 3 vezes da capacidade de processamento é obtido pela multiplicação de três fatores: 1,4 vezes provenientes da Lei de Moore, 1,2 vezes provenientes da construção de novas fábricas de wafers (limitada até 2030 pela oferta de equipamentos EUV) e 1,8 vezes provenientes da AI deslocando quotas de wafers de processo avançado de outros dispositivos (este fator atingirá um limite por volta de 2027, quando a proporção de wafers N3 dedicados à AI aumentar de 60% para 86%). Nenhum desses três fatores pode ser facilmente aumentado, e o último atingirá seu pico em um ou dois anos com a saturação das quotas de wafers.
Final: A capacidade de mineração certamente ficará mais barata novamente, mas não agora
O que quero destacar é que, em algum momento no futuro, a capacidade de processamento se tornará barata novamente. Um dia, robôs poderão transformar diretamente a areia de sílica das praias e os minérios de cobre subterrâneos em computadores, e nesse momento, o preço da capacidade de processamento provavelmente retornará a níveis próximos aos custos das matérias-primas e das ferramentas. O que estou discutindo agora é apenas esta fase atual — a capacidade de IA está crescendo apenas 3 vezes por ano, uma taxa que simplesmente não acompanha o efeito de pressão sobre os preços causado pelo aumento anual de valor da IA.
Por falar nisso, a receita da Anthropic cresce 10 vezes por ano, enquanto a capacidade de computação cresce apenas 3 vezes — isso indica que o negócio de modelos apresenta economias de escala extremamente fortes. Logicamente, isso faz sentido — ao treinar um modelo, você paga um custo de aprendizado único, que pode ser distribuído entre todos os usuários (ao contrário da força de trabalho humana, em que cada instância precisa ser treinada do zero). Não quero viver em um mundo onde a inteligência apresenta tais economias de escala intensas (porque temo a concentração de poder). Mas a realidade parece ser exatamente essa.
Autor: Dwarkesh Patel; Tradução: Deep潮 TechFlow
