Agente de IA replica software semelhante ao CUDA em 10 horas, gerando debate

icon MarsBit
Compartilhar
AI summary iconResumo
Uma startup chamada Infinity usou um agente de pesquisa de IA para desenvolver um software semelhante ao CUDA para a d-Matrix em 10 horas. O agente de IA, Ignition, gerencia geração de código, testes e otimização. Embora o projeto demonstre o crescente papel da IA no desenvolvimento de software, especialistas afirmam que o ecossistema completo do CUDA é difícil de substituir. A dominância do BTC permanece sob pressão, enquanto altcoins para acompanhar ganham tração no mercado de inferência.

CUDA foi mais uma vez quebrado...

Desta vez, o responsável é a IA criada diretamente pela NVIDIA.

Uma pequena empresa, fundada há apenas um ano, usou um agente de programação baseado em IA para desenvolver, em apenas 10 horas, um software "semelhante ao CUDA".

CUDA

Pare, pare, pare.

Você está dizendo que esse império de software construído pela NVIDIA ao longo de quase 20 anos foi simplesmente copiado??

CUDA

Além disso. DeepSeek Também está tentando escrever menos CUDA de baixo nível.

Eles já abriram o código de uma biblioteca de operadores GPU chamada TileKernels, escrita em TileLang, economizando muito trabalho de codificação manual em CUDA de baixo nível.

No entanto, não é a primeira vez que ouvimos uma "crise CUDA" semelhante.

De tempos em tempos, a CUDA é criticada, com afirmações recorrentes de que já foi substituída, superada ou que sua vantagem competitiva foi revogada…

Is that really true?

10 horas "recriar" CUDA

Ao mencionar NVIDIA, a primeira reação de muitas pessoas é a GPU.

H100, Blackwell, Rubin, aproveitando chips cada vez mais potentes, a NVIDIA capturou a maior parte dos benefícios desta onda de IA.

Mas a verdadeira vantagem difícil de superar da NVIDIA não é o hardware, mas o software.

Os chips podem ser comprados, os parâmetros podem ser acompanhados e o processo de fabricação também evolui. O que realmente torna difícil para os clientes deixarem a NVIDIA após o uso é o ecossistema de software inteiro construído em torno da GPU.

E o CUDA é o núcleo desse império de software.

CUDA, cujo nome completo é Compute Unified Device Architecture, foi desenvolvida por quase 20 anos sob a liderança do executivo da NVIDIA, Ian Buck.

É frequentemente chamado de linguagem de programação, mas com mais precisão, o CUDA é um conjunto completo de software construído em torno das GPUs da NVIDIA.

Se dividido simplesmente em três camadas, a mais inferior é a camada de núcleo, composta pelo Kernel, compilador e tempo de execução que diretamente fazem o chip funcionar.

No centro estão bibliotecas de cálculo altamente otimizadas, como cuBLAS e cuDNN, além de ferramentas de depuração, validação e análise de desempenho.

Na parte superior, estão os frameworks de desenvolvimento como PyTorch e TensorFlow, a vasta quantidade de código e fluxos de trabalho acumulados pelas empresas, e o ecossistema de desenvolvedores que cresceu em torno do CUDA.

CUDA

Isso pode parecer um pouco abstrato, mas você pode imaginar as GPUs da NVIDIA como uma fábrica.

O CUDA na camada mais baixa é responsável por dizer à máquina como fazer cada passo, a camada intermediária fornece ferramentas de produção prontas, e a camada mais alta é um sistema de produção inteiro que vem funcionando há anos.

Então, para o cliente, o que está sendo comprado não é apenas uma placa da NVIDIA, mas uma fábrica pronta para uso.

Agora, um cara chamado Jeremy Nixon chegou com o AI Agent.

CUDA

Nixon é o fundador da startup de software de IA Infinity e anteriormente trabalhou como pesquisador no Google Brain.

Sua equipe desenvolveu um agente de pesquisa em IA chamado Ignition, especificamente para escrever software de baixo nível para diferentes chips de IA.

Ele pode gerar Kernel de GPU, executar testes, identificar erros, medir desempenho e reescrever automaticamente o código com base nos resultados.

Engenheiros humanos são responsáveis por definir a direção estratégica; o restante do trabalho tedioso e exigente é deixado para os Agentes repetirem em ciclos.

Assim, a Infinity construiu um software semelhante ao CUDA para a startup de chips de IA d-Matrix usando o Ignition.

Levou apenas 10 horas.

Huh??

O código de baixo nível que antes exigia ajustes repetidos por engenheiros de software de chips agora realmente pode ser entregue à IA?

CUDA

Não se pode dizer que é totalmente炒作.

O Agente de IA é realmente adequado para tarefas de programação com feedback claro.

Se o código pode ser compilado, se os resultados estão corretos e se o desempenho melhorou pode ser verificado por meio da execução real.

Assim, o agente pode formar um ciclo completo:

Escrever código → compilar → executar → testar correção e desempenho → modificar com base no feedback

No entanto, o Infinity se concentra principalmente na primeira camada da CUDA: gerar e otimizar Kernels de inferência para diferentes chips e construir capacidades de software de baixo nível em torno desses Kernels.

Ele está desenvolvendo uma biblioteca de inferência universal para vários chips, mas isso não significa que ele replicou, em 10 horas, o ecossistema completo acumulado pelo CUDA ao longo de quase 20 anos.

Mas...

Mas!

Você realmente não precisa copiar um CUDA para arrecadar 15 milhões de dólares em financiamento.

CUDA

The company's current valuation has also reached $100 million.

Não sei se há uma ameaça à NVIDIA, mas o capital certamente está comprando. (doge)

No lado de raciocínio, o segundo front foi iniciado!

Se os agentes de IA forem as armas para atacar a cidade, o mercado de raciocínio é a brecha na muralha.

O cálculo dos grandes modelos é dividido principalmente em duas etapas:

O treinamento envolve criar um modelo e exige milhares de GPUs trabalhando juntas por vários meses; a inferência usa o modelo já treinado para responder perguntas e pode ser executada com um pequeno cluster ou até mesmo uma única GPU.

No lado do treinamento, a CUDA ainda é praticamente insolúvel.

O treinamento em larga escala é extremamente sensível ao desempenho, estabilidade e cooperação do cluster. A comunicação entre chips, o gerenciamento da memória gráfica e a recuperação após falhas no programa — qualquer perda de eficiência, quando amplificada em milhares ou até dezenas de milhares de chips, se torna tempo e custo reais.

Portanto, as empresas costumam ser extremamente conservadoras ao escolher uma plataforma de treinamento.

Mesmo que outros chips tenham parâmetros aparentemente bons, se o software não for suficientemente maduro ou o cluster não for estável, os custos de hardware economizados provavelmente serão duplicados em custos de desenvolvimento e experimentação.

Mas no lado de inferência, as regras do jogo mudaram.

Marshall Choy, chefe de negócios da empresa sul-coreana de chips de IA Rebellions, acredita que:

No lado de inferência, a CUDA já não é o fator determinante. Será uma competição entre software de código aberto.

CUDA

Por que todos os concorrentes estão focados na inferência?

Porque o treinamento se preocupa com "desempenho extremo", enquanto a inferência se preocupa com "o custo de cada resposta".

O treinamento exige milhares de GPUs trabalhando em conjunto, enquanto a inferência pode ser dividida em pequenos clusters ou até mesmo em uma única GPU; não se ousa trocar os chips no treinamento, mas é possível na inferência.

De qualquer forma, desde que seja rápido e barato, os clientes estarão dispostos a experimentar.

Mais importante ainda, o software de inferência pode operar em vários chips. Se o framework de inferência suportar múltiplos chips, os usuários poderão alternar entre diferentes hardware sem precisar reescrever o código—

O maior lock-in da CUDA foi anulado.

Isso deixa espaço para chips de inferência dedicados.

As tarefas de inferência não exigem todas as capacidades do CUDA, desde o treinamento até a coordenação em cluster. Chips projetados especificamente para modelos e cenários particulares, desde que consigam operar mais rápido, mais barato ou com menor consumo de energia, têm a oportunidade de conquistar uma fatia do mercado da NVIDIA.

Por exemplo, a d-Matrix é uma empresa de chips cujo foco principal é a inferência.

CUDA

A empresa foi fundada em 2019 e se especializa em chips de inferência de IA generativa.

O cofundador e CEO Sid Sheth lembrou que eles perceberam cedo que a oportunidade trazida pela inferência de IA acabaria superando o treinamento.

O software semelhante ao CUDA desenvolvido pela Infinity com um AI Agent em 10 horas atende aos chips de inferência da d-Matrix.

Assim, a história completa do "evento de 10 horas" se encaixa:

Novos chips desejam entrar no mercado de inferência, mas carecem de software maduro; AI Agent gera e otimiza rapidamente Kernels subjacentes, reduzindo o tempo de adaptação, que antes poderia levar meses ou até anos, para horas ou dias.

Sid também disse abertamente:

Embora a NVIDIA mantenha a liderança no treinamento, sua vantagem competitiva na inferência foi enfraquecida.

CUDA

Não é apenas a d-Matrix que está observando essa lacuna.

Rebellions e d-Matrix, focadas em raciocínio; Cerebras, apostando em chips em nível de wafer; Inferentia da Amazon, TPU do Google e MI300X da AMD...

Várias fabricantes de chips e gigantes de computação em nuvem já se posicionaram no mercado de inferência, prontas para arrancar uma fatia da NVIDIA.

Para essas empresas, não é necessário substituir imediatamente a NVIDIA.

Eles precisam apenas provar que, em certas tarefas de raciocínio, é possível executá-las mais rapidamente ou com menor custo sem depender do conjunto completo de hardware e da ecossistema CUDA da NVIDIA.

Isso é suficiente.

A vantagem competitiva da NVIDIA, será que foi ou não颠覆?

A resposta pode ser... ainda está longe.

Como mencionado anteriormente, as 10 horas de reescrita referem-se ao código de adaptação de um único chip, enquanto o ecossistema CUDA possui 20 anos de acúmulo de bibliotecas, ferramentas de depuração, comunidade e milhões de desenvolvedores.

Isso não é algo que pode ser facilmente substituído.

Mais importante ainda, o código poder ser gerado não significa que possa ser usado.

Bing Xu, fundador da INT21, anteriormente dirigiu a empresa de software de chips de IA HippoML, adquirida pela NVIDIA, e deixou a NVIDIA apenas em abril deste ano.

CUDA

Sua avaliação é: o agente pode gerar grande quantidade de código em pouco tempo, mas a validação é o maior gargalo.

Gerar dez mil linhas de código com IA é rápido, mas "provar que essas dez mil linhas calculam corretamente e funcionam de forma estável em todos os casos limite" é extremamente lento.

O ativo mais profundo da CUDA é exatamente sua cadeia de ferramentas de verificação — por isso, ele acredita que, na era dos Agentes, o ecossistema de verificação se tornará a próxima barreira competitiva da CUDA.

Chris Lattner, cofundador e CEO da Modular, também deu uma resfriada.

CUDA

He believes the improvements brought by coding agents are incremental, and "the hype has been greatly exaggerated."

Há três razões: primeiro, escrever código é apenas uma pequena parte da engenharia de software; a otimização para produção é que determina o desempenho do chip e, diretamente, o custo de execução da IA;

Em segundo lugar, o software de chips é um campo nicho e elitista, com muito menos código aberto do que o desenvolvimento de aplicativos; há poucos dados de treinamento disponíveis para a IA nessa área;

Terceiro, o custo de migração de milhões de linhas de código existente ainda existe; isso não é um problema técnico, mas sim uma decisão organizacional.

Um ponto facilmente ignorado é que a NVIDIA também está usando IA.

O vice-presidente do ecossistema de desenvolvedores da NVIDIA, Ankit Patel, disse:

Também estamos usando AI Agent para desenvolver CUDA mais rapidamente e validar em maior escala.

Usar sua própria lança para atacar o escudo do outro também reduz a vantagem relativa do atacante.

Bing Xu resumiu: o resultado desta batalha depende da velocidade com que os concorrentes conseguem alcançar a NVIDIA, em comparação com a velocidade de autoiteração da NVIDIA.

Mas é evidente que o maior fabricante global de chips "não está dormindo nem ficando no lugar".

Em geral, no curto prazo, a vantagem competitiva da NVIDIA permanece intacta, mas as mudanças ocorrerão primeiro silenciosamente no lado de inferência.

A verdadeira incerteza de longo prazo é que o fosso competitivo está sendo transferido do "estoque de código" para o "ecossistema de validação e otimização".

Quem ocupar primeiro a nova posição será o próximo vencedor.

Link de referência: [1] https://www.businessinsider.com/nvidia-cuda-new-threats-ai-coding-agents-2026-8

Este artigo é do número de assinantes do WeChat "Quantum Bit", autor: Ting Yu

Aviso legal: as informações nesta página podem ter sido obtidas de terceiros e não refletem necessariamente os pontos de vista ou opiniões da KuCoin. Este conteúdo é fornecido apenas para fins informativos gerais, sem qualquer representação ou garantia de qualquer tipo, nem deve ser interpretado como aconselhamento financeiro ou de investimento. A KuCoin não é responsável por quaisquer erros ou omissões, ou por quaisquer resultados do uso destas informações. Os investimentos em ativos digitais podem ser arriscados. Avalie cuidadosamente os riscos de um produto e a sua tolerância ao risco com base nas suas próprias circunstâncias financeiras. Para mais informações, consulte nossos termos de uso e divulgação de risco.