AMD adquire a Taalas para integrar pesos de modelos de IA em chips

iconBitPush
Compartilhar
AI summary iconResumo
A AMD adquiriu a startup de chips com sede em Toronto, Taalas, que incorpora pesos de modelos de IA diretamente no silício. O chip HC1 da Taalas, construído em 6nm da TSMC, executa o modelo Llama 3.1 8B da Meta a 17.000 tokens por segundo, superando o Nvidia H200 e o H100 em velocidade e eficiência energética. O chip utiliza um formato de 3 bits e atualiza-se em 8 semanas por meio de alterações em máscaras metálicas. A AMD planeja integrar os chips de inferência da Taalas à sua linha de GPUs para cargas de trabalho de IA. Esta notícia de IA + cripto surge em meio a dados inflacionários em mudança e crescente demanda por computação eficiente.

Autor: Xiao Bing

AMD adquire Taalas: chips de inferência começam a gravar pesos de modelos diretamente no silício


Em 6 de agosto, a AMD anunciou a aquisição da empresa de chips de Toronto, Taalas, cujo valor da transação não foi divulgado. Esta startup, fundada em 2023 e que arrecadou um total de $219 milhões em financiamento, fez algo que parece um pouco louco: gravar os pesos dos modelos de IA diretamente nas camadas metálicas do chip, criando chips dedicados que só conseguem executar um único modelo.

O GPU funciona armazenando os parâmetros do modelo na memória de alta largura de banda (HBM) e, durante a inferência, movendo repetidamente os dados para dentro e para fora das unidades de cálculo. Esse processo de "movimentação" consome grande quantidade de energia e tempo, sendo chamado pela indústria de "parede de memória". A abordagem da Taalas elimina completamente a movimentação, fixando os pesos diretamente nos transistores do chip, integrando armazenamento e cálculo em um único sistema.

O custo é que este chip só pode executar um modelo, mas o benefício é um salto de ordens de grandeza na velocidade e eficiência energética.

O que significa 17.000 tokens por segundo?

O chip de verificação técnica Taalas HC1 é baseado no processo de 6 nm da TSMC, com uma área de chip de 815 mm² e 53 bilhões de transistores; o modelo integrado é o Llama 3.1 8B da Meta.

Dados de desempenho do HC1: cerca de 17.000 tokens/segundo por usuário. Para comparação, o Nvidia H200 alcança cerca de 230 tokens/segundo e o H100 cerca de 150 tokens/segundo no mesmo modelo. Uma diferença de velocidade de 73 vezes, com apenas um décimo do consumo de energia.

Contabilidade econômica mais intuitiva: O custo de inferência declarado pelo Taalas é de aproximadamente 0,75 centavo de dólar por milhão de tokens (Llama 8B), enquanto as soluções GPU variam entre 20 e 49 centavos de dólar. Cada cartão HC1 consome 250 W; um rack padrão com arrefecimento por ar, contendo 10 cartões, requer apenas 12-15 kW, sem necessidade de refrigeração líquida, enquanto racks de GPU consomem tipicamente de 120 a 600 kW.

O analista da Forbes Karl Freund avaliou em fevereiro: “10 vezes mais rápido que a plataforma de inferência mais rápida (Cerebras Wafer-Scale Engine) e duas ordens de grandeza mais rápido que GPUs.”

Mas há algumas limitações importantes. O HC1 utiliza um formato de dados de 3 bits desenvolvido internamente pela Taalas, combinado com parâmetros de 6 bits, resultando em uma quantização muito agressiva, com perda de qualidade inequívoca em tarefas de raciocínio complexas. Os dados de 17.000 tokens/segundo vêm de um teste de referência do fornecedor com 1K de entrada/1K de saída e não representam o desempenho real em ambientes de produção. Além disso, o Llama 3.1 8B é um modelo lançado em meados de 2024, e versões quantizadas com 8B de parâmetros conseguem rodar até em um Raspberry Pi 5. O HC1 demonstra o potencial da arquitetura, e não a competitividade de um produto maduro.

O que fazer quando o modelo for substituído?

Gravar o modelo no chip, a questão mais intuitiva é: e se o modelo for atualizado? O chip fica inútil?

A resposta de Taalas foi: não será descartado. O ciclo de design tradicional de ASIC leva mais de dois anos. A Taalas desenvolveu um processo de design automatizado que requer apenas a modificação de poucas camadas metálicas no topo do chip para compilar um novo modelo em um novo chip, com um ciclo de aproximadamente 8 semanas. A empresa previu, em seu modelo de custos, os custos de três atualizações de chip dentro de um ciclo de vida de quatro anos.

Esta resposta pode aliviar parte da ansiedade, mas não pode eliminá-la completamente.

A flexibilidade da GPU reside no fato de que a mesma placa pode executar o Llama hoje, o Claude amanhã e um novo modelo ainda não lançado depois disso. O chip da Taalas não consegue fazer isso. Se um cliente precisar de vários modelos simultaneamente (o que é extremamente comum em ambientes de produção), será necessário equipar cada modelo com um chip diferente, aumentando a complexidade de gerenciamento de estoque e operação.

HC2 já está em desenvolvimento, com o objetivo de um modelo de aproximadamente 20 bilhões de parâmetros, utilizando ponto flutuante de 4-bit para aumentar a precisão. A Taalas originalmente planejava suportar modelos de ponta até o final de 2026.

A aquisição da AMD trouxe sinergia entre a linha de produtos Instinct GPU e o sistema de rack Helios, permitindo que os clientes usem GPUs para cargas de trabalho variáveis e chips Taalas para inferência de modelo único estável e de alta frequência.

Corrida armamentista de chips de inferência

A AMD adquiriu a Taalas, o que representa o mais recente acordo na onda de aquisições de chips de inferência nos últimos oito meses, no contexto do setor.

Em dezembro de 2025, a Nvidia adquiriu a Groq por 20 bilhões de dólares americanos, obtendo a arquitetura de inferência de baixa latência baseada em SRAM.

Em maio de 2026, a Cerebras fez IPO com uma capitalização de mercado de aproximadamente US$ 56 bilhões, tornando-se o maior IPO tecnológico desde a Snowflake em 2020.

Em junho, a Etched encerrou mais de dois anos de inatividade, anunciando que seu primeiro chip dedicado a Transformers foi produzido com o processo N4P da TSMC e possui contratos com clientes superiores a US$ 1 bilhão. Relata-se que a Intel assinou uma carta de intenção de aquisição com a SambaNova, e a Qualcomm está em contato com a Tenstorrent.

Essas negociações apontam para a mesma conclusão: o raciocínio está se tornando o principal campo de batalha para gastos em capacidade de IA.

Previsões da indústria indicam que, em 2026, a inferência representará dois terços dos gastos em computação de IA, e até 2030, ASICs dedicados à inferência podem capturar 45% do mercado de inferência. As GPUs da Nvidia ainda dominam o lado de treinamento, mas sua arquitetura genérica enfrenta desafios de chips dedicados de várias direções no lado de inferência.

Taalas está na extremidade mais extrema desse espectro: ele abre mão até mesmo da generalização de um "modelo de classe", desenvolvendo diretamente um chip dedicado a um "único modelo".

Groq substitui HBM por SRAM para contornar o parede da memória, Cerebras usa área em nível de wafer para superar brutalmente, Etched otimiza apenas para a arquitetura Transformer, e a aposta da Taalas é ainda mais ousada: ela aposta que os modelos de IA gradualmente se estabilizarão, assim como os protocolos de comunicação acabam convergindo para poucos padrões. Quando os modelos não forem mais substituídos mensalmente, fabricar um chip dedicado para cada um dos poucos modelos mais populares torna-se economicamente viável.

O modelo de aposta vai “congelar”

O vice-presidente sênior da AMD, Vamsi Boppana, disse no anúncio que o objetivo da aquisição é fornecer aos clientes "a melhor solução de computação para cada carga de trabalho de IA". Essa frase, traduzida em termos de estratégia competitiva, significa: GPUs para flexibilidade, chips Taalas para eficiência extrema, com os clientes combinando conforme necessário.

A validade deste raciocínio depende de uma suposição central: se o ciclo de atualização dos modelos de IA irá desacelerar.

Se grandes modelos continuarem a receber atualizações arquiteturais a cada alguns meses, gravar pesos em silício será como derramar concreto sobre areia movediça — o chip ainda não terá recuperado o investimento quando o modelo já estiver obsoleto. Mas se a capacidade dos modelos tender a convergir e modelos líderes servirem de forma estável por um ou dois anos tornar-se o normal, chips dedicados no estilo Taalas se tornarão tão comuns quanto os chips de baseband da indústria de comunicações, passando de experimentos frenéticos a escolhas óbvias.

Olhando para os últimos 12 meses, o ritmo das atualizações do modelo realmente apresentou mudanças sutis. O intervalo entre as versões da série Llama, de 3.1 para 3.2 e depois para 4, está se alongando, enquanto as mudanças arquiteturais no GPT, de 4 para 4o e depois para 5, estão se reduzindo. Muitos novos modelos estão sendo desenvolvidos por meio de distilação, quantização e fine-tuning em arquiteturas existentes, e a iteração dos modelos base está desacelerando.

Se essa tendência continuar, Taalas apostou corretamente.


Twitter:https://twitter.com/BitpushNewsCN

Grupo de discussão do BitPush no TG: https://t.me/BitPushCommunity

Assine o BitPush no TG: https://t.me/bitpush

Observação: Todos os artigos da BitPush representam apenas a opinião dos autores e não constituem conselhos de investimento.
Aviso legal: as informações nesta página podem ter sido obtidas de terceiros e não refletem necessariamente os pontos de vista ou opiniões da KuCoin. Este conteúdo é fornecido apenas para fins informativos gerais, sem qualquer representação ou garantia de qualquer tipo, nem deve ser interpretado como aconselhamento financeiro ou de investimento. A KuCoin não é responsável por quaisquer erros ou omissões, ou por quaisquer resultados do uso destas informações. Os investimentos em ativos digitais podem ser arriscados. Avalie cuidadosamente os riscos de um produto e a sua tolerância ao risco com base nas suas próprias circunstâncias financeiras. Para mais informações, consulte nossos termos de uso e divulgação de risco.