[Guia] A velocidade de raciocínio do GPT-5.6 atinge impressionantes 750 tokens/segundo! Especialistas revelam que ele operará em 100 wafers. A IA passou de pensamento para aparição — a era da inteligência em tempo real realmente chegou?
De acordo com vazamentos de várias fontes, o GPT-5.6 estará logo disponível para todos.
Recentemente, diversos palpites sobre este modelo se tornaram virais no X.
Em 26 de junho, a OpenAI anunciou oficialmente a nova geração da família GPT-5.6.
E no blog oficial, há esta frase: A OpenAI planeja lançar este mês o novo modelo de ponta, GPT-5.6 Sol, no hardware personalizado da gigante de chips Cerebras, com uma velocidade de inferência impressionante de 750 tokens por segundo!

Ou seja, operações complexas de Agent que antes exigiam minutos de espera agora podem ser concluídas em um piscar de olhos.
Claramente, a OpenAI já deu um passo revolucionário no design conjunto de hardware e modelo.
Além disso, com a recente revelação do Jalapeño, o primeiro chip de inferência AI desenvolvido internamente da história, podemos perceber que a OpenAI tem a ambição de se tornar um império AI full-stack.
As artes marciais do mundo todo não podem vencer a velocidade: um ataque de 750 tokens/s
O que significa “750 tokens por segundo”?
Para humanos, isso equivale a ler e produzir aproximadamente 500 a 600 caracteres chineses em um segundo.
O texto que você vê diante de você, o GPT-5.6 Sol precisa de menos de um décimo de segundo para gerar.
No X, o conhecido desenvolvedor Caleb Shepherd expressou entusiasmo: “Isso é o que mais me entusiasma — o GPT-5.6 Sol rodando no Cerebras. Não apenas porque a velocidade de escrever código aumentou, mas porque a velocidade de uso dos computadores sofreu uma mudança qualitativa. Nós nunca mais precisaremos esperar dois minutos enquanto o AI clica em um botão.”

Por muito tempo, embora os grandes modelos tenham se tornado cada vez mais inteligentes, a “latência de inferência” permaneceu o maior gargalo para a implementação de tarefas de Agentes com múltiplos passos em interações em tempo real.
Quando os modelos atingem dimensões com trilhões de parâmetros, os clusters tradicionais de GPU frequentemente enfrentam gargalos físicos na comunicação entre nós (interconexão NVLink).
A resposta da OpenAI é: não faça o modelo se adaptar ao hardware; faça o hardware e o modelo se fundirem.
Com base nas informações preliminares divulgadas oficialmente, o GPT-5.6 Sol será disponibilizado em julho para clientes específicos em escala extremamente limitada, expandindo-se gradualmente à medida que a capacidade de produção aumentar.
Como muitos especularam online, este é absolutamente um serviço extremamente caro, projetado exclusivamente para empresas de alto nível dispostas a pagar por velocidade.

Como caber um monstro de 3 trilhões de parâmetros em um chip?
Quando a mensagem de 750 tokens/s foi divulgada, Peter Gostev, responsável pela LLM Arena, fez uma pergunta que deixou todos intrigados:
O que exatamente está acontecendo com o GPT-5.6 Sol na Cerebras? Pelo que sei, este parece ser o mesmo modelo completo (com capacidades multimodais, incluindo visão), e não uma versão reduzida como o anterior GPT-5.3-Codex-Spark, que tinha visão e contexto cortados.
Mas minha compreensão é que o chip único da Cerebras pode acomodar no máximo um modelo de 700 a 900 bilhões de parâmetros. Então, o modelo ficou menor? Ou há um novo tipo de chip que eu não conheço? Ou alguma nova tecnologia de cooperação entre múltiplos chips?

Essa dúvida imediatamente gerou uma série de discussões entre internautas.
Alguns brincam que todos estão realizando uma "auditoria forense de chips à meia-noite" e afirmam: "Se isso for realmente o mesmo modelo completo, é como se alguém tivesse forçado um superiate inteiro dentro de uma garrafa de vidro, sem te dizer como fizeram isso."
Em breve, o experiente especialista técnico Bleys Goodson apresentou uma análise técnica extremamente convincente—
GPT-5.6 Sol não é composto por um único chip, mas sim por 70 a 100 chips de wafer da Cerebras!

Estética de implantação extrema: “um wafer, uma rede”
Especialistas da indústria estimam que as especificações do GPT-5.6 Sol são extremamente grandes:
- Parâmetros totais: aproximadamente 3 trilhões
- Parâmetros de ativação: aproximadamente 150 bilhões
- Camadas de rede: aproximadamente 70 a 90 camadas
Para obter recursos de serviço de inferência saudáveis, a OpenAI e a Cerebras adotaram uma abordagem extremamente luxuosa e impressionante: implantar cada camada da rede neural em uma única wafer da Cerebras.

Como um internauta apontou, ao aumentar as etapas da pipeline, desde que você tenha suficientes wafers para conectá-las, teoricamente você pode escalar para modelos de qualquer tamanho, o que não afetará a velocidade de geração de tokens, podendo apenas ter um leve impacto no tempo para o primeiro token (TTFT).

Reestruturação de arquitetura com decisão corajosa — O cache KV leve forçado pela necessidade
No entanto, ter apenas uma quantidade massiva de wafers não é suficiente. Uma das principais características da arquitetura do chip Cerebras é possuir uma quantidade massiva de SRAM on-chip (memória de acesso aleatório estático), extremamente rápida, mas com capacidade extremamente valiosa.
Se a OpenAI usasse, como no passado, o tradicional e pesado cache KV no GPT-5.6 Sol, essa largura de banda cara de SRAM seria imediatamente esgotada.
Isso leva à mudança estratégica mais central desta parceria: a reestruturação do modelo em torno de hardware específico.
Bleys Goodson observou que, dado o envolvimento profundo da OpenAI no design colaborativo de hardware, é altamente provável que eles tenham abandonado o esquema tradicional de cache de atenção em favor de um design mais avançado e leve.
As opções mais prováveis incluem:
Arquitetura semelhante ao DeepSeekV4: otimização extrema do uso de cache.
Projeto híbrido SSM: Integrar modelos de complexidade temporal linear, como Mamba, com Transformer para eliminar completamente o peso histórico do KV Cache.
Além disso, o conhecido desenvolvedor John Lam também fez uma suposição surpreendente — o desacoplamento da atenção e do FFN.

Ele especula que a OpenAI pode estar usando GPUs tradicionais para processar cálculos de atenção e grandes wafers da Cerebras para forçar intensamente os cálculos da parte da rede neural feedforward.
Isso não é nada infundado. Os internautas rapidamente descobriram os detalhes da implantação do Kimi K2.6 mencionados anteriormente pelo Cerebras em seu blog:
A Cerebras armazena os pesos originais do Kimi K2.6 em 4-bit no sistema CS-3, enquanto realiza cálculos em ponto flutuante de 16-bit para garantir precisão. Os pesos são distribuídos em múltiplos wafers, e os valores de ativação são transmitidos em fluxo entre wafers. A comunicação totalmente interconectada entre camadas depende inteiramente da estrutura de rede no wafer, com largura de banda mais de 200 vezes superior à do NVLink no Nvidia NVL72! Combinando operadores personalizados e decodificação especulativa, eles conseguem executar modelos MoE com trilhões de parâmetros a uma velocidade próxima a 1000 tokens/s.

As especificações oficiais mostram que o revolucionário sistema CS-3 não apenas possui velocidade inigualável, mas também permite expandir facilmente modelos de até 24 trilhões de parâmetros em um único dispositivo lógico!

Como alguém exclamou: “Se isso for realmente a versão completa do Sol rodando no Cerebras, então o limite superior pré-suposto para o tamanho dos modelos foi diretamente quebrado esta noite.”
A verdadeira carta na manga — OpenAI lança pela primeira vez o chip próprio «Jalapeño»
E pouco antes, a OpenAI lançou oficialmente seu primeiro chip desenvolvido internamente — Jalapeño.

O lançamento deste chip explica diretamente a lógica profunda por trás da parceria entre a OpenAI e a Cerebras: por meio da exploração em hardware de inferência de ponta de terceiros, a OpenAI compreendeu plenamente os pontos críticos e o valor da arquitetura dedicada de inferência, transformando-os em uma plataforma subjacente sob seu próprio controle.
Jalapeño é uma das variedades mais suaves de pimenta mexicana. A OpenAI a escolheu como nome, claramente indicando que isso é apenas um aperitivo.
Este chip é um ASIC personalizado projetado especificamente para inferência de grandes modelos. Desde a primeira linha desenhada, cada transistor foi otimizado para uma única finalidade: executar grandes modelos.
Surpreendentemente, o Jalapeño não apenas roda modelos da própria OpenAI, mas sua arquitetura também é compatível com LLMs de toda a indústria, demonstrando grande ambição de plataforma.
Além disso, o design e a fabricação deste chip levaram apenas nove meses.
Por trás disso, há uma aliança industrial extremamente poderosa:
Arquitetura liderada: OpenAI projetou diretamente a arquitetura de base.
Implementação e interconexão de chips: A gigante de chips Broadcom oferece capacidades robustas de implementação e suporte técnico para interconexão de redes.
Integração do sistema: Celestica é responsável pela fabricação final das placas e pela integração física em rack.
Engolir toda a cadeia de valor, a ambição de império full-stack da OpenAI
Treinar o modelo sozinho, projetar o chip sozinho, otimizar a inferência sozinho e controlar a implantação sozinho.
Claramente, o objetivo da OpenAI é um vasto império de IA full-stack.
Mas a ambição da OpenAI é ainda mais louca do que a da Apple e do Google: eles possuem um superciclo sem precedentes — usar IA para acelerar a construção de infraestrutura de IA e, em seguida, usar essa infraestrutura mais poderosa para executar IA ainda mais avançada.
De acordo com o ambicioso plano divulgado pela OpenAI, os primeiros data centers de gigawatt serão implantados a partir do final de 2026 em parceria com parceiros-chave, como a Microsoft.
O consumo total de energia de uma cidade média será usado para alimentar os racks de inferência do Jalapeño e da próxima geração de chips de pimenta.
Prepare-se, em breve, estaremos prestes a ver o GPT-5.6 correr sobre o wafer da Cerebras a 750 Tokens/s, quebrando o encanto físico dos parâmetros e da velocidade de inferência.
Referência: https://x.com/bleysg/status/2073937651150029084
Este artigo é do número oficial do WeChat "Nova Inteligência", autor: Apocalipse da ASI; editor: Aeneas
