Thinking Machines lança o modelo aberto Inkling-Small, com 276 bilhões de parâmetros totais e 12 bilhões de parâmetros ativados, utilizando arquitetura MoE e design nativamente multimodal. O modelo supera a versão inicial do Inkling em benchmarks de matemática, raciocínio e codificação de agentes, utilizando apenas um quarto da sua escala. O desempenho superior foi alcançado por meio de distilação e duas semanas de treinamento por aprendizado por reforço, reduzindo significativamente a barreira de entrada para inferência e permitindo que equipes de médio porte personalizem o modelo. Apesar de quatro dos seis cofundadores já terem deixado a equipe, a equipe mantém um ritmo frequente de lançamentos mesmo em meio à instabilidade.Autor e fonte do artigo: 36Kr
Thinking Machines lança o modelo aberto Inkling-Small, superando a versão original
Após o lançamento do primeiro modelo Inkling, um novo AI está dominando as redes!
Hoje, a Thinking Machines lançou oficialmente seu segundo modelo de destaque — Inkling-Small.
276 bilhões de parâmetros totais, 12 bilhões de parâmetros ativados, multimodal nativo, contexto de 1 milhão de tokens

Há meio mês, o primeiro Inkling de 975B de código aberto foi lançado, causando grande impacto no mundo da IA.
Inkling-Small, usando apenas um quarto da quantidade, alcançou diretamente um desempenho superior ao do "irmão maior de trilhões".


No ARC-AGI-2, o Inkling-Small atualizou o SOTA de código aberto
Revendo os últimos dias da Thinking Machines, a trama foi digna de muitas reviravoltas.
Dois dias após o anúncio oficial da saída de Wang Li, cofundadora, a OpenAI confirmou seu retorno — liderando o esforço em "Autoaperfeiçoamento Recursivo" (RSI).

No terceiro dia, a empresa, que acabara de perder um de seus principais líderes, lançou diretamente os "pesos completos" do novo modelo.
Inkling-Small estreia agora, 276B supera trilhões
Na descrição do blog oficial, o Inkling-Small é um modelo de arquitetura MoE, com 276 bilhões de parâmetros totais e 12 bilhões de parâmetros ativados por inferência.
Em comparação com o Inkling original, o tamanho foi reduzido diretamente para um quarto.
Como disse o grande especialista em PyTorch, Horace He: "O Inkling-Small nem precisa do esforço de toda a vila; pode simplesmente continuar usando a tecnologia anterior."
O mais robusto é que, embora o volume tenha diminuído, a capacidade geral aumentou significativamente.

Em benchmarks de matemática, raciocínio, codificação de agentes e multimodal, o Inkling-Small é comparável e até supera o Inkling e o DeepSeek V4 Flash.

Nos três indicadores principais — HLE, Terminal-Bench e IFBench — o Inkling-Small oferece desempenho superior por FLOP em comparação ao Inkling.
Pode-se ver que a curva do Inkling-Small permanece sempre abaixo da curva do Inkling.


Na área multimodal, também quase não ficou para trás: compreensão de gráficos, raciocínio visual, compreensão de voz e raciocínio em longos áudios. O Inkling-Small alcançou resultados "próximos" da versão original nos testes, com um custo muito menor.
Outros resultados de benchmark são os seguintes:

Um modelo com apenas um quarto do tamanho dominou seu predecessor em inferência e tarefas de agentes.
Detalhes pós-treinamento, totalmente divulgados
Quanto a como fazer isso, o oficial detalha muito bem o método, sendo essenciais dois passos.

O Inkling-Small começou o treinamento depois do Inkling, então acabou absorvendo todos os erros da rodada anterior—
A proporção dos dados de pré-treinamento foi alterada e a receita de aprendizado de máquina foi refinada novamente.
Mais importante, são duas etapas.
Passo 1: Use o Inkling como professor para a destilação on-policy e gere primeiro um checkpoint de visualização.
Na segunda etapa, o agente executou treinamento de aprendizado por reforço por duas semanas inteiras a partir deste ponto de verificação, resultando no cenário em que o "aluno superou o professor".
Em apenas duas semanas, recuperou a diferença e até ultrapassou.
Isso significa que a Thinking Machines estabeleceu diretamente uma linha de produção capaz de gerar modelos repetidamente. O primeiro modelo é uma obra; o segundo modelo é uma prova de capacidade produtiva.
12 bilhões ativados são o verdadeiro ponto de virada
Para a grande maioria dos desenvolvedores, o que realmente importa é se eles conseguem usar.
O limiar original do Inkling é muito alto; o ponto de verificação BF16 exige no mínimo 2 TB de memória VRAM agregada—
A configuração de exemplo é de 8 B300 ou 16 H200; mesmo ao trocar pela versão quantizada NVFP4, ainda são necessários pelo menos 600 GB.

Inkling-Small puxou esse limite bem para baixo.
A afirmação da LMSYS é direta: 276B parâmetros totais com 12B ativados é o ponto ideal para aprendizado por reforço, tornando LoRA e treinamento de parâmetros completos "acessíveis".
Antes, apenas grandes empresas podiam personalizar modelos; agora, até uma equipe de médio porte tem a oportunidade de treiná-lo realmente como seu próprio produto.
Testes práticos mostram que, em um mesmo ambiente com 8 B200, TP8, NVFP4 e batch size 1, executar o Inkling-Small com SGLang alcança 648 tok/s de decodificação com o DSpark ativado e 288 tok/s sem ele.

Quatro dos seis co-fundadores saíram, e o modelo está se acelerando cada vez mais.
Em fevereiro do ano passado, a Thinking Machines começou com um impacto impressionante, apresentando uma lista de seis membros do "sonhado time da OpenAI":
Mira Murati, John Schulman, Barret Zoph, Weng Li, Andrew Tulloch, Luke Metz.
Na época, eles tinham o roteiro absurdo de um financiamento semente de US$2 bilhões e uma avaliação de US$120 bilhões.
Quem poderia imaginar que o financiamento de US$ 5 bilhões em janeiro deste ano, que acabou não se concretizando, tornou-se o início da virada?
Atualmente, o grupo de seis restou apenas com Murati e Schulman.
Mais interessante ainda é que, dos quatro que saíram, Zoph e Metz retornaram à OpenAI, e agora Weng Li é o terceiro.
Uma empresa formada por "rebeldes" da OpenAI, cujos principais membros da equipe ainda não conseguiram escapar do campo gravitacional da OpenAI.

Mas o verdadeiramente dramático é a reação da equipe diante da turbulência.
Em 15 de julho, após 17 meses de silêncio, a Thinking Machines finalmente lançou seu primeiro modelo de grande porte, o Inkling.
Menos de duas semanas depois, Weng Li anunciou sua saída; apenas três dias depois, um segundo modelo aberto com peso completo foi lançado.
Os talentos estão saindo em ritmo acelerado, e os modelos estão avançando desenfreadamente.
Essas duas curvas opostas tornaram-se um dos momentos mais representativos da indústria de IA.
Talvez este seja o caminho inevitável para a ASI: não importa quão poucos permaneçam, a roda da máquina seguirá girando cada vez mais rápido.
Thinking Machines lança o modelo aberto Inkling-Small, com 276 bilhões de parâmetros totais e 12 bilhões de parâmetros ativados, utilizando arquitetura MoE e design nativamente multimodal. O modelo supera a versão inicial do Inkling em benchmarks de matemática, raciocínio e codificação de agentes, utilizando apenas um quarto da sua escala. O desempenho superior foi alcançado por meio de distilação e duas semanas de treinamento por aprendizado por reforço, reduzindo significativamente a barreira de entrada para inferência e permitindo que equipes de médio porte personalizem o modelo. Apesar de quatro dos seis cofundadores já terem deixado a equipe, a equipe mantém um ritmo frequente de lançamentos mesmo em meio à instabilidade.Fonte: Nova Inteligência
