A Nvidia está distribuindo modelos de IA como amostras gratuitas na Costco. A lógica é a mesma: uma vez que você experimentar o produto, voltará para comprar o hardware que o executa melhor.
A última versão da empresa, Nemotron 3.5 Lightning, é um modelo com 30 bilhões de parâmetros, lançado em 11 de agosto de 2026. Ele utiliza uma arquitetura Mixture of Experts (MoE) com aproximadamente 3 bilhões de parâmetros ativos, o que permite que seja executado em uma única GPU, suportando janelas de contexto de até 1 milhão de tokens. Isso representa uma quantia séria de capacidade para um modelo que você pode baixar da Hugging Face sem pagar nada.
O modelo de lâmina e barbear, potencializado
A Nvidia agora oferece inferência hospedada gratuitamente para mais de 100 modelos de IA por meio de suas APIs no build.nvidia.com. Desenvolvedores podem acessar esses modelos sem precisar inserir um cartão de crédito, testá-los com suas próprias cargas de trabalho e criar aplicações com base neles.
No início de 2026, a Nvidia lançou o Nemotron 3 Ultra, um modelo de 550 bilhões de parâmetros, juntamente com o Dynamo 1.0, software que supostamente aumenta o desempenho da GPU em até 7x.
Por que modelos abertos são importantes para o negócio de GPUs
A indústria de IA dividiu-se em dois campos principais. De um lado, estão empresas como OpenAI e Anthropic, que desenvolvem modelos fechados e proprietários atrás de paredes de pagamento por API. Do outro lado, está a Meta com sua série Llama e agora a Nvidia, impulsionando alternativas de pesos abertos que qualquer um pode baixar, modificar e implantar.
Os modelos são liberados sob licenças permissivas, abrangendo famílias inteiras como Nemotron e Cosmos. Eles são otimizados para formatos de hardware específicos da Nvidia, como o NVFP4, um formato de quantização projetado para chips da Nvidia.
Em agosto de 2026, a Nvidia também introduziu o NeMo Switchyard, uma ferramenta que roteia inteligentemente tarefas entre diferentes modelos para reduzir os custos de inferência.
