O Google lançou em 2 de setembro de 2026 o Gemini 3.8 Flash e o Gemini 3.8 Flash Cyber destinado a instituições de defesa cibernética confiáveis. A versão padrão possui contexto de 1 milhão de tokens, focando-se em programação, Agentes e tarefas de conhecimento especializado; nos testes divulgados pelo Google, alcançou 73,7% de desempenho em engenharia de software de longo prazo, próximo aos 74,0% do Claude Opus 5, e superou os modelos testados em Agentes financeiros, Agentes jurídicos e parte dos raciocínios integrados. A versão Cyber é capaz de identificar automaticamente vulnerabilidades e gerar patches: a taxa de sucesso nos testes internos do Google em 20 linguagens de programação excedeu 70%, e a equipe do Chrome recebeu 2,6 vezes mais patches corretos do que modelos comerciais grandes. O preço atual da API é de US$ 0,75 por milhão de tokens de entrada e US$ 3,75 por milhão de tokens de saída, mas o modelo troca desempenho por mais etapas de raciocínio e chamadas a ferramentas; avaliações independentes mostram que seu custo por tarefa é cerca de 40% maior do que o do 3.7 Flash. O sinal chave deste lançamento é que a capacidade de Agentes, anteriormente restrita a modelos旗舰 caros, está entrando em modelos acessíveis e escaláveis para trabalho, mas os dados de desempenho ainda se baseiam principalmente em testes do Google e parceiros, e a versão Cyber não está disponível para usuários comuns.Autor do artigo, fonte: DeepMind
Atualizado três vezes em seis semanas, o Google transformou o Flash no modelo principal
Gemini 3.8 Flash foi lançado apenas três semanas após o Gemini 3.7 Flash e é o terceiro modelo Flash lançado pelo Google em seis semanas.
No passado, “Flash” geralmente significava velocidade alta e baixo custo, mas capacidade claramente inferior aos modelos de topo. A posição do Gemini 3.8 está mudando: o Google ainda o classifica como um “modelo de trabalho” adequado para implantação em larga escala, mas agora destaca programação de longo prazo, chamadas contínuas de ferramentas e análise profissional como principais capacidades, em vez de limitá-lo a tarefas leves como bate-papo e resumos.
O novo modelo suporta entradas de texto, imagem, áudio, vídeo e PDF, com contexto de 1 milhão de tokens e saída máxima de 64 mil tokens, podendo invocar ferramentas de busca, funções e operações de computador. Ele já está oficialmente disponível, e não em pré-visualização de teste, e pode ser acessado por meio da Gemini API, Google AI Studio, Gemini Enterprise, Google Antigravity, aplicativo Gemini, modo AI da pesquisa e Google Sheets.
O agente hospedado pelo Google, Antigravity, também já adotou o 3.8 Flash por padrão. Isso indica que o modelo realmente visa agentes que exigem planejamento repetido, chamada de ferramentas, verificação de resultados e correção contínua, e não apenas respostas únicas.
The coding performance is now approaching that of expensive flagship models.
No teste de engenharia de software de longo prazo DeepSWE v1.1 divulgado pelo Google, o Gemini 3.8 Flash obteve 73,7%, superando o 3.7 Flash com 65,3% e o GPT-5.6 Sol com 72,7%, e ficando apenas 0,3 pontos percentuais abaixo do Claude Opus 5 com 74,0%.
Este tipo de teste exige que o modelo acesse um repositório de código real, compreenda as relações entre vários arquivos, localize problemas e realize modificações que passem nos testes. É mais próximo do trabalho real de um agente de programação do que gerar independentemente uma função única.
No Vals Finance Agent v2, o 3.8 Flash obteve 61,4%, enquanto os 3.7 Flash, Claude Opus 5 e GPT‑5.6 Sol testados obtiveram 59,0%, 58,6% e 53,8%, respectivamente.
No teste do Agente Jurídico Harvey, o Flash 3.8 obteve 10,0%, acima do 8,8% do Flash 3.7, 6,7% do Claude Opus 5 e 2,5% do GPT-5.6 Sol. No entanto, todos os modelos tiveram pontuações absolutas muito baixas nessa avaliação; estar em primeiro lugar não significa que já consigam lidar confiavelmente com tarefas jurídicas complexas.
No teste de raciocínio interdisciplinar HLE-Verified, o 3.8 Flash obteve 54,9%, enquanto o GPT‑5.6 Sol e o Claude Opus 5 obtiveram 54,5% e 54,4%, respectivamente; a diferença entre os três é mínima e insuficiente para provar que algum modelo possui vantagem abrangente e estável.
Esses resultados foram publicados principalmente pelo Google conforme sua própria configuração. Modelos, frameworks de agentes, intensidade de raciocínio, permissões de ferramentas e orçamento de teste afetam os resultados finais; portanto, a conclusão mais razoável é que modelos da classe Flash estão próximos de alguns modelos de topo caros, e não que o Gemini já lidera em todas as tarefas.
“Trabalhar mais” significa trabalhar mais inteligentemente, e também pode significar mais caro
O Google atribuiu o aumento da capacidade do 3.8 Flash a uma escolha de design direta: fazer o modelo "trabalhar mais".
Ao enfrentar tarefas complexas, ele utiliza mais etapas de raciocínio intermediárias, chama ferramentas repetidamente e verifica ativamente o trabalho já concluído. Os desenvolvedores podem escolher entre três níveis de pensamento: baixo, médio e alto, sendo o médio a configuração padrão; o nível alto é adequado para programação difícil e raciocínio em múltiplos passos, enquanto o nível baixo é ideal para bate-papo em tempo real, geração de rascunhos e tarefas sensíveis a latência.
Isso reduz a probabilidade de o agente parar prematuramente, omitir etapas ou desviar completamente do objetivo após uma falha na chamada de ferramenta, mas também consome mais tokens.
No teste independente do Artificial Analysis, o 3.8 Flash obteve um índice de inteligência de 59 pontos em níveis altos de pensamento, um aumento de 3 pontos em relação ao 3.7 Flash, e está em nível semelhante à configuração de raciocínio não máxima do GPT‑5.6 Sol. Sua velocidade média de saída é de aproximadamente 300 tokens por segundo, com um tempo médio de 2,5 minutos para concluir cada teste individual.
Mas a saída média de tokens do 3.8 Flash aumentou cerca de 30%, e houve mais rodadas de execução nos testes de Agent. Embora o preço por token não tenha aumentado, o custo médio por tarefa é de aproximadamente US$ 0,58, cerca de 40% mais alto que os US$ 0,40 do 3.7 Flash.
Portanto, “preço unitário baixo” não significa que “cada tarefa será necessariamente mais barata”. Se a tarefa em si não exigir raciocínio complexo, fazer o 3.8 Flash operar em alta intensidade pode apenas aumentar o tempo e os custos. O Google também recomenda fluxos de trabalho que priorizam a eficiência, reduzindo o nível de pensamento, ou continuando a usar o 3.7 Flash, que ainda é suportado.
O preço atual baixo é apenas uma oferta limitada no tempo
Até 31 de dezembro de 2026, o preço promocional do Gemini 3.8 Flash é de US$ 0,75 por milhão de tokens de entrada e US$ 3,75 por milhão de tokens de saída, o mesmo preço atual do 3.7 Flash.
A partir de 1º de janeiro de 2027, o preço padrão será de US$ 1,50 por milhão de tokens de entrada e US$ 7,50 por milhão de tokens de saída, exatamente o dobro. Os desenvolvedores não devem considerar os preços do período de lançamento como preços permanentes ao avaliar custos a longo prazo.
Mesmo calculado com base nos preços futuros, ele ainda está abaixo de alguns modelos principais; no entanto, para Agentes que precisam gerar dezenas de milhares de Tokens e executar dezenas de chamadas de ferramentas, deve-se comparar o custo total da tarefa, e não apenas o valor por milhão de Tokens listado na tabela de preços.
O objetivo da versão Cyber não é explicar a vulnerabilidade, mas entregar o patch diretamente.
O Google também lançou o Gemini 3.8 Flash Cyber. Ele compartilha as capacidades básicas da versão padrão, mas foi treinado com foco maior em segurança cibernética e adota restrições de segurança cibernética mais flexíveis, permitindo que realize análises de vulnerabilidades que modelos comuns podem recusar.
No benchmark de descoberta de vulnerabilidades CyberGym, o Google afirmou ter atingido o estado da arte. Como o CyberGym se concentra principalmente em projetos em C e C++, a empresa desenvolveu um conjunto interno de testes que cobre 20 linguagens de programação e inclui repositórios de código real e complexo, alcançando uma taxa de sucesso superior a 70% na detecção de vulnerabilidades pelo 3.8 Flash Cyber.
Descobrir a vulnerabilidade é apenas o primeiro passo. O Google enfatiza especialmente que o foco do treinamento da versão Cyber é corrigir problemas, e não gerar explorações de ataque.
No teste de patch CWE-Bench executado pela Collinear, a taxa de aprovação da primeira submissão do Flash Cyber foi de 47,2%, comparada a 47,8% do modelo líder de referência. Ambos os resultados são próximos, mas o Google afirma que o Flash Cyber tem custo de execução mais baixo.
Isso representa uma mudança no objetivo do agente de segurança cibernética, passando de “informar aos engenheiros que pode haver um problema” para compreender vulnerabilidades, escrever patches, executar testes e validar as alterações. Se os resultados forem suficientemente confiáveis, isso pode reduzir o tempo que a equipe de segurança leva para descobrir uma vulnerabilidade e implantar uma correção.
Chrome recebeu 2,6 vezes o patch correto, mas ainda está em teste pela fabricante e parceiros
O Google já está usando o Flash Cyber para trabalhos de segurança de código interno.
A equipe de segurança do Chrome afirmou que o número correto de patches de vulnerabilidades gerados por ela é 2,6 vezes maior do que o de modelos comerciais maiores. A empresa de segurança cibernética Wiz afirmou que, em seus benchmarks de teste de penetração, a taxa de recuperação de vulnerabilidades da Flash Cyber é de 7,5 a 9,7 pontos percentuais mais alta do que outros modelos de ponta, com custos 2,3 a 5,2 vezes menores.
A equipe de pesquisa de vulnerabilidades do Google Cloud também afirmou que o modelo identificou uma vulnerabilidade crítica na infraestrutura em menos de duas horas, enquanto pesquisas semelhantes normalmente podem durar meses.
Esses resultados têm valor de referência real, mas não devem ser considerados como avaliações públicas independentes e reprodutíveis. O Google não divulgou os detalhes específicos da vulnerabilidade crítica, a lista de modelos comparados nem o trajeto completo da execução; os dados do Chrome são provenientes de fontes internas do Google, e a Wiz também é parceira da Fairwind. Portanto, eles demonstram que os modelos já conseguem participar de tarefas reais de segurança, mas não provam que alcançam consistentemente o mesmo nível de desempenho em todos os repositórios de código e tipos de vulnerabilidades.
As melhores capacidades de segurança cibernética estão disponíveis apenas para instituições confiáveis
Flash Cyber é oferecido através do novo programa Fairwind do Google, com mais de 650 participantes atuais, principalmente agências de cibersegurança governamentais, operadores de infraestrutura crítica, mantenedores de software e grandes empresas de segurança.
As instituições envolvidas devem limitar o acesso interno a um grupo restrito e adotar medidas de segurança, como autenticação multifator. Após a integração com o CodeMender Agent, o modelo pode localizar, validar e corrigir vulnerabilidades no ambiente em nuvem da própria instituição.
Clientes normais do Google Cloud ainda podem usar o CodeMender com o modelo Gemini público, mas não têm acesso direto às capacidades completas do Flash Cyber.
Essa abordagem de lançamento “um modelo base, dois níveis de permissão” é muito semelhante à estratégia anterior da Anthropic, que dividiu o Claude em Fable e Mythos: capacidades gerais de programação e análise são disponibilizadas ao mercado, enquanto funções de segurança cibernética mais propensas a serem convertidas em habilidades de ataque são protegidas por autenticação de identidade, controle de acesso e monitoramento contínuo.
A segurança não sofreu upgrade significativo, mas houve regressão em algumas expressões não em inglês
A versão padrão 3.8 Flash inclui restrições de segurança relacionadas a substâncias químicas, biológicas, radioativas, nucleares e ataques cibernéticos; a versão Cyber, por precisar cumprir missões de defesa profissional, possui restrições de segurança cibernética mais flexíveis e, portanto, está disponível apenas para instituições aprovadas.
A ficha do modelo do Google afirma que, em comparação com o 3.7 Flash, o 3.8 Flash não apresentou novas capacidades significativas nas áreas de alto risco focadas pelo quadro de segurança avançado da empresa, portanto não acionou um nível de risco mais elevado. A proteção contra injeção de prompts indiretos Gray Swan também melhorou.
No entanto, a ficha do modelo também revela que o 3.8 Flash apresentou uma queda de 5,4 pontos percentuais em testes automatizados de segurança multilíngue em comparação com o 3.7 Flash. Após verificação manual pela Google, foi afirmado que a maioria das diferenças corresponde a falsos positivos ou conteúdos não graves, mas os dados completos da amostra e por idioma não foram divulgados.
O modelo ainda apresenta problemas comuns de modelos de linguagem de grande porte, incluindo alucinações, respostas ocasionais lentas ou tempo esgotado, e o uso excessivo de tokens para melhorar o desempenho. A data de corte do conhecimento é indicada como março de 2026, mas o Google informa que, em algumas áreas, o conhecimento confiável pode ainda estar atualizado apenas até por volta de janeiro de 2025; ao lidar com informações mais recentes, é necessário verificar online.
A verdadeira competição está mudando de "quem é mais inteligente" para "quem pode ser usado em larga escala"
O mais notável no Gemini 3.8 Flash não é algum benchmark liderar por frações de ponto, mas sim o fato de que o Google está incorporando capacidades de programação de longo prazo, análise profissional e chamada autônoma de ferramentas na faixa de preço do Flash.
Modelos de topo são adequados para tarefas difíceis, de alto valor e baixa frequência; no entanto, os Agentes realmente implantados em atendimento ao cliente corporativo, pipelines de programação, análise financeira e varredura de segurança podem processar milhões de chamadas por dia. Nesses cenários, velocidade, custo por unidade e taxa de sucesso por tarefa geralmente são mais importantes do que estar em primeiro lugar nos rankings.
3.8 O Flash também revela a contradição nesse caminho: quanto mais bem-sucedido o modelo for em revisar repetidamente e trabalhar continuamente, maior a probabilidade de gerar mais tokens, aumentando o custo por tarefa do "modelo barato". Assim, o núcleo da competição futura entre Agentes não será apenas quem responde melhor, mas também quem consegue determinar quando continuar pensando, quando chamar ferramentas e quando parar.
