Autor: Google DeepMind
Tradução: Deep潮 TechFlow
Leitura profunda da Shenchao: Os três modelos lançados pelo Google focam diretamente nos principais desafios comerciais dos AI Agents — custo e velocidade. O 3.6 Flash economiza 17% em tokens em relação à geração anterior, com preço mais baixo e qualidade superior; o 3.5 Flash-Lite alcança 350 tokens/segundo, sendo o modelo mais rápido da série 3.5; já o modelo especializado em segurança cibernética, Flash Cyber, visa o mercado essencial de correção de vulnerabilidades de código. Não se trata de um jogo de benchmarks de desempenho, mas sim de preparar o caminho para a implantação em larga escala de AI Agents.
O Google DeepMind lançou hoje três novos modelos Gemini: 3.6 Flash, 3.5 Flash-Lite e 3.5 Flash Cyber. Esses modelos foram projetados para eficiência, latência e confiabilidade necessárias para construir grandes escalas de AI Agent.
Gemini 3.6 Flash: Mais eficiente, de melhor qualidade
3.6 Flash foi aprimorado com base no feedback dos desenvolvedores sobre o 3.5 Flash. Não apenas avançou na codificação e no trabalho de conhecimento, mas também aumentou significativamente a eficiência de tokens. De acordo com o Artificial Analysis Index, o 3.6 Flash reduz o consumo de tokens de saída em 17% em comparação com o 3.5 Flash. Em alguns testes de referência, como o DeepSWE da Datacurve, a redução chega a 65%. Também são necessários menos passos de raciocínio e chamadas de ferramentas para concluir fluxos de trabalho com múltiplos passos.
Essa melhoria na eficiência vem acompanhada de preços mais baixos. Com precificação de US$ 1,5 por milhão de tokens de entrada e US$ 7,5 por milhão de tokens de saída, o 3.6 Flash reduz o custo total por tarefa do Agente, tornando a construção e execução de Agentes mais econômicas.
Mesmo sendo mais eficiente, o 3.6 Flash apresenta desempenho superior ao 3.5 Flash em diversos casos de uso:
A edição de código tornou-se mais precisa, reduzindo modificações e ciclos de execução desnecessários, alcançando 49% no DeepSWE (3.5 Flash: 37%) e aumentando significativamente para 63,9% no benchmark de pesquisa em machine learning MLE Bench (3.5 Flash: 49,7%).
Melhoria nas habilidades de operação de computador, pontuação OSWorld-Verified de 83,0% (3,5 Flash em 78,4%). A operação de computador agora está disponível por meio da Gemini API e Gemini Enterprise como ferramenta integrada
O trabalho intelectual apresenta melhor desempenho, como no benchmark GDPval-AA v2 com pontuação de 1421 (3.5 Flash obteve 1349). Clientes como Hebbia e Harvey descobriram que ele se destaca em tarefas multimodais, como análise de documentos, gráficos e dados, e redação de relatórios.
O feedback do cliente indica que o 3.6 Flash representa uma melhoria em custo e qualidade, equilibrando eficiência em tokens, precisão e velocidade em fluxos de trabalho complexos e tarefas baseadas em conhecimento.
Design de segurança
3.6 Flash está equipado com medidas aprimoradas de proteção de ponta contra ameaças químicas, biológicas, radiológicas, nucleares (CBRN) e abusos de ataques cibernéticos. Essas proteções aumentam significativamente a resistência do modelo a ataques de jailbreak. Ao mesmo tempo, o modelo foi treinado para minimizar recusas a usos benéficos.
Gemini 3.5 Flash-Lite: criado para escalar fluxos de trabalho de Agent
3.5 Flash-Lite foi projetado para tarefas de baixa latência e cenários de desenvolvimento que exigem alta taxa de transferência, como busca de Agentes e processamento de documentos.
3.5 Flash-Lite é o modelo mais rápido da série 3.5. Segundo medição da Artificial Analysis, alcança até 350 tokens de saída por segundo. Com preço de US$ 0,3 por milhão de tokens de entrada e US$ 2,5 por milhão de tokens de saída, oferece qualidade significativamente superior ao 3.1 Flash-Lite, proporcionando excelente custo-benefício para desenvolvedores e clientes que executam tarefas de produção com alto volume.
3.5 Flash-Lite oferece expansão eficiente do sistema Agent. Em todos os níveis de pensamento, o modelo supera significativamente o 3.1 Flash-Lite. Os desenvolvedores podem configurar o modelo conforme a carga de trabalho: usar níveis mínimos e baixos de pensamento para tarefas em grande escala, priorizando baixa latência e execução de baixo custo; ou ativar níveis mais altos de pensamento para lidar com cargas de trabalho de Agentes filhos em múltiplos passos. O modelo agora também inclui operações de computador como ferramenta integrada, oferecendo suporte confiável para tarefas Agent em interfaces diversas.
Houve melhoria significativa em codificação e tarefas de agente, como pontuação de 54% no Terminal-Bench 2.1 (3.1 Flash-Lite: 31%), contextos longos como GDM-MRCR v2 com pontuação de 72,2% (3.1 Flash-Lite: 60,1%) e execução de tarefas reais como GDPval-AA v2 com pontuação de 1140 (3.1 Flash-Lite: 642).
Na verdade, em muitos agentes e avaliações de codificação, o 3.5 Flash-Lite superou até mesmo o 3 Flash, incluindo o SWE-Bench Pro (54,2% vs 49,6%) e o OSWorld-Verified (74,0% vs 65,1%), tornando-se a opção mais rápida e poderosa para cargas de trabalho do 2.5 e 3 Flash.
Os clientes iniciais destacaram a combinação única de velocidade, inteligência e eficiência de custo do 3.5 Flash-Lite na expansão de fluxos de trabalho de Agentes e tarefas de processamento de dados.
Gemini 3.5 Flash Cyber em CodeMender: descobrir e corrigir vulnerabilidades de forma eficiente
Os modelos de IA estão descobrindo vulnerabilidades de segurança mais rápido do que os sistemas atuais conseguem corrigi-las. Enfrentar essa ameaça cada vez mais grave exige uma abordagem de segurança de software eficiente e robusta.
O desempenho e a eficiência do Flash o tornam uma base ideal para detecção em larga escala, validação e correção de problemas de segurança no código. O Gemini 3.5 Flash Cyber é construído sobre o 3.5 Flash, finamente ajustado especificamente para descobrir e corrigir vulnerabilidades de segurança cibernética, com custo por token inferior ao de modelos maiores.
No CodeMender, múltiplos 3.5 Flash Cyber Agents trabalham em conjunto para gerar um único relatório abrangente, alcançando nível competitivo de ponta no benchmark popular CyberGym.
Devido à natureza de uso duplo dessa tecnologia, adotamos uma abordagem cautelosa de implantação. O modelo será disponibilizado em breve, por meio do CodeMender, como um projeto piloto com acesso restrito a governos e parceiros confiáveis. Isso permitirá que defensores de primeira linha identifiquem e corrijam vulnerabilidades críticas antes que sejam exploradas, ao mesmo tempo em que reduz os riscos de uso indevido mais amplo.
Comece agora
3.6 Flash e 3.5 Flash-Lite estão disponíveis a partir de hoje:
Os desenvolvedores podem usar por meio da API Gemini no Google AI Studio e no Android Studio. O 3.6 Flash também está disponível no Google Antigravity.
A empresa pode ser utilizada na plataforma Gemini Enterprise Agent. 3.6 Flash também está disponível no aplicativo Gemini Enterprise.
Disponível para todos através do aplicativo Gemini. O 3.5 Flash-Lite também está sendo lançado no Google Search.
Agradecemos pelo feedback para aprimorar futuros modelos Gemini; aguardamos ansiosamente o lançamento do 3.5 Pro.
