Just now, Google is back!
Esta noite, o Google lançou oficialmente o Gemini 3.8 Flash e o Gemini 3.8 Flash Cyber, especializado em segurança cibernética.
Este é o terceiro lançamento do Flash pela Google em apenas seis semanas.
As duas atualizações anteriores pareciam apenas um aquecimento, pois desta vez o Google colocou diretamente a relação custo-benefício na vanguarda—
Custo de tarefa única de US$ 0,58! Entrada apenas US$ 0,75 por milhão de tokens!
É exatamente esse pequeno modelo, com um preço de "repolho", que, em vários testes de referência principais, conseguiu alcançar o patamar dos melhores modelos do mundo: Opus 5, GPT-5.6 Sol e Grok 4.6.
O especialista do Google DeepMind, Yao Shunyu, comentou: Para o modelo, isso é apenas um pequeno passo; mas para o RSI, é um grande salto.

No X, os desenvolvedores já explodiram.
Após testes reais, alguém fez a pergunta fundamental: “Nossa, o Google enviou o produto errado? Isso não é exatamente o Gemini 3.5 Pro que nunca foi lançado? Pagando o preço do Flash, fazendo o trabalho do Pro!”


Na equipe do DeepMind, provavelmente alguém não dormiu desde julho.
Enquanto todos ainda estão processando o Fable 5.1, o Google virou a mesa novamente.
O "rei do esforço" do Google voltou: o rei da relação custo-benefício
O Google, após um longo período de silêncio, anuncia ao mundo, de forma extremamente competitiva: o grande vilão voltou.

Para entender o impacto do Gemini 3.8 Flash, devemos primeiro examinar o cenário atual do mercado de IA.
Originalmente, no teste da Artificial Analysis, já foi estabelecida uma barreira extremamente rigorosa. Para possuir inteligência de nível superior (Índice de Inteligência em torno de 60 pontos), é necessário incorrer em um custo elevado em Tokens.
Como resultado, o Gemini 3.8 Flash atua como um assassino, simplesmente sem ética.
No modo de raciocínio elevado da Artificial Analysis, o Gemini 3.8 Flash atingiu um índice de inteligência de 59 pontos!

O que é esse conceito? Está a um passo apenas dos melhores GPT-5.6 Sol e Grok 4.6, e até supera o Claude Opus 5 em alguns aspectos!
E qual é o custo de fazer tudo isso? O custo por tarefa é de apenas US$ 0,58.
Especificamente, o custo de entrada permanece em 0,75 dólar por milhão de tokens, e a saída em 3,75 dólares por milhão de tokens.
O Google criou um gráfico: no fronteiro de Pareto entre inteligência e custo, o ponto azul representando o Gemini 3.8 Flash está no canto superior direito do benchmark de engenharia de software DeepSWE, superando em muito o segundo colocado.

Gemini 3.8 Flash não é apenas inteligente, mas também incrivelmente rápido. Sua velocidade de geração atinge impressionantes 305 tokens/s, enquanto o próximo modelo mal alcança 154 tokens/s.
Rápido, inteligente e barato como se não custasse nada—esse é o modelo que os humanos realmente podem usar todos os dias.

Em particular, no benchmark de engenharia de software de longo prazo DeepSWE v1.1, o 3.8 Flash alcançou um impressionante 73,7%.
Neste teste que exige que a IA resolva automaticamente problemas de engenharia complexos e escreva código de ponta a ponta, ela não apenas superou a maioria dos caros modelos avançados, mas também custou apenas uma fração do preço desses modelos.
Sabe que esta é apenas a versão «Flash», não a «Pro», muito menos a «Ultra».
Desta vez, o Google mais uma vez permitiu que modelos pequenos tomassem o lugar dos modelos principais.
Alguém testou pessoalmente o Gemini 3.8 Flash e o Opus 5 na mesma tarefa.

Este salto significativo na habilidade de programação não é acidental.

Este salto significativo na habilidade de programação não é acidental.
Segundo relatos, nos testes da ferramenta de código interna da Google, Jetski, os engenheiros da Google preferiram ainda mais o 3.8 Flash em vez do modelo Opus da Anthropic.

Por trás disso está o Google investindo pesadamente em aprendizado por reforço desde o início do ano — ou seja, na fase de "aperfeiçoamento final" do treinamento do modelo, permitindo que ele aprenda realmente a realizar tarefas por meio de tentativa e erro.
O Google DeepMind formou uma equipe de elite de código focada em aprimorar as capacidades dos modelos de programação, liderada pelo CTO do DeepMind e supervisionada diretamente pelo co-fundador Sergey Brin.
O objetivo deles é forçar a autoevolução recursiva, transformando abruptamente o modelo de programação em um pesquisador de IA totalmente automático, fechando completamente o ciclo de desenvolvimento.

Na memória interna, o Google disse diretamente:
To win the final sprint, we must urgently close the gap in agent execution and turn our models into lead developers.

Além disso, o Google também recrutou Barret Zoph, cofundador da Thinking Machines Lab e ex-responsável por pós-treinamento na OpenAI, que agora assume o cargo de vice-presidente de pesquisa, liderando as áreas de aprendizado por reforço e pós-treinamento. Essa movimentação deixa claro que estão determinados a ir até o fim.
No mês passado, o cofundador e ganhador do Prêmio Nobel, Demis Hassabis, deixou o cargo de CEO, e seu sucessor, Koray Kavukcuoglu, logo declarou: acelerar, acelerar e ainda mais acelerar.
Base "inflada", ou desempenho excepcional?
No entanto, entre os elogios, o Google foi amplamente criticado por abrir o champanhe antes da hora, comemorando cedo demais.

O mais irritante é a Meta——
O Muse Spark 1.3 da Meta e o Gemini 3.8 Flash se encontram; o primeiro obteve 62 pontos no índice de inteligência da Artificial Analysis, empatando com o Claude Fable 5 e entrando entre os melhores.
E o custo de entrada do Muse é 8 vezes menor que o do Fable 5, enquanto o custo de saída é quase 12 vezes menor, oferecendo o melhor custo-benefício.
O chefe de IA do Meta, Alexandr Wang, disparou diretamente: no índice inteligente Artificial Analysis, o Gemini não é nada e só consegue respirar a fumaça dos modelos dos outros.


Muse Spark 1.3 pontuou mais alto que GPT-5.6 Sol, Grok 4.6 e Gemini 3.8 Flash, mas atualmente está apenas em pré-visualização limitada.
Alguém apontou que, embora o gráfico de benchmark da 3.8 Flash pareça bom, na prática pode não ser tão bom assim.
De fato, o Gemini 3.8 Flash superou o GPT-5.6 Sol e o Opus 5 em testes como Terminal-Bench 2.1 e HLE, mas a grande diferença de pontuação entre o TBench 2.1 e o TBench 4 revela que pode haver algum componente de “manipulação de classificações”.
Ou seja, ao enfrentar desafios Zero-shot do mundo real, desconhecidos e ainda não incluídos no conjunto de treinamento, o 3.8 Flash provavelmente ainda é inferior a monstros de parâmetros como o Opus 5.
Mas a solução do Google é extremamente inteligente — a diligência compensa a falta de talento.
Como mencionado no blog oficial do Google: "Esses ganhos de desempenho decorrem de escolhas de design fundamentais: o 3.8 Flash trabalha mais duro."
Ao enfrentar tarefas complexas, o 3.8 Flash foi projetado para executar etapas adicionais de raciocínio e chamar ferramentas iterativamente. Quando encontra uma pergunta que não entende, não desiste imediatamente, mas sim consome mais tokens para realizar uma autoverificação e reflexão internas em alta velocidade.
Mesmo consumindo mais tokens por meio de múltiplas iterações de pensamento, como seu preço unitário básico é extremamente baixo (US$ 0,75 por milhão de tokens), no total, ele ainda é muito mais barato do que chamar diretamente o GPT-5.6!
Esta estratégia quebra diretamente a competição unidimensional anterior de "parâmetros maiores = maior capacidade".
Isso prova que, em um ciclo de agente perfeito, velocidade e custo de inferência extremamente baixo são, por si só, uma forma poderosa de inteligência.
Por que enviar o Flash? A versão Pro "cancelada"
Desta vez, o Google realmente não enviou o produto errado?
O Gemini 3.5 Pro ainda nem apareceu. O próximo cartão-asa, o Gemini 4, tem dados de pré-treinamento bem bonitos, mas ainda não terminou a fase de pós-treinamento.

Na verdade, o fato de o Google não lançar a versão Pro por tanto tempo tem uma história triste por trás.
Pi Chai prometeu em maio deste ano que lançaria a série Pro mais poderosa "no próximo mês", mas sempre adiou.
Na verdade, havia vários modelos candidatos ao 3.5 Pro internamente no Google, mas todos foram implacavelmente descartados — porque não superavam significativamente a atual série Flash!
Ao mesmo tempo, o aguardado próximo modelo旗舰 Gemini 4, embora tenha se saído bem nas avaliações de pré-treinamento, ainda está preso na fase mais crítica de pós-treinamento.
Em resumo, tudo acabou levando à intensa iteração da série Flash.
Vulnerabilidade descoberta em 2 horas que levaria meses para ser encontrada: dominando o ranking de segurança cibernética
Nesta vez, o Google está apenas pressionando os preços no 3.8 Flash em tarefas comuns?
Muito mais do que isso.
O verdadeiro trunfo deste lançamento é seu irmão gêmeo — Gemini 3.8 Flash Cyber.
Os próprios desenvolvedores estão se perguntando: “Que tipo de tarefa de segurança justifica o Google criar uma versão exclusiva do Cyber especificamente para o Flash?”
A resposta do Google é: para combater futuros hackers de IA.
No CyberGym, o benchmark onde a vulnerabilidade foi descoberta, o 3.8 Flash Cyber obteve uma pontuação de 86,2%, dominando diretamente a classificação e deixando para trás os modelos anteriores.
Além disso, o código do mundo real não se limita ao C/C++.
Em um teste abrangente em um código complexo interno do Google que abrange 20 linguagens de programação, este modelo alcançou uma taxa de sucesso superior a 70% na detecção de vulnerabilidades amplas.
Mais impressionante ainda é seu desempenho real no mundo real.
A equipe de segurança do Chrome o testou e descobriu que ele gerou 2,6 vezes mais patches de correção corretos do que o melhor modelo comercial disponível anteriormente, que era muito maior em tamanho.
A empresa de segurança Wiz descobriu que sua taxa de recall aumentou de 7,5 a 9,7% nos testes de penetração, enquanto os custos diminuíram de 2,3 a 5,2 vezes.
O mais surpreendente é que a equipe de pesquisa de vulnerabilidades do Google Cloud a utilizou e, em apenas 2 horas, descobriu uma vulnerabilidade crítica e fundamental—enquanto, anteriormente, especialistas humanos de alto nível levavam meses para encontrar tais vulnerabilidades!
No CWE-Bench (teste de capacidade de correção), a taxa de primeira aprovação da Flash Cyber atingiu 47,2%, quase empatando com os maiores modelos de ponta (47,8%), mas seu custo é apenas uma fração mínima.

Precisamente por causa do impacto impressionante do ataque e defesa em rede da 3.8 Flash Cyber, o Google não optou por torná-la totalmente de código aberto, mas sim lançou o novo programa Fairwind, disponibilizando-a apenas para instituições confiáveis.
OpenAI, Anthropic e Google: a batalha dos grandes modelos entra em um ponto de virada
Com o lançamento do Gemini 3.8 Flash, pode-se ver que os três grandes da IA hoje seguem três rotas de evolução completamente diferentes.
Anthropic (série Claude) foca firmemente em "confiabilidade e estabilidade do conhecimento".
Nos testes que priorizam cobertura de conhecimento e precisão factual (como AA-Omniscience), o Claude ainda é uma dominação.
Os sete primeiros são todos da série Claude; agora eles claramente estão reforçando a capacidade de não cometer erros em tarefas empresariais, buscando saídas estáveis.
OpenAI (série GPT), apostando na "raciocínio profundo e iluminação".
No teste CritPt voltado para física e derivações matemáticas, o GPT-5.6 Sol lidera de forma esmagadora.
OpenAI parece estar buscando um simples surgimento de inteligência, exigindo que o modelo consiga, sozinho, "pensar" como um cientista, sem que ninguém lhe diga a resposta.
Google (série Gemini) cria um "trabalhador hiperacelerado em ciclo infinito".
O Google desta vez deu uma terceira resposta: talvez eu não consiga resolver de uma vez o problema de física mais difícil, mas reajo extremamente rápido e com custo extremamente baixo.
Na era do Agent, consigo pensar 100 vezes em um segundo, escrever código, executar, encontrar erros, corrigir, e forçar a obtenção do resultado correto por meio de iterações brutas com custo extremamente baixo.
Agen enfrenta problemas na vida real, exigindo tentativa e erro repetidos, chamada de ferramentas e ajustes dinâmicos.
E o Gemini 3.8 Flash foi literalmente projetado para esse tipo de "fluxo de trabalho de longa duração".
Você pode usar apenas uma palavra-chave e um comando de loop no Google Antigravity para fazer o 3.8 Flash gerar automaticamente um jogo completo com enigmas, texturas de ambiente e níveis 3D.
Você pode usá-lo para gerar automaticamente uma versão em DOS do Google Maps com street view e navegação.
Claramente, a facilidade de uso e o custo do Gemini 3.8 Flash já ultrapassaram um ponto crítico.
A chegada do Gemini 3.8 Flash parece ser uma declaração da Google a toda a indústria: os grandes modelos estão deixando de ser algo apenas acessível às grandes empresas e avançam rumo à democratização da capacidade de processamento.
As tarefas de agentes que antes exigiam dezenas de milhares de dólares e dias inteiros de execução agora podem ser concluídas em minutos, pelo preço de algumas xícaras de café.
A era do indivíduo extraordinário para pessoas comuns realmente chegou.
Este é o momento de despertar dos pequenos modelos.
Referências:
https://x.com/alexandr_wang/status/2095266112212754659?s=20
https://blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber/
Editado por: Aeneas David
Este artigo é do canal oficial do WeChat "Nova Inteligência", autor: Apocalipse da ASI
