Google lançará o Gemini 3.8 Flash amanhã, com foco em codificação e compreensão de vídeo

icon MarsBit
Compartilhar
AI summary iconResumo
O Google está prestes a lançar o Gemini 3.8 Flash amanhã, um importante evento de lançamento de token no espaço da IA. O modelo, codinome "Skimaki", melhora a codificação e a compreensão de vídeos, reduzindo o uso de tokens em até 88%. O Gemini 3.5 Pro foi cancelado, com o desenvolvimento transferido para o Gemini 4.0. Notícias on-chain mostram que o Google também está introduzindo compreensão de vídeo agente para análise de conteúdo dinâmico.

Claude 5.1 acabou de ser lançado, e logo em seguida a OpenAI Astra está a caminho.

Agora, até o Google está fazendo novos movimentos. O mais recente vazamento indica que o Gemini 3.8 Flash será lançado amanhã.

Google

Google

Parece que o mundo da IA está prestes a viver um "novo ano".

Gemini 3.5 Pro descontinuado, próximo grande lançamento: 4.0

Em vez do lançamento do Gemini 3.8 Flash, muitos ainda estão mais curiosos: quando o Gemini 3.5 Pro vai chegar?!

Desculpe, não precisa esperar mais, o Google desistiu...

Google

Desde o anúncio da conferência I/O em maio deste ano, já se passaram quase quatro meses, e a evolução do Gemini 3.5 Pro nem chega perto da do Flash.

O Google também não teve escolha, simplesmente "abandonou a peça".

Felizmente, o Gemini 4.0 apresentou excelente desempenho na pré-treinagem, e o pós-treinamento está ocorrendo conforme planejado.

Google

Google

Esta exclusiva da WSJ também anuncia com grande destaque as poderosas habilidades de programação do Gemini 3.8 Flash (código "Skimaki").

Supostamente, no teste comparativo da ferramenta interna de codificação do Google, Jetski, o 3.8 Flash superou drasticamente o modelo Opus.

E, além disso, este modelo foi desenvolvido há vários meses, antes mesmo do "terremoto" na liderança do Google.

Hassabis se afasta, e o cientista-chefe Jeff Dean deixa a empresa, fazendo muitos duvidarem do futuro do Gemini.

Google

No entanto, atualmente, tudo parece estar sendo conduzido de forma organizada internamente.

Atualmente, o Google planeja lançar primeiro o Gemini 3.8 Flash porque este modelo possui parâmetros menores, requer menos computação e é mais fácil de produzir resultados.

Segundo fontes internas, desde o início deste ano, o Google alocou mais recursos humanos e computacionais especificamente para melhorar a capacidade do Gemini em escrever código.

Em particular, aumentou-se o investimento no "aprendizado por reforço", permitindo que a IA aprenda verdadeiramente novas habilidades por meio de tentativa e erro.

E o Google DeepMind e outros laboratórios estão avançando simultaneamente em vários projetos, de modo que, mesmo se um não funcionar, outro poderá substituí-lo.

Gemini 3.5 Pro não atendeu às expectativas, mas o Gemini 4.0 ainda não foi lançado.

Hoje, as duas grandes empresas da Silicon Valley, OpenAI e Anthropic, já se destacam muito em modelos avançados e agents de programação.

Informa que a próxima geração da OpenAI, Astra, também adota um novo método de inferência chamado “profundidade recorrente”, reduzindo o número de tokens de pensamento enquanto aumenta significativamente o desempenho.

Esta carta especial será revelada nesta semana.

Google

E neste exato momento, o Google precisa entregar algo.

Após a promessa de劈柴, nos meses seguintes, nada além do lançamento de um modelo 3.7 Flash foi apresentado para entusiasmar a comunidade de IA.

Talvez já esta noite, o Gemini 3.8 Flash vai estrear.

Google

Gemini pela primeira vez, consegue assistir a vídeos sozinho

Antes da publicação aqui, o Google trouxe hoje uma prévia, adicionando uma nova funcionalidade ao Gemini—

Compreensão de Vídeo por Agentes (Agentic Video Understanding)

This feature is a total game-changer.

Carregue um vídeo da conferência I/O: o mesmo modelo, Gemini 3.7 Flash, reduziu o consumo de tokens em 88%.

Google

O Google declarou em seu blog oficial que os modelos Gemini 3.7 Flash, 3.6 Flash e 3.5 Flash-Lite agora possuem capacidade de compreensão de vídeo agente, acessíveis por meio do Google AI Studio e da Gemini Enterprise Agent Platform.

Ao ativar este interruptor nos benchmarks padrão de análise de vídeo, o consumo de tokens pode cair até 88%, o custo de análise pode cair até 66% e a precisão aumenta em até 7%.

Google

E não cobramos um centavo a mais, o preço do token ainda segue o padrão da API. Economizar e ser preciso geralmente entram em conflito. Desta vez, não houve conflito.

Google

Porque o Gemini aprendeu a "arrastar a barra de progresso".

O método anterior era chamado de processamento "estático", no qual o modelo recebia passivamente um fluxo de imagens com taxa de quadros fixa, determinada por parâmetros da API, sem qualquer influência do modelo.

Agora o modelo decide por si mesmo: qual trecho analisar, com que velocidade, se observar a imagem, ouvir o áudio ou ler diretamente a transcrição textual.

Google

Esta não é a primeira vez que o Google faz isso.

A visão agente anterior combinava a execução de código com a compreensão nativa de imagens do Gemini, permitindo que o modelo escrevesse código sozinho para ampliar, recortar e comparar uma imagem.

Agora é a vez do vídeo, mesma ideia, apenas trocando a ferramenta pela ferramenta nativa de vídeo.

Quatro tarefas que antes eram muito difíceis

O blog oficial também lista vários cenários de aplicação de alta dificuldade.

Recuperação de fragmentos em subsegundos. Modelos anteriores "viam" vídeos, capturando apenas uma imagem por segundo. O problema é que muitas coisas passam em menos de um segundo.

Agora é possível localizar esses momentos com precisão de menos de um segundo.

Isso significa que o "corte automático" tornou-se viável pela primeira vez: anteriormente, os editores tinham que analisar manualmente a linha do tempo, quadro a quadro, para decidir onde fazer os cortes; agora, o modelo pode primeiro analisar e marcar os pontos de corte candidatos, permitindo que o humano escolha posteriormente.

Google

Procurar uma agulha em um palheiro longo. Faça uma pergunta complexa em horas de material sem precisar gastar todos os milhões de tokens.

Detecção de anomalias. Após o modelo identificar uma janela de tempo específica, pode aumentar a taxa de quadros e reamostrar apenas esse trecho para visualizar movimentos rápidos e pequenas imperfeições na imagem. Essa abordagem é especialmente útil para inspeção de linha de produção e monitoramento de segurança, pois as anomalias geralmente ocorrem apenas nesses poucos segundos.

Conte. Questões como quantas vezes um movimento foi repetido ou quantos objetos diferentes estão na cena eram constantemente erradas pelo modelo, e a razão era simples: os quadros perdidos continham exatamente os elementos necessários.

Google

O agente finalmente prestou atenção ao vídeo.

Vídeo sempre foi o mais caro entre todos os modais.

O texto é barato, as imagens vão bem, mas os vídeos são grandes e longos — um minuto pode consumir tantos tokens quanto um livro inteiro.

Então, nos últimos dois anos, todos que discutem Agentes ainda estão principalmente falando sobre sua capacidade de ler, escrever e usar ferramentas.

O problema é que um agente que depende principalmente da compreensão textual do mundo está vendo apenas um mundo já "recontado" por alguém.

Ela não sabe nada sobre o que foi filmado por câmeras, gravado em reuniões ou passado nas linhas de produção — coisas que ninguém quer gastar tempo para transcrever.

Agora, essa curva de custo foi reduzida significativamente.

Um agente que consegue revisar sozinho várias horas de monitoramento, dezenas de horas de cursos e centenas de materiais sem esgotar o orçamento muda a forma como interage com o mundo.

Ele não precisa mais esperar que alguém descreva a imagem em texto para alimentá-lo, nem precisa mais escolher entre "ver bem" e "ver com precisão".

O Google foi o primeiro a quebrar esse impasse.

Guerra de IA, próxima rodada

Nestes dias, o ritmo de lançamento das quatro empresas quase coincidiu.

Claude 5.1 acabou de chegar, a OpenAI Astra já está na porta, e o Google, que esperou meses, finalmente lançou o Gemini 3.8 Flash para enfrentar.

Após esta atualização, o Claude agora se concentra em duas áreas principais: programação e pesquisa científica.

A próxima geração da Astra se tornará um “agente contínuo”;, na linguagem de Ultraman, sua capacidade de uso de computador atingiu o nível humano.

Google

O Gemini 3.8 Flash também terá um grande avanço em programação.

Agora, a OpenAI, a Anthropic, o Google e a SpaceXAI estão todos operando em plena capacidade.

Google

Musk anuncia que o Grok 4.7 será lançado em dez dias

Esta batalha acaba de entrar na sua fase mais feroz.

Referências:

https://x.com/Google/status/2094840983913402704

https://deepmind.google/blog/introducing-agentic-video-in-gemini/

Este artigo é do canal oficial do WeChat "Nova Inteligência", autor: Apocalipse da ASI

Aviso legal: as informações nesta página podem ter sido obtidas de terceiros e não refletem necessariamente os pontos de vista ou opiniões da KuCoin. Este conteúdo é fornecido apenas para fins informativos gerais, sem qualquer representação ou garantia de qualquer tipo, nem deve ser interpretado como aconselhamento financeiro ou de investimento. A KuCoin não é responsável por quaisquer erros ou omissões, ou por quaisquer resultados do uso destas informações. Os investimentos em ativos digitais podem ser arriscados. Avalie cuidadosamente os riscos de um produto e a sua tolerância ao risco com base nas suas próprias circunstâncias financeiras. Para mais informações, consulte nossos termos de uso e divulgação de risco.