O Gemini Flash do Google resolve 3 problemas de matemática de nível PhD usando o framework de trabalho em equipe

icon MarsBit
Compartilhar
AI summary iconResumo
O Gemini Flash do Google resolveu três problemas de matemática de nível de doutorado usando um framework de conformidade que permite que agentes de IA colaborem e aprimorem soluções. O modelo leve replicou resultados anteriormente alcançados pelo Gemini Pro, produzindo provas sem erros verificadas por máquinas. O framework Teamwork imita a revisão acadêmica, demonstrando como modelos menores podem lidar com tarefas complexas. A liquidez e os mercados de criptomoedas podem se beneficiar dessa colaboração estruturada de IA.

Se você não visse o nome, certamente acharia que se trata de mais um modelo top, tão poderoso que não pode ser lançado publicamente, com um desempenho "cheio de truques":

Fazer pesquisa científica: resolver de uma só vez sete dos mais avançados problemas de matemática e ciência da computação, apresentando uma prova extensa de 40 páginas que nem o mais rigoroso sistema de verificação automática consegue encontrar falhas;

Engenharia: Desenvolvi do zero um simulador de CPU extremamente realista, que não apenas inicializou com sucesso o sistema, mas também apresentou um erro de execução de 0,71%;

Escrever código: otimize acidentalmente o código principal das duas bibliotecas open source mais populares, Eigen e ParlayHash, e as alterações foram integradas diretamente pelos mantenedores upstream.

Este é o relatório apresentado pela equipe Antigravity do Google em 27 de agosto.

Google

No artigo técnico da Teamwork, a equipe Antigravity do Google apresentou conjuntamente três categorias de resultados: matemática, sistemas e código aberto.

Surpreendentemente, o destaque desta vez não foi um monstro de computação que consome recursos, mas sim o pequeno modelo focado em "rapidez e baixo custo": Gemini 3.7 Flash.

Google

O Google oficialmente declarou: este é o primeiro modelo de nível Flash a produzir uma descoberta matemática de nível doutoral.

Por que modelos baratos conseguem superar desafios de nível superior?

O segredo não está nos parâmetros, mas em um framework de orquestração de múltiplos agentes chamado Teamwork.

O sinal que o Google realmente quer transmitir à indústria é: não foi o Flash que de repente ficou mais esperto, mas sim a forma como o trabalho é organizado.

Pro lidera a exploração

Flash reproduzido com sucesso

Quem é o protagonista deste boletim? O longo artigo técnico do Google fornece uma definição muito rigorosa:

7 resultados em matemática e ciência da computação teórica, inicialmente obtidos todos pelo Gemini 3.1 Pro no modo de prova longa do Teamwork.

Mas o que é impressionante é que três desses resultados robustos foram completamente reproduzidos pelo Gemini 3.7 Flash.

Esses três itens não são problemas secundários meramente para completar números: a construção de coreset para aproximação de subespaços ℓp, o limite inferior da dimensão para embedding de máximo produto interno e a quantização de Hadamard que reduz diretamente a constante líder em aproximadamente 5,93 vezes.

Cada um deles é um problema aberto sério na comunidade acadêmica.

Google

As outras quatro são exclusivamente resolvidas pelo 3.1 Pro, incluindo o limite inferior da condição para otimização convexa esparsa, o limite inferior aproximadamente ótimo para fatoração de matriz de prefixo, o problema dos Ciclos de Knuth e o problema da distância unitária de Erdős reproduzido independentemente sem conexão à internet.

Além disso, a pontuação máxima de 71% no benchmark TCSBench, que quebrou o recorde interno do Google, foi alcançada pela combinação do 3.7 Flash com o 3.1 Pro, superando diretamente o recorde anterior de 67,7% obtido pelo 3.6 Flash combinado com o 3.1 Pro.

Entre eles, o sinal realmente digno de nossa atenção é:

Basta montar o framework corretamente, e modelos leves como o Flash conseguem reproduzir inteiramente os estudos realizados com modelos de ponta.

Isso é suficiente para expandir os limites da nossa compreensão sobre o que modelos pequenos podem fazer.

Teamwork transforma "procurar falhas" em um sistema rigoroso

Teamwork é um framework de orquestração de múltiplos agentes desenvolvido pela equipe Antigravity.

Basta digitar /teamwork-preview, e o Gemini lerá o prompt, escolherá automaticamente o modo e convocará imediatamente uma “equipe de especialistas em IA”, que funcionará por várias horas ou até dias.

Os resultados matemáticos mencionados anteriormente surgem todos do modo Prova Longa (Long Proof).

Sua abordagem é extremamente contra-intuitiva: em vez de acumular parâmetros, baseia-se em fazer um grupo de Flash se reunir para se criticar mutuamente, discutir e apontar fraquezas.

Como exatamente esses AI realizam reuniões? Decomposto, há quatro etapas no total:

Passo 1: A "pesquisa de estratégia de competição" frenética.

O sistema incubará simultaneamente várias propostas candidatas e atribuirá a cada uma um "especialista em contestação" dedicado, cujo único KPI é refutar essa proposta.

Curiosamente, o plano que foi severamente criticado não é descartado diretamente na lixeira, mas permanece no processo carregando todas as opiniões contrárias.

After all, in a dead-end "wrong path," there often lies inspiration that can save you.

Passo 2: Siga o mapa, «decomposição precisa».

Assim que uma estratégia confiável for selecionada, o sistema a divide em uma série de subproblemas com dependências, organizando-os em um gráfico topológico rigoroso. Os que podem ser executados em paralelo avançam independentemente; os que têm ordem sequencial aguardam na fila.

Passo 3: O "torneio interno" de competição intensa.

Dentro de cada subpergunta, realize uma nova eliminatória: os nós leem as soluções candidatas enquanto analisam críticas mordazes, trabalhando juntos para criar uma versão aprimorada.

Se a análise geral falhar, volte a executar com as objeções acumuladas até fechar completamente a vulnerabilidade.

Passo 4: A “aprendizagem interciclo” que transforma erros em lições.

Os rascunhos falhos serão mantidos inalterados para a próxima rodada; cada armadilha enfrentada pelos validadores será registrada no "Livro de Armadilhas".

Caminhos sem saída percorridos e conclusões comprovadas são sincronizadas em tempo real no repositório de conhecimento compartilhado, disponível para todos acessarem a qualquer momento.

Google

Rede de torneios no modo Long Proof: cada estratégia candidata é acompanhada por um falsificador, e as rotas rejeitadas permanecem no processo com objeções.

Ao finalizar todo esse processo, em vez de parecer um supercérebro frio e impessoal, ele replica uma reunião de grupo acadêmico extremamente rigorosa, na qual ninguém consegue se esconder.

Aqui, qualquer proposta precisa passar por várias rodadas de críticas acerbas; apenas os ossos mais difíceis de quebrar conseguem passar com sucesso.

Isso cura diretamente a histeria coletiva mais comum em agentes múltiplos tradicionais:

Anteriormente, quando um AI inadvertidamente desviava o ritmo, outros AI seguiam cegamente como "eco", construindo cada vez mais alto sobre uma base errada.

O trunfo do trabalho em equipe é transformar o "procurar falhas uns nos outros" em um sistema robusto do qual ninguém pode escapar.

A verdade sobre o enigma de Knuth

Sobre esses sete resultados, o mais notável e mais facilmente mal interpretado é o problema Knuth's Cycles, proposto por Donald Knuth.

Na verdade, esta questão já foi resolvida em cadeia pela IA na primavera deste ano.

Google

Donald Knuth, palestra de Natal de Stanford de 2023.

No final de fevereiro deste ano, o Claude Opus 4.6 produziu, em cerca de uma hora, a construção de um cenário ímpar, forçando Knuth a escrever dois "Shock!" no início do artigo.

Google

Em seguida, modelos como gpt-5.3-codex e GPT-5.4 Pro entraram em ação, completando também os casos pares mais difíceis.

By mid-April, Gartner definitively confirmed in the revised paper that the even case was no longer in doubt.

O que o Google fez desta vez?

Em resumo, o Google encontrou duas novas construções mais elegantes e simples para o caso par e, de passagem, apresentou duas das primeiras provas extensas, com 40 e 70 páginas, respectivamente.

Aquele prova robusta de mais de 40 páginas foi ainda verificada formalmente pelo Lean, de modo que nem mesmo a máquina conseguiu encontrar falhas.

Isso é certamente uma contribuição acadêmica bastante sólida, mas seu verdadeiro significado está em "fornecer uma prova mais elegante", e não em romper realmente do zero.

Isso revela, na verdade, o verdadeiro ponto forte da Teamwork:

Ele não buscou compensar a "inteligência ilha" de um único modelo, mas, por meio de jogos e coordenação institucionalizados, curou completamente a deficiência de colaboração dos múltiplos agentes inteligentes, que antes eram desunidos e se conformavam uns aos outros, liberando assim a "inteligência coletiva".

From Theorem to Shell

Desta vez foi realmente o Flash.

O mesmo mecanismo de detecção de diferenças, o Google mudou o modo e foi direto para a engenharia avançada.

Este artigo técnico detalhado especifica claramente "usar o Gemini 3.7 Flash". A equipe construiu do zero um simulador de CPU RISC-V com execução fora de ordem por ciclo.

A execução fora de ordem é padrão em CPUs modernas de alto desempenho e também o ponto mais propenso a causar falhas em simuladores.

O trabalho em equipe segue dois passos: primeiro, garantir que a microarquitetura funcione corretamente, escrevendo sozinho a pipeline fora de ordem e o buffer de reordenação, conseguindo inicializar o sistema operacional xv6 até o Shell; depois, alinhar cronologicamente ciclo a ciclo.

Google

Processo de inicialização do kernel xv6 e entrada no Shell por meio do emulador RISC-V construído pela Teamwork.

O obstáculo mais difícil, que o Google chama de "abismo da execução silenciosa".

O estado da microarquitetura do simulador pode desviar-se silenciosamente em centenas de ciclos, e quando erros são detectados no nível da arquitetura, a origem já não pode ser localizada.

A solução da Teamwork é isolar o simulador de referência Spike em um sandbox para impedir que os agentes colam ou plágio, e realizar simulação coordenada passo a passo, verificando cada etapa.

Finalmente, o simulador executou mais de 100 benchmarks padrão RISC-V e apresentou um erro médio de ciclos de apenas 0,71% em cargas de teste não vistas em comparação com o hardware BOOM.

Google

Google divulga: Alinhamento de ciclo entre o simulador Teamwork e o hardware BOOM, sem erro médio de 0,71% na carga de teste.

No entanto, é importante esclarecer que este é um simulador a nível de software, absolutamente não um projeto de chip RTL, muito menos a fabricação de um chip.

Desenvolvimento aberto real com código autêntico

Na segunda metade da pesquisa em IA, o que importa é a implementação e a aprovação.

Em comparação com matemática e simuladores, a última categoria de resultados parece mais humilde, mas as evidências são as mais robustas.

Eigen é uma biblioteca de álgebra linear de alto desempenho amplamente utilizada no mundo C++.

A equipe identificou uma implementação subótima de multiplicação de vetor de matriz única linha ou única coluna e criou diretamente um caminho rápido SIMD.

No hash table concorrente ParlayHash, o Teamwork introduziu as otimizações do Swiss Table, dobrando o throughput inicial de inserção com 64 threads, aumentando o throughput geral por thread em 1,5 vezes e reduzindo o uso de memória por elemento em 25%.

Essas duas alterações não são apenas pontuações feitas em isolamento, mas sim código real, revisado rigorosamente pelo código aberto e oficialmente integrado ao branch principal por mantenedores externos.

Mais importante do que a pontuação é uma declaração do autor no final de um artigo matemático: a prova foi inicialmente gerada pelo sistema de agente interno Gemini da Google e posteriormente verificada e editada pelo autor.

Os agentes são responsáveis por explorar freneticamente folhas de rascunho infinitas, enquanto os humanos são responsáveis por assinar e aprovar finalmente. Essa é a divisão de trabalho mais realista na pesquisa de IA atualmente.

O próprio Google deixou bem claro: esses problemas originalmente exigiriam meses de trabalho de especialistas de ponta; o Teamwork reduz o ciclo de tentativa e erro, mas o volante e a autoridade final ainda estão nas mãos das pessoas.

Na segunda metade da pesquisa em IA, o que importa já não é quem tem o modelo com mais parâmetros, mas quem montou a melhor equipe de IA.

Quanto mais barato e mais como um produto de uso cotidiano o modelo for, mais valiosa se torna a revisão e a supervisão humanas.

Antes, as pessoas eram as que resolviam problemas. Agora, as pessoas são as que criam e validam os problemas.

Gartner encontrou uma prova manual para Claude e depois descobriu que alguém havia verificado com Lean; ele disse: “Isso é realmente bom”, pois “recentemente tenho errado com mais frequência”.

Mesmo a prova do ganhador do Prêmio Turing de 88 anos precisa passar pelo verificador; as provas escritas por IA não podem ser exceção.

Na tarefa de resolver problemas, a máquina fará cada vez mais. Para a fase de aceitação, alguém precisa sempre estar presente.

Referências:

https://antigravity.google/blog/teamwork-when-ai-becomes-a-research-partner

https://www-cs-faculty.stanford.edu/~knuth/papers/claude-cycles.pdf

Este artigo é do número oficial do WeChat "Nova Inteligência", autor: Apocalipse da ASI, editor: Yuan Yu

Aviso legal: as informações nesta página podem ter sido obtidas de terceiros e não refletem necessariamente os pontos de vista ou opiniões da KuCoin. Este conteúdo é fornecido apenas para fins informativos gerais, sem qualquer representação ou garantia de qualquer tipo, nem deve ser interpretado como aconselhamento financeiro ou de investimento. A KuCoin não é responsável por quaisquer erros ou omissões, ou por quaisquer resultados do uso destas informações. Os investimentos em ativos digitais podem ser arriscados. Avalie cuidadosamente os riscos de um produto e a sua tolerância ao risco com base nas suas próprias circunstâncias financeiras. Para mais informações, consulte nossos termos de uso e divulgação de risco.