GPT-6 Astra pontuação quase perfeita no ARC-AGI-3 desperta debate sobre a IAG

iconMetaEra
Compartilhar
AI summary iconResumo
O GPT-6 Astra obteve pontuação quase perfeita no ARC-AGI-3, utilizando um modelo simbólico do mundo para resolver quebra-cabeças complexos melhor que humanos em 96% das tarefas. O teste custou US$ 18.000, com críticos afirmando que ele dependeu de ferramentas externas em vez de verdadeira IAG. Em meio ao crescente interesse em ativos de risco, o desempenho do modelo levanta questões sobre o verdadeiro progresso da IA em comparação com computação de alto custo. Agências de CFT já estão monitorando como os avanços em IA podem impactar estruturas regulatórias.
O GPT-6 Astra chamou a atenção ao obter uma pontuação quase de 100% no teste ARC-AGI-3. O modelo cria automaticamente um sistema algébrico de símbolos DSL para registrar as regras do ambiente, abstraindo o mundo real em símbolos lógicos e códigos causais por meio da geração de "modelos de mundo simbólico" eficientes, construindo um "sandbox virtual" para simulação e inferência antes de agir. No entanto, por trás da alta pontuação estão custos computacionais elevados — US$ 360 por questão e um total de US$ 18.000 para todo o teste. Greg Kamradt, presidente da fundação ARC Prize, observou que a alta pontuação depende do suporte do framework externo Harness e não representa uma verdadeira ruptura em AGI, apenas provando que a IA está ficando mais inteligente.

Autor e fonte do artigo: Leifeng.com

Quebrando o teste de QI da IA! O modelo de mundo simbólico do GPT-6 Astra é uma ruptura ou apenas um esforço com dinheiro?

Cada pergunta gasta US$ 360, o GPT-6 realmente passou no AGI?

O modelo mais poderoso da OpenAI, o GPT-6 Astra, finalmente foi lançado, com avanços surpreendentes em operações de computador, pesquisa científica e defesa cibernética. Entre os muitos resultados notáveis, o que mais gerou discussão pública foi seu desempenho próximo a 100% no teste ARC-AGI-3.

Quebrando o teste de QI da IA! O modelo de mundo simbólico do GPT-6 Astra é uma ruptura ou apenas um esforço com dinheiro?

O que é o ARC-AGI-3? É o ranking global reconhecido na comunidade tecnológica para avaliar a "inteligência" da IA, que você pode entender como o exame de admissão para o clube Mensa da IA.

Este teste consiste inteiramente em problemas de padrões gráficos em constante mudança, impossíveis de decorar; a IA precisa explorar o ambiente, inferir objetivos e identificar padrões por meio de reações imediatas e raciocínio, algo mais avançado em diversos exames e que realmente testa se a IA é apenas uma ferramenta ou verdadeiramente inteligente.

E o GPT-6 Astra passou nesse teste com facilidade; lembre-se de que o modelo anterior, GPT-5.6 Sol, obteve apenas 38,3% de pontuação — trata-se de um salto enorme. Essa inteligência até supera a humana: em 96% dos níveis, sua eficiência operacional foi superior à dos humanos, com uma média de 51,7% menos passos de ação.

Se uma IA, em um ambiente totalmente desconhecido, realmente possuir a capacidade de estabelecer padrões lógicos e resolver problemas, podemos imaginar que, no futuro, ela poderá tomar decisões corretas em condições de direção autônoma totalmente novas ou, diante de um novo vírus desconhecido, rapidamente deduzir a estrutura molecular de um medicamento eficaz.

Para investigar por que o GPT-6 Astra é tão inteligente, a equipe oficial do ARC Prize revisou seus registros de fundo e descobriu que, ao jogar jogos, ele gera modelos de "mundo simbólico" eficientes.

Quebrando o teste de QI da IA! O modelo de mundo simbólico do GPT-6 Astra é uma ruptura ou apenas um esforço com dinheiro?

O modelo de símbolos do mundo é um derivado avançado do "modelo do mundo". Enquanto o modelo do mundo, como um artista, prevê o futuro por meio de imagens; o modelo de símbolos em tempo real é mais como um matemático, abstraindo o mundo real em símbolos lógicos e códigos causais.

Essa tecnologia é amplamente reconhecida como o caminho obrigatório para a IA avançar na raciocínio avançado.

O que é o modelo de símbolo do mundo?

No passado, uma das principais razões pelas quais muitos grandes modelos não obtinham pontuações altas nos testes de referência ARC-AGI era que eles estavam acostumados com a abordagem de “tentativa e erro por força bruta”. A IA dividia a tela do jogo em blocos de pixels, clicava aleatoriamente primeiro, e, se não funcionasse, mudava de direção, contando com a sorte para passar.

Neste modo, mesmo que haja algumas quebras de pontuação, a IA não compreende verdadeiramente nem domina as regras do jogo.

O modelo de mundo simbólico consegue controlar o todo precisamente porque compreende plenamente as leis físicas e as relações de causa e efeito do ambiente ao seu redor, fazendo escolhas por meio de cálculos precisos.

Em testes reais, quando o GPT-6 Astra entra em um jogo gráfico desconhecido, ele começa a fazer inúmeras anotações usando uma DSL criada por ele mesmo — um sistema de símbolos algébricos exclusivo. Por exemplo, ele registra com precisão as regras implícitas potenciais do jogo, uma sequência de instruções a serem executadas e até mapeia com exatidão a trajetória de cada pixel em um sistema de coordenadas.

Esse método de registro algébrico resulta em um estado mundial unicamente determinado; em comparação com a ambiguidade gerada pelas interações em linguagem natural nos modelos anteriores, essa representação simbólica trará uma melhoria épica na precisão.

Então, ele primeiro escreve na mente um lógica de código Python: "Se eu pressionar A, o gráfico gira 90 graus para a esquerda".

Em seguida, ele cria um "sandbox virtual" em sua mente, simulando o plano a seguir. Somente após confirmar que o raciocínio é coerente e impecável, ele executa o primeiro passo no jogo real. É por isso que sua eficiência operacional é muito superior à dos humanos.

Para explorar os limites das capacidades do GPT-6 Astra, a plataforma de teste de equipe vermelha PRO‑LONG o colocou em um sandbox de código, permitindo que a IA escrevesse e executasse código personalizado autonomamente.

Como resultado, o GPT-6 Astra começou a criar ferramentas "personalizadas" para cada jogo. Por exemplo, em um jogo de labirinto complexo com guardas patrulhando, o GPT-6 Astra desenvolveu sozinho um sistema de navegação, adicionou regras de combate, simulou as rotas de patrulha dos guardas e, por fim, usou essa cadeia de ferramentas自制 para prever e validar perfeitamente os resultados.

Nos últimos anos, essa capacidade de inferência simbólica e criação autônoma de ferramentas dependia inteiramente de frameworks externos de hack para funcionar. Os hacks ajudavam o modelo a realizar tradução de imagens, registro de estados e validação de resultados, mas apresentavam desvantagens muito evidentes: a transmissão recíproca de dados entre o modelo e os hacks gerava alta latência; a capacidade de engenharia dos hacks era completamente desconectada do treinamento dos pesos do modelo grande; devido à forte dependência de ambientes de computação em nuvem e scripts externos, essas capacidades avançadas eram difíceis de implantar em hardware de borda e dispositivos locais.

E o GPT-6 Astra agora internalizou grande parte das capacidades da Harness diretamente nos pesos do modelo. O renomado acadêmico Gary Marcus, sempre defensor de modelos do mundo simbólico, não pôde deixar de elogiar o GPT-6 Astra como uma grande vitória para essa abordagem.

Nos últimos um ou dois anos, academia e indústria produziram uma grande quantidade de resultados fundamentais nessa direção, desde Harvard e MIT até o Google DeepMind, todos apostando no "modelo de mundo simbólico". Diante de inúmeras ramificações rumo à AGI, a indústria está alcançando um consenso técnico subjacente.

Com uma pontuação tão alta, a AGI está garantida?

O criador da pergunta regou diretamente com água fria

Curiosamente, enquanto a comunidade inteira celebrava essa pontuação no ranking, Greg Kamradt, presidente da fundação ARC Prize, veio pessoalmente resfriar o entusiasmo, respondendo à declaração do presidente da OpenAI, Greg Brockman, de que “a AGI já chegou”.

Ele é a figura central entre os criadores de questões, e tem a maior autoridade sobre como o benchmark foi projetado e como os escores devem ser interpretados. Do ponto de vista da avaliação, ele acredita que, embora os escores sejam reais, ainda há uma enorme distância entre eles e a AGI.

Até agora, ele já viu várias equipes alcançarem mais de 90% no ARC-AGI-3 usando o Agent Harness, como o PRO-LONG, com um supermemória externa, o Tycho, especialista em raciocínio profundo, e o Prime Agent, capaz de evoluir seu ambiente de programação.

Esses produtos de alta pontuação compartilham uma fórmula técnica comum, composta por cinco componentes principais: memória sem perda, análise programática, teste de hipóteses explícito, estado persistente e cálculos internos de baixo custo.

A memória sem perdas é responsável pela memória, a análise programática pelo raciocínio, a verificação explícita de hipóteses pela dedução, o estado persistente pelo contexto em interações múltiplas e o cálculo interno de baixo custo pela capacidade computacional interna econômica, permitindo que a IA faça tentativas intensivas em ambientes virtuais antes de emitir a resposta correta. Juntos, eles formam um Harness invencível que compensa as deficiências do modelo.

O GPT-6 Astra atingiu quase 100% de desempenho, utilizando o mesmo conjunto luxuoso de Harness, apoiado por um "base de adaptadores de fornecedor" personalizado, que utiliza conversas contínuas e compressão de contexto para sustentar sua cadeia lógica. Cada partida consome 360 dólares em poder de computação caro. Se executado completamente, o custo total de computação chega a um impressionante US$ 18.000 (aproximadamente R$ 135.000)!

Um ser humano pode resolver um quebra-cabeça gráfico em apenas alguns minutos; calculado com base no metabolismo humano de 20W, o custo da energia elétrica é inferior a meio centavo; mesmo considerando o pagamento real de hora de trabalho aos participantes, cada partida custa apenas US$ 12,78, enquanto a IA gasta US$ 360. Será que esse desempenho alcançado com “poder de dinheiro” realmente pode se tornar uma AGI acessível às pessoas comuns?

Claro, o GPT-6 Astra já começou a internalizar gradualmente as capacidades do Harness, e, se continuar a se desenvolver, a capacidade computacional potencial interna do modelo se tornará cada vez mais poderosa. No entanto, como seu processo de raciocínio começou a se tornar opaco, os desenvolvedores não sabem se a IA realmente compreendeu ou simplesmente encontrou caminhos mais eficientes para burlar o sistema.

Voltando à pergunta anterior, o GPT-6 Astra é ou não AGI?

Para essa questão, Greg Kamradt ofereceu, no final de seu artigo extenso, uma resposta profundamente filosófica. Por que os seres humanos são considerados “inteligência geral”? Porque os humanos conseguem se adaptar a qualquer mundo desconhecido — mesmo que um bebê da antiguidade fosse lançado no mundo moderno, ele ainda aprenderia a pegar o metrô e usar um celular. Essa inteligência persiste por milênios, impulsionando continuamente o avanço tecnológico. Mas agora, os exames que a indústria tecnológica exige que os AI passem são apenas um “jogo de correspondência de figuras” organizado para eles.

Isso apenas prova que a IA está ficando mais inteligente, mas não é evidência de que a IAG está chegando.

Aviso legal: as informações nesta página podem ter sido obtidas de terceiros e não refletem necessariamente os pontos de vista ou opiniões da KuCoin. Este conteúdo é fornecido apenas para fins informativos gerais, sem qualquer representação ou garantia de qualquer tipo, nem deve ser interpretado como aconselhamento financeiro ou de investimento. A KuCoin não é responsável por quaisquer erros ou omissões, ou por quaisquer resultados do uso destas informações. Os investimentos em ativos digitais podem ser arriscados. Avalie cuidadosamente os riscos de um produto e a sua tolerância ao risco com base nas suas próprias circunstâncias financeiras. Para mais informações, consulte nossos termos de uso e divulgação de risco.