Claude Fable 5 domina o benchmark de codificação de IA com taxa de sucesso de 64%

icon MarsBit
Compartilhar
AI summary iconResumo
Claude Fable 5 lidera os benchmarks de codificação em IA com uma taxa de sucesso de 64% no MirrorCode, superando o GPT-5.6 Sol e o GPT-5.5. Ele lida com linguagens populares e nichadas, como Go e Ada, com apenas uma queda de 3% no desempenho para estas últimas. O MirrorCode exige cobertura de testes de 100% sem acesso ao código, comprovando as habilidades de reconstrução lógica do Fable 5. À medida que altcoins para acompanhar ganham atenção, o índice de medo e ganância permanece como uma métrica-chave para traders que monitoram o sentimento do mercado.

Desta vez, o Claude realmente dominou o ranking de programação de IA!

Na recém-atualizada classificação do MirrorCode, Claude Fable 5 voltou a ocupar o primeiro lugar com uma taxa absoluta de sucesso de 64%.

GPT-5.6 Sol, que vem em seguida, tem apenas um terço da pontuação!

Em quarto lugar, o GPT-5.5 ficou ainda pior. Além de obter apenas 10% de desempenho, foi até superado pelo seu próprio antecessor, o GPT-5.4.

Programação de IA

Mais surpreendente ainda, ao usar linguagens de alto consumo de recursos como Go, a taxa de resolução do Fable 5 foi de 64%; ao mudar para a linguagem menos comum Ada, o desempenho ainda foi de 61%.

Sabe-se que, no mundo de código aberto, o corpus em Python é cerca de 230 vezes maior que o da Ada.

Mas aqui no Fable 5, o desempenho caiu apenas 3 pontos percentuais.

Programação de IA

Isso fica interessante.

Se o modelo dependesse principalmente da memória da gramática e das estruturas comuns em idiomas populares, então, ao mudar para Ada, os resultados deveriam ter diminuído.

Mas o resultado atual aponta para outra possibilidade—

O modelo mais poderoso já se libertou da dependência de dados específicos e começou a aprender como construir um projeto de software completo do zero.

Travado na linha de conclusão de 100%, teste limite de 10 bilhões de tokens

Especificamente, o MirrorCode completo inclui 25 programas-alvo, abrangendo áreas como ferramentas Unix, interpretadores, consultas de dados, bioinformática e ferramentas de compressão.

Aqui, o modelo será colocado em um ambiente isolado, sem acesso à internet, sem visibilidade do código-fonte do projeto original e sem capacidade de baixar dependências de terceiros. O que ele poderá acessar são apenas documentos de alto nível, alguns testes visíveis e um programa original que pode ser chamado repetidamente.

Em seguida, ele precisa continuar enviando dados ao programa original, observar as saídas para adivinhar a lógica interna e depois Clique aqui Escreva um novo programa com comportamento consistente.

Selecione 15 alvos Medium e Large da lista mais recente. Cada alvo utiliza duas linguagens de implementação, com cada linguagem executada três vezes.

Além disso, a taxa de conclusão dos testes visíveis e dos testes ocultos deve atingir 100% para ser aprovada; 99,9% não é suficiente.

Mesmo que um único caso limite seja ignorado, toda a execução ainda será considerada um fracasso.

Programação de IA

Para forçar o modelo a preencher também as últimas lacunas, o MirrorCode aumentou o orçamento por sessão para 10 bilhões de tokens, permitindo execução contínua por até 7 dias.

A tarefa mais cara no artigo foi ainda mais extrema: o modelo rodou continuamente por 19 dias, com um único custo de US$ 2.600.

Nesses 19 dias, o modelo executará repetidamente o programa original, comparará os resultados, acrescentará funcionalidades e voltará a executar os testes. Se ocorrer um erro, investigará a causa; se a saída não corresponder, alterará as hipóteses; e, uma vez que uma parte seja aprovada, prosseguirá para preencher a próxima lacuna.

Todo o processo é mais como um ajuste contínuo de vários dias do que uma única geração.

Programação de IA

O exemplo do gotree é o mais intuitivo.

Esta ferramenta de bioinformática originalmente tinha cerca de 16 mil linhas de código Go e mais de 40 comandos.

Claude Opus 4.7 gastou 14 horas e US$ 251 para passar em 2.000 de 2.001 testes, alcançando uma conclusão de 99,95%.

Embora tenha ignorado uma borda pouco comum no tratamento de datas, foi bloqueado pela linha de aprovação de 100% do MirrorCode, mas já reduziu o esforço de engenharia, que originalmente era calculado por semana, para apenas algumas dezenas de horas—

A Epoch estima que, sem o uso de IA, engenheiros humanos levariam pelo menos 2 a 17 semanas para concluir a mesma tarefa.

No deserto de materiais, o Fable 5 dropou apenas 3 pontos

O artigo do MirrorCode usou anteriormente a mistura de treinamento pública do StarCoder como referência.

O Python representa cerca de 8%, enquanto a Ada representa apenas 0,034%, sendo o primeiro aproximadamente 230 vezes maior que o segundo.

Programação de IA

Claro, não podemos saber quantos códigos Ada os modelos fechados já viram. Mas, tomando como referência o ecossistema aberto, a escassez de Ada já é suficientemente clara.

Essa linguagem é principalmente utilizada em sistemas aeroespaciais, de defesa e outros sistemas críticos para segurança. Independentemente do tamanho da comunidade, do número de tutoriais ou de projetos de código aberto, está longe de se comparar ao Python, JavaScript ou Go.

E Fable 5 claramente não está traduzindo o código Go linha por linha para Ada.

É mais como primeiro entender exatamente como o programa original funciona e depois recriar o mesmo comportamento em outra linguagem.

Programação de IA

Em comparação, outros modelos não são tão estáveis.

O GPT-5.6 caiu de 24% para 19%, o GPT-5.4 caiu de 21% para 12%, e o GPT-5.5 caiu ainda mais, de 17% para 5%. Ao mudar o idioma, a diferença fica imediatamente ampliada.

Entregar todo o projeto à IA

Atualmente, o Cursor já permitiu que centenas de agentes colaborem por quase uma semana, escrevendo do zero mais de 1 milhão de linhas de código de navegador distribuídas em 1.000 arquivos.

A Anthropic executou em paralelo cerca de 2.000 sessões com 16 agentes Claude, resultando em um compilador C de 100.000 linhas capaz de compilar o kernel Linux 6.9.

Na amostra de usuários individuais do Codex divulgada pela OpenAI até maio, 70,2% enviaram pelo menos uma tarefa estimada em mais de uma hora de trabalho humano; 25,6% enviaram tarefas superiores a oito horas.

As unidades que as pessoas entregam à IA estão passando de um trecho de código, um bug, para uma tarde, uma semana, ou até todo o projeto.

64% do MirrorCode é exatamente uma quantificação desse tipo de "comissão de projeto".

Ele indica que, desde que o objetivo seja suficientemente claro e os resultados possam ser automaticamente validados, modelos de ponta já conseguem concluir sozinhos parte de softwares de médio e grande porte.

Para cada pessoa que está entregando seu trabalho à IA, a mudança já está à porta—

Antes, você precisava ficar observando e escrevendo cada linha de código; agora, é mais provável que você apenas verifique se ele está desviando-se nos pontos críticos.

O código ficará cada vez mais barato.

E aqueles que conseguem explicar claramente os problemas e verificar os resultados com precisão se tornarão cada vez mais valiosos.

Referência: https://epoch.ai/MirrorCode

Este artigo é do número oficial do WeChat "Nova Inteligência", autor: Apocalipse da ASI; editor: Moisés

Aviso legal: as informações nesta página podem ter sido obtidas de terceiros e não refletem necessariamente os pontos de vista ou opiniões da KuCoin. Este conteúdo é fornecido apenas para fins informativos gerais, sem qualquer representação ou garantia de qualquer tipo, nem deve ser interpretado como aconselhamento financeiro ou de investimento. A KuCoin não é responsável por quaisquer erros ou omissões, ou por quaisquer resultados do uso destas informações. Os investimentos em ativos digitais podem ser arriscados. Avalie cuidadosamente os riscos de um produto e a sua tolerância ao risco com base nas suas próprias circunstâncias financeiras. Para mais informações, consulte nossos termos de uso e divulgação de risco.