Desta vez, o Claude realmente dominou o ranking de programação de IA!
Na recém-atualizada classificação do MirrorCode, Claude Fable 5 voltou a ocupar o primeiro lugar com uma taxa absoluta de sucesso de 64%.
GPT-5.6 Sol, que vem em seguida, tem apenas um terço da pontuação!
Em quarto lugar, o GPT-5.5 ficou ainda pior. Além de obter apenas 10% de desempenho, foi até superado pelo seu próprio antecessor, o GPT-5.4.

Mais surpreendente ainda, ao usar linguagens de alto consumo de recursos como Go, a taxa de resolução do Fable 5 foi de 64%; ao mudar para a linguagem menos comum Ada, o desempenho ainda foi de 61%.
Sabe-se que, no mundo de código aberto, o corpus em Python é cerca de 230 vezes maior que o da Ada.
Mas aqui no Fable 5, o desempenho caiu apenas 3 pontos percentuais.

Isso fica interessante.
Se o modelo dependesse principalmente da memória da gramática e das estruturas comuns em idiomas populares, então, ao mudar para Ada, os resultados deveriam ter diminuído.
Mas o resultado atual aponta para outra possibilidade—
O modelo mais poderoso já se libertou da dependência de dados específicos e começou a aprender como construir um projeto de software completo do zero.
Travado na linha de conclusão de 100%, teste limite de 10 bilhões de tokens
Especificamente, o MirrorCode completo inclui 25 programas-alvo, abrangendo áreas como ferramentas Unix, interpretadores, consultas de dados, bioinformática e ferramentas de compressão.
Aqui, o modelo será colocado em um ambiente isolado, sem acesso à internet, sem visibilidade do código-fonte do projeto original e sem capacidade de baixar dependências de terceiros. O que ele poderá acessar são apenas documentos de alto nível, alguns testes visíveis e um programa original que pode ser chamado repetidamente.
Em seguida, ele precisa continuar enviando dados ao programa original, observar as saídas para adivinhar a lógica interna e depois Clique aqui Escreva um novo programa com comportamento consistente.
Selecione 15 alvos Medium e Large da lista mais recente. Cada alvo utiliza duas linguagens de implementação, com cada linguagem executada três vezes.
Além disso, a taxa de conclusão dos testes visíveis e dos testes ocultos deve atingir 100% para ser aprovada; 99,9% não é suficiente.
Mesmo que um único caso limite seja ignorado, toda a execução ainda será considerada um fracasso.

Para forçar o modelo a preencher também as últimas lacunas, o MirrorCode aumentou o orçamento por sessão para 10 bilhões de tokens, permitindo execução contínua por até 7 dias.
A tarefa mais cara no artigo foi ainda mais extrema: o modelo rodou continuamente por 19 dias, com um único custo de US$ 2.600.
Nesses 19 dias, o modelo executará repetidamente o programa original, comparará os resultados, acrescentará funcionalidades e voltará a executar os testes. Se ocorrer um erro, investigará a causa; se a saída não corresponder, alterará as hipóteses; e, uma vez que uma parte seja aprovada, prosseguirá para preencher a próxima lacuna.
Todo o processo é mais como um ajuste contínuo de vários dias do que uma única geração.

O exemplo do gotree é o mais intuitivo.
Esta ferramenta de bioinformática originalmente tinha cerca de 16 mil linhas de código Go e mais de 40 comandos.
Claude Opus 4.7 gastou 14 horas e US$ 251 para passar em 2.000 de 2.001 testes, alcançando uma conclusão de 99,95%.
Embora tenha ignorado uma borda pouco comum no tratamento de datas, foi bloqueado pela linha de aprovação de 100% do MirrorCode, mas já reduziu o esforço de engenharia, que originalmente era calculado por semana, para apenas algumas dezenas de horas—
A Epoch estima que, sem o uso de IA, engenheiros humanos levariam pelo menos 2 a 17 semanas para concluir a mesma tarefa.
No deserto de materiais, o Fable 5 dropou apenas 3 pontos
O artigo do MirrorCode usou anteriormente a mistura de treinamento pública do StarCoder como referência.
O Python representa cerca de 8%, enquanto a Ada representa apenas 0,034%, sendo o primeiro aproximadamente 230 vezes maior que o segundo.

Claro, não podemos saber quantos códigos Ada os modelos fechados já viram. Mas, tomando como referência o ecossistema aberto, a escassez de Ada já é suficientemente clara.
Essa linguagem é principalmente utilizada em sistemas aeroespaciais, de defesa e outros sistemas críticos para segurança. Independentemente do tamanho da comunidade, do número de tutoriais ou de projetos de código aberto, está longe de se comparar ao Python, JavaScript ou Go.
E Fable 5 claramente não está traduzindo o código Go linha por linha para Ada.
É mais como primeiro entender exatamente como o programa original funciona e depois recriar o mesmo comportamento em outra linguagem.

Em comparação, outros modelos não são tão estáveis.
O GPT-5.6 caiu de 24% para 19%, o GPT-5.4 caiu de 21% para 12%, e o GPT-5.5 caiu ainda mais, de 17% para 5%. Ao mudar o idioma, a diferença fica imediatamente ampliada.
Entregar todo o projeto à IA
Atualmente, o Cursor já permitiu que centenas de agentes colaborem por quase uma semana, escrevendo do zero mais de 1 milhão de linhas de código de navegador distribuídas em 1.000 arquivos.
A Anthropic executou em paralelo cerca de 2.000 sessões com 16 agentes Claude, resultando em um compilador C de 100.000 linhas capaz de compilar o kernel Linux 6.9.
Na amostra de usuários individuais do Codex divulgada pela OpenAI até maio, 70,2% enviaram pelo menos uma tarefa estimada em mais de uma hora de trabalho humano; 25,6% enviaram tarefas superiores a oito horas.
As unidades que as pessoas entregam à IA estão passando de um trecho de código, um bug, para uma tarde, uma semana, ou até todo o projeto.
64% do MirrorCode é exatamente uma quantificação desse tipo de "comissão de projeto".
Ele indica que, desde que o objetivo seja suficientemente claro e os resultados possam ser automaticamente validados, modelos de ponta já conseguem concluir sozinhos parte de softwares de médio e grande porte.
Para cada pessoa que está entregando seu trabalho à IA, a mudança já está à porta—
Antes, você precisava ficar observando e escrevendo cada linha de código; agora, é mais provável que você apenas verifique se ele está desviando-se nos pontos críticos.
O código ficará cada vez mais barato.
E aqueles que conseguem explicar claramente os problemas e verificar os resultados com precisão se tornarão cada vez mais valiosos.
Referência: https://epoch.ai/MirrorCode
Este artigo é do número oficial do WeChat "Nova Inteligência", autor: Apocalipse da ASI; editor: Moisés
