Muito competitivo.
Só passaram 3 dias de setembro e já foram lançados cinco modelos avançados!
Fable 5.1 e Mythos 5.1 da Anthropic, Gemini 3.8 Flash e Cyber do Google, e Muse Spark1.3 da Meta... RSI, certamente já chegou.
Na noite passada, logo após o Gemini 3.8 Flash da Google se tornar o novo líder leve, a Meta veio desafiar.
Zuckerberg anuncia oficialmente no X: o Muse Spark 1.3 foi lançado hoje oficialmente, trazendo uma experiência quase tão barata quanto gratuita, com desempenho de ponta. Este é o maior avanço que já alcançamos em programação e agentes inteligentes!

Alexandr Wang, líder do Superintelligence Lab da Meta, também publicou três posts no X, revelando a principal arma desta "carta na manga".
Ele afirmou que, em comparação com o Muse Spark 1.2, o Muse Spark 1.3 reduziu rodadas inválidas, diminuiu em cerca de 20% o número de chamadas de ferramentas e reduziu em cerca de 25% o consumo de tokens, além de manter melhor as exigências em tarefas de longo prazo: “os usuários sentirão claramente este salto”.

Assim que o Muse Spark 1.3 foi lançado, o Gemini 3.8 Flash, lançado ontem à noite, ficou um pouco embaraçado.
Os resultados mostram que o aumento deste Muse Spark 1.3 foi maior.
Ele não apenas superou o GPT-5.6 Sol e o Fable 5 em desempenho, mas o índice de inteligência Artificial Analysis sob a intensidade de inferência Max atingiu 62 pontos, entrando com certeza no atual grupo de elite.

Em cinco meses, a Meta já iterou quatro versões do Muse Spark sem perceber.
Alexander Wang ridicules Google: "Breathe the exhaust of other models"
Recentemente, o primeiro escalão de IA está muito lotado. O GPT-5.6 ocupa o trono, o Fable 5.1 está surgindo rapidamente e o Gemini 3.8 Flash está ultrapassando na curva.
O lançamento do Muse Spark 1.3 desorganizou completamente todos.
No benchmark DeepSWE v1.1, que melhor reflete a verdadeira capacidade de programação de longo prazo do modelo, o Muse Spark 1.3 superou diretamente o Opus 5 e o GPT-5.6 Sol, deixando para trás o recém-lançado Gemini 3.8 Flash e obtendo a pontuação mais alta atual.
Muse Spark 1.3: 75,4 pontos
Claude Opus 5: 74,0 pontos
GPT-5.6 Sol: 73.0 pontos

Além disso, o Muse Spark 1.3 também demonstrou desempenho notável em outras métricas-chave de desenvolvedores.
No SWEAtlas CodeBase QnA, ele obteve 59,4 pontos, superando o GPT-5.6 Sol e o Opus 5.
No Terminal-Bench 2.1, ele obteve 88,8 pontos.
No MRCR 512K-1M, ele obteve uma impressionante pontuação de 98,1! (Para comparação, o GPT-5.6 Sol obteve apenas 73,8 nessa métrica — uma dominação absoluta.)

Em termos de capacidade do agente, ele praticamente alcançou os níveis mais avançados, apresentando apenas uma pequena diferença de alguns pontos percentuais em relação ao Opus 5 em testes como JobBench e OSWorld.

Na Artificial Analysis, o Muse Spark 1.3 deixou claramente para trás o Gemini 3.8 Flash.
Na pontuação do índice inteligente, obteve 62 pontos, empatando com o Claude Fable 5 e entrando entre os melhores.

Em termos de custo mais relevantes para desenvolvedores, o custo de entrada do Muse é 8 vezes menor que o do Fable 5, e o custo de saída é quase 12 vezes menor, oferecendo o melhor custo-benefício.
Diante desse desempenho brilhante, o chefe de IA do Meta, Alexandr Wang, simplesmente disparou: “No índice inteligente Artificial Analysis, o Gemini não é nada, só consegue respirar a fumaça dos modelos dos outros.”
O Google realmente caiu em desgraça.

Alguns brincam: “O Google trabalhou duro por quatro meses e lançou quatro versões do Gemini Flash, enquanto a Meta iterou quatro vezes o Muse Spark⁺ em cinco meses. Mas o Google mal liderou por algumas horas quando a Meta o ultrapassou — essa trama é incrível.”

Menos é mais: um monstro de desempenho por US$ 1 por 2 horas
Ter um alto desempenho é certamente impressionante, mas no mundo da IA de hoje, o que realmente entusiasma os desenvolvedores é sempre algo útil e barato.
O Muse Spark 1.3 é chamado de rei da relação custo-benefício porque não apenas é rápido, mas também economiza muito.
Como Alexandr Wang disse, o Muse Spark 1.3 é "barato demais para ser mencionado", "desempenho de ponta, com custo apenas uma fração".


Ele seguiu um caminho completamente diferente do habitual dos grandes modelos: “força bruta gera milagres, empilhar parâmetros loucamente” — fez uma redução.
O Muse Spark 1.3 foi treinado especificamente para programação de longo prazo e melhor capacidade de seguimento de instruções, reduzindo rodadas de interação desnecessárias e tornando as saídas mais concisas.

Ficou mais inteligente e direto, com um estilo de código mais limpo e menos enrolação.
E a consequência direta desse subtração é uma queda acentuada nos custos.
Abaixo está um caso real de teste muito impressionante.
O desenvolvedor @SPAC89 comparou o Muse Spark 1.3 Ultra Contributor Mode com o Fable 5.1 xHigh.

O prompt fornecido por ele inclui uma regra rígida de "autoaperfeiçoamento": se a pontuação dada por avaliadores independentes for inferior a 9,5/10, o agente deve continuar aprimorando o código e tentar novamente.
Ambos os modelos funcionaram por aproximadamente 2 horas, com resultados surpreendentes.
Muse Spark 1.3 é como um superfuncionário incansável, que simplesmente não para, realizando 20 ciclos de autoaperfeiçoamento, iniciando 3 agentes a cada vez — o equivalente a mais de 60 execuções de agentes em apenas 2 horas.
E o custo total para concluir essa tarefa de raciocínio de longo prazo, extremamente grande e complexa, foi inferior a 1 dólar!

O desenvolvedor exclamou: "Isso ultrapassou completamente minhas expectativas, isso é simplesmente uma obra de arte!"
Em termos de precificação macro, a Meta demonstrou grande sinceridade. O novo modelo oferece mais recursos sem aumentar os preços, mantendo a tarifa de US$ 1,25 por milhão de tokens de entrada e US$ 4,25 por milhão de tokens de saída.

Em termos de precificação, a versão contribuidor do Muse Spark 1.3, "muse-spark-1.3-contributor", é o piso dos preços dos modelos estrangeiros. (A contrapartida é usar os dados para aprimorar os produtos da Meta.)

O fundador e desenvolvedor da Codedamn, Mehul Mohan, disse diretamente:
O nível de preços dos contribuidores do Muse Spark 1.3 é simplesmente absurdo e irreal — este é o tipo de coisa que os laboratórios de IA dos EUA fazem « DeepSeek Momento de precificação.

Na estatística da Artificial Analysis, entre modelos com nível de inteligência equivalente (pontuação acima de 59), o custo unitário do Muse Spark 1.3 é de apenas US$ 0,55, sendo a solução absolutamente ideal.
Para comparação, o Grok 4.6 com inteligência igual (61 pontos) custa 0,94 dólares, o GPT-5.6 Sol exige 0,95 dólares e o Claude Opus 5 chega a 1,23 dólares.
Além disso, o desenvolvedor Kartik observou que o Muse Spark 1.3 parece possuir uma capacidade de raciocínio de "profundidade cíclica" semelhante à do Sol e ao Fable.
Ele não gera respostas de imediato, mas sabe realizar inferências lógicas internamente, o que torna sua eficiência de tokens surpreendentemente alta.

A ascensão de Alexandr Wang e a ambição final de Zuck
O surgimento do Muse Spark 1.3 não seria possível sem os operadores por trás dele.
Em julho deste ano, a Meta lançou o Muse Spark 1.1, com foco no contexto ultra longo de 1M e operações de computador.
Em menos de dois meses, a versão 1.3 já elevou a capacidade de codificação de longo prazo ao nível do GPT-5.6.
Essa iteração tão rápida é exatamente o resultado trazido por Alexandr Wang após assumir o Laboratório de Superinteligência do Meta.
Qual é o objetivo final deles? Como Zuckerberg e Alexandr Wang enfatizaram repetidamente: “agentes” e “barato o suficiente para ser ignorado”.
Ou seja, o Meta olha para o próximo vento da ASI — "Engenharia de Agentes".
Alexandr Wang, chefe do Meta AI, afirmou claramente em entrevista à Axios que todas as melhorias de disponibilidade visam servir ao ambicioso plano mencionado repetidamente por Zuck — criar agentes pessoais disponíveis 24/7.

Para que um agente possa lidar com e-mails, escrever código e analisar dados por 24 horas em seu nome, ele precisa atender a duas condições.
1. Extremamente inteligente e estável: precisa suportar linhas de conversa muito longas (longas threads) e ser capaz de processar vários fluxos de trabalho em paralelo.
Quando o comando for ambíguo, deve saber fazer perguntas proativas; quando encontrar obstáculos, deve saber buscar ajuda humana; antes de executar operações críticas, deve saber confirmar. Acima de tudo, não gerar ilusões.
2. Extremamente barato: se o custo de executar um agente pessoal por um dia chegar a dezenas de dólares, ele nunca será mais do que um brinquedo para poucos.
A chegada do Muse Spark 1.3 é, em essência, abrir caminho para agentes pessoais 7×24.
É como um engenheiro sênior experiente: você dá um objetivo, e ele planeja sozinho, corrige erros sozinho e entrega sozinho.
Para isso, Sun Zhiqing, ex-aluno da Universidade de Pequim e pesquisador do Meta, revelou que a equipe do Meta realizou novamente o pós-treinamento do modelo anterior Avocado, alcançando melhor escalonamento nos testes.

Por trás da celebração: fomos enganados pelo “manipulação de ranking”?
No entanto, o Muse Spark 1.3 também foi questionado.
A renomada instituição de IA BridgeMind publicou uma frase reflexiva:
Gemini 3.8 Flash e Muse Spark 1.3 foram lançados hoje simultaneamente. Ambos parecem excelentes nos testes de referência.
Muse Spark 1.3 está empatado com Fable 5 no índice inteligente... Eu gostaria de me sentir empolgado. Mas não estou.
Porque, este mês, os lançamentos de IA foram idênticos, as pontuações dispararam, mas a experiência no mundo real não melhorou em nada.
Isso é frustrante. Minha confiança nos benchmarks diminui semanalmente, e minha confiança nos laboratórios que manipulam benchmarks está quase zero.

Esta frase atinge com precisão o ponto fraco da indústria atual de grandes modelos.
Um usuário da internet realizou testes de pressão no Muse Spark 1.3 e no Gemini Flash 3.8z sob restrições 3D em nível de backend, e os resultados expuseram as limitações de ambos os modelos:
Muse Spark 1.4 não é tão bom, e o Gemini Flash 3.5 está apenas manipulando as classificações.

Atualmente, os principais laboratórios caíram no ciclo vicioso de "treinar apenas para obter pontuações". Um modelo lançado sempre é acompanhado por várias imagens de gráficos de radar e capturas de tela de rankings superando os concorrentes.
DeepSWE, Tau3-Bench, GPQA tornaram-se alvos frenéticos de "estudo intensivo" por parte de todas as empresas.
E o Muse Spark 1.3 também revelou sua verdadeira natureza.
No relatório aprofundado da Artificial Analysis, também podemos ver um pequeno retrocesso.
Por exemplo, no teste AA-Omniscience, as versões xhigh e max apresentaram queda. A razão é que sua "taxa de abstenção" aumentou — quando não tem certeza, prefere não responder do que inventar.
Isso reduziu a taxa de ilusões, mas também indica indiretamente que seu repositório absoluto de conhecimento não aumentou tanto quanto sugerem os resultados nos testes.

Na segunda metade dos grandes modelos, o que realmente está em jogo?
Hoje, com o lançamento do Muse Spark 1.3 e do Gemini 3.8 Flash, podemos tirar as seguintes conclusões.
Primeiro, o "benefício de parâmetros" dos modelos base está atingindo seu pico.
O caminho de melhorar a inteligência apenas aumentando o tamanho dos parâmetros está apresentando benefícios marginais cada vez menores.
No futuro, quem conseguir, como o Muse Spark 1.3, introduzir mecanismos de raciocínio semelhantes ao “profundidade cíclica” na arquitetura do sistema e fazer uma “redução extrema” na chamada de ferramentas, obterá um verdadeiro salto na experiência.
Além disso, a engenharia de agentes é o fator decisivo.
A disputa entre grandes modelos já passou de "quem fala melhor" para "quem faz mais trabalho".
A barreira central do futuro não é um único teste de desempenho, mas a capacidade de implementar tarefas de longo prazo a custos extremamente baixos.
Modelos como o Muse Spark 1.3, que conseguem executar 60 ciclos de tentativa e erro por menos de 1 dólar, redefinirão completamente os modelos de negócio.
Referências:
https://x.com/SPAC89/status/2095284969614475744
https://research.meta.ai/blog/introducing-muse-spark-1-3
https://x.com/AIatMeta/status/2095234385129963666?s=20
https://artificialanalysis.ai/zh/models/muse-spark-1-3
https://x.com/EdwardSun0909/status/2095236891574780275?s=20
Este artigo é do canal oficial do WeChat "Nova Inteligência", autor: Apocalipse da ASI
