Trop de concurrence.
Seulement trois jours sont passés en septembre, et cinq modèles de pointe ont déjà été publiés !
Fable 5.1 et Mythos 5.1 d'Anthropic, Gemini 3.8 Flash et Cyber de Google, ainsi que Muse Spark1.3 de Meta... RSI, c'est sûrement arrivé.
Just last night, just as Google's Gemini 3.8 Flash became the lightweight champion, Meta came to challenge it.
Zuckerberg annonce sur X : Muse Spark 1.3 est officiellement lancé aujourd'hui, offrant une expérience presque trop peu coûteuse pour être mesurée grâce à des performances de pointe. Il s'agit de la plus grande avancée que nous ayons réalisée jusqu'à présent en matière de programmation et de travail avec des agents !

Alexandr Wang, à la tête du Superintelligence Lab de Meta, a publié trois messages sur X, révélant la carte maîtresse de ce « coup de tonnerre ».
Il a déclaré que, par rapport à Muse Spark 1.2, Muse Spark 1.3 réduit les tours invalides, diminue le nombre d'appels d'outils d'environ 20 %, réduit la consommation de tokens d'environ 25 %, et maintient mieux les exigences lors de tâches à long terme : « les utilisateurs ressentiront clairement ce saut ».

Dès la sortie de Muse Spark 1.3, Gemini 3.8 Flash, publié hier soir, semble un peu dépassé.
Les chiffres montrent que l'amélioration de Muse Spark 1.3 est plus importante cette fois-ci.
Il ne se contente pas de dépasser GPT-5.6 Sol et Fable 5 en termes de performance, l'indice d'intelligence Artificial Analysis sous puissance d'inférence Max atteint déjà 62 points, entrant sans conteste dans le premier peloton actuel.

Au cours des cinq derniers mois, Meta a itéré discrètement quatre versions de Muse Spark.
Alexandre le Grand se moque de Google : « aspire la vapeur des modèles des autres »
Récemment, le premier échelon de l'IA a été très encombré. GPT-5.6 occupe le trône, Fable 5.1 a fait une entrée remarquée, et Gemini 3.8 Flash dépasse les autres en courbe.
L'apparition de Muse Spark 1.3 a complètement bouleversé tout le monde.
Sur le benchmark DeepSWE v1.1, qui évalue le mieux les capacités réelles de programmation à long terme du modèle, Muse Spark 1.3 dépasse directement Opus 5 et GPT-5.6 Sol, et laisse derrière lui le récemment lancé Gemini 3.8 Flash, en obtenant le score le plus élevé actuel.
Muse Spark 1.3 : 75,4 points
Claude Opus 5 : 74,0 points
GPT-5.6 Sol : 73,0 points

Moreover, Muse Spark 1.3 also demonstrated significant performance in several other key developer metrics.
Dans SWEAtlas CodeBase QnA, il obtient 59,4 points, dépassant GPT-5.6 Sol et Opus 5.
Sur Terminal-Bench 2.1, il obtient un score de 88,8.
Sur MRCR 512K-1M, il a obtenu un score impressionnant de 98,1 ! (Pour comparaison, GPT-5.6 Sol n'a obtenu que 73,8 sur ce point, c'est une domination totale.)

En termes de capacités, il est pratiquement au niveau des dernières avancées, avec un écart de quelques pourcents seulement face à Opus 5 sur des tests tels que JobBench et OSWorld.

Sur Artificial Analysis, Muse Spark 1.3 laisse clairement Gemini 3.8 Flash derrière lui.
Sur l'indice intelligent, il obtient un score de 62, à égalité avec Claude Fable 5, se classant parmi les meilleurs.

En ce qui concerne les coûts les plus surveillés par les développeurs, le coût d'entrée de Muse est 8 fois inférieur à celui de Fable 5, et son coût de sortie est près de 12 fois inférieur, offrant un rapport qualité-prix optimal.
Face à un tel bilan impressionnant, le chef de l'IA de Meta, Alexandr Wang, a directement lancé : « Sur l'indice intelligent Artificial Analysis, Gemini n'est rien du tout et ne peut que respirer les échappements des modèles des autres. »
Google est vraiment tombé en disgrâce.

Certains plaisantent : « Google a travaillé dur pendant quatre mois pour lancer quatre versions de Gemini Flash, tandis que Meta a effectué quatre itérations successives de Muse Spark⁺ en cinq mois. Mais à peine Google avait-il pris la tête quelques heures, qu’il a été dépassé par Meta — une intrigue absolument fascinante. »

Moins, c’est plus : une bête de performance à 1 $ pour 2 heures
Un haut score de performance est certes impressionnant, mais dans le monde de l'IA d'aujourd'hui, ce qui excite vraiment les développeurs, c'est toujours la facilité d'utilisation et le prix abordable.
Muse Spark 1.3 est surnommée la reine du rapport qualité-prix car elle ne se contente pas d'être rapide, elle permet aussi de faire de grandes économies.
Comme l'a déclaré Alexandr Wang, Muse Spark 1.3 est « si bon marché qu'il n'en vaut pas la peine », « des performances de pointe pour un coût négligeable ».


Il a emprunté une voie complètement différente de celle des grands modèles précédents, qui consistaient à « faire appel à une puissance brute et accumuler follement des paramètres » — il a fait preuve de simplification.
Muse Spark 1.3 a été spécifiquement entraîné pour les programmes à long terme et une meilleure capacité à suivre les instructions, réduisant ainsi les cycles d'interaction inutiles et rendant les sorties plus concises.

Il devient plus intelligent et plus précis, avec un code plus propre et moins de bavardage.
La conséquence directe de cette soustraction est une chute vertigineuse des coûts.
Voici un exemple réel et très impressionnant.
Le développeur @SPAC89 a comparé le modèle Muse Spark 1.3 Ultra Contributor avec Fable 5.1 xHigh.

Le prompt qu'il a fourni contient une règle stricte d'auto-amélioration : si la note attribuée par les juges indépendants est inférieure à 9,5/10, l'agent doit continuer à améliorer le code et réessayer.
Les deux modèles ont fonctionné pendant environ 2 heures, avec des résultats étonnants.
Muse Spark 1.3 ressemble à un super employé sans relâche, incapable de s'arrêter, ayant effectué 20 cycles d'amélioration autonome, en lançant 3 agents à chaque fois — l'équivalent de plus de 60 exécutions d'agents en seulement 2 heures.
Et le coût total de cette tâche de raisonnement à long terme extrêmement vaste et complexe est inférieur à 1 dollar !

Ce développeur s'écrie : « C'est complètement au-delà de mes attentes, ce truc est véritablement une œuvre d'art ! »
Sur le plan de la tarification macroéconomique, Meta a démontré un grand sérieux. Le nouveau modèle offre plus de capacité sans augmentation de prix, en conservant les tarifs à 1,25 $ pour un million de jetons d'entrée et 4,25 $ pour un million de jetons de sortie.

En termes de prix, la version contributeur de Muse Spark 1.3, « muse-spark-1.3-contributor », constitue le plancher des prix pour les modèles étrangers. (En contrepartie, les données doivent être utilisées pour améliorer les produits Meta.)

Le fondateur et développeur de Codedamn, Mehul Mohan, a déclaré :
Les tarifs de la couche de contribution de Muse Spark 1.3 sont tout simplement incroyablement irréalistes, c'est ce que les laboratoires d'IA américains appellent « DeepSeek Le moment du prix.

Selon les statistiques d'Artificial Analysis, parmi les modèles ayant un niveau d'intelligence équivalent (score supérieur à 59), le coût unitaire de Muse Spark 1.3 n'est que de 0,55 $, ce qui en fait la solution optimale absolue.
Pour comparaison, Grok 4.6 avec une intelligence équivalente (61 points) coûte 0,94 $, GPT-5.6 Sol nécessite 0,95 $, et Claude Opus 5 atteint même 1,23 $.
Même selon le développeur Kartik, Muse Spark 1.3 semble posséder une capacité de raisonnement en « boucle profonde » similaire à celle de Sol et Fable.
Il ne génère pas de réponses en un instant, mais sait effectuer des déductions logiques en interne, ce qui lui confère une efficacité token étonnante.

L'ascension d'Alexandr Wang, l'ambition ultime de Petit Zuck
La sortie de Muse Spark 1.3 ne serait pas possible sans les traders derrière.
En juillet de cette année, Meta a publié Muse Spark 1.1, mettant en avant un contexte ultra-long de 1M et des opérations informatiques.
En à peine deux mois, la version 1.3 a poussé les capacités de codage à long terme au niveau de GPT-5.6.
Cette itération si rapide est précisément le résultat apporté par Alexandr Wang après avoir pris la direction du laboratoire de super-intelligence de Meta.
Quel est leur objectif ultime ? Comme Mark Zuckerberg et Alexandr Wang ont répété à plusieurs reprises : « agents » et « si bon marché qu’on les ignore ».
Autrement dit, Meta regarde le prochain souffle de l'ASI : « l'ingénierie des agents ».
Alexandr Wang, responsable de Meta AI, a déclaré lors d'un entretien avec Axios que toutes les améliorations de disponibilité visent à réaliser la vision ambitieuse mentionnée à plusieurs reprises par Zuck : créer un agent personnel disponible 24/7.

Pour qu’un agent puisse traiter vos e-mails, écrire du code et analyser des données 24 heures sur 24, il doit répondre à deux conditions.
1. Extrêmement intelligent et stable : il doit gérer des chaînes de conversation très longues (longs threads) et traiter en parallèle plusieurs flux de travail.
Lorsque les instructions sont floues, il doit savoir poser des questions proactives ; lorsqu'il rencontre des obstacles, il doit savoir demander de l'aide à un humain ; avant d'effectuer des opérations critiques, il doit savoir confirmer. Le plus important est de ne pas générer d'hallucinations.
2. Extrêmement bon marché : si le coût d'exécution d'un agent personnel pendant une journée atteint plusieurs dizaines de dollars, il ne pourra jamais être qu'un jouet pour quelques-uns.
L'apparition de Muse Spark 1.3 ouvre la voie aux agents personnels 7×24 heures.
C'est comme un ingénieur chevronné et expérimenté : vous lui donnez un objectif, et il peut planifier, corriger ses erreurs et livrer lui-même.
À cet effet, Sun Zhiqing, ancien étudiant de l'Université de Pékin et chercheur chez Meta, a révélé que l'équipe Meta a effectué un nouveau fine-tuning du modèle Avocado précédemment développé, réalisant ainsi de meilleures performances lors des tests de mise à l'échelle.

Derrière la fête : avons-nous été trompés par le « trafic de classement » ?
Cependant, Muse Spark 1.3 a également été remis en question.
L'organisation d'IA renommée BridgeMind a partagé une réflexion profonde :
Gemini 3.8 Flash et Muse Spark 1.3 sont publiés aujourd'hui en même temps. Les deux semblent excellents sur les tests de référence.
Muse Spark 1.3 est actuellement ex aequo avec Fable 5 sur l'indice intelligent… Je voudrais être enthousiaste. Mais je ne l'ai pas été.
Parce que les publications d'IA ce mois-ci sont identiques, les notes ont explosé, mais l'expérience dans le monde réel n'a pas progressé.
C’est frustrant. Ma confiance dans les benchmarks diminue chaque semaine, et ma confiance dans les laboratoires qui manipulent les benchmarks est presque nulle.

Ce message cible précisément les points douloureux actuels de l'industrie des grands modèles.
Un internaute a effectué des tests de charge sur Muse Spark 1.3 et Gemini Flash 3.8z sous des contraintes 3D au niveau du backend, révélant les limites réelles des deux modèles :
Muse Spark 1.4 n'est pas si bon, et Gemini Flash 3.5 ne fait que tricher dans les classements.

Actuellement, les principaux laboratoires sont pris dans un cercle vicieux consistant à entraîner des modèles uniquement pour obtenir de bons scores. Chaque publication de modèle est accompagnée de plusieurs graphiques radar et captures d'écran de classements prétendant surpasser les concurrents.
DeepSWE, Tau3-Bench, GPQA sont devenus les cibles favorites des « révisions intensives » de chacun.
Mais Muse Spark 1.3 a également laissé transparaître ses faiblesses.
Dans le rapport approfondi d'Artificial Analysis, nous pouvons également observer un léger recul.
Par exemple, lors du test AA-Omniscience, les versions xhigh et max ont connu une baisse. Cela s'explique par une augmentation de leur « taux d'abstention » : lorsqu'elles ne sont pas sûres, elles privilégient de ne pas répondre plutôt que d'inventer des informations.
Cela a réduit le taux d'hallucinations, mais indique également que son stock absolu de connaissances n'a pas progressé aussi considérablement que ses performances sur les tests.

La seconde moitié des grands modèles, qu'est-ce qui est vraiment en jeu ?
Aujourd'hui, avec le lancement de Muse Spark 1.3 et Gemini 3.8 Flash, nous pouvons tirer plusieurs conclusions.
Tout d'abord, le « bénéfice des paramètres » des modèles de base atteint son pic.
Le chemin consistant à augmenter uniquement la taille des paramètres pour améliorer l'intelligence présente des rendements marginaux de plus en plus faibles.
À l'avenir, celui qui pourra, comme Muse Spark 1.3, introduire dans l'architecture système un mécanisme d'inférence similaire à la « profondeur cyclique » et effectuer une « réduction » extrême dans l'appel aux outils, obtiendra une véritable amélioration de l'expérience.
De plus, l'ingénierie des agents est la clé du succès.
La bataille des grands modèles est passée de « qui parle le mieux » à « qui travaille le mieux ».
Le véritable avantage concurrentiel futur ne réside pas dans une seule note de performance, mais dans la capacité à mettre en œuvre des tâches à long terme à un coût extrêmement faible.
Des modèles comme Muse Spark 1.3, capables d'effectuer 60 boucles d'essais-erreurs pour moins de 1 dollar, redéfiniront complètement les modèles économiques.
Références :
https://x.com/SPAC89/status/2095284969614475744
https://research.meta.ai/blog/introducing-muse-spark-1-3
https://x.com/AIatMeta/status/2095234385129963666?s=20
https://artificialanalysis.ai/zh/models/muse-spark-1-3
https://x.com/EdwardSun0909/status/2095236891574780275?s=20
Cet article provient du compte officiel WeChat « Nouvelle Intelligence », auteur : Apocalypses de l'ASI
