Dans la communauté des grands modèles, il est courant de faire des tests en « portant un masque ».
Récemment, un modèle anonyme nommé Ox Alpha est apparu sur OpenRouter. « Ox » signifie « bœuf » ; les internautes chinois lui ont rapidement donné un nom plus familier :
Modèle « Niu Lai ».
Selon les informations divulguées par OpenRouter, Ox Alpha prend en charge 1 million de jetons de contexte, ainsi que des entrées textuelles, d'images et de vidéos, et permet d'appeler des outils ; il est actuellement entièrement gratuit.

Peu après le déploiement, les développeurs l'ont intégré à l'Agent de codage et l'ont testé dans un dépôt de code réel.
Les résultats des tests initiaux indiquent que ce modèle « Niu Lai » d'origine inconnue atteint une performance proche des meilleurs modèles de code actuels.
Dans le même temps, un internaute a révélé qu'un modèle anonyme nommé korrine est en cours de test sur Code Arena. Certains pensent que c'est Kimi K3.1, certains le rattachent à Qwen et MiMo, il y a toutes sortes d'avis.
Le mois d'août dans le monde des grands modèles est soudainement devenu un grand jeu de devinettes.
Le grand modèle « Niu Lai » se distingue par ses performances
Ox Alpha a vraiment attiré l'attention grâce à ses compétences en codage.
Le développeur Ben Davis a extrait 10 tâches de DeepSWE pour les tester ; Ox Alpha en a accompli 8, soit un taux de réussite de 80 %. Les résultats comparatifs publiés montrent que Fable 5 Max obtient 65 %, GLM-5.3 Max et Grok 4.6 xhigh obtiennent tous deux 62 %, et GPT-5.6 Sol Max obtient 52 %.

DeepSWE évalue les compétences réelles en ingénierie logicielle. Le modèle doit lire un dépôt de code, identifier des problèmes, modifier le code, exécuter des tests, puis corriger les erreurs en fonction des retours. Contrairement aux exercices de programmation en une seule étape, il reflète plus fidèlement le travail réel d'un agent de codage.
Cependant, l'échantillon de 10 tâches est petit. Par la suite, d'autres développeurs ont testé sur un autre sous-ensemble de DeepSWE, obtenant des résultats d'environ 63 %. Les domaines des tâches et les configurations d'exécution des deux tests ne sont pas identiques ; il n'est donc pas possible pour l'instant de déterminer avec précision le classement d'Ox Alpha.

Ces résultats préliminaires indiquent que ce modèle anonyme présente déjà un fort potentiel de codage à long terme, approchant les performances des modèles de pointe actuels.
Qui est le propriétaire du grand modèle « Niu Lai » ?
L'identité du modèle « Niu Lai » est actuellement largement répandue comme étant GLM-5.3 Flash, encore non publié par Zhipu, ou la version multimodale de GLM-5.3.
Quelqu’un a même écrit un blog pour en faire une analyse :
1. La preuve la plus convaincante provient de l'encodeur vidéo. Dans quatre vidéos présentant des fréquences d'images, des durées et des résolutions différentes, Ox Alpha consomme exactement les mêmes tokens visuels que GLM-5V-Turbo. MiMo, Qwen et GLM-4.6V affichent tous des résultats nettement différents.
2. Le tokenizer de texte est également très cohérent. Les chercheurs ont testé 25 groupes de prompts, et l'écart de nombre de tokens entre Ox Alpha et GLM-5.3 reste toujours fixe à 75 tokens.
3. D'autres caractéristiques pointent également vers Zhipu. Ox Alpha refuse de traiter les audio, de la même manière que GLM-5V ; le style de réponse, le nombre d'étapes d'exécution de l'Agent et l'interface d'inférence sont également très proches de GLM. Zhipu a précédemment utilisé Pony Alpha pour tester anonymement GLM-5, ce qui constitue un précédent similaire.

https://ox-alpha-evidence-production.up.railway.app/
D'autres internautes ont trouvé des indices dans la conversation.

Ben Davis est à 99 % certain que c'est GLM-5.x.

Ces indices augmentent la crédibilité de ce que dit GLM, mais ne suffisent pas à confirmer l'identité.
À ce jour, OpenRouter et Zhipu n'ont pas répondu publiquement.
L'identité de korrine est encore plus mystérieuse
L'identité du modèle « Niu Lai » reste encore floue, et un modèle anonyme nommé korrine apparaît sur Code Arena.
Au départ, beaucoup ont supposé que c'était Kimi K3.1, car Kimi Avant sa sortie, K3 a été supposé être testé sous le code nom kivine. Étant donné que kivine présente une structure similaire à korrine, cela a suscité des associations.

Cependant, la personne qui a initialement divulgué l'information a ensuite complété que le nouveau modèle Moonshot précédemment mentionné pourrait correspondre à un autre code : adamant-ananke. Korrine pourrait également provenir d'autres équipes chinoises, telles que Qwen.

Dans les commentaires, certains le font également référence à MiMo V3.

Pourquoi les fabricants de grands modèles aiment-ils « porter des masques » ?
Les tests anonymes deviennent un élément essentiel avant la publication officielle des grands modèles.
Cacher les fabricants et les modèles dans l’Arena permet de réduire au maximum les préjugés liés à la marque. Les utilisateurs, ne voyant pas l’identité du modèle, ne peuvent choisir qu’en fonction des performances réelles, et les résultats des combats accumulés reflètent ainsi plus fidèlement l’expérience utilisateur réelle.
OpenRouter propose un autre type d'environnement de test.
Les développeurs intégreront le modèle à divers agents de codage pour le faire interagir avec des dépôts réels, appeler continuellement des outils et gérer des tâches d'ingénierie logicielle durant plusieurs heures. La stabilité du contexte, la fiabilité des appels d'outils et la capacité du modèle à rester sur la bonne voie pendant des tâches de longue durée seront rapidement mises à l'épreuve lors d'une utilisation intensive.
Pour les fabricants de modèles, cela équivaut à un test de pression public. L'équipe peut observer à l'avance les cas d'échec, vérifier la capacité de charge des services d'inférence et accumuler un véritable bouche-à-oreille avant la publication officielle.
De plus, « deviner le modèle » devient de plus en plus un moyen de marketing ; le mystère autour de l’identité permet effectivement de prolonger le cycle de discussion.
Revenons enfin au modèle lui-même. Si Ox Alpha est véritablement un modèle Flash dont les compétences en codage approchent déjà le niveau des meilleurs, où pousserait-on la limite avec une version complète, mieux dotée en ressources et plus complète ?
Lien de référence :
https://x.com/Adidotdev/status/2090833298713096241
https://x.com/davis7/status/2090669483740279155?s=20
https://x.com/davis7/status/2090655207831298095?s=20
https://x.com/MaxForAI/status/2090783750217162788
Cet article provient du compte WeChat « Machine Heart » (ID : almosthuman2014), auteur :關注AI的
