Message de ChainThink, le 22 juillet, Artificial Analysis met à jour le classement AA-Briefcase : Kimi K3 obtient un score de 1543 Elo, derrière Claude Fable 5 avec 1574, mais au-dessus de GPT-5.6 Sol avec 1501, Claude Sonnet 5 et Claude Opus 4.8.
AA-Briefcase exige que le modèle recherche des informations dans près de 2 000 e-mails, enregistrements Slack et documents d'entreprise, et fournisse des tableaux, des présentations et des prototypes d'interface, comprenant 4 projets à long terme et 91 tâches confidentielles.
En ce qui concerne les détails, le taux de passage des exigences objectives de K3 est de 51 %, inférieur aux 56 % de Fable 5 ; la note de qualité d'analyse est de 1754, légèrement supérieure aux 1744 de Fable 5.
Les principaux écarts de K3 se situent dans la présentation des produits finis, en dessous de GPT-5.6 Sol et Opus 4.8. En termes de coût, K3 dépense en moyenne 10,57 dollars par tâche, soit environ 10 fois le coût de Kimi K2.6 ;
Moyenne de 83 tours exécutés, sortie de 120 000 tokens, durée de 56,4 minutes ; le temps nécessaire pour accomplir cette tâche est environ 2,5 fois supérieur à celui de Fable 5.
