Organisé et compilé par Shenchao TechFlow

Invités : Jordan et Max, analystes chez SemiAnalysis
Animateur : Jordan (Dialogue interne de SemiAnalysis)
Source du podcast : SemiAnalysis
Titre original : [Épisode d'urgence] Kimi K3 de Moonshot est arrivé ! La Chine dispose d'un modèle de pointe
Date de diffusion : 18 juillet 2026
Résumé des points clés
Moonshot (L'Autre Face de la Lune) lance Kimi K3, qui dépasse Google et Meta sur plusieurs benchmarks globaux, devenant le troisième meilleur modèle au monde, derrière Fable d'Anthropic et Soul 5.6 d'OpenAI. Les deux analystes de SemiAnalysis, Jordan et Max, ont décrypté les implications de ce lancement dans un programme d'urgence : un modèle de 2,8 T paramètres est proposé au même prix que Sonnet (3/15 par million de jetons) ; s'il est de la même taille que les modèles propriétaires de pointe, alors les marges bénéficiaires d'Anthropic à 10/50 pourraient être de niveau ahurissant.
Un jugement plus tranchant vient de Jordan : l'écart de pointe se réduit, ce qu'il attribue aux restrictions imposées par le gouvernement américain sur la publication des modèles les plus puissants d'Anthropic/OpenAI, créant artificiellement une fenêtre de temps pour les poursuivants. L'open source n'a pas vraiment rattrapé le retard. Dans le même temps, l'open source occidental est complètement vide : aucun modèle open source d'entreprise américaine ne parvient à rivaliser avec le cinquième meilleur modèle chinois. La concurrence entre modèles devient une compétition en matière d'exploitation (utilisation d'outils) et géopolitique.
Résumé des points de vue intéressants
À propos de la position de Kimi K3
- Si vous consultez le classement global de tous les principaux benchmarks, il y a aujourd'hui un top trois très clair : Fable, Soul 5.6 et Kimi K3. Ils restent systématiquement au-dessus de tous les autres, y compris DeepSeek, ainsi que Google, Meta et xAI.
- Google devrait particulièrement se sentir très gêné. En novembre et décembre 2025, tout le monde croyait encore que les trois géants de l'IA étaient Google, Anthropic et OpenAI. Aujourd'hui, en discutant avec certains « vieux rétrogrades », ils pensent encore ainsi, mais il est évident que ce n'est plus le cas.
- Cela pourrait être le deuxième meilleur modèle au monde, car chaque fois que j'essaie de faire quelque chose de sérieux avec Fable, je me fais refuser et rediriger vers Opus. Même si je ne suis pas sûr qu'il soit meilleur qu'Opus, du moins je n'ai pas de refus.
À propos de la marge bénéficiaire des modèles de pointe
- If Kimi is unlikely to be selling K3 at 3/15 at a loss, then Fable, with a similar scale, charging 10/50, should completely alleviate concerns that AI labs are unprofitable businesses. Selling tokens at API prices may even be more profitable than SaaS.
- Le prix est passé de 0,95/4 à 3/15, soit une augmentation de plus de trois fois, passant de K2,7 à K3. Mais je ne pense pas qu'ils aient encore beaucoup de marge pour augmenter les prix, car de nombreuses tâches peuvent être réalisées avec GLM ou MiniMax M3.
Sur le gouvernement américain et l'écart
- Je crois que ce rapprochement s'explique squarely par les restrictions imposées par le gouvernement américain à Anthropic, ce qui nous empêche d'accéder aux modèles les plus puissants de ces entreprises. Ils se sont rattrapés artificiellement.
- Nous ne pouvons accéder à l'intelligence avancée que si elle est autorisée. Cela représente en réalité une opportunité pour les joueurs classés quatrième, cinquième, sixième et septième.
About Western open-source vacuum
- Je suis choqué que, alors que le marché est encore si inefficace, nous n'ayons pas encore une seule entreprise américaine capable de rattraper au moins la cinquième meilleure entreprise chinoise.
- Même si le gouvernement n'interdit pas les modèles open source chinois, les grandes entreprises américaines ordinaires ne souhaitent pas alimenter leurs données propriétaires dans des modèles open source chinois. Même si vous chargez les poids dans un centre de données isolé, le PCC ne voit pas vos données, mais les cadres supérieurs ne seront pas convaincus.
À propos de Harness
- Testez Kimi K3 pour la première fois examiner sérieusement Open Code, Hermes et Pi. Harness est toujours une partie du produit.
- Des éléments simples peuvent me faire choisir ce modèle plutôt qu'un autre : puis-je l'installer sur un serveur SSH distant ? Les raccourcis clavier sont-ils pratiques ? Ces détails dans les harness influencent réellement où je fais envoyer mes jetons, c'est-à-dire où je dirige mon budget.
À propos de "c'est encore trop tôt"
- La semaine dernière, j'étais à l'ICML, et la semaine précédente, à la conférence AI Engineer. C'est une conférence sur l'IA en nom, mais plus de 80 % des participants n'avaient jamais entendu parler de SemiAnalysis. Vous prétendez travailler dans l'IA, mais vous n'avez même pas lu SemiAnalysis ? Nous sommes encore trop en avance.
Kimi K3 est-il le troisième meilleur modèle au monde ?
Jordan : Commentaire rapide, Kimi K3 est-il maintenant le troisième meilleur modèle au monde ?
Max : La réponse est clairement « oui ». Tout le monde aime critiquer les benchmarks, et les benchmarks ont effectivement des défauts, mais si vous examinez le classement global de tous les principaux benchmarks, leurs orientations sont toujours correctes. Aujourd'hui, il y a un top trois très clair : Fable, Soul 5.6 et Kimi K3, qui restent systématiquement au-dessus de tous les autres, y compris les acteurs open source comme DeepSeek, et nettement au-dessus de Google, Meta et xAI. C'est un accomplissement exceptionnel pour l'équipe de Moonshot.
Google devrait particulièrement se sentir très gêné. En novembre et décembre 2025, tout le monde pensait encore que les trois géants de l'IA étaient Google, Anthropic et OpenAI. Aujourd'hui, en discutant avec certains « vieux rétrogrades », ils pensent encore ainsi, mais il est évident que ce n'est plus le cas.
Overall, I still think it’s not as good as Fable and Soul 5.6. It’s a bit funny that they explicitly said so in their own model release blog. Maybe it’s old-school Chinese modesty, or maybe they didn’t want to attract scrutiny from the U.S. government, especially since the release of Fable 5.6 was also somewhat delayed. But regardless, it’s very impressive.
Jordan : Ils ont écrit dans la section limitations du blog : « Bien que K3 soit globalement un modèle hautement compétitif, il existe toujours un écart notable avec Fable 5 et GPT 5.6 en termes d'expérience utilisateur. » Mon expérience personnelle est qu'il est effectivement bon, mais il est vraiment lent, ce qui est agaçant. Cela m'a poussé pour la première fois à essayer un harness open source. Honnêtement, j'ai appris plus sur les harness que sur les modèles eux-mêmes, car tous ces modèles sont suffisamment bons pour accomplir les tâches basiques que je fais actuellement, et j'ai du mal à trouver des tâches complexes qu'ils ne peuvent pas accomplir.
Cela pourrait être le deuxième meilleur modèle au monde pour moi, car chaque fois que j'utilise Fable pour des tâches sérieuses, je me fais refuser et rediriger vers Opus. Même si je ne suis pas sûr qu'il soit meilleur qu'Opus, le fait de ne pas être refusé est déjà moins frustrant. Cependant, lorsqu'on utilise une clé API avec un paiement à la consommation, on ne se fait jamais refuser — seules les utilisations via la console web ou la recherche approfondie déclenchent les limites. Ils n'ont visiblement pas assez de GPU pour répondre à la demande générée par ce modèle. Avant, ce problème était résolu par une stratégie open source : ils publiaient les poids pour que d'autres les servent. Mais cette fois-ci, ils n'ont pas encore libéré les poids, et ils disent qu'ils les libéreront dans 10 jours.
Pourquoi retarder l'ouverture des poids de 10 jours ?
Jordan : Quelle est selon toi la stratégie de ce retard ?
Max : Pour être clair, ce sont uniquement mes hypothèses. Une raison majeure pourrait être qu'ils ont besoin de donner aux équipes des moteurs d'inférence comme vLLM et SGLang suffisamment de temps pour s'assurer qu'ils peuvent servir ce modèle avec des performances élevées. Si les poids étaient publiés aujourd'hui et que tout le monde les servait avec seulement 20 tokens/seconde, ce serait très néfaste pour leur image. Ils ont maintenant une excellente opportunité d'obtenir une grande couverture médiatique et une adoption massive ; si cette sortie était freinée par des performances médiocres, cela affaiblirait au contraire leur élan.
Une autre possibilité est qu’ils négocient des partenariats de licence avec des fournisseurs de services d’inférence comme Together AI, Fireworks, Nebius et Groq, afin qu’ils utilisent les derniers processeurs tels que le GB300 pour fournir une capacité supplémentaire. Ces deux pistes sont probablement les principales raisons du report de 10 jours.
Bénéfices exponentiels des modèles de pointe
Jordan : Discutons de l'architecture du modèle. Il compte 2,8 T de paramètres, ce qui le rend trop volumineux pour un B200 ; vous avez besoin d'un B300, d'un GB300 ou d'un AMD MI355X pour le servir sur un seul serveur HGX 8-GPU. Bien sûr, vous pouvez implémenter un pipeline parallelism inter-nœuds, mais cela nuirait considérablement aux performances. Seules les personnes disposant des puces les plus récentes peuvent servir ce modèle.
Revenons à ce que vous avez dit à propos de Google : ce modèle atteint une compétitivité de pointe avec 2,8 billions de paramètres, ce qui nous donne en fait quelques indices sur la taille des modèles de pointe propriétaires. S'ils utilisent des modèles de 10 billions de paramètres pour le comparer, ce serait encore plus humiliant. Nous devons supposer qu'il est du même ordre de grandeur que Soul et Fable.
Max : Oui, tu as raison. Je crois toujours en la capacité et la finesse de l'équipe de recherche d'Anthropic. Si quelqu'un sur Twitter affirme que les modèles actuels fermés ont 10T de paramètres, et que c'est vrai, alors il serait temps de faire ses valises : le cours d'NVIDIA chuterait de 50 % demain, et ce serait la fin.
Je suis assez certain que Kimi K3 n’est pas beaucoup plus petit que les modèles propriétaires actuels en tête, voire légèrement plus grand. Si c’est vrai, cela confirme encore une fois un point que nous soulignons constamment chez SemiAnalysis : les marges de ces laboratoires propriétaires sont absolument incroyables. Si Kimi ne vend probablement pas K3 à perte au prix de 3/15, comme Sonnet, tandis que Fable, de taille similaire, facture 10/50, alors toute inquiétude concernant la rentabilité des laboratoires d’IA devrait disparaître. Vendre des tokens selon les prix API pourrait même être plus rentable que le SaaS, aujourd’hui.
Jordan : Pas de coûts de personnel, seulement des GPU. Et par rapport aux prix précédents ? Vous avez mentionné le 3/15, mais le prix direct de la version précédente de Moonshot était de 0,95/4, donc le prix est passé de K2,7 à K3, soit une augmentation de plus de trois fois. De quelle marge de hausse disposent-ils encore ?
Max : Je ne pense pas qu'ils aient encore beaucoup de marge pour augmenter les prix. Même à 3/15, beaucoup trouveront cela trop cher. Leurs besoins sont déjà couverts par GLM ou MiniMax M3. Il y a ici une divergence intéressante : ceux comme SemiAnalysis qui ne se soucient pas de consommer les tokens Dylan continueront à utiliser Fable pour presque tout ; tandis que les utilisateurs extrêmement sensibles aux coûts, comme Tesla ou Uber, qui ne dépensent que 200 $ de tokens par semaine, opteront pour la couche de tarification GLM. Alors, qui sont les véritables utilisateurs qui passeront à Kimi K3 ? Peut-être un groupe de personnes philosophiquement attachées à l'open source et souhaitant soutenir de nouveaux modèles. Je ne serais pas surpris que la réponse soit non quant à l'adoption de ce modèle par les grandes entreprises.
Nouvelle architecture et prochaines étapes
Jordan : C'est une nouvelle architecture. 2,8 T de paramètres, avec le delta attention de Kimi, les potential residuals, le stable latent ; c'est essentiellement une version agrandie des modèles précédents, environ deux fois plus grande. Pour K2.5, nous avons vu Cursor l'utiliser comme composer, basé sur le continued pre-training et le MRL, puis sont sortis les checkpoints 2.5, 2.6, 2.6.7, etc. C'est un nouveau modèle de base, mais il est déjà assez complet, sans les bords rugueux typiques des modèles originaux. Et ensuite ? Quand sortira-t-il la version 3.1 ? Le prix changera-t-il ? Y aura-t-il un composer basé sur K3 ?
Max : Il n'y aura probablement pas de composer basé sur K3, car l'équipe de Cursor a décidé de former son propre modèle dès le départ. Concernant K3.1, K3.2, etc., il est probable qu'au cours des deux à trois prochains mois, deux ou trois mises à jour soient publiées, continuant le post-entraînement. Je suppose que les prix resteront inchangés, car ils ne pourront pas exploiter de nouveaux matériels dans les deux à trois prochains mois, et il n'y aura donc pas d'amélioration du débit pour justifier une baisse des prix. Peut-être qu'un ingénieur kernel particulièrement talentueux pourrait réduire les coûts au niveau de DeepSeek V4, mais je doute qu'un modèle de 3T paramètres puisse atteindre ce niveau. Les prix actuels de GLM et de MiniMax sont probablement déjà à la limite de ce que des modèles de 1T à 1,5T paramètres peuvent offrir.
L'open source rattrapera-t-il le closed source ?
Max : La question plus intéressante est de savoir si l'écart entre open source et closed source continuera de se réduire, et si l'open source pourra véritablement atteindre une parité avec les niveaux de pointe. Si cela se produit, cela aura un impact énorme sur notre industrie entière. Qu'en pensez-vous ?
Jordan : Mon avis est que l'écart se réduit maintenant, et la raison en est directement liée aux restrictions imposées par le gouvernement américain sur Anthropic, ce qui nous empêche d'accéder aux modèles les plus puissants de ces entreprises. Ils sont rattrapés artificiellement.
Nous pouvons comparer Mythos et Fable. Je ne peux pas utiliser Mythos, et pour Fable, je dois insister sérieusement pour l'utiliser occasionnellement. 5,6 Soul : selon notre évaluation interne, ce n'est pas le plus grand modèle entraîné par OpenAI, il est plus petit que 4,5. Ils détiennent un modèle encore plus grand. Le résultat est que nous ne pouvons y accéder que si les autorités gouvernementales autorisent l'accès aux technologies d'intelligence avancée.
Cela représente en réalité une opportunité pour les joueurs classés quatrième, cinquième, sixième et septième de lâcher prise dans une certaine limite et de commencer à conquérir des parts de marché, mais sans jamais atteindre la vraie frontière. Je pense que la frontière pourrait faire un grand pas en avant à la fin de cet été, ou bien les orientations politiques pourraient encore changer un peu. Il est aussi possible que nous commencions à découvrir des modalités au-delà du codage, leur permettant véritablement d’explorer ces domaines.
Au passage, mentionnons la sortie d’Inkling de Thinking Machines ; l’entrée audio native me semble très intéressante, un signal pour l’avenir.
Max : Concernant Inkling, l'Occident manque vraiment, vraiment, vraiment d'un modèle open source de qualité. Le marché est encore si inefficace que nous n'avons pas une seule entreprise américaine capable de rattraper le cinquième meilleur modèle chinois — cela me choque. D'une part, l'interdiction totale par le gouvernement américain des modèles open source chinois n'est peut-être qu'une question de temps. D'autre part, même sans interdiction, les grandes entreprises américaines ordinaires ne veulent pas alimenter des modèles open source chinois avec leurs données propriétaires. Même si vous chargez les poids dans un centre de données isolé, où le CCP ne peut pas voir vos données, les cadres supérieurs ne le accepteront pas. Beaucoup d'entreprises se soucient du budget en tokens et ne veulent exécuter que des modèles occidentaux ou non chinois. Inkling est le meilleur OSS occidental que nous puissions obtenir actuellement, mais il est encore très éloigné de la pointe de l'open source — cela me choque.
Jordan : Avant, c'était Neotron, maintenant c'est Inkling. Je pense qu'il y a deux opportunités dans la stratégie d'Inkling : premièrement, ils doivent être meilleurs que la plupart des projets open source chinois pour entrer sur le marché. Deuxièmement, ils doivent aussi surpasser les modèles de niveau deux et trois des laboratoires de pointe, ainsi que Sonnet, car vous pouvez obtenir une intelligence proche de la pointe en utilisant Bedrock ou Foundry, tout en économisant de l'argent avec des modèles propriétaires de niveau deux. Je n'ai jamais bien compris l'angle occidental du « open source pour économiser de l'argent ». Faire progresser les modèles dans des écosystèmes comme Fireworks, Together, Base10 est certainement une bonne chose, mais la majeure partie du marché se situe au niveau gouvernemental.
Conçu pour les accélérateurs nationaux chinois
Jordan : Un autre point à mentionner, le blog K3 indique que des quantifications ont été effectuées lors de la phase SFT, en utilisant nativement MXFP4 et MXFP8 pour les poids et les activations ; selon l'officiel, cela assure une « broad hardware compatibility ». Que d'autres matériels Moonshot pourrait-il encore considérer ?
Max : J'ai une liste de 11 accélérateurs chinois ; vous devriez vous abonner au modèle d'accélérateur de SemiAnalysis pour en savoir plus. Les accélérateurs Huawei Ascend, Baidu Kunlun, Cambricon, Moore Threads, et divers autres puces apparaissent dans les articles scientifiques et dans le code. Faire fonctionner les modèles de pointe sur des accélérateurs nationaux chinois est devenu une priorité nationale en Chine. Si, à la fin de l'année 2025, nous continuons à appeler Google un laboratoire de pointe, il faudra alors aussi désigner Moonshot comme laboratoire de pointe.
Jordan : Pour en revenir à autre chose, mon père est en déplacement en Chine et il dit que tous les hôtels sont complets, car Xi Jinping va bientôt prononcer un discours dans cette région sur le fait que l’IA est la priorité numéro un de la Chine. Ce que vous dites est très juste.
Harness est le produit lui-même
Jordan : La principale leçon que j'ai tirée en utilisant ces modèles, c'est que de plus en plus, il est difficile de distinguer la différence entre utiliser un modèle de pointe avec le mode max thinking et un mode à effort moyen. Dans les tâches quotidiennes, je ne trouve vraiment aucune tâche que ces modèles ne puissent pas accomplir. Mon comportement par défaut est d'activer le mode le plus puissant et le plus exigeant, car je ne me soucie pas du budget de Dylan.
Mais il y a un aspect selon lequel Harness fait lui-même partie intégrante du produit. Tester Kimi K3 m’a pour la première fois amené à examiner sérieusement Open Code, Hermes et Pi. Harness est entièrement une partie du produit. Des détails simples suffisent à me faire choisir ce modèle plutôt qu’un autre : peut-on l’installer sur un serveur SSH distant ? Les raccourcis clavier sont-ils pratiques ? Peut-on modifier les commandes précédentes ? Ces petits détails dans Harness influencent réellement vers où j’envoie mes tokens, c’est-à-dire où je dirige mon budget.
Max : Beaucoup parlent de budget token, mais d'après votre description de flux de travail, même pour les tâches que GLM peut gérer, je préfère les router vers Fable en utilisant Max Intelligence, car le ROI en vaut toujours la peine. Les benchmarks indiquent que de nombreuses tâches peuvent être transférées vers GLM, mais vous préférez toujours rester sur les modèles d'Anthropic ou d'OpenAI.
Jordan : Essentiellement, oui. Mais j'utilise beaucoup de bots Slack, et je ne sais pas quels modèles fonctionnent en arrière-plan. Par exemple, pour l'intégration Slack de Perplexity, si elle commence à acheminer vers K3, vers GLM ou vers Sonnet, cela m'est indifférent. Ce n'est qu'en examinant l'utilisation que j'ai découvert quelle part était occupée par les modèles OpenAI, car c'est une décision prise par elle-même. Cette partie de justification est déterminée par harness.
Max : Cela constitue au contraire une opportunité pour un modèle de tarification basé sur les résultats. Si un laboratoire adopte une tarification basée sur les résultats, il pourrait réaliser une marge brute supérieure à 95 %, car les tâches pour lesquelles vous payez un prix stable peuvent aujourd'hui être traitées pour une fraction du coût.
Jordan : Deuxièmement, je ne pense pas que ces laboratoires aient épuisé toutes leurs idées. Ils peuvent continuer à former des modèles époustouflants pour battre le RSI côté codage, mais ne pas les nous libérer, en maintenant leur « classe inférieure permanente ». Ils peuvent continuer à distiller, nous donner un petit aperçu, tout en explorant d'autres applications comme la génération vidéo, l'audio vers l'audio, la recherche approfondie — des domaines qui ne ressemblent pas au codage. La robotique et les modèles du monde constituent une direction simple. Et si Anthropic changeait son objectif du travail intellectuel au travail physique ? Je ne crois pas qu'ils soient incapables de construire une entreprise durable avec un bon ROI en utilisant la technologie la plus avancée au monde.
Nous sommes encore trop tôt
Max : Même sans parler de cela, j'utilise ces modèles quotidiennement à un niveau très élevé ; mes amis ingénieurs logiciels les utilisent dix fois moins et dépensent dix fois moins. Une personne qui utilise Fable en fait autant qu'une personne qui utilise Sonnet, mais celle qui utilise Fable dépense dix fois plus d'argent, avec une marge brute de 90 %, ce qui soutient la majeure partie de l'activité. Dès que ces personnes commenceront à utiliser des modèles plus grands et à les utiliser davantage, la demande ne fera qu'augmenter, et les modèles n'ont même pas besoin de devenir meilleurs. Ensuite, je dois encore discuter avec mes voisins qui ne sont pas dans la technologie ; parmi eux, je suis certainement 0,1 % ou même 0,01 %, avec peut-être un espace de croissance de 1 000 fois. Revenons à la « courbe de l'oie dorée » de Masa-san (Masayoshi Son).
Jordan : Ce qu'elle dit, « c'est encore trop tôt », est tout à fait correct, et c'est pourquoi je pense que Kimi K3 n'entraînera pas de ralentissement de la croissance nette de l'ARR d'Anthropic et d'OpenAI. Même si une partie des utilisateurs actuels de Fable et 5.6 basculent inévitablement vers Kimi K3, ces utilisateurs seront totalement submergés par ceux qui n'ont pas encore sérieusement testé cette technologie. Ces derniers découvrent chaque jour de nouveaux cas d'utilisation à haut ROI et continueront par défaut d'utiliser 5.6 Soul ou Fable 5 pour débloquer ces nouveaux scénarios. Vous ne verrez pas de ralentissement de la croissance de l'ARR.
Max : Pense à combien de personnes n'ont pas encore souscrit à ce podcast ni suivi SemiAnalysis. La semaine dernière, j'étais à ICML, et la semaine d'avant, j'étais à la conférence AI Engineer, une conférence officiellement dédiée à l'IA, où plus de 80 % des participants n'avaient jamais entendu parler de SemiAnalysis. Tu prétends travailler dans l'IA, mais tu n'as même pas lu SemiAnalysis ? Nous sommes encore trop en avance.
Jordan : C'est une sorte de rappel à l'ordre pour toi-même, Max, prends un moment pour te calmer.
