Thinking Machines lance le modèle open source Inkling-Small, avec 276 milliards de paramètres totaux et 12 milliards de paramètres activés, utilisant une architecture MoE et une conception native multimodale. Ce modèle dépasse la première génération d’Inkling sur des benchmarks de mathématiques, de raisonnement et de codage d’agents avec seulement un quart de sa taille. Il atteint cette performance supérieure grâce à un distillation et deux semaines d’entraînement par renforcement, réduisant considérablement la barrière à l’entrée pour l’adaptation du modèle, permettant même aux équipes de taille moyenne de le personnaliser. Malgré le départ de quatre des six cofondateurs, l’équipe maintient un rythme de publication fréquent dans la turbulence.Auteur et source de l'article : 36Kr
Thinking Machines lance le modèle open source Inkling-Small, qui dépasse la version initiale
Après le lancement du premier modèle Inkling, un tout nouvel IA fait sensation !
Aujourd'hui, Thinking Machines lance officiellement son deuxième modèle majeur : Inkling-Small.
276 milliards de paramètres totaux, 12 milliards de paramètres activés, multimodal natif, contexte de 1 million de tokens

Il y a deux semaines, le premier Inkling open source de 975B a fait son apparition et a soulevé une vague dans le monde de l'IA.
Inkling-Small a directement dépassé les performances du « géant des billions » en n'utilisant qu'un quart de sa capacité.


Sur ARC-AGI-2, Inkling-Small bat le SOTA open source
Revenons sur les derniers jours de Thinking Machines, l'intrigue a été des plus mouvementées.
Deux jours seulement après l'annonce officielle de son départ par le cofondateur Weng Li, OpenAI a confirmé son retour — pour diriger les efforts sur l'« amélioration récursive de soi » (RSI).

Le résultat est arrivé le troisième jour : l'entreprise, venant de perdre un de ses principaux atouts, a directement publié les « poids complets » du nouveau modèle.
Nouvelle arrivée d’Inkling-Small, 276B bat les billions
Dans la présentation du compte officiel, Inkling-Small est un modèle d'architecture MoE avec un total de 276 milliards de paramètres et 12 milliards de paramètres activés lors d'une inférence unique.
Compared to the first-generation Inkling, the size has been directly reduced to one-quarter.
Comme l'a dit Horace He, le grand expert de PyTorch, « Inkling-Small n'a pas besoin de mobiliser tout le village ; il suffit simplement de reprendre les technologies précédentes ».
Le plus impressionnant est que, malgré une réduction de la taille, la capacité globale s'est considérablement améliorée.

Dans les benchmarks de mathématiques, raisonnement, codage d'agents et multimodalité, Inkling-Small est à la hauteur, voire supérieur à Inkling et DeepSeek V4 Flash.

Sur les trois indicateurs principaux HLE, Terminal-Bench et IFBench, Inkling-Small offre une performance supérieure par FLOP par rapport à Inkling.
On peut voir que la courbe d'Inkling-Small reste constamment sous celle d'Inkling.


Du côté multimodal, il n’a presque pas été en retard : compréhension de graphiques, raisonnement visuel, compréhension vocale, raisonnement sur de longs fichiers audio. Inkling-Small a obtenu des résultats « proches » de la version originale lors des évaluations, avec un coût bien inférieur.
Les autres résultats de benchmark sont les suivants :

Un modèle dont le volume est seulement un quart a dominé son aîné dans les tâches d'inférence et d'agent.
Détails de l'entraînement postérieur, entièrement publiés
Pour savoir comment y parvenir, l'équipe officielle a fourni des instructions détaillées, avec deux étapes clés.

Le démarrage de l'entraînement de Inkling-Small a eu lieu plus tard que celui de Inkling, ce qui lui a permis de bénéficier de toutes les erreurs précédentes —
Les proportions des données de pré-entraînement ont été modifiées, et la recette d'apprentissage automatique a été affinée à nouveau.
Plus important encore, il s'agit de deux étapes.
Étape 1 : Utilisez Inkling comme enseignant pour effectuer une distillation on-policy, puis générer un point de contrôle de prévisualisation.
Étape deux : l'agent a poursuivi pendant deux semaines entières l'apprentissage par renforcement par codage à partir de ce point de contrôle, ce qui a conduit au résultat « l'élève dépasse le maître ».
En seulement deux semaines, il a rattrapé le retard et même pris la tête.
Cela signifie que Thinking Machines a directement mis en place une chaîne de production capable de générer des modèles de manière répétée. Le premier modèle est une œuvre, le second est une preuve de capacité de production.
12 milliards d'actifs activés constituent le véritable point de bascule
Pour la grande majorité des développeurs, ce qui compte vraiment, c’est de savoir s’ils peuvent l’utiliser.
Le seuil d'Inkling est très élevé ; le point de contrôle BF16 exige un minimum de 2 To de mémoire vidéo agrégée —
La configuration exemple est de 8 B300 ou 16 H200 ; même en passant à la version quantifiée NVFP4, il faut au moins 600 Go.

Inkling-Small a abaissé ce seuil de manière significative.
LMSYS le dit clairement : 276B de paramètres totaux avec 12B activés est le point idéal pour l'apprentissage par renforcement, rendant LoRA et l'entraînement à paramètres complets « accessibles ».
Avant, seules les grandes entreprises pouvaient personnaliser des modèles ; maintenant, une équipe de taille moyenne a aussi la possibilité de vraiment l'entraîner pour en faire quelque chose de propre.
Les tests réels montrent que, dans le même environnement avec 8 B200, TP8, NVFP4 et une taille de lot de 1, l'exécution d'Inkling-Small avec SGLang atteint 648 tok/s en décodage avec DSpark, et 288 tok/s sans DSpark.

Quatre des six cofondateurs sont partis, le modèle s'accélère de plus en plus.
En février de l'année dernière, Thinking Machines a fait ses débuts en présentant une liste de six membres du « dream team d'OpenAI » :
Mira Murati, John Schulman, Barret Zoph, Weng Li, Andrew Tulloch, Luke Metz.
À l'époque, ils avaient le scénario incroyable d'un financement initial de 2 milliards de dollars et d'une évaluation de 12 milliards de dollars.
Qui aurait pu imaginer que ce financement à une évaluation de 50 milliards de dollars en janvier de cette année s'est finalement avéré un échec, marquant le début d'un tournant ?
Aujourd'hui, il ne reste plus que Murati et Schulman parmi le groupe des six.
Plus intéressant encore, parmi les quatre personnes parties, Zoph et Metz sont revenus à OpenAI, et maintenant Weng Li devient la troisième.
Une entreprise fondée par les « révoltés » de OpenAI, dont les membres clés n'ont finalement pas pu échapper au champ gravitationnel de OpenAI.

Mais ce qui est vraiment dramatique, c'est la réaction de l'équipe face à la turbulence.
Le 15 juillet, Thinking Machines, silencieuse pendant 17 mois, a enfin dévoilé son premier grand modèle : Inkling.
Moins de deux semaines après, Weng Li a annoncé son départ ; seulement trois jours plus tard, un second modèle open source avec un poids complet a été lancé.
Les talents s'échappent de plus en plus vite, les modèles s'envolent de plus en plus rapidement.
Ces deux courbes opposées sont devenues la scène la plus emblématique de l'industrie de l'IA.
Peut-être est-ce là le chemin incontournable vers l'ASI : peu importe le nombre de personnes qui restent, la roue de la machine ne fera que tourner de plus en plus vite.
Thinking Machines lance le modèle open source Inkling-Small, avec 276 milliards de paramètres totaux et 12 milliards de paramètres activés, utilisant une architecture MoE et une conception native multimodale. Ce modèle dépasse la première génération d’Inkling sur des benchmarks de mathématiques, de raisonnement et de codage d’agents avec seulement un quart de sa taille. Il atteint cette performance supérieure grâce à un distillation et deux semaines d’entraînement par renforcement, réduisant considérablement la barrière à l’entrée pour l’adaptation du modèle, permettant même aux équipes de taille moyenne de le personnaliser. Malgré le départ de quatre des six cofondateurs, l’équipe maintient un rythme de publication fréquent dans la turbulence.Source : XinZhiYuan
