Decitron : Le premier modèle d'IA général de prise de décision au monde est lancé

icon MarsBit
Partager
AI summary iconRésumé
Zhongke Wenge a lancé Decitron, le premier modèle décisionnel général au monde, selon MarsBit. Le modèle combine modélisation du monde, simulation multi-agents et raisonnement théorique des jeux pour des décisions en environnement ouvert. Il utilise MetaWorld pour la modélisation structurée des états, SAO pour la représentation des décisions et AutoABM pour le raisonnement. Decitron est censé simuler des scénarios complexes tels que les conflits commerciaux et évaluer les résultats avec des probabilités calibrées. Ce lancement intervient au moment où les préoccupations liées au CFT (Lutte contre le financement du terrorisme) augmentent, avec des implications pour la liquidité et les marchés cryptos.

Générer des réponses devient une capacité fondamentale de l'IA, tandis que déduire le monde réel constitue le défi plus difficile de la prochaine étape.

La prise de décision réelle n'est pas une question à réponse statique. Elle se déroule dans un monde en constante évolution, où plusieurs acteurs agissent simultanément, avec des informations incomplètes et une grande incertitude.

Par exemple, si un nouveau modèle open source fait soudainement chuter les coûts, les entreprises derrière les modèles leaders suivront-elles en réduisant leurs prix ? Comment les fournisseurs de cloud, les développeurs et les entreprises d'applications réorganiseront-elles leurs positions ? Dans de telles décisions, l'action d'une partie modifie les conditions auxquelles les autres sont confrontées, et les réactions nouvelles continuent de redéfinir la situation. C'est comme une partie d'échecs où tous les joueurs posent leurs pièces en même temps : chaque coup modifie immédiatement l'échiquier.

C’est dans ce contexte que, après son lancement, le décisionnaire Decitron de Zhongke Wenge a été qualifié par plusieurs médias technologiques majeurs de « premier modèle décisionnel général au monde ». Ce qualificatif ne souligne pas la première apparition d’une technologie spécifique, comme les modèles du monde, les agents multiples ou la résolution de jeux, mais plutôt le fait que le décisionnaire intègre pour la première fois ces capacités au sein d’un cadre décisionnel unifié orienté vers un monde ouvert, formant une boucle complète de modélisation continue, d’inférence, de résolution et de calibration.

Ce que l'on appelle « universel », c'est sa tentative d'abstraire des problèmes de décision complexes provenant de domaines variés en une structure commune — état du monde, acteurs impliqués, espace d'actions, relations de contraintes, interactions en plusieurs étapes et résultats incertains — et d'effectuer continuellement des déductions et des résolutions au sein de ce même cadre.

Zhongke Wenge

Adresse du rapport technique : https://chinaxiv.org/abs/202608.00064

Le 3 août, le rapport technique complet de Decitron a été publié officiellement, révélant pour la première fois ses trois contributions technologiques clés :

Premièrement, introduire le modèle explicite du monde MetaWorld, qui organise les informations provenant de sources multiples en un état du monde structuré, persistant et calculable, ainsi qu'en une modélisation causale ; deuxièmement, adopter une représentation formalisée State–Action–Outcome (SAO) pour transformer les décisions complexes en expressions et raisonnements calculables ; troisièmement, construire une architecture de raisonnement hybride AutoABM, intégrant la simulation multi-agents, le raisonnement stratégique et l'optimisation formelle, afin de résoudre des problèmes de décision complexes tels que la recherche d'équilibres de jeux, la planification de stratégies et la satisfaction de contraintes. Ensemble, ces trois éléments constituent la base technique de la machine de décision, visant à transformer les jugements ponctuels des systèmes d'IA en un processus de calcul et de déduction en constante mise à jour avec l'évolution du monde.

Quelle architecture est nécessaire pour permettre à l'IA de participer à des décisions réelles ?

Actuellement, les plusieurs capacités clés nécessaires à l'IA pour la « simulation de prise de décision » — telles que les modèles du monde, les agents multiples, le raisonnement stratégique et les prédictions probabilistes — sont déjà apparues progressivement. La véritable difficulté réside dans le fait que, lorsque l'IA passe d'une tâche fermée au monde réel ouvert, ces capacités doivent travailler ensemble en s'appuyant sur un seul et même état du monde, en constante mise à jour, et ne peuvent plus se contenter de fournir des analyses indépendantes dans un seul prompt.

Commencez par le modèle mondial. Lorsqu'on évoque le modèle mondial, on pense facilement à Sora, World Labs, V-JEPA, des modèles physiques principalement axés sur l'environnement visuel, spatial, physique ou robotique. En revanche, MetaWorld, proposé par Decision Machine, se concentre sur des scénarios de décision plus complexes : économie, politique, concurrence entre entreprises, géopolitique, etc., des systèmes ouverts où les entités, variables, relations et contraintes impliquées dans la modélisation sont bien plus complexes.

MetaWorld peut être considéré comme une extension du modèle du monde aux systèmes sociaux, nécessitant de traiter trois types de problèmes complexes : les différences de règles, la réflexivité (interactions bidirectionnelles et influences circulaires entre les causes et les effets) et l'incertitude impossible à éliminer complètement. Cela soulève une question directe : si le jugement sur le monde actuel est biaisé, les déductions suivantes ne risquent-elles pas de s'en éloigner ?

Une fois intégré dans un système social, il ne suffit pas de maintenir l'état de l'environnement ; l'IA doit également déterminer comment les autres participants agiront. Des systèmes comme CICERO de Meta et Richelieu de l'Université de Pékin ont déjà démontré la capacité de plusieurs agents à interagir et à jouer dans des conditions d'information limitée ; pour des décisions réelles dans un monde ouvert, après avoir simulé les actions de toutes les parties, il faut encore évaluer la faisabilité des stratégies, identifier les équilibres possibles du jeu, ainsi que les probabilités et les conditions associées aux différents scénarios futurs.

La signification du décisionnel réside ici : son architecture de raisonnement hybride, AutoABM, unifie la compréhension sémantique des LLM, la représentation structurée SAO, la modélisation et la simulation multi-agents, ainsi que le raisonnement et l'optimisation des stratégies sur une même chaîne d'implémentation, reliant ainsi les quatre étapes : « comprendre le monde — simuler et explorer — déterminer une solution — évaluer l'avenir ».

De la réalité au futur, comment l'outil de décision effectue-t-il une simulation complexe ?

Le système de décision est composé de six niveaux : entrées et tâches, données et connaissances, modélisation et formalisation, simulation et raisonnement, prévision et calibration, rapport et explication, formant une chaîne complète allant des informations réelles à la sortie décisionnelle.

Zhongke Wenge

Ensuite, nous prenons l'exemple de « Comment un conflit commercial complexe pourrait-il évoluer au cours des six prochains mois ? » pour voir comment la machine de décision construit progressivement l'état actuel du monde à partir d'informations réelles, simule les actions des différentes parties, explore les différentes voies possibles à venir et les conditions dans lesquelles ces voies se produiront.

Étape 1 : Ne cherchez pas tout de suite à prédire l'avenir ; commencez par comprendre ce qui se passe actuellement et quelles informations sont dignes de confiance.

Les informations du monde réel sont variées, peuvent être redondantes ou contradictoires, et parfois obsolètes. La machine de décision transforme d'abord la question de l'utilisateur en une tâche structurée, précisant ce qu'il faut répondre, quels sujets sont impliqués, la durée d'observation et les contraintes applicables. Dans ce cas, le système identifie d'abord les principaux acteurs impliqués dans le conflit, la période concernée et les points de litige actuels, puis établit les conditions susceptibles d'influencer l'évolution de la situation, telles que les tarifs douaniers, les chaînes d'approvisionnement, les politiques industrielles et les comportements des entreprises. Ensuite, il collecte des informations à partir de diverses sources, telles que des articles de presse, les réseaux sociaux et des rapports d'étude, autour de ces éléments.

Zhongke Wenge

Figure 2 : Schéma du processus de traitement des données

Les informations collectées sont d'abord dédoublonnées, regroupées et soumises à une extraction d'événements, puis organisées en une chronologie d'événements et un ensemble d'unités de preuve plus fines. Le système évalue ensuite la qualité de chaque preuve à l'aide du Score de Qualité des Preuves (EQS), en tenant compte de la pertinence par rapport à la question actuelle, de la fiabilité de la source, de la actualité et de l'exhaustivité du contenu, ainsi que de la cohérence entre les différentes sources. Selon le niveau de confiance de chaque preuve, elle est acheminée vers des chemins différents : les preuves à haute confiance sont directement transférées à l'étape suivante d'inférence.

Si les preuves existantes sont insuffisantes ou si des conflits apparaissent entre différentes sources, le système continue d'exécuter un raisonnement et une recherche alternés basés sur ReAct, ajuste la prochaine recherche en fonction des informations manquantes actuelles, et intègre les nouvelles informations trouvées dans la chronologie existante.

Zhongke Wenge

Figure 3 : Utilisation d'un mécanisme d'alternance entre raisonnement et recherche basé sur ReAct

Étape 2 : convertir les faits filtrés en un « état mondial » mis à jour en continu. Les faits indiquent au système ce qui s'est produit ; il faut ensuite aller plus loin et déterminer : en combinant ces changements, quel est l'état actuel du monde ?

Le mécanisme de décision formalise ce processus à l'aide d'une représentation State–Action–Outcome (SAO), où State décrit l'état actuel du monde, Action enregistre les actions prises par chaque agent dans cet état, et Outcome enregistre les résultats tels que les gains, pertes, coûts et risques découlant de ces actions. Il est à noter que State distingue les états macroscopiques des états plus fins et quantifiables. Dans ce cas, l'escalade des tensions commerciales peut constituer un état macroscopique, tandis que les niveaux de tarifs douaniers, les prix des biens et le degré d'impact sur les chaînes d'approvisionnement peuvent être intégrés dans des enregistrements d'états plus fins.

En outre, le système prend en compte séparément les chocs externes, tels que des changements soudains de politique, des modifications environnementales ou d'autres événements hors du contrôle de l'Agent. Après qu'une action et un événement externe se produisent, l'état du monde est mis à jour. Cet état mis à jour devient ensuite le point de départ de la prochaine action. Ce cycle se répète, formant une trajectoire SAO continue.

Zhongke Wenge

Figure 4 : Processus d'exécution de SAO

C’est MetaWorld qui est chargé de maintenir réellement ces états, en produisant une structure structurée pouvant être calculée et mise à jour. L’état peut être décomposé en trois niveaux : la couche Environment Layer enregistre l’environnement global partagé par tous les participants, par exemple le stade de la situation, les prix des ressources, etc. ; la couche Agent Metrics Layer enregistre les ressources, les capacités et l’avancement des objectifs de chaque Agent ; la couche Relationship Matrix Layer enregistre les évolutions des relations entre les différents Agents.

MetaWorld utilise également un DAG causal (Directed Acyclic Graph causal) pour contraindre la manière dont l'état évolue : les influences possibles entre les variables sont organisées dans un graphe causal dès la phase de modélisation. Pendant l'inférence, le système met à jour l'état des nœuds et les poids des arêtes causales, sans générer un nouveau graphe causal à chaque itération.

Cela est crucial pour les prévisions à long terme. Les précédentes modifications tarifaires ont influencé les prix, qui à leur tour ont modifié les choix des entreprises et les réponses des autres participants ; ces changements doivent être conservés pour permettre de continuer les calculs ultérieurs. MetaWorld assume ce rôle de « livre de compte » mis à jour en continu.

Étape 3 : avec l'état du monde, les différents agents commencent à agir. Les modélisations traditionnelles basées sur des agents (ABM) nécessitent généralement que des experts définissent à l'avance les participants, les règles de comportement, les variables d'environnement et les mécanismes d'interaction. Si on change de question, il faut re-modéliser beaucoup d'éléments. AutoABM, proposé par le moteur de décision, automatisera cette étape : face à une question en langage naturel, le système combinera des preuves externes pour extraire les participants, les objectifs et contraintes, l'espace d'action, les variables d'environnement ainsi que les relations causales, puis construira en conséquence un environnement de simulation multi-agents.

Un conflit commercial peut impliquer simultanément différents agents tels que des gouvernements, des entreprises, des organisations sectorielles et des consommateurs, chacun ayant ses propres objectifs, ressources, préférences en matière de risque et des lignes rouges non négociables. Ces agents n'ont pas de perspective divine et ne peuvent agir qu'en se basant sur les informations locales dont ils disposent.

Pour chaque itération, l'agent récupère les interactions et l'historique précédents, évalue les opportunités, risques et contraintes de la situation actuelle, génère plusieurs stratégies possibles et en choisit une. De plus, à chaque itération, le système ne pousse pas dans une seule direction : il explore simultanément plusieurs états mondiaux différents, y compris des trajectoires d'équilibre relativement stables, des évolutions plus optimistes ou pessimistes, ainsi que des branches à faible probabilité mais à fort impact qui pourraient radicalement modifier la situation. Ensuite, ces trajectoires sont filtrées et validées, l'état mondial est mis à jour, et l'itération suivante commence. Au fur et à mesure que les parties prenantes continuent d'agir, certaines trajectoires perdent leur faisabilité, tandis que d'autres deviennent plus probables.

Zhongke Wenge

Figure 5 : Paradigme de comportement de l'agent

En dehors de la simulation multi-agents, une décision complexe nécessite un « arbitre mathématique ». Les agents multiples peuvent explorer de nombreuses trajectoires futures apparemment raisonnables, mais envisager quelque chose ne signifie pas pouvoir le réaliser : les décisions réelles sont soumises à des contraintes rigides telles que le budget, les ressources, le temps, les lignes rouges politiques et les équilibres entre les parties.

Le moteur de décision intègre une capacité de résolution formelle couvrant cinq catégories de problèmes : jeux classiques, allocation et optimisation des ressources, planification et ordonnancement de trajets, inférence probabiliste sous incertitude, et satisfaction de contraintes. Par exemple, la répartition des ressources sous contrainte budgétaire, les équilibres possibles dans des jeux multipartites, ou encore la détection d'une stratégie franchissant une limite prédéfinie peuvent être traités à ce niveau. Pour les problèmes de jeu, le système intègre neuf types de jeux atomiques classiques, tels que le dilemme du prisonnier, le jeu du cerf, le jeu du poulet et les jeux à somme nulle, couvrant 144 topologies de jeux Robinson–Goforth 2×2 afin d'identifier et de résoudre différentes structures de jeux.

L'accent de ce niveau repose sur le fait qu'il reintroduit les stratégies candidates générées par les agents multiples dans un cadre calculable de jeux, de contraintes et d'optimisation, transformant ainsi le concept de « sémantiquement raisonnable » en « formellement vérifiable ».

Sur le benchmark TMGBench, conçu pour évaluer les capacités de jeu multi-agents, l'exactitude de l'équilibre décisionnel atteint 99,4 %, l'exactitude de l'identification topologique est de 100 %, le temps moyen de résolution est de 0,8 seconde et le score d'interprétabilité est de 4,3/5,0.

Zhongke Wenge

Table 2 : Cinq principaux types de problèmes à résoudre

La répartition des tâches entre la simulation multi-agents et la résolution formelle est claire : la première consiste à déployer les chemins possibles ; la seconde consiste à vérifier si ces chemins sont viables sous les contraintes et la structure du jeu.

À la dernière étape de l'analyse, il reste une question cruciale : quelle est la probabilité de réalisation de chacune des voies futures précédemment exposées ? Pour cela, le système de décision a mis en place une étape de prévision et de calibration.

Sur la base des chemins candidats précédemment identifiés, cette couche traite l'incertitude restante : le système combine les résultats de l'inférence du modèle et des signaux de calibration externes pour attribuer des probabilités aux différents résultats, puis calibre ces probabilités à l'aide d'informations de marchés prédictifs, de performances historiques de prévisions et de règles d'évaluation probabiliste. La machine de décision ne fournit plus seulement une série de scénarios décrits comme « ce qui pourrait se produire » ; chaque chemin est désormais accompagné d'une évaluation probabiliste correspondante, mise à jour continuellement à mesure que de nouvelles preuves et résultats d'inférence apparaissent.

Nous pouvons le comprendre comme une « carte du futur » en constante évolution : une intensification des tensions commerciales, un apaisement temporaire entre les parties ou l’apparition de nouveaux facteurs imprévus peuvent toutes devenir des branches distinctes. Le système évalue la probabilité de chaque chemin et identifie les changements qui rendent un chemin particulier plus probable.

Zhongke Wenge

Figure 6 : Module de prédiction de probabilité

Ainsi, le système de décision relie ensemble une boucle complète d'analyse décisionnelle.

Validation expérimentale : ce cadre de décision est-il efficace ?

Le rapport utilise plusieurs expériences pour tester le système d'inférence du décideur ; les résultats les plus intéressants à observer sont ceux de « l'inférence d'événements et la prédiction de probabilités ».

Commençons par l’ensemble de prédictions d’événements auto-constructs, afin d’observer si la déduction structurée améliore les prédictions d’événements. L’équipe a créé un ensemble de données comprenant 74 événements et 370 questions de jugement binaire, couvrant plusieurs catégories d’événements à haute instabilité, et intégrant différentes durées de prévision dans l’évaluation. Dans le cadre de l’évaluation de l’équipe, le résultat global du décideur s’élève à 78,41 %.

En outre, dans les paramètres LLM-NEWS, pour le groupe à court terme de 3 à 30 jours, le résultat du mécanisme de décision est de 72,80 %, tandis que GPT-5.5 et Claude-4.7 affichent respectivement 35,43 % et 44,62 % ; une fois passés aux périodes moyenne et longue, cet écart diminue progressivement. Cela signifie que le raisonnement structuré présente un avantage relatif plus marqué dans les scénarios à court terme où les conditions évoluent rapidement et où les tendances historiques sont difficiles à appliquer.

Zhongke Wenge

Ensuite, des expériences complémentaires sur le marché prédictif public PolyBench.

Le FFA (taux de précision des prédictions finales) du Décideur est de 81,20 %, son EVPA (taux de précision des prédictions de volatilité attendue) de 73,40 % et son MSE (erreur quadratique moyenne) de 0,822 ; ces trois indicateurs surpassent ceux de Gemini-3-Flash, MiMo-V2-Flash et Grok-4.1-Fast. Cela démontre que le Décideur offre une meilleure capacité à capturer les directions des changements de probabilités de marché et à contrôler les erreurs de probabilité.

Zhongke Wenge

L'IA de décision est en train de modifier l'unité de concurrence des grands modèles

L'IA générative utilise le token comme unité de calcul de base, et répond à la question : « Comment générer le prochain segment de contenu ? » ; l'IA décisionnelle, quant à elle, prend les changements d'état du monde comme objet de calcul de base, et répond à la question : « Comment une action va-t-elle modifier le monde suivant ? » La première s'intéresse à la cohérence de la réponse, tandis que la seconde doit également gérer les relations de cause à effet, les contraintes réelles, les réactions des adversaires et les variations de probabilité. Il ne s'agit pas d'une simple addition de capacités, mais d'un changement de paradigme de calcul.

Il est difficile pour l'IA de décision d'émerger naturellement uniquement grâce à une plus grande échelle de paramètres et à une capacité linguistique accrue. Une fois entrée dans un monde ouvert, le modèle de base reste important, mais il commence à passer d'être un système entier à devenir un composant du système de décision. L'unité de concurrence dans l'IA passe également d'un modèle unique à un système complet.

La signification technique de l'agent décisionnel réside dans sa capacité à organiser des compétences autrefois dispersées en une structure décisionnelle commune. Ce qui est appelé « universel » ne signifie pas prédire l'avenir dans tous les domaines, mais plutôt que des problèmes provenant de domaines différents peuvent tous être traduits en états, actions, résultats, contraintes et incertitudes, et intégrés dans un même cadre de raisonnement et de résolution.

Du point de vue de cette perspective, la véritable valeur du « premier modèle de décision universel au monde » ne réside pas seulement dans la conquête d’un « premier », mais aussi dans la définition d’un cadre technique relativement complet pour les « modèles de décision universels » : décrire le monde par des états explicites, déployer des actions à travers des agents multiples, tester les stratégies par la théorie des jeux et l’optimisation, puis calibrer les probabilités des différentes trajectoires futures. En conséquence, les critères d’évaluation de l’IA commencent également à évoluer — il ne s’agit plus seulement de vérifier la précision des réponses, mais aussi de s’assurer que les états restent cohérents, que les déductions soient vérifiables, que les probabilités soient fiables, et que les mises à jour soient effectuées en temps réel face à de nouvelles informations.

Après tout, une réponse qui semble correcte ne correspond pas nécessairement à une décision résistante aux changements réels.

Cet article provient du compte WeChat « Machine Heart » (ID : almosthuman2014), auteur : spécialisé dans l'IA décisionnelle

Clause de non-responsabilité : les informations sur cette page peuvent avoir été obtenues auprès de tiers et ne reflètent pas nécessairement les points de vue ou opinions de KuCoin. Ce contenu est fourni à titre informatif uniquement, sans aucune représentation ou garantie d’aucune sorte, et ne doit pas être interprété comme un conseil en investissement. KuCoin ne sera pas responsable des erreurs ou omissions, ni des résultats résultant de l’utilisation de ces informations. Les investissements dans les actifs numériques peuvent être risqués. Veuillez évaluer soigneusement les risques d’un produit et votre tolérance au risque en fonction de votre propre situation financière. Pour plus d’informations, veuillez consulter nos conditions d’utilisation et divulgation des risques.