Decitron: Modelo global de inteligência artificial de tomada de decisão geral lançado

icon MarsBit
Compartilhar
AI summary iconResumo
Zhongke Wenge lançou o Decitron, o primeiro modelo de decisão geral do mundo, segundo a MarsBit. O modelo combina modelagem do mundo, simulação multiagente e raciocínio teórico-jogos para decisões em ambientes abertos. Ele utiliza o MetaWorld para modelagem estruturada de estados, o SAO para representação de decisões e o AutoABM para raciocínio. Espera-se que o Decitron simule cenários complexos, como conflitos comerciais, e avalie resultados com probabilidades calibradas. O lançamento ocorre em meio a crescentes preocupações em torno do CFT (Combate ao Financiamento do Terrorismo), com implicações para liquidez e mercados de criptoativos.

Gerar respostas está se tornando uma capacidade básica da IA, enquanto inferir o mundo real é a próxima questão mais difícil.

Decisões reais não são uma pergunta e resposta estática. Elas ocorrem em um mundo em constante mudança, onde múltiplos agentes agem simultaneamente, com informações incompletas e cheio de incertezas.

Por exemplo, se um novo modelo de código aberto reduz abruptamente os custos, as empresas de modelos líderes seguirão com reduções de preços? Como as empresas de nuvem, desenvolvedores e empresas de aplicativos reorganizarão suas posições? Nesse tipo de decisão, a ação de uma parte altera as condições enfrentadas pelas demais, e as novas reações continuam reescrevendo a situação. É como um jogo de xadrez em que todos os jogadores movem simultaneamente — cada peça colocada muda o tabuleiro.

Nesse contexto, após o lançamento do Decitron da Zhongke Wenge (abreviado como Decitron), diversas principais mídias tecnológicas o denominaram de “primeiro modelo de decisão geral do mundo”. Essa designação não se refere à primeira aparição de uma única tecnologia, como modelos de mundo, múltiplos agentes ou solução de jogos, mas sim ao fato de o Decitron ter unificado pela primeira vez essas capacidades em um único framework de decisão voltado para um mundo aberto, formando um ciclo completo de modelagem contínua, simulação, solução e calibração.

O termo “geral” refere-se à tentativa de abstrair problemas complexos de tomada de decisão de diferentes áreas como uma estrutura comum — estado do mundo, agentes envolvidos, espaço de ações, relações de restrição, interações em múltiplas rodadas e resultados incertos — e realizar推演 e resolução contínuas dentro dessa mesma estrutura.

Zhongke Wenge

Endereço do relatório técnico: https://chinaxiv.org/abs/202608.00064

Em 3 de agosto, o relatório técnico completo da Decitron foi lançado oficialmente, revelando pela primeira vez suas três contribuições tecnológicas principais:

Primeiro, propõe-se o modelo explícito do mundo MetaWorld, que organiza informações de múltiplas fontes em um estado do mundo estruturado, persistente e computável, juntamente com sua modelagem causal; segundo, adota-se a formalização State–Action–Outcome (SAO), transformando decisões complexas em expressões e raciocínios computáveis; terceiro, constrói-se uma arquitetura de raciocínio híbrida chamada AutoABM, que integra simulação de múltiplos agentes, raciocínio de jogos e otimização formal, resolvendo problemas complexos de decisão como equilíbrios de jogos, planejamento de estratégias e satisfação de restrições por meio de um sistema de inferência de decisões de múltiplos agentes. Juntos, esses três elementos constituem a base técnica da máquina de decisão, com o objetivo de transformar julgamentos pontuais de sistemas de IA em um processo contínuo de cálculo e inferência que se atualiza conforme o mundo muda.

Que arquitetura é necessária para permitir que a IA participe de decisões reais?

Atualmente, as várias capacidades-chave necessárias pela IA para a "simulação de decisões" — como modelos do mundo, múltiplos agentes, raciocínio de jogos e previsão probabilística — já surgiram progressivamente. A verdadeira dificuldade reside no fato de que, quando a IA passa de tarefas fechadas para o mundo real aberto, essas capacidades devem operar em conjunto em torno de um único estado do mundo, que é continuamente atualizado, e não apenas fornecer análises independentes dentro de um único prompt.

Primeiro, examine o modelo mundial. Ao mencionar World Model, as pessoas facilmente pensam em modelos físicos voltados principalmente para o mundo físico, como Sora, World Labs e V-JEPA, que lidam com visão, espaço, física ou ambientes robóticos. Já o MetaWorld proposto pela Decision Machine foca em cenários de decisão mais complexos: economia, políticas, competição empresarial e geopolítica — sistemas abertos cujos agentes, variáveis, relações e restrições envolvidos na modelagem são muito mais complexos.

MetaWorld pode ser visto como uma extensão do modelo do mundo para sistemas sociais, exigindo o tratamento de três tipos de problemas complexos: diferenças de regras, reflexividade (interação bidirecional e influência cíclica entre causa e efeito) e incerteza que não pode ser totalmente eliminada. Isso também levanta uma questão direta: se o julgamento sobre o mundo atual estiver incorreto, os cenários subsequentes não correrão o risco de se desviar?

Uma vez inserido no sistema social, manter apenas o estado do ambiente não é suficiente; a IA também precisa avaliar como os outros participantes agirão. O Richelieu, proposto pela Meta, pela Universidade de Pequim e outras equipes, já demonstrou a capacidade de múltiplos agentes interagirem e jogarem sob informações limitadas; já para decisões reais em um mundo aberto, após simular as ações de todas as partes, ainda é necessário avaliar se as estratégias são viáveis, em quais equilíbrios o jogo pode se estabilizar e as probabilidades e condições de diferentes futuros possíveis.

O significado do Decision Machine está aqui: sua arquitetura de raciocínio híbrida, AutoABM, unifica a compreensão semântica do LLM, a representação estruturada SAO, a modelagem e simulação de múltiplos agentes, e o raciocínio e otimização de estratégias em uma única cadeia de implementação, conectando as quatro etapas: "compreender o mundo — simular e testar — buscar soluções de decisão — avaliar o futuro".

Do fato ao futuro, como o mecanismo de decisão realiza uma inferência complexa?

O sistema de decisão é composto por seis níveis: entrada e tarefa, dados e conhecimento, modelagem e formalização, simulação e raciocínio, previsão e calibração, relatório e explicação, formando uma cadeia completa da informação real até a saída de decisão.

Zhongke Wenge

Em seguida, usaremos o caso “Como uma complexa disputa comercial pode evoluir nos próximos seis meses?” para ver como a máquina de decisão parte das informações reais, constrói passo a passo o estado atual do mundo, simula as ações de todas as partes, projeta diferentes caminhos futuros possíveis e identifica em quais condições esses caminhos ocorrerão.

Passo 1: Não se apresse em prever o futuro; primeiro, entenda o que está acontecendo agora e quais fatos merecem confiança.

As informações do mundo real são variadas, podendo ser repetitivas, conflitantes ou desatualizadas. A máquina de decisão primeiro converte a pergunta do usuário em uma tarefa estruturada, definindo claramente o que precisa ser respondido, quais entidades estão envolvidas, por quanto tempo deve ser observado e quais são as restrições. No caso apresentado, o sistema primeiro identifica os principais participantes envolvidos no conflito, o intervalo de tempo e o ponto atual da controvérsia, organizando condições que podem afetar a evolução da situação, como tarifas, cadeias de suprimento, políticas industriais e comportamento corporativo, e depois coleta informações de diversas fontes, como notícias, mídias sociais e relatórios de pesquisa, em torno desses elementos.

Zhongke Wenge

Figura 2: Fluxograma do processo de processamento de dados

As informações coletadas são primeiro processadas para remoção de duplicatas, agrupamento e extração de eventos, organizando-se em uma linha do tempo de eventos e um conjunto de unidades de evidência mais detalhadas. Em seguida, o sistema avalia a qualidade de cada evidência por meio do Evidence Quality Score (EQS), considerando a relevância em relação à pergunta atual, a confiabilidade da fonte, a atualidade e completude do conteúdo, e a consistência entre diferentes fontes. Ao mesmo tempo, conforme o nível de confiança de cada evidência, são determinados seus caminhos subsequentes, sendo as evidências com alta confiança encaminhadas diretamente para a etapa de inferência subsequente.

Se as evidências existentes forem insuficientes ou houver conflitos entre fontes diferentes, o sistema continuará executando o raciocínio e a busca alternados baseados em ReAct, ajustando a próxima busca com base nas informações atualmente ausentes e incorporando as novas informações encontradas na linha do tempo existente.

Zhongke Wenge

Figura 3: Utilização do mecanismo alternado de raciocínio e recuperação baseado em ReAct

Passo dois: transforme os fatos filtrados em um «estado mundial» em constante atualização. Os fatos informam ao sistema o que ocorreu; a seguir, é necessário avaliar ainda mais: ao combinar essas mudanças, qual é o estado atual do mundo?

A máquina de decisão formaliza esse processo usando a representação State–Action–Outcome (SAO), onde State descreve o estado atual do mundo, Action registra as ações tomadas por cada agente sob esse estado, e Outcome registra os resultados das ações, como ganhos, perdas, custos e riscos. É importante notar que State distingue entre estados macro e estados mais finos e quantificáveis. No caso, o agravamento das tensões pode ser um estado macro, enquanto níveis de tarifas, preços de bens e o grau de impacto na cadeia de suprimentos podem ser incluídos nos registros de estados mais finos.

Além disso, o sistema considera separadamente choques externos, como mudanças repentinas na política, alterações ambientais ou outros eventos fora do controle do Agente. Após uma ação e um evento externo ocorrerem, o estado do mundo é atualizado. Esse estado atualizado se torna, então, o ponto de partida para a próxima ação. Esse ciclo se repete continuamente, formando uma trajetória contínua de SAO.

Zhongke Wenge

Figura 4: Processo de execução do SAO

Responsável por manter realmente esses estados é o MetaWorld, que gera uma estrutura de estado mundial estruturada que pode ser calculada e atualizada. O estado pode ser dividido em três níveis: a Environment Layer registra o ambiente geral compartilhado por todos os participantes, como estágio da situação e preços de recursos; a Agent Metrics Layer registra os recursos, capacidades e progresso dos objetivos de cada Agent; e a Relationship Matrix Layer registra as mudanças nas relações entre diferentes Agentes.

MetaWorld também utiliza um DAG causal (Gráfico Direcionado Acíclico Causal) para restringir como os estados mudam: as possíveis influências entre variáveis são organizadas em um gráfico causal durante a fase de modelagem. Durante a inferência, o sistema atualiza os estados dos nós e os pesos das arestas causais, mas não gera um novo gráfico causal a cada rodada.

Isso é crucial para o cenário de longo prazo. A mudança anterior nas tarifas afetou os preços, que por sua vez alteraram as escolhas das empresas e as respostas de outros participantes, e todas essas mudanças precisam ser mantidas para continuar os cálculos subsequentes. O MetaWorld assume o papel deste "livro-razão" em constante atualização.

Passo 3: Com o estado mundial estabelecido, os diversos Agentes começam a agir. A modelagem baseada em agentes (ABM) tradicional geralmente exige que especialistas definam antecipadamente os participantes, regras de comportamento, variáveis ambientais e mecanismos de interação. Se a pergunta mudar, muitas coisas precisam ser remodeladas. O AutoABM proposto pela Decision Machine automatiza esse passo: diante de uma pergunta em linguagem natural, o sistema combina evidências externas para extrair participantes, objetivos e restrições, espaço de ação, variáveis ambientais e relações de causalidade, e, com base nisso, constrói um ambiente de simulação multiagente.

Um conflito comercial pode envolver diferentes agentes, como governos, empresas, organizações setoriais e consumidores, cada um com seus próprios objetivos, recursos, preferências de risco e linhas vermelhas intransponíveis. Esses agentes não têm uma visão de Deus e só podem agir com base nas informações locais que possuem.

Em cada rodada, o agente recupera as interações e trajetórias anteriores, avalia as oportunidades, riscos e restrições na situação atual, gera várias estratégias possíveis e faz uma escolha. Além disso, cada rodada não se limita a empurrar em uma única direção; o sistema simultaneamente explora vários estados mundiais diferentes, incluindo caminhos de equilíbrio relativamente estáveis, tendências de evolução mais otimistas ou pessimistas, e ramificações de alto impacto — de baixa probabilidade, mas que alterariam significativamente a situação caso ocorressem. Em seguida, esses caminhos são filtrados e validados, os estados mundiais são atualizados e avança-se para a próxima rodada. Conforme as partes continuam agindo, alguns caminhos perdem suas condições de viabilidade, enquanto outros se tornam mais prováveis.

Zhongke Wenge

Figura 5: Paradigma de comportamento do Agente

Além da simulação de múltiplos agentes, decisões complexas exigem um “árbitro matemático”. Múltiplos agentes podem explorar muitas trajetórias futuras que parecem plausíveis, mas pensar em algo não significa poder realizá-lo; decisões reais estão sujeitas a restrições rígidas, como orçamento, recursos, tempo, linhas vermelhas políticas e equilíbrios entre partes envolvidas.

O mecanismo de decisão integrou uma capacidade de resolução formal, abrangendo cinco categorias de problemas: jogos clássicos, alocação e otimização de recursos, planejamento e agendamento de rotas, inferência probabilística sob incerteza e satisfação de restrições. Por exemplo, como alocar recursos com orçamento limitado, quais equilíbrios podem surgir em jogos multipartidários e se uma estratégia ultrapassa limites pré-definidos — todos esses cenários podem ser processados nessa camada. Em jogos, o sistema incorpora internamente nove tipos clássicos de jogos atômicos, como o dilema do prisioneiro, o jogo da caça ao cervo, o jogo do galinha e jogos de soma zero, cobrindo 144 topologias de jogos 2×2 Robinson–Goforth, utilizadas para identificar e resolver diferentes estruturas de jogos.

O foco deste nível está em retornar as estratégias candidatas geradas por múltiplos agentes a um quadro computacional de jogos, restrições e otimização, transformando o que é "semanticamente razoável" em "formalmente verificável".

No benchmark TMGBench, avaliado pela capacidade de jogos multiagentes, a precisão do equilíbrio de decisão atingiu 99,4%, a precisão de identificação topológica foi de 100%, o tempo médio de solução foi de 0,8 segundos e a pontuação de explicabilidade foi de 4,3/5,0.

Zhongke Wenge

Tabela 2: Cinco principais tipos de problemas de solução

A divisão de tarefas entre simulação multiagente e solução formal é clara: a primeira é responsável por expandir os caminhos possíveis; a segunda é responsável por verificar se esses caminhos são válidos sob as restrições e a estrutura do jogo.

Na última etapa do cenário, resta uma questão-chave: qual é a probabilidade de ocorrência de cada um dos caminhos futuros apresentados anteriormente? Para isso, o sistema de decisão implementou as etapas de previsão e calibração.

Com base nas rotas candidatas obtidas anteriormente, esta camada continua tratando a incerteza: o sistema combina os resultados da inferência do modelo com sinais externos de calibração para atribuir probabilidades a diferentes resultados, e depois calibra essas probabilidades usando informações de mercados preditivos, desempenho histórico de previsões e regras de pontuação de probabilidade. A máquina de decisão não fornece mais apenas uma sequência de descrições de cenários “o que pode acontecer”; cada caminho agora vem acompanhado de uma avaliação probabilística correspondente, que continua sendo atualizada à medida que novas evidências e resultados de inferência surgem.

Podemos entendê-lo como um "mapa do futuro" em constante mudança: o agravamento das tensões comerciais, um alívio temporário entre as partes ou a aparição de novas variáveis imprevistas podem se tornar ramificações distintas. O sistema avalia a probabilidade de cada caminho ocorrer e quais mudanças tornam um determinado caminho mais provável.

Zhongke Wenge

Figura 6: Módulo de previsão de probabilidade

Até aqui, o mecanismo de decisão conectou toda a cadeia de simulação de decisão.

Validação experimental: Este quadro de decisão é eficaz?

O relatório utilizou vários conjuntos de experimentos para testar o sistema de inferência do decisor, sendo os resultados mais interessantes os da "inferência de eventos e previsão de probabilidade".

Primeiro, examine o conjunto de previsões de eventos autoconstruído para observar se a inferência estruturada melhora as previsões de eventos. A equipe construiu um conjunto de dados contendo 74 eventos e 370 questões de julgamento binário, abrangendo várias categorias de eventos de alta instabilidade e incluindo diferentes intervalos de previsão na avaliação. Sob o conjunto de avaliação da equipe, o resultado geral da máquina de decisão foi de 78,41%.

Além disso, nas configurações do LLM-NEWS, para o grupo de curto prazo de 3-30 dias, o resultado do mecanismo de decisão foi de 72,80%, enquanto o GPT-5.5 e o Claude-4.7 obtiveram respectivamente 35,43% e 44,62%; à medida que se avança para o médio e longo prazo, a diferença vai se reduzindo. Ou seja, a inferência estruturada apresenta vantagem relativa mais acentuada em cenários de curto prazo, onde as condições mudam rapidamente e as tendências históricas são difíceis de aplicar.

Zhongke Wenge

Em seguida, experimentos complementares no benchmark de mercado preditivo público PolyBench.

A FFA (Taxa de Precisão da Previsão Final) da Decision Machine é de 81,20%, a EVPA (Taxa de Precisão da Previsão da Volatilidade Esperada) é de 73,40% e o MSE (Erro Quadrático Médio) é de 0,822, todos superiores ao Gemini-3-Flash, MiMo-V2-Flash e Grok-4.1-Fast. Isso indica que a Decision Machine apresenta melhor desempenho na captura da direção das mudanças de probabilidade do mercado e no controle do erro de probabilidade.

Zhongke Wenge

A inteligência artificial de decisão está mudando a unidade de competição dos grandes modelos

A IA generativa usa o token como unidade básica de cálculo e resolve a questão de “como gerar o próximo trecho de conteúdo”; a IA de decisão, por sua vez, considera as mudanças no estado do mundo como seu objeto básico de cálculo e resolve a questão de “como uma ação alterará o mundo seguinte”. A primeira se preocupa apenas se a resposta é razoável, enquanto a segunda deve lidar ainda com causalidade, restrições reais, reações de adversários e mudanças de probabilidade. Entre ambas não há simplesmente uma adição de capacidades, mas uma mudança no paradigma de cálculo.

A inteligência artificial de tomada de decisão é difícil de emergir naturalmente apenas com maior escala de parâmetros e capacidades linguísticas mais fortes. Após entrar no mundo aberto, o modelo base ainda é importante, mas passa a ser um componente do sistema de tomada de decisão, em vez de ser o sistema inteiro. A unidade de competição em IA também passa de um único modelo para um sistema completo.

O significado técnico da máquina de decisão reside em organizar capacidades anteriormente dispersas em uma estrutura comum de tomada de decisão. O termo "geral" não significa prever o futuro em todos os domínios, mas sim que problemas de diferentes domínios podem ser traduzidos em estados, ações, resultados, restrições e incertezas, e integrados a um único quadro de inferência e resolução.

Do ponto de vista deste ângulo, o verdadeiro valor do "primeiro modelo de decisão geral do mundo" não se limita à disputa por um "primeiro lugar", mas reside em fornecer um contorno técnico relativamente completo para o "modelo de decisão geral": descrever o mundo por meio de estados explícitos, executar ações por meio de múltiplos agentes, testar estratégias por meio de jogos e otimização, e calibrar probabilidades para diferentes caminhos futuros. Consequentemente, os critérios de avaliação da IA também começam a mudar — não basta mais avaliar se as respostas são precisas, mas também se os estados permanecem consistentes, se as inferências podem ser verificadas, se as probabilidades são confiáveis e se novas informações podem ser atualizadas prontamente.

After all, an answer that sounds right doesn't equal a decision that can withstand real-world changes.

Este artigo é do número de identificação “机器之心” (ID: almosthuman2014) do WeChat, autor: focado em IA de decisão

Aviso legal: as informações nesta página podem ter sido obtidas de terceiros e não refletem necessariamente os pontos de vista ou opiniões da KuCoin. Este conteúdo é fornecido apenas para fins informativos gerais, sem qualquer representação ou garantia de qualquer tipo, nem deve ser interpretado como aconselhamento financeiro ou de investimento. A KuCoin não é responsável por quaisquer erros ou omissões, ou por quaisquer resultados do uso destas informações. Os investimentos em ativos digitais podem ser arriscados. Avalie cuidadosamente os riscos de um produto e a sua tolerância ao risco com base nas suas próprias circunstâncias financeiras. Para mais informações, consulte nossos termos de uso e divulgação de risco.