Decitron: Світовий перший загальний AI-модель прийняття рішень випущена

icon MarsBit
Поділитися
AI summary iconКороткий зміст
За даними MarsBit, Zhongke Wenge запустив Decitron — першу у світі загальну модель прийняття рішень. Модель поєднує моделювання світу, багатоагентне симулювання та ігрово-теоретичні міркування для прийняття рішень у відкритому світі. Вона використовує MetaWorld для структурованого моделювання станів, SAO для представлення рішень та AutoABM для міркувань. Decitron має симулювати складні сценарії, такі як торгівельні конфлікти, і оцінювати результати з каліброваними ймовірностями. Випуск відбувається на тлі зростаючої тривоги щодо CFT (боротьба з фінансуванням тероризму), що має наслідки для ліквідності та крипторинків.

Генерація відповідей стає базовою здатністю ШІ, а моделювання реального світу — це складніша задача на наступному етапі.

Реальні рішення — це не статичний тест з питаннями та відповідями. Вони приймаються в світі, який постійно змінюється, де кілька учасників діють одночасно, інформація неповна, а невизначеність є нормою.

Наприклад, якщо нова відкрита модель раптово знизить витрати, чи приєднаються до цього компанії з лідирующими моделями? Як перегрупуються хмарні провайдери, розробники та компанії-застосунки? У таких рішеннях дія однієї сторони змінює умови, з якими стикаються інші, а нові реакції продовжують змінювати ситуацію. Це наче шахи, де всі гравці роблять ходи одночасно: кожен крок змінює стан дошки.

Саме в цьому контексті після запуску рішення Decitron (скорочено — рішення) від Zhongke Wenge воно було назване багатьма провідними технологічними ЗМІ «першою у світі універсальною великою моделлю прийняття рішень». Цей термін підкреслює не перше з’явлення окремих технологій, таких як світова модель, багатоагентні системи чи розв’язання ігор, а те, що рішення вперше об’єднало ці здібності в єдиній рамці прийняття рішень для відкритого світу, створивши повний замкнений цикл постійного моделювання, моделювання, розв’язання та калібрування.

Термін «універсальний» означає, що він намагається абстрагувати складні проблеми прийняття рішень з різних галузей до спільної структури — стан світу, учасники, простір дій, обмеження, багатокрокова взаємодія та невизначені результати — і постійно моделювати та розв’язувати їх у межах однієї й тієї ж рамки.

Zhongke Wenge

Адреса технічного звіту: https://chinaxiv.org/abs/202608.00064

3 серпня було офіційно опубліковано повний технічний звіт Decitron, вперше системно розкривши три ключові технічні досягнення:

По-перше, запропоновано явну світову модель MetaWorld, яка структуризує, зберігає та робить обчислюваними багатоджерельні інформаційні потоки у вигляді світового стану та його причинно-наслідкового моделювання; по-друге, використано формалізоване представлення State–Action–Outcome (SAO), що перетворює складні рішення на обчислювані та логічно обґрунтовані форми; по-третє, створено гібридну архітектуру міркувань AutoABM, що поєднує багатоагентне моделювання, ігрове міркування та формальну оптимізацію, для вирішення складних проблем прийняття рішень, таких як знаходження рівноваги гри, планування стратегій та задоволення обмежень. Разом ці три компоненти утворюють технічну основу рішень, метою якої є перетворення одноразових висновків AI-системи на процес постійного обчислення та міркування, що оновлюється разом із змінами у світі.

Яку архітектуру потрібно використовувати, щоб дати ІІ відповідальність за реальні рішення?

Зараз ключові здібності, необхідні для «моделювання прийняття рішень» — такі як світова модель, багатоагентні системи, ігрове міркування та ймовірнісне прогнозування — вже поступово з’являються. Справжня складність полягає в тому, що коли AI переходить від закритих завдань до відкритого реального світу, ці здібності повинні працювати разом, спираючись на єдиний, постійно оновлюваний стан світу, а не надавати окремі аналізи лише в одному запиті.

Спочатку розглянемо світові моделі. Коли згадують World Model, люди часто думають про такі моделі, як Sora, World Labs, V-JEPA, які зосереджені на фізичному світі — візуальному, просторовому, фізичному або робототехнічному середовищі. Натомість MetaWorld, запропонований Decision Machine, зосереджений на більш складних сценаріях прийняття рішень: економіці, політиці, корпоративній конкуренції, геополітиці та інших відкритих системах, де моделювання системи включає більше суб’єктів, змінних, зв’язків і обмежень.

MetaWorld можна розглядати як розширення моделі світу на соціальні системи, яке вимагає вирішення трьох складних проблем: різниця в правилах, рефлексивність (двостороннє взаємодія та циклічний вплив між причинами та наслідками) та неможливість повного усунення невизначеності. Це також ставить безпосереднє питання: якщо оцінка поточного світу буде неточною, чи не спотворяться наступні прогнози?

Після входу в соціальну систему одного лише підтримання стану середовища недостатньо — ШІ також має визначати, як інші учасники діятимуть. Richelieu, запропонований командами Meta, Пекінського університету та іншими, вже продемонстрував здатність кількох агентів взаємодіяти та грати в ігри за обмеженої інформації; а для реальних рішень у відкритому світі, після моделювання дій всіх сторін, необхідно далі оцінювати, чи є стратегії здійсненними, на яких рівновагах може завершитися гра, а також ймовірності та умови різних майбутніх сценаріїв.

Сенс рішучого механізму саме в цьому: його гібридна архітектура міркувань AutoABM об’єднує семантичне розуміння LLM, структуроване представлення SAO, моделювання та симуляцію багатоагентних систем, а також міркування та оптимізацію стратегій в єдиній ланцюжці реалізації, з’єднуючи чотири кроки: «розуміння світу — симуляція та моделювання — пошук рішення — оцінка майбутнього».

Від фактів до майбутнього: як система прийняття рішень проводить складну прогнозну модель?

Механізм прийняття рішень складається з шести рівнів: вхідні дані та завдання, дані та знання, моделювання та формалізація, симуляція та міркування, прогнозування та калібрування, звітність та пояснення, що утворює повний ланцюжок від реальних даних до вихідного рішення.

Zhongke Wenge

Далі ми розглянемо приклад: «Як може розвиватися складний торгівельний конфлікт у наступні шість місяців?», щоб побачити, як рішальний механізм на основі реальних даних побудовує поточний стан світу, моделює дії всіх сторін, прогнозує різні можливі сценарії майбутнього та визначає умови, за яких ці сценарії можуть відбутися.

Крок 1: Спочатку не поспішайте робити висновки про майбутнє — спочатку з’ясуйте, що відбувається зараз, і які факти варто вважати достовірними.

Інформація з реального світу є хаотичною, може бути дубльованою або суперечливою, а також застарілою. Механізм прийняття рішень спочатку перетворює запит користувача на структуроване завдання, чітко визначаючи, що потрібно відповісти, які суб’єкти задіяні, який період спостереження та які обмеження існують. У цьому випадку система спочатку визначає основних учасників конфлікту, часовий діапазон та поточні точки суперечки, систематизує умови, що можуть впливати на зміну ситуації — такі як тарифи, ланцюги поставок, промислова політика, поведінка підприємств — а потім збирає інформацію з різних джерел, включаючи новинні матеріали, соціальні мережі та дослідницькі звіти, навколо цих елементів.

Zhongke Wenge

Рисунок 2: Діаграма процесу обробки даних

Зібрана інформація спочатку проходить очищення від дублікатів, кластеризацію та витягування подій, після чого утворюється хронологія подій та набір деталізованих одиниць доказів. Потім система оцінює якість кожної інформації за допомогою показника якості доказів (EQS), враховуючи її актуальність щодо поточного запиту, надійність джерела, терміновість та повноту вмісту, а також узгодженість між різними джерелами. Крім того, залежно від рівня впевненості кожного доказу, визначається його подальша доля: докази з високою впевненістю безпосередньо переходять до наступного етапу моделювання.

Якщо наявних доказів недостатньо або виникають конфлікти між різними джерелами, система продовжує виконувати чергування між міркуванням та пошуком на основі ReAct, налаштовуючи наступний пошук згідно з відсутньою інформацією та додаючи ново знайдені дані до існуючої хронології.

Zhongke Wenge

Рисунок 3: Використання ітеративного механізму міркувань та пошуку на основі ReAct

Другий крок: перетворіть відфільтровані факти на постійно оновлюваний «світовий стан». Факти повідомляють системі, що відбулося, а потім необхідно додатково визначити: який стан світу склався внаслідок цих змін у сукупності.

Машина прийняття рішень формалізує цей процес за допомогою представлення State–Action–Outcome (SAO), де State описує поточний стан світу, Action фіксує дії, що вживаються кожним агентом у поточному стані, а Outcome фіксує наслідки дій, такі як прибуток, збитки, витрати та ризики. Варто зазначити, що State розрізняє макростан та більш детальні кількісні стани. У цьому випадку ескалація тертя може бути макростаном, а рівень тарифів, ціни на товари, ступінь впливу на ланцюжок поставок тощо можуть бути включені до детальних записів стану.

Крім того, система окремо враховує зовнішні шоки, такі як раптові зміни політики, зміни середовища або інші події, які не підконтрольні агенту. Після виконання дії та виникнення зовнішньої події стан світу оновлюється. Оновлений стан стає вихідною точкою для наступної дії. Такий цикл повторюється, утворюючи неперервну траєкторію SAO.

Zhongke Wenge

Рисунок 4: Процес виконання SAO

Відповідальність за реальне підтримування цих станів лежить на MetaWorld, який виводить структурований стан світу, який можна обчислювати та оновлювати. Стан можна розділити на три рівні: Environment Layer фіксує загальну середовищну інформацію, спільну для всіх учасників, наприклад, етап ситуації, ціни на ресурси тощо; Agent Metrics Layer записує ресурси, здібності та прогрес у досягненні цілей кожного агента; Relationship Matrix Layer фіксує зміни у відносинах між різними агентами.

MetaWorld також використовує причинно-наслідковий DAG (Causal Directed Acyclic Graph) для обмеження того, як змінюються стани: можливі впливи між змінними організовуються в причинно-наслідкову діаграму на етапі моделювання. Під час виведення система оновлює стани вузлів та ваги причинно-наслідкових зв’язків, але не перегенерує причинно-наслідкову діаграму на кожному кроці.

Це дуже важливо для довгострокового моделювання. Попередні зміни тарифів впливають на ціни, а ціни змінюють вибір компаній та відповідь інших учасників — усі ці зміни потрібно зберігати, щоб продовжувати обчислення. MetaWorld виконує роль цього постійно оновлюваного «світового реєстру».

Третій крок: зі створенням світового стану агенти починають діяти. Традиційне агентно-орієнтоване моделювання (ABM) зазвичай вимагає, щоб експерти заздалегідь визначили учасників, правила поведінки, змінні середовища та механізми взаємодії. Якщо поставити інше питання, потрібно буде знову моделювати багато аспектів. Рішення AutoABM автоматизує цей крок: на основі природної мови система об’єднує зовнішні докази, витягує учасників, цілі та обмеження, простір дій, змінні середовища та причинно-наслідкові зв’язки, а потім на основі цього створює середовище багатоагентного моделювання.

У торгівельному конфлікті одночасно можуть брати участь різні агенти, такі як уряд, підприємства, галузеві організації, споживачі тощо; кожен з них має власні цілі, ресурси, схильність до ризику та непорушні межі. Ці агенти не мають божественного погляду і діють лише на основі локальної інформації, якою вони володіють.

Щодо кожного циклу дій агент спочатку отримує попередні взаємодії та історичні дані, потім оцінює можливості, ризики та обмеження поточної ситуації, генерує кілька альтернативних стратегій та вибирає одну. Крім того, на кожному циклі система одночасно розгортає кілька різних сценаріїв світу: включаючи відносно стабільні рівноважні шляхи, оптимістичні чи песимістичні напрямки розвитку, а також низькопрогнозовані, але високовпливові гілки, які при реалізації кардинально змінюють ситуацію. Потім ці шляхи фільтруються та перевіряються, стан світу оновлюється, і система переходить до наступного циклу. З поступовим продовженням дій усіх учасників деякі шляхи втрачають свою основу, тоді як інші стають більш ймовірними.

Zhongke Wenge

Рисунок 5: Поведінкові парадигми агента

Крім багатоагентного моделювання, складні рішення вимагають «математичного арбітра». Багатоагентні системи можуть генерувати багато здаються логічними сценаріїв майбутнього, але здатність уявити їх не означає їх реалізацію — реальні рішення обмежені жорсткими факторами, такими як бюджет, ресурси, час, політичні межі та баланс інтересів сторін.

Система інтегрована з формальним розв’язувачем (Solver), який вирішує п’ять типів задач: класичні ігри, розподіл ресурсів та оптимізація, планування та розкладання шляхів, ймовірнісні висновки за умов невизначеності та задоволення обмежень. Наприклад, як розподілити ресурси при обмеженому бюджеті, які рівноваги можуть виникнути в багатоучасникових іграх, чи не перевищує стратегія встановлені межі — все це може бути обчислено на цьому рівні. У сфері ігор система має вбудовані дев’ять класичних атомарних ігор, зокрема дилему в’язня, гру про полювання на оленя, гру «хоробрий», гру з нульовою сумою тощо, що охоплюють 144 топології Robinson–Goforth 2×2, щоб ідентифікувати та розв’язувати різні ігрові структури.

Основна ідея цього рівня полягає у тому, що кандидатські стратегії, згенеровані багатоагентними системами, повертаються до обчислювальних ігор, обмежень та оптимізаційних рамок, щоб «семантично обґрунтовані» стратегії перетворилися на «формально перевіряні».

На бенчмарку TMGBench для тестування здатності до багатоагентних ігор точність рівноваги рішень становить 99,4%, точність ідентифікації топології — 100%, середній час розв’язання — 0,8 секунди, а оцінка пояснюваності — 4,3/5,0.

Zhongke Wenge

Таблиця 2: П’ять основних типів розв’язання проблем

Розподіл обов’язків між симуляцією багатоагентних систем та формальним розв’язанням чіткий: перше відповідає за розгортання можливих шляхів, а друге — за перевірку, чи витримують ці шляхи обмеження та структуру гри.

На останньому етапі моделювання залишився ще один ключовий питання: яка ймовірність реалізації кожного з раніше розглянутих сценаріїв майбутнього? Для цього рішення має відділ прогнозування та калібрування (Forecasting & Calibration).

На основі попередньо отриманих кандидатів на шляхи, цей рівень продовжує обробку невизначеності: система поєднує результати моделювання та зовнішні сигнали калібрування, щоб призначити ймовірності різним результатам, а потім калібрує ці ймовірності за допомогою інформації про прогнозуючі ринки, історичних прогнозів та правил оцінки ймовірностей. Рішення, що надається системою, більше не є просто списком сценаріїв «що може відбутися» — кожен шлях тепер супроводжується відповідною оцінкою ймовірності та оновлюється з урахуванням нових доказів та результатів міркувань.

Ми можемо розуміти це як динамічну «карту майбутнього»: продовження торгівельних суперечок, тимчасове полегшення між сторонами або виникнення нових неочікуваних факторів можуть стати різними гілками. Система оцінює ймовірність кожної траєкторії та визначає, які зміни зроблять певний шлях більш ймовірним.

Zhongke Wenge

Рисунок 6: Модуль прогнозування ймовірностей

Таким чином, механізм прийняття рішень з’єднав повний цикл моделювання рішень.

Експериментальна перевірка: чи ефективна ця рамка прийняття рішень?

Звіт використовував кілька експериментів для перевірки системи виведення рішень, найбільш варто подивитися результати «виведення подій та прогнозування ймовірностей».

Спочатку розглянемо власні набори прогнозів подій, щоб оцінити, чи може структуроване логічне міркування покращити прогнозування подій. Команда створила набір даних, що містить 74 події та 370 бінарних питань, який охоплює кілька категорій високої нестабільності та включає різні періоди прогнозування. У налаштуванні оцінки команди загальний результат моделі прийняття рішень становить 78,41%.

Крім того, у налаштуваннях LLM-NEWS для короткострокової групи 3–30 днів результат рішення машини становить 72,80%, GPT-5.5 і Claude-4.7 — відповідно 35,43% і 44,62%; з переходом до середньострокового та довгострокового періодів розрив поступово зменшується. Іншими словами, структуроване логічне міркування має більш виражену перевагу в короткострокових сценаріях, де ситуація швидко змінюється, а історичні закономірності важко застосовувати.

Zhongke Wenge

Додаткові експерименти на публічному прогнозному ринковому бенчмарку PolyBench.

FFA (кінцева точність прогнозу) машини прийняття рішень становить 81,20%, EVPA (точність прогнозування очікуваної волатильності) — 73,40%, MSE (середньоквадратична помилка) — 0,822; усі три показники кращі, ніж у Gemini-3-Flash, MiMo-V2-Flash та Grok-4.1-Fast. Це свідчить про кращу здатність машини прийняття рішень виявляти напрямок змін ринкових ймовірностей та контролювати помилки ймовірності.

Zhongke Wenge

AI-прийняття рішень змінює одиницю конкуренції великих моделей

Генеративний ІІ використовує токени як основну обчислювальну одиницю, розв’язуючи питання «як згенерувати наступний фрагмент контенту»; аDecision AI базується на змінах стану світу як основному об’єкті обчислення, розв’язуючи питання «як дія вплине на наступний стан світу». Перший ставить питання, чи є відповідь логічною, тоді як другий повинен також враховувати причинно-наслідкові зв’язки, реальні обмеження, реакції суперників та зміни ймовірностей. Між ними не існує простої сумісності здібностей — це зміна обчислювальної парадигми.

Рішення AI важко з’являються природним чином лише через більший розмір параметрів і сильніші мовні здібності. Після входу у відкритий світ базові моделі залишаються важливими, але вони починають перетворюватися з цілого системного компонента на складову частину системи прийняття рішень. Одиниця конкуренції AI також зміщується з окремої моделі на повну систему.

Технічний зміст рішень полягає в тому, що вони об’єднують раніше розсіяні здібності в єдину структуру прийняття рішень. Поняття «універсальний» не означає передбачення майбутнього у всіх галузях, а те, що проблеми з різних галузей можна перетворити на стани, дії, результати, обмеження та невизначеність і включити в єдину рамку моделювання та розв’язання.

З цієї точки зору справжня цінність «першої у світі універсальної моделі прийняття рішень» полягає не лише у здобутті «першого місця», а й у формуванні досить повного технічного контуру «універсальної моделі прийняття рішень»: використання експліцитного опису стану світу, застосування багатоагентних систем для виконання дій, перевірка стратегій за допомогою ігор та оптимізації, а також калібрування ймовірностей різних майбутніх сценаріїв. Відповідно, стандарти оцінки ШІ також починають змінюватися — тепер важливо не лише те, чи є відповідь точною, а й чи зберігається послідовність стану, чи можна перевірити логічні висновки, чи є ймовірності надійними, а також чи може система оперативно оновлюватися при з’явленні нової інформації.

На відміну від цього, відповідь, яка звучить логічно, не завжди є рішенням, яке витримує випробування реальністю.

Цей матеріал зі сторінки WeChat «Machine Heart» (ID: almosthuman2014), автор: фокус на AI прийняття рішень

Відмова від відповідальності: Інформація на цій сторінці може бути отримана від третіх осіб і не обов'язково відображає погляди або думки KuCoin. Цей контент надається лише для загального інформування, без будь-яких запевнень або гарантій, а також не може розглядатися як фінансова або інвестиційна порада. KuCoin не несе відповідальності за будь-які помилки або упущення, а також за будь-які результати, отримані в результаті використання цієї інформації. Інвестиції в цифрові активи можуть бути ризикованими. Будь ласка, ретельно оцініть ризики продукту та свою толерантність до ризику, виходячи з ваших власних фінансових обставин. Для отримання додаткової інформації, будь ласка, зверніться до наших Умов використання та Розкриття інформації про ризики.