Microsoft та Шанхайський університет Цзяотонг відкрили джерела Argus — автономну дослідницьку систему на 1548 годин

icon MarsBit
Поділитися
AI summary iconКороткий зміст
Microsoft та Шанхайський університет Цзяо Тонг відкрили код Argus — універсальну середовище виконання агентів для довгострокових дослідницьких завдань. Система підтримує автономні дослідження протягом кількох днів за допомогою рішень, заснованих на доказах. Протестована в 27 кампаніях протягом 1 548 годин, вона досягла рівня завантаження 95,1–98,7%. Argus отримав результати в галузях AI4AI, оптимізації GPU-ядер та AI4Math. Аналіз відкритого інтересу показує сильні технічні рівні підтримки та опору у метриках продуктивності системи.

Від «виконуватиме» до «керуватиме» — чого бракує довгостроковому агенту?

У сучасному світі швидкого розвитку агентів Harness уже дозволив велиkim моделям зіткнутися з реальним світом, дозволяючи їм використовувати інструменти, змінювати код і запускати експерименти. Але коли завдання розтягуються з кількох десятків хвилин на кілька днів, системі все ще потрібен людина, яка довго сидить перед екраном, щоб вирішити, куди рухатися далі.

Ключовою причиною цього обмеження є не лише недостатня здатність моделі, а й те, що існуючі агенти автоматизують лише «виконання», але не автоматизують справжнього «керування» над виконанням. Harness надає моделі здатність до дій, а людина надає моделі здатність до прийняття рішень. Як тільки людина відходить, проект зупиняється. Крім того, у відсутність щільної зворотної зв’язкової інформації про нагороди виконання та реакція агента виглядають повільно та несміливо.

Щоб вирішити цю проблему, Microsoft, Шанхайський джіаотунський університет та інші організації відкрили джерела Argus — універсальну середовище виконання міркувань агента для довгострокових дослідницьких завдань, а також опублікували технічний звіт. Система за допомогою дизайну, заснованого на доказах, саморозвитку, співпраці кількох агентів та розділенні ядра та спеціалізованих областей, дозволяє агентам розширюватися на кілька галузей і безперервно проводити дослідження протягом кількох днів без щільної стандартної зворотного зв’язку.

Звіт охоплює 27 кампаній та 1 548 годин реального часу. У середньому один раз на 40,7 години відбувалася активна потреба у втручанні людини; завантаження звіту становило 95,1%–98,7%. Ця поставка Argus — це не просто високий результат у benchmark, а повний набір продуктивних рішень. Команда представила результати у таких широких галузях, як AI4AI, GPU Kernel, навчання моделей, AI4Science, проектування чіпів, AI4math та AI4System, що підтверджує універсальність та справжній дослідницький рівень інтелекту Argus.

Шанхайський джіаотунський університет

Рисунок 1: Огляд часу виконання Argus, базових показників здатностей та результатів доставки.

Шанхайський джіаотунський університет

  • Назва статті: Argus: Хто керує гірським обладнанням протягом днів?
  • Папер: https://arxiv.org/abs/2608.05144
  • Код: https://github.com/lbx154/Argus
  • Головна сторінка проекту: https://argusbot.cn/
  • Відкритий сховище результатів проекту: https://github.com/Argus-AiTeam
  • Прямий ефір з розв’язанням математичних задач проекту: https://open.argusbot.cn/#counterexample-live

01

Перехід від цілеворієнтованого до доказово-орієнтованого:

Хто вирішує наступний крок агента?

За останні два роки основний прогрес у проекті Agent зосереджувався на Harness: якщо уявити автопілот FSD, то модель — це двигун, а Harness — це трансмісія, але те, хто вирішує, куди їхати, — це людина за екраном. У коротких завданнях, як у звичайному паркуванні, саме завдання надає чіткі зворотні зв’язки; але коли завдання розтягується на кілька днів, дослідницькі проблеми часто не мають стабільної нагороди та чітко визначеної мети з самого початку. Таким чином, існуючі Agent виявляють справжній обмежуючий фактор: вони вже вміють виконувати завдання, але ще не можуть постійно оцінювати в умовах невизначеності.

Шанхайський джіаотунський університет

Рисунок 2: Argus, реалізуючи автономні дослідження за допомогою auto-research, переводить роль людини з місця постійного водія на пасажирське сидіння.

Argus називає цю раніше неавтоматизовану позицію над Harness «Driver». Його завдання — продовжувати керувати, спираючись на докази, навіть коли виникає конфлікт між планом і реальністю. Цілі, записані на початку дослідження, є лише початковими припущеннями на етапі мінімальної інформації; якщо агент зможе прагнути лише до передбачених цілей, навіть у випадку неможливих завдань, витрачаючи токени понад міру, це призведе до жорсткості цілей. Evidence-Driven підхід навпаки перевертає логіку керування: наступний крок визначається наявними доказами, а не початковими припущеннями плану. Усі результати, отримані в процесі виконання, є доказами, що можуть змінити курс; система саме працює за принципом доказів. Конкретно, Driver повинен на основі поточних доказів повторно відповідати на такі чотири питання:

1. Чи було це завдання виконано, і чи якість достатньо висока?

2. Які дії найбільш варто зробити наступними, враховуючи поточні докази?

3. Як слід змінити поведінку системи в майбутньому на основі досвіду, отриманого в цьому турі?

4. Чи стосуються залишені питання рішень, які можуть приймати лише люди?

02

Створіть універсальну налаштовувану довготривалу середовище виконання

Argus організовує довгострокові проекти у постійні кампанії, які розбиваються на серію чітко визначених місій. Його основний цикл: Manager → Planner → Engineer ⇄ Reviewer → Manager:

Згідно з режимом /goal OpenAI Codex, можна краще зрозуміти напрямок дизайну Argus. /goal продовжує однокроковий цикл агента до тривалого циклу з цільовим станом; Argus ж організовує дослідницькі проекти як тривало працюючі системи з багатьма ролями, багатьма harness-ами та можливістю накопичення знань. Перший відповідає на питання «як зробити, щоб агент не зупинявся», а другий — на питання «як ефективно працювати, коли агент не зупиняється». Саме це й є структурною різницею на рівні виконання між підходом, спрямованим на ціль, і підходом, спрямованим на докази.

1. Менеджер керує перехідними етапами, схваленням процесів та глобальними стратегіями;

2. Планувальник планує конкретні завдання на основі поточних даних;

3. Інженер входить до реального кодового репозиторію, експериментує, виконує;

4. Ревізор незалежно перевіряє артефакти, оцінює інноваційність та ефективність, а потім звітує менеджеру або повертає інженеру.

Основна ідея тут — не сама наявність кількох ролей, а розбиття контексту — кілька ролей працюють разом, щоб уникнути того, щоб агент перетворився на простий локальний підйом, де кожна роль має власний унікальний контекст, але спільну робочу область, щоб не покладати всі завдання — планування, виконання та перевірку — на одного агента, що підвищує ефективність використання токенів. Саме тому в одному завданні Argus можна одночасно увімкнути Pi, Codex, Claude Code, DeepSeek Harness Різні harness, що забезпечують високу ступінь кастомізації.

Система зберігає повний набір артефактів; лише досвід, що проходить через поріг доказів, потрапляє до Wiki та Skill і доступний для повторного використання у межах проекту, вертикалі або глобального масштабу.

Тим часом Core та Vertical залишаються роз’єднаними: Core відповідає за права ролей, подання доказів та людські межі, а Vertical визначає експерти з відповідних галузей, що вважається дійсними доказами в математичних, GPU, матеріальних та інших завданнях, а також пов’язані людські навички та знання; Vertical може значно підвищити якість виконання дослідницьких завдань і надає інтерфейс для спільної еволюції людських експертів та агентів, а також для кастомізації робочих процесів.

Шанхайський джіаотунський університет

Рисунок 3: Механізм довгострокової роботи Argus. Чотири ролі обертаються навколо постійного стану, а кампанія може просуватися або відкатуватися між восьма дослідницькими етапами.

03

Через 1548 годин що залишив Argus?

Справжнім критерієм успішності довгострокових агентів є здатність перетворювати час на реальні наукові досягнення. За менше місяця після відкриття джерельного коду Argus вже зробив видатний внесок у дослідження інфраструктури, матеріалів, чіпів, математики та систем штучного інтелекту. Ми також першою командою оприлюднили повний журнал відбору розв’язань математичних гіпотез, відкривши всі сесії треків виконання. Нижче наведено зведення досягнень Argus після відкриття джерельного коду:

Шанхайський джіаотунський університет

Рисунок 4: Репрезентативні дослідження Argus, ключові показники та критерії прийняття

Як показано у таблиці, Argus спочатку перетворив постійне виконання на підтверджений реальний результат у AI4System & Infra, завершивши перший крок від автоматизованого виконання до автономного дослідження за допомогою чітких інженерних результатів; після цього завдання розширилися від AI-інфраструктури до AI4Science, AI4Hardware, AI4Math, і критерії оцінки змінилися з «чи завершено встановлене завдання» на «чи можна дослідити нерозв’язані актуальні наукові проблеми», що дозволило автоматизованому дослідженню перейти від автоматизованого надання до автоматизованого дослідження; на цій основі Argus розширився у напрямку AI4AI від окремих результатів до повного дослідницького процесу, постійно підтримуючи просування завдань за допомогою доказів, не вимагаючи постійного перебування людини біля екрану, формуючи таким чином прогресивний шлях від реального надання, міждисциплінарного дослідження до повністю автономного дослідження.

Шанхайський джіаотунський університет

Рисунок 5: Результати, отримані Argus у процесі написання статті.

Всі ці результати було досягнуто протягом одного місяця. Об’єднуючи ці досягнення, Argus — це поступово глибшаюча ланцюжок цінності: автоматизовані об’єкти розширюються від одноразового виконання до досліджень, що продвигаються на основі доказів, що значно прискорює прогрес у дослідженнях — це найбільш пряма відповідь на питання: «Хто керуватиме агентом, коли людина відійде від екрана?»

Висновок

Після вимкнення екрану проект не зник.

Довгострокова інтелігентність полягає у перетворенні токенів на інтелект, а потім використанні цього інтелекту для постійного просування дослідницького проекту та створення реальної вартості. Argus об’єднує раніше ізольовані виклики моделей у єдину неперервно працюючу дослідницьку систему, де напрямок керується доказовою основою, а досвід через саморозвиток перетворюється на здатності.

Argus демонструє не просто довготривалий агент, а новий спосіб організації досліджень: Harness вирішує, як діють моделі, а Driver визначає, як система постійно рухається вперед — швидкість досліджень більше не обмежена часом роботи та відпочинку людей. Це може означати, що настає ера прискорення досліджень. Екран може вимкнутися, а дослідження продовжуються.

Авторський опис

Argus розробляють дослідники з Microsoft та Шанхайського джияотонського університету, а також дослідники з інших університетів.

Цей текст походить із офіційного каналу WeChat «Machine Heart»

Відмова від відповідальності: Інформація на цій сторінці може бути отримана від третіх осіб і не обов'язково відображає погляди або думки KuCoin. Цей контент надається лише для загального інформування, без будь-яких запевнень або гарантій, а також не може розглядатися як фінансова або інвестиційна порада. KuCoin не несе відповідальності за будь-які помилки або упущення, а також за будь-які результати, отримані в результаті використання цієї інформації. Інвестиції в цифрові активи можуть бути ризикованими. Будь ласка, ретельно оцініть ризики продукту та свою толерантність до ризику, виходячи з ваших власних фінансових обставин. Для отримання додаткової інформації, будь ласка, зверніться до наших Умов використання та Розкриття інформації про ризики.