Microsoft и Шанхайский университет Цзяо Тонг открыли исходный код Argus — автономной исследовательской системы на 1548 часов

icon MarsBit
Поделиться
AI summary iconСводка
Microsoft и Шанхайский университет Цзяотонг открыли исходный код Argus — универсальной среды выполнения агентов для долгосрочных исследовательских задач. Система поддерживает автономные исследования в течение нескольких дней с использованием принятия решений на основе доказательств. При тестировании в 27 кампаниях и за 1548 часов она показала рабочий цикл от 95,1% до 98,7%. Argus сгенерировала результаты в областях AI4AI, оптимизации GPU-ядер и AI4Math. Анализ открытого интереса показывает сильные уровни технической поддержки и сопротивления в метриках производительности системы.

От «выполнения» к «управлению» — чего не хватает долгосрочному агенту?

В эпоху быстрого развития агентов Harness уже позволил крупным моделям взаимодействовать с реальным миром, вызывать инструменты, изменять код и запускать эксперименты. Однако, когда задачи продлеваются с десятков минут до нескольких дней, системе все еще требуется человек, который долго сидит перед экраном, чтобы решить, куда двигаться дальше.

Ключевой проблемой, вызывающей этот узкий момент, является не только недостаточная способность модели, но и то, что существующие агенты в основном автоматизируют «выполнение», но не автоматизируют настоящую «навигацию» над выполнением. Harness предоставляет модели способность к действиям, а люди дают модели способность к принятию решений. Как только человек уходит, проект останавливается. Кроме того, при отсутствии плотной обратной связи по вознаграждению выполнение и реакции агента становятся медленными и неуклюжими.

Для решения этой проблемы Microsoft, Шанхайский джияотонгский университет и другие организации открыли исходный код Argus — универсальную среду выполнения рассуждений агентов для долгосрочных исследовательских задач — и опубликовали технический отчет. Система позволяет агентам расширяться на несколько областей и продолжать исследования в течение нескольких дней без интенсивной стандартной обратной связи благодаря дизайну, основанному на доказательствах, самоэволюции, сотрудничестве нескольких агентов и разделении ядра и специализированных доменов.

Отчет охватывает 27 кампаний и 1548 часов реального времени. В среднем активный запрос на вмешательство человека происходит каждые 40,7 часа; коэффициент загрузки отчета составляет 95,1%–98,7%. Этот выпуск Argus предоставляет не только высокие результаты в бенчмарках, но и полный набор производственных решений. Команда представила результаты в широком спектре задач, включая AI4AI, GPU Kernel, обучение моделей, AI4Science, проектирование чипов, AI4math и AI4System, продемонстрировав универсальность и реальный исследовательский уровень интеллекта Argus.

Шанхайский джияотунский университет

Рисунок 1: Обзор времени выполнения Argus, базовых показателей возможностей и итоговых результатов.

Шанхайский джияотунский университет

  • Название статьи: Argus: Кто управляет упряжью на протяжении дней?
  • Статья: https://arxiv.org/abs/2608.05144
  • Код: https://github.com/lbx154/Argus
  • Главная страница проекта: https://argusbot.cn/
  • Открытый репозиторий с результатами проекта: https://github.com/Argus-AiTeam
  • Прямая трансляция решения математических задач проекта: https://open.argusbot.cn/#counterexample-live

01

Переход от целенаправленного к основанному на доказательствах:

Кто решает следующий шаг агента?

За последние два года основной прогресс в инженерии Agent был сосредоточен на Harness: если использовать аналогию с автопилотом FSD в автономных автомобилях, модель — это двигатель, а Harness — трансмиссия, но окончательное решение о том, куда поедет автомобиль, по-прежнему принимает человек за экраном. В краткосрочных задачах, как при обычной парковке, сама задача предоставляет четкую обратную связь; однако, когда задача растягивается на несколько дней, исследовательские проблемы часто не имеют стабильной награды и четко определенной цели с самого начала. Таким образом, существующие Agent демонстрируют настоящий узкий момент: они уже умеют выполнять действия, но еще не способны постоянно оценивать в условиях неопределенности.

Шанхайский джияотунский университет

Рисунок 2: Argus, реализуя автономные научные исследования через auto-research, переводит роль человека с водительского сиденья постоянного управления на пассажирское сиденье.

Argus называет ранее неавтоматизированную позицию над Harness «Driver». Его задача — продолжать управлять, основываясь на доказательствах, даже когда планы противоречат реальности. Цели, записанные в начале исследования, являются лишь начальными гипотезами на этапе минимальной информации; если агент будет лишь целенаправленно преследовать заранее заданные конечные точки, даже при невозможности достижения этих целей и многократной трате токенов, это приведет к жесткости целей. Evidence-Driven, напротив, переворачивает логику управления: следующий шаг определяется имеющимися доказательствами, а не исходными предположениями плана. Все результаты, полученные в процессе работы, являются действительными доказательствами, способными изменить курс; система именно на доказательствах и основана. Конкретно, Driver должен на основе текущих доказательств многократно отвечать на следующие четыре вопроса:

Работа уже завершена и её качество достаточно высоко?

2. Исходя из текущих данных, что наиболее целесообразно сделать дальше?

3. Как следует изменить поведение системы на основе опыта, полученного в этом цикле?

4. Остались ли вопросы, требующие решений, которые могут принять только люди?

02

Настройка универсальной пользовательской среды выполнения длительного времени

Argus организует долгосрочные проекты в виде постоянных кампаний, которые затем разбиваются на серию четко определенных миссий. Его основной цикл выглядит так: Manager → Planner → Engineer ⇄ Reviewer → Manager:

Сравнение с режимом /goal OpenAI Codex позволяет яснее определить ориентацию Argus. Режим /goal продлевает однократный цикл агента до устойчивого цикла с целевым состоянием; Argus же организует исследовательские проекты как долгосрочные среды выполнения с множеством ролей, множеством сред и возможностью накопления знаний. Первый отвечает на вопрос «как заставить агента не останавливаться», второй — на вопрос «как эффективно работать, когда агент не останавливается». Именно это и есть структурное различие на уровне среды выполнения между подходом, ориентированным на цель, и подходом, ориентированным на доказательства.

1. Менеджер управляет переходом между этапами, одобрением процессов и глобальной стратегией;

2. Планировщик разрабатывает конкретные задачи на основе текущих данных;

3. Инженер входит в реальный кодовый репозиторий, проводит эксперименты, выполняет действия;

4. Рецензент независимо проверяет артефакты, оценивает инновационность и эффективность, и сообщает менеджеру или возвращает инженеру.

Основной акцент здесь не на самих ролях, а на разделении контекста — несколько ролей работают совместно, чтобы предотвратить превращение агента в простой локальный восходящий алгоритм. Каждая роль имеет свой уникальный контекст, но использует общую рабочую область, что позволяет не возлагать все этапы — планирование, выполнение и проверку — на одного агента, повышая эффективность использования токенов. Именно поэтому в рамках одной задачи в Argus можно одновременно активировать Pi, Codex, Claude Code, DeepSeek Harness Различные харнессы обеспечивают высокую степень настройки.

Система сохраняет полный набор артефактов; только опыт, прошедший порог доказательств, попадает в Wiki и Skill и доступен для повторного использования в последующих задачах в рамках проекта, вертикали или глобального масштаба.

В то же время Core и Vertical остаются декомплированными: Core отвечает за права ролей, представление доказательств и человеческие границы, а Vertical, определяемый экспертами в области, задает, что считается действительными доказательствами в задачах, связанных с математикой, GPU, материалами и т.д., а также соответствующие человеческие навыки и знания; Vertical может значительно повысить качество выполнения исследовательских задач и предоставляет интерфейс для совместной эволюции человеческих экспертов и агентов, а также для настройки рабочих процессов.

Шанхайский джияотунский университет

Рисунок 3: Механизм долгосрочной работы Argus. Четыре роли циркулируют вокруг постоянного состояния, и кампания может продвигаться или откатываться между восемью этапами исследования.

03

Что оставил Аргус через 1548 часов?

На самом деле, успех долгосрочного агента определяется тем, может ли время быть преобразовано в реальные научные результаты. В течение менее чем месяца после открытия исходного кода Argus уже внес выдающийся вклад в исследования инфраструктуры, материалов, чипов, математики и систем ИИ. Мы также стали первой командой, опубликовавшей полные логи отбора решений математических гипотез в режиме полного цикла, открыв все сессии траекторий выполнения. Ниже приведен обзор достижений Argus после открытия исходного кода:

Шанхайский джияотунский университет

Рисунок 4: Репрезентативные исследовательские достижения Argus, ключевые показатели и критерии приемки

Как показано в таблице выше, Argus сначала преобразовал непрерывную работу в проверяемые реальные результаты в области AI4System & Infra, завершив первый шаг от автоматического выполнения к автономным исследованиям с четкими инженерными результатами; затем задачи расширились от AI-инфраструктуры до AI4Science, AI4Hardware и AI4Math, и критерии оценки сместились с «выполнена ли запланированная задача» на «способна ли система исследовать нерешенные практические научные проблемы», что позволило автоматизированным исследованиям перейти от автоматизированной доставки к автоматизированному исследованию; на этой основе Argus далее расширил направление AI4AI от единичных результатов до полного исследовательского цикла, обеспечивая непрерывное продвижение задач на основе доказательств, без необходимости постоянного присутствия человека перед экраном, тем самым сформировав прогрессивный путь от реальной доставки через междисциплинарное исследование к полной автономии исследовательских процессов.

Шанхайский джияотунский университет

Рисунок 5: Результаты, предоставленные Argus на всех этапах производства научной статьи.

Все эти результаты были достигнуты в течение одного месяца. Соединив эти достижения вместе, Argus представляет собой постепенно углубляющуюся цепочку создания стоимости: автоматизированные объекты расширяются от однократного выполнения до исследований, управляемых доказательствами, что значительно ускоряет прогресс в исследованиях — это самый прямой ответ на вопрос «Кто будет управлять агентом, когда человек отойдет от экрана?»

Заключение

После отключения экрана проект не обнулился

Долгосрочный интеллект превращает токены в интеллект, а затем использует этот интеллект для непрерывного продвижения исследовательского проекта и создания реальной ценности. Argus объединяет ранее изолированные вызовы моделей в непрерывно функционирующую исследовательскую систему, направляя её с помощью Evidence-Driven подхода и посредством саморазвития превращая опыт в компетенции.

Argus представляет собой не просто более длительно работающий агент, а новый способ организации исследований: Harness решает, как действует модель, а Driver определяет, как система продолжает продвигаться вперед — скорость исследований больше не зависит от рабочего и личного времени человека. Это может означать, что наступает эра ускорения исследований. Экран может погаснуть, но исследования продолжаются.

Авторская информация

Argus возглавляется исследователями Microsoft и Шанхайского джияотонского университета, а также продвигается совместно исследователями нескольких университетов.

Эта статья взята из официального аккаунта WeChat «Machine Heart»

Отказ от ответственности: Информация на этой странице может быть получена от третьих лиц и не обязательно отражает взгляды или мнения KuCoin. Данный контент предоставляется исключительно в общих информационных целях, без каких-либо заверений или гарантий, а также не может быть истолкован как финансовый или инвестиционный совет. KuCoin не несет ответственности за ошибки или упущения, а также за любые результаты, полученные в результате использования этой информации. Инвестиции в цифровые активы могут быть рискованными. Пожалуйста, тщательно оценивайте риски, связанные с продуктом, и свою устойчивость к риску, исходя из собственных финансовых обстоятельств. Для получения более подробной информации, пожалуйста, ознакомьтесь с нашими Условиями использования и Уведомлением о риске.