微軟與上海交通大學開源 Argus,1548 小時自主研究系統

icon MarsBit
分享
AI summary icon精華摘要
微軟與上海交通大學已開源 Argus,這是一個適用於長期研究任務的通用代理運行時系統。該系統可透過以證據為導向的決策,實現跨多日的自主研究。在 27 場活動和 1,548 小時的測試中,其工作負載週期達到 95.1% 至 98.7%。Argus 在 AI4AI、GPU 核心優化和 AI4Math 領域產生了成果。未平倉量分析顯示,其性能指標具有強勁的技術支撐與阻力水平。

從「會執行」到「會掌舵」,長程 Agent 還缺什麼?

在 Agent 快速發展的今天,Harness 已經讓大模型觸碰到真實世界,能夠調用工具、修改代碼並運行實驗。但當任務從幾十分鐘延長到數天,系統仍需要一個人長期守在螢幕前,判斷下一步該往哪裡走。

造成這一瓶頸的關鍵,不僅僅是模型能力不足,更是現有的 Agent 大多自動化了「執行」,卻未真正自動化執行之上的「駕駛」。Harness 賦予模型行動的能力,人類賦予模型決策。一旦人類離開,項目便隨之停擺。此外,在缺乏密集獎勵反饋的情況下,Agent 的執行與反應也會顯得遲鈍笨拙。

為了解決這一問題,微軟、上海交通大學等機構開源了 Argus,一套面向長週期研究任務的通用 Agent 推理運行時,並發布技術報告。系統透過證據驅動、自進化、多 Agent 協作、核心與垂域解耦等設計,讓 Agent 在沒有密集標準回饋的情況下,擴展至多領域持續研究數天。

報告涵蓋 27 個 Campaign、1,548 小時牆鐘時間。平均每 40.7 小時主動請求一次人類干預;報告的工作佔空比為 95.1%~98.7%。這次 Argus 交付的不只是高分 benchmark,而是一套完整的生產級成果冊。團隊在 AI4AI、GPU Kernel、模型訓練、AI4Science、晶片設計、AI4math、AI4System 等廣闊任務上提供了成果,體現了 Argus 的通用性與真實研究級智慧。

上海交通大學

圖 1:Argus 運行時、能力基準與交付成果總覽。

上海交通大學

  • 論文標題:Argus:誰在驅動這股勢力數日?
  • 論文:https://arxiv.org/abs/2608.05144
  • 代碼:https://github.com/lbx154/Argus
  • 項目主頁:https://argusbot.cn/
  • 項目成果開源庫:https://github.com/Argus-AiTeam
  • 項目數學解題直播:https://open.argusbot.cn/#counterexample-live

01

從目標導向轉向證據導向:

誰來決定 Agent 的下一步?

過去兩年,Agent 工程的主要進展集中在 Harness:以自動駕駛的 FSD 作比喻,模型像發動機,Harness 像傳動系統,但真正決定車輛駛向哪裡的,仍是坐在螢幕前的人。在短任務中,就像普通的自動泊車,任務本身還能提供明確反饋;一旦任務延長至數天,研究問題往往既沒有穩定的獎勵,也沒有從一開始就定義清楚的目標。現有 Agent 因此暴露出真正的瓶頸:它們已經會執行,卻還不會在不確定性中持續判斷。

上海交通大學

圖 2:Argus 透過實現 auto-research 的自主科研,將人類的角色從持續推動的駕駛位變為副駕駛。

Argus 將 Harness 上方這個此前未被自動化的位置稱為 Driver。它的作用是在計劃與現實衝突時,仍能依據證據繼續掌舵。研究開始時寫下的目標,僅是資訊最少階段的初始假設;如果 Agent 只能以 Goal-Driven 方式追逐預設終點,甚至在不可能的目標上反覆浪費 Token,就會導致目標僵化。而 Evidence-Driven 則將控制邏輯倒轉:下一步由已有證據決定,而非由計劃最初的假設決定。運行中的一切結果,都是能改變路線的有效證據;系統正是以證據驅動。具體而言,Driver 需要根據當前證據反覆回答以下四個問題:

Has this task been completed, and is the quality sufficient?

2. Based on current evidence, what is the most worthwhile next step?

3. 本輪獲得的經驗,應如何改變後續的系統行為?

4. 剩餘的問題是否涉及只有人類才能作出的決定?

02

Build a universal customizable long-running runtime

Argus 將長期項目組織為持久性的 Campaign,並拆解為一系列邊界明確的 Mission。其基本閉環為:Manager → Planner → Engineer ⇄ Reviewer → Manager:

以 OpenAI Codex 的 /goal 模式為參照,可以更清楚地定位 Argus 的設計取向。/goal 是將一個 agent 的單輪迴圈拉長為帶有 goal state 的持久迴圈;Argus 則是將研究項目組織為多角色、多 harness、可沉澱知識的長程運行時。前者回答「怎麼讓 agent 不停下來」,後者回答「agent 不停下來後,怎麼有效工作」。這正是從 Goal-Driven 轉向 Evidence-Driven 在運行時層面對應的結構差異。

1. 管理員掌握階段轉換、流程審批、全局策略;

2. Planner 根據當前證據規劃具體任務;

3. Engineer 進入真實代碼庫、實驗、執行;

4. 審核者獨立審查工件,檢驗其創新性與有效性,並向經理報告或退回給工程師。

重點不在於多角色本身,而在於拆分上下文——多個角色相互配合,以避免 agent 變成簡單的局部爬山器;每個角色擁有自己獨特的上下文,但共享工作區,從而避免將規劃、執行和驗證全部交由單一 agent 完成,可提升 token 效率。正因如此,可在 Argus 的一個任務中同時啟用 Pi、Codex、Claude Code、 DeepSeek 網羅 不同的 harness,保證了高度客製化。

系統儲存的是一套完整的工件;只有通過證據門檻的經驗,才會進入 Wiki 和 Skill,並按 Project、Vertical 或 Global 作用域供後續任務複用。

同時,Core 與 Vertical 保持解耦:Core 負責角色權限、證據提交和人類邊界;Vertical 由領域專家定義數學、GPU、材料等任務中什麼才算有效證據,以及相關的人類 skill 和知識;Vertical 可顯著提升研究任務的交付品質,同時為人類專家與 agent 的協同進化及客製化工作流程提供介面。

上海交通大學

圖 3:Argus 的長程運行機制。四類角色圍繞持久狀態循環,Campaign 可在八個研究階段間推進或回滾。

03

1548 小時之後,Argus 留下了什麼?

真正決定長程 Agent 是否成立的,是時間能否轉化為真實的研究成果。Argus 開源後不到一個月,已在基礎設施、材料、晶片、數學和 AI 系統研究中做出卓越貢獻,同時我們是首個公布完整端到端數學猜想解決篩選日誌的團隊,將所有的運行軌跡 session 等均開放,以下為 Argus 開源後各項成果的彙總:

上海交通大學

圖 4:Argus 代表性研究成果、關鍵指標與驗收依據

As shown in the table above, Argus first transformed continuous operation into verifiable, tangible deliverables within AI4System & Infra, completing the first step from automated execution to autonomous research through clear engineering outcomes; subsequently, the scope of tasks expanded from AI infrastructure to AI4Science, AI4Hardware, and AI4Math, with evaluation criteria shifting from “whether predefined tasks were completed” to “whether unresolved real-world research problems could be explored,” thereby advancing automated research from automated delivery to automated exploration; on this foundation, Argus further extended from isolated achievements to a complete research workflow in the AI4AI direction, continuously driving task progression with evidence, eliminating the need for humans to remain constantly at their screens, thus forming a progressive path from tangible delivery, cross-domain exploration, to fully autonomous research.

上海交通大學

圖 5:Argus 在全流程論文生產中的交付結果。

以上成果均在 1 個月內取得,將這些成果串聯起來,Argus 是一條逐步加深的價值鏈:自動化的對象由單次執行擴展至證據驅動的研究推進,大幅加速研究進展,這也是「人離開螢幕後,誰來駕駛 Agent」最直接的答案。

結語

螢幕熄滅後,項目並未歸零

長程智能是將 Token 轉化為智能,再以智能持續推進研究項目,創造實際價值。Argus 將原本彼此割裂的模型調用整合為一套持續運轉的研究系統,以 Evidence-Driven 控制方向,並透過自進化將經驗沉淀為能力。

Argus 展示的不僅僅是一個運行時間更長的 Agent,而是一種全新的研究組織方式:Harness 解決模型如何行動,Driver 決定系統如何持續前進,研究速度不再受制於人類的工作與娛樂時間。這可能意味著研究的加速時代正在到來。螢幕可以熄滅,研究仍在繼續。

作者介紹

Argus 由微軟與上海交通大學的研究者牽頭,並由多所高校的研究者共同推進。

本文來自微信公眾號「機器之心」

免責聲明:本頁面資訊可能來自第三方,不一定反映KuCoin的觀點或意見。本內容僅供一般參考之用,不構成任何形式的陳述或保證,也不應被解釋為財務或投資建議。 KuCoin 對任何錯誤或遺漏,或因使用該資訊而導致的任何結果不承擔任何責任。 虛擬資產投資可能存在風險。請您根據自身的財務狀況仔細評估產品的風險以及您的風險承受能力。如需了解更多信息,請參閱我們的使用條款風險披露