Buksan ng Microsoft at Shanghai Jiao Tong University ang Argus, 1548-hour na Autonomous Research System

icon MarsBit
I-share
AI summary iconSummary
Ang Microsoft at ang Shanghai Jiao Tong University ay nag-open source ng Argus, isang pangkalahatang agent runtime system para sa mga mahabang panahong pananaliksik. Ang sistema ay sumusuporta sa awtonomong pananaliksik sa loob ng maraming araw gamit ang pagdedesisyon na batay sa ebidensya. Nasubok sa 27 kampanya at 1,548 oras, nakamit nito ang 95.1% hanggang 98.7% na work duty cycle. Ang Argus ay nag-produce ng mga resulta sa AI4AI, GPU kernel optimization, at AI4Math. Ang pag-analisa ng open interest ay nagpapakita ng malakas na teknikal na suporta at resistance levels sa mga metric ng performance ng sistema.

Mula sa “magpapatakbo” patungo sa “magpapangulo,” ano pa ang kulang sa Long-term Agent?

Sa kasalukuyang mabilis na pag-unlad ng Agent, pinagdala na ng Harness ang malalaking modelo sa tunay na mundo, kaya nilang i-call ang mga tool, baguhin ang code, at patakbuhin ang mga eksperimento. Ngunit kapag ang mga gawain ay lumalawig mula sa ilang minuto hanggang sa ilang araw, kailangan pa rin ng sistema ng isang tao na manatili sa harap ng screen para masukat ang susunod na hakbang.

Ang pangunahing sanhi ng bottleneck ay hindi lamang ang kakulangan sa kapasidad ng modelo, kundi ang katotohanan na ang karamihan sa mga kasalukuyang Agent ay automatizado ang 'paggawa', ngunit hindi talaga automatizado ang 'pangangasiwa' sa ibabaw ng paggawa. Binibigyan ng Harness ang modelo ng kakayahang mag-aksi, samantalang binibigyan ng tao ang modelo ng desisyon. Kapag umalis ang tao, tumitigil din ang proyekto. At sa kawalan ng malakas na feedback sa reward, ang paggawa at reaksyon ng Agent ay maaaring maging mabagal at kahina-hina.

Upang lutasin ang problema na ito, ang Microsoft, Shanghai Jiao Tong University, at iba pang mga institusyon ay nag-open source ng Argus, isang pangkalahatang Agent reasoning runtime na nakatuon sa mga mahabang panahong pananaliksik, kasama ang teknikal na ulat. Sa pamamagitan ng disenyo na batay sa ebidensya, self-evolving, multi-agent collaboration, at decoupling ng core at domain-specific components, ang sistema ay nagpapahintulot sa mga Agent na mag-expand sa maraming larangan at magpatuloy sa pananaliksik nang ilang araw nang walang malakas na standard feedback.

Ang ulat ay sumasakop sa 27 na Campaign, 1,548 na oras ng real-time. Ang average ay isang aktibong hiling para sa tao na interbensyon bawat 40.7 na oras; ang duty cycle ng ulat ay 95.1% hanggang 98.7%. Ang pagpapadala na ito ng Argus ay higit pa sa isang mataas na marka sa benchmark—ito ay isang buong koleksyon ng produksyon-grade na resulta. Ang koponan ay nagbigay ng mga resulta sa malawak na mga gawain tulad ng AI4AI, GPU Kernel, model training, AI4Science, chip design, AI4math, at AI4System, na nagpapakita ng universalidad at tunay na research-grade na智能化 ng Argus.

Shanghai Jiao Tong University

Figure 1: Pangkalahatang-pananaw sa Argus runtime, capability benchmark, at mga resulta ng pagpapadala.

Shanghai Jiao Tong University

  • Pamagat ng papel: Argus: Sino ang Nagpapagalaw sa Harness sa Mga Araw?
  • Papel: https://arxiv.org/abs/2608.05144
  • Code: https://github.com/lbx154/Argus
  • Pahina ng proyekto: https://argusbot.cn/
  • Open-source library ng project result: https://github.com/Argus-AiTeam
  • Live na ngayon ang paglutas ng mga problema sa matematika ng proyekto: https://open.argusbot.cn/#counterexample-live

01

Mula sa Goal-Driven patungo sa Evidence-Driven:

Sino ang magdedesisyon sa susunod na hakbang ng Agent?

Sa nakaraang dalawang taon, ang pangunahing pag-unlad sa proyekto ng Agent ay nakatuon sa Harness: gamit ang FSD ng autonomous driving bilang metapora, ang model ay tulad ng engine, habang ang Harness ay tulad ng transmission system, ngunit ang tunay na nagpapasya kung saan papunta ang sasakyan ay ang tao na nakaupo sa harap ng screen. Sa maikling mga gawain, tulad ng karaniwang automatic parking, ang gawain mismo ay nagbibigay ng malinaw na feedback; ngunit kapag ang gawain ay napapalawig sa ilang araw, ang mga problema sa pag-aaral ay kadalasang walang matatag na reward at walang malinaw na layunin mula sa simula. Ang umiiral na Agent ay nagpapakita ng totoong hadlang: alam na nilang gawin ang mga gawain, ngunit hindi pa sila kayang magpatuloy na magpasya sa gitna ng kakaibang kalagayan.

Shanghai Jiao Tong University

Figure 2: Sa pamamagitan ng pagpapatupad ng auto-research, ang Argus ay nagpapalit sa papel ng tao mula sa driver’s seat na patuloy na nagpapagalaw patungo sa passenger seat.

Tinatawag ng Argus ang dating hindi awtomatizado na posisyon sa itaas ng Harness bilang Driver. Ang layunin nito ay patuloy na magmamaneho batay sa ebidensya, kahit na may pagkakaiba sa pagitan ng plano at katotohanan. Ang mga layunin na isinulat sa simula ng pag-aaral ay simpleng unang hipotesis sa isang yugto na may kaunting impormasyon; kung ang Agent ay nagpapalakas lamang sa paghahanap ng nakatakdang katapusan, kahit sa mga imposibleng layunin at paulit-ulit na pagwawasto ng Token, magiging rigid ang layunin. Ang Evidence-Driven naman ay binabago ang lohika ng kontrol: ang susunod na hakbang ay tinutukoy ng mga umiiral na ebidensya, hindi ng mga unang hipotesis ng plano. Ang lahat ng resulta sa pagpapatakbo ay ebidensyang makakapagbabago ng landas; ang sistema ay direktang dinadala ng ebidensya. Sa partikular, kailangan ng Driver na paulit-ulit na sagutin ang sumusunod na apat na tanong batay sa kasalukuyang ebidensya:

Nakatapos na ba ang trabaho, at sapat na ba ang kalidad nito?

2. Batay sa kasalukuyang ebidensya, ano ang pinakamahalagang gagawin sunod?

3. Paano dapat baguhin ang susunod na pag-uugali ng sistema batay sa karanasan sa round na ito?

4. May mga natitirang tanong ba na tumatalakay sa mga desisyon na maaaring gawin lamang ng tao?

02

Ipatayo ang isang pangkalahatang custom long-running runtime

Ang Argus ay nag-organisa ng mga matagalang proyekto bilang mga patuloy na Campaign, at sinasplitsa ito sa isang serye ng malinaw na hangganan ng Mission. Ang kanilang pangunahing loop ay Manager → Planner → Engineer ⇄ Reviewer → Manager:

Kung gagamitin ang /goal mode ng OpenAI Codex bilang pagsasalin, mas malinaw ang direksyon ng disenyo ni Argus. Ang /goal ay nagpapalawig ng isang single-loop ng isang agent sa isang matagal na loop na may goal state; samantala, ang Argus ay nag-uugnay ng mga proyekto sa pananaliksik bilang maraming papel, maraming harness, at may kakayahang mag-imbak ng kaalaman sa isang matagal na runtime. Ang una ay sumasagot sa “paano gawing hindi tumigil ang agent”; ang ikalawa naman ay sumasagot sa “paano mapapakinabangan nang epektibo ang agent kung hindi ito tumitigil.” Ito ang eksaktong struktural na pagkakaiba sa runtime mula sa Goal-Driven patungo sa Evidence-Driven.

1. Ang Manager ay may kontrol sa pagpapalit ng mga yugto, pagpapasya sa proseso, at pandaigdigang patakaran;

2. Ang Planner ay nagpaplano ng mga tiyak na gawain batay sa kasalukuyang ebidensya;

3. Ingniyero: Makapasok sa totoong code repository, eksperimento, at pagsasagawa;

4. Ang reviewer ay tumitingin sa mga independiyenteng artefact at sinusuri ang pagkakamali at epektibidad, at ipinapahayag sa manager o ibinabalik sa engineer.

Hindi ang pangunahing punto ang maraming role mismo, kundi ang paghihiwalay ng konteksto — ang maraming role na nagtatrabaho nang magkakasama upang maiwasan ang pagiging simpleng local hill-climber ng agent, kung saan bawat role ay may sariling natatanging konteksto ngunit nagbabahagi ng workspace, upang hindi isang agent lang ang magdadasal sa pagpaplano, pagsasagawa, at pagsusuri, na maaaring mapataas ang efficiency ng token. Dahil dito, maaaring i-enable ang Pi, Codex, at Claude Code nang sabay-sabay sa isang gawain ng Argus, DeepSeek Harness Mga iba’t ibang harness, na nagtataguyod ng mataas na pagkakakilanlan.

Ang sistemang nag-iimbak ay isang buong artifact; ang mga karanasan lamang na nakakapasa sa batayan ng ebidensya ang makakapasok sa Wiki at Skill, at maaaring muling gamitin sa mga susunod na gawain ayon sa sakop ng Project, Vertical, o Global.

Samantala, ang Core at Vertical ay nananatiling hiwalay: ang Core ay nagtatanggol ng mga karapatan ng papel, pagsumite ng ebidensya, at mga hangganan ng tao; ang Vertical ay tinukoy ng mga eksperto sa larangan kung ano ang itinuturing na ebidensya sa mga gawain tulad ng matematika, GPU, at materyales, kasama ang kaugnay na kasanayan at kaalaman ng tao; ang Vertical ay maaaring malinaw na pataasin ang kalidad ng pagpapadala ng mga pag-aaral, at nagbibigay din ng interface para sa ko-ebolusyon ng mga eksperto at agent, at pag-customize ng mga proseso ng trabaho.

Shanghai Jiao Tong University

Figure 3: Ang mekanismo ng long-range ng Argus. Ang apat na uri ng papel ay umiikot sa paligid ng patuloy na estado, at ang Campaign ay maaaring magpalaya o mag-rollback sa pagitan ng walong yugto ng pag-aaral.

03

Pagkatapos ng 1,548 na oras, ano ang natirang ng Argus?

Ang tunay na pagtukoy kung ang long-term Agent ay makakamit ay kung ang oras ay maaaring isalin sa totoong mga resulta ng pananaliksik. Sa loob ng isang buwan pagkatapos ng pagbukas ng Argus, ito ay nagbigay ng mga makabuluhang kontribusyon sa infrastruktura, materyales, chip, matematika, at pananaliksik sa AI system. Samantala, kami ang unang tim na nagpahayag ng kompletong end-to-end log ng pagpili ng paglutas ng matematikal na konjektura, at inilabas ang lahat ng mga session ng tracing. Narito ang buod ng mga resulta ng Argus pagkatapos ng pagbukas:

Shanghai Jiao Tong University

Figure 4: Mga representative na pag-aaral, pangunahing mga indikador, at mga batayan para sa pagtatanggap ng Argus

Tulad ng ipinakikita sa tabla, unang ginawa ng Argus ang pagpapalit ng patuloy na pagpapatakbo sa isang makatotohanang deliverable sa AI4System & Infra, na nagtapos sa unang hakbang mula sa awtomatikong pagpapatakbo patungo sa awtonomong pag-aaral sa pamamagitan ng malinaw na inhinyeriyang resulta; pagkatapos, ang mga gawain ay napalawak mula sa AI infrastructure patungo sa AI4Science, AI4Hardware, at AI4Math, at ang mga pamantayan sa pagtataya ay naging “kung nakakatapos ba ito ng nakatakdaang gawain” patungo sa “kung kayang masuri ang mga hindi pa nalulutas na aktuwal na problema sa pag-aaral”, kaya ang awtomatikong pag-aaral ay inilipat mula sa awtomatikong deliverable patungo sa awtomatikong paglalayong mag-eksplorasyon; batay dito, lumawak pa ng Argus sa direksyong AI4AI mula sa isang puntos na resulta patungo sa buong proseso ng pag-aaral, na pinapagalaw ang mga gawain sa pamamagitan ng patuloy na ebidensya, nang hindi kailangang manatili ang tao sa harap ng screen, at kaya ay nabuo ang isang patuloy na landas mula sa makatotohanang deliverable, interdisiplinaryong paglalayong mag-eksplorasyon, hanggang sa awtonomong pag-aaral sa buong proseso.

Shanghai Jiao Tong University

Figure 5: Mga resulta ng Argus sa buong proseso ng paggawa ng papel.

Nakamit ang lahat ng mga resultang ito sa loob ng isang buwan; pagkakasunod-sunodin ang mga tagumpay na ito, ang Argus ay isang palalim na value chain: ang automation ay nagsimula sa isang pagpapatupad at lumawak patungo sa evidence-driven research advancement, na nagpapabilis nang malaki sa pag-unlad ng pananaliksik, at ito ang pinakadirektang sagot sa tanong na “Sino ang magmamaneho ng Agent pagkatapos umalis ang tao sa screen?”

Wakas

Pagkatapos ma-off ang screen, hindi nawala ang proyekto.

Ang Long-Range Intelligence ay nagpapalit ng Token sa inteligensya, at gamit ang inteligensyang ito, patuloy na itinutulak ang isang pananaliksik na proyekto upang maglikha ng tunay na halaga. Ang Argus ay nag-uugnay sa mga modelo na dati'y hiwalay at nagpapasa sa isang patuloy na gumagana na sistema ng pananaliksik, kung saan ang Evidence-Driven ang nagpapaliwanag ng direksyon, at sa pamamagitan ng sariling pag-unlad, iniiwan ang karanasan bilang kakayahan.

Hindi lang ipinapakita ng Argus ang isang mas mahabang nagtatagal na Agent, kundi isang bagong paraan ng pag-organisa ng pananaliksik: Sinusolusyunan ng Harness kung paano gumagawa ang modelo, habang tinutukoy ng Driver kung paano patuloy na umunlad ang sistema—hindi na nakabatay sa oras ng trabaho at libangan ng tao ang bilis ng pananaliksik. Maaaring ibig sabihin nito na dumating na ang panahon ng pagpapabilis ng pananaliksik. Maaaring magsara ang screen, ngunit patuloy pa rin ang pananaliksik.

Ipinakilala ng may-akda

Ang Argus ay pinangunahan ng mga researcher mula sa Microsoft at Shanghai Jiao Tong University, at pinagsama-sama ng mga researcher mula sa iba't ibang unibersidad.

Ang artikulong ito ay galing sa WeChat public account na “Machine Heart”

Disclaimer: Ang information sa page na ito ay maaaring nakuha mula sa mga third party at hindi necessary na nagre-reflect sa mga pananaw o opinyon ng KuCoin. Ibinigay ang content na ito para sa mga pangkalahatang informational purpose lang, nang walang anumang representation o warranty ng anumang uri, at hindi rin ito dapat ipakahulugan bilang financial o investment advice. Hindi mananagot ang KuCoin para sa anumang error o omission, o para sa anumang outcome na magreresulta mula sa paggamit ng information na ito. Maaaring maging risky ang mga investment sa mga digital asset. Pakisuri nang maigi ang mga risk ng isang produkto at ang risk tolerance mo batay sa iyong sariling kalagayang pinansyal. Para sa higit pang information, mag-refer sa aming Terms ng Paggamit at Disclosure ng Risk.