Dari “akan melaksanakan” ke “akan memimpin”, apa yang masih kurang pada Agent jangka panjang?
Pada masa ini, di mana Agent berkembang pesat, Harness telah membolehkan model besar menyentuh dunia nyata, mampu memanggil alat, mengubah kod, dan menjalankan eksperimen. Namun, apabila tugas diperpanjang dari beberapa minit kepada beberapa hari, sistem masih memerlukan seseorang untuk sentiasa berada di hadapan skrin untuk menentukan langkah seterusnya.
Faktor utama yang menyebabkan bottlenecks ini bukan hanya kekurangan kemampuan model, tetapi juga fakta bahawa Agent semasa ini sebahagian besar telah mengautomatiskan «pelaksanaan», tetapi tidak benar-benar mengautomatiskan «pemanduan» di atas pelaksanaan. Harness memberikan model kemampuan bertindak, manakala manusia memberikan model keputusan. Apabila manusia meninggalkan, projek juga berhenti. Selain itu, tanpa umpan balik ganjaran yang padat, pelaksanaan dan tindak balas Agent juga akan kelihatan perlahan dan kikuk.
Untuk menyelesaikan masalah ini, Microsoft, Shanghai Jiao Tong University, dan institusi lainnya telah melepaskan Argus secara sumber terbuka—sebuah runtime inferensia agen generik untuk tugas penyelidikan jangka panjang—bersama dengan laporan teknikal. Sistem ini membolehkan agen untuk meluaskan penyelidikan berterusan selama beberapa hari ke pelbagai bidang tanpa umpan balik standard yang padat, melalui reka bentuk yang mendorong bukti, berevolusi sendiri, kerjasama pelbagai agen, serta pemisahan antara inti dan domain khusus.
Laporan ini mencakup 27 kampanye dan 1,548 jam masa sebenar. Purata satu permintaan intervensi manusia setiap 40.7 jam; isi kerja laporan memiliki penggunaan 95.1% hingga 98.7%. Penghantaran Argus ini bukan sahaja mencapai benchmark berpoin tinggi, tetapi juga menghasilkan satu set hasil peringkat pengeluaran yang lengkap. Pasukan telah memberikan pencapaian dalam tugas-tugas luas seperti AI4AI, GPU Kernel, latihan model, AI4Science, reka bentuk cip, AI4math, dan AI4System, yang menunjukkan keupayaan generik dan kecerdasan peringkat penyelidikan sebenar Argus.

Rajah 1: Ikhtisar keseluruhan masa jalan Argus, asas kemampuan, dan hasil penghantaran.

- Tajuk kertas: Argus: Siapakah yang Mendorong Harness selama Berhari-hari?
- Kertas kerja: https://arxiv.org/abs/2608.05144
- Kod: https://github.com/lbx154/Argus
- Laman utama projek: https://argusbot.cn/
- Perpustakaan sumber terbuka hasil projek: https://github.com/Argus-AiTeam
- Langsung penyelesaian matematik projek: https://open.argusbot.cn/#counterexample-live
01
Beralih daripada Goal-Driven kepada Evidence-Driven:
Siapa yang menentukan langkah seterusnya untuk Agent?
Dalam dua tahun terakhir, kemajuan utama dalam rekabentuk Agen berpusat pada Harness: dengan mengambil perbandingan FSD dari pemanduan autonomi, model berfungsi seperti enjin, sementara Harness berfungsi seperti sistem pemindah kuasa, tetapi orang yang duduk di hadapan skrin tetap menentukan arah perjalanan kenderaan. Dalam tugas jangka pendek, seperti parkir automatik biasa, tugas itu sendiri masih memberikan maklum balas yang jelas; tetapi apabila tugas diperpanjang sehingga berhari-hari, masalah penyelidikan sering kali tidak mempunyai ganjaran yang stabil atau matlamat yang ditakrifkan dengan jelas sejak awal. Oleh itu, batasan sebenar Agen semasa ini terdedah: mereka sudah mampu melaksanakan tugas, tetapi masih belum mampu membuat penilaian berterusan dalam ketidakpastian.

Rajah 2: Argus mengubah peranan manusia daripada tempat pemandu yang terus-menerus mendorong kepada tempat penumpang, melalui penyelidikan autonomi yang dicapai melalui auto-research.
Argus memanggil posisi sebelumnya yang tidak diotomatiskan di atas Harness sebagai "Driver". Fungsinya adalah untuk terus mengendalikan arah berdasarkan bukti, walaupun terdapat konflik antara rancangan dan kenyataan. Tujuan yang ditulis pada permulaan penyelidikan hanyalah hipotesis awal pada tahap dengan informasi paling minimum; jika Agent hanya mampu mengejar tujuan akhir yang telah ditetapkan secara sepihak, bahkan terus-menerus membuang Token pada tujuan yang tidak mungkin dicapai, ia akan mengalami kekakuan tujuan. Sebaliknya, pendekatan Evidence-Driven membalikkan logika pengendalian: langkah seterusnya ditentukan oleh bukti yang telah ada, bukan oleh anggapan awal rancangan. Semua hasil yang dihasilkan semasa operasi adalah bukti yang sah yang boleh mengubah arah; sistem ini sebenarnya digerakkan oleh bukti. Secara khusus, Driver perlu menjawab empat soalan berikut secara berulang berdasarkan bukti semasa:
Adakah pekerjaan ini telah selesai dan kualitinya mencukupi?
2. Berdasarkan bukti semasa, apa yang paling patut dilakukan seterusnya?
3. Pengalaman yang diperoleh dalam putaran ini, bagaimana seharusnya ia mengubah perilaku sistem seterusnya?
4. Adakah isu yang tinggal melibatkan keputusan yang hanya boleh dibuat oleh manusia?
02
Membina satu persekitaran masa berjalan yang disesuaikan secara am
Argus mengorganisasi projek jangka panjang sebagai Campaign yang berterusan, kemudian memecahkannya menjadi serangkaian Mission dengan sempadan yang jelas. Lingkaran asasnya ialah Manager → Planner → Engineer ⇄ Reviewer → Manager:
Dengan merujuk kepada mod /goal OpenAI Codex, arah rekaan Argus boleh dikenal pasti dengan lebih jelas. /goal memanjangkan satu putaran tunggal agen menjadi putaran berterusan yang membawa keadaan matlamat; Argus pula mengorganisasikan projek penyelidikan sebagai masa berjalan jangka panjang dengan pelbagai peranan, pelbagai harness, dan pengetahuan yang boleh disimpan. Yang pertama menjawab “bagaimana membuat agen tidak berhenti”, manakala yang kedua menjawab “setelah agen tidak berhenti, bagaimana ia bekerja secara berkesan”. Ini merupakan perbezaan struktur di peringkat masa berjalan antara pendekatan Berpusat pada Matlamat dan Berpusat pada Bukti.
1. Pengurus menguasai peralihan peringkat, persetujuan proses, dan strategi global;
2. Perancang merancang tugas spesifik berdasarkan bukti semasa;
3. Jurutera masuk ke repositori kod sebenar, eksperimen, jalankan;
4. Peninjau mengkaji artefak secara bebas, menguji keinovatifan dan keberkesanannya, serta melaporkan kepada Pengurus atau mengembalikan kepada Jurutera.
Fokus di sini bukan pada pelbagai peranan itu sendiri, tetapi pada pemisahan konteks — pelbagai peranan bekerjasama untuk mengelakkan agen daripada menjadi alat pendaki tempatan yang mudah, di mana setiap peranan mempunyai konteks tersendiri tetapi berkongsi ruang kerja, supaya perancangan, pelaksanaan, dan pengesahan tidak diserahkan sepenuhnya kepada satu agen, yang boleh meningkatkan kecekapan token. Oleh sebab itu, dalam satu tugas Argus, anda boleh menghidupkan Pi, Codex, Claude Code secara serentak, DeepSeek Harness Pelbagai harness yang berbeza, memastikan penyesuaian yang tinggi.
Sistem menyimpan satu set artefak lengkap; hanya pengalaman yang melepasi ambang bukti yang akan masuk ke Wiki dan Skill, dan boleh digunakan semula untuk tugas seterusnya dalam lingkungan Project, Vertical, atau Global.
Sementara itu, Core dan Vertical tetap dipisahkan: Core bertanggung jawab atas keizinan peranan, penghantaran bukti, dan sempadan manusia, manakala Vertical ditakrifkan oleh pakar bidang mengenai apa yang dianggap bukti yang sah serta kemahiran dan pengetahuan manusia yang berkaitan dalam tugas-tugas matematik, GPU, bahan, dan sebagainya; Vertical boleh meningkatkan kualiti penghantaran tugas penyelidikan dengan jelas, serta menyediakan antaramuka untuk perkembangan bersama pakar manusia dan agen, serta penyesuaian alur kerja.

Rajah 3: Mekanisme jangka panjang Argus. Empat peranan berputar mengelilingi keadaan kekal, dan Kampanye boleh dipromosikan atau dikembalikan antara lapan peringkat penyelidikan.
03
1548 jam selepas itu, apa yang ditinggalkan oleh Argus?
Yang menentukan sama ada Agen Jangka Panjang berjaya ialah sama ada masa boleh ditukar kepada pencapaian penyelidikan yang nyata. Kurang daripada sebulan selepas Argus dibuka sumber, ia telah memberikan sumbangan luar biasa dalam infrastruktur, bahan, cip, matematik dan penyelidikan sistem AI, serta kami merupakan pasukan pertama yang mengumumkan log penyaringan penyelesaian konjektur matematik end-to-end yang lengkap, dengan membuka semua sesi jejak operasi. Berikut adalah ringkasan pencapaian Argus selepas dibuka sumber:

Rajah 4: Penemuan utama Argus, indikator utama, dan kriteria penerimaan
Seperti yang ditunjukkan dalam jadual di atas, Argus pertama-tama mengubah operasi berterusan menjadi penghantaran nyata yang boleh diterima dalam AI4System & Infra, menyelesaikan langkah pertama dari pelaksanaan automatik kepada penyelidikan autonomi melalui hasil kejuruteraan yang jelas; selepas itu, tugas merebak dari infrastruktur AI ke AI4Science, AI4Hardware, dan AI4Math, dengan kriteria penilaian berubah dari “adakah tugas yang ditetapkan telah selesai” kepada “mampukah ia mengkaji masalah penyelidikan nyata yang belum terpecahkan”, sehingga penyelidikan automatik dipertingkatkan daripada penghantaran automatik kepada eksplorasi automatik; berdasarkan ini, Argus kemudian memperluaskan hasil titik tunggal kepada aliran penyelidikan penuh dalam arah AI4AI, dengan bukti terus mendorong kemajuan tugas tanpa memerlukan manusia sentiasa berada di hadapan skrin, membentuk satu lintasan berperingkat dari penghantaran nyata, eksplorasi lintas bidang, hingga penyelidikan autonomi penuh.

Rajah 5: Hasil penghantaran Argus dalam proses penuh penghasilan kertas kerja.
Semua hasil di atas dicapai dalam tempoh 1 bulan; dengan menggabungkan pencapaian ini, Argus membentuk satu rantai nilai yang semakin mendalam: objek automatik diperluaskan daripada pelaksanaan sekali sahaja kepada penyelidikan yang didorong bukti, mempercepatkan kemajuan penyelidikan secara besar-besaran, dan ini merupakan jawapan paling langsung kepada soalan “Setelah manusia meninggalkan skrin, siapa yang memandu Agent?”
Penutup
Selepas skrin dimatikan, projek tidak menjadi sifar
Kecerdasan jangka panjang ialah proses menukar Token menjadi kecerdasan, kemudian menggunakan kecerdasan tersebut untuk meneruskan projek penyelidikan secara berterusan dan menghasilkan nilai sebenar. Argus mengorganisasi panggilan model yang sebelumnya terpisah menjadi satu sistem penyelidikan yang beroperasi secara berterusan, membolehkan pengawalan berdasarkan Bukti, serta mengubah pengalaman menjadi kemampuan melalui evolusi diri.
Argus bukan sekadar agen yang beroperasi lebih lama, tetapi cara baharu untuk mengorganisasi penyelidikan: Harness menyelesaikan bagaimana model bertindak, Driver menentukan bagaimana sistem terus bergerak, dan kelajuan penyelidikan tidak lagi dibatasi oleh masa kerja dan rehat manusia. Ini mungkin bermakna era percepatan penyelidikan sedang datang. Skrin boleh dimatikan, tetapi penyelidikan masih berterusan.
Perkenalan penulis
Argus dipimpin oleh para penyelidik dari Microsoft dan Universiti Jiaotong Shanghai, dengan penyertaan penyelidik dari pelbagai universiti.
Artikel ini berasal daripada akaun微信公众号 "Mesin Jiwa"
