“Yürütülecek”ten “Yönetilecek”e, Uzun Vadeli Agent’in eksikleri neler?
Agent'in hızlı gelişiminde, Harness büyük modelleri gerçek dünyaya ulaştırmış, araçları çağırarak kodu değiştirmeye ve deneyleri çalıştırmaya izin veriyor. Ancak görevler onlarca dakikadan günlere uzadığında, sistem hâlâ birinin ekran önünde uzun süre kalmasını gerektiriyor ve sonraki adımın nereye gideceğini belirliyor.
Bu darboğazın temel nedeni sadece modelin kapasitesinin yetersizliği değil, mevcut Agent’ların çoğunun “yürütme”yi otomatikleştirmesine rağmen, yürütmenin üzerindeki “yönetimi” gerçekten otomatikleştirmemesidir. Harness, modele eylem yeteneği kazandırır; insanlar modele karar verme yeteneği verir. İnsan ayrıldığında proje de durur. Ayrıca yoğun ödül geri bildirimi olmadan, Agent’ların yürütme ve tepki verme süreçleri de yetersiz ve kaba görünür.
Bu sorunu çözmek için Microsoft, Şangay Jiaotong Üniversitesi ve diğer kurumlar, uzun dönemli araştırma görevleri için genel bir Agent çıkarım çalışma zamanı olan Argus'u açık kaynak hale getirdi ve teknik bir rapor yayınladı. Sistem, kanıta dayalı, kendini geliştiren, çoklu Agent işbirliği ve çekirdek ile uzmanlık alanlarının ayrılması gibi tasarımlarla, yoğun standart geri bildirim olmadan Agent'ların birkaç gün boyunca çoklu alanlarda sürekli araştırma yapmasını sağlar.
Rapor, 27 kampanyayı ve 1.548 saatlik gerçek zamanlı süreyi kapsıyor. Ortalama her 40,7 saatte bir insan müdahalesi isteği gerçekleşiyor; raporun çalışma doluluk oranı %95,1 ile %98,7 arasındadır. Bu Argus teslimi, yalnızca yüksek puanlı bir benchmark değil, tam bir üretim seviyesi sonuç kitapçığıdır. Takım, AI4AI, GPU Kernel, model eğitimi, AI4Science, çip tasarımı, AI4math ve AI4System gibi geniş görevlerde sonuçlar sunarak Argus'un genel yeteneğini ve gerçek araştırma seviyesindeki zekâsını göstermiştir.

Şekil 1: Argus çalışma süresi, yetenek performansı ve teslim edilen sonuçların genel bakışı.

- Makale Başlığı: Argus: Günlükler için Kazığı Kim Sürer?
- Makale: https://arxiv.org/abs/2608.05144
- Kod: https://github.com/lbx154/Argus
- Proje Ana Sayfası: https://argusbot.cn/
- Proje sonucu açık kaynak kütüphanesi: https://github.com/Argus-AiTeam
- Proje Matematik Çözümü Canlı Yayın: https://open.argusbot.cn/#counterexample-live
01
Hedefe Odaklıdan Kanıta Odaklıya Geçiş:
Agent'in bir sonraki adımını kim belirler?
Geçen iki yıl içinde Agent mühendisliğinin ana ilerlemesi, Harness üzerine odaklanmıştır: Otonom sürüş FSD'sini bir benzetme olarak kullanırsak, model motor gibi, Harness ise şanzıman gibi; ancak aracın nereye gideceğini gerçekten belirleyen, ekranın önünde oturan insandır. Kısa görevlerde, sıradan bir otomatik park gibi, görev kendisi net bir geri bildirim sağlar; ancak görev birkaç güne uzadığında, araştırma sorunları genellikle kararlı bir ödül sağlamaz ve baştan itibaren net olarak tanımlanmış bir hedefe sahip değildir. Mevcut Agent'lar bu nedenle gerçek bir sınırı ortaya koymaktadır: Zaten yürütme yapabiliyorlar, ancak belirsizlik içinde sürekli olarak karar veremiyorlar.

Şekil 2: Argus, otomatik araştırma uygulayarak insan rolünü sürekli iten sürücü koltuğundan pasajöre dönüştürüyor.
Argus, otomasyon altında olmayan bu konumu "Driver" olarak adlandırıyor. Amacı, plan ile gerçeklik çatıştığında da kanıtlara dayalı olarak yönü korumaktır. Araştırmanın başlangıcında yazılan hedefler, en az bilgiye sahip aşamadaki başlangıç varsayımlarıdır; eğer Agent, yalnızca hedefe odaklı olarak önceden belirlenmiş bir sona doğru koşar ve imkânsız hedefler üzerinde sürekli Token harcarsa, hedef sertleşir. Ancak Kanıta Dayalı yaklaşım, kontrol mantığını tersine çevirir: bir sonraki adım, başlangıçtaki varsayımlara değil, mevcut kanıtlara göre belirlenir. Çalışma sırasında ortaya çıkan tüm sonuçlar, rotayı değiştirecek geçerli kanıtlardır; sistem tamamen kanıta dayalıdır. Örneğin, Driver şu dört soruyu mevcut kanıtlara göre sürekli olarak yanıtlamalıdır:
Bu iş tamamlandı mı ve kalitesi yeterli mi?
2. Mevcut kanıtlar doğrultusunda sonraki en değerli adım nedir?
3. Bu turda kazanılan deneyim, sonraki sistem davranışlarını nasıl değiştirmelidir?
4. Kalan sorular, yalnızca insanların verebileceği kararlarla ilgili mi?
02
Genel bir özelleştirilmiş uzun süreli çalışma zamanı kurun
Argus, uzun vadeli projeleri kalıcı Kampanyalara organize eder ve bunları net sınırlara sahip Misyonlara böler. Temel döngüsü Yönetici → Planlayıcı → Mühendis ⇄ İnceleyici → Yönetici şeklindedir:
OpenAI Codex'in /goal modellerine dayanarak, Argus'un tasarım yönelimi daha net bir şekilde tanımlanabilir. /goal, bir ajanın tek döngüsünü bir hedef durumu içeren kalıcı bir döngüye uzatır; Argus ise araştırmaları çoklu rolleri, çoklu donanımları ve kalıcı bilgiyi içeren uzun süreli çalışma ortamlarına organize eder. İlki "Ajanı nasıl durdurmadan tutarım?" sorusuna cevap verirken, ikincisi "Ajan durmadığında, nasıl etkili çalışır?" sorusuna cevap verir. Bu, çalışma zamanı düzeyinde Goal-Driven'dan Evidence-Driven'a geçişin karşılık gelen yapısal farkıdır.
1. Yönetici, aşama geçişlerini, süreç onaylarını ve genel stratejiyi yönetiyor.
2. Planlayıcı, mevcut kanıtlara göre spesifik görevleri planlıyor;
3. Mühendis, gerçek kod deposuna girin, deneyler yapın ve uygulayın;
4. İnceleyici, bağımsız inceleme ürününü gözden geçirir, yenilikçiliği ve etkinliğini test eder ve Yönetici'ye rapor eder veya Mühendis'e geri gönderir.
Buradaki vurgu, çoklu rollerin kendisi değil, bağlamın ayrıştırılmasıdır — birden fazla rol, bir agent’in sadece yerel bir tırmanıcı haline gelmesini önlemek için birbirleriyle işbirliği yapar; her rol kendi özel bağlamına sahiptir ancak ortak bir çalışma alanı paylaşır, böylece planlama, yürütme ve doğrulama tümüyle bir agent’e bırakılmaz ve token verimliliği artırılır. Bu nedenle, Argus’un bir görevinde aynı anda Pi, Codex, Claude Code etkinleştirilebilir, DeepSeek Kullanımı Farklı harness'ler, yüksek derecede özelleştirme sağlar.
Sistem, tam bir artifact kümesini kaydeder; yalnızca kanıt eşiğini aşan deneyimler, Wiki ve Beceri'ye eklenir ve sonraki görevler için Project, Vertical veya Global kapsamlarında yeniden kullanılır.
Aynı zamanda, Core ve Vertical birbirinden bağımsız kalır: Core, rollerin yetkilerini, kanıt sunumunu ve insan sınırlarını sorumlu tutar; Vertical, alan uzmanları tarafından matematik, GPU, malzeme vb. görevlerde neyin geçerli bir kanıt olduğunu ve ilgili insan becerilerini ve bilgilerini tanımlar; Vertical, araştırma görevlerinin teslim kalitesini açıkça artırır ve aynı zamanda insan uzmanlar ile agentlerin ortak gelişimi ve özelleştirilmiş iş akışları için bir arayüz sağlar.

Şekil 3: Argus'un uzun vadeli çalışma mekanizması. Dört farklı rol, kalıcı durum etrafında dönerken Kampanya sekiz araştırma aşaması arasında ilerletilebilir veya geri alınabilir.
03
1548 saat sonra Argus ne bıraktı?
Uzun vadeli Agent'in başarısını gerçekleştiren, zamanın gerçek araştırma sonuçlarına dönüştürülebilirliğiyledir. Argus'un açık kaynak kodlu hale gelmesinden bir aydan kısa bir sürede, altyapı, malzeme, çip, matematik ve AI sistemleri araştırmalarında üstün katkılar sağlamıştır; aynı zamanda tam端到端 matematik varsayım çözümü filtreleme günlüklerini açıklayan ilk takımdır ve tüm çalışma izleri oturumlarını dahil olmak üzere tüm verileri açık hale getirmiştir. Aşağıda Argus'un açık kaynak kodlu hale gelmesinden sonra elde edilen sonuçların özeti yer almaktadır:

Şekil 4: Argus’un temsili araştırma bulguları, anahtar göstergeleri ve kabul kriterleri
Yukarıdaki tabloya göre, Argus önce AI4System & Infra'da sürekli çalışmayı kabul edilebilir gerçek teslimatlara dönüştürerek, otomatik yürütmeden bağımsız araştırmaya geçişin ilk adımını net mühendislik sonuçlarıyla tamamlar; ardından görevler AI altyapısından AI4Science, AI4Hardware, AI4Math alanlarına genişler ve değerlendirme kriterleri "belirlenen görevler tamamlandı mı?" yerine "çözümsüz gerçek araştırma sorularını keşfedebilir mi?" haline gelir; bu sayede otomatik araştırma, otomatik teslimattan otomatik keşife ilerler; bu temel üzerinde, Argus AI4AI yönünde tekil başarıları tam bir araştırma sürecine genişleterek, kanıtlarla sürekli görev ilerlemesini sağlar ve insanlar her zaman ekranın önünde kalmadan çalışır; böylece gerçek teslimat, çoklu alan keşfi ve tam süreçte bağımsız araştırmaya kadar uzanan bir ilerleme yolu oluşur.

Şekil 5: Argus’un tüm süreç boyunca makale üretimi sırasında sunduğu sonuçlar.
Bu sonuçlar tümü 1 ay içinde elde edildi; bu başarıları bir araya getirdiğimizde, Argus, adım adım derinleşen bir değer zinciridir: otomasyonun nesnesi, tek bir yürütmeden kanıta dayalı araştırma ilerlemesine genişlemiştir ve bu da araştırma ilerlemesini büyük ölçüde hızlandırmıştır; bu, “İnsan ekranı terk ettikten sonra, kim Agent’i sürer?” sorusunun en doğrudan cevabıdır.
Sonuç
Ekran kapatıldıktan sonra proje sıfıra düşmedi.
Uzun vadeli akıl, Token'u akıla dönüştürür ve bu akıl sayesinde bir araştırma projesi sürekli ilerletilir, gerçek değer yaratılır. Argus, önce birbirinden ayrılmış model çağrılarını sürekli çalışan bir araştırma sistemi haline getirir, kanıta dayalı kontrol yönü belirler ve kendini geliştirmek suretiyle deneyimi beceriye dönüştürür.
Argus, yalnızca daha uzun süre çalışan bir Agent değil, yeni bir araştırma organizasyon biçimi sunuyor: Harness modelin nasıl davranacağını çözüyor, Driver sistemin nasıl sürekli ilerleyeceğini belirliyor ve araştırma hızı artık insanların çalışma ve eğlence zamanlarına bağlı değil. Bu, araştırmaların hızlanma çağının başlaması anlamına gelebilir. Ekran kapanabilir, araştırma ise devam eder.
Yazar tanıtımı
Argus, Microsoft ve Şangay Jiaotong Üniversitesi araştırmacıları tarafından öncülük ediliyor ve birçok üniversitenin araştırmacıları tarafından destekleniyor.
Bu yazı WeChat hesabından "Machine Heart" gelmiştir.
