Meta AI ve Illinois Üniversitesi Urbana-Champaign'den araştırmacılar, büyük dil modellerinin kendi dış durumlarını oluşturmasına, erişmesine ve yönetmesine izin veren eğitilebilir bir koordinasyon katmanı olan EvoHarness-RL'yi tanıtan yeni bir makale yayımladı. Sonuç: temel modelin bunu kullanmadan çalıştırıldığı duruma göre %47,9'dan %96,9'a yükselen bir başarı oranı.
EvoHarness-RL'nin aslında ne yaptığını
LLM ajanların sınırlı bağlam pencereleri vardır. Bir görev birçok adımı kapsadığında, dinamik API bağlantıları, sunucu günlükleri, bekleyen alt hedefler ve hata kurtarma dahil olmak üzere, modelin dahili belleği yeterli değildir. Dünya hakkında ne inandığını, ne kadar ilerleme kaydettiğini ve geçmiş hatalardan ne öğrendiğini takip etmek için dış bir iskelete ihtiyaç duyar.
Çerçeve, İnanç, İlerleme ve Deneyim olmak üzere üç bileşene dayalı yapılandırılmış bir dış durum tanıtır; bunlara birlikte BPE denir. İnanç, aracının çevresi hakkındaki mevcut anlayışını yansıtır. İlerleme, aracın adımları atlamaması veya işi tekrarlamaması için tamamlanan ve bekleyen alt hedefleri takip eder. Deneyim, API hız sınırları nedeniyle bir toplu işlemin reddedilmesi gibi hatalardan öğrenilen dersleri bir veritabanı gibi saklar, böylece araç yaklaşımını uyarlayabilir.
Eğitim iki aşamada gerçekleşir. İlk aşamada, uzman gösterimlerini kullanan denetimli ince ayar, modelin donanım ile nasıl etkileşime gireceğini öğretir. Daha sonra, görev performansını donanım çağrılarının hesaplama maliyetiyle dengeler için Grup Göreceli Politika Optimizasyonu (GRPO) adlı bir maliyet-bilinçli optimizasyon tekniği kullanılır.
Araştırmacılar, temellendirilmiş yapay zeka için bir ölçüt olan ALFWorld üzerinde Qwen3-8B modelini kullanarak yaklaşımını test ettiler. Bu ölçüt, ajanların çok adımlı ev görevlerini tamamlamasını gerektirir. Olgun ortamlarda %96,9 başarı oranı zaten etkileyici olsa da, görülmemiş ortamlarda %86,6 başarı oranı belki de daha anlamlıdır.
Araştırmacıların açıkça programlamadığı iki davranış
Kağıt, eğitim sırasında ortaya çıkan ve doğrudan mühendislik yoluyla oluşturulmayan iki ortaya çıkan fenomeni vurgulamaktadır.
İlki “kemer ısıl işlemidir.” Zamanla, ajan rutin kemer işlemlerini içselleştirmeye başlar ve dış duruma başvurma sıklığını azaltır. Kemer çağrıları, sistemin bozulmasından değil, modelin kalıpları içselleştirmesinden dolayı azalır.
İkincisi “evrimi güçlendirmek.” Ajan eğlendirildikçe, dış durumunu belirli görev türleri için daha kompakt bir formata sıkıştırır ve yeniden yapılandırır. BPE temsili, tasarımında herhangi bir insan müdahalesi olmadan daha hafif ve daha özelleşir.
Daha önceki çalışmalara dayanarak
EvoHarness-RL, Mart 2026'da ortaya çıkan ve agensel arama teknikleriyle kılıf kodunu optimize etmeye odaklanan Meta-Harness projesinin üzerine inşa edilmiştir. Meta-Harness, kılıfı arama yoluyla geliştirilecek bir kod olarak ele alırken, EvoHarness-RL tam koordinasyon katmanını modelin kendisinin oluşturup geliştirebileceği bir şey olarak ele alır.
Kağıt, özellikle görülmemiş görevlerde SkillOS ve SkillRL gibi mevcut ajan çerçevelerine kıyasla iyileştirmeleri de rapor ediyor. EvoHarness-RL için tanıdık ve yeni ortamlar arasındaki performans farkı yaklaşık 10 puan, rekabetçi yaklaşımlarda ise çok daha büyük düşüşler gözleniyor.
Kurumsal AI dağıtımı için bunun ne anlama geldiğini
Kontrollü ortamlarda başarı oranı yaklaşık %48’den %97’ye yükseldiğinde bu, küçük bir iyileşme değildir. %86,6 genelleme oranı da önemlidir, çünkü gerçek dünya kurumsal görevler nadiren eğitim verileriyle tam olarak aynı görünür.
GRPO eğitimi aşamasına entegre edilen maliyet farkındalıklı optimizasyon, pratik bir endişeyi de giderir. Dışı harnes çağrıları ücretsiz değildir. Bu çağrılar hesaplama kaynakları tüketir ve gecikme ekler. Araç, harnes soğutma yoluyla gereksiz çağrıları minimize etmeye eğitildiğinde, çerçeve doğruluğu kaybetmeden zamanla daha verimli hale gelir.
