Wang Yunhe, girişimini başlattıktan sonra ilk kez büyük model sonucunu sundu.
Quantum Bit'e göre, Huawei Noah's Ark Laboratuvarı'nın eski müdürü, Pangu Büyük Modeli Yönetici Wang Yunhe tarafından kurulan Ji Yuan Lüdong, ilk Agent-Native modeli NeoHorse'u duyuruyor.
Bu model, Wuwen Xinqiong tarafından temel altyapı desteği ve Infra optimizasyon teknolojisi sağlanarak, Tsinghua Üniversitesi ve Pekin Üniversitesi takımları tarafından algoritma ve eğitim yöntemleri araştırılmıştır; Agent sonrası eğitimde veri kullanım verimliliği ve eğitim etkinliğinin artırılması ortak olarak araştırılmaktadır.
NeoHorse-1, Araç çağırma, ortam geri bildirimini okuma, hataları tespit etme, rotayı ayarlama ve nihayetinde görevi tamamlama gibi, Agent iş süreçlerinde gerekli olan bir dizi yeteneğe odaklanan 4B ve 9B olmak üzere iki sürüm içerir.

Harness Agent, araç kullanımı, kod ve talimat uyumu gibi 10 değerlendirme alanında, Agentic Post-Training sonrası 4B modelinin genel performansı, 9B temel modele ulaşmış veya hafifçe aşmıştır.

Sürekli çoklu model iş birliğini vurgulayan bir şirket, neden şimdi kendi modelini eğitmeye başlıyor? Primal Rhythm temel model masasına katılacak mı?
NeoHorse'un verdiği cevaba göre, yön böyle bir değişiklik göstermedi.
Bu model, temel ritmin geçmişte birikmiş çoklu model yürütme deneyimlerine daha çok benziyor ve ilk kez model parametrelerine girdi.
Agent için model seçen şirket, modeli eğitmeye de başladı.
Sürekli olarak, puanlar model karşılaştırmalarının ana ölçütü olmuştur.
Ancak model, Agent sistemine entegre edilip tam görevler üstlendikten sonra, tek bir puanın açıklama gücü azalır.
Bir görevde, model sadece görünüşte mantıklı bir cevap vermekle kalmaz, aynı zamanda işlem sırasında ortam geri bildirimlerini sürekli okumalı, hataları işlemeli ve gerçek ilerlemeye göre sonraki yolları ayarlamalıdır; farklı aşamalar modelin yetenekleri açısından farklı gereksinimler sunar.
Bu şekilde, Element Rhythm ekibi bir yargıya vardı.
Model normalization olmaması, AI endüstrisinde uzun süre var olacak bir yapıdır.
Daha fazla model ve daha ayrıntılı iş bölümü, fiyat ve yetenek farklarını daha belirgin hale getirir ve bu durumda bir dizi soruya sistematik olarak cevap vermek gerekir—
Bu adımda hangi model kullanılmalı? Hangi aşamalar daha düşük maliyetli modele bırakılabilir? Hangi durumlarda daha güçlü çıkarım ve yürütme yeteneklerine sahip bir modele geçilmelidir? Bir yürütme yolu tıkanırsa, kim devralmalı? Birden fazla model aynı anda çözüm sunup sonuçları birleştirebilir mi?
Wang Yunhe ekibi bu katman sistemini Routing Harness olarak adlandırıyor (altındaki ilgili açık kaynak projesi OpenSquilla, birden fazla modeli birleşik bir arayüz üzerinden entegre ederek, Agent çalışması sırasında ince düzeyde rota atama, model değiştirme ve çoklu model iş birliği sağlıyor).

Aynı düşünceyle, Elemental Rhythm'in kendi modelini eğitmesinin güçlü bir nedeni görünmüyor. Piyasada yeterince zengin model tedariki mevcut; ihtiyaç doğrultusunda çağırma daha esnek görünüyor.
Zamanlama sistemi sürekli çalışırken, "hangi görev hangi yeteneği gerektirir", "model hangi aşamada başarısız olur", "hangi onarım yolları etkilidir", "hangi sonuçlar ortam doğrulamasını geçer" gibi başka bir sınıf varlık birikmeye başlamıştır.
Bu bilgiler, bir yandan rota kararını artırırken, diğer yandan eğitim değeri de kazanmaya başlıyor.
Bu, birçok markayı tüketicilerle bağlayan bir platform gibi. İşlem sırasında biriken talep, değerlendirme ve kullanım geri bildirimleri, ürünün daha uygun kullanıcılarına ulaşmasına yardımcı olabilir ve ürün geliştirme sürecine daha fazla geri bildirim sağlayabilir.
Platform hizmet pazarı süreci, bir sonraki ürün geliştirme döngüsünün veri kaynağı haline gelmektedir.
NeoHorse, Harness'te birikmiş bazı yürütme deneyimlerini model becerilerine dönüştürür.
Çoklu modelin attığı yolu, Agent-Native modeline kazıtın
NeoHorse'un veri kaynağı dikkat edilmesi gereken bir noktadır.
Temel veri seti, Routing Harness tarafından oluşturulan Agent yürütme sinyallerini açık verilerle birleştirerek Agent sonrası eğitim için bir veri sistemi kurmaktır.
Bir Agent, Harness içinde bir görevi tamamladığında, tam bir yürütme kaydı bırakır.
- Görevi girin → Röle, hangi yeteneğe ihtiyaç duyduğunu belirler
- → Bir model seçin
- Model, çıkarım yapar ve araç çağırır
- → Çevre sonuç döndürüyor
- Model çalışmaya devam ediyor veya hata oluştu
- Sistem modelini değiştiriyor veya yolu ayarlıyor
- Görev sona erdi veya başarısız oldu
Sıkça sorulan sorular verileri genellikle “soru” ve “cevap” uçlarında yoğunlaşır.
Routing Harness verileri, görevin hangi yeteneklere ihtiyaç duyduğunu, sistemin hangi yürütme kararlarını aldığını ve ortamın nihayetinde hangi geri bildirimi verdiğini de içerir.
Örneğin, yönlendirici ilk olarak bir görevin yalnızca standart model gerektirdiğini belirler, ancak yürütme sırasında ardışık başarısızlıklar yaşanır ve görev tamamlanana kadar daha güçlü bir modele yükseltilir.
Bu iz, bir başarısızlıktan çok daha fazla bilgi içeriyor.
Sistem, ilk yetenek değerlendirmesinin düşük olabileceğini, modelin hangi adımda sorun yaşadığını, daha güçlü modelin hangi stratejiyi kullandığını, hangi yürütme yolunun ortam doğrulamasını geçtiğini ve görevi tamamlamak için ek olarak ne kadar Token ve zaman harcandığını bilebilir.

Daha önemli olan, temel ritmin gözlemlediği şeyin bir modelin kendi yetenekleri hakkında bir değerlendirme değil, benzer görevler karşısında birçok modelin yanıt gösterdiği yatay performanstır.
Başarılı yolların yanı sıra, arada başarısızlıkla sonuçlanan ve ardından diğer modeller tarafından devralınan yürütme kayıtları da vardır.
Eğitim açısından, başarısız yollar hatta daha fazla bilgi sağlayabilir.
Son cevap, modele bir uygun yol gösterir; başarısızlık ve düzeltme süreçleri ise nerede hatalar yapılabileceği ve hatalar sonrası nasıl ayarlanacağı konusunda iki ek bilgi türü sağlar.
Birden fazla modelin görev ortamında gerçekleştirdiği yollar da dahil olmak üzere, birden fazla modelin verdiği sonuçları öğrenmek, NeoHorse’un ayırt edici bir özelliğidir.
Agent çalışma günlüğü nasıl model yeteneğine dönüşür?
Tüm günlük verileri eğitime yatırmak, doğal olarak daha güçlü bir Agent modeli elde etmeyi garanti etmez.
Agent izleri genellikle uzundur ve bunlara sistem uyarıları, kullanıcı istekleri, araç parametreleri, yürütme sonuçları, tekrarlı denemeler, hata bilgileri ve çok sayıda ara çıktı karışık şekilde yer alır.
Bazı adımlar eğitim değeri taşırken, bazıları daha çok gürültüye yakındır. Bazı yörüngeler tamamen tamamlanmış olsa da, sonuçlar doğru değildir.
Temel döngü, önce "hangi verilerin modelin öğrenmesi değerli" sorusunu çözmek zorundadır.
Teknik rapora göre, her yolculuk, istek, model yanıtı, araç çağrısı ve çevre sonucu arasındaki uyum için yapısal denetimden geçer.
Daha sonra sistem, kullanıcı hedefinin tamamlanıp tamamlanmadığı, talimatlara uyulup uyulmadığı, araç kullanımının uygunluğu, sonuçların kanıtla desteklenip desteklenmediği, hata oluştuğunda iyileştirilebilirlik ve modelin görevi uygun zamanda sonlandırıp sonlandırmadığı olmak üzere altı boyutta yürütme kalitesini değerlendirir.
Burada ayrıca Agent eğitimiyle karıştırılması kolay sorunlar da yer alıyor.
Görevin bitmesi, kullanıcının hedefinin karşılandığı anlamına gelmez—modelin “görev tamamlandı” çıktısı, yürütme sürecinin durduğunu gösterir, ancak teslim edilen ürünün kullanıcı gereksinimlerini karşıladığını kanıtlayamaz.
Bu nedenle, tamamlanma durumu, hedef doyumu, çevre kanıtları ve kullanıcı geri bildirimleri, farklı sinyaller olarak ayrı ayrı kaydedilmelidir.
Veriler filtrelendikten sonra, rota sinyalleri başka bir işlevi yerine getirmeye başlar.
Röle, görev için gerekli kapasiteyi tahmin eder ve farklı kapasite seviyelerine göre sinyaller oluşturur. NeoHorse, eğitim sürecinde bu sinyallere göre örnekleri sıralar; önce daha düşük kapasite gerektiren görevleri öğrenir, ardından daha karmaşık yürütme yollarına geçerken temel görevlerin kapsanmasını korur.
Bu yöntem, Routing-Guided Curriculum, yani rota yönlü müfredat olarak adlandırılır.
Daha anlaşılır bir şekilde ifade edersek, rota sinyali, çevrimiçi olarak hangi görevin kim tarafından yürütüleceğini belirler ve eğitim aşamasında modeli, hangi görevlerin önce, hangilerinin sonra öğrenilmesi daha uygun olduğunu yönlendirebilir.

Klasik denetimli ince ayarın yanı sıra NeoHorse, On-Policy Distillation de kullanmaktadır.
Öğrencinin kendi yöntemini kullanarak soruyu çözmeye başlaması, ardından öğretmenin öğrencinin gerçek adıma ulaştığı noktaya göre rehberlik etmesi olarak anlaşılabilir.
Bu şekilde, öğretmen modeli, öğrenci modelinin mevcut dağılımı altında karşılaşacağı sorunları işliyor, önceden hazırlanmış bir standart hata setini değil.

Bu aşamalar sonucunda, çoklu modelin uzun vadeli görevlerde birikmiş deneyimleri, NeoHorse'un sonraki eğitimi için kullanılmaya başlanmıştır.
Son eğitimden sonra ne artar?
Mevcut teknik raporda verilen sonuçlara göre, Agentic Post-Training, 4B ve 9B ölçeklerinde sabit bir artış sağlıyor.
Bu arada, NeoHorse-1-4B'nin genel performansı (makro ortalama puanı 58,94'ten 64,87'ye yükseldi), aynı boyutta SOTA'ya ulaşmıştır — karşılaştırılabilir tüm benchmark'larda temel modeli Qwen3.5-4B'yi aştı ve 4B boyutundaki diğer modeller arasında genel olarak önde.

Ancak SOTA, yeteneklerin eşit şekilde dağıldığı anlamına gelmez.
Daha ayrıntılı sonuçlara bakıldığında, 4B modelindeki iyileşmelerin büyük ölçüde bir tür görevde yoğunlaştığı görülmektedir.
Bu tür görevler genellikle nispeten net bir iş akışına sahiptir, ortam geri bildirimi gözlemlenebilir, başarı ve başarısızlık doğrulanabilir ve nihai teslim standartları da oldukça belirgindir.
Örneğin, bir proje zamanlaması görevinde, temel model çalışma dizinindeki dosyaları buldu ancak en yeni bağımlılık kısıtlamalarını içeren bir e-postayı okumaya devam etmedi.
Sonuç olarak, süresi dolmuş bilgilere dayalı bir plan oluşturdu ve dosyayı yanlış konuma yazdı.
Son eğitimden sonra model, yeni kanıtları okumaya devam eder, kısıtlamaların değiştiğini tespit eder, planlamayı yeniden hesaplar, sonuçları doğrular ve teslimatları doğru konuma kaydeder.
Fark, Agent yürütme zincirinde ortaya çıkar.
Bir model, görevin nasıl yapılacağını yaklaşık olarak biliyor, diğer model ise kanıt elde etme, kısıtlamaları güncelleme, yürütme, doğrulama ve teslim etme adımlarını daha tam bir iş akışı haline getirmiştir.
Aynı ölçekteki SOTA'ya ulaşmak, NeoHorse-1-4B'nin tüm görevleri üstlenmesi gerektiği anlamına gelmez. Primitif ritim, farklı modellerin yetenek sınırlarını nasıl ince bir şekilde ayırt edeceğine daha çok odaklanır.
4B ile kararlı bir şekilde tamamlanabilecek görevler, daha büyük ölçekli modellerin çağrılmasını azaltır; daha güçlü modellerle tamamlanabilecek görevler ise sürekli olarak en pahalı üst düzey modele yükseltmeye gerek yoktur; zorluk arttıkça, daha güçlü modellerden oluşan havuza devredilir.
Burada tam olarak Routing Harness ile kendi geliştirdiğimiz model arasındaki ilişki sağlanmaktadır.
Model, üstlenebilecek görevlerin maliyet aralığını sürekli genişletir; rota sistemi ise görevin zorluğuna ve yürütme durumuna göre farklı yetenekleri uygun yerlere yerleştirir.

API çağrı ücretlerinin dışında bu modelin başka hangi değerleri var?
Buraya kadar, temel ritmin çeşitli ürün hatları arasındaki ilişki giderek netleşmeye başladı.
Birinci kat, OpenSquilla açık kaynak sürümüdür.
Primal Vibe, ücretsiz, açık kaynak, yerel dağıtım ve masaüstü ürünlerle geliştiricilerin çoklu model Agent kullanımını kolaylaştırır ve geliştiricileri görev giriş noktalarına bağlar.
İkinci kat TokenRhythm API'dir.
Çin'in OpenRouter versiyonu olarak konumlanan bu platform, farklı modellerin çağrılma yeteneklerini tek bir arayüz üzerinden sunarak geliştiricilerin ve şirketlerin model kullanım ihtiyaçlarını karşılar ve model üreticilerinin daha fazla uygulama senaryosuna bağlanmasını sağlar.
Şirketler, birçok model arayüzünü ayrı ayrı uyumlaştırmadan daha kolay bir şekilde modelleri değerlendirebilir, seçebilir ve değiştirebilir.
Üçüncü katman, kurumsal hizmetler ve dağıtım yeteneklerine yöneliktir.
Finans, imalat ve diğer sektörler, erişim hakları, istikrar, özel dağıtım ve hizmet güvencesi açısından farklı ihtiyaçlara sahiptir ve bu da daha fazla ticari alan oluşturur.
Dördüncü kat NeoHorse'tur.
NeoHorse, ilk olarak bir kritik bağlantı doğruladı: Harness yürütme süreci sırasında oluşturulan geçerli deneyimler, filtrelenip eğitildikten sonra gerçekten modelin kendi yeteneklerine dönüştürülebilir.
Bu sayede, Element Pulse daha önce öne sürdüğü ticari tekerlek ilk kez model düzeyinde bir sonuç ortaya koydu.
Bu, muhasebe ekonomisini optimize etme olanağı da getiriyor.
NeoHorse, daha sonra yüksek frekanslı ve nispeten net standartlara sahip bir dizi Agent görevini kararlı bir şekilde üstlenirse, platformun kendi kendine yönlendirebileceği bir kapasite kaynağı daha kazanmış olur.
Bu görevler, çıkarım maliyetini, yanıt hızını ve kararlılığı daha da optimize edebilir ve model sağlama yapılandırmasını daha esnek hale getirebilir. Model devam eden yinelemelerle birlikte kapsayabileceği görevlerin yelpazesini daha da genişletebilir.
Bu açıdan bakıldığında, Element Pulse'in yapmaya çalıştığı şey, üretim sistemlerindeki süreç birikimine benziyor.
Dış model ekosistemi farklı yetenekler sağlar, Harness organizasyonu ve yürütmesini sağlar; yürütme sürecinde kazanılan deneyimler, bir sonraki model iyileştirme döngüsüne dahil edilir.
Bağlantı modeli oluşturmak, hizmet sunmak ve bu hizmetlerden elde edilen deneyimleri model yeteneklerine dönüştürerek verimliliği ve kaliteyi daha da iyileştirmek, temel ritim, API toplama platformunun dışında attığı bir adım daha.
Modelin dışında, elementer ritim ne inşa ediyor?
Temel Ritim'in öngördüğü döngü, birkaç iş hattıyla birleştirilebilir:
- Routing Harness, geliştiricileri Agent görevleriyle birleştiriyor
- → TokenRhythm API bağlantısı, arz ve talep isteklerini sağlar
- → Harness organizasyonu tarafından yürütülüyor, rota ve görev izleri birikti
- Model eğitimi için filtrelenmiş izler kullanılmaktadır
- → Güncellenmiş model, Harness döndürüyor, uyum görevine katılın
- Görev deneyimini iyileştirin, daha iyi yanıt hızı ve maliyet verimliliği keşfedin
- Sürekli kullanım, ödeme ve işletme verimliliğindeki artış
- Bir sonraki hizmet geliştirme ve araştırma-geliştirme yatırımlarını destekleyin
Ana değişikliklerden biri, modelin ürettiği izlerin artık tüketim ve çağırma aşamalarında kalmayıp, bir sonraki model eğitiminin kaynağı olabilmesidir.
Bir görev tamamlandığında, Harness yetenek sınırları hakkında bir gözlem daha kazanır.
Bir model başarısız oldu, sistem yetenek boşluğunun nerede olabileceğini biliyor; başka bir model başarıyla devraldı, sistem yeni bir onarım yolu aldı; kullanıcı nihai sonucu kabul etti veya reddetti ve dış bir geri bildirim sağladı.
Görevler ne kadar fazla birikirse, rota kararı o kadar doğru olabilir; rota kararı daha doğru hale geldikçe, seçilen eğitim yolları gerçek görevlere daha çok benzeyecektir; model görevlere daha uygun hale geldikçe, API hizmeti daha iyi maliyet ve deneyim kazanma fırsatı bulacaktır.
Eğer bu döngü uzun vadeli olarak geçerli olursa, temel ritim ile standart API birleştirme platformları arasındaki farklar, rota kuralları ve model listelerinden başlayarak eğitim görevi tasarımı, eğitim yöntemleri ve model parametrelerine kadar uzanacaktır.
Son olarak ürün performansı ile ortaya konur.
RSI'ye ne kadar uzak?
Yukarıda, Elemental Rhythm'in RSI (Recursive Self-Improvement, Özyenilemeli Kendini Geliştirme) hakkında konuşmaya başlaması için arka plan verilmiştir.
Elemental Rhythm, şu anda RSI aralığını doğrulamak, bir mühendislik döngüsüne daha yakın ve iki parçaya ayrılabilir.
Birinci Data-RSI.
Model, Harness içinde görevleri sürekli olarak yürütür; her rota, araç çağrısı, hata kurtarma ve nihai sonuç, yeni yapılandırılmış kayıtlar oluşturur.
Bu kayıtlar filtrelenip işlendikten sonra, sonraki eğitim veri havuzuna dahil edilebilir. Eğitim verileri bu sayede tamamen insan tarafından önceden hazırlanmaya gerek kalmadan sistem sürekli kullanıldıkça artabilir.
İkinci Model-RSI.
Sistem, değerlendirme sonuçlarına göre mevcut modelin zayıf yönlerini belirler, bir sonraki eğitim veri dağılımını ayarlar, modeli günceller ve yeni modeli tekrar Harness'e geri gönderir.
Yani model, yürütme deneyimlerinden öğrenir, güncellenen model yeni görevleri yürütür ve bir sonraki eğitim döngüsü için yeni geri bildirimler üretir.

Ancak NeoHorse'un şu ana kadar açıkladığı bilgilere göre, bu sistem tam bir RSI olarak kabul edilemez.
Teknik rapor, şu anda bir "çalıştır-değerlendir-seç-güncelle" döngüsünü doğrulamaktadır. Sinyal tasarımı, ödül tasarımı ve eğitim süreci hâlâ insanlar tarafından belirlenmektedir; çok nesil model yinelemeleri sonrası artımların kararlı bir şekilde devam edip edemeyeceği, daha fazla deney ile doğrulanmalıdır.
Bu nedenle NeoHorse'un bu sürümü, iki kat doğrulama tamamladı.
Birinci kat, ticari açıdan, sistemin biriktirdiği verilerin model eğitimi için kullanılabilmesi ve ölçülebilir kapasite artışı haline gelmesidir.
Diğer bir taraf ise teknik olup, Wang Yunhe, bir RSI yönünde tek seferlik mühendislik doğrulamasını girişim ekibiyle tamamladı.
Daha fazla model, bu şirketin daha değerli mi olur?
Elbette, Elemental Rhythm hikayesinin geçerli olabilmesi için birkaç engeli aşmak gerekir.
Birinci olarak, açık kaynak ekosistemi API kullanımına ve gelire sürekli olarak dönüştürülebilir mi?
İkinci olarak, görev türleri arttıkça sistemin, eğitim için yeterli kalitede ve kullanılabilir agent yörüngeleri elde edip edemeyeceği.
Üçüncü olarak, model yeteneklerinin iyileştirilmesinden sonra, daha iyi bir görev deneyimi ve yürütme verimliliğine kararlı bir şekilde dönüştürülebilir mi ve bu da işletme verilerinde daha da ortaya çıkabilir mi.
Dördüncü olarak, çok aşamalı model yinelemelerinden sonra yetenek artışı ne kadar süreyle devam edecektir.
Bu soruların daha uzun bir süre gözlenmesi gerekiyor.
Ve ayrıca kaçınılmaz bir değişken— DeepSeek Qwen MiniMax Model sağlayıcıları da Harness ve Agent ürünlerine doğru genişliyor; model ile Agent altyapısının dikey entegrasyonu giderek daha belirgin hale geliyor.
Elemental Rhythm örneğinde, bu şirketin sahip olduğu farklılıkların biri model nötralitesidir ve çeşitli modeller arasında yürütülen süreçlerde oluşan yan yana karşılaştırma verileridir.
Ancak modeller arasındaki yetenek farkı yeterince büyükse, model arası yönlendirme bağımsız bir iş haline gelebilir; eğer lider modeller giderek daha fazla görevi kapsarsa ya da üreticiler Routing, araç çağrısı ve Agent çerçevesini birlikte paketlerse, orta katman için bırakılan alan daralacaktır.
Üst seviye kapasitesi giderek daha güçlü ve daha ucuz hale geldikçe, bu orta katman neden hâlâ gereklidir?
NeoHorse, Elementa Rhythms için bu soruya en azından yeni bir göz açı katıyor.
Geçmişte kendi kendine "model kullanma" yeteneğini kanıtladı, şimdi ise uzun vadeli model kullanımından birikmiş verilerin de kendi model yeteneğine dönüşebileceğini kanıtlamaya başlıyor.
Bu yol başarıyla izlenirse, Elemental Rhythm'in rekabet avantajı yalnızca rota stratejisinde değil; başarısız olursa, tüm model orta katmanlarının karşılaştığı sorunlarla yüzleşmek zorunda kalır.
GitHub: https://github.com/TokenRhythm/NeoHorse
Kucaklama yüzü: https://huggingface.co/collections/TokenRhythm/neohorse-1
Bu yazı, WeChat hesabının "Quantum Bit" adlı grubundan gelmektedir; yazar: Heng Yu
