Misteriyöz 'Ox Alpha' AI Modeli, OpenRouter'da tahminlere neden oluyor

icon MarsBit
Paylaş
AI summary iconÖzet
OpenRouter'da "Ox Alpha" adlı gizemli bir AI modeli ortaya çıktı ve güçlü kodlama becerileri ile gizliliği nedeniyle dikkat çekiyor. Çinli kullanıcılar arasında "牛来" olarak bilinen bu model, metin, resim ve video girdilerini destekliyor ve şu anda ücretsiz. Geliştiriciler, gerçek kod depolarında test ettiler ve sonuçlar en üst düzey modellere yakın çıktı. Bazıları bu modeli Zhipu AI'nin GLM-5.3'üyle ilişkilendiriyor. Başka bir model olan korrine, Code Arena'da test ediliyor ve Kimi K3.1 veya MiMo V3 ile bağlantılı olduğu yönünde teoriler var. Zincir üstü analizler, resmi sürümlerden önce tarafsız değerlendirme ve halktan geri bildirim imkanı sağlayan anonim testlere yönelik artan ilgiyi gösteriyor.

Büyük modeller topluluğunda "kılık değiştirerek test etme" popüler.

Son zamanlarda, Ox Alpha adlı bir anonim model OpenRouter'da aniden ortaya çıktı. Ox zaten "öküz" anlamına gelir, Çinli internet kullanıcıları hemen ona daha günlük bir isim verdi:

「İnek Geliyor» büyük modeli.

OpenRouter'in açıklamalarına göre, Ox Alpha 1 milyon token kontekstine sahiptir, metin, resim ve video girdilerini destekler, araçları çağırabilir ve şu anda tamamen ücretsizdir.

GLM

Yüklendikten kısa bir süre sonra, geliştiriciler bunu Coding Agent'e entegre edip gerçek kod deposunda test etmek için kullandı.

İlk test sonuçları, tanımlanamayan "Niu Lai" büyük modelinin, mevcut en üst düzey kod modellerine yaklaşan bir yeteneğe sahip olduğunu gösteriyor.

Aynı zamanda, bir kullanıcı, Code Arena'da test edilen korrine adlı bir anonim modelden bahsetti. Kimi bunun Kimi K3.1, bazıları bunu Qwen ve MiMo ile ilişkilendiriyor, çeşitli iddialarda bulunuyorlar.

Ağustos'ta büyük modeller dünyası, aniden büyük bir bulmaca oyununa dönüştü.

「Bo Lai» büyük modeli dikkat çekici performans sergiliyor

Ox Alpha, kodlama becerisiyle gerçek ilgi çekiyor.

Geliştirici Ben Davis, DeepSWE'den 10 görev çıkararak test etti; Ox Alpha, bu görevlerin 8'ini tamamladı ve %80 geçme oranı sağladı. Yayınlanan karşılaştırma sonuçlarına göre, Fable 5 Max %65, GLM-5.3 Max ve Grok 4.6 xhigh %62, GPT-5.6 Sol Max ise %52'dir.

GLM

DeepSWE, gerçek yazılım mühendisliği becerilerini değerlendirir. Model, kod deposunu okumalı, sorunları tespit etmeli, kodu değiştirmeli, testleri çalıştırmalı ve hatalara göre düzeltmeler yapmalıdır. Tek seferlik programlama sorularına kıyasla, bu yaklaşım kodlama Agent'larının gerçek iş süreçlerine daha yakındır.

Ancak, 10 görevlik örnek kümesi küçüktür. Daha sonra diğer geliştiriciler, DeepSWE'nin başka bir alt kümesinde test yaptı ve sonuç yaklaşık %63 çıktı. İki testin görev kapsamları ve çalışma yapılandırmaları tamamen aynı olmadığından, şu anda Ox Alpha'nın kesin sıralaması belirlenemiyor.

GLM

Ancak bu sonuçlar, bu anonim modelin uzun menzilli kodlama potansiyelinin güçlü olduğunu ve şu anki önde gelen modellere yaklaşan bir yeteneğe sahip olduğunu ilk olarak göstermektedir.

「İnek Geliyor» büyük modeli kimin?

「牛来» büyük modelinin kimliği, şu anda en çok yayılan görüşe göre, ZhiPu'nun henüz yayınlamadığı GLM-5.3 Flash veya GLM-5.3'ün çoklu modlu sürümüdür.

Bazıları analiz için özel olarak bir blog yazdı:

1. En güçlü kanıt video kodlayıcıdan geliyor. Farklı frame rate, süre ve çözünürlüğe sahip dört video da Ox Alpha'nın GLM-5V-Turbo ile tamamen aynı görsel tokenleri tükettiğini gösteriyor. MiMo, Qwen ve GLM-4.6V ise açıkça farklı sonuçlar veriyor.

2. Metin talep ayırıcısı da yüksek oranda uyumlu. Araştırmacılar 25 adet istek grubunu test etti ve Ox Alpha ile GLM-5.3 arasındaki token sayısı her zaman sabit 75 token farkını korudu.

3. Diğer özellikler de智谱'yi işaret etmektedir. Ox Alpha, sesi işlememektedir, bu da GLM-5V'nin yönlendirme yöntemiyle aynıdır; cevap tarzı, Agent yürütme adımları ve akıl yürütme arayüzü de GLM ile çok benzerdir.智谱, daha önce Pony Alpha ile GLM-5'i anonim olarak test etmiş ve aynı işlem örneğine sahiptir.

GLM

https://ox-alpha-evidence-production.up.railway.app/

Ayrıca bazı kullanıcılar diyalogdan ipuçları buldu.

GLM

Ben Davis, bunun %99 kesinlikle GLM-5.x olduğunu düşünüyor.

GLM

Bu ipuçları, GLM'nin iddiasını daha güvenilir hale getiriyor, ancak kimlik doğrulamayı tamamlamak için yeterli değil.

Şu ana kadar OpenRouter ve ZhiPu herhangi bir yanıt vermedi.

Korrine'in kimliği daha da belirsizleşti

「牛来」 büyük modelinin kimliği hâlâ belirsizken, Code Arena'da korrine adlı anonim bir model ortaya çıktı.

İlk başta birçok kişi bunun olduğunu tahmin etti Kimi K3.1, nedeni Kimi K3, kivine kod adıyla test edildiği düşünülmüştü. Kivine, korrine ile yapısal olarak benzer olduğu için bağlantılar kuruldu.

GLM

Ancak, haberi ilk yaylayan kaynak, daha önce bilinen Moonshot yeni modelinin başka bir kod adı olan adamant-ananke ile eşleşebileceğini ekledi. Korrine, Qwen gibi diğer Çinli takımlardan da gelebilir.

GLM

Yorumlarda, bazıları bunu MiMo V3'e yönlendiriyor.

GLM

Büyük modelleri üreten şirketler neden “kılık değiştirmeyi” tercih eder?

Anonim testler, büyük modellerin resmi yayınından önce önemli bir aşamaya dönüşüyor.

Arena'da üretici ve modeli gizleyerek, önceden var olan marka algılarını en aza indirebilirsiniz. Kullanıcılar model kimliğini göremez, yalnızca gerçek çıktıya göre seçim yapar ve toplanan mücadele sonuçları, gerçek kullanıcı deneyimine daha yakındır.

OpenRouter, başka bir tür test ortamı sunmaktadır.

Geliştiriciler, modeli çeşitli kodlama agent'larına entegre ederek gerçek depolara girmesini, uzun saatler süren yazılım mühendisliği görevlerini işlemek için araçları sürekli olarak çağırmasını sağlayacaktır. Bağlamın kararlı kalıp kalmadığı, araç çağrılarının güvenilir olup olmadığı ve modelin uzun vadeli görevlerde döngüye girecek mi yoksa sapacak mı, yoğun kullanım sırasında hızla ortaya çıkacaktır.

Model üreticileri için bu, açık bir yük testi gibidir. Takım, hatalı durumları önceden gözlemleyebilir, çıkarım hizmetlerinin kapasitesini test edebilir ve resmi sürüm sonrasında gerçek kullanıcı geri bildirimleri birikimini sağlayabilir.

Ayrıca, "Modeli Tahmin Et" artık bir pazarlama aracı haline gelmeye başlamıştır; kimlik gizliliği gerçekten tartışmaların süresini uzatabilir.

Son olarak modele dönelim. Eğer Ox Alpha gerçekten bir Flash modeliyse ve kodlama yetenekleri zirve seviyesine yaklaşmışsa, daha fazla kaynak yatırılmış ve daha tam bir tam sürüm, üst sınırı nereye taşıyacak?

Referans bağlantısı:

https://x.com/Adidotdev/status/2090833298713096241

https://x.com/davis7/status/2090669483740279155?s=20

https://x.com/davis7/status/2090655207831298095?s=20

https://x.com/MaxForAI/status/2090783750217162788

Bu yazı, WeChat hesabından "Makine Kalbi" (ID: almosthuman2014) tarafından paylaşılmıştır, yazar: AI'ya ilgi duyan

Yasal Uyarı: Bu sayfadaki bilgiler üçüncü şahıslardan alınmış olabilir ve KuCoin'in görüşlerini veya fikirlerini yansıtmayabilir. Bu içerik, herhangi bir beyan veya garanti olmaksızın yalnızca genel bilgilendirme amacıyla sağlanmıştır ve finansal veya yatırım tavsiyesi olarak yorumlanamaz. KuCoin, herhangi bir hata veya eksiklikten veya bu bilgilerin kullanımından kaynaklanan sonuçtan sorumlu değildir. Dijital varlıklara yapılan yatırımlar riskli olabilir. Lütfen bir ürünün risklerini ve risk toleransınızı kendi finansal koşullarınıza göre dikkatlice değerlendirin. Daha fazla bilgi için lütfen Kullanım Koşullarımıza ve Risk Açıklamamıza bakınız.