Vals AI, a16z liderliğinde 40 milyon dolarlık Seri A finansmanını toplayarak bağımsız AI model performans testleri oluşturuyor
2026/08/22 12:06:00

Finansman Turu, Gerçek Dünya AI Performans Ölçütleri İçin Artan İhtiyacı Gösteriyor
Ağustos 2026’nın ortalarında, Vals AI, Andreessen Horowitz’in öncülük ettiği, mevcut yatırımcılar 8VC, Pear VC ve Bloomberg Beta’nın yanı sıra yeni destekçiler HRT Ventures ve Next Ladder Ventures’in katıldığı, 400 milyon dolarlık değerlemeye sahip 40 milyon dolarlık Series A sermaye topladı. San Francisco merkezli şirket, akademik tarz testlerin büyük ölçüde doygun hale geldiği yerde, ekonomik olarak anlamlı mesleki işler üzerinde performansı değerlendirmek için kendi referans testlerini oluşturarak öncü AI modellerinin bağımsız bir değerlendiricisi olarak kendini konumlandırıyor. Sonuçları zaten OpenAI, Anthropic, Google, Meta ve xAI’nin model kartlarında yer alıyor. Gelir, 2025 yılı boyunca elde edilen tüm gelirle kıyaslandığında sekiz kat arttı, müşteri tabanı iki katına çıktı ve ekip altı ay içinde üç katına çıktı.
Finansmanla birlikte Vals, herhangi bir GitHub deposundan alınan özelleştirilmiş kodlama performans testleri için Vals Smith’i, rekürsif kendi kendini geliştirme yeteneklerini ölçmek için CoreWeave ile geliştirilen RSI Endeksi, Columbia, Tufts, UC Berkeley ve UCLA’dan araştırmacılarla birlikte oluşturulan ReverseEngBench’i ve ABD GSYİH’ye sektör katkılarına göre ağırlık veren genişletilmiş Vals Endeksi 2.0’ı piyasaya sürdü. Bu adımlar, işletmelerin güvenilir yatırım getirisi ölçüm yöntemleri olmaksızın AI benimsemeye zorlanırken, hükümetlerin de öncü yetenekler ve siber risk için bağımsız ölçümler aramaya başlamasıyla birlikte geldi. Temel tez, bağımsız, sürekli güncellenen profesyonel görev performans testlerinin, AI ekonomisi için temel altyapı haline geldiğidir ve finans, hukuk, yazılım mühendisliği ve yüksek riskli alanlarda çok adımlı işleri tamamlama yeteneği ile tedarikçilerin raporladığı liderlik tabloları puanları arasındaki büyüyen boşluğu kapatmaktadır.
Geleneksel Yapay Zeka Sıralamalarının Kurumsal Kararlar İçin Tahmin Gücünü Kaybetmesinin Nedeni
Kamu akademik referansları bir zamanlar model ilerlemesini izlemek için ortak bir dil sağlıyordu, ancak Zürih ETH ve Stanford'daki araştırmacıların Şubat 2026 tarihli bir analizinde, 60 yaygın olarak kullanılan büyük dil modeli değerlendirmesinden 29'unun doygunlaştığını, en iyi ve ikinci model arasındaki performans farklarının ölçüm gürültüsü içine düştüğünü tespit ettiler. Kontaminasyon, test verilerinin eğitim korpüslerine girmesiyle oluşur, bazen Common Crawl aracılığıyla, aynı zamanda laboratuvarlar bilinen hedeflere doğrudan optimize edilir. Sonuç olarak, MMLU, HumanEval veya benzeri test setlerinde yüksek puanlar artık karmaşık, çok adımlı profesyonel iş akışlarında başarıyı güvenilir şekilde tahmin etmez. Vals, ana test setlerini gizli tutarak, temsilci görevleri tanımlamak için alan uzmanlarıyla ortaklık kurarak ve modelleri ayırt etmeyi bıraktıkları zaman referansları kaldırmak suretiyle bu sorunu çözer.
May 2026'da şirket, önceki CorpFin değerlendirmesini, farklılaşmanın çöktüğü nedenle daha katı bir Excel Modelleme Benchmark'ı ile değiştirdi. Bu uyarlanabilir yaklaşım, değerlendirmeyi statik bir sınav değil, sürekli altyapı olarak ele alır ve işletmelere üretim dağıtımında modeller seçerken daha net bir sinyal sunar. Şirketin metodolojisi ve a16z yatırım duyurusuna ilişkin resmi belgeler, sürekli yerine geçirilen özel, uzmanlar tarafından kurulan kümelerin, tamamen kamuoyuna açık ya da tamamen özel statik testlerden daha etkili şekilde doyma yolunu direndiğini vurgulamaktadır.
Vals, Gerçek Profesyonel İş Akışları Etrafında Ölçütler Oluşturuyor
Vals, her alanda yetkin işi tanımlayan görevlerin taksonomisini haritalamak için uygulamalı avukatlar, finansal analistler, yazılım mühendisleri ve klinik uzmanlarla iş birliği yapar; ardından üretilen iş ürünlerini çoktan seçmeli doğru cevaplar veya tam metin eşleşmeleri yerine uzman standartlarına göre puanlayan otomatik notlama sistemleri geliştirir. Tipik bir Finance Agent v2 görevi, bir ajana belgelerden destekleyici verileri almasını, rakip şirketler arasında göreli değer modelleri sentezlemesini, sektör katalizörlerini tanımlamasını ve adımlar arasında verileri hayal etmeden ya da bağlamı kaybetmeden temellendirilmiş yatırım önerileri üretmesini gerektirir. Mayıs 2026'da en yüksek puanı alan model, bu test setinde yalnızca %52 doğruluk oranına ulaşmıştır; bu da hatta öncü sistemlerin bile bir profesyonel analistin yerine getirmesi beklenen görevlerin yaklaşık yarısında başarısız olduğunu göstermektedir.
Aynı felsefe, yasal araştırmaya, kod migrasyonuna, terminal tabanlı mühendisliğe ve tıbbi kodlamaya da uygulanır. Derecelendirme otomatikleştirilmiştir ancak uzman yargılarıyla kalibre edilmiştir; bu nedenle model erişimi alındıktan saatler içinde değerlendirme üretilebilir ve bu, öncü sürümlerin mevcut haftalık sürüm döngüsüyle uyumlu olur. Şirket, ana puanları üreten özel test setlerinin bütünlüğünü korurken yeniden üretilebilirliği desteklemek için değerlendirme altyapısının bazı bölümlerini açık kaynak hale getirmiştir. Alan ortaklığı, otomatik uzman düzeyinde puanlama ve hızlı dönüş süresi kombinasyonu, bu platformu akademik liderlik tablolarından ve yalnızca tercihe dayalı alanlardan ayırmaktadır.
a16z'nin 400 milyon dolarlık değerlemeye liderlik etme gerekçesi
Andreessen Horowitz, yatırımını ekonomist George Akerlof tarafından tanımlanan klasik bilgi asimetrisi problemi etrafında şekillendirdi: satıcıların ürün kalitesi hakkında alıcılardan daha fazla bilgiye sahip olması ve olumlu verileri öne çıkarma eğiliminde olmaları durumunda, pazarlar daha düşük kaliteli sonuçlara doğru bozulur. Jennifer Li ve a16z ekibi, bağımsız bir AI puanlayıcısının ihtiyacını, kredi piyasalarında Moody’s’in ve halka açık şirketlerin raporlamasında bağımsız denetçilerin tarihsel ortaya çıkışına karşılaştırdı. Vals’in gelir modeli, belirli bir laboratuvarın iddialarını sertifikalamak yerine değerlendirme hizmetleri için ücret almayı hedefler ve yapısal bağımsızlığı korumayı amaçlar.
Şirket, kurucuların teknik derinliğini ve referans geçerliliği konusundaki uzun süredir süren şüpheci tutumunu vurguladı; Rayan Krishnan ve Langston Nashold, Stanford'da bilgisayar bilimi okurken zaten gerçek dünya ölçüm problemleri üzerinde birlikte çalışmışlardı. Turun değerlemesi ve nicel işlemle bağlantılı HRT Ventures'in katılımı, sofistike sermayenin güvenilir ölçümü, kenar bir araştırma aracından ziyade kritik altyapı olarak gördüğünü gösteriyor. Resmi a16z yorumu, modellerin sorulara cevap vermekten çok saatler süren ajanlık iş akışlarını gerçekleştirmeye doğru kaydığını vurguluyor ve kötü bir model seçiminin maliyetinin token harcamasından ziyade kaybedilen zaman ve müşteri sonuçlarına yükseldiğini belirtiyor.
Kurucuların Arka Planları ve Bağımsız-Değerlendirme Tezi'nin Kökenleri
Şirketin CEO'su olan Rayan Krishnan, bilinen bir veri analiz firması olan Palantir'de önceki çalışmalarıyla dikkat çekici bir geçmişe sahiptir. Ortak kurucusu Langston Nashold, CTO pozisyonunda bulunmakta olup, Meta, NVIDIA ve Hudson River Trading gibi büyük teknoloji şirketlerindeki deneyimleriyle zengin bir arka plana sahiptir. İki kurucu, Stanford Üniversitesi'nde bir ön yönlendirme sıralama gezisi sırasında ilk kez birbirleriyle karşılaştı ve hemen bir bağ kurdu. Daha sonra bilgisayar bilimi derslerinde birlikte çalıştılar ve önemli bir farkına varışlar: büyük dil modelleri, iş yapma şeklini kökten değiştirebilir. Ancak aynı zamanda endüstride bu modelleri test etmek için güvenilir ve etkili yöntemlerin hâlâ eksik olduğunu da fark ettiler. İncelemeleriyle motive olan bu iki kurucu, Vals kurmak amacıyla kendi lisansüstü programlarını bıraktılar. Yeni girişimlerinin ilk odak noktası, ABD'deki ekonomik faaliyetlerin önemli bir kısmını temsil eden finans ve kodlama görevleri oldu.
Piyasada yaygınlık kazanmaya başladıklarında, önemli model kartlarında dikkat çekici alıntılar elde ettiler ve Ticaret Bakanlığı tarafından girişimlerine destek aldıkları gibi, yapay zeka politikasıyla ilgili kongre çabalarına da dahil oldular. Kurucular, eski performans ölçütlerinin sürekli olarak yaşlanmasını ve özel test setlerinin kullanılmasını büyük önemle vurguluyorlar. Bu yaklaşım, modellerin statik performans ölçütlerinin zirvesine ne kadar hızlı ulaştığını ve eğitim verilerinin kamu değerlendirmelerini nasıl etkilediğini gözlemlemelerinin doğrudan bir sonucudur. Üretim sistemleri ve nicel ortamlar konusundaki birlikteki deneyimleri, değerlendirme yığınının tasarımını ve işletmelerin şimdi teknolojinin öncü düzeyiyle uyumlu şekilde modelleri seçmek ve izlemek için kullandığı ticari ürünü büyük ölçüde şekillendirdi.
Finans Ajantı Başarı Ölçütleri, Liderlik Sıralaması Puanları ile Analist Düzeyi Çalışmaları Arasında Sürekli Farkları Ortaya Koyuyor
Modeller eski akademik test setlerinde neredeyse mükemmel sonuçlar elde etse de, Finance Agent v2 test seti göz ardı edilemeyecek önemli eksiklikleri ortaya koymaya devam etmektedir. Bu sette yer alan görevler, çok belge sentezi, göreli değer modellemesi ve öneri üretimi içerir ve bunların tümü endüstrideki profesyonel finansal analistlerin günlük çıktılarını yakından yansıtmaktadır. Mayıs 2026'da lider sistemde kaydedilen %52lik tavan, yüksek genel bilgi puanlarının otomatik olarak güvenilir ve özerk finansal analiz yetenekleri anlamına gelmediğini açıkça hatırlatmaktadır.
Vals, Bileşik Vals Endeksi'ni ABD GSYİH'sine yaklaşık sektör katkılarını dikkate alarak ağırlıklandırır; bu da finans sektörüne önemli bir çarpan etkisi sağlar ve çeşitli modellerin toplam sıralamasında ekonomik etkinin doğru şekilde yansımasını sağlar. Vals değerlendirmeleri kısmen kullanılarak seçilen modelleri başarıyla uygulayan işletmeler, platformu yalnızca ilk seçim süreci için değil, aynı zamanda ürünlerin yerleşik öncü bazlara karşı sürekli performans ölçümü için de kullanmaktadır. Ayrıca, mevcut performans farkı, finansal kurumlar içinde sermaye tahsisi kararlarını bilgilendirmede kritik bir rol oynar. Bu kurumlar, genellikle öznel ve daha az güvenilir olabilen niteliksel gösterimlere değil, ölçülebilir verimlilik kazanımlarıyla AI harcamalarını gerekçelendirmek zorundadır. Bu sürekli değerlendirme süreci, AI teknolojilerine yapılan yatırımların somut faydalar ve operasyonel verimlilik artışı sağladığından emin olmak için esastır.
Vals Smith, Kurumsal Depolardan Doğrudan Çekilen Özel Kodlama Başarımlarını Açıyor
Seria A duyurusuyla, Vals, Smith'i genel erişime açtı ve herhangi bir kuruluşun kendi GitHub depolarından özel bir kodlama performans testi oluşturmasını sağladı. Sistem, tarihsel çekme isteklerinden gerçek geliştirme görevlerini çıkarır ve bir modelin işi tamamlayıp tamamlayamayacağını belirlemek için gizli testler uygular. Kullanıcılar, başlamak için 120 ücretsiz kredi alır. Kod tabanlarında özel kalıplar, kütüphaneler ve mimari kurallar içeren şirketler için, genel Python veya Java yeterliliği ile bu özel ortamda çalışabilme yeteneği arasındaki fark karar vericidir.
Smith, bu nedenle kodlama yeteneğiyle ilgili soyut soruyu, özgün bir organizasyona özgü bir ölçüm haline dönüştürüyor. Erken kurumsal benimseyenler, kısmen ezberlenmiş veya optimize edilmiş olabilecek genel test setlerine değil, gerçek mühendislik iş yükleri üzerindeki performansa göre modelleri sıralayabiliyor. Yayın, Vals’ın önceden oluşturulmuş alan testlerinin ötesine, müşteri ihtiyaçlarıyla ölçeklenebilen özel değerlendirme altyapısına genişliyor.
RSI Endeksi ve ReverseEngBench, Öncü Risk Alanlarına Kapsamını Genişletiyor
Yeni finansmanla birlikte, Vals, CoreWeave ile iş birliği içinde geliştirilen RSI Endeksini duyurdu. Bu yenilikçi endeks, model geliştirme, sıkıştırma teknikleri, eğitim yöntemleri, parametre optimizasyon stratejileri, harness mühendisliği uygulamaları ve eğitim sonrası değerlendirmeler için gerekli olan araştırma görevlerini çeşitli modellerin gerçekleştirebilir olup olmadığını değerlendirmeyi amaçlıyor. Ayrıca şirket, Columbia Üniversitesi, Tufts Üniversitesi, UC Berkeley ve UCLA gibi saygın akademik kurumlarla titizlikle geliştirilen ReverseEngBench projesini tanıttı. Bu kapsamlı referans seti, toplamda 16.000 satır kodun ortalamasını aşan 19 özel programdan oluşuyor.
Bu programlar, ağ protokolleri, donanım yazılımları, oyun uygulamaları, dosya formatı kurtarma süreçleri ve kötü amaçlı yazılım analizi gibi çeşitli alanları kapsar ve tümü, güvenliği artırmak için tasarlanan kapsamlı bir analiz önleme sistemiyle korunur. İlk sonuçlar, önde gelen öncü modeller arasında önemli bir farklılaşma göstermekte olup, agenterin gerçekçi ikili dosyaları tutarlı bir şekilde tersine mühendislikle çözmesi için hâlâ büyük bir potansiyel kaldığını ortaya koymaktadır. Bu çabaların yanı sıra, zihinsel sağlık uygulamaları alanında erken aşamada çalışmalar da başlatılmış olup, çevresel etki değerlendirmeleri, askeri uygulamalar ve biyogüvenlik alanları gibi kritik alanlara genişletme planları mevcuttur. Bu değerlendirmeler, risk odaklıdır ve hem kurumsal güvenlik durumlarının artırılmasında hem de en son teknolojik sistemlerin hükümet tarafından değerlendirilmesinde kritik olan yetenekleri ele alır.
Vals Endeksi 2.0, ekonomik katkıya göre ağırlıklandırılmış performansı birleştirir
Yeniden tasarlanan website ve Vals Endeksi 2.0, finans, kodlama ve yasal görevler dahil olmak üzere çeşitli alanlarda önemli ölçüde genişletilmiş kapsama sahiptir. Endekste kullanılan sektör ağırlıkları, Ekonomik Analiz Bürosu tarafından sağlanan katma değer verilerinden türetilmiştir. Kullanılan bileşik formül, her sektör içindeki performans metriklerini ortalamakta ve ardından bu sektör puanlarını GSYİH'nın yaklaşık paylarına göre birleştirmektedir. 2026 yılının ortasında, Claude Opus 5 Endekste öncü konumda olup, ardından Claude Fable 5 ve GPT-5.6 Sol gelmektedir.
Endeks, en son model sürümlerini yansıtmak için sıklıkla güncellenir ve potansiyel ekonomik etkiyi gösteren tek bir ana metrik olarak hizmet verir; aynı zamanda kullanıcıların bireysel alan liderlik tablolarına daha detaylı girişler yapmalarını sağlar. Temel performans ölçümleri büyük ölçüde gizli kalır ve periyodik olarak yenilenir; bu nedenle Endeks, tamamen kamuoyuna açık bileşiklerle karşılaştırıldığında daha uzun süre farklılığını korur. Kurumlar ve araştırmacılar, bu Endeksi yalnızca göreli sıralama amaçlı değil, aynı zamanda mevcut model ekosistemi boyunca maliyet-gecikme-kapasite dengelerini analiz etmek için de kullanır ve en ilgili verilere dayalı olarak bilinçli kararlar almayı sağlar.
Kurumsal Kabul Desenleri ve Ölçülebilir ROI Talebi
Büyük ölçekli AI uygulamaları, temel modelleri seçerken ve iç ürünleri öncü performans metrikleriyle karşılaştırırken artan şekilde Vals değerlendirmelerini entegre etmektedir. Hızlı dönüş süresi, alan özgürlüğü ve bağımsızlık kombinasyonu, tedarik ekiplerinin ve teknik liderlerin karşılaştığı pratik zorlukları etkili bir şekilde çözmektedir: tedarikçi puan tabloları artık yüksek riskli kararlar almak için yeterli değildir.
2025 yılının tamamına kıyasla sekiz katlık gelir büyümesi, sadece altı ay içinde iki katına çıkan müşteri tabanı ve üç katına çıkan personel sayısı, talebin ilk denemeler aşamasından aşamaya geçtiğini açıkça göstermektedir. Hükümetler de yetenek ölçümü ve siber risk konularında değerli bilgiler edinmek amacıyla platformla iş birliği yapmışlardır; bu da platformun ticari ve politik bağlamlardaki önemini pekiştirmiştir. Haftalık model yayınlarıyla uyumlu kalma kapasitesi, sinyalin birkaç ay geride kalmadan güncel ve ilgili kalmasını sağlamaktadır.
Ekosistem ve Tercih Temelli Platformlardan Yapısal Ayırıcı Farklılıklar
Diğer değerlendirme çabaları, açık uçlu çıktılar üzerinde insan yargılarını birleştiren tercih oylama alanları ve değerlendirme süresini önemli ölçüde kısaltmayı hedefleyen psikometrik yaklaşımlar da dahil olmak üzere mevcuttur. Vals, yüksek ilgi ve uygulanabilirliği garanti altına alan uzmanlar tarafından hazırlanmış profesyonel görev tasarımı ve kurulan alan standartlarına dikkatlice ayarlanmış otomatik notlandırma ile kendini ayırt eder. Şirket, değerlendirmelerinin bütünlüğünü korumak için sürekli olarak geri çekilen özel test setlerini kullanır ve sahadaki tüm büyük öncü laboratuvarlar tarafından kanıtlanmış alıntı kaydına sahiptir.
Bu alıntı kaydı, yeni girenlerin inanırlık kazanmak için kazanmaya çalışması gereken kritik bir meşruiyet biçimidir. Ayrıca, şirketin sadece konuşma tercihi veya saf hız üzerine odaklanmak yerine, ekonomik ağırlıklı, çok adımlı iş akışlarına verdiği önem, onu araştırma liderlik sıralamalarında bir oyuncu olarak değil, bilinçli üretim kararları almak için kritik bir altyapı haline getirmektedir. Yatırımcılar, bu benzersiz farklılaşmayı açıkça tanımlamış ve etkileyici 400 milyon dolarlık değerlemeye yansıtmıştır.
Model Geliştiriciler İçin Tahmin ve Yetenek Ölçümünün Hızı
Ön frontier laboratuvarları artık bağımsız puanların, kendi bildirdiği sayıların artan ölçüde eksik olduğu bir ortamda faaliyet göstermektedir. Model kartlarında alıntı yapmak, kurumsal alıcılara sonuçların üçüncü taraf denetiminden geçtiğini sinyal verir. Aynı zamanda, daha zor referans noktalarının sürekli oluşturulması, sıradaki modellerin aşması gereken barı yükseltmektedir. Bu nedenle, yapay zeka ilerlemesini sürdüren “tepe tırmanma” süreci, daha dik ve daha sık yenilenen tepe setleriyle karşı karşıya kalmaktadır.
Değerlendirmeyi ikincil bir düşünce olarak gören geliştiriciler, yetenek boşluklarını yalnızca dağıtım sonrası keşfedebilir; daha erken bağımsız ölçüm entegrasyonu yapanlar, gerçek iş için önemli olan iyileştirmeleri önceliklendirebilir. Seçili altyapı bileşenlerinin açık kaynak yapılması, yeniden üretilebilirliği teşvik ederken, en yüksek sinyal puanlarını üreten temel özel değerlendirmeleri korur.
Güvenilir Ölçüm Kurumları İçin Daha Genel Piyasa İhtiyacı
Yapay zeka sistemleri, yasal ve finansal olarak önemli süreçlere daha derin girdikçe, bağımsız ölçümün yokluğu, geçmişte diğer endüstrilerde derecelendirme ajansları ve denetçilerin ortaya çıkmasına neden olan aynı bilgi asimetrisi risklerini yaratır. Vals’in büyüme metrikleri ve destekçilerinin kalitesi, sermayenin bu kurumsal boşluğu tanıdığını göstermektedir. Şirketin, yapay zekanın bağımsız değerlendiricisi olma amaçlı açıkça belirtilen misyonu, getiri netliği arayan işletmeler ve kapasite ile risk anlayışı arayan politika yapıcılar için pratik gereksinimlerle uyumludur.
Ek profesyonel ve risk alanlarına genişlemeye devam etmek, yöntemin bağımsızlığı ve sinyal kalitesini korurken ölçeklenebilirliğini test edecektir. Şu anda, son ürün çıkışları, hızlı ticari kazanım ve yüksek profilli sermaye taahhüdünün birleşimi, Vals’i gerçekten önemli olan işleri yapabilecek modelleri seçmek zorunda kalan herkes için merkezi bir referans noktası haline getirmektedir.
Sıkça Sorulan Sorular
Vals AI, Seri A finansman turunda tam olarak ne duyurdu?
Vals AI, 13 Ağustos 2026 tarihinde 400 milyon dolarlık değerlemeye sahip olarak 40 milyon dolarlık Series A finansmanını kapattı. Andreessen Horowitz turu öncülük etti, mevcut yatırımcılar 8VC, Pear VC ve Bloomberg Beta geri döndü, yeni yatırımcılar ise HRT Ventures ve Next Ladder Ventures katıldı. Şirket aynı zamanda özel kodlama performans testleri için Vals Smith, RSI Endeksi, ReverseEngBench, genişletilmiş Vals Endeksi 2.0 ve yeniden inşa edilmiş bir web sitesini yayınladı. Vals ve a16z'den resmi açıklamalar, rakamları ve eşlik eden ürün sürümlerini doğrulamaktadır.
Vals referansları, MMLU veya SWE-bench gibi genel liderlik tablolarından nasıl farklıdır?
Vals, alan uzmanları tarafından tanımlanan çok adımlı profesyonel iş akışlarını ve uzman standartlarına göre ayarlanmış otomatik sistemler tarafından puanlanan çözümlere odaklanır. Ana test setleri gizli tutulur ve modelleri ayırt etmeyi durdurduklarında emeklileştirilir; bu da kirlenmeyi ve optimizasyon oyunlarını azaltır. Kamu akademik paketleri sıklıkla doygun hale gelir veya eğitim verilerine sızar, bu da gerçek kurumsal görevler için tahmini değerlerini sınırlar. Vals’ın yaklaşımı, model erişiminden saatler içinde sonuçlar üretir ve zaten büyük laboratuvarların model kartlarında yer almaktadır.
Finans Ajantı görevlerindeki %52 puanın önemi nedir?
May 2026'da önde gelen model, göreli değer modellemesini, belge sentezini ve temellendirilmiş önerileri gerektiren Finance Agent v2 suite'inde yaklaşık %52 doğruluk sağladı. Bu rakam, en güçlü mevcut sistemlerin bile bir profesyonel finansal analistin yerine getirmesi beklenen görevlerin yaklaşık yarısında başarısız olduğunu gösteriyor. Akademik puanlar ile profesyonel görev performansı arasındaki bu boşluk, Vals'ın ölçmeye ve böylece kapatmaya çalıştığı tam olarak sorundur.
Kurucular kimdir ve hangi deneyime sahiptirler?
CEO Rayan Krishnan, daha önce Palantir'de çalıştı. CTO Langston Nashold, Meta, NVIDIA ve Hudson River Trading'te deneyime sahiptir. İkisi de Stanford'da bilgisayar mühendisliği okudu ve şirketin kurulmasından önce ölçüm problemleri üzerinde çalışmaya başladılar. Arka planları, üretim sistemleri deneyimini nicel ve araştırma odaklı bakış açılarıyla birleştirerek Vals'ın titiz, uyarlanabilir değerlendirme vurgusunu şekillendirdi.
Vals Smith, kurumlar için ne sağlar?
Vals Smith, herhangi bir kurumun GitHub depolarından özelleştirilmiş bir kodlama performans ölçütü oluşturmasına izin verir. Sistem, tarihsel çekme isteklerinden gerçekçi geliştirme görevlerini çıkarır ve gizli testler uygular. Kullanıcılar 120 ücretsiz krediyle başlar. Araç, genel kodlama performans ölçütlerini, mülkiyet kod kalıplarını ve mühendislik uygulamalarını yansıtan kuruma özel ölçümlere dönüştürür.
Vals Endeksi, ekonomik ağırlıklandırmayı nasıl dahil eder?
Endeks, finans, kodlama ve yasal görevlerdeki performansı birleştirir ve Bureau of Economic Analysis verilerini kullanarak sektör ortalamalarını ABD GSYİH'ye yaklaşık katkılarına göre ağırlıklandırır. Elde edilen bileşik endeks, bireysel alan sonuçlarının ayrıntılı incelenmesine izin verirken potansiyel ekonomik etkinin tek bir ana ölçüsünü sunar. Sürüm 2.0, kapsamı genişletilmiş ve yeni model sürümlerini yansıtmak için sık sık güncellenmektedir.
🔥 KuCoin, Oynak Bir Piyasada Daha Kararlı Bir Seçenek Sunuyor
Piyasadaki sık sık olan yükseliş ve düşüşlerden endişe ediyorsanız ve pasif gelir elde etmek için daha istikrarlı bir seçenek arıyorsanız, KuCoin tam olarak gelmeniz gereken yer:

Simple Earn: Tokenları her zaman yatırın ve çekin, sabit getiriler kazanın.
KuCoin Earn: Profesyonel varlık yönetimiyle istikrarlı kazanç elde edin.
Tut ve Kazan: Varlıklarınızı Finansman, İşlem, Marjin, Vadeli, Madencilik ve Birleşik Hesaplarınızda tutarak ödüller kazanın.
Katılma: Zincir üzerindeki varlıkların kazanç potansiyelini açığa çıkarın.
Gelişmiş Yatırımlar: Gelişmiş Yatırımlar, paranızın her piyasa koşulunda büyümesine yardımcı olmak için çeşitli yapılandırılmış ürünler sunar.
Shark Fin: Anapara Koruması ve Garantili Kazanç
İkili Yatırım: Düşükten alıp yüksekten satın, şeffaf getiri hesaplamalarıyla.
Kartopu: Yüksek getiri, fiyat koruması ile.
İndirimli Alım: Kripto paraları indirimli fiyatlardan alın.
KCS Sadakat: ≥ 1 KCS stake ederek özel avantajlardan yararlanmak için seviye yükseltin.
KuCoin Wealth: Geleceğin değerini keşfedin ve akıllı yatırım yolculuğunu başlatın.
KCS Avantajları: Platform boyunca avantajlara erişmek için KCS tutun ve stake edin.
KCS Staking 2.0: Getir kazanmak için KCS zincir içi yönetimine katılın.
Sorumluluk Reddi: Bu içerik yalnızca bilgilendirme amaçlıdır ve yatırım tavsiyesi oluşturmaz. Kripto para yatırımları risk taşır. Lütfen kendi araştırmanızı yapın (DYOR).
Sorumluluk Reddi: Bu sayfa, kolaylığınız için AI teknolojisi kullanılarak çevrilmiştir. En doğru bilgi için orijinal İngilizce versiyona bakınız.
