AI Model Jev, Ajan Çağı'nda İkili Kararlar İçin Popülerlik Kazanıyor

icon MarsBit
Paylaş
AI summary iconÖzet
Jev adlı yeni bir AI modeli, ajan eraında ikili karar verme yetenekleriyle dikkat çekiyor. ChatGPT’nin aksine, Jev evet/hayır kararları, puanlama ve çoktan seçmeli görevlere odaklanıyor. İlan analizi, bağlam temizleme ve ajan doğrulama için kullanılıyor. Zincir üzerindeki analizler, Jev’in en iyi modellere kıyasla 193,6 kat daha hızlı ve 444,6 kat daha ucuz olduğunu gösteriyor. Girdi maliyetleri milyon token başına $0,042’a kadar düşüyor. Geliştiriciler arasında korku ve avarelik endeksi, Jev’in verimliliği ortaya çıkarken artıyor. Kurucusu Diogo Almeida, önce OpenAI’da RLHF üzerinde çalıştı ve şimdi insan odaklı AI yerine otomatik karar verme üzerine odaklanıyor.

Yazar: Zhu Xueying

Bu iki gün içinde, biraz tuhaf bir yapay zeka modeli ekranda dolaşmaya başladı.

Adı Jev.

Konuşamaz, kod yazamaz, hatta ChatGPT gibi size uzun bir cevap üretmez. Sadece bir şey yapar: karar verir.

Ancak görünürde "yetenekleri yarıya indirilmiş" gibi görünen bu model, geliştirici topluluğunda aniden popüler hale geldi.

Biri bunu kullanarak 40 saniyede 724 gerçek zamanlı reklamı analiz ederek toplamda 8724 karar verdi; biri bunu Claude Code'a bağlayarak gereksiz bağlamları temizledi; bir başkası ise AI Agent'a "hakem" olarak görev vererek görevin gerçekten tamamlanıp tamamlanmadığını kontrol etti. LangChain, Jev'in Agent değerlendirmesi olarak performansını test etmeye başladı.

Daha da çarpıcı olan hız ve fiyat.

TypeSafe tarafından yayınlanan testlerde, Jev en fazla 193,6 kat hızlanma ve maliyette en fazla 444,6 kat azalma sağlıyor. Her milyon Token girişi sadece 0,042 dolar, Token çıkışı ise ücretsiz.

Daha az yetenekli gibi görünen bir AI neden daha popüler oldu?

Agent era's girdiğinde, AI'nın gerçekten ihtiyaç duyabileceği şey sadece "derin düşünme" değil, aynı zamanda milyonlarca kez gerçekleşecek hızlı ve ucuz kararlar: bir sonraki adım ne olmalı, hangi aracı kullanmalı, görev tamamlandı mı. Daha da önemlisi, bu kararlar gelecekte AI'nın arka planda kendisi tarafından yapılacaktır ve insanlar ekranın önünde sürekli beklemeyecektir. Jev, her gün milyonlarca kez gerçekleşebilecek bu küçük kararları hedef alıyor.

Daha ilginç olan şey, Jev modelinin kurucusu Diogo Almeida'nın tam olarak RLHF'ye katılmış olması ve şimdi RLHF'yi sorgulamaya başlaması: ChatGPT'nin kullanışlı hale gelmesini sağlayan bu eğitim yönteminin, AI'nın gerçek otomasyona ulaşması için uygun olmayabileceğidir.

Bir aydan fazla önce, Almeida bir konuşma yaptı. Şimdi geriye dönüp baktığımızda, o konuşma neredeyse Jev'in "düşünce kılavuzu" oldu.

Resim

Resim

Yapay zeka artık yüksek matematik yapabiliyor, neden hâlâ müşteri hizmetlerini iyi yapamıyor?

Diogo Almeida'nın özgeçmişi özel.

OpenAI'de çalışmış, GPT-4, ChatGPT ve InstructGPT/RLHF çalışmalarına katılmıştır. Yani, bugün büyük modellerin en önemli arka plan eğitim paradigmalarından birini doğrudan oluşturmuştur.

Ancak o konuşmada, OpenAI içinde ChatGPT'yi açıkça eleştiren az sayıda kişiden biri olduğunu kendisi de alay etti.

Konuşmasının konusu daha doğrudan: RLHF'den Sonra Ne?

Diogo, görünüşte çelişkili bir soru sordu.

Bugünün büyük modelleri, çok zor matematik sorularını, kodlamayı, akıl yürütme ve çeşitli performans testlerini aşabiliyor.

Ancak birçok şirketin gerçekten otomatikleştirmek istediği işlemlerde insanlar hâlâ kaldırılamıyor.

Örneğin müşteri hizmetleri.

AI ile araştırma yapmak, belgeleri özetlemek ve yanıt taslakları oluşturmak sorun değil.

Ancak AI'nin kendi kararını vermesi gerekirse: Bu para iade edilsin mi? Bu kullanıcı tazminat ödemeli mi?

Şirket hemen dikkatli hale geldi.

Bu işlerin yüksek matematikten çok daha basit göründüğü halde neden AI'ya vermekten korkuluyor?

Diogo'nun verdiği cevap basitti: Bugün'in AI'sı otomasyon değil, yardım için inanılmaz.

Bugünün AI'si işinizi yapmanıza yardımcı olmak çok iyi, ancak hâlâ işi tamamlamakta zorlanıyor.

Bu iki şey birbirinden çok az farklı görünüyor, aslında tamamen farklı.

Claude Code ne kadar güçlü olsun, genellikle bilgisayarın önünde oturursunuz. Kod yazıyor, siz izliyorsunuz; dosyaları değiştiriyor, siz kontrol ediyorsunuz; hata yaparsa, tekrar düzeltmesini istiyorsunuz.

Dolayısıyla Diogo'ya göre, Claude Code hâlâ ChatGPT'in başlattığı "yardımcı era"nın bir parçası.

Gerçek otomasyon nedir?

İnsan orada değil.

Yapay zeka arka planda kendi kendine karar verir ve kendi kendine işlem yapar, bir günde on binlerce hatta milyonlarca kez çalışabilir, siz bunun ne yaptığını asla göremezsiniz.

Peki soru şu: Neden bugünün AI'sı bu kadar akıllı olmasına rağmen insana bağımlı?

Diogo, kendi çok iyi bildiği bir şeye—RLHF'ye—odaklandı.

Resim

AI'yi eğlerken insanları döngüye soktuk

Bu durum biraz ironik.

Çünkü RLHF, Diogo'nun yıllar önce desteklediği teknoloji yolundan biridir.

RLHF'nin temel mantığı aslında karmaşık değil: İnsan tercihlerini toplayın ve modeli insan tercihlerine giderek daha uygun hale getirin.

Diogo, konuşmasında bugünün büyük modellerinin neden her zaman bir insanın döngüde olması gerektiğini çok açık bir şekilde açıkladı.

Onu eğitirken, kelimenin tam anlamıyla insanları o döngüye soktuk.

Model, baştan itibaren insanların daha çok ne tür cevapları tercih ettiğini öğreniyor.

Bu, zaten çok iyi bildiğimiz büyük modellerin bir özelliğini de açıklıyor—bilmeseler bile, genellikle çok gerçekçi gibi görünürler.

Diogo, yerinde çok sert bir örnek verdi.

Birisi, ChatGPT'ye kendi bestelediği bir müzik parçası olduğunu söyleyerek bir flatülans kaydını gönderdi ve ondan “samimi ve dürüst” bir değerlendirme istedi.

Sonuç olarak ChatGPT ciddi bir şekilde, bu şarkının karanlık ve tuhaf bir atmosferi olduğunu söyledi.

Diogo, “Aşırı taahhüt bir özelliktir.” diye özetledi.

Aşırı taahhüt bir hata değil, bir özelliktir.

Soğuk ürün için bu ölümcül olmayabilir. Kullanıcılar hâlâ ekranın önünde, hatalar düzeltilabilir.

Ancak gerçek otomatik sistemler tamamen farklıdır.

Makine cevabınızın ne kadar hoş olduğuna değil, tam olarak ne yapmanız gerektiğini ve ne kadar emin olduğunuzu bilmek ister.

Bu, bir aydan fazla sonra yayınlanan Jev'in neden bu kadar tuhaf göründüğünü açıklıyor.

Resim

Bu yüzden Jev, AI'nın "konuşmasını" tamamen durdurdu.

Sonunda yalnızca “A mı, B mi” cevabını vermesi gerekse bile, genel büyük modeller genellikle Token üretme sürecinden geçer.

Jev bu kısmı doğrudan kaldırıyor.

Şu anda şu üç şeyi yapıyor:

  • No

  • Seçim, birkaç seçenekten birini seçmek;

  • Puan, standartlara göre değerlendirin.

Sonra doğrulama ve olasılığı doğrudan döndürün.

Küçük bir essay yazmıyorum, sohbet etmiyorum.

Resmi olarak açıklanan uçtan uca gecikme süresi 70–500 milisaniye arasındadır ve en gelişmiş modellere göre 20–200 kat daha hızlı, fiyat olarak 40–400 kat daha ucuzdur.

Ancak gerçekten önemli olan, "hız" değil, arkasındaki olasılık.

Bunun için TypeSafe, RLCD (Reinforcement Learning for Calibrated Decisions), yani Kalibre Edilmiş Kararlar İçin Güçlendirilmiş Öğrenme adlı yeni bir eğitim yöntemi öneriyor.

Çözümlemeye çalıştığı soru çok gerçekçi: Eğer bir AI, bir şeyin %80 olasılıkla gerçekleşeceğini söylüyorsa, bu %80'e gerçekten güvenebilir miyiz?

İdeal durumda, modelin %80 olasılıkla tahmin ettiği olayların yaklaşık %80'i gerçekleşmelidir.

Bu, otomatik sistemlerde çok önemlidir.

%99 güvenle doğrudan yürütülebilir.

%51 güvenle, daha güçlü ve daha pahalı bir büyük modele, hatta bir insana bırakabilirsiniz.

Sorun, AI'nın bilmediği değil, AI'nın bilmediğini bilmediği.

Yani Jev, AI çıktısının hedefini gerçekten değiştirmek istiyor.

Geçmişte ChatGPT tarafından üretilen cevaplar çoğunlukla insanlar için hazırlanmıştı. Jev'in verdiği yargılar ve olasılıklar ise doğrudan yazılıma verilmek üzere hazırlanmıştı.

Resim

Agent çağında, belki de daha büyük bir beyne ihtiyaç duyulmayabilir

Bu, neden Jev'in tam olarak şimdi popüler hale geldiğini de açıklıyor.

Çünkü Agent gerçekten çalıştırıldığında, sonsuz sayıda küçük karar üretir:

Sonraki adım hangi aracı çağırır? Bu web sayfasında hangi düğmeye tıklanır? Bu bilgi hâlâ kullanışlı mı? Görev tamamlandı mı? Sonuç yeniden kontrol edilmeli mi?

Bu sorular tek başına kolay görünse de, bir Agent bir günde yüz binlerce, hatta milyonlarca kez karar vermesi gerekebilir.

Her seferinde en güçlü büyük modeli çağırıp, birkaç saniye "derinlemesine düşünüp" büyük bir Token miktarı üretmek, maliyeti ve gecikmeyi hızla artırır.

Jev, bu katı ele geçirmek istiyor.

Çok sayıda sık tekrarlanan küçük kararları Jev'e bırakın, gerçek anlamda karmaşık akıl yürütme gerektiren görevleri ise büyük modele bırakın.

Bu, TypeSafe'nin Jev'i System One Model olarak adlandırmasının nedenidir.

Bu kavram, Daniel Kahneman'ın "Sistem 1" ve "Sistem 2"si üzerine: biri hızlı, sezgisel kararlarla ilgili, diğeri yavaş, karmaşık düşünmeyle ilgili.

Jev, adı bile "Jevons paradoksu"ndan gelir:

Bir kaynak daha ucuz hale geldikçe, insanlar bunu daha az kullanmayabilir, aksine daha çok kullanabilir.

Bir AI çağrısı çok maliyetliyse, onu yalnızca en önemli yerlerde kullanırsınız.

Ancak bir AI, fiyatı neredeyse göz ardı edilecek kadar ucuz olarak değerlendirirse?

Bir e-posta, bir günlük kaydı, bir araç çağrısı, bir web sayfası düğmesi veya Agent'in her adımı, bir AI kararı içerebilir.

Elbette, Jev'in bir sonraki nesil AI temsilcisi olduğunu söylemek henüz erken.

Yaptığı所谓的“zero hallucination”, daha çok belirlenmiş cevap türlerinin dışına çıkmadan rastgele üretmemek anlamına gelir, yanlış seçim yapmayacağı anlamına gelmez; 193,6 kat, 444,6 kat gibi aşırı veriler de çoğunlukla TypeSafe'in kendi testlerinden gelmektedir.

Ancak Jev'in bu kez patlamasında, GPT veya Claude'ye meydan okuyup okuyamayacağından daha önemli olan şey olabilir.

Ama ChatGPT'yi oluşturan birinin, daha temel bir soruyu yeniden sormasıdır:

Geçtiğimiz yıllarda tüm sektör, AI'nın daha uzun süre düşünüp daha fazla konuşmasını nasıl sağlayacağımızı düşünüyordu.

Ancak gelecekte gerçekten milyarlarca makine arasındaki kararlar gerekiyorsa, neden AI her seferinde "bir konuşma yapmalı"?

ChatGPT, makinelere insanlarla nasıl konuşulacağını öğretti.

Jev yatırımının bir sonraki adımı şudur: İnsan ekranın önünde oturmazken, makine kendi kararını verebilir mi?

Yasal Uyarı: Bu sayfadaki bilgiler üçüncü şahıslardan alınmış olabilir ve KuCoin'in görüşlerini veya fikirlerini yansıtmayabilir. Bu içerik, herhangi bir beyan veya garanti olmaksızın yalnızca genel bilgilendirme amacıyla sağlanmıştır ve finansal veya yatırım tavsiyesi olarak yorumlanamaz. KuCoin, herhangi bir hata veya eksiklikten veya bu bilgilerin kullanımından kaynaklanan sonuçtan sorumlu değildir. Dijital varlıklara yapılan yatırımlar riskli olabilir. Lütfen bir ürünün risklerini ve risk toleransınızı kendi finansal koşullarınıza göre dikkatlice değerlendirin. Daha fazla bilgi için lütfen Kullanım Koşullarımıza ve Risk Açıklamamıza bakınız.