Yapay zeka, örnekleri sadece kopyalamak yerine, neyi optimize edeceğini öğrenir mi? Denetimli ince ayar (SFT), modelin uzman cevaplarını taklit etmesiyle eğitir. Yeni bir makale, PARED adlı bir uyum yöntemi tanıtır; bu yöntem, aynı gösterimlerden yeniden kullanılabilir bir ödül çıkarmayı amaçlar. PARED, uzman cevaplarını seçilen özellikler açısından modelin kendi yanıtlarıyla karşılaştırır: yardımcı olma, zarar vermemek ve konu gibi. Bu farklılıkları kullanarak açık bir ödül öğrenir ve bu ödül, SFT sonrası ek güçlendirme öğrenimini yönlendirir. 4.000 GPT-5.1 tarafından oluşturulan gösterim kullanılarak, PARED ile eğitilen modellerin yanıtları, iki farklı ödül güncelleme yaklaşımında, Gemini 2.5 Flash tarafından değerlendirildiğinde, ilgili olmayan karşılaştırmalarda sırasıyla %86,2 ve %88,4 oranında orijinal SFT kontrol noktasının yanıtlarından tercih edildi. Gösterimler, sadece taklit için değil, aynı zamanda SFT sonrası modelin öğrenmeye devam edeceği bir amaç tanımlamak için de faydalı olabilir.
MintyPaylaş

Kaynak:Orijinalini göster
Yasal Uyarı: Bu sayfadaki bilgiler üçüncü şahıslardan alınmış olabilir ve KuCoin'in görüşlerini veya fikirlerini yansıtmayabilir. Bu içerik, herhangi bir beyan veya garanti olmaksızın yalnızca genel bilgilendirme amacıyla sağlanmıştır ve finansal veya yatırım tavsiyesi olarak yorumlanamaz. KuCoin, herhangi bir hata veya eksiklikten veya bu bilgilerin kullanımından kaynaklanan sonuçtan sorumlu değildir.
Dijital varlıklara yapılan yatırımlar riskli olabilir. Lütfen bir ürünün risklerini ve risk toleransınızı kendi finansal koşullarınıza göre dikkatlice değerlendirin. Daha fazla bilgi için lütfen Kullanım Koşullarımıza ve Risk Açıklamamıza bakınız.
