Bir yapay zekaya çalışır kod yazmayı öğretmek bir şey. Ancak ona hızlı çalışan kod yazmayı öğretmek, görünüşe göre tamamen farklı bir mesele.
Meta AI'nin FAIR ekibinden 29 Temmuz'da yayınlanan yeni bir makale, pekiştirme öğrenmesini kod doğruluğundan kod hızı optimizasyonuna genişletmenin, standart yaklaşımların basitçe çözemeyeceği sorunlarla dolu olduğunu ortaya koyuyor. Sorunların nedenleri: gürültülü zamanlama ölçümleri, seyrek ödüller ve performansa odaklanmanız gerektiğinde çöken algoritmalar.
Hızla ilgili sorun
Kodun doğru cevabı üretip üretmediğini ölçtüğünüzde temiz bir ikili sinyal alırsınız. Ancak kodun ne kadar hızlı çalıştığını ölçmek karmaşıktır. Aynı kodu aynı makinede iki kez çalıştırırsanız, biraz farklı yürütme süreleri elde edersiniz. Arka plan süreçleri, CPU planlaması, bellek tahsisi, tümü zamanlamaya dair ölçümlere gürültü ekler.
Meta ekibi, pekiştirmeli öğrenme araç setindeki standart bir algoritma olan Genelleştirilmiş Pekiştirmeli Politika Optimizasyonu'nun (GRPO), bu tür gürültülü hız ölçümleri verildiğinde kararsız hale geldiğini tespit etti.
Ödül seyrelmesi sorunu artırır. Çoğu kod optimizasyonu marjinal hız iyileştirmeleri sağlar, bu da modelin “evet, bu değişiklik şeyleri daha hızlı yaptı” gibi güçlü bir pozitif sinyal almasını nadiren sağlar.
DMC-Optim: Yeni bir problem için yeni bir ölçüt
Bu zorlukları aşmak için araştırmacılar, kalibre edilmiş bir kum havuzu ortamı ve özel bir eğitim hattı içeren DMC-Optim adlı bir performans ölçütü geliştirdi. Sistem, offline bir simülatör içinde hem doğruluk hem de yürütme hızı için ödüller birleştirerek, zamanlama gürültüsünün yok sayılması yerine yönetilebileceği kontrollü bir ortam oluşturuyor.
Sonuçlar tartışılmaz. Qwen 2.5 7B için geçme oranı %18,0'den %31,3'e yükseldi, bu da yaklaşık %74'lük bir göreceli iyileşme demek. CWM 32B'nin geçme oranı %30,7'den %50,4'e çıktı, bu da %64'lük bir göreceli artış. LCB performans testinde, bu yaklaşımla eğitilen CWM 32B, doğrulanabilir ödüllerden elde edilen standart pekiştirmeli öğrenme ile eğitilen modellerin medyan hız karşılaştırmalarını %83 oranında geçti.
Kötüleşmiş zamanlama koşullarında, ölçüm gürültüsü kasıtlı olarak artırıldığında, DMC-Optim benchmarkı standart yöntemlere kıyasla %100 ile %200 arasında performans artışı gösterdi.
Makale, Meta AI'den Pierre Chambon, Kunhao Zheng, Juliette Decugis, Benoît Sagot ve Gabriel Synnaeve tarafından yazıldı.
