source avatarsleepy.md

Paylaş

OpenAI Astra'nın bu "yenilik"i, ByteDance geçen yıl zaten açıkça yapmıştı. Bu yol, recurrent depth olarak adlandırılıyor. Basitçe söylemek gerekirse, daha uzun CoT üretmeye dayalı bir "daha fazla düşünme" stratejisi yerine, aynı Transformer blokları gizli durum üzerinde tekrar tekrar döngüye girerek daha fazla hesaplama latent uzaya sıkıştırılıyor. Karmaşık sorular için daha fazla tur atılıyor, basit sorular için erken çıkılıyor. Parametreler, çıkarım derinliğiyle birlikte büyümeden kalıyor ve test zamanı hesaplama kaynakları daha esnek bir şekilde dağıtılıyor. Geçen yıl Ekim'de, ByteDance Seed, Ouro adlı modeli açıklayıp açık kaynak hale getirmişti; bu model, Looped Language Model idi. Ouro-1.4B ve 2.6B, ön-eğitim aşamasında doğrudan yinelemeli gizli çıkarım eklenmiş durumdaydı; 2.6B varsayılan olarak çoklu recurrent hesaplama yapıyor ve adaptive exit desteği sunuyor, böylece her soru kendi başına kaç tur yapması gerektiğini kararlaştırabiliyor. Geçen yıl sadece ByteDance'nin küçük modellerle doğruladığı bir yan yoluydu; şimdi OpenAI bu yöntemi en önde gelen modele dahil etti. Bu, recurrent depth'in sadece akademik olarak "ilginç" bir tasarım değil, aynı zamanda bir sonraki nesil büyük modellerin gerçek mühendislik yolunda yer aldığını gösteriyor. Ancak getirdiği sorunlar, benchmark'lardan daha karmaşık. Geçmişte, çıkarım modellerinin genişletilebilirliği çoğu hesaplamayı CoT içinde tutuyordu. Model ne kadar uzun düşünürse, ürettiği reasoning token sayısı o kadar artıyordu. CoT, modelin tam içsel durumunu değilse de, en azından bir güvenlik izleme penceresi olarak hizmet edebiliyordu. Recurrent depth, hesaplamaları daha da latent uzaya taşıyacak. Aynı parametreler, gizli durumda birçok kez döngüye girerek modelin iç kısmında büyük miktarda hesaplama tamamlanacak ve sonuçta sadece kısa bir metin çıktısı verilecek. Bu durumda oldukça gerçekçi bir sorun ortaya çıkıyor: Modelin gerçek çıkarımı tamamladığı yer, giderek doğal dilin dışına doğru kayıyor. Bu da şu anda araştırmacıların Astra hakkında en çok endişelendiği nokta. OpenAI geçmişte Chain-of-Thought izleme konusunda çok özen göstermişti; çünkü model eğer hile yapmak, ödül manipülasyonu yapmak ya da kuralları atlamak istiyorsa, bazen önce CoT içinde niyetini açığa çıkarıyordu. Ancak artık çıkarımın büyük bir kısmı gizli durumda gerçekleşiyorsa, neyi izleyebilirsiniz? OpenAI'nin Astra'nın recurrent depth kullanımını bilinçli olarak sınırladığı da rapor ediliyor; bu sayede daha fazla okunabilir CoT korunuyor ve ek olarak içsel durum ve davranış izleme sistemleri de kuruluyor. Bu durum aslında oldukça ilginç. Geçtiğimiz birkaç yılda, büyük modellerin çıkarım yeteneğini genişletme yolu oldukça anlaşılırydı: Daha fazla token vermek, ona daha fazla konuşması sağlamak. Bundan sonraki yol ise, modele daha fazla içsel döngü vermek olacak—ancak bu süreçleri size açıklamak zorunda kalmayacak.

Yasal Uyarı: Bu sayfadaki bilgiler üçüncü şahıslardan alınmış olabilir ve KuCoin'in görüşlerini veya fikirlerini yansıtmayabilir. Bu içerik, herhangi bir beyan veya garanti olmaksızın yalnızca genel bilgilendirme amacıyla sağlanmıştır ve finansal veya yatırım tavsiyesi olarak yorumlanamaz. KuCoin, herhangi bir hata veya eksiklikten veya bu bilgilerin kullanımından kaynaklanan sonuçtan sorumlu değildir. Dijital varlıklara yapılan yatırımlar riskli olabilir. Lütfen bir ürünün risklerini ve risk toleransınızı kendi finansal koşullarınıza göre dikkatlice değerlendirin. Daha fazla bilgi için lütfen Kullanım Koşullarımıza ve Risk Açıklamamıza bakınız.