OpenAI Astra memperkenalkan "inovasi" ini, tetapi ByteDance sebenarnya telah memperkenalkannya tahun lalu. Jalur ini disebut recurrent depth. Secara ringkas, ia tidak lagi bergantung semata-mata pada penghasilan CoT yang lebih panjang untuk berpikir lebih lama, tetapi membiarkan sekumpulan blok Transformer yang sama berulang kali berputar pada hidden state, memasukkan lebih banyak komputasi ke dalam latent space. Soal yang sukar dijalankan beberapa putaran, soal yang mudah dikeluarkan lebih awal. Parameter tidak perlu tumbuh seiring dengan kedalaman inferensi, dan compute pada masa ujian juga boleh dialokasikan dengan lebih fleksibel. Pada Oktober tahun lalu, ByteDance Seed telah memperkenalkan dan mengopen-source Ouro, yang merupakan Looped Language Model. Ouro-1.4B dan 2.6B secara langsung menambahkan iterative latent reasoning semasa pre-training; 2.6B secara lalai menjalankan beberapa putaran komputasi recurrent, sambil menyokong adaptive exit, membolehkan setiap soal menentukan sendiri berapa banyak putaran yang diperlukan. Pada tahun lalu, ini hanyalah satu cabang kecil yang diuji oleh ByteDance dengan model kecil; kini ia dimasukkan oleh OpenAI ke dalam model paling mutakhir. Ini bermakna recurrent depth kemungkinan besar tidak lagi sekadar reka bentuk "menarik" secara akademik, tetapi bermula memasuki jalan kejuruteraan sebenar untuk model besar generasi seterusnya. Namun, masalah yang dibawanya jauh lebih rumit daripada benchmark. Di masa lalu, apabila model reasoning diperluaskan, banyak komputasi ditulis dalam CoT. Semakin lama model berpikir, semakin banyak token reasoning yang dihasilkannya. Walaupun CoT bukanlah status dalaman penuh model, ia sekurang-kurangnya masih menjadi jendela pemantauan yang selamat. Recurrent depth akan terus memindahkan komputasi ke dalam latent space. Sekumpulan parameter yang sama boleh berputar berulang kali dalam hidden state, di mana model telah menyelesaikan banyak komputasi dalaman, dan akhirnya hanya perlu mengeluarkan sedikit teks. Maka muncul satu masalah yang sangat praktikal: Lokasi sebenar di mana model menyelesaikan inferensinya sedang perlahan-lahan meninggalkan bahasa semula jadi. Inilah yang menjadi kebimbangan utama para penyelidik terhadap Astra. OpenAI sendiri sebelum ini sangat menekankan pemantauan Chain-of-Thought, kerana jika model bersedia untuk curang, hack reward, atau mengelakkan peraturan, ia sering kali terlebih dahulu mengekspos niatnya dalam CoT. Namun, jika semakin banyak reasoning berlaku di dalam latent state, apakah yang masih boleh anda pantau? Dilaporkan bahawa OpenAI kini sengaja menghadkan tahap recurrent depth yang digunakan oleh Astra, demi mengekalkan lebih banyak CoT yang boleh dibaca, sambil secara tambahan melaksanakan pemantauan status dalaman dan perilaku. Perkara ini sebenarnya sangat menarik. Dalam beberapa tahun terakhir, jalan untuk memperluaskan reasoning pada model besar sangat mudah difahami: berikan lebih banyak token, biarkan ia berkata lebih banyak. Seterusnya mungkin ia akan menjadi: berikan lebih banyak putaran dalaman, tetapi ia tidak perlu memberitahu anda proses tersebut.
sleepy.mdKongsi
Sumber:Tunjukkan artikel asal
Penafian: Maklumat yang terdapat pada halaman ini mungkin telah diperoleh daripada pihak ketiga dan tidak semestinya menggambarkan pandangan atau pendapat KuCoin. Kandungan ini adalah disediakan bagi tujuan maklumat umum sahaja, tanpa sebarang perwakilan atau waranti dalam apa jua bentuk, dan juga tidak boleh ditafsirkan sebagai nasihat kewangan atau pelaburan. KuCoin tidak akan bertanggungjawab untuk sebarang kesilapan atau pengabaian, atau untuk sebarang akibat yang terhasil daripada penggunaan maklumat ini.
Pelaburan dalam aset digital boleh membawa risiko. Sila menilai risiko produk dan toleransi risiko anda dengan teliti berdasarkan keadaan kewangan anda sendiri. Untuk maklumat lanjut, sila rujuk kepada Terma Penggunaan dan Pendedahan Risiko kami.