Kertas baharu mencadangkan latihan end-to-end untuk model generatif melalui pemodelan eksploratif

icon MarsBit
Kongsi
AI summary iconRingkasan
Sebuah kertas kerja baru dari UIUC dan Harvard memperkenalkan Pemodelan Eksploratif (XM), kaedah latihan end-to-end untuk model generatif. Pendekatan ini menggunakan gelung for untuk menghasilkan dan memilih calon teratas, mengurangkan pemburaman mod. Ia menunjukkan peningkatan dalam tugas imej, video, dan bahasa, dengan kecekapan FLOP, sampel, dan parameter yang lebih baik. Semasa altcoin yang perlu diawasi mendapat perhatian, inovasi seperti ini mungkin mempengaruhi indeks ketakutan dan keserakahan di kalangan pedagang.

Pada tahun 2012, AlexNet mengakhiri satu era dengan kemenangan telak. Sebelum itu, pengenalan gambar bergantung pada reka bentuk manual oleh manusia terhadap proses pengambilan ciri bertingkat; AlexNet membuktikan satu perkara yang kemudian berulang kali disahkan: memberikan keseluruhan tugas kepada model untuk belajar secara end-to-end hampir selalu mengalahkan saluran berperingkat yang direka dengan teliti oleh manusia.

Dari pengelasan imej hingga pengesanan objek hingga pemisahan imej, setiap lompatan dalam pembelajaran mendalam dibelakangnya adalah satu perkataan yang sama: biarkan ia belajar sendiri secara berterusan.

Satu-satunya bidang yang sentiasa pengecualian: model generatif.

Model generatif terkuat dan paling boleh dikembangkan hari ini (baik autoregresif atau model penyebaran) bukanlah end-to-end.

Mereka dilatih hanya untuk meramal "satu langkah kecil", tetapi semasa inferens, mereka perlu mengulangi langkah ini berhampiran ratusan hingga ribuan kali seperti rangkaian kitaran.

Cara pengambilan sampel yang digunakan untuk latihan dan inferens tidak sama. Celah ini membawa masalah lama: kesilapan pada setiap langkah akan dimasukkan ke langkah seterusnya, input perlahan-lahan menyimpang daripada taburan yang pernah dilihat semasa latihan, dan kesilapan terkumpul secara bertingkat. Dalam akademik, ia dikenali sebagai "exposure bias".

Dengan kata lain, pengalaman paling penting dalam pembelajaran mendalam, iaitu "end-to-end lebih baik", selama lebih dari sepuluh tahun tidak pernah benar-benar diterapkan kepada model generatif.

Dan baru-baru ini, sebuah kertas kerja dari UIUC dan Universiti Harvard cuba memasang kepingan terakhir teka-teki ini.

Model penghasilan

Penulis memberi nama kepada paradigma baru ini sebagai Explorative Modeling (Pemodelan Eksploratif), dengan singkatan XM. Gagasan ini begitu sederhana sehingga hampir naif, tetapi membawa kepada kesimpulan yang berani: selain parameter dan data, model generatif sebenarnya mempunyai paksi ketiga yang boleh diperbesarkan.

Model penghasilan

Laman web projek: https://explorative-modeling.github.io

Alamat kertas: https://arxiv.org/abs/2607.27372

Repositori kod: https://github.com/alexiglad/XM

Punca masalah: Model hanya akan 「mengambil purata」

Untuk memahami apa yang dicuba diselesaikan oleh kertas ini, perlu terlebih dahulu memahami mengapa penghasilan itu sukar.

Pembelajaran pengawasan biasa (seperti pengelasan) setiap input hampir selalu mempunyai satu jawapan yang betul, jadi model hanya perlu belajar satu pemetaan yang pasti.

Tetapi hasilnya berbeza. Anda meminta model untuk "menghasilkan seekor anjing", dan jawapan yang betul mungkin mempunyai jumlah tak terhingga. Output-output yang sah ini merupakan mode-mode dalam taburan, iaitu puncak-puncak berasingan dalam taburan. Penghasilan sukar kerana perlu menangkap semua mode ini secara serentak.

Masalahnya ialah, model generatif utama dilatih menggunakan kerugian rekonstruksi (contohnya, ralat kuasa dua). Apabila satu input dipasangkan secara rawak dengan banyak sasaran sah yang berbeza, penyelesaian terbaik yang boleh diberikan oleh kerugian rekonstruksi ialah purata sasaran-sasaran tersebut. Namun, bagi kebanyakan data, purata tersebut tidak berada di atas manifold data, tetapi terletak di antara beberapa mode, dan tidak menyerupai mana-mana satu.

Gambar dalam kertas itu sangat intuitif: apabila model secara langsung melakukan regresi end-to-end tanpa sebarang teknik, tiga set titik tersebar akan diprediksi sebagai satu titik di tengah, gambar anjing akan menjadi kabur, dan satu ayat akan terdegenerasi menjadi pengulangan kata "the" sehingga habis. Ini dikenali sebagai "mode blurring", iaitu penyelesaian optimum justru merupakan jawapan yang paling tidak menyerupai data sebenar.

Model penghasilan

Model semasa bagaimana mengelakkan ini? Jawapannya ialah dengan memecahkan proses “penghasilan” kepada bahagian-bahagian kecil. Regresi automatik hanya meramal satu elemen pada satu masa, penyebaran hanya menghilangkan sedikit kebisingan pada setiap langkah, dan setiap langkah kecil ditujukan kepada hampir hanya satu mod sahaja, maka fungsi kerugian rekonstruksi tidak akan mengambil purata.

Proses "penguraian dan penghasilan" ini adalah sebab mengapa penyebaran dan auto-regresif mampu menghasilkan sampel berkualiti tinggi, tetapi ia juga menyebabkan model tidak boleh end-to-end.

Penulis seterusnya mengemukakan satu soalan penting: model generatif hanya mempunyai dua perkara yang boleh dipisahkan, iaitu bagaimana ia dihasilkan dan bagaimana ia dilatih.

Jika memisahkan generasi merusak end-to-end, mengapa tidak memisahkan latihan?

Model penghasilan

Satu gelung for: seluruh teras pemodelan eksploratori

Explorative Modeling membongkar siklus latihan itu sendiri.

Mekanismenya boleh dinyatakan dalam satu ayat: Pada setiap langkah latihan, model tidak lagi menghasilkan satu sampel sahaja untuk memaksa mencapai sasaran, tetapi menghasilkan K cadangan, kemudian hanya memilih yang paling hampir dengan data sebenar untuk dilatih dan menghantar gradien semula. Kertas ini mengimplementasikannya sebagai gelung for 3 hingga 5 baris, begitu ringkas sehingga agak mencurigakan (Algoritma 1).

Model penghasilan

Mengapa cara ini dapat menyelesaikan kekaburan mode?

Tukar kepada situasi kehidupan sehari-hari: tebak titik jatuh panah. Jika anda hanya dibenarkan menebak sekali, strategi terbaik anda ialah menebak posisi purata semua panah, tetapi biasanya ia berada di tempat yang hampir tidak ada panah yang menghujam. Namun, jika anda dibenarkan menebak K kali dan hanya skor tebakan paling dekat yang diambil, strategi terbaik segera berubah: anda akan menyebarkan tebakan anda supaya setiap tebakan meliputi satu kumpulan titik jatuh yang berbeza.

Model penghasilan

Model juga sama. Apabila ia dibenarkan menjelajahi K kandidat, bunyi input yang berbeza akan masing-masing "mengaku" satu mode yang berbeza, bukan semuanya berkumpul di tengah untuk mengambil purata. Berapa kali penjelajahan dilakukan, model akan dapat menangkap dengan stabil sebanyak itu jumlah mode.

Model penghasilan

Penulis memberi nama kepada kemampuan yang lama diabaikan ini: ekspresiviti generatif (generative expressivity), dan menunjukkan bahawa ia ditentukan oleh objektif latihan itu sendiri, tidak kira seberapa besar anda menambah parameter dan data, ia tidak akan meningkat dengan sendirinya.

Model penghasilan

Ini juga menjelaskan fenomena aneh yang telah lama diperhatikan dalam industri: mengapa model terbaik hari ini sangat bergantung pada teknik "guidance".

Yang dinamakan classifier-free guidance, pada dasarnya adalah mendorong ramalan menjauh dari nilai purata yang kabur. Tetapi jika model itu sendiri tidak kabur, mengapa perlu mendorongnya? Guidance berguna justru kerana akar masalah yang ditinggalkan oleh mode yang kabur.

Kertas itu juga memberikan dua arah penjelajahan: Forward dan Reverse. Yang pertama menetapkan satu sasaran sebenar dan mencari yang paling hampir dalam hasil generasinya sendiri, cenderung kepada "kelengkapan" (meliputi semua mode); yang kedua menetapkan satu hasil generasi dan mencari yang paling hampir dalam data sebenar, cenderung kepada "ketepatan", dan hampir tidak menambah beban pengiraan, dengan harga kemungkinan merosot kepada beberapa mode sahaja. Keduanya saling melengkapi dan boleh digunakan bersama.

Model penghasilan

Model penghasilan

Paksi ketiga: semakin diperbesar, semakin besar keuntungan

Kesimpulan paling berkesan dalam kertas ini ialah membuktikan "eksplorasi" sebagai satu paksi penskalaan yang sebenar.

Penulis mengaplikasikan eksplorasi ke model diffusion/flow, model Jumpy, hingga model bahasa diffusion tersembunyi, dan secara konsisten melihat peningkatan performa monotonik pada tiga modality: gambar, video, dan bahasa. Lebih penting lagi, keuntungan mengikuti tren skala: semakin besar, semakin kuat.

Nombor yang diberikan dalam kertas ini adalah: semasa skala data meningkat, keuntungan daripada eksplorasi meningkat dari 7% hingga 36%; semasa model membesar, ia meningkat dari 13% hingga 23%; apabila kuasa pengiraan meningkat tiga kali ganda, keuntungan kecekapan berlipat ganda lebih daripada dua kali.

Dari segi kecekapan, ia meningkatkan kecekapan FLOP sebanyak 4.1 kali, kecekapan sampel sebanyak 6.2 kali, dan kecekapan parameter sebanyak 47%. Dalam penghasilan imej, ia mendorong resepi RAE terkuat semasa ke FID 1.43 tanpa panduan di ImageNet, mendekati tahap terbaik industri.

Model penghasilan

Satu model besar yang menjelajahi 5 mode, bahkan mampu mengalahkan model XLarge yang memiliki 47% parameter lebih banyak tetapi tidak melakukan penjelajahan.

Model penghasilan

Makna arah ini tidak kecil. Penjelasan penulis adalah: pada skala kecil, model terutama dibatasi oleh parameter dan data, di mana ekspresiviti penghasilan belum menjadi bottleneck; tetapi sekali parameter dan data diperbesar hingga "tidak lagi menjadi pembatas", ekspresiviti penghasilan akan semakin menjadi bottleneck sebenarnya. Dan inilah yang sedang dieksplorasi sebagai sesuatu yang boleh diperbesar secara langsung.

Mengingat bahawa latihan model asas sebenar semasa ini menggunakan kuasa pengiraan yang lebih tinggi sebanyak kira-kira empat peringkat daripada eksperimen terbesar dalam kertas ini, penulis berpendapat bahawa nombor-nombor yang dilaporkan dalam kertas ini kemungkinan besar hanyalah had bawah keuntungan dalam skala yang lebih besar.

Generasi end-to-end sejati

Apa yang akan berlaku jika eksplorasi dibawa hingga ke hadnya? Jawapannya kembali kepada ketegangan awal: model generatif akhirnya boleh dilaksanakan secara end-to-end.

Penulis menganggap XM sebagai model end-to-end yang berdiri sendiri dan menggunakannya untuk tugas pengawasan robot. Dalam peniruan tingkah laku (Behavior Cloning), Polisi Eksploratif mereka hanya memerlukan sekali forward pass untuk menyamai atau bahkan melampaui Polisi Diffusion yang memerlukan 100 kali forward pass; dalam pemodelan dunia berorientasi tujuan, Model Dunia Eksploratif mencapai prestasi purata yang lebih baik dengan menggunakan 16 hingga 256 kali kurang daya pengiraan inferensi berbanding Diffuser.

Model penghasilan

Model penghasilan

Sumber jurang ini jelas: model penyebaran menggunakan ratusan langkah inferensia untuk menukar ekspresiviti, manakala XM end-to-end mengalihkan kos ini kepada eksplorasi semasa latihan, sehingga inferensia hanya memerlukan satu forward pass. "Menangani banyak mode" — perkara yang sama ini — sama ada dibongkar perlahan-lahan semasa inferensia, atau dieksplorasi sepenuhnya semasa latihan; kertas ini memilih yang kedua.

Perkenalan Penulis

Penulis pertama kertas ini, Alexi Gladstone, bukanlah orang asing. Pada Julai 2025, EBT (Energy-Based Transformers) yang dipimpinnya pernah menimbulkan perbincangan besar di platform sosial.

Model penghasilan

Kajian itu mengklaim bahawa ia pertama kali "mengalahkan" lengkung penskalaan Transformer feedforward standard di pelbagai dimensi, dan berusaha memperluaskan "pemikiran Sistem 2" ke mana-mana mod. Lihat laporan Machine Heart: "Paradigma Baru Tiba! Model Energi Baru Membongkar Had Penskalaan Transformer++, Meningkatkan Kadar Penskalaan Latihan Sebanyak 35%".

Model penghasilan

Pemodelan Eksploratif selaras dengan pendekatan konsistennya: kedua-duanya mempertanyakan sama ada model boleh melakukan perkara yang tidak dapat dicapai melalui satu langkah maju semata-mata melalui cara carian atau eksplorasi. Kertas ini juga dibina di atas teori lain yang dicipta olehnya bersama rakan kongsi (Yilun Du dan Heng Ji), iaitu Mode Forcing. Dalam kertas tersebut, diakui bahawa kerana teori tersebut telah wujud terlebih dahulu, kebanyakan keputusan XM telah diramalkan secara teori sebelum dibuktikan secara eksperimen—suatu pendekatan yang jarang berlaku dalam kalangan komuniti pembelajaran mendalam yang biasanya "jalankan eksperimen dahulu, baru terangkan".

Model penghasilan

Penulis juga secara jujur mengakui batasan-batasannya: idea best-of-K itu sendiri bukanlah sesuatu yang baru, kerana telah dilakukan berkali-kali sebelum ini; sumbangan sebenar mereka ialah memahami dengan jelas apa yang sebenarnya dilakukan oleh kitaran ringkas ini: ia memperbesar daya ungkapan penghasilan secara langsung tanpa memecahkan proses penghasilan.

Selain itu, model bahasa autoregresif masih merupakan cabaran terbesar, dan Forward XM tulen end-to-end masih terlalu mahal pada taburan yang sangat banyak mod (seperti penghasilan imej), yang semuanya ditangguhkan untuk kerja seterusnya.

Selama bertahun-tahun, kita telah terbiasa menggunakan dua kawalan untuk menyesuaikan model generatif: membuatnya lebih besar dan memberinya lebih banyak data.

Knob ketiga yang dicadangkan dalam kertas ini agak sederhana: biarkan model membuat tekaan berulang kali dan hanya simpan tekaan terbaik. Tetapi jika tren yang diungkapkan itu sah, maka seiring skala terus membesar, dua knob pertama akannya mencapai batasnya, manakala knob ketiga baru sahaja bermula berputar.

Pautan rujukan

https://x.com/AlexiGlad/status/2083230922196107288

Artikel ini berasal daripada akaun微信公众号 "Machine Heart" (ID: almosthuman2014), penulis: Panda

Penafian: Maklumat yang terdapat pada halaman ini mungkin telah diperoleh daripada pihak ketiga dan tidak semestinya menggambarkan pandangan atau pendapat KuCoin. Kandungan ini adalah disediakan bagi tujuan maklumat umum sahaja, tanpa sebarang perwakilan atau waranti dalam apa jua bentuk, dan juga tidak boleh ditafsirkan sebagai nasihat kewangan atau pelaburan. KuCoin tidak akan bertanggungjawab untuk sebarang kesilapan atau pengabaian, atau untuk sebarang akibat yang terhasil daripada penggunaan maklumat ini. Pelaburan dalam aset digital boleh membawa risiko. Sila menilai risiko produk dan toleransi risiko anda dengan teliti berdasarkan keadaan kewangan anda sendiri. Untuk maklumat lanjut, sila rujuk kepada Terma Penggunaan dan Pendedahan Risiko kami.