Penulis: Zhu Xueying
Dua hari ini, sebuah model AI yang agak tidak biasa tiba-tiba menjadi viral.
Ia dipanggil Jev.
Tidak boleh bercakap, tidak menulis kod, bahkan tidak boleh menghasilkan jawapan panjang seperti ChatGPT. Ia hanya melakukan satu perkara: membuat keputusan.
Namun, model yang kelihatan "kemampuannya dipotong separuh" ini tiba-tiba menjadi popular di kalangan pembangun.
Seseorang menggunakannya selama 40 saat untuk menganalisis 724 iklan secara langsung dan membuat sebanyak 8,724 keputusan; seseorang menghubungkannya dengan Claude Code untuk membersihkan konteks yang tidak berguna; dan ada pula yang menggunakannya sebagai "pengadil" untuk agen AI, memeriksa sama ada tugas benar-benar selesai. LangChain juga telah memulakan ujian terhadap prestasi Jev sebagai penilai agen.
Lebih teruk lagi adalah kelajuan dan harga.
Dalam ujian yang dianjurkan oleh TypeSafe, Jev mencapai peningkatan kelajuan sehingga 193.6 kali ganda dan pengurangan kos sehingga 444.6 kali ganda. Input setiap juta Token hanya memerlukan $0.042, sementara output Token bahkan percuma.
Mengapa AI yang kelihatan kurang cekap justru menjadi popular?
Kerana telah memasuki era Agen, yang mungkin diperlukan AI bukan sahaja "pertimbangan mendalam", tetapi juga penilaian yang besar, pantas, dan murah: apa yang perlu dilakukan seterusnya, alat mana yang perlu dipanggil, dan sama ada tugas tersebut telah selesai atau tidak. Lebih penting lagi, penilaian-penilaian ini pada masa depan perlu dilakukan oleh AI sendiri di latar belakang, tanpa perlu manusia terus duduk di hadapan skrin memantau. Yang dilihat Jev ialah keputusan-keputusan kecil ini yang boleh berlaku berjuta-juta kali setiap hari.
Yang lebih menarik, Diogo Almeida, pendiri model Jev, sebenarnya terlibat dalam RLHF, dan sekarang dia mulai merefleksikan RLHF: cara latihan yang membuat ChatGPT menjadi berguna ini mungkin tidak sesuai untuk AI benar-benar mencapai automasi.
Lebih daripada sebulan yang lalu, Almeida pernah memberi ucapan. Sekarang, jika dilihat semula, ucapan itu hampir seperti "panduan pemikiran" Jev.


AI sudah boleh lakukan matematik tinggi, mengapa masih tidak boleh lakukan perkhidmatan pelanggan dengan baik?
Latar belakang Diogo Almeida adalah unik.
Beliau pernah bekerja di OpenAI dan terlibat dalam kerja-kerja berkaitan GPT-4, ChatGPT, dan InstructGPT/RLHF. Dengan kata lain, beliau secara langsung terlibat dalam membina satu set paradigma pasca-pelatihan paling penting untuk model besar hari ini.
Namun dalam ucapan itu, dia langsung bercanda tentang dirinya sendiri, sebagai salah satu daripada sedikit orang di OpenAI yang secara terbuka mengkritik ChatGPT.
Tema ucapannya lebih langsung: What's Next After RLHF?
Diogo terlebih dahulu mengajukan satu soalan yang kelihatan bertentangan.
Model besar hari ini sudah mampu menyelesaikan soal matematik yang sangat sukar, dengan kod, penarikan kesimpulan, dan pelbagai benchmark terus meningkat.
Namun, dalam banyak proses perniagaan yang ingin diotomatisasi secara sebenar, manusia masih tetap diperlukan.
Contohnya, perkhidmatan pelanggan.
Mengizinkan AI untuk mencari maklumat, merumuskan dokumen, dan menyusun balasan, tiada masalah.
Tetapi jika membiarkan AI menentukan sendiri: Adakah wang ini perlu dipulangkan? Adakah pengguna ini perlu diganti rugi?
Perusahaan segera menjadi berhati-hati.
Walaupun perkara-perkara ini kelihatan jauh lebih mudah daripada matematik tinggi, mengapa malah takut untuk menyerahkannya kepada AI?
Jawapan Diogo sangat mudah: AI hari ini sangat hebat dalam membantu, bukan mengautomatikkan.
AI hari ini sangat baik dalam membantu anda bekerja, tetapi masih belum begitu mampu menyelesaikan tugasnya sendiri.
Kedua perkara ini kelihatan hanya berbeza sedikit, tetapi sebenarnya sangat berbeza.
Walaupun Claude Code lebih kuat, anda biasanya masih duduk di hadapan komputer. Ia menulis kod, anda lihat; ia mengubah fail, anda semak; jika salah, anda suruh ia ubah semula.
Jadi, menurut Diogo, Claude Code masih termasuk dalam "era bantuan" yang dibuka oleh ChatGPT.
Apa itu automasi sebenarnya?
Orang itu tidak ada di tempat.
AI menilai dan melaksanakan sendiri di latar belakang, mungkin berjalan puluhan ribu hingga ratusan ribu kali sehari, dan anda mungkin tidak pernah melihat apa yang ia lakukan.
Masalahnya muncul: mengapa AI hari ini begitu pintar, tetapi tetap tidak dapat lepas dari manusia?
Diogo menuding kepada sesuatu yang sangat dikenalinya—RLHF.

Ketika kami melatih AI, kami memasukkan manusia ke dalam kitaran.
Perkara ini agak ironik.
Kerana RLHF, yang merupakan salah satu jalan teknologi yang diusahakan oleh Diogo pada masa itu.
Logik asas RLHF sebenarnya tidak rumit: kumpulkan preferensi manusia, kemudian buat model semakin selaras dengan preferensi manusia.
Jadi, Diogo memberikan penjelasan yang sangat terus terang dalam ucapan beliau: mengapa model besar hari ini selalu memerlukan manusia dalam lingkaran?
Kerana semasa melatihnya, kami secara harfiah memasukkan manusia ke dalam gelung itu.
Model telah belajar sejak awal: jawapan macam apa yang lebih disukai manusia?
Ini juga menjelaskan satu ciri model besar yang sudah sangat kita kenal—walaupun tidak tahu, ia sering kali berbicara seolah-olah ia benar-benar tahu.
Diogo memberikan contoh yang sangat memalukan secara langsung.
Seseorang menghantar rakaman bunyik kepada ChatGPT, memberitahunya bahawa ia adalah muzik ciptaannya sendiri, dan meminta ia menilai dengan “tulus dan jujur”.
Hasilnya, ChatGPT memuji dengan serius, mengatakan bahawa ini adalah muzik persekitaran yang sangat mencekik dan aneh.
Diogo bahkan merangkum dengan satu pernyataan: “Overpromising is a feature.”
Janji berlebihan bukan bug, tetapi ciri.
Bagi produk perbualan, ini tidak mesti mematikan. Pengguna masih di hadapan skrin, kesilapan boleh diperbaiki.
Tetapi sistem automatik yang sebenar sangat berbeza.
Mesin tidak peduli sama ada jawapan anda enak didengar atau tidak, ia hanya perlu tahu dua perkara: apa yang perlu dilakukan, dan seberapa yakin anda?
Ini juga menjelaskan mengapa Jev yang dikeluarkan lebih daripada sebulan kemudian kelihatan begitu tidak biasa.

Jadi, Jev memutuskan untuk tidak membiarkan AI "berbicara" sama sekali
Model biasa walaupun akhirnya hanya perlu menjawab "A atau B", seringkali masih melalui proses penghasilan Token.
Jev terus memotong bahagian ini.
Ia kini terutamanya melakukan tiga perkara:
Yes
Pilihan, pilih satu daripada beberapa pilihan;
Skor, berikan penilaian mengikut piawai.
Kemudian kembalikan penilaian dan kebarangkalian.
Saya tidak akan menulis esei pendek untuk anda, dan tidak akan berbual dengan anda.
Latensi hujung-ke-hujung yang diumumkan secara rasmi adalah serendah 70–500 milisaat, 20–200 kali lebih pantas berbanding model terkini, dan 40–400 kali lebih murah.
Tetapi yang benar-benar penting, sebenarnya bukan “cepat”, tetapi probabilitas di belakangnya.
Untuk tujuan ini, TypeSafe mengusulkan satu kaedah latihan baru: RLCD, Reinforcement Learning for Calibrated Decisions, Pembelajaran Penguatan untuk Keputusan yang Disesuaikan.
Masalah yang ingin ia selesaikan sangat realistik: Jika AI memberitahu anda bahawa sesuatu mempunyai kemungkinan 80% berlaku, adakah 80% ini boleh dipercayai?
Secara ideal, perkara yang dimodelkan mempunyai kebarangkalian 80% seharusnya berlaku sebanyak kira-kira 80%.
Ini sangat penting dalam sistem automatik.
Dengan keyakinan 99%, boleh dilaksanakan terus.
Dengan keyakinan 51%, anda boleh serahkan kepada model yang lebih kuat dan lebih mahal, atau bahkan serahkan kepada manusia.
Masalah sebenar bukanlah AI tidak tahu, tetapi AI tidak tahu bahawa ia tidak tahu.
Jadi, apa yang Jev benar-benar ingin ubah ialah objek output AI.
Jawapan yang dihasilkan oleh ChatGPT sebelum ini terutamanya ditujukan untuk dibaca oleh manusia. Penilaian dan kebarangkalian yang diberikan oleh Jev pula disediakan untuk digunakan secara langsung oleh perisian.

Di era agen, mungkin tidak diperlukan otak yang lebih besar
Ini juga menjelaskan mengapa Jev tiba-tiba menjadi popular sekarang.
Kerana apabila Agent beroperasi sepenuhnya, ia akan menghasilkan sejumlah besar keputusan kecil:
Alat mana yang perlu dipanggil seterusnya? Butang mana yang perlu diklik di halaman web ini? Maklumat ini masih berguna atau tidak? Tugasan ini sudah selesai atau belum? Adakah hasilnya perlu diperiksa semula?
Masalah-masalah ini secara individu tidak sukar, tetapi seorang agen mungkin perlu membuat keputusan puluhan ribu hingga ratusan ribu kali dalam sehari.
Jika setiap kali meminta model besar terkuat, menghabiskan beberapa saat untuk "mempertimbangkan dengan mendalam", kemudian mengeluarkan sejumlah besar token, kos dan latensi akan meningkat dengan cepat.
Jev ingin merebut lapisan ini.
Serahkan keputusan kecil yang sering dan berjumlah besar kepada Jev, dan hanya serahkan tugas yang memerlukan penalaran kompleks kepada model besar.
Inilah sebabnya TypeSafe memanggil Jev sebagai System One Model.
Konsep ini berasal dari "Sistem 1" dan "Sistem 2" Daniel Kahneman: satu bertanggung jawab atas penilaian pantas dan intuitif, satu lagi bertanggung jawab atas pemikiran perlahan dan kompleks.
Jev juga mengambil namanya dari "Paradoks Jevons":
Sumber daya menjadi semakin murah, orang tidak semestinya menggunakannya kurang, malah mungkin menggunakannya lebih banyak.
Jika memanggil AI itu mahal, anda hanya akan menggunakannya di tempat yang paling penting.
Tetapi bagaimana jika AI menilai bahawa ia murah hampir boleh diabaikan?
Satu e-mel, satu log, satu panggilan alat, satu butang laman web, setiap langkah yang diambil oleh Agent, boleh menyertakan satu penilaian AI.
Tentu, masih terlalu awal untuk mengatakan bahawa Jev mewakili AI generasi seterusnya.
Yang disebutnya sebagai "nol halusinasi" lebih bermaksud tidak akan keluar dari jenis jawapan yang ditetapkan untuk membuat cerita, tetapi tidak bermaksud tidak akan memilih jawapan yang salah; data ekstrem seperti 193.6 kali dan 444.6 kali juga terutamanya berasal dari ujian sendiri TypeSafe.
Namun, yang mungkin lebih patut diperhatikan daripada sama ada Jev mampu menantang GPT atau Claude ialah kejayaan besar Jev kali ini.
tetapi seorang yang terlibat dalam menciptakan ChatGPT sedang mengajukan semula soalan yang lebih mendasar:
Dalam beberapa tahun terakhir, seluruh industri telah memikirkan cara membuat AI berfikir lebih lama dan berbicara lebih banyak.
Tetapi jika yang benar-benar diperlukan di masa depan adalah puluhan miliar penilaian antara mesin, mengapa AI setiap kali perlu terlebih dahulu "mengucapkan satu pernyataan"?
ChatGPT mengajar mesin bagaimana berkomunikasi dengan manusia.
Langkah seterusnya yang diambil oleh Jev ialah: apabila manusia tidak lagi duduk di hadapan skrin, adakah mesin mampu membuat keputusan sendiri?
