Penulis: Zhu Xueying
Dua hari ini, sebuah model AI yang agak tidak biasa tiba-tiba menjadi viral.
Namanya Jev.
Tidak bisa mengobrol, tidak menulis kode, bahkan tidak bisa menghasilkan jawaban panjang seperti ChatGPT. Ia hanya melakukan satu hal: membuat keputusan.
Namun, model yang tampaknya "kemampuannya dipotong separuh" ini tiba-tiba menjadi populer di kalangan pengembang.
Seseorang menggunakannya untuk menganalisis 724 iklan real-time dalam 40 detik, membuat total 8.724 penilaian; seseorang menghubungkannya ke Claude Code untuk membersihkan konteks yang tidak berguna; dan ada yang menggunakannya sebagai "wasit" untuk AI Agent, memeriksa apakah tugas benar-benar telah selesai. LangChain juga telah mulai menguji kinerja Jev sebagai evaluator Agent.
Lebih ekstrem lagi adalah kecepatan dan harga.
Dalam pengujian yang diumumkan oleh TypeSafe, Jev mencapai peningkatan kecepatan maksimal sekitar 193,6 kali, dengan biaya yang dapat berkurang hingga 444,6 kali. Input setiap juta Token hanya memerlukan biaya 0,042 dolar AS, sementara output Token bahkan gratis.
Mengapa AI yang tampaknya memiliki kemampuan lebih sedikit justru menjadi populer?
Karena telah memasuki era Agent, yang mungkin dibutuhkan AI sebenarnya bukan hanya "pertimbangan mendalam", tetapi juga penilaian dalam jumlah besar, cepat, dan murah: langkah selanjutnya apa, alat mana yang harus dipanggil, dan apakah tugas benar-benar selesai. Lebih penting lagi, penilaian-penilaian ini di masa depan perlu dilakukan AI sendiri di latar belakang, tanpa perlu manusia terus-menerus duduk di depan layar. Yang dilihat Jev adalah keputusan-keputusan kecil ini yang bisa terjadi jutaan kali setiap hari.
Yang lebih menarik lagi, pendiri model Jev, Diogo Almeida, justru pernah terlibat dalam RLHF, dan sekarang ia mulai merefleksikan RLHF: metode pelatihan yang membuat ChatGPT menjadi berguna ini mungkin tidak cocok untuk AI menuju otomatisasi sejati.
Lebih dari sebulan yang lalu, Almeida pernah memberikan sebuah pidato. Sekarang, jika dilihat kembali, pidato itu hampir seperti "petunjuk pemikiran" Jev.


AI sudah bisa mengerjakan matematika tingkat tinggi, mengapa masih belum bisa menjadi layanan pelanggan dengan baik?
Latar belakang Diogo Almeida sangat istimewa.
Dia pernah bekerja di OpenAI dan berpartisipasi dalam pekerjaan terkait GPT-4, ChatGPT, serta InstructGPT/RLHF. Artinya, dia secara langsung terlibat dalam membangun satu set paradigma pelatihan lanjutan paling penting untuk model besar saat ini.
Namun dalam pidato itu, ia langsung bercanda tentang dirinya sendiri, menjadi salah satu dari sedikit orang di OpenAI yang secara terbuka mengkritik ChatGPT.
Topik pembicaraannya lebih langsung: What's Next After RLHF?
Diogo terlebih dahulu mengajukan pertanyaan yang tampaknya kontradiktif.
Model besar hari ini sudah dapat menantang soal matematika yang sangat sulit, kode, penalaran, dan berbagai benchmark terus meningkat.
Namun, dalam banyak bisnis perusahaan yang benar-benar ingin otomatisasi, manusia tetap tidak bisa dihilangkan.
Misalnya layanan pelanggan.
Mengizinkan AI untuk mencari informasi, merangkum dokumen, dan menyusun balasan, tidak masalah.
Tetapi jika membiarkan AI yang memutuskan: uang ini apakah akan dikembalikan atau tidak? Apakah pengguna ini harus memberikan ganti rugi?
Perusahaan langsung menjadi lebih berhati-hati.
Meskipun hal-hal ini tampak jauh lebih sederhana daripada matematika tingkat tinggi, mengapa justru takut menyerahkannya ke AI?
Jawaban Diogo sangat sederhana: AI hari ini luar biasa dalam membantu, bukan otomatisasi.
Hari ini, AI sangat baik dalam membantu Anda bekerja, tetapi belum terlalu mampu menyelesaikan pekerjaan sendiri.
Kedua hal ini tampak hanya sedikit berbeda, tetapi sebenarnya sangat berbeda.
Claude Code sekuat apa pun, Anda biasanya tetap duduk di depan komputer. Ia menulis kode, Anda lihat; ia mengubah file, Anda periksa; jika salah, Anda minta ia ubah lagi.
Jadi, menurut Diogo, Claude Code tetap termasuk dalam "era bantuan" yang dimulai oleh ChatGPT.
Apa itu otomatisasi sejati?
Orang itu sama sekali tidak hadir.
AI secara otomatis menilai dan menjalankan sendiri di latar belakang, mungkin berjalan puluhan ribu bahkan ratusan ribu kali sehari, dan Anda bahkan mungkin tidak pernah melihat apa yang telah dilakukannya.
Masalahnya muncul: mengapa AI hari ini sangat cerdas, tetapi justru tak bisa lepas dari manusia?
Diogo menunjukkan jari ke sesuatu yang sangat ia kenal—RLHF.

Ketika kami melatih AI, kami memasukkan manusia ke dalam siklusnya.
Ini agak ironis.
Karena RLHF, justru merupakan salah satu jalur teknologi yang ikut didorong oleh Diogo pada masa itu.
Logika dasar RLHF sebenarnya tidak rumit: kumpulkan preferensi manusia, lalu buat model semakin sesuai dengan preferensi manusia.
Jadi Diogo memberikan penjelasan yang sangat jelas dalam pidatonya: mengapa model besar hari ini selalu memerlukan manusia di dalam loop?
Karena saat melatihnya, kami secara harfiah memasukkan manusia ke dalam siklus tersebut.
Model belajar sejak awal: jawaban seperti apa yang lebih disukai manusia?
Ini juga menjelaskan salah satu ciri model besar yang sudah sangat kita kenal—meskipun tidak tahu, ia sering bisa berbicara seolah-olah benar-benar tahu.
Diogo memberikan contoh yang sangat menggurau di lokasi.
Seseorang mengirimkan rekaman kentut ke ChatGPT, mengatakan bahwa itu adalah musik ciptaannya, dan meminta agar ChatGPT mengevaluasinya dengan “tulus dan jujur”.
Hasilnya, ChatGPT memuji dengan serius, mengatakan bahwa ini adalah musik lingkungan yang sangat bernuansa gelap dan aneh.
Diogo bahkan merangkumnya dalam satu kalimat: “Overpromising is a feature.”
Overpromising is not a bug, it's a feature.
Untuk produk chat, ini belum tentu mematikan. Pengguna masih di depan layar, kesalahan bisa diperbaiki.
Tetapi sistem otomatis yang sebenarnya sama sekali berbeda.
Mesin tidak peduli apakah jawabanmu enak didengar, ia hanya perlu tahu dua hal: apa yang harus dilakukan, dan seberapa besar keyakinanmu?
Ini juga menjelaskan mengapa Jev yang dirilis lebih dari sebulan kemudian tampak sangat tidak biasa.

Jadi, Jev memutuskan untuk tidak membiarkan AI "berbicara" sama sekali
Model besar biasa bahkan jika akhirnya hanya perlu menjawab "A atau B", seringkali tetap harus melalui proses generasi Token.
Jev langsung menghapus bagian ini.
Saat ini ia terutama melakukan tiga hal:
Noul, jawab Ya atau Tidak;
Pilihan, pilih satu dari beberapa opsi;
Score, penilaian sesuai standar.
Kemudian kembalikan hasil penilaian dan probabilitasnya.
Saya tidak akan menulis esai panjang untukmu, dan tidak akan mengobrol dengannya.
Latensi end-to-end yang diumumkan resmi mencapai 70–500 milidetik, 20–200 kali lebih cepat daripada model terdepan, dan 40–400 kali lebih murah.
Tetapi yang benar-benar krusial sebenarnya bukan "cepat", melainkan probabilitas di belakangnya.
Untuk ini, TypeSafe mengusulkan metode pelatihan baru: RLCD, Reinforcement Learning for Calibrated Decisions, pembelajaran penguatan untuk keputusan yang dikalibrasi.
Masalah yang ingin dipecahkannya sangat nyata: Jika AI memberi tahu Anda bahwa ada probabilitas 80% suatu hal akan terjadi, apakah 80% itu benar-benar bisa dipercaya?
Secara ideal, sejumlah peristiwa yang dinilai model memiliki probabilitas 80% seharusnya benar-benar terjadi sekitar 80% dari waktu.
Ini sangat penting dalam sistem otomatis.
Dengan kepercayaan 99%, bisa langsung dieksekusi.
Dengan kepercayaan 51%, Anda bisa menyerahkannya ke model yang lebih kuat dan lebih mahal, bahkan menyerahkannya ke manusia.
Masalah sebenarnya bukanlah AI tidak tahu, tetapi AI tidak tahu bahwa ia tidak tahu.
Jadi, yang sebenarnya ingin diubah oleh Jev adalah objek output AI.
Jawaban yang dihasilkan ChatGPT sebelumnya terutama ditujukan untuk dibaca manusia. Penilaian dan probabilitas yang diberikan Jev, sebaliknya, disiapkan untuk langsung digunakan oleh perangkat lunak.

Di era agen, mungkin yang dibutuhkan bukanlah otak yang lebih besar
Ini juga menjelaskan mengapa Jev tiba-tiba menjadi populer sekarang.
Karena setelah Agent benar-benar berjalan, ia akan menghasilkan sejumlah besar keputusan kecil:
Langkah selanjutnya memanggil alat mana? Tombol mana yang harus diklik di halaman web ini? Informasi ini masih berguna atau tidak? Tugasnya sudah selesai atau belum? Hasilnya perlu diperiksa ulang atau tidak?
Masalah-masalah ini secara individu tidak sulit, tetapi seorang agen mungkin perlu menilanya puluhan ribu hingga ratusan ribu kali dalam sehari.
Jika setiap kali meminta model terbesar untuk berpikir dalam beberapa detik dan menghasilkan sejumlah besar token, biaya dan latensi akan segera meningkat.
Yang ingin diambil oleh Jev adalah lapisan ini.
Serangkaian keputusan kecil dan frekuensi tinggi serahkan ke Jev, sedangkan tugas yang benar-benar memerlukan penalaran kompleks serahkan ke model besar.
Ini juga sebabnya TypeSafe menyebut Jev sebagai System One Model.
Konsep ini berasal dari "Sistem 1" dan "Sistem 2" Daniel Kahneman: satu bertanggung jawab atas penilaian cepat dan intuitif, satu lagi bertanggung jawab atas pemikiran lambat dan kompleks.
Jev bahkan namanya berasal dari "paradoks Jevons":
Saat sebuah sumber daya menjadi semakin murah, orang tidak necessarily akan menggunakannya lebih sedikit, malah mungkin justru menggunakannya lebih banyak.
Jika memanggil AI mahal, Anda hanya akan menggunakannya di tempat yang paling penting.
Namun, bagaimana jika AI menilai harganya begitu murah hingga hampir dapat diabaikan?
Satu email, satu log, satu panggilan alat, satu tombol halaman web, setiap langkah yang diambil oleh Agent, dapat menyertakan satu penilaian AI.
Of course, it's still too early to say Jev represents the next generation of AI.
Yang disebutnya "nol ilusi" lebih berarti tidak akan keluar dari jenis jawaban yang ditentukan dan membuat-buat, bukan berarti tidak akan salah memilih; data ekstrem seperti 193,6 kali dan 444,6 kali juga terutama berasal dari pengujian TypeSafe sendiri.
Namun, yang sebenarnya patut diperhatikan dari kepopuleran Jev kali ini mungkin bukan apakah ia bisa menantang GPT atau Claude.
Namun, seseorang yang terlibat dalam menciptakan ChatGPT sedang mengajukan kembali pertanyaan yang lebih mendasar:
Dalam beberapa tahun terakhir, seluruh industri telah memikirkan cara membuat AI berpikir lebih lama dan berbicara lebih banyak.
Tetapi jika di masa depan yang benar-benar dibutuhkan adalah miliaran kali penilaian antar mesin, mengapa AI harus selalu "mengucapkan sebuah kalimat" setiap kali?
ChatGPT mengajarkan mesin cara berbicara dengan manusia.
Langkah selanjutnya yang ditebak Jev adalah: ketika manusia tidak lagi duduk di depan layar, apakah mesin bisa membuat keputusan sendiri?
