Untuk sejenak, momen indah di Januari 2025, model AI berbasis terbuka mengejar setara dengan pesaing sumber tertutupnya. Selisih peringkat Elo di papan peringkat terkumpul Arena mencapai nol. Kesetaraan.
Momen itu telah berlalu. Sejak September 2026, kesenjangan antara model frontier tertutup terbaik dan pesaing teratas berbobot terbuka telah melebar menjadi 29 poin Elo, menurut data evaluasi Arena AI. Claude Opus 5 Max berada di peringkat 1505, sementara Kimi K3 Max dari Moonshot AI, pesaing berbobot terbuka terkuat, tertinggal hampir 30 poin. Peter Gostev, Kepala Kemampuan AI Arena, berada di pusat pemantauan dan visualisasi perbedaan ini.
Apa arti sebenarnya dari angka-angka tersebut
Trajektori ini menceritakan kisah yang lebih menarik daripada satu gambaran tunggal. Dari nol pada Januari 2025 menjadi 29 poin pada September 2026, garis tren bergerak ke arah yang salah bagi para pendukung model berbobot terbuka. Analisis Epoch AI memperkuat gambaran ini dari sudut yang berbeda: model berbobot terbuka kini tertinggal sekitar empat bulan dari model tertutupnya dalam kinerja pada tugas-tugas paling menantang. Itu meningkat dari keterlambatan tiga bulan yang diamati hingga akhir 2025.
Arena memproses lebih dari 10 juta evaluasi setiap bulan, mengandalkan kumpulan besar interaksi pengguna nyata daripada benchmark sintetis. Ketika jutaan pengguna anonim secara konsisten lebih menyukai output satu model dibandingkan yang lain, sinyal ini lebih sulit diabaikan.
Bisnis mengukur AI
Arena sendiri telah menjadi kisah bisnis yang menarik. Yang awalnya merupakan proyek penelitian UC Berkeley pada tahun 2023 telah berubah menjadi perusahaan yang menghasilkan pendapatan tahunan sebesar $100 juta. Perusahaan ini mencapai tingkat pendapatan tersebut hanya dalam delapan bulan setelah meluncurkan layanan evaluasi berbayar.
Kontribusi spesifik Gostev berfokus pada membuat kelemahan model menjadi jelas. Karyanya menyoroti ketegangan antara kinerja model saat dievaluasi oleh para ahli bidang dibandingkan pengguna umum, sebuah perbedaan yang sangat penting untuk penerapan perusahaan.
Geopolitik model terbuka
Pengembangan model open-weight yang paling aktif telah berpindah secara signifikan ke laboratorium-laboratorium Tiongkok. Seri Kimi dari Moonshot AI, GLM dari Zhipu, DeepSeek, dan Qwen dari Alibaba mewakili batas terdepan dari apa yang tersedia secara publik. Namun, kesenjangan tetap ada. Anthropic, OpenAI, dan Google DeepMind terus mendorong model-model tertutup mereka lebih jauh dan lebih cepat.
