Untuk sekejap, momen yang indah pada Januari 2025, model AI terbuka mengejar ketinggalan dari pesaing sumber tertutup mereka. Kesenjangan peringkat Elo di papan pemimpin yang disumbangkan komuniti Arena mencapai sifar. Kesetaraan.
Masa itu telah berlalu. Sehingga September 2026, jurang antara model frontier tertutup terbaik dan pesaing teratas berbobot terbuka telah melebar kepada 29 mata Elo, menurut data penilaian Arena AI. Claude Opus 5 Max berada pada peringkat 1505, manakala Kimi K3 Max daripada Moonshot AI, pencabar berbobot terbuka terkuat, tertinggal hampir 30 mata. Peter Gostev, Ketua Kemampuan AI Arena, berada di pusat pemantauan dan visualisasi perbezaan ini.
Apakah maksud nombor-nombor tersebut
Trajektori ini menceritakan kisah yang lebih menarik daripada sebarang gambar tunggal. Dari sifar pada Januari 2025 kepada 29 poin pada September 2026, garis tren bergerak ke arah yang salah bagi penyokong berat terbuka. Analisis Epoch AI memperkuat gambaran ini dari sudut yang berbeza: model berat terbuka kini tertinggal sebanyak kira-kira empat bulan berbanding model tertutup dalam prestasi pada tugas-tugas paling mencabar. Itu meningkat daripada tertinggal tiga bulan yang diperhatikan sehingga akhir 2025.
Arena memproses lebih daripada 10 juta penilaian setiap bulan, menggunakan sekumpulan besar interaksi pengguna sebenar bukan penilaian sintetik. Apabila jutaan pengguna anonim secara konsisten lebih menyukai output satu model berbanding yang lain, isyarat ini sukar untuk diabaikan.
Perniagaan mengukur AI
Arena sendiri telah menjadi kisah perniagaan yang menarik. Apa yang bermula sebagai projek penyelidikan UC Berkeley pada 2023 telah berubah menjadi perusahaan yang menghasilkan pendapatan tahunan sebanyak $100 juta. Ia mencapai kadar pendapatan tersebut hanya dalam lapan bulan selepas melancarkan perkhidmatan penilaian berbayar.
Kontribusi khusus Gostev berpusat pada menjadikan kelemahan model lebih jelas. Karyanya menonjolkan ketegangan antara bagaimana model berkinerja apabila dievaluasi oleh pakar domain berbanding pengguna umum, suatu perbezaan yang sangat penting untuk pelaksanaan perusahaan.
Geopolitik model terbuka
Pembangunan model terbuka yang paling aktif telah berpindah secara besar-besaran kepada makmal Cina. Siri Kimi daripada Moonshot AI, GLM daripada Zhipu, DeepSeek, dan Qwen daripada Alibaba mewakili sempadan apa yang tersedia secara awam. Namun, jurang tersebut masih ada. Anthropic, OpenAI, dan Google DeepMind terus mendorong model tertutup mereka lebih jauh dan lebih pantas.
