GPT-6 Astra dari OpenAI memimpin leaderboard Code Arena WebDev dengan 1.797 poin

iconCryptoBriefing
Bagikan
AI summary iconRingkasan
Berita on-chain menunjukkan bahwa GPT-6 Astra dari OpenAI memimpin leaderboard Code Arena WebDev dengan 1.797 poin, mengalahkan Claude Fable 5.1 dari Anthropic dengan selisih 35 poin. Model ini mencapai posisi pertama hanya dua hari setelah peluncurannya pada 3 September 2026. Code Arena menggunakan sistem Elo berbasis crowdsourcing untuk meranking model berdasarkan tugas frontend dunia nyata, dengan lebih dari 650.000 suara pada 126 model. Berita tentang real-world assets (RWA) terus menyoroti peran AI yang semakin besar dalam pengembangan.

GPT-6 Astra dari OpenAI telah merebut posisi teratas di leaderboard WebDev Code Arena dengan skor 1.797, menciptakan selisih 35 poin dari Claude Fable 5.1 milik Anthropic yang berada di posisi 1.762. Dua hari setelah peluncuran resminya pada 3 September 2026, model ini sudah mengubah urutan peringkat dalam pengembangan web yang dibantu AI.

Papan peringkat, yang dioperasikan oleh Arena.ai, bukanlah tolok ukur statis biasa. Sistem ini menggunakan peringkat gaya Elo yang bersumber dari komunitas, mekanisme peringkat yang sama yang digunakan dalam catur kompetitif, di mana anggota komunitas memberikan suara tentang seberapa baik model AI menangani tugas pemrograman frontend dunia nyata. Lebih dari 650.000 suara telah dicatat pada 126 model, menjadikan ini salah satu evaluasi komunitas paling kuat di bidang AI.

Iklan

Apa yang membuat benchmark ini berbeda

Benchmarks AI tradisional cenderung menguji model terhadap kumpulan data tetap dengan jawaban benar yang telah ditentukan sebelumnya. Code Arena mengambil pendekatan yang secara fundamental berbeda. Model dievaluasi berdasarkan penalaran multi-langkah, pemanfaatan alat, dan alur kerja pemrograman iteratif, pada dasarnya proses berantakan dan nonlinier yang melibatkan pengembangan web nyata.

Skor 1.797 GPT-6 Astra merupakan nilai tertinggi yang pernah diraih oleh model mana pun di leaderboard khusus ini. Claude Fable 5.1, pesaing terbaru dari Anthropic, sebelumnya bertahan di angka 1.762.

Lanskap kompetitif semakin ramai

OpenAI dan Anthropic bukan satu-satunya pemain yang bersaing untuk posisi. Snapshot awal dari peringkat September menunjukkan model dari pengembang Tiongkok yang menantang kedua perusahaan tersebut untuk peringkat teratas.

GPT-6 Astra (Max) dan Claude Fable 5.1 (Max) sama-sama dihargai identik, yaitu $10 per juta token masukan dan $50 per juta token keluaran. Keduanya menawarkan jendela konteks sebesar 1 juta token.

OpenAI telah menempatkan GPT-6 Astra sebagai model paling canggihnya untuk rekayasa perangkat lunak dan aplikasi terkait. Model ini saat ini tersedia bagi pelanggan ChatGPT dan mitra API serta cloud terpilih.

Penafian: Informasi pada halaman ini mungkin telah diperoleh dari pihak ketiga dan tidak mencerminkan pandangan atau opini KuCoin. Konten ini disediakan hanya untuk tujuan informasi umum, tanpa representasi atau jaminan apa pun, dan tidak dapat ditafsirkan sebagai saran keuangan atau investasi. KuCoin tidak bertanggung jawab terhadap segala kesalahan atau kelalaian, atau hasil apa pun yang keluar dari penggunaan informasi ini. Berinvestasi di aset digital dapat berisiko. Harap mengevaluasi risiko produk dan toleransi risiko Anda secara cermat berdasarkan situasi keuangan Anda sendiri. Untuk informasi lebih lanjut, silakan lihat Ketentuan Penggunaan dan Pengungkapan Risiko.