Uji Coba Siber AS Menunjukkan Kimi K3 Ketinggalan dari Model AI Amerika Teratas

iconBeInCrypto
Bagikan
AI summary iconRingkasan
Sebuah penilaian pemerintah AS menunjukkan bahwa Kimi K3, yang dikembangkan oleh Moonshot AI, tertinggal dibandingkan model AI AS teratas dalam kemampuan siber. Uji coba oleh Center for AI Standards and Innovation (CAISI) bersama mitra Inggris menunjukkan Kimi K3 mendapat skor 32% pada tes ExploitBench, dibandingkan 76% untuk model AS terkemuka. Kimi K3 gagal mengendalikan mesin target secara penuh dalam semua 41 tes, sementara model AS terbaik berhasil dalam 20 kasus. Temuan ini muncul setelah pejabat AS menuduh Moonshot menggunakan teknologi AS yang dicuri untuk Kimi K3. Hasil ini dapat berdampak pada upaya CFT dan selaras dengan fokus MiCA pada transparansi teknologi.

Pemerintah AS menguji model AI terbaru Tiongkok dengan uji coba peretasan. Hasilnya menunjukkan bahwa Kimi K3 dari Moonshot AI jauh di bawah model-model Amerika terbaik.

Pusat Standar dan Inovasi AI (CAISI), sebuah agensi AS, menjalankan pengujian dengan mitra Inggris. Hasilnya muncul hanya satu hari setelah Washington menuduh Moonshot membangun Kimi K3 dengan teknologi AS yang dicuri.

Disponsori
Disponsori

Kimi K3 Tidak Memenuhi Standar Siber AS

Departemen Perdagangan membagikan hasilnya pada hari Kamis. Departemen tersebut menyatakan bahwa Kimi K3 berada jauh di bawah model-model AS teratas, dengan mengutip tes bersama dengan para ahli Inggris.

Moonshot meluncurkan Kimi K3 pada 16 Juli. Permintaan sangat tinggi sehingga harus menangguhkan pendaftaran baru dalam dua hari.

Peluncuran itu juga memengaruhi saham chip AS dan menimbulkan keraguan baru tentang kepemimpinan Amerika dalam AI.

Satu tes, bernama ExploitBench, menggunakan kerentanan browser Chrome nyata yang dibuat oleh Carnegie Mellon University. Kimi K3 mendapat skor 32%. Angka ini mengungguli GLM-5.2 dari Tiongkok yang berada di 24%. Namun, ia tertinggal dari model-model teratas AS yang mencapai sekitar 76%.

Kemampuan Pengembangan Eksploit
Uji pada Metrik Kemampuan Pengembangan Eksploit. Sumber: NIST
Disponsori
Disponsori

Langkah paling sulit adalah mengambil kendali penuh atas mesin target. Kimi K3 gagal pada langkah ini di semua 41 tes. Model AS terbaik berhasil melakukannya pada 20 tes.

Satu tes lain, bernama The Last Ones, adalah serangan jaringan perusahaan palsu dengan 32 langkah. Seorang ahli manusia membutuhkan sekitar 20 jam untuk menyelesaikannya. Kimi K3 rata-rata mencapai langkah 17. Model teratas AS mencapai langkah 28,5. Kimi K3 hanya menyelesaikan seluruhnya sekali dalam 10 percobaan.

Sistem AS terbaik dilaporkan melakukannya enam atau tujuh kali.

Tetapi Celahnya Mungkin Terlihat Lebih Besar dari yang Sebenarnya

Tetapi angka-angka tersebut tidak menceritakan seluruh cerita. Catatan kecil dalam laporan tersebut mengandung beberapa syarat terselubung.

Pertama, model-model AS diuji dengan filter keamanan mereka dimatikan. Pengaturan ini menunjukkan kekuatan penuh mereka. Versi publik tetap mengaktifkan filter tersebut. Jadi, skor AS adalah kasus terbaik, bukan kondisi nyata.

Tim juga mengakhiri pekerjaan itu lebih awal dan terbatas. Hasilnya hanya mencapai Kimi K3 pada satu tes dan menjalankan hanya sebagian dari seluruh rangkaian tes. Jadi peringkatnya tidak stabil. Beberapa tes juga bersifat pribadi, sehingga pihak luar tidak dapat memeriksa pekerjaan tersebut.

Ada juga ketidaksesuaian dasar. Kimi K3 adalah model terbuka yang dapat diunduh oleh siapa saja. Model-model AS adalah sistem tertutup dan pribadi. Lembaga Inggris menemukan bahwa model terbuka biasanya tertinggal empat hingga tujuh bulan dari model tertutup terbaik. Akan memberikan uji coba penuh kepada Kimi K3 hanya setelah Moonshot merilisnya ke publik.

Uji coba ini juga bukan serangan nyata. Jaringan palsu tidak memiliki penjaga manusia dan tidak ada alarm yang bisa dipicu. Meski demikian, Kimi K3 mengalahkan model terbuka teratas terakhir. Dan ia berhasil menyelesaikan serangan penuh sekali.

Waktu dan sumbernya juga menimbulkan pertanyaan. CAISI dulu adalah Institut Keselamatan AI AS. Pemerintahan Trump menamai ulangnya pada Juni 2025. Lembaga ini berada di departemen yang sama yang membatasi penjualan chip AS ke Tiongkok. Dan laporannya tentang pesaing Tiongkok datang hanya sehari setelah klaim pencurian.

Perlindungan Lemah Masih Meningkatkan Taruhan

Namun, skor rendah tidak berarti Kimi K3 aman. Uji coba menemukan bahwa pengamanannya tidak mencegahnya mencoba membangun serangan atau menyerang sistem.

Itu penting karena apa yang akan datang berikutnya. Moonshot berencana merilis model lengkap pada 27 Juli. Setelah dirilis, model tersebut tidak dapat ditarik kembali. Siapa pun dapat mengunduhnya dan menghapus filter keamanan.

Tes ini juga datang setelah klaim pencurian. Washington mengatakan Moonshot membangun Kimi K3 berdasarkan teknologi AI AS yang dicuri. Kepala teknologi Gedung Putih Michael Kratsios mengatakan perusahaan tersebut secara diam-diam menyalin Claude Fable 5 dari Anthropic. Triknya, yang disebut distilasi, melatih model baru berdasarkan jawaban dari model yang lebih kuat.

Anthropic mendukung klaim tersebut. Pada Februari, ia melacak lebih dari 3,4 juta obrolan Claude ke Moonshot melalui ratusan akun palsu. Ia memperingatkan bahwa model yang disalin kehilangan kontrol keamanan dari yang asli. Itu adalah kelemahan yang sama yang baru ditemukan oleh tes ini.

AS masih menghabiskan 23 kali lebih banyak untuk AI dibandingkan Tiongkok. Namun, laboratorium Tiongkok terus menutup kesenjangan tersebut. Ujian sebenarnya datang ketika Kimi K3 go public dan para ahli luar dapat memeriksa klaim tersebut secara mandiri.

Penafian: Informasi pada halaman ini mungkin telah diperoleh dari pihak ketiga dan tidak mencerminkan pandangan atau opini KuCoin. Konten ini disediakan hanya untuk tujuan informasi umum, tanpa representasi atau jaminan apa pun, dan tidak dapat ditafsirkan sebagai saran keuangan atau investasi. KuCoin tidak bertanggung jawab terhadap segala kesalahan atau kelalaian, atau hasil apa pun yang keluar dari penggunaan informasi ini. Berinvestasi di aset digital dapat berisiko. Harap mengevaluasi risiko produk dan toleransi risiko Anda secara cermat berdasarkan situasi keuangan Anda sendiri. Untuk informasi lebih lanjut, silakan lihat Ketentuan Penggunaan dan Pengungkapan Risiko.