Kerajaan AS menguji model AI terbaru China melalui ujian peretasan. Ia mendapati bahawa Kimi K3 milik Moonshot AI jauh di bawah model Amerika terbaik.
Pusat Piawaian dan Inovasi AI (CAISI), sebuah agensi AS, menjalankan ujian bersama rakan British. Keputusan itu muncul hanya sehari selepas Washington menuduh Moonshot membina Kimi K3 dengan teknologi AS yang dicuri.
Kimi K3 Tidak Mencapai Ukuran Siber AS
Jabatan Perdagangan berkongsi keputusan pada hari Khamis. Ia menyatakan Kimi K3 berada jauh di bawah model AS teratas, merujuk kepada uji coba bersama pakar British.
Moonshot melancarkan Kimi K3 pada 16 Julai. Permintaan sangat tinggi sehingga perlu menangguhkan pendaftaran baru dalam tempoh dua hari.
Pelancaran itu juga mengejutkan saham cip AS dan menimbulkan keraguan baru mengenai kepimpinan Amerika dalam AI.
Satu ujian, dipanggil ExploitBench, menggunakan kelemahan peramban Chrome sebenar yang dibina oleh Universiti Carnegie Mellon. Kimi K3 mendapat 32%. Ini melebihi GLM-5.2 China pada 24%. Tetapi ia tertinggal di belakang model teratas AS, yang mencapai sekitar 76%.

Langkah paling sukar ialah mengambil kawalan penuh atas mesin sasaran. Kimi K3 gagal pada langkah ini pada semua 41 ujian. Model AS terbaik berjaya melakukannya pada 20.
Satu ujian lain, dipanggil The Last Ones, adalah serangan jaringan syarikat palsu dengan 32 langkah. Seorang pakar manusia memerlukan kira-kira 20 jam untuk menyelesaikannya. Kimi K3 mencapai langkah 17 secara purata. Model teratas AS mencapai langkah 28.5. Kimi K3 hanya menyelesaikan keseluruhan ujian ini sekali dalam 10 cubaan.
Sistem US terbaik dilaporkan melakukannya enam atau tujuh kali.
Tetapi jurang mungkin kelihatan lebih besar daripada yang sebenarnya
Tetapi nombor-nombor tersebut tidak menceritakan keseluruhan cerita. Cetakan halus laporan itu sendiri mengandungi beberapa perangkap.
Pertama, model AS diuji dengan penapis keselamatan mereka dimatikan. Tetapan ini menunjukkan kekuatan penuh mereka. Versi awam kekal dengan penapis itu dihidupkan. Oleh itu, skor AS adalah kes terbaik, bukan kehidupan sebenar.
Pasukan juga menghentikan kerja itu awal dan terhad. Ia hanya menilai Kimi K3 pada satu ujian sahaja dan menjalankan sebahagian sahaja daripada keseluruhan set. Oleh itu, penilaianya tidak kukuh. Sesetengah ujian juga bersifat sulit, jadi pihak luar tidak dapat memeriksa kerja tersebut.
Terdapat juga ketidaksesuaian asas. Kimi K3 adalah model terbuka yang boleh dimuat turun oleh sesiapa sahaja. Model AS adalah sistem tertutup dan peribadi. Institusi UK menemui bahawa model terbuka biasanya tertinggal empat hingga tujuh bulan di belakang model tertutup terbaik. Ia akan memberikan ujian penuh kepada Kimi K3 hanya selepas Moonshot melepaskannya kepada awam.
Ujian-ujian ini bukan serangan sebenar juga. Rangkaian palsu itu tidak mempunyai pertahanan manusia dan tidak ada alarm yang boleh dipicu. Walaupun begitu, Kimi K3 mengalahkan model terbuka teratas terakhir. Dan ia memang menyelesaikan serangan penuh sekali.
Masa dan sumber juga menimbulkan soalan. CAISI dahulu merupakan Institut Keselamatan AI AS. Pentadbiran Trump menamakan semula ia pada Jun 2025. Ia berada di dalam jabatan yang sama yang membataskan jualan cip AS ke China. Dan laporannya mengenai pesaing China datang hanya sehari selepas tuntutan pencurian.
Perlindungan Lemah Masih Meningkatkan Taruhan
Namun, skor rendah tidak bermakna Kimi K3 selamat. Ujian mendapati bahawa palang keselamatannya tidak menghalangnya daripada cuba membina serangan atau menyerang sistem.
Itu penting kerana apa yang akan datang seterusnya. Moonshot merancang untuk melancarkan model penuh pada 27 Julai. Sekali dilancarkan, ia tidak boleh ditarik balik. Sesiapapun boleh memuat turunnya dan menghapuskan penapis keselamatan.
Ujian itu juga berlaku selepas tuntutan pencurian. Washington mengatakan Moonshot membina Kimi K3 pada teknologi AI AS yang dicuri. Ketua teknologi White House, Michael Kratsios, mengatakan syarikat itu secara rahsia meniru Claude Fable 5 milik Anthropic. Trik itu, dipanggil distilasi, melatih model baru berdasarkan jawapan model yang lebih kuat.
Anthropic menyokong dakwaan itu. Pada Februari, ia menelusuri lebih daripada 3.4 juta perbualan Claude kepada Moonshot melalui ratusan akaun palsu. Ia memperingatkan bahawa model yang disalin kehilangan kawalan keselamatan asalnya. Itulah kelemahan yang sama yang baru ditemui oleh ujian ini.
Amerika Syarikat masih menghabiskan 23 kali lebih banyak untuk AI berbanding China. Namun, makmal China terus mengekang jurang tersebut. Ujian sebenar akan datang apabila Kimi K3 ditawarkan kepada awam dan pakar luar boleh menyemak tuntutan tersebut sendiri.
