Sebuah kelompok relawan bernama Bitcoin Red Team baru saja menjalankan salah satu audit keamanan otomatis paling ambisius yang pernah dilihat oleh ekosistem kripto. Senjata pilihan mereka: Kimi K3, model AI berbobot terbuka yang dibangun oleh Moonshot AI Tiongkok. Dalam waktu sekitar 108 jam, model tersebut mencatat 7.958 temuan keamanan potensial di 501 proyek open-source terkait bitcoin, dengan 1.280 di antaranya dinilai memiliki tingkat keparahan tinggi atau kritis.
Kimi K3 mengungguli semua model open-weight lain yang diuji, termasuk GLM-5.2 dari Zhipu, dalam benchmark deteksi kerentanan standar.
Apa yang sebenarnya ditemukan oleh audit
Dari 7.958 masalah potensial yang ditandai oleh Kimi K3, hanya 24,7% yang dapat direproduksi secara dinamis. Pada saat pelaporan, 29,4% temuan telah dikomunikasikan ke atas ke proyek-proyek yang terdampak.
Temuan paling berdampak adalah celah bypass otentikasi dua faktor pada BTCPay Server versi 2.4.2. Kerentanan ini sudah dieksploitasi untuk mengekstrak kredensial dompet Lightning sebelum diperbaiki, menjadikannya insiden keamanan nyata yang sedang terjadi, bukan sekadar kekhawatiran teoretis.
Bagaimana Kinerja Kimi K3
Institut Keamanan AI Inggris dan mitranya, CAISI, melakukan penilaian awal terhadap Kimi K3 pada Juli 2026, dengan skor 32% di ExploitBench. Ini adalah tolok ukur yang dirancang untuk mengukur kemampuan model AI dalam mengidentifikasi dan bernalar tentang kerentanan perangkat lunak yang dapat dieksploitasi. GLM-5.2 mendapat skor 24% pada tes yang sama.
Di antara model berbobot terbuka, yang bobotnya tersedia secara publik untuk diunduh dan dijalankan oleh siapa saja, Kimi K3 berada di puncak. Model ini dirilis sekitar 16–27 Juli 2026, dan Tim Merah memperkuat upaya auditnya dalam minggu-minggu berikutnya.
Kesenjangan antara model open-weight dan closed-source tetap signifikan. Model-model terkemuka AS dari OpenAI dan Anthropic rata-rata mencapai sekitar 76% di ExploitBench. Itu lebih dari dua kali lipat skor Kimi K3.
Insiden Coldcard yang memulai semuanya
Upaya Tim Merah dipicu oleh insiden keamanan pada Juli 2026 yang melibatkan Coldcard Mk3. Sebuah kelemahan pada firmware Mk3 menyebabkan pencurian sekitar 594 BTC, yang diperkirakan bernilai $38 juta pada saat itu. Insiden tersebut memicu spekulasi luas bahwa para penyerang telah menggunakan AI untuk mengidentifikasi kerentanan firmware, meskipun klaim tersebut belum terbukti secara pasti.
Apa artinya ini bagi keamanan bitcoin
Ekonomi audit kode akan segera berubah. Audit keamanan profesional untuk satu proyek Bitcoin dapat menghabiskan biaya puluhan ribu dolar dan memakan waktu berminggu-minggu. Kimi K3 memindai 501 proyek dalam 108 jam.
Perusahaan AI AS, yang membangun model paling canggih, umumnya membatasi penggunaan alat mereka untuk penelitian kerentanan, dengan alasan kekhawatiran keamanan. Sementara itu, model Cina berbobot terbuka sedang didistribusikan secara gratis untuk menemukan dan melaporkan bug pada infrastruktur keuangan kritis. Kesenjangan antara kinerja model berbobot terbuka dan tertutup di ExploitBench—32% versus 76%—menunjukkan bahwa deteksi kerentanan paling canggih masih berada di balik dinding bayar API.

