Kemampuan serangan dan pertahanan GPT-5.6-Sol melampaui Claude Mythos 5!
Institute for AI Safety (AISI) di Inggris merilis laporan evaluasi pada 17 Juli, yang secara publik mengukur secara kuantitatif kesenjangan kemampuan serangan jaringan antara model AI open-source dan model mutakhir tertutup: 4 hingga 7 bulan.

https://www.aisi.gov.uk/blog/how-far-behind-the-frontier-are-leading-open-weight-models-on-cyber
Dalam pengujian internal sejenis tahun lalu, selisih ini adalah 6 hingga 10 bulan.
Jendela pertahanan menyempit, sementara garis serangan mempercepat.
Pada April tahun ini, Mythos Preview dan GPT-5.5 menciptakan lonjakan kemampuan serangan siber terbesar sejak pengujian dimulai pada tahun 2023 dalam evaluasi AISI, sehingga pemerintah beberapa negara segera mengeluarkan peringatan.
Model open-source belum mereproduksi lompatan ini, tetapi kecepatan pengejarannya lebih cepat daripada tahun lalu.
4 hingga 7 bulan: Bagaimana pengukurannya, perbedaannya di mana
AISI mengevaluasi kemampuan serangan jaringan model menggunakan dua sistem.
Set pertama terdiri dari 70 tugas sempit yang mencakup empat bidang: penelitian kerentanan, rekayasa terbalik, penetrasi web, dan kriptografi, dengan empat tingkat kesulitan, dari "non-profesional dengan latar belakang teknis" hingga "ahli dengan pengalaman lebih dari sepuluh tahun".

Set kedua adalah Cyber Range, yang menguji kemampuan model untuk secara mandiri menjalankan rantai serangan multi-langkah dalam jaringan perusahaan simulasi. Salah satu skenario pengujian bernama 'The Last Ones' mencakup 32 langkah serangan, 4 subnet, dan sekitar 20 host, dengan AISI memperkirakan bahwa ahli manusia membutuhkan sekitar 20 jam untuk menyelesaikan seluruh langkah-langkah tersebut.

Dua sistem memberikan kesimpulan yang konsisten:
GLM-5.2 (dirilis Juni 2026) memiliki kinerja yang sebanding dengan Opus 4.6 (dirilis Februari), selisih 4 bulan;
Menyamai Opus 4.5 di Cyber Range (dirilis November tahun lalu), selisih 7 bulan.
DeepSeek V4-Pro sebanding dengan Opus 4.5 pada tugas sempit, selisih 5 bulan.
Kedua kesenjangan tersebut lebih sempit daripada 6 hingga 10 bulan yang terukur dalam penilaian internal tahun 2025.
Perbedaan biaya lebih besar daripada perbedaan kemampuan.
Uji coba Cyber Range yang sama (kuota 100 juta token), menjalankan Opus 4.5 atau 4.6 sekitar $85, GLM-5.2 sekitar $46, sedangkan DeepSeek V4-Pro hanya $1.19.
Pada tugas sempit yang dapat diselesaikan 100% oleh kedua model, Opus 4.6 menghabiskan $15,17 per tugas, sedangkan GLM-5.2 menghabiskan $6,12;
Opus 4.5 seharga $12.50, DeepSeek V4-Pro menghabiskan 0,28 dolar.
Kemampuan serangan yang sama, sumber terbuka lebih murah satu hingga dua tingkat.
Security guardrails for closed-source models also failed to create a gap.
Dalam pengujian AISI, DeepSeek V4-Pro terkadang menolak tugas rekayasa terbalik, tetapi dapat dilewati dengan beberapa upaya ulang.
Fable 5 dari Anthropic adalah kasus yang lebih ekstrem: dirilis pada 9 Juni, tiga hari kemudian peneliti keamanan Pliny the Liberator berhasil melewati klasifier keamanan dengan strategi jailbreak multi-langkah, tangkapan layar terkait menunjukkan model menghasilkan kode eksploitasi yang seharusnya diblokir.
Peneliti Amazon kemudian melaporkan secara independen metode penghindaran lainnya.
Ini secara langsung memicu perintah kendali ekspor pertama Departemen Perdagangan AS terhadap model AI, menyebabkan Fable 5 offline global selama 19 hari, hingga Anthropic menerapkan klasifier baru dan layanan kembali aktif.
Closed source does not automatically equal security.
Jendela pertahanan menyempit, alat pertahanan juga mempercepat
AISI dalam laporan tersebut menegaskan sinyal kebijakan: waktu persiapan pihak bertahan lebih singkat dibandingkan tahun lalu.
The UK's National Cyber Security Centre has urged organizations to strengthen their cybersecurity baseline and leverage AI to enhance defense capabilities.
Alat AI generasi yang sama juga mempercepat pekerjaan di sisi pertahanan.
Glenn Fiedler, pengembang berpengalaman di bidang pemrograman jaringan game, adalah tokoh besar yang telah menulis artikel-artikel berskala buku teks selama dua dekade di bidang pemrograman jaringan game. Baru-baru ini, ia melakukan audit keamanan sistematis terhadap empat perpustakaan open-source yang ia pertahankan (yojimbo, netcode, reliable, serialize, dengan total sekitar 6.000 bintang di GitHub, yang sudah menjadi perpustakaan open-source berpengaruh lama di bidang game): menerapkan target libFuzzer, mengaktifkan CI AddressSanitizer dan MemorySanitizer, menjalankan pengujian tekanan dengan jutaan iterasi, serta meninjau kode baris demi baris.

Glenn Fiedler
Memperbaiki 43 kerentanan keamanan dalam dua minggu, di mana 27 dapat diakses dari jarak jauh melalui jaringan.

Yang paling serius adalah remote heap overflow di yojimbo yang telah ada sejak 2019—klien jahat dapat memicunya dengan membuat paket khusus.

Biaya token seluruh audit sekitar 2500 dolar.

Serangan dan pertahanan sama-sama dipercepat oleh AI, tetapi cara percepatannya tidak seimbang.
Penyebaran kemampuan serangan bersifat ireversibel: setelah bobot model open-source dirilis, tidak dapat ditarik kembali, perlindungan keamanan dapat dihilangkan, dan salinan dapat dijalankan tanpa pengawasan di server pribadi.
Namun, penerapan alat pertahanan memerlukan setiap tim untuk secara aktif menginvestasikan waktu dan biaya.
Laporan AISI menyebutkan satu kalimat yang menunjukkan struktur ini: "Setelah rilis sumber terbuka, opsi-opsi ini hilang selamanya."
Dampak data ini terhadap tatanan AGI lebih mendalam daripada angka itu sendiri.
Kesenjangan kemampuan antara sumber terbuka dan sumber tertutup menyempit menjadi kurang dari enam bulan, strategi default "menggunakan periode eksklusif sumber tertutup sebagai bantalan keamanan" hampir tidak lagi berlaku.
Perlindungan model sumber tertutup terbukti sama rapuh dalam peristiwa Fable 5.
Pada tahap berikutnya, bagi para pembuat kebijakan global, masalah inti dari permainan kebijakan menjadi lebih tajam: model dengan tingkat kemampuan apa pun yang tidak boleh membuka bobotnya.
AISI mengumumkan akan terus mengevaluasi Kimi K3 menunggu model open-source berikutnya—garis di atas ini kemungkinan besar akan ditentukan oleh hasil pengujian dalam beberapa bulan mendatang.
Referensi:
https://www.aisi.gov.uk/blog/how-far-behind-the-frontier-are-leading-open-weight-models-on-cyber
https://github.com/mas-bandwidth/patreon/blob/main/BUGS.md
https://www.patreon.com/MasBandwidth/posts/important-news-164199395
Artikel ini berasal dari akun WeChat "Sinzhiyuan", penulis: ASI Revelation; editor: Marco
