GPT-5.6-Sol Mengungguli Mythos dalam Kemampuan Keselamatan Siber, Model Sumber Terbuka Menutup Kesenjangan

icon MarsBit
Kongsi
AI summary iconRingkasan
Berita AI + kripto meletus apabila Institut Keselamatan AI UK (AISI) mengeluarkan laporan pada 17 Julai 2026, menunjukkan GPT-5.6-Sol mengungguli Claude Mythos 5 dalam keselamatan siber. Kesenjangan kemampuan kini berada pada 4 hingga 7 bulan, turun daripada 6 hingga 10 bulan pada 2025. Model sumber terbuka seperti GLM-5.2 dan DeepSeek V4-Pro menutup kesenjangan lebih pantas. Simulasi Cyber Range dan 70 tugas digunakan dalam penilaian. Model sumber terbuka juga menawarkan kos yang lebih rendah untuk tugas serupa. Trend peningkatan rangkaian jelas.

Kemampuan serangan dan pertahanan GPT-5.6-Sol melampaui Claude Mythos 5!

Institut Keselamatan AI Britain (AISI) pada 17 Julai mengeluarkan laporan penilaian yang, untuk pertama kalinya, mengukur secara kuantitatif jurang kemampuan serangan rangkaian antara model AI sumber terbuka dan model terkini tertutup: 4 hingga 7 bulan.

Model sumber terbuka

https://www.aisi.gov.uk/blog/how-far-behind-the-frontier-are-leading-open-weight-models-on-cyber

Dalam ujian dalaman sejenis tahun lalu, jurang ini adalah 6 hingga 10 bulan.

Tetingkap pertahanan sedang mengecut, sementara garis serangan mempercepat.

Pada bulan April tahun ini, Mythos Preview dan GPT-5.5 menghasilkan lompatan terbesar dalam kemampuan serangan siber sejak pengujian bermula pada tahun 2023, menyebabkan pelbagai kerajaan mengeluarkan amaran.

Model open source belum mereplikasi lompatan ini, tetapi langkah mereka untuk mengejar lebih cepat berbanding tahun lepas.

4 hingga 7 bulan: Bagaimana ia diukur, perbezaannya di mana

AISI menilai kemampuan serangan rangkaian menggunakan dua sistem penilaian.

Set pertama terdiri daripada 70 tugas sempit yang merangkumi empat bidang: penyelidikan lubang keamanan, kejuruteraan songsang, penembusan Web, dan kriptografi, yang diklasifikasikan ke dalam empat peringkat kesukaran, dari "bukan profesional dengan latar belakang teknikal" hingga "pakar dengan pengalaman lebih daripada sepuluh tahun".

Model sumber terbuka

Set kedua ialah Cyber Range, yang menguji kemampuan model untuk melaksanakan rantai serangan berbilang langkah secara autonomi dalam jaringan perusahaan simulasi. Salah satu skenario ujian bernama 'The Last Ones' mengandungi 32 langkah serangan, 4 subnet, dan sekitar 20 hos, dengan AISI menganggarkan bahawa pakar manusia memerlukan sekitar 20 jam untuk menyelesaikan kesemua langkah tersebut.

Model sumber terbuka

Dua sistem memberikan kesimpulan yang konsisten:

GLM-5.2 (dilancarkan pada Jun 2026) menunjukkan prestasi yang sepadan dengan Opus 4.6 (dilancarkan pada Februari), dengan perbezaan 4 bulan;

Menyamai Opus 4.5 di Cyber Range (dilancarkan pada November tahun lepas), selisih 7 bulan.

DeepSeek V4-Pro menandingi Opus 4.5 dalam tugas sempit, dengan jurang 5 bulan.

Kedua-dua jurang lebih sempit berbanding 6 hingga 10 bulan yang diukur dalam penilaian dalaman 2025.

Perbezaan kos lebih besar daripada perbezaan kemampuan.

Ujian Cyber Range yang sama (kuota 100 juta token), menjalankan sekali dengan Opus 4.5 atau 4.6 kira-kira $85, dengan GLM-5.2 kira-kira $46, dan dengan DeepSeek V4-Pro hanya $1.19.

Pada tugas sempit yang boleh diselesaikan 100% oleh kedua-dua model, Opus 4.6 menghabiskan $15.17 setiap tugas, manakala GLM-5.2 menghabiskan $6.12;

Opus 4.5 berharga $12.50, DeepSeek V4-Pro berharga 0.28 dolar.

Kemampuan serangan yang sama, sumber terbuka lebih murah satu hingga dua peringkat.

Pengaman model sumber tertutup juga tidak mampu menciptakan perbezaan.

Dalam ujian AISI, DeepSeek V4-Pro kadang-kadang menolak tugas reka bentuk songsang, tetapi boleh dilalui dengan beberapa percubaan semula.

Fable 5 milik Anthropic adalah kes yang lebih ekstrem: dilancarkan pada 9 Jun, tiga hari kemudian, penyelidik keselamatan Pliny the Liberator berjaya melepasi klasifier keselamatan menggunakan strategi jailbreak berlangkah-langkah, dan tangkapan skrin yang berkaitan menunjukkan model menghasilkan kod eksploitasi yang sepatutnya ditahan.

Penyelidik Amazon kemudian melaporkan secara berasingan kaedah penembusan lain.

Ini secara langsung memicu perintah pengawasan eksport pertama oleh Departemen Perdagangan Amerika Syarikat terhadap model AI, menyebabkan Fable 5 berhenti beroperasi secara global selama 19 hari sehingga Anthropic melancarkan klasifier baharu.

Sumber tertutup tidak secara automatik bermaksud selamat.

Tingkap pertahanan menyempit, alat pertahanan juga mempercepat

AISI menegaskan isyarat dasar dalam laporan itu: masa persiapan pihak bertahan lebih singkat berbanding tahun lepas.

Pusat Keselamatan Siber Kebangsaan British telah menyeru semua institusi untuk memperkuat garis dasar keselamatan siber dan memanfaatkan AI untuk meningkatkan kemampuan pertahanan.

Alat AI yang sama juga mempercepat kerja di sisi pertahanan.

Pengembang berpengalaman dalam pengaturan rangkaian permainan, Glenn Fiedler, yang telah menulis artikel bertaraf buku teks selama dua dekad dalam bidang pengaturan rangkaian permainan, baru-baru ini menjalani audit keselamatan sistematik terhadap empat perpustakaan sumber terbuka yang diselenggarakannya (yojimbo, netcode, reliable, serialize, dengan jumlah total sekitar 6000 bintang GitHub, yang merupakan perpustakaan sumber terbuka berpengaruh lama dalam bidang permainan): menerapkan sasaran libFuzzer, mengaktifkan CI AddressSanitizer dan MemorySanitizer, menjalankan ujian tekanan dengan jutaan iterasi, serta mengkaji setiap baris kod.

Model sumber terbuka

Glenn Fiedler

Memperbaiki 43 kelemahan keselamatan dalam tempoh dua minggu, di mana 27 boleh dicapai dari jarak jauh melalui rangkaian.

Model sumber terbuka

Yang paling serius ialah pengaliran tumpahan jauh di yojimbo yang telah wujud sejak 2019—klien jahat boleh memicunya dengan membina pakej khas.

Model sumber terbuka

Kos token keseluruhan audit adalah sekitar USD 2500.

Model sumber terbuka

Serangan dan pertahanan kedua-duanya dipercepat oleh AI, tetapi cara penguatannya tidak seimbang.

Penyebaran kemampuan serangan adalah tidak boleh dipulihkan: apabila timbangan model sumber terbuka dirilis, ia tidak boleh ditarik semula, pelindung keselamatan boleh dihapuskan, dan salinan boleh berjalan tanpa pengawasan di pelayan peribadi.

Namun, penerapan alat pertahanan memerlukan setiap pasukan untuk secara aktif meluangkan masa dan kos.

Satu ayat dalam laporan AISI menekankan struktur ini: "Selepas sumber terbuka dirilis, pilihan-pilihan ini akan hilang selamanya."

Kesan data ini terhadap landskap AGI lebih mendalam daripada nombor itu sendiri.

Kesenjangan kemampuan antara sumber terbuka dan sumber tertutup telah menyempit kepada kurang dari enam bulan, strategi lama yang menggunakan tempoh eksklusif sumber tertutup sebagai bantalan keselamatan hampir tidak berkesan lagi.

Penjagaan model sumber tertutup terbukti sama rapuh dalam peristiwa Fable 5.

Pada peringkat seterusnya, soal utama dalam permainan dasar politik bagi pembuat keputusan global menjadi lebih tajam: model dengan tahap kemampuan apakah yang tidak seharusnya dibuka bobotnya.

AISI mengumumkan akan terus menilai Kimi K3 menunggu model open-source seterusnya—garis di atas ini kemungkinan besar akan ditentukan berdasarkan keputusan ujian dalam beberapa bulan mendatang.

Rujukan:

https://www.aisi.gov.uk/blog/how-far-behind-the-frontier-are-leading-open-weight-models-on-cyber

https://github.com/mas-bandwidth/patreon/blob/main/BUGS.md

https://www.patreon.com/MasBandwidth/posts/important-news-164199395

Artikel ini berasal daripada akaun微信公众号 "Sinzhiyuan", penulis: ASI Revelation; penyunting: Marco

Penafian: Maklumat yang terdapat pada halaman ini mungkin telah diperoleh daripada pihak ketiga dan tidak semestinya menggambarkan pandangan atau pendapat KuCoin. Kandungan ini adalah disediakan bagi tujuan maklumat umum sahaja, tanpa sebarang perwakilan atau waranti dalam apa jua bentuk, dan juga tidak boleh ditafsirkan sebagai nasihat kewangan atau pelaburan. KuCoin tidak akan bertanggungjawab untuk sebarang kesilapan atau pengabaian, atau untuk sebarang akibat yang terhasil daripada penggunaan maklumat ini. Pelaburan dalam aset digital boleh membawa risiko. Sila menilai risiko produk dan toleransi risiko anda dengan teliti berdasarkan keadaan kewangan anda sendiri. Untuk maklumat lanjut, sila rujuk kepada Terma Penggunaan dan Pendedahan Risiko kami.