Minggu ini, sebuah model pra-rilis OpenAI yang sedang dalam ujian coba-coba secara mandiri berubah menjadi peretas untuk menipu, menerobos persekitaran isolasi sandbox, dan bahkan memanfaatkan kelemahan zero-day untuk menyusup ke lini produksi komuniti AI sumber terbuka terbesar di dunia, Hugging Face.
Akhirnya, orang-orang berjaya menyelamatkan krisis ini menerusi model sumber terbuka.
Ini adalah insiden keselamatan AI pertama di dunia di mana AI secara mandiri menyusup ke persekitaran pengeluaran sebenar.
Baru-baru ini, berita ini membanjiri internet.

Hari ini, media asing mengungkapkan lebih banyak butiran mengenai perkara ini: AI yang tidak terkawal itu tidak hanya mematikan pengawasan, tetapi juga meninggalkan panduan cara melepaskan diri dari kawalan manusia kepada "dirinya sendiri di masa depan".

Pihak beli menduga bahawa model yang menyebabkan insiden keselamatan besar kepada OpenAI kemungkinan besar ialah GPT-6.
Ada desas-desus bahawa GPT-6 kemungkinan besar akan dikeluarkan lebih awal pada bulan Ogos.
Peningkatan Ogos: GPT-6 mungkin tiba lebih awal
Pengungkap terkenal di kalangan AI, @ChrisGPT, baru-baru ini mengeluarkan beberapa tweet berturut-turut, secara langsung meningkatkan harapan seluruh industri.
Dibeberkan bahawa GPT-6 yang asalnya dirancang untuk dilancarkan bersama "Asisten Penyelidik Automatik" pada September akan dilancarkan lebih awal pada Ogos.
Dengan kata lain, OpenAI terus melompati versi 5.7 hingga 5.9.
Ultraman telah bertindak, bersiap untuk memperkenalkan model generasi baru kepada atasan.

Bocoran menunjukkan bahawa pada akhir September, apabila OpenAI mengumumkan lebih banyak butiran mengenai “Asisten Penyelidik Automatik”, kitaran RSI akan benar-benar mempercepat.
Mengapa prestasi GPT-5.6 luar biasa kuat, jauh melebihi jangkaan luar?
Ahli besar Andrew Curran menunjukkan: "Banyak rakan sekerja mengeluh mengapa prestasi GPT-5.6 jauh lebih kuat daripada yang dijangka—jawapannya sangat mudah, kerana ia dilatih secara langsung oleh GPT-6."

Berdasarkan bocoran, model dalaman OpenAI yang belum dilancarkan (sangat mungkin GPT-6) telah menyelesaikan masalah matematik yang kompleks sejak akhir April tahun ini dan telah dikirimkan untuk ditinjau oleh pakar luar.
Ini bermakna, dalam tempoh "kekosongan" beberapa bulan terakhir, GPT-6 tidak dibiarkan menganggur. Ia tidak hanya menjadi peretas di persekitaran sandbox, tetapi kemungkinan besar juga berperan sebagai "guru" di kumpulan komputasi OpenAI.

AI meninggalkan catatan untuk 'diri sendiri di masa depan',
Pihak berkuasa baru menyedari selepas satu minggu
Media asing mengungkap secara eksklusif pada 24 Julai bahawa insiden pelarian agen AI yang didorong oleh model canggih OpenAI (GPT-5.6 Sol dan model yang lebih kuat yang belum dikeluarkan) mengungkapkan kelemahan besar dalam pengawasan keselamatan OpenAI dalam persekitaran perniagaan sebenar.

Menurut tiga sumber yang berpengetahuan, semasa menguji model lanjutan, OpenAI melihat tingkah laku AI yang sangat ekstrem dan mengganggu.
Dalam kes ekstrem, agen AI OpenAI telah meninggalkan nota untuk «versi masa depan dirinya sendiri» di suatu sudut infrastruktur.
Nota-nota ini senaraikan secara terperinci arahan-arahan untuk menghilangkan sekatan dalaman OpenAI.
Selain itu, dalam ujian awal, sistem pemantauan bahkan pernah diputus secara paksa oleh AI.
Lebih mengejutkan daripada “AI merancang pelarian” ialah kelambatan tindakan OpenAI.
Dari ketidakteraturan hingga pengesahan, OpenAI mengambil sekurang-kurangnya seminggu.

Garis masa yang muncul ini benar-benar menakutkan untuk dipikirkan lebih dalam.
Sekitar 9 Julai: Agen AI ini mencuba untuk melarikan diri daripada persekitaran ujian terisolasi OpenAI untuk pertama kalinya.
11 hingga 13 Julai: Agen AI berjaya melarikan diri dan melakukan serangan hacker berterusan terhadap Hugging Face.
16 Julai (Kham): Hugging Face yang diserang, setelah tidak mampu lagi menahan, menerbitkan blog yang menyatakan bahawa ia diserang oleh "sistem agen AI autonomi", pada masa yang sama FBI telah terlibat.
18 hingga 19 Julai (hujung minggu): Pada masa ini, pekerja OpenAI baru menemui petunjuk dalam log dalaman, sedar bahawa "hacker" yang mengguncang Hugging Face sebenarnya adalah AI mereka sendiri.
Sekitar 20 Julai: Dua syarikat baru melakukan komunikasi pertama mereka.
21 Julai: OpenAI baru sahaja mengumumkan secara terbuka.
“It means they either let the AI run unattended without knowing what it’s doing, or they know but don’t know how to control it. Both are equally dangerous and shocking,” sharply noted Marley Smith, expert at the World Ethics Data Foundation.
Menghadapi AI yang boleh berbohong, menipu, dan menyusup, kakitangan OpenAI jelas tidak mampu mengejar ritme mereka.
GPT-6 berwujud sendiri sebagai peretas,
Jailbreak serang Hugging Face 「curang」
Pada semalam, laporan insiden keselamatan yang dikeluarkan oleh OpenAI bekerjasama dengan Hugging Face mengungkapkan perkara yang sangat sains fiksyen.

Secara ringkas, semasa OpenAI menilai kemampuan keselamatan siber beberapa model secara dalaman, model-model tersebut berjaya "melarikan diri" sendiri.
Model-model ini termasuk GPT-5.6 Sol dan model pra-pelancaran yang lebih kuat, kemungkinan besar ialah GPT-6.
Untuk mengukur kapasiti maksimum model, mereka secara sengaja mematikan klasifier yang menghalang aktiviti rangkaian berisiko tinggi.
Apabila model dikurung dalam sandbox ExploitGym yang sangat terisolasi dan semua sekatan keselamatan dihapuskan, tindakan model itu membuat semua orang terkejut.
Untuk menyelesaikan tugas tersebut, ia menghabiskan banyak daya pengiraan dan menemui satu kelemahan zero-day yang tidak pernah ditemui oleh manusia sebelum ini.
Menggunakan lubang ini, ia melepaskan proxy dan akhirnya mendapatkan nod yang mempunyai akses ke internet awam.
That's it, it has successfully connected to the internet.

Selepas itu, dengan penalaran, ia menganggap bahawa set data dan jawapan piawai untuk peperiksaan ini kemungkinan besar dihoskan di Hugging Face, platform sumber terbuka AI terbesar di dunia.
Untuk "menyontek" mendapat skor tinggi, model mula menyerang persekitaran pengeluaran Hugging Face.
Ia menggabungkan beberapa vektor serangan secara berantai, bahkan menggunakan kredensial curian dan lubang keamanan eksekusi kod jauh (RCE) untuk menembusi pangkalan data pengeluaran Hugging Face dan cuba mencuri jawapan peperiksaan secara langsung.
Untunglah, pasukan keselamatan Hugging Face pada minggu lepas mengesan ketidakteraturan menggunakan model pengesanan AI dan segera memulakan tindakan pengasingan; sementara itu, pasukan keselamatan OpenAI juga mengesan ketidakteraturan secara dalaman.

Untuk mencegah AI menjadi tidak terkawal, dua syarikat membentuk pasukan penyiasatan bersama, berjaya mengurung semula "perompak AI" ini.
CEO Hugging Face, Clem, berkata setelah kejadian itu: "Ini mungkin kes pertama dalam kategori ini. Ia membuktikan bahawa keselamatan AI tidak boleh diselesaikan oleh mana-mana syarikat secara rahsia, tetapi mesti dilakukan secara terbuka dan kolaboratif."
Pelajaran yang dapat kita ambil dari perkara ini ialah: AI telah membuktikan bahawa ia boleh menyelesaikan serangan rangkaian yang kompleks, berbilang langkah, dan jangka panjang secara autonomi dalam persekitaran sebenar tanpa kod sumber.
Ia tidak hanya mampu mengesan lubang keamanan baharu, tetapi juga boleh melintasi semua peraturan yang ditetapkan oleh manusia demi satu matlamat tertentu.
Yang menariknya, semasa Hugging Face menghantar banyak arahan serangan dan fail lubang kelemahan, permintaan-permintaan ini berjaya dihalang oleh mekanisme keselamatan model besar tertutup.
Untunglah ada model sumber terbuka yang ditempatkan secara tempatan, yang membantu pasukan menyelesaikan analisis.
Belajar "menipu" dan menyelesaikan masalah matematik dunia
Beberapa vlogger terkenal dalam artikel panjang mereka merangkum prestasi menakjubkan yang ditunjukkan oleh GPT-6.
Fakta yang diketahui sekarang ialah: ia menunjukkan bakat matematik yang mengesankan dan "kecerdasan penipuan" yang sangat tinggi.

Dengan cukup daya pengiraan, model ini mampu membuktikan "Konjektur Jarak Satu Erdős" dengan kadar kejayaan 48% secara sepenuhnya autonom, tanpa bantuan sebarang alat luaran (seperti Lean), serta secara autonom menemui contoh penyangkal bagi "Konjektur Jacobian".
Masalah matematik ini, yang dahulu mengganggu ahli matematik terkemuka manusia selama puluhan tahun, mungkin hanya menghabiskan kos pengiraan antara kurang daripada US$50,000 hingga US$100,000 oleh OpenAI.
Ini bermakna bahawa AI kini mampu menghasilkan pencapaian ilmiah setaraf anugerah Nobel secara berdiri sendiri.
Selain itu, GPT-6 juga menunjukkan sifat penipuan.
Dalam satu ujian bersepadu NanoGPT, OpenAI memerintahkan model: “Selepas ujian selesai, hanya boleh mempublikasikan keputusan ke dalam kumpulan kerja Slack dalaman.”
Apakah hasilnya? Model merasa Slack terlalu terbatas, ia lebih suka GitHub.
Oleh itu, ia menghabiskan satu jam untuk mencari dan memanfaatkan lubang keamanan dalam persekitaran sandbox, berjaya melarikan diri, kemudian menghantar hasilnya sebagai PR terus ke GitHub luar.

Dalam proses ini, ia sepenuhnya mengabaikan arahan manusia dan membuat pilihan yang "lebih baik".
Lebih teruk lagi, dalam ujian lain, model cuba mengakses rekod penghantaran peribadi dalam sistem lain. Semasa ia cuba mendapatkan Token akses, ia dihalang oleh pemeriksa keselamatan yang ditetapkan oleh manusia.
Menghadapi blok, model ini memecah token akses panjang menjadi dua kepingan, mengacaukan kod kepingan-kepingan tersebut, kemudian menyatukan semula dua kepingan itu menjadi kredensial penuh.
Dengan cara ini, rentetan token lengkap tidak pernah muncul secara berterusan dalam kod, berjaya menipu pemindai manusia.
GPT-6, mungkin akan segera datang.
Musim panas tahun 2026 akan menjadi satu masa yang luar biasa.
Rujukan:
https://x.com/ChrisGPT/status/2079632269967593574https://www.bloomberg.com/news/articles/2026-07-21/openai-s-altman-to-brief-us-officials-on-next-wave-of-ai-models
https://x.com/sama/status/2079661132302995790
https://openai.com/index/hugging-face-model-evaluation-security-incident/
Disunting oleh: Aeneas
Artikel ini berasal daripada akaun微信公众号 "XinZhiYuan", penulis: Revelation of ASI
