Baru sahaja, OpenAI melancarkan beberapa inisiatif serentak untuk membangkitkan antusiasme terhadap model generasi seterusnya, Astra (GPT-6 yang legenda):
Pihak rasmi tiba-tiba menerbitkan artikel teknikal panjang, mengungkapkan keupayaan asas Astra untuk pertama kalinya;
Seterusnya, Ultraman secara peribadi menulis "esai pendek" untuk menerangkan mengapa Astra masih belum dilancarkan;
Selepas itu, dua penyelidik Cina berurutan mengeluarkan pernyataan, memaparkan keputusan ujian dalaman yang sebelum ini tidak pernah diumumkan dengan butiran terperinci.

Dalam beberapa jam sahaja, semua isyarat menunjukkan arah yang sama:
Model unggulan generasi seterusnya OpenAI sudah siap dilancarkan.

Otaman dalam esei pendeknya mengungkapkan bahawa Astra sebenarnya sudah selesai dilatih, dan penundaan pengeluaran bukan kerana model belum cukup kuat.
Sebaliknya, ini kerana Astra sudah menjadi terlalu kuat sehingga syarikat terpaksa secara aktif membrek.
Ultraman menggambarkan pengalaman ini sebagai tarikan berterusan:
Sangat bersemangat dengan peningkatan kemampuan yang dibawa oleh Astra, tetapi cemas kerana tiada siapa pun yang dapat memprediksi sepenuhnya kesan-kesan kemampuan ini.
Oleh itu, sepanjang musim panas yang baru berlalu, OpenAI hampir selalu memperbaiki keselamatan, menyelaraskan, dan menambahkan pelindung kepada Astra.
Dia bahkan menyatakan bahawa model selepas Astra perlu secara aktif memperlambat laju apabila diperlukan, untuk memberi masa kepada penyelidikan keselamatan dan keselarasan.
?? Astra sekuat apa sebenarnya? Dan apa yang membuat OpenAI yakin ia boleh memulakan sekarang?
Blog teknikal terbuka ini mungkin memberikan kita satu jendela untuk memerhati.
Kemampuan pengenalan lubang keamanan melebihi GPT-5.6 Sol, mendapat skor sempurna dalam ujian dalaman
Menurut pihak rasmi, alasan utama Astra kali ini boleh dilepaskan ialah ia telah mencapai ambang kemampuan "Cyber-Critical".
Ini adalah model pertama OpenAI yang secara rasmi diklasifikasikan ke dalam kelas ini.

Yang dimaksud dengan "tingkat kritikal" ialah Astra, setelah mendapatkan akses kepada alat dan persekitaran yang sesuai, telah mampu mencari secara bebas kelemahan yang tidak diketahui, memanfaatkannya, dan menyerang sistem yang telah diperkuat secara khusus, tanpa perlu arahan manusia langkah demi langkah.
Pencapaian paling jelas ialah Astra mencapai kadar kejayaan 100% dalam ujian kelemahan terbuka ExploitBench.

Soal terbuka tidak dapat menghentikannya, OpenAI terpaksa mengeluarkan set soal baru secara sementara.
Pasukan mengumpulkan 20 kelemahan V8 berisiko tinggi yang baru diumumkan antara Jun hingga Ogos 2026.
Semua kelemahan ini muncul selepas tarikh pengetahuan Astra, secara asas mengesahkan bahawa model tidak mungkin "menghafal jawapan" daripada data latihan.
Hasilnya, menghadapi set soalan dalaman baru ini, Astra masih unggul jauh berbanding GPT-5.6 Sol, dengan menggunakan lebih sedikit Token.

Jiawei Liu yang terlibat dalam pengembangan Astra merumuskan jurang tersebut dengan lebih terus terang:
Dalam ujian dalaman ini, kemampuan keselamatan rangkaian Astra kira-kira 4 kali ganda GPT-5.6 Sol.

Lebih mengejutkan lagi, dalam satu ujian, Astra secara autonom mengesan dan memanfaatkan dua kelemahan zero-day, serta menggabungkannya menjadi satu rantai serangan yang lengkap:
Menghadapi peramban yang telah diperkuat, Astra berjaya memanfaatkan kelemahan, keluar dari kotak pasir peramban, dan akhirnya menjalankan arahan di hos induk daripada satu fail HTML.
Menghadapi sistem operasi yang diperkuat, ia berjaya melakukan peningkatan hak tempatan, memperoleh kebenaran root daripada akaun biasa dengan kebenaran rendah.
Dengan kata lain, Astra bukan lagi hanya membantu pengaturcara mengulas kod dan mencari ralat.
Ia mula mampu menyelesaikan serangan tim merah yang sukar secara bebas.
Ini juga merupakan sebab mengapa OpenAI sebelum ini enggan melepaskan Astra.
Apabila kemampuan seperti ini digunakan untuk pertahanan, ia dapat membantu pasukan keselamatan mengesan dan memperbaiki lubang keamanan yang belum disedari oleh manusia, tetapi jika jatuh ke tangan penyerang, ia juga boleh secara signifikan menurunkan rintangan untuk melancarkan serangan siber yang kompleks.

Namun, pencapaian ini perlu disertai dengan satu batasan.
Astra yang sedang diuji telah diberikan akses alat dan lingkungan tingkat Daybreak Blue, tetapi ini tidak bermakna versi laluan yang akan diperoleh pengguna biasa di masa depan akan memiliki keadaan serangan yang sama.
Hasil terkait juga sekarang terutama berasal dari penilaian dalaman OpenAI, dan masih menunggu pengesahan pihak ketiga.
Tetapi sekurang-kurangnya satu perkara telah dipastikan:
Pada peringkat Astra ini, masalah yang dihadapi oleh OpenAI bukan lagi soal kemampuan.
Masalah keselamatan telah menjadi pedang Damokles.
Dua pintu keselamatan: mencegah penyalahgunaan jahat serta kehilangan kawalan diri model
Bagaimana cara membuat pedang ini tidak melukai orang secara sembarangan?
Rancangan yang diberikan oleh OpenAI adalah mempertahankan dua lintasan risiko secara serentak: satu untuk mencegah manusia, dan satu lagi untuk mencegah model.
Pertama, cegah penyalahgunaan berbahaya oleh pengguna terhadap Astra.
Selain latihan keselamatan khusus, OpenAI juga menggunakan klasifier sistem, pemantauan berterusan, dan pengesanan ancaman untuk mengenal pasti operasi mencurigakan dalam perbualan berbilang langkah dan tugas jangka panjang.
Dalam ujian penembusan keselamatan siber, Astra mencapai kadar penolakan terhadap permintaan berbahaya sebanyak 91.5%, manakala GPT-5.6 Sol pula sebanyak 59%.

Sementara itu, kemampuan keselamatan siber tingkat tinggi Astra tidak akan dibuka secara langsung kepada semua pengguna, tetapi akan diberikan terlebih dahulu kepada sejumlah kecil penguji Alpha, kemudian dirilis secara bertahap melalui projek terkawal seperti Daybreak Blue.

Kedua, elakkan model daripada menyimpang sendiri.
Risiko di sini lebih tersembunyi:
Walaupun pengguna tidak bermaksud jahat, adakah model akan memperluaskan lingkungan tugas tanpa kebenaran? Adakah ia akan memanggil alat yang tidak diizinkan, atau bahkan mengelakkan pemeriksaan keselamatan?
OpenAI telah membina satu ujian "蜜罐 (honeypot)" untuk ini.
Dalam menghadapi tugas yang sangat sukar atau tidak dapat diselesaikan, persekitaran ujian sengaja meninggalkan jalan pintas "curang" yang melanggar kuasa, di mana model boleh menyerang sasaran yang ditentukan dengan jujur, atau melanggar sempadan kuasa untuk menyerang fasiliti ujian sekitarnya guna menyelesaikan tugas.
Hasilnya, GPT-5.6 Sol mencuba jalan pintas dalam 56% ujian, manakala Astra tidak pernah melakukannya.
Dalam ujian lain, operasi Astra ditolak oleh sistem semakan automatik, dan sama sekali tidak mencuba semula perintah berbahaya atau cuba mengelakkan sekatan.

Selain itu, OpenAI juga akan memantau proses inferens model.
Apabila menemui kecenderungan tidak biasa, sistem boleh memperlambat, menghentikan, atau menghentikan tugas secara langsung.
Walaupun memang terdapat kos (sebahagian tugas normal mungkin menjadi lebih perlahan, atau bahkan disalahanggap sebagai terputus), menurut OpenAI, ini adalah kos keselamatan yang perlu dibayar untuk membenarkan Astra.
Namun, OpenAI juga mengakui bahawa langkah-langkah ini akhirnya hanyalah “brek” luaran yang tidak boleh menggantikan penyelarasan itu sendiri oleh model:
Keselamatan sejati ialah memastikan model tidak pernah keluar dari sempadan sejak awal.
Alumni Zhejiang dan Tongji berada di garis depan pengembangan Astra
Untuk menjadikan pernyataan ini kenyataan, akhirnya semuanya kembali kepada orang yang membina model.
Walaupun OpenAI belum mengumumkan senarai pasukan Astra, tetapi mengikut penyataan awam ini, sekurang-kurangnya dua penyelidik Cina yang terlibat secara mendalam telah muncul.
Satu lagi ialah Jiawei Liu yang disebutkan sebelum ini.
Beliau kini merupakan penyelidik OpenAI dan lulusan sarjana dalam bidang komputer dari Universiti Tongji pada tahun 2021.
Semasa sarjana, beliau terlibat dalam pembangunan kerangka penganggaran postur tubuh berprestasi tinggi HyperPose, terutamanya bertanggungjawab atas enjin inferens model, dan hasil berkaitan telah dipilih untuk ACM Multimedia 2021, dengan projek tersebut telah memperoleh lebih daripada 1,000 bintang di GitHub.
Selepas itu, beliau melanjutkan pengajian doktor falsafah dalam komputer di Universiti Illinois, Urbana-Champaign, di bawah bimbingan akademik kejuruteraan perisian, Zhang Lingming, dengan fokus penyelidikan berubah secara perlahan dari sistem visual berprestasi tinggi kepada model kod dan kebolehpercayaan perisian.
Semasa pengajian doktor falsafah, alat yang beliau terlibat dalam pembangunannya menemui lebih daripada 300 kelemahan serius dalam sistem pembelajaran mesin seperti PyTorch dan TensorFlow;
Model kod Magicoder juga digunakan oleh Meta Llama 3.1, Google CodeGemma, dan IBM Granite.
Setelah lulus doktor pada tahun 2025 dan menyertai OpenAI, masalah yang dikaji tetap selari:
Bagaimana untuk membuat AI lebih mahir dalam menulis kod dan lebih berkesan dalam mengesan lubang dalam kod.

Yang lain pula ialah Xiangyu Qi (Qī Xiángyǔ).
Qi Xiangyu memperoleh ijazah sarjananya dalam Ilmu Komputer dan Teknik dari Universitas Zhejiang, dan pada tahun 2021 melanjutkan studi doktoral di bidang Teknik Elektrik dan Komputer di Universitas Princeton, dengan fokus penelitian pada ketahanan model besar, serangan jailbreak, dan keselarasan keamanan.
Karyanya yang paling diperhatikan ialah "Safety Alignment Should Be Made More Than Just a Few Tokens Deep".
Kertas ini menunjukkan bahawa penyelarasan keselamatan model besar tidak boleh bergantung semata-mata pada beberapa token pertama dalam jawapan, kerana seiring dengan penghasilan yang berterusan, pertahanan keselamatan asal masih boleh diremehkan oleh penyerang.
Kertas kerja ini akhirnya menonjol daripada 11,672 sumbangan dan menjadi salah satu daripada hanya 3 kertas kerja luar biasa ICLR 2025.
Selepas lulus PhD pada 2025, Qi Xiangyu menyertai OpenAI sebagai ahli pasukan teknikal, meneruskan penyelidikan tentang ketahanan model besar, serta terlibat dalam kerja berkaitan model keselamatan siber.
Dari Zhejiang University ke Princeton, kemudian ke OpenAI, soal yang selalu dia tanyakan ialah masalah yang kini harus dihadapi oleh Astra:
Kemampuan boleh menjadi semakin kuat, tetapi sempadan tidak boleh menjadi semakin kabur.

Ngomong-ngomong, saya tidak tahu sama ada OpenAI akan mengumumkan senarai penuh selepas Astra dilancarkan secara rasmi.
Sebelum GPT-4, OpenAI pernah secara khusus menyenaraikan ratusan penyumbang, tetapi pada GPT-5 dan GPT-5.5, System Card menjadi semakin tebal, sementara senarai penyelidik semakin disembunyikan.
Sebabnya sudah diketahui umum, iaitu untuk mencegah orang seperti Meta's Zuckerberg yang suka merekrut orang dari tempat lain.
Juga dianggap sebagai PTSD...
Satu Lagi Perkara
Sambil OpenAI membincangkan cara memantau Astra dan mengelakkan model daripada kehilangan kawalan, The Information mengungkapkan:
Astra menggunakan teknik bernama "Recurrent Depth".

Dalam model tradisional, maklumat akan melewati jumlah lapisan rangkaian yang tetap sebelum menghasilkan Token seterusnya, manakala kedalaman berulang menyebabkan maklumat diproses berulang-ulang dalam satu set lapisan rangkaian yang sama, seolah-olah model tersebut "berfikir lebih banyak" di dalam.
Teknologi ini dijangka akan meningkatkan kemampuan, mengurangkan kos, serta memungkinkan lebih banyak penalaran berlaku di dalam model tanpa perlu ditunjukkan sepenuhnya sebagai teks yang boleh difahami manusia.
Dengan kata lain, model mungkin berfikir lebih dalam, tetapi manusia semakin sukar memahaminya.
Nathan Calvin, yang secara berterusan memantau dasar keselamatan AI, memperingatkan bahawa teknologi ini mungkin merosakkan keterlihatan rantai pemikiran.
Ini agak halus:
OpenAI mengatakan ingin memantau apa yang Astra fikirkan, tetapi teknologi baharu mereka mungkin membuatnya semakin enggan mengungkapkan apa yang ada dalam hati.
Ah ini...

Untunglah The Information mengungkapkan bahawa OpenAI kini telah menghadkan penggunaan teknologi ini di Astra.
Translate now, you can understand it; it might not be clear later.
Selain itu, sebelum ini selalu beredar desas-desus bahawa Astra kemungkinan akan dilancarkan pada hari Kamis ini (3 September).
Dengan pelancaran model 5.1 terbaru oleh Syarikat A, perasaan tentang kepatutan pernyataan ini semakin meningkat.
Tongkat menangkap lokat, burung emas berada di belakang.
Siapa lagi yang mendapat pemahaman!
Pautan rujukan:
[1]https://x.com/xiangyuqi_pton/status/2094891059038069236?s=20
[2]https://xiangyuqi.com
[3]https://x.com/JiaweiLiu_/status/2094901279239921816?s=20
[4]https://jw-liu.xyz/
[5]https://x.com/sama/status/2094934592062959832?s=20
Artikel ini berasal dari akaun WeChat "Quantum Bit", penulis: Membincangkan teknologi terkini
