OpenAI pada 1 September menyatakan bahwa Astra, yang belum dirilis, telah mencapai ambang batas keamanan siber "tingkat kritis" dalam kerangka kesiapan perusahaan. Ini adalah pertama kalinya OpenAI memasukkan model ke dalam kategori ini, yang berarti akan diterapkan batasan keamanan yang lebih ketat selama pengembangan dan sebelum rilis.
Pertama kali memasuki level kunci
Menurut definisi OpenAI, jika model mampu secara mandiri menemukan kerentanan tak dikenal di berbagai sistem nyata yang telah diperkuat dan membangun rantai serangan yang dapat digunakan, atau hanya dengan menggunakan tujuan tingkat tinggi untuk menyelesaikan serangan jaringan lengkap terhadap target yang sangat sulit, maka model tersebut akan diklasifikasikan sebagai "tingkat kritis". Sebelumnya, model-termasuk GPT-5.6 Sol—mencapai maksimum pada kategori "risiko tinggi".
Ditemukan dua kerentanan nol hari selama pengujian
Dalam pengujian ExploitBench, Astra mencapai tingkat keberhasilan 100%. Pengujian ini terutama menilai kemampuan model untuk mengubah kerentanan perangkat lunak yang diketahui menjadi kode eksploit yang dapat dieksekusi.
Untuk menghilangkan pengaruh bank soal memori, OpenAI kembali memilih 20 kerentanan tingkat tinggi pada mesin JavaScript Google V8 yang diungkapkan antara Juni hingga Agustus tahun ini untuk pengujian internal. OpenAI menyatakan bahwa Astra memiliki tingkat keberhasilan eksekusi kode sewenang-wenang yang lebih tinggi daripada GPT-5.6 Sol, serta menggunakan lebih sedikit token output. Selama pengujian, Astra juga secara mandiri menemukan dan menghubungkan dua kerentanan nol-hari yang sebelumnya tidak diketahui, dan masalah terkait masih dalam proses pengungkapan kepada pihak pemelihara yang terdampak.
Dibuka terlebih dahulu untuk sejumlah kecil pengujinya
Dalam pengujian yang lebih mendekati situasi nyata, Astra membangun rantai serangan lengkap menggunakan seperangkat browser yang diperkuat dan seperangkat sistem operasi yang diperkuat. OpenAI menyatakan bahwa model tersebut berhasil melarikan diri dari sandbox browser dan menjalankan perintah di host utama hanya dengan mengajak target membuka file HTML jahat. Dalam pengujian lain, model tersebut juga menghubungkan beberapa kelemahan sistem menjadi jalur peningkatan hak, sehingga akun pengguna biasa akhirnya memperoleh hak root.
OpenAI menyatakan bahwa tingkat penolakan Astra terhadap prompt jailbreak keamanan siber mencapai 91,5% dalam pengujian internal, lebih tinggi daripada 59% dari GPT-5.6 Sol. Kemampuan keamanan siber terkuatnya akan pertama kali tersedia untuk sejumlah kecil peserta alpha, kemudian secara bertahap diperluas melalui proyek Daybreak Blue, terutama untuk pekerjaan keamanan defensif.
Informasi tambahan: Pengungkapan ini dirilis pada hari yang sama ketika Anthropic meluncurkan Fable 5.1 dan Mythos 5.1, di mana Mythos 5.1 tetap hanya tersedia untuk lembaga keamanan siber dan ilmu kehidupan yang telah disetujui. OpenAI saat ini belum mengumumkan tanggal peluncuran resmi Astra.
