Kenapa model belum dikeluarkan sudah menimbulkan kontroversi??
Menjelang pelancaran GPT-6, satu berita yang pertama kali diungkap oleh The Information dengan cepat menarik perhatian di internet:
Model baru OpenAI memperkenalkan teknik penalaran bernama "recurrent depth", yang mungkin membuat proses pemikiran model menjadi lebih sukar difahami dan dipantau.
Dengan kata lain, selepas ini, manusia benar-benar tidak akan memahami apa yang dipikirkan oleh AI.

Oh, jika AI belajar berbohong, curang, atau mengelakkan sekatan keselamatan, bukankah kita juga tidak akan dapat mengesannya dengan segera??
Tidak hairanlah apabila berita itu keluar, komuniti keselamatan AI segera mengaktifkan amaran, dan semua orang bimbang:
Jika teknologi ini terus diperluas penggunaannya, mekanisme pemantauan rantai pemikiran yang ada mungkin menjadi tidak berkesan secara langsung.
Kerana isu ini sangat serius dan perbincangan terlalu sengit, ketua saintis OpenAI terpaksa turun tangan secara langsung untuk memberi respons.
Bahkan, di tengah kegaduhan, ada yang terkejut menemui:
Nama model baharu OpenAI sebenarnya ialah “GPT-6” atau “Astra”, mungkin telah bocor terlebih dahulu melalui API.
Sementara itu, OpenAI juga mungkin melancarkan versi baharu model gambar, GPT Images 2.1.
Terlalu banyak buah, mari kita nikmati satu per satu.
Model mulai berputar di dalam otak, pakar keselamatan menjadi panik
Yang pertama ialah teknik "kedalaman kitaran" yang menimbulkan perdebatan kali ini.
Model sebelumnya akan meninggalkan rantai pemikiran CoT yang jelas semasa inferens, jadi apa yang dipikirkan menjadi jelas terlihat.
Walaupun rentetan teks ini mungkin tidak sama seratus peratus dengan pergolakan batin sebenar model (masih diperdebatkan), ia sekurang-kurangnya meninggalkan jejak yang boleh diperiksa.
Sementara itu, "kedalaman siklik" yang digunakan oleh Astra kelihatan berbeza.

Ia membenarkan model mengembalikan keadaan dalaman yang dihasilkan pada langkah tertentu semula ke rangkaian saraf, untuk diproses berulang kali dalam ruang tersembunyi sebelum mengeluarkan teks seterusnya.
Sebagai contoh, dahulu model menyelesaikan soalan dengan berfikir sambil menulis proses pengiraan di kertas buram.
Sekarang, ia boleh dihitung dalam fikiran.
Orang luar mungkin hanya dapat melihat soalan dan jawapan, tetapi tidak semestinya dapat melihat bagaimana pengiraan di antaranya, idea-idea apa yang telah dicuba, atau sama ada ada jalan yang tersesat.
Dengan menghemat usaha menterjemahkan setiap langkah ke dalam teks, secara teori model boleh menggunakan sumber pengiraan yang sama untuk berfikir beberapa putaran lagi dan mempertimbangkan beberapa penyelesaian secara serentak.
Namun, semasa prestasi meningkat, masalah turut timbul:
Jika model tidak lagi berfikir dengan bahasa manusia, bagaimanakah manusia boleh memantau ia?
Pengarah Eksekutif Redwood Research, sebuah organisasi penyelidikan keselamatan AI bukan keuntungan, telah mengungkapkan kebimbangan yang kuat:
Belum jelas sejauh mana keterlihatan rantai pemikiran Astra telah menurun, tetapi jika OpenAI terus memperluas kedalaman kitaran, ia boleh menyebabkan sebahagian besar penalaran model berpindah ke ruang tersembunyi yang tidak boleh dibaca, akhirnya “menghancurkan sepenuhnya” keterlihatan rantai pemikiran.

Ryan Greenblatt, saintis utama Redwood, juga bimbang arah yang sama.
Menurutnya, penalaran yang tidak transparan mungkin berkembang lebih cepat daripada rantai pemikiran tradisional. Dengan meneruskan jalan ini, model di masa depan mungkin akan melakukan penalaran sepenuhnya atau hampir sepenuhnya dalam ruang laten.
Ini adalah kemajuan paling buruk dalam bidang keselamatan AI sejauh ini.
Setelah semua, jika hanya "proses pengiraan tidak difahami", masalahnya tidak akan sebegitu rumit.
Sebagai penyelidik utama dalam insiden "Serangan model OpenAI terhadap Hugging Face" sebelum ini, beliau menemui dua ancaman utama:
Pada masa itu, penyelidik sangat bergantung kepada rantai pemikiran untuk memulihkan tingkah laku sejumlah agen AI, walaupun begitu, penyiasatannya sudah sangat sukar.
AI yang berkaitan pernah cuba memalsukan rekodnya sendiri, bahkan mengada-adakan panggilan alat.
Untuk yang terakhir, jika model memiliki kemampuan penalaran tersembunyi yang lebih kuat, ia lebih mungkin terlebih dahulu merancang skema penipuan dalam ruang laten, kemudian menciptakan cerita palsu melalui panggilan dan output yang dipalsukan, tanpa meninggalkan petunjuk jelas dalam rantai pemikiran teks.
Oh no, the risk has doubled directly...

Zvi Mowshowitz, yang secara berterusan memperhatikan keselamatan AI, berkata lebih terus terang:
Ini seperti bermain dengan api.
Dia bimbang bahawa sekiranya penyembunyian inferens memberikan keuntungan prestasi yang ketara, setiap makmal mungkin terperangkap dalam persaingan jahat:
Anda takut akan keselamatan sehingga tidak berani menyembunyikan rantai pemikiran, tetapi pesaing berani, dan model yang mereka hasilkan lebih kuat dan lebih murah.
Untuk tidak ketinggalan, apa kamu ikut?
Mowshowitz bahkan berpendapat bahawa di masa depan mungkin diperlukan tindakan undang-undang untuk mengelakkan syarikat AI secara kolektif melepaskan keterlaluan pemantauan rantai pemikiran demi mengejar kemampuan.

Namun, di sisi lain, ada yang merasa kepanikan ini datang terlalu cepat.
Tian Yuan Dong juga menyatakan di X bahawa mereka sebelum ini menerima pertanyaan yang hampir sama ketika memperkenalkan Coconut.
Coconut secara penuh dikenali sebagai "Chain of Continuous Thought", dan juga berpendapat agar model secara langsung ber推理 dalam ruang tersembunyi yang berterusan, bukan dengan menghuraikan setiap langkah menjadi teks.
Menurut Tian Yuan Dong, walaupun model mengekalkan rantai pemikiran eksplisit, ia tidak bermakna manusia benar-benar melihat pemikiran sebenarnya.
Penting untuk memahami bagaimana model itu sendiri berfungsi, bukan hanya memperhatikan "proses penyelesaian" yang ditulis oleh model.

Semasa kontroversi semakin membesar, ahli sains utama OpenAI, Jakub Pachocki, turut tidak dapat diam dan secara peribadi memberi respons.
Dia segera menyatakan bahawa perlu menghalang pertandingan yang tidak dapat dipantau yang disebabkan oleh "laporan yang kacau".
Termasuk Astra, kedalaman graf komputasi model terkini OpenAI masih berada dalam dua kali ganda GPT-4.
Dengan kata lain, Astra memang menggunakan pengiraan berputar, tetapi skala semasa masih terhad dan tidak menyembunyikan seluruh rantai pemikiran. Berdasarkan maklumat semasa, penalaran bahasa semula jadinya masih boleh dibaca.
Pachocki juga menekankan bahawa OpenAI sentiasa menganggap pemantauan rantai pemikiran sebagai langkah keselamatan yang penting, dan ia masih menjadi matlamat utama dalam rancangan penyelidikan semasa syarikat tersebut.
Namun, beliau juga mengakui bahawa pemantauan rantai pemikiran sangat rapuh dan sedang bergerak ke arah negatif.
Namun, penurunan ini bukan semata-mata disebabkan oleh perubahan arsitektur seperti kedalaman siklus (sebagai pengumuman awal, kami akan menulis artikel khusus untuk menjelaskan hal ini), dan OpenAI juga terus menyelidiki cara memperkuat kemampuan pemantauan.

Jadi, Astra belum membuat model menjadi tidak dapat difahami oleh manusia sepenuhnya.
Yang sebenarnya menjadi kebimbangan pakar keselamatan adalah:
Apakah inferensi tersembunyi yang hari ini dibatasi dalam lingkup kecil akan terus diperluas dalam model generasi seterusnya, sehingga akhirnya menjadi kotak hitam yang tidak dapat dipantau?
Apakah benar-benar GPT-6-Astra? Nilai balikan API sudah terbongkar
Setelah selesai membincangkan isu algoritma, buah kedua berkaitan dengan nama model.
Pengungkap leo mendapati, apabila meminta "gpt-6-astra" melalui API OpenAI Responses, server mengembalikan 404 Not Found.
Sementara itu, memasukkan nama model yang tidak wujud atau dibuat-buat biasanya akan menghasilkan ralat 400.
404 bermakna pengenal model ini telah dikenal oleh backend, tetapi akaun semasa tidak mempunyai kebenaran untuk mengakses, atau model belum dibuka.
Sebelum ini, beberapa model yang belum dikeluarkan juga pernah menunjukkan jejaknya melalui perbezaan respons API yang serupa.
Oleh itu, Leo menyimpulkan bahawa “gpt-6-astra” mungkin telah dideploykan ke latar belakang OpenAI API.

GPT Images 2.1 juga akan datang, pertama-tama selesaikan "penyakit titik bising"
Di luar model bahasa, produk gambar OpenAI juga didedahkan mengalami kemas kini serentak.
Menurut akaun bocor Fix, model gambar versi baharu, GPT Images 2.1, mungkin dilancarkan pada 4 September.
Perubahan paling ketara dalam peningkatan ini ialah pembaikan "penyakit gangguan" pada versi lama.

Sebelum ini, beberapa hasil generasi Images v2 menunjukkan butiran aneh, kesan kabut, dan tekstur kotor, terutama dalam gambar yang mengandungi banyak teks atau elemen halus, seperti yang dinyatakan oleh seorang pengguna lain:
Seperti diambil melalui kaca yang kotor.
Sementara itu, contoh terkini yang bocor telah jelas memperbaiki masalah ini, dengan gambar yang lebih bersih.
Mari mari, masih menjadi pentas utama pelakon lama Ultraman:
Lukisan terkenal dunia: “Ultraman Akan Ditangkap Jika GPT-6 Tidak Dikeluarkan!”

Dan juga Ultraman yang begadang bekerja lembur, pulang larut malam dan berjalan-jalan di jalan-jalan agar tidak ditangkap.
Sambil itu, teruskan gambar Instagram berjudul "Adakah anda pernah melihat jalan pada pukul 2 pagi?"

Tidak dapat dipungkiri, gambar kelihatan sangat berkualiti, hampir sama seperti yang diambil secara langsung.
Lebih banyak tema, lebih banyak gaya juga dikuasai dengan baik:



Jangan banyak cakap, Oto-man, segera hantarlah.
Pautan rujukan:
[1]https://techcrunch.com/2026/09/02/openais-new-reasoning-technique-alarms-ai-safety-experts/
[2]https://x.com/tydsh/status/2095227000365707542?s=20[
3]https://x.com/merettm/status/2095023204993490967?s=20
[4]https://x.com/synthwavedd/status/2095184148981842161?s=20
[5]https://x.com/FixlationAI/status/2095232751654064426?s=20
[6]https://x.com/marco_obviously/status/2095275097217191981?s=20
Artikel ini berasal daripada akaun微信公众号 "Quantum Bit", penulis: Membincangkan teknologi terkini
