Menurut TechCrunch yang mengutip The Information, model Astra yang akan dilancarkan oleh OpenAI akan menggunakan teknik penalaran bernama "recursive depth". Kaedah ini mungkin mengurangkan jejak yang kelihatan semasa proses penalaran model, membuatkan pihak luar lebih sukar untuk menilai mengapa model mencapai kesimpulan tertentu melalui catatan rantai pemikiran.
Ahli penyelidik keselamatan memberikan amaran
Dalam model penalaran biasa, rantai pemikiran biasanya menunjukkan langkah demi langkah bagaimana model memproses masalah. Walaupun rekod ini tidak sama dengan keseluruhan proses dalaman sebenar model, ia tetap menjadi alat penting untuk memantau penyimpangan model dari matlamat, keputusan tidak biasa, atau perilaku berpotensi tidak terkawal.
Buck Shlegeris, CEO Redwood Research, mengatakan bahawa beliau sangat prihatin terhadap penggunaan teknologi semacam ini oleh Astra. Beliau percaya bahawa jika OpenAI memperluaskan penggunaan kaedah ini lebih lanjut, keterlaluan rantai pemikiran model mungkin menurun secara ketara.
Komentator yang secara berterusan memperhatikan keselamatan AI, Zvi Mowshowitz, juga menyatakan bahawa jika setiap laboratorium bersaing dalam kemampuan model, pihak pengawas mungkin perlu campur tangan pada masa depan untuk mengelakkan industri terus menurunkan piawaian keselamatan.
Pengurangan jejak kelihatan melalui pembulatan berulang
Laporan tersebut menyebutkan bahawa "rekursi tidak telus" merujuk kepada model yang tidak lagi menyelesaikan penalaran terutamanya melalui langkah-langkah linear, tetapi memproses soalan yang sama secara berulang. Tindakan ini mungkin mengurangkan proses perantara yang boleh dibaca oleh pihak luar, sama ada mengelakkan laluan kelihatan yang disediakan oleh rekod rantai pemikiran tradisional.
Ini juga merupakan bahagian yang paling dikhawatirkan oleh pakar keselamatan. Kerana sekali model semakin kerap melakukan penalaran di dalam ruang dalaman yang tidak kelihatan, para penyelidik akan lebih sukar untuk menilai sama ada ia menyesatkan, mengelakkan batasan, atau menunjukkan tingkah laku lain yang tidak diharapkan.
Ahli sains utama Redwood Research, Ryan Greenblatt, menyatakan bahawa risiko yang lebih besar ialah penalaran tidak telus sebegini mungkin lebih mudah diskalakan berbanding penalaran rantai pemikiran tradisional, akhirnya menjadikan sebahagian besar proses penalaran keluar dari salur yang kelihatan.
OpenAI menekankan kepentingan mempertahankan kemampuan pemantauan
Namun, pada peringkat ini, penggunaan Astra terhadap teknologi ini dikatakan masih agak terhad. Laporan itu menunjukkan bahawa rantai pemikiran model dijangka masih boleh dibaca, dan OpenAI juga menentang gambaran luaran bahawa ia beralih kepada “neuro-linguistik” sepenuhnya tidak dapat dijelaskan.
Ilmuwan utama OpenAI, Jakub Pachocki, menyatakan di X bahawa syarikat telah berusaha untuk mengekalkan dan memanfaatkan kemampuan pemantauan rantai pemikiran sejak model penalaran awal, yang juga merupakan salah satu matlamat utama dalam rancangan penyelidikan semasa.
Perlu diperhatikan bahawa bukan hanya OpenAI yang mendekati arah ini. Laporan seterusnya oleh The Information menyatakan bahawa Anthropic dan Google DeepMind juga telah membincangkan teknologi serupa. Ini bermakna, keseimbangan antara peningkatan kemampuan model dan ketersediaan keselamatan serta pemeriksaan mungkin segera menjadi isu bersama yang lebih luas dalam industri AI.
