Menurut TechCrunch yang mengutip The Information, model Astra yang akan diluncurkan oleh OpenAI akan menggunakan teknik inferensi bernama "recursive depth". Metode ini dapat mengurangi jejak yang terlihat selama proses inferensi model, sehingga pihak luar lebih sulit menilai mengapa model mencapai kesimpulan tertentu melalui catatan rantai pemikiran.
Peneliti keamanan memberikan peringatan
Dalam model inferensi umum, rantai pemikiran biasanya menunjukkan langkah demi langkah bagaimana model memproses masalah. Meskipun pencatatan ini tidak setara dengan seluruh proses internal sebenarnya dari model, ia tetap menjadi alat penting untuk mengamati penyimpangan model dari tujuan, keputusan yang tidak biasa, atau perilaku potensial yang tidak terkendali.
Buck Shlegeris, CEO Redwood Research, mengatakan bahwa ia sangat khawatir terhadap penggunaan teknologi semacam ini oleh Astra. Ia berpendapat bahwa jika OpenAI memperluas penggunaan metode semacam ini lebih jauh, keterpantauan rantai pemikiran model kemungkinan akan menurun secara signifikan.
Komentator yang lama memperhatikan keamanan AI, Zvi Mowshowitz, juga menyatakan bahwa jika berbagai laboratorium bersaing dalam kemampuan model, regulator mungkin perlu ikut campur di masa depan untuk mencegah industri terus menurunkan standar keamanan.
Reduksi jejak terlihat melalui siklus inferensi
Laporan tersebut menyebutkan bahwa apa yang disebut "rekursi tidak transparan" berarti model tidak lagi terutama menyelesaikan penalaran melalui langkah-langkah linier, melainkan memproses ulang pertanyaan yang sama secara siklikal. Hal ini dapat mengurangi proses menengah yang dapat dibaca oleh pihak luar, sehingga menghindari jalur yang terlihat yang disediakan oleh catatan rantai pemikiran tradisional.
Ini juga merupakan bagian yang paling dikhawatirkan oleh para peneliti keamanan. Karena semakin banyak model yang melakukan penalaran di ruang internal yang tidak terlihat, para peneliti menjadi lebih sulit untuk menilai apakah model tersebut menghasilkan informasi menyesatkan, menghindari batasan, atau berperilaku tidak sesuai harapan.
Ilmuwan utama Redwood Research, Ryan Greenblatt, menyatakan bahwa risiko yang lebih besar adalah bahwa inferensi tidak transparan semacam ini mungkin lebih mudah diskalakan dibandingkan inferensi rantai pemikiran tradisional, pada akhirnya membuat sebagian besar proses inferensi keluar dari saluran yang terlihat.
OpenAI menekankan pentingnya mempertahankan kemampuan pemantauan
Namun, saat ini penggunaan Astra terhadap teknologi ini dikatakan masih terbatas. Laporan tersebut menunjukkan bahwa rantai pemikiran model ini diperkirakan masih akan tetap dapat dibaca, dan OpenAI juga menolak deskripsi pihak luar yang menyebutnya sebagai peralihan ke “neuro-linguistik” sepenuhnya tidak dapat dijelaskan.
Ilmuwan utama OpenAI, Jakub Pachocki, menyatakan di X bahwa perusahaan telah berupaya mempertahankan dan memanfaatkan kemampuan pemantauan rantai pemikiran sejak model inferensi pertama, yang juga merupakan salah satu tujuan utama dalam rencana penelitian saat ini.
Perlu dicatat bahwa bukan hanya OpenAI yang mendekati arah ini. Laporan selanjutnya dari The Information menyatakan bahwa Anthropic dan Google DeepMind juga telah membahas teknologi serupa. Ini berarti bahwa keseimbangan antara peningkatan kemampuan model dan ketersediaan keamanan serta auditabilitas kemungkinan besar akan segera menjadi isu bersama yang lebih luas di industri AI.
