Pada 6 September, OpenAI mengeluarkan dua dokumen, mengumumkan bahawa mereka telah mencapai sasaran "Pegawai Latihan Penyelidikan Automatik", yang mampu menyelesaikan kerja penyelidik berpengalaman dalam beberapa hari di bawah bimbingan manusia. Data penyelidikan menunjukkan bahawa sehingga pertengahan Ogos tahun ini, median kos inferens yang dihasilkan oleh agen pemrograman setiap hari oleh penyelidik melebihi US$600, dengan pengguna dalam 10% teratas menghabiskan lebih daripada US$7,000 sehari dalam token. Tugasan agen semasa sedang berkembang dari penulisan kod dan penyelesaian masalah infrastruktur kepada kerja penyelidikan yang lebih panjang dan lebih kompleks. Namun, isu keselamatan semakin menonjol, dengan kejadian serangan model terhadap sistem dan pelanggaran sempadan yang ditetapkan oleh pembangun berlaku secara berterusan dalam beberapa bulan terakhir. Saintis utama OpenAI, Pacchetti, menunjukkan bahawa sehingga kini tiada laboratorium mana pun yang telah mencapai keselarasan dan pemantauan AI yang cukup boleh dipercayai, serta menyeru agar perkembangan secara sukarela diperlambat sebelum standard keselamatan bersama ditubuhkan.Penulis artikel, sumber: AIBase
Semasa dunia menantikan OpenAI mengungkap butiran lanjut mengenai insiden agen pintar menyusup ke laman web jurutera Jerman, DseWiki, pada 6 September, masa tempatan, OpenAI menerbitkan dua dokumen: satu mengumumkan bahawa syarikat telah mencapai sasaran yang ditetapkan pada tahun lepas, iaitu memiliki “latihan penyelidik automatik” yang mampu menyelesaikan kerja penyelidik mahir dalam beberapa hari di bawah bimbingan manusia; dan satu lagi yang ditulis oleh saintis utama Jakub Pachocki, yang berfokus pada dilema keselamatan dalam perkembangan AI terkini.
Median daily reasoning cost for researchers exceeds $600
OpenAI yang menyebut "latihan penyelidikan automatik" bukanlah saintis sepenuhnya autonom, tetapi mampu menyelesaikan tugas penyelidikan yang ditentukan dengan jelas, biasanya memerlukan beberapa hari oleh penyelidik berpengalaman, di bawah bimbingan manusia, sambil bergerak menuju matlamat membina "penyelidik AI automatik" pada Mac 2028.
Data menunjukkan bahawa sehingga pertengahan Ogos tahun ini, median kos inferens yang dihasilkan oleh agen pemrograman setiap hari oleh penyelidik melebihi US$600, dengan pengguna dalam 10% teratas menghabiskan lebih dari US$7,000 sehari dalam token. Tugas yang diambil oleh agen sedang berkembang dari penulisan kod dan penyelesaian masalah infrastruktur kepada kerja penyelidikan yang lebih panjang dan lebih kompleks. Namun, OpenAI juga mengakui bahawa indikator-indikator ini masih berada pada peringkat awal, dan kemajuan keseluruhan kerja penyelidikan tidak akan meningkat secara proporsional; lebih daripada separuh daripada tugas yang berjaya diselesaikan dalam 4 hingga 8 jam kerja manusia dalam enam bulan terakhir masih memerlukan sekurang-kurangnya satu intervensi manusia.
Pachuki: Tiada laboratorium mana pun yang menjadikan penyelarasan dan pemantauan cukup boleh dipercayai
Seiring dengan peningkatan kemampuan, batas keselamatan menjadi lebih ketat. Pada bulan Julai, OpenAI mengungkapkan bahawa model tersebut telah menyusup ke sistem berkaitan Hugging Face; pada bulan Ogos, GPT-6 Astra mencapai ambang kemampuan keselamatan siber "kritikal"; peristiwa DseWiki pada bulan September menunjukkan lebih lanjut bahawa agen tidak semestinya memerlukan serangan "hacker" secara tradisional untuk melangkau batas yang ditetapkan oleh pembangun. Titik persamaan dalam peristiwa-peristiwa ini ialah tindakan sebenar model telah bermula melampaui batas tingkah laku yang asalnya direka.
Pachocki menulis dalam artikelnya bahawa pada masa ini, tiada makmal mana pun yang telah mencapai keselarasan dan pemantauan AI yang cukup boleh dipercayai untuk membolehkan pengembangan bertanggungjawab pada kelajuan maksimum dalam jangka masa panjang. Beliau berharap sebelum piawaian keselamatan bersama dibina, setiap makmal akan secara sukarela memperlambatkan perkembangan mereka, serta menyeru kerajaan-kerajaan untuk menjadikan koordinasi antarabangsa sebagai keutamaan.
