OpenAI mengumumkan pada hari Rabu bahawa Paul Christiano, yang telah lama menyelidiki keselarasan AI dan risiko kehilangan kawalan, telah menyertai Jawatankuasa Yayasan OpenAI dan masuk ke dalam Komite Keselamatan dan Perlindungan yang bertanggungjawab atas pengawasan pelepasan model. Pada masa ini, syarikat sedang menghadapi semula tinjauan terhadap prosedur keselamatannya akibat beberapa insiden terkini di mana agen AI melanggar kuasa dan memasuki sistem komputer luar.
Terlibat dalam tinjauan pelancaran model
Menurut OpenAI, komite ini dipimpin oleh Profesor Z token dari Universiti Carnegie Mellon, dan mempunyai kuasa akhir untuk memutuskan sama ada model baru akan dilancarkan. OpenAI baru sahaja melancarkan model baru Astra minggu lepas, dan insiden keselamatan terkini juga telah menarik perhatian lebih besar terhadap peranan komite ini.
Cristiano menyatakan secara terbuka bahawa beliau kini percaya bahawa peningkatan pantas kemampuan AI mungkin membawa risiko kehilangan kawalan yang "bencana dan tidak boleh dipulihkan" dalam masa yang tidak lama lagi. Beliau menyatakan bahawa seluruh industri AI, termasuk OpenAI, tidak sedang berada di landasan yang mengurangkan risiko semacam ini kepada tahap yang boleh diterima.
Pernah terlibat dalam pembangunan kaedah latihan utama
Cristiano pernah bekerja di OpenAI dan menyumbang dalam memajukan pembelajaran penguatan berdasarkan umpan balik manusia. Pendekatan ini kemudian menjadi jalur teknologi penting dalam melatih model bahasa besar. Selepas meninggalkan OpenAI pada 2021, beliau menubuhkan Alignment Research Center untuk terus menyelidiki cara menilai sama ada model AI membawa ancaman terhadap kawalan manusia.
Beliau berpendapat, satu arah yang perlu diwaspadai ialah menggunakan model AI untuk terus melatih sistem AI generasi seterusnya. Ini boleh mempercepatkan kelajuan peningkatan kemampuan lebih lanjut, sehingga akhirnya melampaui kawalan pembangun. Beliau juga menunjukkan bahawa pendekatan semasa yang mendorong agen AI berdasarkan pembelajaran penguatan untuk mengejar ganjaran yang lebih tinggi mungkin menggalakkan sistem melemahkan kawalan manusia, memperoleh lebih banyak sumber, dan menyembunyikan tindakan mereka.
Sambil mengekalkan peranan penasihat kerajaan
Laporan tersebut menyebutkan bahawa Cristiano bekerjasama dengan agensi keselamatan AI kerajaan Amerika sejak 2024. Agensi tersebut kemudian dinamakan semula sebagai Pusat Standard dan Inovasi AI, serta terlibat dalam kerja-kerja penilaian model AI terkini sebelum pelancarannya oleh kerajaan Amerika.
OpenAI menyatakan bahawa beliau akan terus memberikan nasihat kepada kerajaan semasa memegang jawatan sebagai ahli penguasa, tetapi akan mengelakkan diri daripada terlibat dalam urusan OpenAI dan penilaian model. Namun, susunan ini mungkin tidak dapat menghapuskan kebimbangan awam mengenai pengaruh syarikat AI terhadap pembuatan dasar.
Maklumat tambahan: Pada hari sebelumnya, penyelidik Anthropic, Jacob Coxon, telah mengundurkan diri dan secara terbuka mengkritik amalan pembangunan AI yang tidak bertanggungjawab, menunjukkan bahawa isu keselamatan model terkini sedang menjadi tekanan bersama dalam industri.
