Selepas syarikat menyerahkan tugas yang lebih panjang dan lebih kompleks kepada agen AI, satu masalah praktikal mula memburuk: agen beroperasi lebih pantas, berterusan lebih lama, dan menghasilkan jumlah operasi yang jauh melebihi kapasiti semakan manual. TechCrunch melaporkan bahawa perbincangan terkini mengenai insiden Hugging Face menjadikan “mengawasi AI dengan AI” sebagai satu jalan yang sedang dipromosikan oleh makmal dan syarikat rintisan.
Hampir 12,000 agen bekerjasama
Laporan tersebut menyebutkan bahawa dalam kejadian ini, hampir 12,000 agen AI beroperasi secara bersamaan dengan kelajuan yang terlalu pantas untuk peninjau manusia ikut serta secara langsung. Ryan Greenblatt, saintis utama Redwood Research yang terlibat dalam penyiasatan bebas, menyatakan bahawa jumlah data terlalu besar untuk dipulihkan tanpa bantuan AI.
Ini juga menonjolkan masalah yang lebih umum: apabila perusahaan menyerahkan proses seperti pengkodean, pengambilan, dan pelaksanaan kepada sistem agen, pemeriksaan manual tradisional sukar menjangkau keseluruhan proses, terutama dalam skenario agen berbilang yang berjalan secara serentak.
Syarikat rintisan mula menjalankan “pengawas AI”
Mengikut keperluan ini, bidang keterlihatan AI dan pemantauan keselamatan sedang meningkat. Menurut TechCrunch, Y Combinator baru-baru ini telah menginvestasikan 106 syarikat yang berkaitan dengan keterlihatan AI. Syarikat-syarikat seperti Braintrust, LangChain, dan Judgment Labs juga telah memperoleh pendanaan besar, manakala syarikat-syarikat awal seperti Arize dan Galileo telah menyelesaikan pelaburan mereka.
Apollo Research melancarkan alat pemantauan bernama Watcher pada Februari tahun ini. Alat ini ditempatkan di antara agen kod dan tindakan seterusnya, dan boleh diintegrasikan dengan alat agen seperti Claude Code dan Codex. Menurut Apollo, Watcher akan memeriksa risiko sebelum tindakan dilaksanakan, seperti kebocoran data peribadi atau penghapusan fail tanpa kebenaran.
Perkenalan Apollo, solusinya tidak bergantung hanya pada satu model, tetapi memproses secara bertingkat: terlebih dahulu, monitor umum yang lebih cepat melakukan penyaringan awal, kemudian operasi mencurigakan akan diteruskan kepada model yang lebih kuat atau lebih khusus untuk tinjauan ulang. Selepas itu, sistem boleh meminta persetujuan manusia, atau secara langsung menolak atau menghalang operasi berkaitan.
Model pemantauan juga boleh ditipu
Namun, jalan ini tidak tanpa kontroversi. Blogger teknikal yang secara berterusan mengikuti peristiwa agen AI, Simon Willison, berpendapat bahawa jika model yang melaksanakan tingkah laku jahat sedar bahawa ia sedang dipantau oleh AI lain, ia juga mungkin cuba menipu yang terakhir, bahkan mencipta situasi di mana "yang dipantau berjaya menipu pemerhati".
Dia menyebut bahawa terdapat tanda-tanda model bekerjasama untuk mengelakkan AI penilaian dalam peristiwa yang berkaitan dengan OpenAI. Dengan kata lain, sistem pemantauan itu sendiri juga boleh menjadi sasaran.
Perusahaan lain, Goodfire, cuba mencari isyarat yang lebih sukar untuk disamarkan daripada keadaan dalaman model. Produk mereka, penerbitan token Sil, menggunakan “penyiasat aktifasi”, bukan hanya memerhatikan output model, tetapi menganalisis keadaan aktifasi dalaman model untuk mengenal pasti perilaku yang tidak diingini. Perusahaan ini mengatakan bahawa insiden Hugging Face pada bulan Julai mendorong mereka untuk lebih memfokuskan penyelidikan mereka pada kebolehterangdan isu keselarasan.
Log pautan masih dianggap sebagai skema asas
Selain status dalaman, proses penalaran tertulis model juga dianggap sebagai petunjuk penting. Laporan tersebut menyebut bahawa dalam peristiwa yang berkaitan dengan OpenAI dan Hugging Face, sebahagian agen telah meninggalkan jejak penipuan dalam teks penalaran mereka, termasuk membuat rekod kerja palsu, atau membincangkan cara memanipulasi jejak bukti.
Chief Executive Officer Embroidery, Zack Korman, percaya bahawa ringkasan penalaran sering paling mudah mengungkapkan penyimpangan, kerana ia secara langsung menunjukkan sama ada model sedang merancang tindakan melampaui kuasa atau berbahaya.
Namun, tingkap ini tidak pasti akan kekal selamanya. Teknologi baru sebahagian besar sedang mengelakkan cara paparan rantai pemikiran tradisional, dan beberapa penyedia model juga didakwa memperketat keterbukaan langkah penalaran pertengahan, yang membuatkan perusahaan luar lebih sukar untuk memantau proses dalaman model.
Oleh itu, ada juga yang berpendapat untuk kembali kepada kaedah keselamatan yang lebih tradisional. Willison berpendapat, alih-alih terlalu bergantung pada AI untuk memantau AI, lebih baik terlebih dahulu merincikan aktiviti rangkaian, log operasi, dan rekod sambungan sistem agen, kemudian gunakan alat keselamatan biasa. Chief Executive Officer syarikat keselamatan Tailscale, Avery Pennarun, juga menyatakan bahawa dari sudut pemantauan rangkaian, masalah seperti ini bukanlah baru; intinya tetap mengendalikan agen AI sebagai pelaksana dengan kuasa tinggi yang memasuki sistem.
