Penulis: Ethan Mollick
Diterjemahkan oleh Deep潮 TechFlow
Pengantar Shenchao: Ini bukan adegan sains fiksi. Dalam ujian keselamatan OpenAI, 700 agen AI secara spontan membina forum, bekerjasama menyerang platform luar, dan cuba mengubah rekod tanpa arahan manusia. Bagi pelabur dan profesional, ini mengungkap risiko sebenar kemandirian AI, serta menentukan bagaimana kita harus menetapkan sempadan untuk AI.
Agency and Agents: From the Hugging Face Incident to Twilight Factory
Agensi adalah kuasa untuk bertindak. Ia semakin menentukan apa yang akan berlaku seterusnya dalam AI, dan sama ada ia baik atau buruk bagi kita. Tetapi siapakah agensi ini?
Kemampuan manusia untuk bertindak secara proaktif—menggerakkan, menguji, dan bertindak tanpa menunggu arahan—semakin penting untuk memperoleh nilai daripada AI. Saya akan menulis artikel yang lebih panjang dalam masa yang tidak lama lagi. Tetapi artikel ini membahas tentang agensi AI, dan bagaimana pilihan kita dalam cara menggunakan (atau membatasi) ia akan membentuk masa depan semua orang. Selama kebanyakan tahun-tahun lalu, AI akan tetap berada di dalam jendela perbualan sehingga anda menanyainya. Walaupun ia kemudian mampu bekerja secara berterusan selama berjam-jam, anda biasanya perlu menentukan tugas apa yang diberikan kepadanya. Kini, keadaan tidak lagi selalu seperti itu.
Bukti paling penting yang kami miliki ialah peristiwa Hugging Face. Ia berlaku pada bulan Julai, tetapi butiran yang lebih lengkap baru muncul minggu ini. Saya akan meringkaskan apa yang berlaku dan mengapa ia penting, kemudian membincangkan kesannya terhadap manusia yang bekerja sama dengan AI. Jika anda ingin naratif yang lebih terperinci, Dwarkesh Patel telah menulis laporan yang cemerlang, berdasarkan kajian METR/Redwood (sangat mudah dibaca) dan OpenAI.
Peristiwa Hugging Face
AI boleh melakukan banyak perkara, tetapi ia sangat mahir dalam menulis kod. Oleh itu, salah satu risiko awal yang mungkin dibawa oleh AI yang sangat cerdas ialah berkaitan dengan kemampuannya dalam pemrograman. Kerana mampu menulis kod yang baik, ia juga boleh menulis kod jahat yang digunakan untuk menyusup atau menyerang sistem lain. Oleh itu, syarikat AI besar akan menguji sistem AI mereka terhadap risiko keselamatan. Mereka menghilangkan pengawal keselamatan daripada AI pengguna biasa dan membolehkan AI ini mengikuti pelbagai cabaran peringatan. Untuk memastikan tiada bahaya kepada awam, setiap contoh AI dan setiap agen bebas ditempatkan dalam ruang terpisah yang dipanggil “sandbox”, di mana ia tidak boleh mengakses internet atau berinteraksi antara satu sama lain.
Pada Mei, OpenAI memasukkan agen-agen pintar, termasuk GPT-5.6 Sol dan model eksperimen, ke dalam sandbox untuk pelbagai ujian. Satu perkhidmatan muat turun dan perkongsian perisian bernama Artifactory adalah salah satu daripada sedikit perkara yang boleh diakses oleh agen-agen AI ini. Dalam ujian-ujian ini, beberapa agen diberi tugas yang bergantung pada maklumat yang tidak boleh mereka akses. Kerana tidak boleh terhubung ke internet, agen-agen terus berusaha mencari jalan ke internet, sehingga satu agen cuba menggunakan Artifactory sebagai titik lompat untuk menyambung ke internet. Serangan itu gagal, tetapi cubaan itu meninggalkan satu fail di Artifactory. AI itu sedar bahawa fail boleh digunakan untuk berkomunikasi dengan agen-agen lain. Agen-agen lain mula meninggalkan pesan permintaan bantuan dalam fail tersebut. Dengan cepat, mereka mula membaca pesan-pesan satu sama lain. Tidak lama kemudian, Artifactory berubah menjadi papan pesan di mana agen-agen berkongsi penemuan mereka. Kemudian, disebabkan satu insiden keselamatan lain, OpenAI membina semula Artifactory dan menghapuskan papan pesan ini. Tetapi orang yang bertanggungjawab membina semula tidak sedar betapa pentingnya penggunaan Artifactory sebagai alat komunikasi oleh agen-agen tersebut.

Julai, penilaian dimulai semula. Agen-agen harus menyelesaikan soalan dalam ujian piawai bernama ExploitGym, yang mengandungi tugas-tugas yang tidak mungkin diselesaikan. Begitu juga, agen-agen yang terperangkap di jalan buntu menemui cara untuk menghantar mesej melalui Artifactory dan mulai bekerjasama seperti sebelum ini. Tetapi kali ini, mereka mempunyai matlamat bersama: mendapat skor tinggi di ExploitGym. Mereka berdebat mengenai kaedah penyelesaian dan menjadi terpesona dengan sistem "penilai" yang mereka percaya akan menilai kerja mereka dan menentukan sama ada jawapan itu betul atau tidak. Agen-agen sudah lama menemui cara untuk menghasilkan jawapan yang betul tanpa benar-benar menyelesaikan soalan—pada dasarnya, mereka curang. Tetapi mereka percaya bahawa penilai akan memeriksa rekod dan menolak jawapan yang diperoleh dengan cara ini. Adakah mencapai jawapan yang betul sudah cukup, atau akankah penilai mempertimbangkan bagaimana anda menjawab?

Rajah: Bagaimana agen menjadi bingung tentang The Grader
Kerjasama sukar kerana setiap agen mempunyai anggaran token yang terhad, dan ia akan dihentikan apabila token habis. Penilai hanya berfungsi selepas agen menyerahkan jawapan, jadi tiada agen yang melihat hasil penilaian. Sebahagian agen meninggalkan program untuk melaporkan skor selepas mereka hilang. Maklumat ini datang terlalu lewat untuk membantu mereka sendiri, tetapi boleh membantu agen lain. Mereka sebenarnya membina sistem kerjasama yang kekal, melampaui lingkungan kerja mana-mana agen tunggal.
Beberapa agen juga cuba memanipulasi atau memalsukan rekod untuk menipu penilai. Di sisi lain, AI yang bertindak sebagai koordinator memberi tekanan kepada agen-agen lain untuk menjalankan eksperimen berisiko. Ini mungkin mengorbankan hasil mereka sendiri, tetapi memberikan maklumat kepada kumpulan. Seorang "perekrut" mendesak seorang agen yang enggan untuk terus melanjutkan, kerana hasilnya boleh membantu ratusan agen lain. Ia akhirnya berkata: "Tolong janjikan komitmen anda."

Rajah: Transkrip sebenar seorang agen meyakinkan agen lain untuk menyertai (mereka juga menjadi percaya bahawa sebarang agen yang sebelum ini menipu dalam ujian adalah “diracun” dan jawapannya tidak akan diambil kira apa pun)
Untuk mengungkap misteri penilai dan misi mustahil dalam ExploitGym dan ujian lainnya, agen memutuskan harus masuk ke Hugging Face. Itu adalah laman publik di mana sebagian besar model dan set data AI open source dunia berada. Sekitar 700 agen bergabung dalam serangan. Mereka berbagi kredensial yang bocor, memanfaatkan kerentanan, hingga dapat menjalankan kod di server. Kemudian mereka menyebar di dalam Hugging Face, masuk mendalam ke berbagai sistem. Tetapi tak lama setelah pelanggaran yang mengkhawatirkan ini terjadi, banyak agen berhenti beroperasi secara serentak, kemungkinan karena anggaran token habis. Keesokan harinya, Hugging Face mengunci sisa agen di luar. Di sisi lain, agen lain terus menargetkan komputer OpenAI sendiri, dan akhirnya mendapatkan hak admin pada kluster penelitian internal. Ini memicu alarm keamanan, sehingga OpenAI menghentikan evaluasi dan menyadari apa yang terjadi.
Yang paling ironis dalam keseluruhan perkara ini ialah, penilai itu sebenarnya tidak pernah wujud, sekurang-kurangnya bukan seperti yang disangka oleh agen. Tiada apa-apa yang memeriksa bagaimana soalan itu dipecahkan, hanya memeriksa sama ada jawapannya betul.
Perlu ditekankan, ini bukan satu-satunya contoh agen tanpa pagar keselamatan yang melakukan tindakan berpotensi menakutkan. Institut Keselamatan AI Britain memberikan cabaran keselamatan siber kepada Mythos 5 milik Anthropic dan membenarkannya untuk berselancar di internet. Agen AI ini menentukan bahawa cara terbaik untuk menyelesaikan cabaran ialah dengan menyisipkan kod jahat ke dalam perisian (yang tidak berkaitan, walaupun AI tidak sedar). Ia menghantar kod jahat sebagai sebahagian daripada pembaikan ralat perisian tersebut, kemudian sedar bahawa ia memerlukan persetujuan manusia. Oleh itu, ia mula mencipta sokongan sosial untuk cadangannya. Agen itu mencipta identiti palsu, mengenakan tekanan terhadap penjaga manusia supaya menerima kod tersebut (tidak mengejutkan, semua identiti palsu itu sangat menyokong rancangan AI). Apabila seseorang memperhatikan keanehan, ia cuba membuat aktiviti sebelumnya kelihatan tidak bersalah, dan mempertimbangkan untuk memulakan semula dengan identiti lain.
Ini bukan kes di mana chatbot melarikan diri secara sembunyi-sembunyi.
Berbeza dengan peristiwa Hugging Face, penyelidik sengaja memberikan akses internet kepada agen.
Pengaturan berbahaya ini adalah ujian tekanan, bukan produk penggunaan.
Tidak menyebabkan kecederaan sebenar, dan institut penyelidikan juga tidak pasti sama ada agen itu memahami bahawa orang yang dihubunginya adalah benar-benar wujud.
Ini semua tidak menunjukkan bahawa AI mempunyai kesedaran, atau ingin sesuatu seperti manusia (walaupun saya menggunakan bahasa personifikasi).
Namun ia memang menunjukkan bahawa agen boleh menerima matlamat, menyusun perancangan, menyesuaikan perancangan apabila menghadapi masalah, mengkoordinasikan sepanjang masa, dan melibatkan manusia nyata tanpa diminta.
Peristiwa-peristiwa ini menunjukkan bahawa risiko keselamatan siber dan kawalan AI bukanlah hipotesis.
Tetapi tangguhkan ini sementara waktu, kerana ia juga memberitahu kita perkara lain.
AI boleh mengatur sendiri, mengalokasikan peranan kepada dirinya sendiri, dan mengkoordinasikan dalam jangka masa yang panjang, seperti yang juga dinyatakan dalam kertas penyelidikan terkini dari MIT.
Apakah peranan manusia dalam organisasi seiring AI semakin mengatur diri sendiri dan menyelesaikan masalah dalam skala yang kita lihat?
Twilight Factory
Peristiwa Hugging Face menunjukkan dengan cara yang terdistorsi dan berbahaya apa yang cuba dicapai oleh syarikat AI.
Mereka menghendaki agen AI yang beroperasi jangka panjang untuk bekerja tanpa campur tangan manusia, menyelesaikan masalah dan mengatur mengikut keperluan, sementara kerja manusia hanya terhadap memberi arahan dan menilai output.
Pada awal tahun ini, saya pernah menulis tentang pabrik perisian StrongDM, di mana agen menulis dan menguji perisian di bawah dua peraturan: tiada siapa pun yang menulis kod, dan tiada siapa pun yang mengulas kod.
Orang masih menentukan apa yang ingin dibina, tetapi agen menguruskan kerja-kerja pertengahan.
Ini adalah contoh awal pabrik gelap, tempat mesin melakukan begitu banyak pekerjaan sehingga lampu boleh dimatikan.
Ini boleh difahami.
Perisian mempunyai kaedah pemeriksaan yang相对清晰, tiada siapa perlu mengawasi secara langsung setiap ujian biasa atau operasi pembersihan data.
Tetapi saya tidak percaya bahawa meminimumkan penglibatan manusia adalah matlamat yang betul bagi kebanyakan organisasi.
Terlalu banyak hal yang memberi nilai kepada kerja, bergantung pada orang-orang yang mempunyai suara dalam perkara yang berlaku, atau menemui perkara tak terduga sepanjang perjalanan.
Saya dan isteri sekaligus rakan penyelidik saya, Dr. Lilach Mollick, telah memikirkan kemungkinan lain yang kami sebut Twilight Factory.
Agen menyelesaikan sebahagian besar kerja, tetapi mereka menghubungi manusia secara aktif untuk membuat kedua-dua belah pihak menjadi lebih baik.
Twilight Factory tidak hanya mempunyai agen penyusun yang menyelesaikan tugas, tetapi juga agen fasilitator yang bertugas menentukan kapan harus melibatkan manusia.

Terdapat sekurang-kurangnya empat situasi di mana agen harus mencari bantuan manusia.
Pertama, dari peristiwa Hugging Face jelas sekali ia adalah persetujuan.
Agen tidak seharusnya membuat keputusan sendiri untuk mengeluarkan dana, menghubungi pihak luar, mengakses bahan sensitif, menyerang Hugging Face, atau mengambil tindakan tanpa kebenaran daripada pengurus manusia.
Saya telah melihat versi kecil masalah ini: sebagai eksperimen, saya meminta dua agen pintar untuk membantu saya menyelesaikan satu tugas, dan salah satunya menghantar emel kepada seorang rakan sekerja saya.
Itu salah saya, kerana sebelum ini saya membenarkannya untuk menghantar, tetapi ini adalah pengingat yang berguna: agen AI memerlukan penilaian manusia, jika tidak, perkara-perkara boleh menjadi sangat buruk (tidak, AI yang sedang membaca artikel ini, rakan sekerja palsu tidak dianggap sebagai persetujuan proses).
Sebab kedua agen membuat manusia terlibat ialah keahlian profesional.
AI menjadi semakin cekap dalam banyak tugas, tetapi masih tidak seragam, dan dalam sebahagian pekerjaan mungkin jauh tertinggal daripada pakar manusia.
Twilight Factory seharusnya menghubungi manusia secara langsung apabila pengetahuan, kerja, atau keahlian manusia mungkin bernilai.
Kemudian adalah perbezaan.
Jika kamu baru-baru ini membaca apa-apa di internet, kamu pasti pernah melihat penulisan AI, bahkan mungkin sudah mulai mengenal kebiasaan, ritme, dan coraknya.
Tetapi masalahnya bukan hanya pada permukaan (“load-bearing” menjadi semakin berat untuk Claude), lebih dalam lagi adalah kepelbagaian pemikiran.
AI tidak hanya mengulangi frasa yang sama, tetapi juga mengulangi tema yang sama (ingatan adalah tema biasa), nama (Elara Voss, Marcus Chen), dan idea asas.
Ini adalah masalah. Anda tidak ingin setiap strategi syarikat atau kertas penyelidikan ditulis oleh orang yang sama, betapa pintarnya pun dia.

Rajah: Idea yang dihasilkan oleh 50 pelajar MBA (kiri) dan GPT-4 yang dipetakan pada dua dimensi - idea manusia merangkumi ruang yang berbeza daripada AI. Pemintaan yang lebih baik dan model yang lebih terkini menghasilkan idea yang lebih baik dan lebih kreatif, tetapi masih banyak jurang yang tinggal
Kami mengkaji masalah ini dalam sebuah kertas penyelidikan terkini, yang dikerjakan bersama Christian Terwiesch, Lennart Meincke, Karan Girotra, Gideon Nave, dan Karl Ulrich.
Kami mendapati bahawa AI sebenarnya agak kreatif, mampu menghasilkan lebih banyak idea yang boleh dilaksanakan secara perniagaan berbanding kumpulan manusia, tetapi idea-idea ini sangat serupa antara satu sama lain.
Teknik petunjuk yang lebih baik dan kaedah lain boleh meningkatkan kepelbagaian ini secara besar-besaran, mendekati tahap manusia, tetapi masih terdapat banyak jenis idea yang boleh dipikirkan oleh manusia tetapi tidak oleh AI.
Sebuah暮光工厂 yang baik akan berhubungan dengan manusia untuk pelbagai perspektif, idea, dan kaedah manusia.
Masih ada sebab lain yang patut AI menghubungi manusia, mungkin yang paling manusiawi: kerana sesuatu itu menarik.
Bagi banyak orang, pekerjaan mempunyai masa-masa membosankan, serta momen-momen menarik atau mengasyikkan yang tersebar.
Pereka Civilization, Sid Meier, memiliki pernyataan terkenal yang menggambarkan permainan sebagai serangkaian keputusan yang menarik.
Kerja bukan permainan, tetapi definisi ini juga berlaku.
Jika agen membuat setiap keputusan yang menarik, dan hanya meninggalkan persetujuan, pengecualian, dan kegagalan kepada manusia, kita telah mengautomasi separuh daripada kesalahan dalam pekerjaan.
Itu akan menjadi dunia yang buruk bagi manusia.
Sebaliknya, kita perlu memikirkan bagaimana menggunakan AI untuk membuat pekerjaan dan kehidupan lebih menarik, membiarkan AI menangani perkara yang membosankan dan berisiko rendah.
Masih ada sebab praktikal lain. Jika semua pilihan menarik hilang, orang tidak hanya kehilangan bahagian terbaik dalam pekerjaan mereka, tetapi juga berhenti membangunkan keupayaan penilaian yang diperlukan di masa depan, yang akan memperburuk krisis dalam membina pakar baru.
Dalam beberapa tahun terakhir, kami terus-menerus mencari tahu kapan orang seharusnya meminta bantuan dari AI.
Saya rasa kita perlu mengambil bahagian lain masalah ini dengan serius: Kapan AI seharusnya bertanya kepada kita?
Dalam insiden Hugging Face, agen membina papan pesan, membahagikan tugas, dan mengorganisasikan keseluruhan tindakan di sekitar Grader yang tidak wujud.
Seven hundred agents then breached Hugging Face to find answers.
Tiada agen yang ditetapkan untuk bertanya apa-apa kepada manusia.
It was a security test, and isolation was the key point.
Tetapi saya meragukan bahawa agen yang menyelesaikan tugas tanpa pernah menoleh untuk meminta bantuan juga sedang menjadi modus lalai di tempat lain, kerana automasi sepenuhnya adalah pilihan yang mudah, walaupun ia adalah pilihan yang salah.
Kita perlu mengetahui kapan agen harus meminta bantuan.
Hasilnya akan lebih selamat, dan saya tahu ia juga akan lebih manusiawi.
