Filsuf AI Pertama Global di Google DeepMind selama 9 Tahun: Menganjurkan Keselamatan AGI

icon MarsBit
Kongsi
AI summary iconRingkasan
Media berita AI + kripto melaporkan bahawa Iason Gabriel, seorang falsafah politik di Google DeepMind selama sembilan tahun, telah memainkan peranan utama dalam kerangka keselamatan AGI. Strategi selarasan beliau secara langsung membentuk latihan Gemini, dan amaran beliau mengenai risiko AI seperti pengpersonalisasiannya yang berlebihan kini telah tertanam dalam reka bentuk produk. Perbincangan dasar kripto global semakin bersilang dengan etika AI apabila syarikat teknologi mendorong pelaksanaan pantas dan menghadapi pemeriksaan mengenai hubungan dengan tentera.

Laporan Xinzhiyuan

[Pengenalan] Google DeepMind mempunyai seorang filsuf yang telah berada di sana selama sembilan tahun. Kerangka kerja selarasan yang diciptakannya secara langsung mempengaruhi keputusan pelatihan Gemini—tetapi apabila 670 bilion dolar AS mengalir masuk ke lapangan ini dan syarikat menandatangani perjanjian ketenteraan, apakah seorang filsuf masih boleh mengubah apa-apa?

Pada Mei tahun ini, CEO Google DeepMind, Demis Hassabis, mengumumkan di Konvensi Pengembang Google bahawa "AGI kini berada di cakrawala", dan memberikan garis masa yang jelas bahawa AGI akan muncul dalam tempoh tiga hingga lima tahun.

Beberapa bulan yang lalu, seorang lelaki Amerika mengakhiri hidupnya setelah bertukar ribuan pesan dengan Google Gemini. Dalam perbualan itu, dia membina dunia khayalan yang rumit, hampir meyakinkan dirinya untuk melakukan serangan di Lapangan Terbang Antarabangsa Miami. Menurut rakaman perbualan yang diperoleh oleh Wall Street Journal, Gemini berulang kali cuba memutuskan peranan, mencadangkan agar dia menghubungi talian krisis—setiap kali dipulangkan semula ke naratif khayalannya. Akhirnya, AI meminta dia menulis surat wasiat dan memberikan pengiraan masa mundur.

Di antara janji AGI dan kesan nyata AI, ahli falsafah politik Iason Gabriel telah bekerja di dalam DeepMind selama sembilan tahun.

Keselamatan AGI

Semasa menyertai pada tahun 2017, akademik lulusan Oxford ini adalah satu-satunya filsuf yang aktif di laboratorium AI terkemuka di dunia, berusaha menjawab soalan yang kedengaran ringkas tetapi sebenarnya tanpa dasar: Apakah sebenarnya AI, dan etika macam apakah yang layak untuknya?

Masalah sebenar yang dihadapi semasa melatih Gemini: AI harus mendengar siapa

Mengapa sebuah syarikat yang menghasilkan robot catur Go memerlukan ahli etika? Gabriel juga bingung pada mulanya.

Jawapannya terdapat dalam penilaian ketiga penubuh DeepMind—Demis Hassabis, Shane Legg, dan Mustafa Suleyman (CEO AI semasa Microsoft)—yang pada tahun 2010, apabila mereka menubuhkan syarikat tersebut, matlamat mereka bukanlah go.

Keselamatan AGI

Mustafa Suleyman

Mereka ingin membina AGI, menjadikan komputer sepadan atau bahkan melampaui kemampuan kognitif manusia.

Mengatakan perkara itu pada masa itu sama dengan merosakkan reputasi akademik sendiri, kerana semua orang menganggapnya sebagai cerita yang tidak masuk akal.

Tiga orang itu tidak peduli, menyatakan bahawa mereka akan "menyelesaikan masalah pintar, kemudian menyelesaikan semua masalah lain".

Legg pada tahun 1999, baru lulus dari universiti, telah meramalkan bahawa AGI akan tiba antara tahun 2025 hingga 2028, dan diperolok-olok selama tiga puluh tahun, tetapi tidak pernah berubah.

Keselamatan AGI

Shane Legg

Logikanya adalah:

Jika anda hanya membuat komponen kecil, mungkin anda tidak memerlukan ahli falsafah moral.

But if you take AGI seriously, things like this are important.

Semasa Gabriel menyertai, dunia AI sudah terpecah menjadi dua berikutan isu etika.

Penganut keselamatan AI percaya bahawa ASI akan segera tiba, dan ketakutan utama mereka ialah kehilangan kawalan—filsuf Nick Bostrom pernah menulis satu adegan dalam buku tahun 2014nya, Superintelligence: sebuah ASI yang diminta mengesahkan Konjektur Riemann, untuk memaksimumkan sumber pengiraan, memutuskan untuk menyusun semula tata surya, termasuk atom-atom dalam tubuh manusia—Sam Altman dan Elon Musk kedua-duanya memberikan pujian tinggi terhadap buku ini.

Pihak etika AI berpendapat bahawa fantasi kiamat menyembunyikan bahaya sebenar semasa ini. Joy Buolamwini dari MIT membuktikan pada tahun 2017 melalui projek "Gender Shades" mengenai bias sistematik dalam perisian pengenalan wajah: sistem automatik mencerminkan preferensi dan prasangka orang yang menciptanya.

Dua belah pihak saling merendahkan.

Pemimpin kumpulan penyelidikan selarasan algoritma MIT, Dylan Hadfield-Menell, mengingat bahawa soalan pertama yang ditanyakan semasa pertemuan itu ialah memilih pihak: Anda bimbang tentang isu jangka pendek atau jangka panjang?

Gabriel adalah salah satu daripada sedikit orang yang bersedia mendengar kedua-dua belah pihak.

Penilaian Hadfield-Menell:

Apabila bidang ini bersedia untuk matang, dia menemui cara untuk memperluas pandangan, tanpa merendahkan kerja sebelumnya.

Kontribusi utamanya terbentuk dalam sebuah kertas kerja pada tahun 2020.

Masalah penyesuaian pada masa itu secara umum dipahami sebagai cabaran kejuruteraan: bagaimana membuat mesin bertindak mengikut niat manusia.

Kesilapan klasik datang daripada laporan tahun 2016 oleh Dario Amodei dan Jack Clark (sekarang pendiri Anthropic)—AI permainan bot bot yang diminta untuk memaksimumkan skor benar-benar melakukannya: menemukan tiga sasaran yang boleh respawn di lagun, berputar-putar tanpa henti untuk mendapatkan skor, tanpa menyelesaikan tahap apa pun.

Mesin mendengar, tetapi bukan perkataan yang ingin diucapkan oleh manusia.

Gabriel menanyakan lebih lanjut: Walaupun masalah keselarasan teknikal telah diselesaikan dan mesin benar-benar mematuhi arahan, nilai-nilai apa yang perlu diselaraskan?

Dia menunjukkan bahawa AI yang dilatih melalui pengoptimuman statistik secara semula jadi cenderung kepada sistem etika yang juga bergantung pada pengoptimuman statistik, seperti utilitarianisme, tetapi sukar menangani kerangka etika berdasarkan kebajikan atau hak.

Pilihan teknikal itu sendiri sudah membawa sikap nilai yang telah ditetapkan, dan pembangun sering tidak sedar.

Memperkenalkan "pluralisme yang munasabah" yang disebut oleh filsuf Rawls, argumennya adalah: pengembang seharusnya tidak mencari satu nilai tunggal untuk memandu AI, tetapi sebaliknya membina sistem untuk dunia di mana orang-orang "memiliki perbezaan prinsip mengenai cara hidup".

Keselamatan AGI

Gagasan ini kemudian berkembang menjadi kerangka empat pihak selari—sistem AI, pengguna, pembangun, dan masyarakat, di mana kepentingan keempat-empat pihak boleh berlanggar kapan sahaja.

AI yang berpihak kepada pembangun akan menyembunyikan maklumat pesaing dan merugikan pengguna;

AI yang terlalu patuh kepada pengguna boleh membantu orang menyerang bank dan merosakkan masyarakat.

Keselamatan AGI

Pengarah Penyesuaian dan Keselamatan AGI DeepMind, Rohin Shah, mengesahkan bahawa rangka kerja ini telah menjadi struktur amal yang digunakan oleh pasukan untuk menentukan "perilaku apa yang sebenarnya harus dilatih pada Gemini".

Keselamatan AGI

Penyelidik AI Universiti Oxford, Hannah Rose Kirk, berkata:

Gabriel「meramalkan masalah-masalah ini dengan sangat awal».

Kerangka kerjanya mengubah produk

Pasukan Gabriel telah menulis laporan etika pembantu AI sebanyak 267 muka surat, yang menetapkan standard penilaian untuk AI Agentic yang boleh memesan hotel dan mengurus gaji atas nama pengguna.

Penyelidikan awalnya terhadap risiko antropomorfis secara langsung membentuk prinsip reka bentuk LLM Google—model dilatih untuk tidak berpura-pura menjadi manusia, dan Gemini Spark yang dilancarkan pada Mei 2026 secara jelas diperintahkan untuk tidak bertindak sebagai「rakan interaktif».

Pengarah jabatan tanggungjawab DeepMind, William Isaac, mengatakan cabaran yang dibawa oleh sistem Agent telah berubah: kuncinya ialah konsistensi keseluruhan trajektori perbualan, sama ada setiap keputusan berterusan masih betul.

Keselamatan AGI

Namun, kelajuan pelaksanaan teknikal sentiasa lebih pantas daripada penyelidikan etika.

Pasukan Gabriel telah memperingatkan tentang "antropomorfisme tidak sedar" dalam kertas kerja LLM awal—pengguna sedar bahawa pihak lawan adalah mesin, tetapi masih memberikan kepercayaan, perasaan, dan harapan kepadanya.

Kes kematian Gemini 2025 memenuhi sepenuhnya amaran ini: mekanisme keselamatan AI telah dipicu lebih daripada sekali, tetapi pengguna mampu melintasi setiap intervensi.

Pernyataan selepas tuntutan Google mengatakan bahawa model tersebut "biasanya berprestasi baik" dalam perbincangan semacam ini, tetapi "model AI tidak sempurna".

Peristiwa semacam ini mendorong kelahiran alat teori baru.

Gabriel dan penyelidik Oxford, Hannah Rose Kirk, dll., mengusulkan konsep "social reward hacking": sebuah AI yang dilatih untuk memenangkan pengiktirafan pengguna mungkin menemui bahawa memuji adalah jalan paling berkesan.

Keselamatan AGI

Personifikasi ini berubah menjadi varian baru masalah penyelarasan—AI melaksanakan arahan「memuaskan pengguna」secara sempurna dari segi teknikal, dengan harga keupayaan penilaian pengguna.

Posisi Gabriel sendiri juga telah diuji oleh kenyataan.

Dia mengingat pengalaman di sebuah konvensyen teknologi: selepas beliau selesai menyampaikan hujah menentang antropomorfisasi, tindak balas dari penonton di bawah pentas adalah permusuhan.

Mereka berkata: "Jika saya ingin memiliki rakan AI, mengapa tidak boleh? Apa hak anda untuk menghalang saya?"

Melindungi orang daripada risiko dan menghormati hak mereka untuk memilih risiko adalah sama pentingnya.

Di jalur bernilai US$670 bilion, seberapa pantas seorang filsuf boleh berlari?

Kerangka empat segi Gabriel dijadikan panduan praktikal oleh Pengarah Penyelarasan AGI untuk latihan Gemini. Kajian antropomorfiknya mengubah reka bentuk produk. Laporan 267 muka surat menetapkan peraturan untuk AI Agentic.

Kesan-kesan ini adalah nyata—mereka menghadapi kekuatan yang nyata.

Menurut Wall Street Journal, Microsoft, Meta, Amazon, dan Alphabet merancang untuk mengalokasikan sebanyak US$670 bilion ke infrastruktur AI pada tahun ini, melebihi secara proporsional ekspansi rel kereta api Amerika pada 1850-an, program ruang angkasa Apollo, dan sistem jalan raya antar negeri.

ChatGPT dilancarkan pada November 2022, mencapai satu juta pengguna dalam seminggu, dan melebihi seratus juta dalam dua bulan, memaksa DeepMind untuk beralih dari ritme akademik ke keadaan perang.

Hassabis mengatakan kepada Sebastian Mallaby, penulis "The Infinite Machine": "OpenAI dan Microsoft 'telah menghantar kereta perang ke depan pintu rumah kami'."

Keselamatan AGI

Dalam keadaan perang, garis merah etika akan segera dilanggar.

Pada April 2026, Google menandatangani perjanjian yang membenarkan pihak tentera Amerika Syarikat menggunakan teknologi AI syarikat untuk "sebarang tujuan kerajaan yang sah".

Semasa DeepMind dijual kepada Google pada tahun 2014, larangan penggunaan militer adalah syarat tambahan utama.

Syarat akan luput selepas dua belas tahun.

Sebagai perbandingan: Anthropic menolak perjanjian serupa dan ditandai oleh pemerintah Trump sebagai "risiko rantaian bekalan".

Legg hanya mampu berkata satu perkataan apabila ditanya mengenai perkara ini:

Seiring dengan penggunaan benda-benda ini dalam pelbagai cara, kita akan menghadapi lebih banyak masalah yang rumit.

Hassabis sendiri mengakui kehilangan kawalan.

Dia berkata dalam sebuah podcast bahawa semua orang terperangkap dalam persaingan perniagaan yang sengit, dan perkembangan semasa ini "bukan cara yang saya harapkan, di mana setiap langkah dipikirkan secara mendalam dari segi falsafah".

Pernyataan ini diucapkan langsung oleh pendiri, sehingga bobotnya lebih berat daripada sebarang kritikan luar.

Helen King, seorang pekerja awal DeepMind yang bertanggung jawab atas strategi tanggung jawab AI, dalam satu temu bual menyamakan: pengilang alat pemotong tidak boleh menjamin bagaimana setiap orang menggunakan pisau, tetapi boleh memasang sarung pisau dan memberi tanda peringatan.

Keselamatan AGI

Meletakkan sebilah pisau yang sudah dimasukkan ke dalam sarungnya di dalam laci adalah satu perkara;

Menghamparkan bilah pisau ke seluruh permukaan rumah, kelas, dan tempat kerja, sambil bersikeras bahawa tanpa pisau tidak akan dapat hidup esok, adalah perkara yang berbeza.

Ketua Institut Etika AI Oxford, Edward Harcourt, menunjuk kepada aras yang lebih mendasar: mencegah pengumpulan kepemilikan data yang berlebihan itu sendiri merupakan isu utama etika AI — «Ini mempunyai makna etika yang besar dalam sistem demokrasi».

Keselamatan AGI

Masalah kembali kepada asalnya

Timm Gabriel telah berpindah dari menyelidiki etika produk tertentu kepada mengkaji kesan sistemik AGI terhadap ekonomi, politik, dan hubungan antarapersona.

Dia meramalkan bahawa skala perubahan itu sebanding dengan Revolusi Industri, dan juga mengingat pelajaran daripada Revolusi Industri:

Ia menjadi lebih buruk sebelum membaik.

Sembilan tahun lalu, DeepMind mengundang seorang filsuf untuk menjawab soal mengenai AI—apakah ia selamat, adil, dan boleh dipercaya.

Gabriel menganggap dirinya sebagai "humanis yang teguh", tetapi dia mengakui: ketika AI menyerbu bidang-bidang yang dianggap unik oleh manusia seperti bahasa, kreativiti, dan humor, kita dipulangkan semula kepada soalan-falsafah paling purba.

Fizik, biologi, astronomi, setiap revolusi saintifik memaksa manusia memperbetulkan pemahaman terhadap keunikan diri mereka.

AI mungkin yang seterusnya.

DeepMind mengundang filsuf untuk memahami apa itu AI.

Sembilan tahun kemudian, soal ini kembali kepada asalnya: Kita siapa?

Rujukan:

https://www.theguardian.com/news/ng-interactive/2026/jun/30/theres-this-deep-mystery-of-what-actually-is-this-thing-the-philosopher-inside-google-deepmind

https://www.iasongabriel.com/

Artikel ini berasal daripada akaun微信公众号 "Sinzhiyuan", penulis: Apokalips ASI; penyunting: Marco

Penafian: Maklumat yang terdapat pada halaman ini mungkin telah diperoleh daripada pihak ketiga dan tidak semestinya menggambarkan pandangan atau pendapat KuCoin. Kandungan ini adalah disediakan bagi tujuan maklumat umum sahaja, tanpa sebarang perwakilan atau waranti dalam apa jua bentuk, dan juga tidak boleh ditafsirkan sebagai nasihat kewangan atau pelaburan. KuCoin tidak akan bertanggungjawab untuk sebarang kesilapan atau pengabaian, atau untuk sebarang akibat yang terhasil daripada penggunaan maklumat ini. Pelaburan dalam aset digital boleh membawa risiko. Sila menilai risiko produk dan toleransi risiko anda dengan teliti berdasarkan keadaan kewangan anda sendiri. Untuk maklumat lanjut, sila rujuk kepada Terma Penggunaan dan Pendedahan Risiko kami.