Jalan AI Menuju Penguasaan: Di Mana Sistem Penilaian Wujud, AI Mengikuti

iconTechFlow
Kongsi
AI summary iconRingkasan
Kepemimpinan AI semakin meningkat di mana sistem penilaian wujud, seperti dalam Go, catur, dan pelipatan protein. Gerakan Lee Sedol oleh AlphaGo, penguasaan catur AlphaZero, dan terobosan protein AlphaFold2 menunjukkan AI berkembang dalam matlamat yang boleh diukur. Pedagang yang memantau altcoin untuk diperhatikan harus memperhatikan tren ini. Semasa AI meresap ke dalam bidang yang terstruktur, indeks ketakutan dan keserakahan mungkin mencerminkan ketidakpastian pasaran. Hadapan seterusnya? Aktiviti manusia tanpa metrik yang jelas.

Penulis: Robonaissance

Diterjemahkan oleh Deep潮 TechFlow

Pengenalan DeepCha: Permainan go, catur, pelipatan protein—bidang-bidang yang kelihatan memerlukan intuisi dan kreativiti manusia, mengapa semuanya berturut-turut diremukkan oleh AI? Artikel ini mengungkap satu pola yang diabaikan: yang menentukan sama ada AI boleh melampaui manusia bukanlah kesukaran tugas, tetapi sama ada ia boleh memberi markah kepada kejayaan. Apabila suatu bidang membina standard penilaian, ia telah menetapkan pengiraan mundur untuk kekalahan dirinya sendiri.

Dipilih daripada siri Whatever You Ask For, mengenai satu-satunya kerja yang tidak boleh dilakukan oleh mesin untuk kita.

Satu per sepuluh ribu

Pada 10 Mac 2016, di sebuah hotel di Seoul, sebuah mesin membuat langkah yang tidak difahami oleh semua orang di dalam ruangan, sementara lawannya tidak berada di tempat.

Lee Se-dol pergi merokok. Pada masa itu, beliau berusia 33 tahun dan memegang 18 gelaran juara dunia, diakui sebagai pemain go terkuat pada generasinya. Beliau kalah pada permainan pertama pada hari sebelumnya, dan ketika memasuki permainan kedua, keyakinan awalnya berkurang, dengan sikap yang lebih berhati-hati. Semasa beliau berada di luar, AlphaGo memilih langkah ke-37, dan penyelidik DeepMind, Huang Shi-jie, menggantikan mesin itu dengan tenang meletakkan biji catur di papan.

The piece landed on the fifth line.

Bagi mereka yang tidak faham go, ini tidak bermakna apa-apa. Bagi yang faham, ini hampir seperti kegilaan. Pada peringkat pembukaan dan pertengahan permainan, posisi yang jauh dari tepi dianggap tidak efisien—tidak dapat menguasai wilayah nyata dan tidak mampu mempertahankan wilayah, sama saja dengan memberi mata kepada lawan. Ini adalah gerakan yang akan diperbaiki oleh guru terhadap pemula. Di ruang penerangan, pemain profesional top Michael Redmond, ketika menyiar langsung pertandingan itu, awalnya menganggap isyarat papan go telah rosak. Dia mengambil sebiji batu, lalu meletakkannya semula.

Li Se-guk kembali duduk dan memandang papan catur selama lama tanpa bergerak. Berbagai perkiraan waktu berbeza antara sekitar 12 hingga 15 minit. Fan Hui, juara Eropah yang dikalahkan oleh AlphaGo lima bulan yang lalu, berada di dalam bangunan itu untuk menyaksikan permainan. Setelah memandang lama, kesimpulannya ialah: "Ini bukan cara manusia bermain. Saya tidak pernah melihat seseorang bermain seperti ini."

Dia betul, dan kebenarannya boleh diukur. Sistem DeepMind mempunyai mekanisme anggaran dalaman yang, melalui pembelajaran daripada banyak permainan manusia, menganggarkan kebarangkalian manusia membuat langkah tertentu dalam sebarang kedudukan. Untuk langkah ke-37, nilai anggaran ini kira-kira satu dalam sepuluh ribu.

Mesin masih turun, dan langkah ini memenangkan permainan keseluruhan.

Tafsiran yang selesa terhadap cerita ini ialah bahawa mesin bekerja sangat keras untuk mempelajari para master manusia, dan akhirnya mengejar mereka yang terkuat. Tafsiran ini salah, dan nombor satu per sepuluh ribu justru menunjukkan mengapa ia salah. Sistem yang belajar dan meniru langkah-langkah manusia mempunyai batas atas, iaitu langkah-langkah manusia itu sendiri. Apa yang berlaku di Seoul ialah, sistem itu tidak lagi dibatasi oleh batas atas itu, kerana matlamat yang diberikan kepadanya bukanlah pengiktirafan daripada para master manusia, tetapi kemenangan dalam permainan.

Perbezaan ini memberikan arahan yang lebih berguna daripada pujian. Jika anda ingin mengetahui aktiviti manusia mana yang telah kalah dalam dimensi kemampuan semata-mata, dan yang seterusnya, soalan yang perlu ditanya bukanlah seberapa sukar aktiviti itu, seberapa memerlukan kreativiti, atau seberapa banyak intuisi yang diperlukan. Soalannya jauh lebih membosankan daripada itu.

Masalahnya, adakah kejayaan boleh dinilai.

Satu per satu

Permainan catur telah kalah 19 tahun yang lalu, dengan cara yang sama sekali berbeza.

Deep Blue pada tahun 1997 mengalahkan Kasparov menggunakan arsitektur yang pada dasarnya merupakan tindakan ekspresi manusia yang besar. Fungsi penilaianya—komponen yang melihat suatu posisi dan memberikan angka seberapa baiknya—dirakit dan disetel dengan bantuan para grandmaster. Pengetahuan catur manusia diekstraksi dengan susah payah dari para pemain catur, lalu dimasukkan ke dalam mesin. Yang ditambahkan oleh mesin adalah kemampuan pencarian: melihat lebih banyak langkah ke depan lebih cepat, tanpa lelah, dan tidak kehilangan bidak akibat kehilangan fokus.

Ini adalah kemenangan sejati, dan sepatutnya dianggap sebagai kemenangan. Tetapi perhatikan bentuknya. Pemahaman Deep Blue terhadap catur adalah pemahaman manusia. Keunggulannya ialah kelajuan. Jika anda bertanya mengapa ia menilai suatu kedudukan dengan cara itu, jawapannya akhirnya akan berpaut pada seseorang yang memberitahunya untuk berbuat demikian.

20 tahun kemudian, DeepMind melancarkan sistem bernama AlphaZero, yang bentuknya berubah.

AlphaZero diberikan peraturan catur. Ia tidak diberikan perpustakaan pembukaan—senarai langkah pertama yang telah dikaji yang menjadi asas setiap program serius. Ia tidak diberikan jadual akhir permainan. Ia tidak diberikan satu permainan manusia pun. Ia bermain melawan dirinya sendiri, bermula dengan langkah rawak, dan menyesuaikan dirinya berdasarkan apa yang memenangkan permainan.

Sekitar empat jam kemudian, DeepMind menganggap peringkatnya melebihi program tradisional terkuat pada masa itu, Stockfish 8. Sekitar sembilan jam kemudian, ia bermain seratus permainan melawan Stockfish dalam kondisi waktu terbatas, menang 28 permainan, tidak kalah sekalipun, dan 72 permainan berakhir seri. Makalah tersebut melaporkan bahawa dalam masa 24 jam, ia mencapai tahap supermanusia dalam catur, shogi, dan go.

Angka-angka ini sering dirujuk tanpa sebahagian cerita yang lain, yang mana sebahagian itu sangat penting. Permainan catur melawan diri sendiri dihasilkan di atas lima ribu unit pemproses tensor generasi pertama, dengan enam puluh empat unit generasi kedua melatih rangkaian, semuanya berjalan secara serentak. Empat jam masa jam dinding adalah empat jam pengiraan—jumlah yang tidak boleh disusun oleh mana-mana individu, bahkan sedikit institusi. Pencapaian bukanlah bahawa bermain catur menjadi mudah. Pencapaian ialah, apabila anda mempunyai kekuatan pengiraan sebanyak itu, pengetahuan manusia bukan lagi sesuatu yang anda perlukan.

Kasparov mempunyai alasan yang lebih besar daripada siapa pun yang masih hidup untuk menganggap keputusan ini sebagai serangan terhadap dirinya, tetapi beliau menulis satu ulasan di jurnal《Science》dengan sikap yang sangat besar hati. Beliau memperhatikan bahawa AlphaZero tidak bermain catur yang membosankan, berhati-hati, cenderung kepada permainan seri seperti yang dijangka semua orang oleh mesin yang sempurna. Ia lebih mengutamakan aktiviti berbanding kekuatan biji, dan bersedia melepaskan biji untuk mencapai kedudukan yang kelihatan berisiko menurut pandangannya. Beliau menunjukkan bahawa program tradisional membawa prioriti dan prasangka penciptanya. AlphaZero menulis sendiri programnya. Beliau menyimpulkan bahawa gayanya oleh itu mencerminkan sesuatu yang lebih sejati daripada selera pengaturcara, dan memperhatikan bahawa ia memeriksa lebih sedikit kedudukan setiap saat berbanding enjin tradisional terbaik di dunia, tetapi masih menang.

Perincian terakhir ini patut diingat. Walaupun enjin tradisional meneroka lebih banyak kemungkinan setiap saat, ia kalah. Kelebihan AlphaZero bukanlah berusaha melihat lebih jauh, tetapi tahu di mana harus melihat, dan pengetahuan ini dibina daripada jutaan permainan melawan diri sendiri dan satu peraturan tentang siapa yang menang, tiada yang lain.

Keputusan permainan shogi lebih aneh bagi mereka yang layak memahaminya. Shogi adalah permainan papan Jepun, di mana biji yang dimakan akan kembali ke tangan pemain yang memakannya, menjadikan ketidakstabilan situasi melebihi catur, serta memiliki teori berabad-abad tentang cara melindungi keselamatan raja. Para pemain hebat yang melihat permainan mesin melaporkan bahawa pembukaan melanggar teori yang diketahui, dengan raja bergerak ke tengah papan pada masa-masa yang setiap buku mengatakan seharusnya ditarik ke sudut. Permainan-permainan ini hampir tidak dapat diinterpretasi oleh mata yang terlatih, tetapi mereka menang.

Letakkan dua sistem bersebelahan, polanya jelas hingga membuat tidak selesa. Biru gelap adalah pengetahuan manusia ditambah kecepatan mesin. AlphaZero adalah kecepatan mesin ditambah definisi kemenangan, pengetahuan manusia sengaja dihapus. Versi yang tanpa pengetahuan manusia lebih baik.

Semua ini tidak bermaksud bahawa mesin tahun 2016 itu sempurna, pertandingan Seoul yang sama mengandungi bukti.

Pada permainan keempat, dengan ketinggalan tiga set, Lee Sedol memasukkan sebiji batu di antara dua kumpulan batu AlphaGo di tengah papan catur, berjuang demi harga diri. Batu itu kemudian dikenali sebagai langkah ilahi. AlphaGo sendiri menganggarkan kebarangkalian manusia membuat langkah ini adalah sekitar satu dalam sepuluh ribu, suatu kebetulan yang menarik. Sistem itu gagal merespons. Penilaian kebarangkalian kemenangannya runtuh dalam beberapa langkah seterusnya, kekuatannya merosot, dan ia kalah dalam permainan ini.

Pada Mac 2016, masih terdapat satu lubang pada mesin itu, dan seorang manusia menemukannya di bawah tekanan paling tinggi, dengan seluruh dunia memperhatikan. Ini patut dinyatakan secara jelas, bukan diabaikan secara halus. Begitu juga penting untuk menyatakan apa yang berlaku kemudian: lubang-lubang semacam ini telah diperbaiki secara berterusan, dan penerus sistem tersebut tidak lagi kalah dalam permainan semacam ini; enjin teratas sudah lama tidak kalah kepada manusia dalam permainan serius. Keputusan tahun 2016 adalah gambaran sekilas perubahan, bukan keseimbangan kuasa yang kekal.

Dari papan catur hingga segala perkara lain, yang dipindahkan bukanlah kemenangan itu sendiri, tetapi mekanismenya. Catur dan Go ditakdirkan menjadi yang pertama jatuh, kerana sebabnya sangat mudah dan memalukan. Dalam permainan tersebut, kejayaan ditakrifkan oleh peraturan dengan ketepatan mutlak. Anda menang atau tidak menang, penilaian adalah percuma, serta-merta, dan tidak dipertikaikan. Satu sistem boleh bermain empat puluh juta permainan sendiri dalam satu hujung minggu, mendapat empat puluh juta keputusan yang jelas dan pasti.

Ini menunjukkan tempat seterusnya yang perlu diperhatikan. Bukan tugas-tugas mudah itu, tetapi tugas-tugas yang membawa papan skor sendiri.

Masalah lima puluh tahun

Protein adalah rantai asid amino yang melipat menjadi bentuk tiga dimensi yang kompleks pada saat ia dihasilkan. Bentuk menentukan fungsi protein. Urutan menentukan bentuk. Menurunkan bentuk daripada urutan telah menjadi masalah terbuka dalam biologi sejak awal 1970-an, dan ia tetap terbuka dengan cara yang menolak semua pendekatan: simulasi fizik dari prinsip pertama, analisis statistik berdasarkan hubungan evolusi, hingga intuisi struktur yang terkumpul selama puluhan tahun—semuanya gagal.

Pada tahun 1994, sekumpulan penyelidik yang dipimpin oleh John Moult melakukan sesuatu terhadap fakta ini: setiap orang dalam bidang ini mengklaim kemajuan, tetapi tiada siapa pun yang boleh memeriksa.

Mereka menciptakan satu ujian. Sejak itu, setiap dua tahun sekali, Critical Assessment of Structure Prediction (CASP) akan mengeluarkan struktur protein yang baru ditentukan secara eksperimen, dan dalam beberapa kes kes, bahkan masih dalam proses penentuan, serta mengumumkan urutan tersebut kepada seluruh dunia. Mana-mana pasukan boleh menghantar ramalan. Tiada siapa yang boleh mengakses jawapan, kerana jawapan untuk beberapa sasaran masih belum wujud. Apabila struktur eksperimen dikeluarkan, ramalan akan dinilai berbanding dengan jawapan sebenar.

Markah diberikan menggunakan ukuran yang dipanggil Global Distance Test, dari 0 hingga 100, yang boleh difahami secara kasar sebagai peratusan di mana kedudukan akhir rantai cukup dekat dengan kedudukan sebenar. Moult menyatakan bahawa sekitar 90 markah secara tidak rasmi dianggap setara dengan struktur yang ditentukan dalam makmal. Sepanjang sejarah penilaian, ramalan terbaik biasanya beredar sekitar 60 markah.

Pada CASP14 tahun 2020, peserta yang didaftarkan sebagai kumpulan 427 mencapai skor median 92.4 pada semua sasaran. Pada kelas paling sukar—sasaran tanpa kekerabatan struktur yang berguna—skor median ialah 87.0. Ralat purata kira-kira 1.6 angstrom, setara dengan lebar satu atom.

Moult telah menjadi ketua sejak permulaan pertandingan, dan beliau membawa penonton melalui sejarah pertandingan sebelum menunjukkan grafik. Grafik itu menerangkan keseluruhan cerita dalam satu gambar. Garis dua puluh tahun merangkak di sekitar 60, kemudian satu garis berdiri di tempat yang tidak pernah dicapai oleh garis-garis lain.

Kumpulan 427 ialah AlphaFold2. Moult mengumumkan bahawa masalah untuk rantai protein tunggal telah diselesaikan.

Kata penghingga seharusnya berada di sana, dalam setiap narasi yang jujur. Satu rantai bukanlah seluruh ilmu protein. Bagaimana protein menyusun diri menjadi kompleks, bagaimana ia bergerak, dan bagaimana ia berperilaku dalam sel hidup—semuanya masih terbuka. Cabaran besar yang tertutup adalah cabaran yang dinyatakan secara spesifik dan tepat.

Ketepatan ini justru merupakan inti cerita yang ingin disampaikan di sini. Bukan kerana struktur ramalan itu asalnya sangat mudah, kerana kegagalan selama separuh abad menunjukkan sebaliknya. Ia runtuh kerana pada tahun 1994, bidang ini membina papan markah sendiri.

Melihat CASP sebagai rekabentuk bukan sains, ia memberikan ukuran kejayaan yang jelas dan tepat untuk sebarang ramalan, yang boleh dikira dalam beberapa saat. Ia memberikan fakta piawai yang tidak boleh dimanipulasi, kerana jawapannya ditentukan secara fizikal oleh orang lain di makmal. Ia memberikan aliran masalah baru yang dihasilkan secara tetap mengikut jadual. Ia memberikan sejarah usaha penilaian selama tiga puluh tahun, iaitu rekod pengelasan tentang apa yang lebih baik dan apa yang lebih buruk dalam bidang ini.

Sebuah bidang yang melakukan semua ini secara tidak sengaja mempersiapkan serangan automatik terhadap masalahnya sendiri. Skor adalah prasyarat. Semua yang lain adalah kejuruteraan dan pengiraan, dan kedua-duanya menjadi lebih murah setiap tahun selama masa yang panjang.

Ini adalah promosi yang dibuat dengan mudah yang mengejutkan. Di mana pun terdapat disiplin yang mencapai konsensus patokan, sebuah sasaran diterbitkan. Terjemahan mesin mempunyai patokan penilaian. Pengenalan suara mempunyai patokan penilaian. Pengelasan imej mempunyai koleksi satu juta gambar yang ditandai dan pertandingan tahunan, setiap orang yang melihat pertandingan itu tahu bagaimana ceritanya berakhir. Hukumnya bukan sesuatu yang sukar yang jatuh dahulu, atau sesuatu yang mudah yang jatuh dahulu. Hukumnya ialah sesuatu yang diukur yang jatuh dahulu.

Ini menimbulkan soalan yang jelas terhadap semua perkara yang belum diukur.

Memberi penilaian kepada perkara yang tidak boleh dinilai

Tembok pertahanan terakhir seharusnya adalah perkara-perkara yang tidak boleh dinilai.

Penulisan adalah contoh standard. Tiada program yang boleh mengambil satu perenggan dan mengembalikan nombor yang menyatakan seberapa baik ia. Dua orang penyunting yang cekap boleh tidak bersetuju. Seorang penyunting yang sama boleh tidak bersetuju dengan dirinya sendiri pada hari yang berbeza. Kualiti bahasa terikat erat dengan konteks, audiens, tujuan, dan selera, yang semuanya tidak boleh diringkaskan menjadi satu ukuran. Jika mesin memerlukan papan mata, tetapi bahasa tidak mempunyai papan mata, maka bahasa adalah selamat.

Argumen ini adalah sah. Perkara yang berlaku kepadanya adalah sebab paling penting dalam keseluruhan naratif ini.

Tidak ada ukuran objektif yang baik untuk bidang ini. Masih tidak ada perkara seperti itu. Ia menciptakan satu skor menggunakan bahan yang tersedia satu-satunya, iaitu penilaian manusia itu sendiri.

Sejarah kaedah ini lebih lama daripada yang disangka kebanyakan orang. Pada tahun 2008, Knox dan Stone menggambarkan satu sistem bernama TAMER, di mana manusia memantau tingkah laku agen pintar dan memberikan penilaian, yang kemudian digunakan untuk melatih model untuk meramalkan apa yang akan dikatakan oleh manusia. Selepas itu, isyarat latihan diberikan oleh model, bukan manusia. Pada tahun 2017, Christiano dan rakan-rakannya menerbitkan karya yang dianggap oleh kebanyakan orang sebagai asal langsung kepada amalan semasa, dengan mengaplikasikan idea ini kepada agen permainan Atari. Pada tahun 2019, Ziegler dan rakan-rakannya mengaplikasikannya kepada model bahasa, dan kebanyakan istilah yang digunakan hari ini ditetapkan dalam kertas kerja itu. Pada tahun 2022, Ouyang dan rakan-rakannya menunjukkan kaedah ini pada skala industri dalam tugas mengikuti arahan, dan tidak lama selepas itu, kebanyakan orang di bumi tanpa sedar telah mengalami hasil-hasil ini.

Mekanisme utamanya patut difahami secara mendalam, kerana ia lebih mudah berbanding yang didengar.

Seseorang duduk di hadapan dua teks, kedua-duanya dihasilkan oleh model berdasarkan petunjuk yang sama. Tugas bukanlah memberi markah. Memberi markah adalah perkara yang dilakukan manusia dengan buruk, kerana tujuh markah seseorang ialah lima markah orang lain, dan bahkan orang yang sama tidak stabil dalam masa satu petang. Tugasnya hanyalah menyatakan yang mana lebih baik. Ini adalah penilaian yang boleh dibuat manusia dengan boleh dipercayai, dan kaedah matematik untuk menukar sekumpulan perbandingan seperti ini kepada skala yang konsisten, lebih tua daripada bidang yang menggunakannya, dan boleh ditelusuri kembali kepada kerja Bradley dan Terry pada tahun 1952 mengenai perbandingan berpasangan.

Pertimbangkan keadaan kerja yang mendorong penilaian semacam ini, kerana ia akhirnya akan memberi kesan. Orang ini membuat banyak penilaian seperti ini setiap jam, dibayar untuk membandingkan panduan tertulis yang menjelaskan apa yang dianggap sebagai jawapan yang lebih baik oleh pelanggan. Sesetengah pasangan hampir serupa sepenuhnya. Sesetengahnya melibatkan topik yang orang ini tidak tahu apa-apa tentangnya, dan dalam kes seperti ini, jawapan yang lebih yakin dan lebih teratur biasanya dipilih, sama ada ia lebih tepat atau tidak. Ini bukan kritikan terhadap orang-orang ini. Ini adalah gambaran tentang apa yang akan dilakukan sesiapa sahaja dalam keadaan seperti ini, dan pilihan yang dihasilkan itulah bahan mentah.

Kumpulkan cukup banyak pilihan ini, dan anda boleh melatih model kedua yang bertugas meramal teks mana antara dua teks yang lebih disukai oleh manusia. Model kedua ini mengeluarkan nombor. Dan nombor itulah satu-satunya perkara yang selama ini hilang.

Perhatikan dengan teliti apa yang sedang dibina di sini, kerana ia mudah dilupakan. Skor yang dioptimalkan bukanlah tentang fakta dunia. Ia tentang model kita. Ia merupakan salinan yang dikompresi dan dipelajari terhadap penilaian sekumpulan orang tertentu yang dipekerjakan pada masa tertentu, bekerja di bawah arahan tertentu, dan seperti semua orang lain, merasa letih pada petang hari. CASP menilai ramalan berdasarkan realiti fizikal yang ditentukan oleh makmal, manakala sistem ini menilai teks berdasarkan gambaran statistik yang diakui oleh manusia.

Gambar ini berguna. Tetapi ia juga pasti merupakan penghampiran, dengan perbezaan antara ia dan objek yang dilukis, yang tidak dipahami sepenuhnya oleh siapa pun. Apa-apa yang tidak dapat ditangkap oleh model preferensi kami mengenai preferensi sebenar kami tidak termasuk dalam sasaran, oleh itu tidak akan dioptimakan, dan dengan itu akan terjejas oleh apa sahaja keadaan — dan penguat optimasi yang kuat tidak mempunyai sebab untuk melindungi kuantiti ini.

Ini adalah fakta mengenai konstruksi, dan tidak ada klaim dibuat mengenai seberapa buruk akibatnya ketika dinyatakan di sini. Poin yang sedang dibahas lebih sempit dan lebih sukar untuk dibantah. Kategori yang tidak dapat dinilai jauh lebih kecil daripada yang tampak. Jika suatu bidang menolak pengukuran, pengukuran dapat dibangun dari preferensi manusia dan terus dilanjutkan. Garis pertahanan ini hanya berfungsi apabila tidak ada yang memikirkan untuk membuat skor.

Apa yang akan jatuh seterusnya

Ini meninggalkan satu masalah praktikal dan satu jawapan yang boleh digunakan.

Pilih mana-mana aktiviti yang anda sukai: pekerjaan, kecekapan, kerjaya, atau tugas yang telah anda belajar selama bertahun-tahun untuk dikuasai. Tanyakan tiga soalan.

Pertama, adakah kejayaan dan kegagalan boleh dibezakan dengan boleh dipercayai? Bukan dengan sempurna, dan bukan setiap orang mampu, tetapi cukup konsisten agar penilai yang cekap kebanyakannya bersetuju. Permainan lulus ujian ini dengan mudah. Ramalan struktur protein lulus ujian ini kerana makmal akhirnya akan menghasilkan jawapan. Penulisan tidak lulus dalam erti kata mutlak, tetapi lulus dalam erti kata relatif kerana orang biasanya mampu menyatakan cubaan mana yang lebih baik antara dua cubaan.

Kedua, adakah penilaian ini boleh dihasilkan secara besar-besaran dengan kos rendah? Soal ini menentukan masa, bukan kemungkinan. Sebuah penilaian percuma dan serta-merta, seperti dalam permainan, bermakna sistem boleh menghasilkan jutaan data latihan sendiri. Penilaian yang memerlukan makmal lebih perlahan tetapi masih mungkin, dengan arsip usaha penilaian selama tiga puluh tahun. Penilaian yang memerlukan pembacaan teks manusia yang dibayar sangat mahal, dan itulah sebabnya begitu banyak usaha dikeluarkan untuk melatih model meniru manusia ini dan mengeluarkan mereka dari kitaran.

Ketiga, keputusan ini bukan tentang kapan satu bidang akan runtuh, tetapi tentang apa yang akan berlaku selepas itu: Skor ini benar-benar apa yang anda inginkan? Skor permainan adalah apa yang anda inginkan, kerana dalam permainan, kemenangan secara definisi adalah segalanya. Struktur protein yang diukur melalui eksperimen sangat dekat dengan apa yang anda inginkan. Model yang belajar daripada preferensi penanda bukanlah apa yang anda inginkan. Ia adalah gambaran apa yang anda inginkan, dan terdapat jurang antara gambaran dan wajah.

Gunakan tiga soalan ini untuk menguji pekerjaan anda sendiri. Kebanyakan orang mendapati jawapan pertama datang dengan cepat dan mengganggu. Sebahagian besar apa yang kita sebut sebagai kemahiran, sekurang-kurangnya dalam erti kata relatif, boleh dinilai apabila orang yang berupaya membandingkan dua percubaan secara bersebelahan. Soalan kedua adalah tempat ketidakpastian sebenar, kerana kos dan skala adalah sasaran bergerak, dan kedua-duanya telah bergerak ke arah yang sama selama sangat lama. Soalan ketiga hampir tidak pernah ditanyakan, dan ia menentukan bagaimana bidang anda kelihatan di sebelah lain.

Perlu dilakukan latihan ini perlahan-lahan pada perkara-perkara biasa. Ambil contoh radiologi. Adakah kejayaan dan kegagalan boleh dibezakan? Ya, dan dengan tepat, kerana diagnosis akhirnya akan disahkan atau disangkal berdasarkan keadaan pesakit. Adakah penilaian boleh dihasilkan secara besar-besaran dengan kos rendah? Hampir boleh, kerana hospital telah mengumpulkan sampel penilaian selama puluhan tahun dalam bentuk imej dan keputusan pengesahan. Adakah skor ini apa yang anda inginkan? Jawapannya menjadi kompleks, kerana yang dinilai adalah keserasian dengan diagnosis yang direkodkan, manakala yang diinginkan ialah keadaan pesakit yang baik; kedua-duanya selari kebanyakan masa, tetapi justru berpisah dalam keadaan yang paling penting.

Ambil sesuatu yang kelihatan lebih selamat, seperti pengurusan. Masalah pertama sudah sukar kerana orang yang berkompeten tidak bersetuju sama ada seorang pengurus tertentu itu cemerlang, dan perbezaan pendapat ini tidak akan diselesaikan dengan cepat. Masalah kedua lebih sukar kerana kesan keputusan pengurusan baru muncul bertahun-tahun kemudian, dan tercampur dengan segala perkara lain yang berlaku. Masalah ketiga paling sukar kerana sebarang indikator alternatif untuk pengurusan yang baik yang dicadangkan oleh sesiapa sahaja—dari kadar kekalan hingga skor keterlibatan hingga output per orang—jelas bukanlah perkara itu sendiri. Berdasarkan diagnosis ini, pengurusan bukan selamat kerana ia mendalam. Ia tidak diukur, dan ini adalah bentuk perlindungan yang berbeza dan kurang menyenangkan.

Mesin telah menguasai sumbu pengoptimuman. Dengan pengiraan yang mencukupi pada sebarang sasaran yang dinyatakan secara jelas, mencari langkah yang baik bukan lagi persaingan, dan hasilnya seringkali tidak hanya lebih kuat daripada kita, tetapi juga lebih asing, mencapai tempat-tempat yang diajarkan oleh tradisi kita untuk tidak diperhatikan. Ini bukan ramalan. Ini adalah gambaran tentang catur, go, shogi, struktur protein, dan semakin banyak perkara yang dahulu berada dalam senarai yang hanya boleh dilakukan oleh manusia.

Yang tinggal ialah sasaran itu sendiri. Seseorang menentukan apa itu skor. Dalam setiap kes di atas, keputusan itu mengambil masa sepetang, dan setiap hasil luar biasa berasal daripadanya, setia kepadanya, dan tidak peduli terhadap apa sahaja yang dilupakan olehnya.

Jadi, soalan terakhir ini patut dipertimbangkan dengan mendalam. Dalam pekerjaan anda, sudah ada skor belum? Jika ada, siapakah yang menulisnya, dan adakah mereka memikirkan anda ketika menulisnya?

Ini adalah bahagian kedua siri "Whatever You Ask For", mengenai apa yang akhirnya diperlukan oleh mesin itu daripada kita, dan seberapa buruk kita melakukannya.

Penafian: Maklumat yang terdapat pada halaman ini mungkin telah diperoleh daripada pihak ketiga dan tidak semestinya menggambarkan pandangan atau pendapat KuCoin. Kandungan ini adalah disediakan bagi tujuan maklumat umum sahaja, tanpa sebarang perwakilan atau waranti dalam apa jua bentuk, dan juga tidak boleh ditafsirkan sebagai nasihat kewangan atau pelaburan. KuCoin tidak akan bertanggungjawab untuk sebarang kesilapan atau pengabaian, atau untuk sebarang akibat yang terhasil daripada penggunaan maklumat ini. Pelaburan dalam aset digital boleh membawa risiko. Sila menilai risiko produk dan toleransi risiko anda dengan teliti berdasarkan keadaan kewangan anda sendiri. Untuk maklumat lanjut, sila rujuk kepada Terma Penggunaan dan Pendedahan Risiko kami.