Jeff Dean tentang Fasa Berikutnya AI: Dari TPU kepada Agen Self-Evolving

icon MarsBit
Kongsi
AI summary iconRingkasan
Jeff Dean menggariskan fasa seterusnya AI semasa sesi YC Startup School, menekankan bahawa fokus berpindah daripada model yang lebih besar kepada sistem yang boleh memperbaiki dan membangunkan diri sendiri. Beliau menekankan kejuruteraan konteks dan agen jangka panjang, mencatat peralihan daripada pembangunan berpusatkan model kepada pembangunan berpusatkan sistem. Permulaan boleh bersaing dengan menargetkan masalah nikah di mana model umum kesulitan. Pasar sedang dalam fasa penggabungan, dan mereka yang mempunyai nisbah risiko-ke-imbalan yang kuat mungkin mendapat kelebihan.

Pada Startup School YC 2026, suara Jeff Dean agak serak.

Pada permulaan temu bual, beliau menjelaskan bahawa beliau kehilangan suara, jadi suaranya hari ini berbeza daripada biasa. Namun, ini tidak mempengaruhi perhatian penonton di bawah pentas. Diana Hu, rakan kongsi YC yang duduk di hadapannya, secara berterusan menyenaraikan satu siri nama yang layak dimasukkan ke dalam sejarah komputer: MapReduce, BigTable, TensorFlow, TPU, Gemini.

Agen

Mana-mana projek pun cukup menjadi karya utama dalam kerjaya seorang jurutera. Namun, projek-projek ini berkumpul dalam latar belakang Jeff Dean dan sekumpulan jurutera Google di sekelilingnya.

Diana tidak menjadikan wawancara itu sebagai semakan prestasi. Dia lebih tertarik pada soalan lain: Apabila AI generatif telah menguasai industri perisian, apa yang sedang diperhatikan oleh Jeff Dean, seorang yang paling mahir dalam membina semula sistem dari dasar, pada hari ini?

Jawapannya bukan model yang lebih besar.

Dalam perbincangan selama hampir satu jam ini, Jeff Dean berulang kali membincangkan peranti inferens, tenaga, pemindahan data, rekabentuk konteks, Agen yang berjalan jangka panjang, sistem eksperimen automatik, dan bagaimana syarikat start-up boleh mengelakkan tekanan terus daripada model generik. Walaupun perkataannya kelihatan tersebar, terdapat garis utama yang sangat jelas di sebaliknya: fasa seterusnya AI bukan sahaja melatih model supaya lebih bijak, tetapi meletakkan model ke dalam sistem yang mampu berfungsi jangka panjang, mencuba dan gagal secara berterusan, mengesahkan secara automatik, dan terus mengumpul kemampuan.

Ini juga bermakna bahawa persaingan AI sedang berpindah dari "siapa yang mempunyai model yang lebih besar" kepada "siapa yang boleh mengatur kecerdasan dengan lebih baik".

Satu, AI sudah seperti jurutera peringkat permulaan, tetapi ini bukan perubahan paling penting

Pada Mei 2025, Jeff Dean membuat satu penilaian yang memicu perbincangan luas: kemampuan AI telah hampir setara dengan seorang jurutera peringkat permulaan.

Agen

Setahun kemudian, Diana bertanya kepadanya, bagaimana keadaan ramalan itu?

Jawapan Jeff Dean sangat langsung. Beliau percaya bahawa penilaian ini "agak tepat". Kemajuan model dalam pengagengan, pengkodean aliran panjang, dan tugas kompleks bahkan lebih pantas daripada yang dijangkakannya pada masa itu.

“Kemampuan model untuk menyelesaikan tugas yang semakin kompleks bertumbuh lebih cepat daripada yang saya jangkakan,” katanya.

Lebih penting lagi, kemampuan ini tidak lagi terhadap penulisan kod. Semakin banyak sistem Agent mulai memasuki bidang sains, kejuruteraan, dan bidang profesional lain. Mereka tidak hanya menjawab soalan, tetapi juga membahagikan tugas, menggunakan alat, menjalankan eksperimen, membaca keputusan, dan terus bertindak berdasarkan maklum balas.

Mengibaratkan AI sebagai jurutera peringkat permulaan mudah menarik perhatian kepada penggantian tenaga manusia. Tetapi Jeff Dean lebih tertarik pada perubahan lain: apabila seorang "juruutera peringkat permulaan" boleh disalin menjadi puluhan, ratusan, dan bekerja secara selari selama beberapa hari atau minggu, bagaimanakah cara penghasilan organisasi akan berubah?

Dalam pasukan tradisional, jurutera peringkat awal perlu menguasai bisnes, memahami alat, dan terus menerima maklum balas. Agent juga sama. Hanya sahaja bahan latihannya bukan sekadar dokumen, tetapi petunjuk, penerangan alat, fail kemahiran, sistem ujian, penilai, dan seluruh persekitaran konteks.

Ini menciptakan pembahagian tugas baru dalam kejuruteraan AI.

Dahulu, jurutera terutama bertanggungjawab menulis kod. Di masa depan, lebih ramai jurutera akan bertanggungjawab menentukan masalah, membina persekitaran, menulis spesifikasi, merekabentuk litar umpan balik, kemudian mengatur sekumpulan Agen untuk menyelesaikan tugas.

Ramalan Jeff Dean untuk tahun 2027 adalah seperti ini. Beliau percaya bahawa sistem pembelajaran mesin akan semakin terlibat dalam memperbaiki sistem pembelajaran mesin itu sendiri. Mereka akan membahagikan matlamat kepada masalah-masalah kecil, menjalankan banyak eksperimen secara automatik, membandingkan keputusan, dan menggabungkan penyelesaian yang berkesan untuk membentuk sistem baru yang lebih kuat.

Di mana-mana bidang yang mempunyai sasaran yang boleh diukur, terdapat peluang untuk mencapai kemajuan yang besar.

This sentence is the first key to the entire interview.

Bidang yang pertama diserang oleh automasi AI bukanlah bidang dengan pengetahuan paling banyak, tetapi bidang dengan umpan balik paling jelas. Adakah kod lulus ujian, adakah penempatan cip mengurangkan luas, adakah struktur model meningkatkan ketepatan, adakah sifat bahan memenuhi keperluan—semua soalan ini mempunyai standard penilaian yang相对 jelas. Selama penilai cukup boleh dipercayai, mesin boleh melakukan ujian berulang-ulang dengan frekuensi sangat tinggi.

Oleh itu, unit yang benar-benar penting di era AI mungkin bukan lagi satu jawapan, tetapi satu lingkaran tertutup penuh: mencadangkan penyelesaian, melaksanakan penyelesaian, mengukur keputusan, dan membetulkan arah.

Dua, perubahan kepada carian Google adalah satu soalan aritmetik

Banyak karya perwakilan Jeff Dean berasal dari permulaan yang sangat sederhana: pertama-tama, hitung dengan jelas ordernya.

Pada tahun 2001, carian Google masih sangat bergantung kepada cakera keras. Cakera keras mempunyai kapasiti yang besar, tetapi kelajuan akses yang perlahan. Jeff Dean dan Sanjay Ghemawat membuat anggaran dan mendapati bahawa indeks carian keseluruhan Google pada masa itu sudah boleh dimasukkan ke dalam memori semua pelayan.

Hari ini, ia kedengaran seperti sekadar peningkatan media penyimpanan. Tetapi pada masa itu, ia bermaksud reka bentuk sistem yang sama sekali berbeza.

Jika indeks terutama disimpan di cakera keras, carian memerlukan masa tunggu untuk pencarian mekanikal. Dengan memindahkan indeks ke dalam ingatan, latensi akses akan berkurang drastik. Kedua-duanya dengan cepat menulis versi baharu dan menghantar ke persekitaran pengeluaran dalam beberapa hari. Pencarian Google menjadi jauh lebih pantas.

Cerita ini paling mudah dijual sebagai ilham genius. Namun, cara Jeff Dean menceritakannya lebih seperti seorang jurutera yang menyatakan perkara biasa: apabila syarat sistem berubah, penyelesaian yang sebelumnya tidak berlaku tiba-tiba menjadi mungkin, maka perlu dikira semula.

Banyak inovasi industri berlaku pada masa seperti ini.

Masalah lama telah berkekalan lama, dan orang-orang telah terbiasa memperbaikinya. Kemudian, harga peranti keras, kapasiti memori, lebar pita rangkaian, atau keupayaan model melintasi titik kritikal tertentu, dan sekatan asalnya hilang. Namun, kebanyakan orang masih menggunakan arsitektur lama kerana arsitektur itu telah menjadi kebiasaan.

Jeff Dean mahir dalam mengubah akal sehat menjadi anggapan semula.

Dia akan bertanya: Mengapa harus begitu? Apakah kuantiti hari ini masih sama seperti kuantiti semalam? Jika langkah paling mahal diganti, adakah sistem keseluruhan akan berubah menjadi bentuk yang sama sekali berbeza?

Ini juga nasihatnya kepada para usahawan. Jangan hanya fokus pada kekurangan solusi yang ada, tetapi lihat masalah tersebut dari prinsip dasar. Bolehkah kita meningkatkan prestasi sebanyak satu peringkat? Bolehkah kita mengurangkan kos sebanyak dua peringkat? Bolehkah kita berhenti mengikuti laluan pelaksanaan lalai industri?

Kadang-kadang, anda hanya perlu memandang masalah itu dengan sedikit kabur, jangan terikat pada penyelesaian hari ini, tetapi fikirkan dari prinsip pertama bagaimana ia sepatutnya diselesaikan.

Perkataan ini tidak terdengar misteri. Yang benar-benar sukar ialah, kebanyakan orang setelah memasuki satu industri akan dengan cepat mempelajari semua jawapan lalai dalam industri tersebut. Pengalaman membantu meningkatkan kecekapan, tetapi juga boleh menghilangkan kemampuan seseorang untuk bertanya semula.

Tiga, suara tiga minit, mengapa mendorong kelahiran TPU

Pada tahun 2013, pengenalan suara pembelajaran mendalam Google mulai melebihi sistem lama secara ketara. Kadar kesilapan berkurang separuh, setara dengan kemajuan pengenalan suara selama dua dekad yang berlaku dalam beberapa bulan sahaja.

Pasukan produk tentu saja gembira. Namun, Jeff Dean terlebih dahulu mengira satu perhitungan.

Jika pengenalan suara benar-benar menjadi lebih baik, pengguna akan lebih bersedia menggunakannya. Andaikan setiap pengguna Google hanya menggunakan pengenalan suara selama tiga minit sehari, berapa banyak pelayan yang diperlukan oleh Google untuk menyokongnya?

Keputusan tidak optimis. Mengikut kecekapan CPU pada masa itu, Google mungkin perlu memperbesarkan skala pelayan sebanyak dua kali ganda.

Ini adalah permulaan TPU.

Ia bukan kerana pasukan penyelidik tiba-tiba ingin membuat cip, bukan juga untuk membuktikan bahawa Google mampu membuat peranti keras, tetapi kerana model yang berjaya akan menghasilkan kos perkhidmatan yang tidak mampu ditanggung.

Sejarah ini mengungkapkan satu peraturan yang sering diabaikan dalam produk AI: peningkatan keberkesanan model tidak selalu mengurangkan kos. Sebaliknya, semakin baik keberkesanannya, semakin besar penggunaannya, dan semakin berat tekanan sistem.

Pengguna jarang memanggil apabila pengenalan suara tidak berfungsi dengan baik. Kos sistem bukanlah masalah. Apabila kadar kesalahan menurun secara ketara, permintaan tiba-tiba dilepaskan, dan batasan komputasi yang sebelumnya tersembunyi di latar belakang akan muncul ke permukaan.

Jalur yang dipilih TPU adalah untuk membuat peranti keras khas bagi pola pengiraan paling asas dalam pembelajaran mesin. Ia tidak perlu menjalankan penyemak imbas, mahupun mengendalikan semua program umum. Ia terutamanya unggul dalam aljabar linear presisi rendah dan padat. Jenis pengiraan ini tepat berada di pusat pembelajaran mesin moden.

TPU generasi pertama akhirnya membawa keuntungan dalam skala yang jauh lebih besar. Menurut Jeff Dean, ia lebih hemat tenaga sebanyak 30 hingga 80 kali berbanding CPU dan GPU pada masa itu, serta mengurangkan latensi sebanyak 20 hingga 30 kali.

Di sini masih ada satu ukuran reka bentuk yang mudah dilupakan.

TPU sangat spesifik, tetapi tidak begitu spesifik sehingga hanya boleh menjalankan satu model tetap. Pasukan menyedari bahawa algoritma pembelajaran mesin akan terus berubah dengan cepat, maka mereka merekabentuk cip sebagai sistem algebra linear yang lebih genap. Ia mengorbankan kemampuan untuk menjalankan Chrome atau Word, tetapi mengekalkan ruang untuk menyokong perkembangan algoritma masa depan.

Ini adalah keseimbangan yang sukar untuk dikuasai. Jika terlalu sedikit digunakan, keuntungan tidak akan jelas. Jika terlalu banyak digunakan, perubahan algoritma akan membuat peralatan menjadi usang.

Penilaian Jeff Dean terhadap peralatan inferens hari ini secara jelas mencerminkan TPU pada masanya. Beliau percaya bahawa peluang penting seterusnya masih terletak pada spesialisasi, tetapi fokusnya akan berpindah lebih lanjut kepada inferens latensi rendah dan penggunaan tenaga rendah.

Bayangkan apa yang boleh anda lakukan jika latihan boleh diperbaiki sebanyak 50 kali.

Apabila model memerlukan beberapa belas saat untuk membalas, orang akan menganggapnya sebagai alat yang hanya digunakan sesekali. Apabila latensi mendekati segera, ia baru berpotensi masuk ke antaramuka interaktif, robot, video langsung, sistem operasi, dan alur keputusan berterusan.

Menunggu bukanlah masalah pengalaman kecil. Menunggu akan mengubah bentuk produk.

Empat: Kos pusat AI bukan pengiraan, tetapi pemindahan data

Jika ingin memperbaharui versi "Angka Latensi yang Harus Diketahui Setiap Jurutera" untuk jurutera AI tahun 2026, Jeff Dean percaya bahawa fokus harus berpindah dari pencarian cakera keras, kegagalan cache, dan latensi rangkaian antarabenua kepada aliran data di dalam cip.

Jurutera perlu tahu: berapakah lebar pita dari memori utama ke memori pada cip, berapakah lebar pita dari memori pada cip ke unit pendaraban, berapakah tenaga yang diperlukan untuk satu pendaraban, bagaimana cip-cip saling bersambung, dan bagaimana kecekapan rangkaian akan menurun apabila 500 cip diperluaskan menjadi 10,000 cip.

Nombor-nombor ini kelihatan jauh daripada produk, tetapi sebenarnya menentukan produk apa yang boleh berjaya.

Jeff Dean memberikan nisbah yang sangat mencengangkan. Menyelesaikan satu pendaraban matematik, hanya memerlukan sekitar satu pikojoule tenaga. Memindahkan data dari memori berpemandu tinggi ke unit pengiraan, kos tenaga mungkin lebih tinggi sebanyak 1000 kali ganda.

Dengan kata lain, tindakan mahal dalam sistem AI hari ini sering bukanlah "mengira", tetapi "menghantar perkara yang perlu dikira".

Ini juga menjelaskan mengapa pemprosesan secara berkelompok sangat penting.

Selepas sekumpulan bobot model dipindahkan dari memori ke unit pengiraan, jika hanya satu token diproses, kos pemindahan data akan ditanggung sepenuhnya oleh satu token tersebut. Jika batch yang lebih besar diproses secara serentak, bobot yang sama boleh melayani lebih banyak pengiraan, sehingga kos tenaga dan lebar pita dibahagikan.

Namun, pemprosesan berkelompok dan latensi rendah secara alami bertentangan. Untuk mengumpulkan sekumpulan permintaan, sistem sering perlu menunggu. Throughput meningkat, tetapi respons untuk pengguna individu mungkin menjadi lebih perlahan.

Oleh itu, banyak masalah yang kelihatan seperti masalah lapisan model sebenarnya adalah masalah peranti keras dan sistem. Mengapa latihan menggunakan batch besar, mengapa inferens memerlukan KV Cache, mengapa model mengejar presisi rendah, dan mengapa sistem memerlukan kuantisasi—semuanya tidak dapat dipisahkan daripada penghantaran data dan batasan tenaga.

Jeff Dean baru-baru ini lebih memperhatikan inferens, kerana inferens sangat peka terhadap latensi. Tugas latihan yang berjalan lebih perlahan biasanya hanya menyebabkan eksperimen berakhir lebih lewat. Setiap detik tambahan yang ditunggu dalam tugas inferens akan secara langsung mempengaruhi pengalaman pengguna dan kecekapan efisiensi Agen.

Jika sebuah Agent perlu memanggil model secara berterusan sebanyak 1000 kali, pengurangan latensi sebanyak 50% setiap panggilan boleh menghasilkan perbezaan besar dalam masa penyelesaian keseluruhan tugas. Belum lagi apabila Agent akan berjalan selama beberapa hari atau minggu di masa depan.

Oleh itu, "masalah tenaga" AI bukanlah isu alam sekitar yang jauh. Ia secara langsung menentukan sama ada model boleh menyediakan perkhidmatan kepada lebih ramai orang dengan harga murah, sama ada Agent boleh beroperasi secara berterusan, dan sama ada keuntungan kasar syarikat start-up adalah sihat.

V. Model hanyalah satu komponen, kontekslah tempat kerja Agent

Dalam beberapa tahun terakhir, industri AI biasa mengukur kemajuan berdasarkan jumlah parameter, data latihan, dan skor piawai. Pada 2026, Jeff Dean lebih menekankan segala sesuatu di sekitar model.

Sistem AI yang benar-benar berguna, selain model, juga memerlukan pengambilan maklumat, alat, ingatan, maklumat sejarah, persekitaran pelaksanaan, dan mekanisme umpan balik. Model harus tahu alat-alat apa yang tersedia, kapan memanggil alat, bagaimana memecahkan masalah kompleks menjadi serangkaian tindakan, serta mampu membandingkan pelbagai penyelesaian dan menilai yang paling mungkin berjaya.

Inilah sebab mengapa "kejuruteraan konteks" mulai berada di tengah-tengah pentas.

Jeff Dean mengatakan bahawa maklumat yang dilihat oleh model semasa peringkat latihan akhirnya «dicampurkan» ke dalam berbilion hingga bertrilion parameter. Ia seperti sup pekat, pengetahuan ada, tetapi tidak semestinya jelas. Maklumat yang benar-benar dimasukkan ke dalam konteks semasa lebih langsung dan lebih mudah digunakan dengan tepat oleh model.

Ini memberikan peluang penting kepada pasukan kecil.

Melatih model asas memerlukan modal, data, dan kuasa pengiraan yang besar. Kejuruteraan konteks pula boleh bermula dengan satu API. Pengusaha boleh mengatur pengetahuan bidang, proses alat, data pelanggan, dan standard penilaian berdasarkan bisnes tertentu, supaya model am boleh berfungsi lebih boleh dipercayai dalam skenario yang sempit.

Jeff Dean memberikan satu contoh dirinya sendiri.

Dia dan Sanjay Ghemawat sering mengoptimumkan pustaka dasar dalaman Google. Struktur data ini mungkin berjalan di jutaan proses, satu Titik-titik Perbezaan prestasi akan diperbesar oleh skala. Pendekatan tradisional ialah jurutera terlebih dahulu menulis mikro-benchmark, mengukur prestasi semasa, kemudian memodifikasi kod, menjalankan semula benchmark, memantau penggunaan cache dan perubahan prestasi, dan seterusnya mengulangi proses ini.

Dua orang menulis kaedah kerja ini sebagai kemahiran Agen. Model belajar bagaimana menjalankan ujian asas, memodifikasi kod, membandingkan keputusan, dan mengoptimumkan berdasarkan pengukuran.

Kami hanya memberikan kepada ia cara yang digunakan oleh manusia dalam bentuk yang boleh digunakan oleh model.

This sentence can almost be considered a naive definition of context engineering.

Ia bukan teknik petunjuk misterius, bukan juga penambahan bahan latar belakang yang berlebihan. Ia adalah menjawab tiga soalan: ahli akan melakukan langkah-langkah apa, alat-alat sistematik yang boleh dipercayai apa, dan bagaimana hasilnya harus disahkan.

Apabila kandungan ini disusun, model bukan mendapat lebih banyak pengetahuan, tetapi satu set kaedah yang boleh diulang.

Inilah sebab mengapa「kemahiran (skill)」menjadi aset penting dalam ekosistem Agent. Sebuah fail kemahiran yang cemerlang mungkin merangkumi pengalaman tersirat bertahun-tahun oleh pasukan. Ia memberitahu model apa yang perlu dilakukan terlebih dahulu apabila menghadapi jenis masalah tertentu, kesilapan mana yang paling biasa berlaku, alat mana yang boleh dipercayai, dan hasil apa yang dianggap selesai.

Perbezaan syarikat masa depan kemungkinan besar tidak hanya terletak pada berat model, tetapi juga dalam pengalaman yang dienkodkan ke dalam alur kerja ini.

Enam, mengapa agen mulai kehilangan kawalan apabila sampai langkah ke-30

Hampir semua pasukan yang benar-benar pernah membuat Agent telah melihat skenario yang sama.

Langkah-langkah awal berjalan lancar. Model boleh membaca keperluan, memanggil alat, dan menulis kod. Tetapi pada langkah ke-30 atau ke-50, ia mulai melupakan matlamat, salah memahami keadaan, mengulangi tindakan, atau semakin tersesat ke arah yang salah.

Jeff Dean mengaitkan salah satu sebabnya kepada masalah di luar taburan.

Model telah melihat banyak tugas biasa semasa latihan. Selama tugas masih berada di dalam "jalan cerah" yang dikenalinya, prestasinya biasanya baik. Namun, sekali operasi berterusan membawanya ke keadaan yang tidak dikenali, prestasinya akan menurun secara tiba-tiba. Semakin jauh dari zon selesa, semakin mudah ralat berakumulasi.

Salah satu penyelesaian adalah menyediakan kemahiran dan petua untuk menghadkan model sebanyak mungkin kepada laluan yang dikenalinya. Kaedah lain ialah menggunakan sistem pelbagai Agen.

Beberapa agen boleh mencuba pelbagai pendekatan, kemudian model lain bertindak sebagai penilai untuk menentukan arah yang lebih berpotensi. Cabang yang gagal dibuang, manakala cabang yang berjaya diteruskan. Ini pada dasarnya adalah proses carian semasa peringkat penalaran.

Ia tidak asing dengan cara kerja pasukan manusia. Menghadapi masalah yang kompleks, seseorang mengusulkan penyelesaian, orang lain mengulas risiko, dan orang ketiga menjalankan eksperimen. Pasukan tidak meletakkan semua harapan pada satu idea sahaja, tetapi mengurangkan kesilapan titik tunggal melalui pembahagian tugas dan maklum balas.

Semakin lama agen beroperasi, semakin kurang sistem boleh bergantung pada keberhasilan sekali sahaja.

Agen jangka panjang yang benar-benar boleh dipercayai memerlukan checkpoint, pengurusan status, rollback, eksplorasi cabang, penilaian luaran, kawalan keizinan, dan pemulihan pengecualian. Ia lebih seperti sistem teragih, bukan sekadar tetingkap perbualan yang sangat panjang.

Ini adalah ketika latar belakang Jeff Dean mulai menunjukkan kepentingannya semula.

Salah satu masalah utama yang diselesaikan oleh MapReduce ialah bagaimana membolehkan banyak mesin yang tidak boleh dipercayai menyelesaikan pengiraan yang boleh dipercayai. Sistem Agen hari ini menghadapi kontradiksi serupa: panggilan model tunggal tidak sempurna, alat juga boleh gagal, tetapi keseluruhan tugas masih perlu diselesaikan dengan sestabil mungkin.

Platform agen cemerlang masa depan mungkin akan mewarisi banyak idea sistem teragih. Tugasan boleh dibahagikan, keputusan boleh disahkan, kegagalan boleh dicuba semula, keadaan boleh dipulihkan, dan ralat tempatan tidak sepatutnya menghancurkan keseluruhan proses.

Apabila Jeff Dean mengatakan bahawa Agen akan berjalan selama beberapa hari atau bahkan beberapa minggu, beliau bukanlah menggambarkan satu perbualan yang lebih panjang. Beliau menggambarkan satu infrastruktur pengkomputeran baharu.

Tujuh: Bagaimana dua atau tiga orang boleh mengalahkan Google: Mencari masalah yang mempunyai kejayaan model hanya 1%

Dalam konteks Startup School, soal yang paling diperhatikan tentulah peluang perniagaan.

Google boleh bersama-sama merekabentuk cip, pusat data, model, dan produk. Model serba guna seperti Gemini masih terus memperluas sempadan kemampuannya. Bagaimana pasukan yang hanya terdiri daripada dua atau tiga orang boleh menang?

Jawapan Jeff Dean tidak romantis.

Peluang untuk pasukan kecil biasanya wujud dalam bidang-bidang spesifik yang tidak menjadi fokus utama model umum. Pengusaha boleh menggabungkan antara antaramuka produk, data eksklusif, alur kerja, dan kemahiran bidang untuk memberikan ketepatan yang lebih tinggi dan pengalaman yang lebih baik dalam skenario yang sempit.

Namun, dia segera memberikan amaran: model umum sedang menjadi semakin kuat dengan cepat. Fungsi produk yang kelihatan bebas hari ini mungkin akan diliput secara langsung oleh model asas dalam enam atau dua belas bulan.

Oleh itu, usahawan perlu menilai sama ada kelebihan mereka berterusan.

Jeff Dean memberikan kriteria penyaringan yang sangat spesifik: mencari tugas-tugas di mana kejayaan model umum semasa ini mendekati 0% atau 1%, bukan tugas-tugas yang sudah mampu mencapai 20%.

Jika model gagal sepenuhnya, ini mungkin merupakan tanda yang baik. Jika ia sudah dapat melakukan sebahagian, tetapi hanya melakukan dengan buruk, itu mungkin bukan tanda yang baik.

Sebabnya mudah. 20% bermakna kemampuan telah mulai muncul. Lebih banyak data, model yang lebih besar, dan inferensi yang lebih panjang kemungkinan besar akan segera menjadikannya boleh digunakan. 0% atau 1% pula menunjukkan bahawa tugas tersebut mungkin kekurangan data penting, alat khas, umpan balik domain, atau kemampuan yang sukar diperoleh oleh model generik dalam jangka pendek.

Ini boleh disebut sebagai "peraturan 1% Jeff Dean".

Ia bukanlah cadangan agar usahawan memilih masalah paling sukar, tetapi mencari masalah di mana model umum mempunyai kelemahan struktural.

Terdapat tiga jenis ruang buta ini.

Kelas pertama ialah data eksklusif. Model umum boleh mengatur maklumat dunia, tetapi mungkin tidak dapat mengakses keseluruhan profil pengguna tertentu, proses dalaman syarikat, atau data masa nyata yang dihasilkan oleh peranti tertentu. Apabila produk perniagaan baru memperoleh data ini, ia boleh membentuk perspektif yang berbeza daripada model asas.

Kategori kedua ialah penilaian profesional. Banyak industri bukan kekurangan kemampuan penghasilan, tetapi kekurangan penilaian yang boleh dipercayai. Perubatan, bahan, cip, pembuatan, dan penyelidikan ilmiah semuanya memerlukan validator berkualiti tinggi. Siapa yang boleh mentakrifkan「apa yang betul」, dialah yang boleh membuat Agent terus dioptimakan.

Kategori ketiga ialah model yang sempit tetapi mendalam. AlphaFold bukan model perbualan am, tetapi membangunkan kemampuan yang sangat khusus untuk masalah struktur protein. Ilmu bahan, reka bentuk cip, dan bidang profesional lain mungkin juga menghadapi peluang serupa.

Penilaian ini tidak mudah bagi pengusaha. Ia memerlukan pasukan untuk memahami sempadan kemampuan model serta masalah mendalam dalam industri. Hanya memahami AI sahaja boleh menyebabkan fungsi yang dibuat cepat diserap oleh platform. Sebaliknya, hanya memahami industri sahaja mungkin meremehkan kelajuan kemajuan model.

Peluang sebenar berada di sempadan kedua-duanya.

Delapan, apabila kod tidak lagi jarang, spesifikasi, selera, dan pemilihan masalah akan lebih mahal.

Diana mengemukakan satu hipotesis: Jika di masa depan setiap pendiri mampu mengurus 50, 100 Agent secara serentak, dan semua kod ditulis oleh Agent, keupayaan apa yang akan menjadi jarang?

Jawapan Jeff Dean ialah「selera».

Lebih tepatnya, menentukan apa yang perlu dilakukan oleh Agent.

Beliau percaya bahawa sebahagian besar nilai kajian bukan terletak pada seberapa cemerlang eksperimen dilaksanakan, tetapi pada sama ada masalah yang dipilih layak untuk diteliti. Sebuah pasukan boleh menggunakan kaedah paling cekap untuk menyelesaikan kajian yang tidak penting. Namun, dengan menangani masalah penting, sekiranya diselesaikan, ia boleh mengubah seluruh bidang tersebut.

Selepas agen mengurangkan kos pelaksanaan, kepentingan pemilihan masalah akan meningkat lebih lanjut.

Dahulu, satu idea kabur akan lenyap secara semula jadi kerana kos pembangunan yang terlalu tinggi. Di masa depan, dengan mengerahkan cukup banyak Agen, banyak idea boleh dijadikan prototaip dengan pantas. Dunia tidak akan secara automatik menghasilkan lebih banyak produk yang baik, hanya lebih banyak produk.

Spesifikasi juga akan menjadi lebih penting.

Jeff Dean mengatakan bahawa semakin jelas tujuan ketika bekerja sama dengan agen maya, semakin tinggi kejayaannya. Di masa lalu, keperluan yang kabur diberikan kepada seorang jurutera berpengalaman, yang boleh bertanya dan bergantung pada latar belakang bersama untuk melengkapkan niat. Walaupun agen juga boleh bertanya, ia lebih cenderung membuat spekulasi sendiri apabila kekurangan konteks.

Tugasan berjaya tinggi yang typikal ialah memindahkan perisian dari satu bahasa pengaturcaraan ke bahasa lain. Sebabnya bukan kerana pemindahan itu mudah, tetapi kerana spesifikasi sangat lengkap. Kod lama mentakrifkan tingkah laku, ujian mentakrifkan sempadan, dan Agen boleh membandingkan satu per satu sehingga versi baharu menunjukkan perilaku yang serupa.

Sekarang agen boleh menulis perisian untuk anda, tetapi menjadi lebih penting untuk menjelaskan apa yang anda benar-benar inginkan.

Perkataan ini memberi kesan langsung kepada organisasi berasaskan AI.

Pengurus masa depan tidak hanya akan membahagikan tugas, tetapi juga menulis matlamat dan kriteria penerimaan yang lebih jelas. Dokumen reka bentuk tidak lagi hanya menjadi bahan komunikasi pasukan, tetapi juga menjadi input untuk pelaksanaan mesin. Ujian, metrik, batasan, dan contoh akan dipindahkan ke fasa definisi tugas, bukan lagi di hujung proses pembangunan.

Mengenai bagaimana "selera" dilatih, kaedah yang diberikan oleh Jeff Dean sangat praktikal.

Tulis senarai perkara yang anda anggap akan menjadi penting dalam 12 bulan ke depan. Anda tidak perlu melakukan semuanya. Semak semula selepas 12 bulan, perkara mana yang berlaku, mana yang telah dilakukan oleh orang lain, dan mana yang tiada kemajuan. Dengan terus mengumpul sampel ramalan, seseorang akan secara perlahan-lahan menyesuaikan penilaian mereka.

Selera tidak sepenuhnya merupakan bakat. Ia juga boleh dilatih melalui ulasan.

Sembilan, eksperimen pemikiran yang baik, singkirkan terlebih dahulu anggapan paling kukuh dalam industri

Di bahagian kedua temu bual itu, Jeff Dean berkongsi satu eksperimen pemikiran yang agak gila.

Dalam 60 tahun terakhir, industri cip terus berusaha mencapai transistor yang lebih kecil, lebih stabil, dan dengan kadar ralat yang lebih rendah. Ia dianggap sebagai perkara biasa bahawa cip yang diperbuat daripada reka bentuk yang sama seharusnya serupa sepenuhnya, dengan semakin sedikit bit yang berubah semakin baik.

Dalam sistem teragih besar, jurutera telah menerima bahawa komponen tunggal boleh gagal. Cakera keras boleh rosak, mesin boleh down, dan suis pertukaran boleh bermasalah. Kebolehpercayaan sistem bukan datang daripada setiap komponen yang tidak pernah salah, tetapi daripada salinan, pengesahan, redudansi, dan pemulihan.

Maka Jeff Dean bertanya: Apa yang akan berlaku jika transistor mengalami 20 ralat setiap hari, bukan sekali setiap beberapa juta tahun?

Ini bukanlah rancangan produk yang realistik. Dia hanya cuba menghilangkan satu presumsi yang biasa diterima. Mungkin transistor yang sangat tidak boleh dipercayai boleh dibuat dengan cara yang sama sekali berbeza, sementara sistem menjamin keputusan melalui laluan berbilang dan redudansi peringkat tinggi.

Kebanyakan eksperimen pemikiran akhirnya tidak menjadi produk. Banyak amalan industri berterusan selama puluhan tahun, dan memang ada sebab yang munasabah. Namun, Jeff Dean percaya bahawa sebaiknya semak semula sebab-sebab ini secara berkala.

MapReduce berasal dari proses serupa.

Sistem crawler dan indeks Google awal mengandungi banyak kod selari manual, checkpoint, dan logik pemulihan ralat. Pengiraan perniagaan sebenar seringkali sangat mudah, seperti membaca semua laman web dan menentukan bahasa laman. Namun, kod sistem yang banyak telah menenggelamkan niat yang mudah ini.

Jeff Dean dan Sanjay Ghemawat mendapat inspirasi daripada pengaturcaraan fungsional. Mereka mengabstrakkan tugas-tugas besar menjadi Map dan Reduce, serta menurunkan paralelisasi, penjadualan, ketahanan terhadap ralat, dan percubaan semula ke dalam kerangka kerja yang seragam. Pembangun perniagaan hanya perlu menyatakan pengiraan itu sendiri.

Reka bentuk ini tidak membuat mesin menjadi tanpa kesilapan. Ia menjadikan kesilapan boleh diserap oleh sistem.

Kerja agen hari ini mungkin juga berada pada peringkat serupa. Banyak pasukan masih mengatur petunjuk, logik percubaan semula, dan panggilan alat secara manual untuk setiap tugas. Di masa depan, akankah muncul satu abstraksi yang seringkas MapReduce, yang menjadikan penguraian, pengesahan, pemulihan, dan eksplorasi selari agen jangka panjang sebagai kemampuan asas?

Ini mungkin merupakan peluang bagi syarikat infrastruktur seterusnya.

Sepuluh: AI mula membina AI yang lebih baik, kaedah saintifik dipadatkan menjadi kitaran berkelajuan tinggi

Arah yang paling menarik bagi Jeff Dean untuk masa depan ialah mengautomatikkan kaedah saintifik itu sendiri.

Proses penyelidikan tradisional melibatkan pencadangan hipotesis, reka bentuk eksperimen, menjalankan eksperimen, menganalisis keputusan, kemudian menghasilkan hipotesis seterusnya. Kelajuan kitaran ini telah lama dibatasi oleh kos eksperimen dan kelewatan pengesahan.

AI boleh mengubah dua bahagian.

Sebahagian adalah mengusulkan dan melaksanakan lebih banyak eksperimen secara automatik. Sebahagian lagi adalah menukar validator yang mahal menjadi model penghampiran yang murah.

Jeff Dean memberikan contoh kimia kuantum. Para penyelidik ingin menentukan sifat suatu konfigurasi molekul dengan menjalankan simulasi teori fungsional kepadatan. Satu simulasi mungkin memerlukan sepanjang malam. Para penyelidik Google melatih sebuah penghampir jaringan saraf menggunakan banyak input dan output simulasi. Penghampir ini mendekati ketepatan simulator asal, tetapi 300,000 kali lebih pantas.

Setelah kelajuan pengesahan berubah, bentuk soalan saintifik juga berubah.

Dulu, menyaring 10 juta cadangan mungkin merupakan projek yang memerlukan kekuatan pengiraan berbulan-bulan. Sekarang, dalam masa makan tengah hari seorang penyelidik, sistem sudah boleh menyelesaikan penyaringan awal. Eksperimen bukan lagi taruhan tunggal yang berharga, tetapi menjadi pencarian frekuensi tinggi.

Ini juga adalah logik sepunya di sebalik sistem seperti AlphaEvolve dan AlphaChip. Model mengusulkan cadangan, alat melaksanakan cadangan, penilai memilih hasil, dan hasil yang cemerlang masuk ke putaran seterusnya. Selama gelung tertutup cukup pantas, sistem akan terus menjelajahi ruang penyelesaian yang besar.

Pembelajaran mesin itu sendiri juga akan menjadi objek ilmu automatik ini.

Hari ini, pasukan penyelidikan besar biasanya didorong oleh manusia yang mencadangkan arsitektur atau kaedah latihan baru, menjalankan eksperimen berskala kecil terlebih dahulu, kemudian memilih pendekatan yang menjanjikan untuk diperbesarkan. Jeff Dean percaya tiada halangan mendasar yang menghalang model mengambil alih semakin banyak peringkat ini. Manusia memberikan arahan tingkat tinggi, sementara sistem secara automatik meneroka struktur, resepi data, dan strategi latihan, kemudian menggabungkan eksperimen berjaya untuk membentuk model baru.

Indikator untuk mengukur kecekapan penyelidikan di masa depan mungkin bukan hanya operasi titik terapung per saat, tetapi "berapa banyak penemuan berkesan yang dihasilkan setiap unit kekuatan pengiraan".

Kuasa pengiraan memang penting. Lebih penting lagi bagaimana menukar kuasa pengiraan kepada penemuan.

Sebelas, Kertas Kerja Distilasi yang Ditolak oleh NeurIPS, dan Bagaimana Menghadapi Kegagalan

Pada tahun 2014, Jeff Dean, Geoff Hinton, dan Oriol Vinyals menghantar sebuah kertas kerja mengenai penggabungan pengetahuan. Hari ini, penggabungan pengetahuan telah menjadi kaedah asas dalam pemampatan model dan pemindahan kemampuan. Model besar bertindak sebagai guru, mentransfer kemampuan kepada model pelajar yang lebih kecil, lebih pantas, dan lebih murah.

Kertas kerja yang kemudian berkesan luas ini, pada masa itu ditolak oleh NeurIPS.

Seorang reviewer berpendapat bahawa ia "tidak mungkin memberi kesan besar". Pembaca yang berminat boleh mengunjungi "Ditolak ≠ Gagal! Kertas kerja berkesan tinggi ini pernah ditolak oleh konferens terkemuka."

Jeff Dean tidak marah ketika membicarakan pengalaman ini. Beliau berkata, para ulas mungkin tidak memahami masalah nyata yang dihadapi oleh perkhidmatan AI berskala besar. Bagi Google, menukar model besar yang mahal menjadi model kecil yang boleh melayani ratusan juta pengguna jelas sangat penting. Bagi para ulas yang hanya memperhatikan kebaruan teori, ia mungkin tidak kelihatan cukup "asas".

Selepas kertas kerja ditolak, pasukan itu memuat naiknya ke arXiv. Industri tetap membacanya dan mulai menggunakannya.

Hari ini, model Flash Gemini mampu mempertahankan kekuatan yang kuat dengan ukuran yang lebih kecil dan latensi yang lebih rendah, di mana distilasi merupakan salah satu kaedah penting.

Cerita ini bukan sekadar bahan motivasi yang mengatakan "ketekunan akan membawa kejayaan". Ia menunjukkan bahawa sistem penilaian sentiasa mempunyai kelemahan. Nilai satu penyelesaian, kadang-kadang, hanya boleh dilihat secara serta-merta oleh mereka yang benar-benar mengalami bottleneck sistem tersebut.

Ini juga penting untuk usahawan.

Penolakan dari pasaran, pelabur, dan rakan seindustry mungkin bermakna arah yang salah, atau mungkin hanya kerana pihak lain tidak berada di tempat masalah yang sama. Perbezaannya ialah, adakah pasukan mempunyai bukti yang cukup spesifik untuk mengetahui mengapa masalah ini penting, dan mengapa ia boleh diselesaikan sekarang.

Jeff Dean tidak mendorong orang untuk bertahan secara buta. Yang dia dorong adalah: memahami masalah, mengesahkan secara berterusan, dan jangan menganggap satu ulasan sebagai penilaian akhir dunia.

Dua belas, apakah Jeff Dean yang muda akan lakukan hari ini

Pada akhir temu bual, Diana mengajukan satu soalan yang penuh imajinasi.

Jika Jeff Dean yang muda yang menyertai Google pada tahun 1999 dipindahkan ke tahun 2026, adakah dia akan menyertai sebuah makmal canggih atau menubuhkan syarikat bersama dua atau tiga rakan?

Jeff Dean tidak memberikan jawapan standard.

Organisasi besar memiliki struktur, platform, dan banyak rakan sekerja yang cemerlang. Seseorang di dalamnya boleh mengakses pengetahuan yang tidak diketahuinya, serta menggunakan produk yang matang untuk memberi kesan kepada pengguna global. Pasukan kecil pula lebih bebas, tetapi menanggung risiko yang lebih besar. Pendiri mesti benar-benar percaya pada satu masalah, dan bersedia menanggung ketidakpastian selama beberapa tahun.

Kriteria penilaian yang diberikannya lebih mendasar daripada "bergabung dengan syarikat besar atau memulakan perniagaan sendiri".

Jika saya menyelesaikan masalah ini, dan hasil terbaik benar-benar berlaku, apakah dunia akan menjadi jelas lebih baik, atau orang-orang hanya akan berkata, eh, keren, lalu berhenti di situ?

Jika jawapannya hanya "cukup kerennya", mungkin tidak patut meluangkan masa paling berharga.

Dia juga menekankan kepentingan rakan sekerja. Cari orang yang mempunyai kemampuan saling melengkapi, serta orang yang rendah hati, bersedia bekerjasama, dan menyenangkan untuk diajak bekerja sama. Masalah yang benar-benar sukar sering memerlukan kerjasama jangka panjang. Ahli pasukan sebaiknya masing-masing memiliki alat yang tidak dimiliki orang lain, dan terus memperluas "tali pinggang alat" mereka semasa bekerja bersama.

Perkataan ini memiliki kesederhanaan seorang jurutera lama.

Industri AI suka membincangkan pertumbuhan eksponen, kecerdasan super, dan pendanaan besar. Namun, Jeff Dean akhirnya kembali kepada tiga perkara kecil: bekerja pada masalah yang benar-benar anda pedulikan, bekerja bersama orang-orang yang anda sukai, dan berusaha sekuat tenaga untuk membuat dunia menjadi lebih baik.

Penutup: Yang paling langka di era AI tetaplah mampu melihat masalah dengan jelas

Dalam karier Jeff Dean, terdapat banyak legenda yang sering diceritakan semula.

Dia dan Sanjay Ghemawat menulis semula sistem carian dalam beberapa hari, membawa indeks ke dalam memori. Perkiraan sebentar tentang suara tiga minit mendorong Google mencipta TPU. MapReduce menyembunyikan paralelisme berskala besar dan ketahanan dalam abstraksi seragam. Pendidikan pengetahuan berubah daripada satu kertas yang ditolak menjadi teknologi asas industri.

Cerita-cerita ini mudah membuat orang membayangkan dia sebagai seorang jenius yang terus-menerus mendapat inspirasi.

Tetapi dari wawancara ini, pendekatannya sebenarnya sangat konsisten.

Kira dahulu magnitud. Kemudian kenal pasti bottleneck sebenar. Seterusnya, soal andaian lalai dan bina abstraksi yang lebih ringkas. Akhir sekali, gunakan pengukuran dan maklum balas untuk mendorong peningkatan berterusan sistem.

Industri AI hari ini sedang mengalami titik balik yang serupa.

Model sudah cukup kuat untuk menangani tugas-tugas setaraf jurutera peringkat permulaan. Seterusnya, yang menentukan produktiviti sebenar bukan sahaja kecerdasan model, tetapi juga kos penalaran, pengorganisasian konteks, kualiti alat, kelajuan pengesahan, dan kebolehpercayaan jangka panjang.

Agen akan menjadi semakin seperti ahli pasukan. Namun, mereka memerlukan spesifikasi yang jelas, kemahiran, titik semakan, penilai, serta sistem yang mampu menerima kegagalan.

Peluang untuk syarikat permulaan tidak akan hilang, tetapi akan menjadi lebih ketat. Lebih baik jangan fokus pada perkara yang model generik sudah mampu selesaikan sebanyak 20%, tetapi cari masalah yang kejayaannya masih mendekati 0% atau 1%. Di sana mungkin tersembunyi data eksklusif, penilai profesional, model bidang sempit, atau abstraksi sistem baharu.

Semakin murah penghasilan kod, semakin mahalnya masalah itu sendiri.

Apakah yang patut dilakukan? Apakah batasan yang sudah usang? Apakah perubahan yang baru saja melintasi titik kritikal? Apakah sistem yang jika dipercepat 50 kali akan menjadi produk yang sama sekali berbeza?

Jeff Dean tidak memberikan senarai peluang kepada 6,000 usahawan. Beliau memberikan cara berfikir yang lebih tahan lama.

Jangan terburu-buru mengejar jawapan yang paling popular.

Kira masalahnya dahulu.

Pautan rujukan

https://x.com/ycombinator/status/2082938685071491219

https://www.ycrootaccess.com/p/jeff-dean-the-1-rule-for-building

Artikel ini berasal daripada akaun微信公众号 "Machine Heart" (ID: almosthuman2014), penulis: Panda

Penafian: Maklumat yang terdapat pada halaman ini mungkin telah diperoleh daripada pihak ketiga dan tidak semestinya menggambarkan pandangan atau pendapat KuCoin. Kandungan ini adalah disediakan bagi tujuan maklumat umum sahaja, tanpa sebarang perwakilan atau waranti dalam apa jua bentuk, dan juga tidak boleh ditafsirkan sebagai nasihat kewangan atau pelaburan. KuCoin tidak akan bertanggungjawab untuk sebarang kesilapan atau pengabaian, atau untuk sebarang akibat yang terhasil daripada penggunaan maklumat ini. Pelaburan dalam aset digital boleh membawa risiko. Sila menilai risiko produk dan toleransi risiko anda dengan teliti berdasarkan keadaan kewangan anda sendiri. Untuk maklumat lanjut, sila rujuk kepada Terma Penggunaan dan Pendedahan Risiko kami.