CUDA lagi-lagi dihancurkan...
Ini kali ini, AI yang dibesarkan langsung oleh NVIDIA yang bertindak.
Sebuah syarikat kecil yang baru beroperasi selama setahun, menggunakan AI Programming Agent, hanya menghabiskan 10 jam untuk membina perisian "serupa CUDA".

Berhenti. Berhenti. Berhenti.
Apakah kamu maksudkan empayar perisian NVIDIA yang memakan hampir 20 tahun untuk dibina, telah disalin begitu sahaja??

Tidak berhenti di situ. DeepSeek Juga mencuba untuk menulis lebih sedikit CUDA aras bawah.
Mereka telah membuka sumber satu perpustakaan operator GPU bernama TileKernels, yang ditulis menggunakan TileLang, mengurangkan keperluan untuk menulis kod CUDA aras bawah secara manual.
Namun, bukan kali pertama kita mendengar "krisis CUDA" yang serupa.
Sekali-sekala, CUDA perlu ditimpa dengan kritikan, selalu dikatakan akan menggantikan, menembus, atau parit pertahanan telah digulingkan…
Is that really true?
10 jam "reka semula" CUDA
Apabila disebut NVIDIA, reaksi pertama banyak orang ialah GPU.
H100, Blackwell, Rubin, dengan chip yang semakin berkuasa dari generasi ke generasi, NVIDIA menikmati manfaat terbesar dari gelombang AI kali ini.
Namun, keunggulan sebenarnya yang sukar digoyahkan oleh NVIDIA bukanlah peranti keras, tetapi perisian.
Chip boleh dibeli, spesifikasi boleh dikejar, proses pembuatan juga akan berubah. Yang benar-benar membuat pelanggan yang telah menggunakan NVIDIA sukar untuk berpindah ialah seluruh ekosistem perisian yang dibina di sekitar GPU.
Dan CUDA adalah inti kepada empayar perisian ini.
CUDA merupakan singkatan bagi Compute Unified Device Architecture, dibina selama hampir 20 tahun di bawah kepimpinan pegawai英伟达 Ian Buck.
Ia sering disebut sebagai bahasa pengaturcaraan, tetapi lebih tepatnya, CUDA adalah satu set platform perisian keseluruhan yang dibina di sekitar GPU NVIDIA.
Jika dibahagikan secara ringkas kepada tiga lapisan, lapisan paling bawah ialah lapisan teras, yang terdiri daripada Kernel, kompilator, dan runtime yang terus membuat cip bekerja.
Tengahnya adalah lapisan perpustakaan—perpustakaan pengiraan yang dioptimakan secara tinggi seperti cuBLAS, cuDNN, serta alat penyemak, pengesahan, dan analisis prestasi.
Di paling atas ialah kerangka pembangunan seperti PyTorch dan TensorFlow, kod dan alur kerja dalam jumlah besar yang dikumpulkan oleh perusahaan, serta ekosistem pembangun yang tumbuh mengelilingi CUDA.

△
Mungkin ini agak abstrak, tetapi anda boleh membayangkan GPU NVIDIA sebagai sebuah kilang.
CUDA pada aras paling bawah bertanggungjawab memberitahu mesin bagaimana untuk melakukan setiap langkah, aras pertengahan menyediakan alat produksi siap pakai, manakala aras paling atas merupakan keseluruhan sistem produksi yang telah beroperasi bertahun-tahun.
Jadi, untuk pelanggan, yang dibeli bukan sekadar satu keping kad NVIDIA, tetapi sebuah pabrik yang siap pakai.
Sekarang, seorang lelaki bernama Jeremy Nixon datang dengan AI Agent.

Nixon ialah pendiri syarikat perisian AI Infinity, sebelum ini juga bekerja sebagai penyelidik di Google Brain.
Timmnya mengembangkan sebuah agen penyelidikan AI bernama Ignition, yang khusus menulis perisian aras bawah untuk pelbagai cip AI.
Ia boleh menjana GPU Kernel, menjalankan ujian, mencari ralat, mengukur prestasi, kemudian menulis semula kod secara automatik berdasarkan keputusan.
Jurutera manusia bertanggungjawab memberikan arahan tingkat tinggi, manakala tugas-tugas kecil dan meletihkan otak yang lain diserahkan kepada Agent untuk diulang secara berterusan.
Itu sahaja, Infinity membina perisian serupa CUDA untuk syarikat mulaan cip AI, d-Matrix, menggunakan Ignition.
Hanya mengambil masa 10 jam.
Apa??
Adakah kod lapisan bawah yang dahulu memerlukan jurutera perisian cip untuk menyesuaikannya berulang-ulang kini benar-benar boleh diserahkan kepada AI?

Tidak benar-benar boleh dikatakan sebagai kempen promosi semata.
Agen AI memang sesuai untuk tugas pemrograman yang mempunyai umpan balik yang jelas.
Apakah kod boleh dikompilasi, sama ada hasil pengiraan betul, dan sama ada prestasi meningkat, semuanya boleh diperoleh melalui pelaksanaan sebenar.
Oleh itu, agen dapat membentuk satu gelung tertutup:
Tulis kod → Kompil → Jalankan → Uji kebenaran dan prestasi → Seterusnya ubah berdasarkan maklum balas
Namun, Infinity terutama menyerang lapisan pertama CUDA: menghasilkan dan mengoptimumkan Kernel inferensia untuk pelbagai cip, serta membina kemampuan perisian asas di sekitar Kernel ini.
Ia sedang membangun pustaka inferensia universal yang sesuai untuk pelbagai cip, tetapi ini tidak bermaksud ia meniru ekosistem lengkap CUDA yang telah dikumpulkan selama hampir 20 tahun dalam masa 10 jam.
Tetapi…
Tetapi!
Anda sebenarnya tidak perlu menyalin sebuah CUDA untuk mendapatkan pendanaan sebanyak $15 juta.

Nilai pasaran syarikat ini kini telah mencapai 100 juta dolar AS.
Tidak tahu sama ada ia mengancam NVIDIA, tetapi modal jelas membelinya. (doge)
Di sisi inferens, medan perang kedua dimulai!
Jika Agen AI adalah senjata untuk menyerang kota, maka pasaran inferens adalah kecacatan di dinding kota.
Kiraan model besar dibahagikan kepada dua bahagian:
Latihan adalah membuat model, yang memerlukan ribuan unit GPU bekerja sama selama berbulan-bulan; inferens adalah menggunakan model yang telah dilatih untuk menjawab soalan, yang boleh dijalankan dengan cluster kecil atau bahkan satu unit GPU.
Di sisi latihan, CUDA masih hampir tidak dapat diselesaikan.
Latihan berskala besar sangat sensitif terhadap prestasi, kestabilan, dan kerjasama kluster. Komunikasi antara cip, pengurusan memori video, dan cara pulih selepas ralat program—sebarang kehilangan kecekapan, apabila diperbesarkan kepada ribuan hingga puluhan ribu cip, akan berubah menjadi masa dan kos yang sebenar.
Oleh itu, syarikat sering sangat berhati-hati apabila memilih platform latihan.
Walaupun cip lain mempunyai parameter teori yang baik, jika perisian tidak cukup matang atau kluster tidak stabil, kos peranti yang dijimatkan kemungkinan besar akan dibayar semula dua kali ganda melalui kos pembangunan dan percubaan.
Tetapi di sisi inferens, peraturan permainan berubah.
Ketua Pegawai Perdagangan syarikat cip AI Korea, Rebellions, Marshall Choy, berpendapat:
Di sisi inferens, CUDA bukan lagi faktor penentu. Ini akan menjadi persaingan perisian sumber terbuka.

Mengapa pesaing semuanya menumpukan perhatian pada inferens?
Kerana latihan memperhatikan "prestasi maksimum", manakala inferens memperhatikan "kos setiap jawapan".
Latihan memerlukan ribuan unit GPU bekerjasama, manakala inferens boleh dibahagikan kepada kluster kecil atau bahkan satu GPU; tidak berani menukar cip untuk latihan, tetapi boleh untuk inferens.
Asalkan ia boleh berjalan dan murah, pelanggan bersedia mencuba.
Lebih penting lagi, perisian inferens boleh berjalan merentasi cip. Jika kerangka inferens menyokong pelbagai cip, pengguna boleh beralih antara peranti yang berbeza tanpa perlu menulis semula kod—
Kesan penguncian terbesar CUDA telah gagal.
Ini memberi peluang kepada cip inferens khas.
Tugas penalaran tidak memerlukan semua kemampuan CUDA dari pelatihan hingga kerjasama kluster. Cip yang direka semula untuk model tertentu dan skenario tertentu, selagi mampu beroperasi lebih pantas, lebih murah, atau lebih jimat tenaga, mempunyai peluang untuk mengambil sebahagian pasaran daripada NVIDIA.
Sebagai contoh, d-Matrix sendiri adalah syarikat cip yang menekankan inferens.

Syarikat ini ditubuhkan pada tahun 2019, dengan fokus pada cip inferens AI generatif.
Pendiri bersama dan CEO Sid Sheth pernah mengingat bahawa mereka telah menilai sejak awal bahawa peluang yang dibawa oleh inferens AI akhirnya akan melebihi latihan.
Perisian seumpama CUDA yang dibina oleh Infinity menggunakan AI Agent dalam masa 10 jam, melayani cip inferensi d-Matrix.
Oleh itu, cerita penuh "peristiwa 10 jam" telah tersambung:
Cip baharu ingin memasuki pasaran inferens, tetapi kekurangan perisian yang matang; AI Agent menghasilkan dan mengoptimumkan Kernel asas dengan pantas, mengurangkan masa penyesuaian yang biasanya mengambil berbulan-bulan hingga bertahun-tahun kepada beberapa jam atau hari.
Sid juga secara terang-terangan menyatakan:
Walaupun NVIDIA terus mempertahankan kedudukan utama dalam bidang latihan, keunggulan kompetitifnya dalam inferens telah melemah.

Bukan hanya d-Matrix yang memperhatikan jurang ini.
Rebellions dan d-Matrix yang fokus pada penalaran, Cerebras yang menjudi cip skala wafer, Inferentia milik Amazon, TPU milik Google, MI300X milik AMD...
Pelbagai kilang cip dan raksasa komputan awan telah pun menyusun pasukan di pasaran inferens, bersiap untuk merebut sebahagian pasaran daripada NVIDIA.
Bagi syarikat-syarikat ini, mereka tidak perlu menggantikan NVIDIA segera.
Mereka hanya perlu membuktikan bahawa dalam beberapa tugas penalaran, ia boleh berjalan lebih pantas atau lebih murah tanpa bergantung pada seluruh peranti keras dan ekosistem CUDA NVIDIA.
Itu sudah cukup.
Kedalaman parit NVIDIA, adakah ia telah terguling atau tidak
Jawapannya mungkin… masih jauh.
Seperti yang telah dinyatakan sebelumnya, 10 jam yang dilalui adalah untuk menulis semula kod adaptasi bagi "sekeping cip", manakala ekosistem CUDA masih mempunyai ribuan pustaka, alat penyahpepijat, komuniti, dan jutaan pembangun yang telah dikumpulkan selama 20 tahun.
Ini bukan sesuatu yang boleh digulingkan dengan mudah.
Yang lebih penting, kod yang boleh dihasilkan tidak bermakna ia boleh digunakan.
Pendiri INT21, Bing Xu, sebelum ini bekerja di syarikat perisian cip AI, HippoML, yang telah diambil alih oleh NVIDIA, dan beliau sendiri baru meninggalkan NVIDIA pada bulan April tahun ini.

Penilaian beliau adalah: Agent mampu menghasilkan kod dalam jumlah besar dalam tempoh yang singkat, tetapi pengesahan adalah halangan terbesar.
Menghasilkan sepuluh ribu baris kod oleh AI adalah cepat, tetapi «membuktikan bahawa sepuluh ribu baris ini mengira dengan betul dan beroperasi dengan stabil dalam pelbagai kes sempadan» sangat perlahan.
Aset paling mendalam CUDA ialah alat semakannya—oleh itu, dia percaya bahawa di era Agent, ekosistem semakan akan menjadi parit pertahanan seterusnya CUDA.
Chris Lattner, salah seorang pendiri dan CEO Modular, juga menumpahkan air sejuk.

Dia percaya bahawa peningkatan yang dibawa oleh agen pengkodean adalah progresif, "gemparan itu sangat dilebih-lebihkan."
Terdapat tiga sebab: Pertama, menulis kod hanyalah sebahagian kecil kejuruteraan perisian, pengoptimuman peringkat pengeluaranlah yang menentukan prestasi cip, serta secara langsung menentukan kos menjalankan AI;
Kedua, perisian cip adalah bidang elit yang kecil, kod awam jauh lebih sedikit berbanding pembangunan aplikasi, dan data latihan yang boleh dipelajari oleh AI di bidang ini memang terhad;
Ketiga, kos pemindahan kod stok yang berjuta-juta baris masih ada, ini bukan perkara yang boleh diselesaikan dengan teknologi, tetapi merupakan keputusan organisasi.
Satu perkara lagi yang mudah dilupakan: NVIDIA sendiri juga menggunakan AI.
Vice President of NVIDIA's Developer Ecosystem, Ankit Patel, mengatakan:
Kami juga menggunakan AI Agent untuk mempercepat pembangunan CUDA dan mengesahkannya dalam skala yang lebih besar.
Dengan mempergunakan senjata sendiri untuk menyerang perisai orang lain, keunggulan relatif pihak penyerang juga akan berkurang.
Bing Xu merumuskan: Kemenangan atau kekalahan pertempuran ini bergantung pada sejauh mana pesaing dapat mengejar NVIDIA, dibandingkan dengan kecepatan iterasi diri NVIDIA.
Namun jelas, pengilang cip terbesar di dunia ini "tidak sedang tidur atau berdiri di tempat".
Secara keseluruhan, parit perlindungan NVIDIA aman dalam jangka pendek, tetapi perubahan akan berlaku secara perlahan di sisi inferens.
Nanti jangka panjang yang sebenarnya ialah: parit pertahanan sedang berpindah dari "stok kod" kepada "ekosistem pengesahan dan pengoptimuman".
Siapa yang pertama menduduki posisi baru, dialah pemenang seterusnya.
Pautan rujukan: [1] https://www.businessinsider.com/nvidia-cuda-new-threats-ai-coding-agents-2026-8
Artikel ini berasal daripada akaun微信公众号 "Quantum Bit", penulis: Ting Yü
