Kod CUDA berjalan pada GPU Apple M3 Pro dengan peningkatan kelajuan 10x

icon MarsBit
Kongsi
AI summary iconRingkasan
Laporan berita on-chain menyatakan bahawa program komputasi berbasis CUDA berjaya dijalankan pada peranti Apple M3 Pro dengan perubahan kod minimum. Program tersebut, yang menangani simulasi cecair 3D sebenar, berjalan kira-kira 10 kali lebih pantas pada GPU Metal Apple berbanding CPU. Tetapan tersebut menggunakan saluran konversi yang melibatkan Clang/HIP, SPIR-V, Vulkan, dan MoltenVK, mengelakkan API khas Metal. GPT-5.6 Sol membantu memperbaiki isu kompatibiliti. Ujian menunjukkan penggunaan GPU yang tinggi dan ketepatan, membuktikan bahawa algoritma bergaya CUDA/HIP boleh berfungsi pada Apple Silicon. Berita aset sebenar (RWA) menonjolkan potensi alat komputasi lintas platform.

Sebuah program pengiraan yang asalnya direka untuk CUDA NVIDIA berjalan secara langsung pada peranti Apple yang dilengkapi M3 Pro tanpa perlu mengubah kod terasnya.

CUDA

Ini adalah kemajuan yang diumumkan oleh pengguna X @Abhinav semalam. Lebih mengejutkan lagi, ia bukan sekadar demonstrasi "penambahan, pengurangan, pendaraban, dan pembahagian vektor", tetapi telah mencapai peningkatan kelajuan sebanyak 10 kali ganda dalam tugas simulasi cairan tiga dimensi yang sebenar.

CUDA

Di sebalik perkara ini, terdapat peserta istimewa — GPT-5.6 Sol.

Peristiwa ini berlaku di platform pengiraan saintifik sumber terbuka OpenFPM. Para penyelidik telah lama melakukan perkara yang banyak orang anggap "tidak mungkin": menjalankan program pengiraan berprestasi tinggi yang asalnya direka untuk GPU CUDA/HIP, melintasi halangan platform, ke arsitektur GPU Metal milik Apple.

Mengapa ini sukar? Selama lebih dari satu dekad, bidang pengiraan GPU sangat terpecah—NVIDIA mempunyai CUDA, AMD mempunyai HIP, dan Apple mempunyai Metal. Ekosistem ini seperti bahasa yang berbeza dan tidak serasi antara satu sama lain. Satu program yang ditulis dengan CUDA biasanya memerlukan penulisan semula yang besar untuk berjalan di platform lain.

Namun, kali ini, pembangun tidak memilih untuk membangun semula versi Metal, tetapi membina saluran penukaran: program pertama-tama diproses melalui Clang/HIP, kemudian melalui perantara seperti SPIR-V, Vulkan, dan MoltenVK, akhirnya membolehkan GPU Metal Apple memahami dan menjalankannya dengan cekap.

Lebih penting lagi, mereka sama sekali tidak menambahkan sebarang API partikel khas Metal. Peringkat aplikasi masih mengekalkan panggilan kernel gaya CUDA/HIP asal, mencapai ketranparan peranti keras yang sebenarnya.

Dalam proses ini, GPT-5.6 Sol memainkan peranan penting. Ia membantu menyelesaikan pembinaan susunan memori di peranti, mengenal pasti masalah kompatibiliti dalam MoltenVK dan SPIR-V dalam masa sekitar 6 jam, serta mereka solusi sementara yang sesuai.

CUDA

Pautan projek: https://github.com/mosaic-group/openfpm/pull/18

Ujian sebenar terhadap pekerjaan ini ialah kes uji kompleks—simulasi runtuhnya bendungan SPH tiga dimensi. Tugas ini memerlukan pemprosesan serentak modul-modul kompleks seperti pemindanan, pengurutan dan penyusunan semula, pembinaan sel dan senarai bersebelahan, pertukaran partikel ghost, operasi reduksi, dan operasi atomik; sebarang kegagalan pada satu peringkat akan menyebabkan penurunan prestasi atau penyimpangan hasil fizikal.

Namun, hasil ujian melebihi jangkaan. Pada peranti Apple dengan cip M3 Pro, ia selesai dalam kira-kira 6 saat apabila dijalankan menggunakan Metal GPU, dan kira-kira 60 saat apabila dihitung secara berurutan menggunakan CPU. Dengan kata lain, dengan hanya menukar peranti pengiraan, program yang sama mendapat peningkatan kelajuan sebanyak 10 kali ganda, dengan penggunaan GPU mendekati 100% (menunjukkan kecekapan penukaran yang tinggi).

Lebih penting lagi, peningkatan kelajuan tidak dicapai dengan mengorbankan ketepatan. Pembangun telah memeriksa semula hasil simulasi dan mendapati bahawa versi GPU Apple dan versi pengiraan asal menghasilkan hasil fizikal yang konsisten, dengan parameter utama dan trajektori simulasi yang sangat serupa. Ini bermakna, GPU Apple tidak hanya berjalan, tetapi juga benar-benar menyelesaikan tugas pengiraan saintifik.

Pembangun juga menunjukkan bahawa penyimpanan partikel bertambah secara linear mengikut bilangan partikel N, manakala kerja seperti pencarian jiran adalah lebih kurang O(N・k) (k ialah bilangan jiran pada ketumpatan tetap). Peningkatan 10 kali yang dipaparkan sekarang adalah hasil perbandingan backend tunggal. Di masa depan, dengan memanfaatkan teknologi RDMA yang disokong oleh Apple Thunderbolt, ia juga boleh mencapai penyeimbangan beban dinamik antara banyak mesin, membolehkan simulasi dijalankan secara meluas di pelbagai peranti.

Tentu, terobosan ini masih jauh dari perubahan keseluruhan industri GPU. Salah satu batasan utama GPU Metal Apple semasa ini ialah penyokongannya yang terhad terhadap pengiraan titik terapung presisi tinggi, sementara banyak bidang pengiraan saintifik profesional bergantung kepada pengiraan presisi ganda. Oleh itu, dalam skenario pengiraan super seperti ramalan cuaca dan simulasi aerospace, GPU profesional NVIDIA masih memegang keunggulan.

Namun, ada pihak yang mempertanyakan makna eksplorasi ini; seorang pengguna internet berkata: “Di pasaran jelas ada banyak sistem yang lebih sesuai, lalu apa gunanya menjalankan simulasi kecil semacam ini di Mac?” Maksudnya, seberapa pantas pun GPU MacBook, ia tetap bukan dirancang untuk pengiraan saintifik—perkara ini kedengaran lebih seperti pertunjukan kemampuan.

Tanggapan pengembang cukup jujur: “Manfaat terbesarnya adalah kesenangan dan kemudahan dalam bekerja.” Dia menjelaskan bahawa simulasi berskala besar pasukan sudah berjalan di kluster, dan keberjayaan kali ini menjalankannya di arsitektur Apple membuktikan bahawa reka bentuk lapisan abstraksi peranti adalah sah. Alasan yang lebih praktikal tersembunyi dalam pengembangan harian—sebelum menjalankan simulasi besar, selalunya perlu terlebih dahulu menguji dengan simulasi kecil; namun, pengujian tempatan bergantung pada CPU sangat perlahan; hasil simulasi sering mencapai beberapa GB, dan SSH tidak mampu menghantarnya kembali, sementara desktop jauh terlalu berat dan sukar digunakan, jadi lebih baik menjalankannya secara tempatan. Yang paling hebat ialah, kod yang berjaya diuji di laptop boleh dipindahkan secara langsung ke kluster GPU dan secara automatik diperluaskan skalanya.

CUDA

Penyelidikan ini juga membuktikan bahawa algoritma gaya CUDA/HIP yang sama boleh dijalankan secara relatif telus pada pelbagai latar belakang peranti, seperti Apple Silicon. Di masa depan, pembangun perisian mungkin tidak lagi terikat kepada ekosistem GPU tunggal.

CUDA

Selain itu, ini juga menunjukkan bahawa AI (GPT-5.6 Sol) sedang bergerak dari peringkat「membantu menulis kod」ke peringkat baru iaitu「terlibat dalam reka bentuk sistem asas, pengoptimuman, dan penyelesaian masalah kejuruteraan lintas platform».

GPU Apple kali ini melintasi jurang CUDA, mungkin hanyalah permulaan.

Pautan rujukan: https://x.com/Abhinavsns/status/2079774018748694696

Artikel ini berasal daripada akaun微信公众号 "Machine Heart" (ID: almosthuman2014), penulis: Machine Heart

Penafian: Maklumat yang terdapat pada halaman ini mungkin telah diperoleh daripada pihak ketiga dan tidak semestinya menggambarkan pandangan atau pendapat KuCoin. Kandungan ini adalah disediakan bagi tujuan maklumat umum sahaja, tanpa sebarang perwakilan atau waranti dalam apa jua bentuk, dan juga tidak boleh ditafsirkan sebagai nasihat kewangan atau pelaburan. KuCoin tidak akan bertanggungjawab untuk sebarang kesilapan atau pengabaian, atau untuk sebarang akibat yang terhasil daripada penggunaan maklumat ini. Pelaburan dalam aset digital boleh membawa risiko. Sila menilai risiko produk dan toleransi risiko anda dengan teliti berdasarkan keadaan kewangan anda sendiri. Untuk maklumat lanjut, sila rujuk kepada Terma Penggunaan dan Pendedahan Risiko kami.