Sebuah program pengiraan yang asalnya direka untuk CUDA NVIDIA berjalan secara langsung pada peranti Apple yang dilengkapi M3 Pro tanpa perlu mengubah kod terasnya.

Ini adalah kemajuan yang diumumkan oleh pengguna X @Abhinav semalam. Lebih mengejutkan lagi, ia bukan sekadar demonstrasi "penambahan, pengurangan, pendaraban, dan pembahagian vektor", tetapi telah mencapai peningkatan kelajuan sebanyak 10 kali ganda dalam tugas simulasi cairan tiga dimensi yang sebenar.

Di sebalik perkara ini, terdapat peserta istimewa — GPT-5.6 Sol.
Peristiwa ini berlaku di platform pengiraan saintifik sumber terbuka OpenFPM. Para penyelidik telah lama melakukan perkara yang banyak orang anggap "tidak mungkin": menjalankan program pengiraan berprestasi tinggi yang asalnya direka untuk GPU CUDA/HIP, melintasi halangan platform, ke arsitektur GPU Metal milik Apple.
Mengapa ini sukar? Selama lebih dari satu dekad, bidang pengiraan GPU sangat terpecah—NVIDIA mempunyai CUDA, AMD mempunyai HIP, dan Apple mempunyai Metal. Ekosistem ini seperti bahasa yang berbeza dan tidak serasi antara satu sama lain. Satu program yang ditulis dengan CUDA biasanya memerlukan penulisan semula yang besar untuk berjalan di platform lain.
Namun, kali ini, pembangun tidak memilih untuk membangun semula versi Metal, tetapi membina saluran penukaran: program pertama-tama diproses melalui Clang/HIP, kemudian melalui perantara seperti SPIR-V, Vulkan, dan MoltenVK, akhirnya membolehkan GPU Metal Apple memahami dan menjalankannya dengan cekap.
Lebih penting lagi, mereka sama sekali tidak menambahkan sebarang API partikel khas Metal. Peringkat aplikasi masih mengekalkan panggilan kernel gaya CUDA/HIP asal, mencapai ketranparan peranti keras yang sebenarnya.
Dalam proses ini, GPT-5.6 Sol memainkan peranan penting. Ia membantu menyelesaikan pembinaan susunan memori di peranti, mengenal pasti masalah kompatibiliti dalam MoltenVK dan SPIR-V dalam masa sekitar 6 jam, serta mereka solusi sementara yang sesuai.

Pautan projek: https://github.com/mosaic-group/openfpm/pull/18
Ujian sebenar terhadap pekerjaan ini ialah kes uji kompleks—simulasi runtuhnya bendungan SPH tiga dimensi. Tugas ini memerlukan pemprosesan serentak modul-modul kompleks seperti pemindanan, pengurutan dan penyusunan semula, pembinaan sel dan senarai bersebelahan, pertukaran partikel ghost, operasi reduksi, dan operasi atomik; sebarang kegagalan pada satu peringkat akan menyebabkan penurunan prestasi atau penyimpangan hasil fizikal.
Namun, hasil ujian melebihi jangkaan. Pada peranti Apple dengan cip M3 Pro, ia selesai dalam kira-kira 6 saat apabila dijalankan menggunakan Metal GPU, dan kira-kira 60 saat apabila dihitung secara berurutan menggunakan CPU. Dengan kata lain, dengan hanya menukar peranti pengiraan, program yang sama mendapat peningkatan kelajuan sebanyak 10 kali ganda, dengan penggunaan GPU mendekati 100% (menunjukkan kecekapan penukaran yang tinggi).
Lebih penting lagi, peningkatan kelajuan tidak dicapai dengan mengorbankan ketepatan. Pembangun telah memeriksa semula hasil simulasi dan mendapati bahawa versi GPU Apple dan versi pengiraan asal menghasilkan hasil fizikal yang konsisten, dengan parameter utama dan trajektori simulasi yang sangat serupa. Ini bermakna, GPU Apple tidak hanya berjalan, tetapi juga benar-benar menyelesaikan tugas pengiraan saintifik.
Pembangun juga menunjukkan bahawa penyimpanan partikel bertambah secara linear mengikut bilangan partikel N, manakala kerja seperti pencarian jiran adalah lebih kurang O(N・k) (k ialah bilangan jiran pada ketumpatan tetap). Peningkatan 10 kali yang dipaparkan sekarang adalah hasil perbandingan backend tunggal. Di masa depan, dengan memanfaatkan teknologi RDMA yang disokong oleh Apple Thunderbolt, ia juga boleh mencapai penyeimbangan beban dinamik antara banyak mesin, membolehkan simulasi dijalankan secara meluas di pelbagai peranti.
Tentu, terobosan ini masih jauh dari perubahan keseluruhan industri GPU. Salah satu batasan utama GPU Metal Apple semasa ini ialah penyokongannya yang terhad terhadap pengiraan titik terapung presisi tinggi, sementara banyak bidang pengiraan saintifik profesional bergantung kepada pengiraan presisi ganda. Oleh itu, dalam skenario pengiraan super seperti ramalan cuaca dan simulasi aerospace, GPU profesional NVIDIA masih memegang keunggulan.
Namun, ada pihak yang mempertanyakan makna eksplorasi ini; seorang pengguna internet berkata: “Di pasaran jelas ada banyak sistem yang lebih sesuai, lalu apa gunanya menjalankan simulasi kecil semacam ini di Mac?” Maksudnya, seberapa pantas pun GPU MacBook, ia tetap bukan dirancang untuk pengiraan saintifik—perkara ini kedengaran lebih seperti pertunjukan kemampuan.
Tanggapan pengembang cukup jujur: “Manfaat terbesarnya adalah kesenangan dan kemudahan dalam bekerja.” Dia menjelaskan bahawa simulasi berskala besar pasukan sudah berjalan di kluster, dan keberjayaan kali ini menjalankannya di arsitektur Apple membuktikan bahawa reka bentuk lapisan abstraksi peranti adalah sah. Alasan yang lebih praktikal tersembunyi dalam pengembangan harian—sebelum menjalankan simulasi besar, selalunya perlu terlebih dahulu menguji dengan simulasi kecil; namun, pengujian tempatan bergantung pada CPU sangat perlahan; hasil simulasi sering mencapai beberapa GB, dan SSH tidak mampu menghantarnya kembali, sementara desktop jauh terlalu berat dan sukar digunakan, jadi lebih baik menjalankannya secara tempatan. Yang paling hebat ialah, kod yang berjaya diuji di laptop boleh dipindahkan secara langsung ke kluster GPU dan secara automatik diperluaskan skalanya.

Penyelidikan ini juga membuktikan bahawa algoritma gaya CUDA/HIP yang sama boleh dijalankan secara relatif telus pada pelbagai latar belakang peranti, seperti Apple Silicon. Di masa depan, pembangun perisian mungkin tidak lagi terikat kepada ekosistem GPU tunggal.

Selain itu, ini juga menunjukkan bahawa AI (GPT-5.6 Sol) sedang bergerak dari peringkat「membantu menulis kod」ke peringkat baru iaitu「terlibat dalam reka bentuk sistem asas, pengoptimuman, dan penyelesaian masalah kejuruteraan lintas platform».
GPU Apple kali ini melintasi jurang CUDA, mungkin hanyalah permulaan.
Pautan rujukan: https://x.com/Abhinavsns/status/2079774018748694696
Artikel ini berasal daripada akaun微信公众号 "Machine Heart" (ID: almosthuman2014), penulis: Machine Heart
