Isang programa sa kompyutasyon na orihinal na disenyo para sa NVIDIA CUDA, ay tumatakbo nang direkta sa isang Apple device na may M3 Pro nang hindi kailangang baguhin ang kernel code.

Ito ay isang pag-unlad na ipinahayag ni @Abhinav mula sa X kahapon. Mas nakakagulat na ito ay hindi isang simpleng demo ng “vector addition, subtraction, multiplication, at division,” kundi isang pagpapabilis ng halos 10 beses sa isang totoong 3D fluid simulation task.

Sa likod ng gawaing ito, may isang espesyal na miyembro — GPT-5.6 Sol.
Nangyari ang pangyayari sa OpenFPM, isang open-source na platform para sa scientific computing. Patuloy ang mga mananaliksik sa isang gawain na itinuturing ng maraming tao bilang «hindi posible»: pagpapatakbo ng mga programa sa high-performance computing na disenyo para sa CUDA/HIP GPU, sa ibabaw ng sariling Metal GPU architecture ng Apple, nang walang mga hadlang sa platform.
Bakit ito mahirap? Sa nakaraang dekada, ang GPU computing ay napakadisperso — may CUDA si NVIDIA, may HIP si AMD, at may Metal si Apple. Ang mga ekosistema na ito ay parang iba’t ibang wika na hindi kompatibleng isa sa isa. Kadalasan, kailangan ng malaking pagbabago ang isang programa na isinulat sa CUDA upang mabuo sa ibang platform.
Ngunit sa pagkakataong ito, hindi pumili ang mga developer na muling i-develop ang isang bersyon ng Metal, kundi itinayo nila ang isang conversion pathway: una ang programa ay sinusuri ng Clang/HIP, pagkatapos ay pumapasa sa mga intermediate layer tulad ng SPIR-V, Vulkan, at MoltenVK, upang makapagbigay ng kakayahang maunawaan at magsagawa nang epektibo ng Apple Metal GPU.
Mas mahalaga pa, wala silang idinagdag anumang particle API na espesipiko para sa Metal. Ang application layer ay nananatiling may mga kernel call na estilo ng CUDA/HIP, na nagtataguyod ng totoong hardware transparency.
Sa proseso na ito, ang GPT-5.6 Sol ay naglalaro ng mahalagang papel. Nakatulong ito sa pagbuo ng layout ng memorya sa device, nakahanap ng mga problema sa compatibility sa MoltenVK at SPIR-V sa loob ng halos 6 na oras, at nilikha ang mga kaukulang solusyon.

Link ng proyekto: https://github.com/mosaic-group/openfpm/pull/18
Ang tunay na pagsubok sa trabahong ito ay isang kumplikadong test case — ang 3D SPH dam break simulation. Kailangan ng gawain na ito ang paghawak nang sabay-sabay ng iba’t ibang kumplikadong module tulad ng scanning, sorting at reshuffling, pagbuo ng cells at neighbor lists, ghost particle exchange, reduction operations, at atomic operations. Ang anumang problema sa anumang bahagi ay magdudulot ng pagbaba sa performance o pagkakaiba sa physical results.
Ngunit ang mga resulta ng pagsubok ay nagsanay sa inaasahan. Sa mga aparato ng Apple na may M3 Pro chip, natapos sa halos 6 segundo habang ginagamit ang Metal GPU; habang ang sequential CPU computation ay nagsanay sa halos 60 segundo. Ibig sabihin, sa parehong programa, ang pagbabago lamang sa hardware ng pagkalkula ay nagbigay ng pagtaas ng bilis na halos 10 beses, at ang paggamit ng GPU ay malapit sa 100% (na nagpapakita ng mataas na efisayensiya ng pagkakatumbas).
Mas mahalaga pa, ang pagtaas ng bilis ay hindi ginawa sa pamamagitan ng pagkawala ng kawastuhan. Ipinagpatuloy ng mga developer ang pagsusuri sa mga resulta ng simulation at natuklasan na ang mga pisikal na resulta mula sa Apple GPU version at ang orihinal na computing version ay pareho, kabilang ang mga mahahalagang parameter at mga trahektorya ng simulation na napakalapit. Ibig sabihin nito, hindi lang nagpapatakbo ang Apple GPU, kundi talagang natapos nito ang mga gawain sa scientific computing.
Pinapagpalawig ng mga developer na ang particle storage ay tumataas nang linyar kasama ang bilang ng particles N, habang ang mga gawain tulad ng neighbor search ay may halagang O(N・k) (k ay ang bilang ng mga kapitbahay sa fixed density). Ang kasalukuyang ipinakikita na 10x speedup ay batay sa komparasyon ng single-machine backend. Sa hinaharap, sa pamamagitan ng RDMA technology na suportado ng Apple Thunderbolt, maaari ring maabot ang dynamic load balancing sa maraming machine, na nagpapahintulot sa simulation na umunlad sa maraming device.
Talagang may malayong distansya ang pagbuo na ito mula sa pagbabago ng buong industriya ng GPU. Sa kasalukuyan, isa sa pinakamalaking limitasyon ng Apple Metal GPU ay ang kakulangan sa suporta para sa mataas na precision na floating-point computation, at maraming propesyonal na scientific computing applications ang nakadepende sa double-precision calculation. Kaya, sa mga supercomputing scenarios tulad ng paghuhula ng panahon at aerospace simulation, patuloy pa ring nangunguna ang mga propesyonal na GPU ng NVIDIA.
Gayon man, may ilan na nagtatanong sa kahalagahan ng pag-aaral na ito; isang netizen ay nagsabi: “Mayroon naman pong maraming mas angkop na sistema sa merkado, ano ba talaga ang gamit ng pagpapatakbo ng maliit na simulasyong ito sa Mac?” Ang ibig sabihin nito ay kahit gaano pa kalakas ang GPU ng MacBook, hindi ito ginawa para sa scientific computing, at tila mas isang pagpapakita ng kakayahan ang gawain na ito.
Ang tugon ng developer ay medyo direktang sinabi: "Ang pinakamalaking gamit ay ang pagiging kasiyahan at pagiging madali sa paggawa." Ipinaliwanag niya na ang malawakang simulasyon ng team ay naka-run na sa cluster, at ang pagkakaroon ng kakayahang mag-run ito sa Apple architecture ay nagpapatotoo na ang disenyo ng device abstraction layer ay tama. Ang mas praktikal na dahilan ay nakatago sa araw-araw na pag-unlad — bago magsimula ng malaking simulasyon, kailangan muna ng maliit na simulasyon para sa debugging, at ang pag-debug sa lokal gamit ang CPU ay sobrang mabagal; ang mga resulta ng simulasyon ay madalas ay ilang GB, at ang SSH ay hindi kayang i-transfer, habang ang remote desktop ay masyadong mabigat at mahirap gamitin, kaya mas mabuti na i-run ito lokal. Ang pinakamagandang bahagi ay ang code na naka-debug sa laptop ay maaaring i-deploy nang walang pagbabago sa GPU cluster, at ito ay awtomatikong magpapalawak ng sukat.

Ang pag-aaral na ito ay patotoo rin na ang isang parehong set ng mga algorithm na CUDA/HIP ay maaaring magtrabaho nang relatibong transparente sa iba’t ibang hardware backend tulad ng Apple Silicon. Sa hinaharap, ang mga developer ng software ay maaaring hindi na nakabatay sa isang GPU ecosystem lamang.

Bukod dito, ipinapakita nito na ang AI (GPT-5.6 Sol) ay naglalakbay mula sa «pagtutulong sa pagsulat ng code» patungo sa «pagkakaaliw sa pagdidisenyo ng sistema, pagpapabuti, at pag-debug ng mga proyekto sa iba’t ibang platform».
Ang Apple GPU ay maaaring lamang ang simula ng paglalampas sa pagkakabahagi ng CUDA.
Mga link na pang-referensya: https://x.com/Abhinavsns/status/2079774018748694696
Ang artikulong ito ay galing sa WeChat public account na “Machine Heart” (ID: almosthuman2014), may-akda: Machine Heart
