CUDAコードがApple M3 Pro GPUで10倍の速度向上で実行

icon MarsBit
共有
AI summary icon概要
オンチェーンニュースによると、最小限のコード変更でCUDAベースの計算プログラムがApple M3 Proデバイス上で正常に実行されました。このプログラムは実際の3次元流体シミュレーションを処理し、AppleのMetal GPUではCPUよりも約10倍高速に動作しました。このセットアップでは、Clang/HIP、SPIR-V、Vulkan、MoltenVKを含む変換パイプラインが使用され、Metal固有のAPIは回避されました。GPT-5.6 Solが互換性の問題を解決するのに貢献しました。テストではGPUの使用率と精度が高かったことから、CUDA/HIPスタイルのアルゴリズムがApple Silicon上で動作可能であることが証明されました。リアルワールドアセット(RWA)に関するニュースは、クロスプラットフォーム計算ツールの可能性を強調しています。

元々NVIDIA CUDA用に設計された計算プログラムは、カーネルコードをほとんど変更することなく、M3 Proを搭載したAppleデバイス上で直接動作した。

CUDA

これはXのユーザー@Abhinavが昨日発表した進展です。さらに驚異的なのは、これは単なる「ベクトルの加減乗除」のデモではなく、実際の三次元流体シミュレーションタスクで約10倍の速度向上を実現したことです。

CUDA

この背後には、特別な参加者であるGPT-5.6 Solがいます。

この出来事は、オープンソースの科学計算プラットフォームOpenFPMで発生しました。研究者たちは、多くの人が「不可能」と考えていたことを実現しようとしています:CUDA/HIP GPU用に設計された高性能計算プログラムを、プラットフォームの壁を越えて、Apple独自のMetal GPUアーキテクチャ上で動作させることです。

なぜこれが難しいのか?過去十数年間、GPU計算分野は非常に断片化されてきた——NVIDIAにはCUDA、AMDにはHIP、AppleにはMetalがある。これらのエコシステムは異なる言語のように互換性がない。CUDAで書かれたプログラムは、他のプラットフォームで実行するためには大規模な書き直しが必要である。

しかし今回は、開発者がMetal版を新たに開発するのではなく、変換チャネルを構築しました。プログラムはまずClang/HIPを経て、SPIR-V、Vulkan、MoltenVKなどの中間層を経由し、最終的にAppleのMetal GPUが理解して効率的に実行できるようにします。

さらに重要なのは、彼らがMetal専用のパーティクルAPIを一切追加していないことです。アプリケーション層は依然として従来のCUDA/HIPスタイルのカーネル呼び出しを維持し、真のハードウェアトランスペアレンシーを実現しています。

このプロセスにおいて、GPT-5.6 Sol が重要な役割を果たしました。它はデバイス側のメモリレイアウト構築を支援し、約6時間でMoltenVKとSPIR-Vの互換性問題を特定し、相应的な回避策を設計しました。

CUDA

プロジェクトリンク:https://github.com/mosaic-group/openfpm/pull/18

この作業の真の試練は、複雑なテストケースである三次元SPHダム決壊シミュレーションである。このタスクは、スキャン、ソートと再配置、セルおよび近接リストの構築、ghost粒子の交換、還元操作、原子操作など、複数の複雑なモジュールを同時に処理する必要があり、どの工程でも問題が発生すると、パフォーマンスの低下や物理的結果のずれが生じる。

しかし、テスト結果は予想外だった。M3 Proチップを搭載したAppleデバイスでMetal GPUを使用した場合、約6秒で完了したのに対し、CPUで順次計算した場合は約60秒かかった。つまり、同じプログラムで計算ハードウェアを変更するだけで、約10倍の速度向上が実現され、GPU利用率はほぼ100%に達した(これは変換効率が非常に高いことを示している)。

更重要的是、速度の向上は精度を犠牲にしたものではありません。開発者はシミュレーション結果をさらに検証し、Apple GPUバージョンと元の計算バージョンが、重要なパラメータやシミュレーション軌道を含めて、最終的な物理的結果が非常に近いことを確認しました。これは、Apple GPUが単に動作しただけでなく、本物の科学計算タスクを正確に完了したことを意味します。

開発者はさらに、粒子ストレージは粒子数 N に比例して増加し、近傍探索などの処理負荷はおおよそ O(N・k)(k は固定密度における近傍数)であると指摘した。現在提示されている10倍の高速化は、単一マシンのバックエンド比較による結果である。今後、Apple Thunderbolt対応のRDMA技術を活用することで、複数マシン間での動的ロードバランシングを実現し、シミュレーションを複数デバイスにスケールさせることができる。

もちろん、このブレイクスルーはGPU産業全体を変えるにはまだ距離があります。現在、Apple Metal GPUの最大の制限の1つは、高精度浮動小数点演算のサポートが不十分であることで、多くの専門的な科学計算分野では倍精度演算が不可欠です。したがって、天気予測や航空宇宙シミュレーションなどのスーパーコンピューティングシナリオでは、NVIDIAのプロフェッショナルGPUが依然として優位性を保っています。

しかし、この探求の意義を疑問視する声もあり、あるネットユーザーは「すでに市場にははるかに適したシステムがたくさんあるのに、Macでこのような小さなシミュレーションを動かす意味はどこにあるのか?」と述べ、MacBookのGPUがどれほど速くても、科学計算のために設計されたものではないという点を指摘し、これはむしろ技術の見せびらかしに見えると示唆した。

開発者の返答は非常に率直だった。「最も大きな利点は、楽しいことと、作業がやりやすくなることだ。」彼は、チームの大規模シミュレーションはすでにクラスタ上で実行されていたが、今回Appleアーキテクチャ上で動作したことで、デバイス抽象層の設計が妥当であることが確認されたと説明した。さらに現実的な理由は日常の開発に隠れている——大規模シミュレーションを実行する前に、必ず小さなシミュレーションでデバッグを行う必要があり、CPUでローカルデバッグを行うのはあまりに遅い。シミュレーション結果は数GBに及ぶことが多く、SSHでは転送できないし、リモートデスクトップは重く使いにくい。それなら、ローカルで直接実行したほうがましだ。最も素晴らしいのは、ノートパソコン上でデバッグしたコードを、そのままGPUクラスタに置けば、自動的にスケールアップできることだ。

CUDA

この探求は、同じ CUDA/HIP スタイルのアルゴリズムが、Apple Silicon などの異なるハードウェアバックエンド上で比較的透明に実行できることを示しました。今後、ソフトウェア開発者は単一の GPU エコシステムに縛られなくなる可能性があります。

CUDA

また、これはAI(GPT-5.6 Sol)が「コード作成の支援」から「底层システムの設計、最適化、クロスプラットフォームエンジニアリングのデバッグへの参加」へと移行している新たな段階を示しています。

AppleのGPUは今回、CUDAの溝を越えたにすぎない可能性がある。

参照リンク:https://x.com/Abhinavsns/status/2079774018748694696

本文は微信公众号「機械の心」(ID:almosthuman2014)より、著者:機械の心

免責事項: 本ページの情報はサードパーティからのものであり、必ずしもKuCoinの見解や意見を反映しているわけではありません。この内容は一般的な情報提供のみを目的として提供されており、いかなる種類の表明や保証もなく、金融または投資助言として解釈されるものでもありません。KuCoinは誤記や脱落、またはこの情報の使用に起因するいかなる結果に対しても責任を負いません。 デジタル資産への投資にはリスクが伴います。商品のリスクとリスク許容度をご自身の財務状況に基づいて慎重に評価してください。詳しくは利用規約およびリスク開示を参照してください。