CUDA কোড অ্যাপল M3 Pro GPU-এ 10x গতি বৃদ্ধি সহ চলে

icon MarsBit
শেয়ার
AI summary iconসারাংশ
অন-চেইন সংবাদে জানা যায় যে একটি CUDA-ভিত্তিক কম্পিউটেশনাল প্রোগ্রাম একটি Apple M3 Pro ডিভাইসে কম কোড পরিবর্তনের মাধ্যমে সফলভাবে চালানো হয়েছে। এই প্রোগ্রামটি, যা একটি বাস্তব 3D তরল সিমুলেশন পরিচালনা করেছিল, Apple-এর Metal GPU-এ CPU-এর চেয়ে প্রায় ১০ গুণ দ্রুত চলেছিল। এই সেটআপটিতে Clang/HIP, SPIR-V, Vulkan এবং MoltenVK-এর মাধ্যমে একটি রূপান্তর পাইপলাইন ব্যবহার করা হয়েছিল, যা Metal-নির্দিষ্ট API-এর এড়িয়ে চলেছে। GPT-5.6 Sol-এর সহায়তায় সামঞ্জস্যতা সমস্যাগুলি সমাধান করা হয়েছিল। পরীক্ষাটি উচ্চ GPU ব্যবহার এবং সঠিকতা দেখিয়েছে, যা প্রমাণ করেছে যে CUDA/HIP-স্টাইলের অ্যালগরিদমগুলি Apple Silicon-এ কাজ করতে পারে। rea-world assets (RWA) সংবাদটি ক্রস-প্ল্যাটফর্ম কম্পিউটেশনাল টুলগুলির সম্ভাবনা উল্লেখ করে।

একটি মূলত নভিডিয়া CUDA-এর জন্য ডিজাইন করা কম্পিউটেশনাল প্রোগ্রাম, মূল কোডে প্রায় কোনো পরিবর্তন ছাড়াই একটি M3 Pro-সজ্জিত অ্যাপল ডিভাইসে চলেছে।

CUDA

এটি এক্স ব্যবহারকারী @Abhinav গতকাল প্রকাশ করা একটি অগ্রগতি। আরও আশ্চর্যজনক বিষয় হলো, এটি শুধুমাত্র একটি সাধারণ “ভেক্টর যোগ, বিয়োগ, গুণ, ভাগ” ডেমো নয়, বরং একটি বাস্তবিক 3D তরল সিমুলেশন কাজে প্রায় 10 গুণ গতির উন্নতি অর্জন করেছে।

CUDA

এই ঘটনার পেছনে একজন বিশেষ অংশগ্রহণকারী রয়েছে — GPT-5.6 Sol।

এটি ওপেন সোর্স সায়েন্টিফিক কম্পিউটিং প্ল্যাটফর্ম OpenFPM-এ ঘটেছে। গবেষকদের একটি কাজ করছে যা অনেকেই অসম্ভব বলে মনে করে: CUDA/HIP GPU-এর জন্য ডিজাইন করা হাই-পারফরম্যান্স কম্পিউটিং প্রোগ্রামগুলিকে প্ল্যাটফর্মের বাধা অতিক্রম করে অ্যাপলের নিজস্ব Metal GPU আর্কিটেকচারে চালানো।

এটি কেন এত কঠিন? গত দশকগুলিতে, GPU কম্পিউটিং ক্ষেত্রে অত্যন্ত বিচ্ছিন্নতা রয়েছে—NVIDIA-এর CUDA, AMD-এর HIP, এবং Apple-এর Metal। এই ইকোসিস্টেমগুলি বিভিন্ন ভাষার মতো, যারা পরস্পরের সাথে সামঞ্জস্যপূর্ণ নয়। একটি CUDA-এ লেখা প্রোগ্রাম সাধারণত অন্য প্ল্যাটফর্মে চালানোর জন্য পুনরায় লেখার প্রয়োজন হয়।

কিন্তু এবার ডেভেলপাররা একটি নতুন Metal সংস্করণ পুনরায় বিকাশ করার পরিবর্তে একটি রূপান্তর চ্যানেল তৈরি করেছে: প্রোগ্রামটি প্রথমে Clang/HIP এর মাধ্যমে প্রক্রিয়া করা হয়, তারপর SPIR-V, Vulkan এবং MoltenVK এর মতো মধ্যবর্তী স্তরের মাধ্যমে পাস করে, শেষ পর্যন্ত অ্যাপল Metal GPU এটিকে বুঝতে এবং দক্ষতার সাথে বাস্তবায়ন করতে পারে।

বেশি গুরুত্বপূর্ণ বিষয় হলো, তারা কোনও Metal-বিশেষ পার্টিকল API যোগ করেনি। অ্যাপ্লিকেশন লেয়ারে এখনও পুরানো CUDA/HIP স্টাইলের কার্নেল কল বজায় রাখা হয়েছে, যা প্রকৃত হার্ডওয়্যার ট্রান্সপারেন্সি অর্জন করেছে।

এই প্রক্রিয়ায় GPT-5.6 Sol একটি কী ভূমিকা পালন করেছে। এটি ডিভাইস-স্তরের মেমোরি লেআউট তৈরির কাজে সহায়তা করেছে, প্রায় 6 ঘন্টার মধ্যে MoltenVK এবং SPIR-V-এর মধ্যে সামঞ্জস্যতার সমস্যা শনাক্ত করেছে এবং সংশ্লিষ্ট বিকল্প সমাধান ডিজাইন করেছে।

CUDA

প্রোজেক্ট লিঙ্ক: https://github.com/mosaic-group/openfpm/pull/18

এই কাজের প্রকৃত পরীক্ষা হল একটি জটিল টেস্ট কেস — ত্রিমাত্রিক এসপিএইচ বাঁধ ভাঙ্গন সিমুলেশন। এই কাজটি স্ক্যান, সাজানো ও পুনর্বিন্যাস, সেল এবং প্রতিবেশী তালিকা তৈরি, গোস্ট কণা বিনিময়, রিডিউস অপারেশন এবং অ্যাটমিক অপারেশনের মতো অনেকগুলি জটিল মডিউলকে একসাথে পরিচালনা করে। যেকোনো একটি ধাপে সমস্যা হলে, এটি পারফরম্যান্সের হ্রাস বা পদার্থবিদ্যাগত ফলাফলের বিচ্যুতির কারণ হবে।

কিন্তু পরীক্ষার ফলাফল প্রত্যাশার বাইরে ছিল। M3 Pro চিপযুক্ত অ্যাপল ডিভাইসে Metal GPU ব্যবহার করে প্রায় 6 সেকেন্ডে সম্পন্ন হয়েছিল; CPU-এর ধারাবাহিক গণনা ব্যবহার করে প্রায় 60 সেকেন্ডে সম্পন্ন হয়েছিল। অর্থাৎ, একই প্রোগ্রামের জন্য, শুধুমাত্র গণনা হার্ডওয়্যার পরিবর্তন করে প্রায় 10 গুণ গতির উন্নতি পাওয়া গেছে, এবং GPU-এর ব্যবহার 100% এর কাছাকাছি (যা দেখায় যে রূপান্তরের দক্ষতা খুবই উচ্চ)।

বেশি গুরুত্বপূর্ণ বিষয় হলো, গতির বৃদ্ধি সঠিকতার ক্ষতি করে হয়নি। ডেভেলপাররা সিমুলেশন ফলাফলগুলি আরও পরীক্ষা করে দেখেছেন যে অ্যাপল GPU সংস্করণ এবং মূল গণনা সংস্করণ চূড়ান্ত পদার্থবিদ্যাগত ফলাফলগুলি একই রাখে, যেমন প্রধান প্যারামিটার এবং সিমুলেশন ট্রাজেক্টরি উভয়ই অত্যন্ত কাছাকাছি। এর মানে হলো, অ্যাপল GPU শুধুমাত্র চালু হয়নি, বরং এটি প্রকৃতপক্ষে বৈজ্ঞানিক গণনা কাজটি সম্পন্ন করেছে।

ডেভেলপাররা আরও উল্লেখ করেন যে, কণার সংখ্যা N-এর সাথে পার্টিকেল স্টোরেজ রৈখিকভাবে বৃদ্ধি পায়, যখন প্রতিবেশী অনুসন্ধানের মতো কাজের পরিমাণ প্রায় O(N・k) (k হল নির্দিষ্ট ঘনত্বের প্রতিবেশীর সংখ্যা)। বর্তমানে প্রদর্শিত 10 গুণ ত্বরণ হল একক মেশিন ব্যাকএন্ডের তুলনা। ভবিষ্যতে, অ্যাপল Thunderbolt-এর সমর্থিত RDMA প্রযুক্তির মাধ্যমে, একাধিক মেশিনে ডাইনামিক লোড ব্যালেন্সিং অর্জন করা যাবে, যার ফলে সিমুলেশনটি একাধিক ডিভাইসে স্কেল হবে।

অবশ্যই, এই বিপ্লবটি সম্পূর্ণ GPU শিল্পকে পরিবর্তন করতে এখনও দূরে। বর্তমানে অ্যাপল মেটাল GPU-এর একটি বড় সীমাবদ্ধতা হল উচ্চ নির্ভুলতা ফ্লোটিং-পয়েন্ট গণনার জন্য সমর্থনের অভাব, যেখানে অনেক পেশাদার বৈজ্ঞানিক গণনা ডবল-প্রিসিশন অপারেশনের উপর নির্ভরশীল। তাই, আবহাওয়ার পূর্বাভাস, বিমান ও মহাকাশ অনুকরণের মতো সупারকম্পিউটিং পরিস্থিতিতে, নভেডিয়ার পেশাদার GPU-গুলি এখনও সুবিধা পাচ্ছে।

তবে, কেউ কেউ এই অনুসন্ধানের গুরুত্বকে প্রশ্নবিদ্ধ করেছেন; একজন ইন্টারনেট ব্যবহারকারী বলেছেন: "বাজারে অনেক বেশি উপযুক্ত সিস্টেম আছে, Mac-এ এই ছোট সিমুলেশন চালানোর কী প্রয়োজন?" এর অর্থ হলো, MacBook-এর GPU যতই দ্রুত হোক না কেন, এটি বিজ্ঞানগত গণনার জন্য তৈরি করা হয়নি, এটি শুধুমাত্র একটি প্রদর্শনের মতো শোনায়।

ডেভেলপারের প্রতিক্রিয়া খুব স্পষ্ট: "এর সবচেয়ে বড় উপযোগিতা হলো মজা করা এবং কাজ সহজ করা।" তিনি ব্যাখ্যা করেন যে, টিমের বড় সিমুলেশনগুলি ইতিমধ্যেই ক্লাস্টারে চলছে, এবং এই বিষয়টি যে অ্যাপল আর্কিটেকচারে চলছে, তা ডিভাইস অ্যাবস্ট্রাকশন লেয়ারের ডিজাইনের সত্যতা প্রমাণ করে। আরও ব্যবহারিক কারণটি দৈনন্দিন ডেভেলপমেন্টে লুকিয়ে আছে — বড় সিমুলেশন চালানোর আগে, সবসময় ছোট সিমুলেশন দিয়ে ডিবাগিং করতে হয়, এবং CPU-এর উপর লোকাল ডিবাগিং খুবই ধীর; সিমুলেশনের ফলাফলগুলি প্রায়শই কয়েক GB, SSH-এর মাধ্যমে ফিরিয়ে আনা সম্ভব নয়, আর রিমোট ডেস্কটপও ভারী এবং অসুবিধাজনক, তাই সরাসরি লোকালি চালানোই ভালো। সবচেয়ে চমৎকার বিষয়টি হলো, ল্যাপটপে ডিবাগ করা কোডটি অপরিবর্তিতভাবে GPU ক্লাস্টারে ব্যবহার করলে, এটি 자동으로 স্কেলআউট হয়।

CUDA

এই অনুসন্ধানটি প্রমাণ করে যে, একই সেটের CUDA/HIP স্টাইলের অ্যালগরিদমগুলি অপেক্ষাকৃত স্বচ্ছভাবে Apple Silicon এর মতো বিভিন্ন হার্ডওয়্যার ব্যাকএন্ডে চলতে পারে। ভবিষ্যতে, সফটওয়্যার ডেভেলপারদের হয়তো একটিমাত্র GPU ইকোসিস্টেমের সাথে আবদ্ধ থাকতে হবে না।

CUDA

এছাড়াও, এটি দেখায় যে AI (GPT-5.6 Sol) এখন “কোড লেখার সাহায্য করা” থেকে “নিম্নস্তরের সিস্টেম ডিজাইন, অপ্টিমাইজেশন এবং ক্রস-প্ল্যাটফর্ম ইঞ্জিনিয়ারিং ডিবাগিং-এ অংশগ্রহণ”-এর নতুন পর্যায়ে প্রবেশ করছে।

এই অ্যাপল GPU এবার CUDA-এর ব্যবধান পার করেছে, যা শুধু শুরু হতে পারে।

রেফারেন্স লিঙ্ক: https://x.com/Abhinavsns/status/2079774018748694696

এই লেখাটি ওয়েইচ্যাট গ্রুপ "মেশিন মাইন্ড" (ID: almosthuman2014) থেকে এসেছে, লেখক: মেশিন মাইন্ড

দাবিত্যাগ: এই পৃষ্ঠার তথ্য তৃতীয় পক্ষের কাছ থেকে প্রাপ্ত হতে পারে এবং অগত্যা KuCoin এর মতামত বা মতামত প্রতিফলিত করে না। এই বিষয়বস্তু শুধুমাত্র সাধারণ তথ্যগত উদ্দেশ্যে প্রদান করা হয়, কোন ধরনের প্রতিনিধিত্ব বা ওয়ারেন্টি ছাড়াই, বা এটিকে আর্থিক বা বিনিয়োগ পরামর্শ হিসাবে বোঝানো হবে না। KuCoin কোনো ত্রুটি বা বাদ পড়ার জন্য বা এই তথ্য ব্যবহারের ফলে যে কোনো ফলাফলের জন্য দায়ী থাকবে না। ডিজিটাল সম্পদে বিনিয়োগ ঝুঁকিপূর্ণ হতে পারে। আপনার নিজের আর্থিক পরিস্থিতির উপর ভিত্তি করে একটি পণ্যের ঝুঁকি এবং আপনার ঝুঁকি সহনশীলতা সাবধানে মূল্যায়ন করুন। আরও তথ্যের জন্য, অনুগ্রহ করে আমাদের ব্যবহারের শর্তাবলী এবং ঝুঁকি প্রকাশ পড়ুন।