একটি মূলত নভিডিয়া CUDA-এর জন্য ডিজাইন করা কম্পিউটেশনাল প্রোগ্রাম, মূল কোডে প্রায় কোনো পরিবর্তন ছাড়াই একটি M3 Pro-সজ্জিত অ্যাপল ডিভাইসে চলেছে।

এটি এক্স ব্যবহারকারী @Abhinav গতকাল প্রকাশ করা একটি অগ্রগতি। আরও আশ্চর্যজনক বিষয় হলো, এটি শুধুমাত্র একটি সাধারণ “ভেক্টর যোগ, বিয়োগ, গুণ, ভাগ” ডেমো নয়, বরং একটি বাস্তবিক 3D তরল সিমুলেশন কাজে প্রায় 10 গুণ গতির উন্নতি অর্জন করেছে।

এই ঘটনার পেছনে একজন বিশেষ অংশগ্রহণকারী রয়েছে — GPT-5.6 Sol।
এটি ওপেন সোর্স সায়েন্টিফিক কম্পিউটিং প্ল্যাটফর্ম OpenFPM-এ ঘটেছে। গবেষকদের একটি কাজ করছে যা অনেকেই অসম্ভব বলে মনে করে: CUDA/HIP GPU-এর জন্য ডিজাইন করা হাই-পারফরম্যান্স কম্পিউটিং প্রোগ্রামগুলিকে প্ল্যাটফর্মের বাধা অতিক্রম করে অ্যাপলের নিজস্ব Metal GPU আর্কিটেকচারে চালানো।
এটি কেন এত কঠিন? গত দশকগুলিতে, GPU কম্পিউটিং ক্ষেত্রে অত্যন্ত বিচ্ছিন্নতা রয়েছে—NVIDIA-এর CUDA, AMD-এর HIP, এবং Apple-এর Metal। এই ইকোসিস্টেমগুলি বিভিন্ন ভাষার মতো, যারা পরস্পরের সাথে সামঞ্জস্যপূর্ণ নয়। একটি CUDA-এ লেখা প্রোগ্রাম সাধারণত অন্য প্ল্যাটফর্মে চালানোর জন্য পুনরায় লেখার প্রয়োজন হয়।
কিন্তু এবার ডেভেলপাররা একটি নতুন Metal সংস্করণ পুনরায় বিকাশ করার পরিবর্তে একটি রূপান্তর চ্যানেল তৈরি করেছে: প্রোগ্রামটি প্রথমে Clang/HIP এর মাধ্যমে প্রক্রিয়া করা হয়, তারপর SPIR-V, Vulkan এবং MoltenVK এর মতো মধ্যবর্তী স্তরের মাধ্যমে পাস করে, শেষ পর্যন্ত অ্যাপল Metal GPU এটিকে বুঝতে এবং দক্ষতার সাথে বাস্তবায়ন করতে পারে।
বেশি গুরুত্বপূর্ণ বিষয় হলো, তারা কোনও Metal-বিশেষ পার্টিকল API যোগ করেনি। অ্যাপ্লিকেশন লেয়ারে এখনও পুরানো CUDA/HIP স্টাইলের কার্নেল কল বজায় রাখা হয়েছে, যা প্রকৃত হার্ডওয়্যার ট্রান্সপারেন্সি অর্জন করেছে।
এই প্রক্রিয়ায় GPT-5.6 Sol একটি কী ভূমিকা পালন করেছে। এটি ডিভাইস-স্তরের মেমোরি লেআউট তৈরির কাজে সহায়তা করেছে, প্রায় 6 ঘন্টার মধ্যে MoltenVK এবং SPIR-V-এর মধ্যে সামঞ্জস্যতার সমস্যা শনাক্ত করেছে এবং সংশ্লিষ্ট বিকল্প সমাধান ডিজাইন করেছে।

প্রোজেক্ট লিঙ্ক: https://github.com/mosaic-group/openfpm/pull/18
এই কাজের প্রকৃত পরীক্ষা হল একটি জটিল টেস্ট কেস — ত্রিমাত্রিক এসপিএইচ বাঁধ ভাঙ্গন সিমুলেশন। এই কাজটি স্ক্যান, সাজানো ও পুনর্বিন্যাস, সেল এবং প্রতিবেশী তালিকা তৈরি, গোস্ট কণা বিনিময়, রিডিউস অপারেশন এবং অ্যাটমিক অপারেশনের মতো অনেকগুলি জটিল মডিউলকে একসাথে পরিচালনা করে। যেকোনো একটি ধাপে সমস্যা হলে, এটি পারফরম্যান্সের হ্রাস বা পদার্থবিদ্যাগত ফলাফলের বিচ্যুতির কারণ হবে।
কিন্তু পরীক্ষার ফলাফল প্রত্যাশার বাইরে ছিল। M3 Pro চিপযুক্ত অ্যাপল ডিভাইসে Metal GPU ব্যবহার করে প্রায় 6 সেকেন্ডে সম্পন্ন হয়েছিল; CPU-এর ধারাবাহিক গণনা ব্যবহার করে প্রায় 60 সেকেন্ডে সম্পন্ন হয়েছিল। অর্থাৎ, একই প্রোগ্রামের জন্য, শুধুমাত্র গণনা হার্ডওয়্যার পরিবর্তন করে প্রায় 10 গুণ গতির উন্নতি পাওয়া গেছে, এবং GPU-এর ব্যবহার 100% এর কাছাকাছি (যা দেখায় যে রূপান্তরের দক্ষতা খুবই উচ্চ)।
বেশি গুরুত্বপূর্ণ বিষয় হলো, গতির বৃদ্ধি সঠিকতার ক্ষতি করে হয়নি। ডেভেলপাররা সিমুলেশন ফলাফলগুলি আরও পরীক্ষা করে দেখেছেন যে অ্যাপল GPU সংস্করণ এবং মূল গণনা সংস্করণ চূড়ান্ত পদার্থবিদ্যাগত ফলাফলগুলি একই রাখে, যেমন প্রধান প্যারামিটার এবং সিমুলেশন ট্রাজেক্টরি উভয়ই অত্যন্ত কাছাকাছি। এর মানে হলো, অ্যাপল GPU শুধুমাত্র চালু হয়নি, বরং এটি প্রকৃতপক্ষে বৈজ্ঞানিক গণনা কাজটি সম্পন্ন করেছে।
ডেভেলপাররা আরও উল্লেখ করেন যে, কণার সংখ্যা N-এর সাথে পার্টিকেল স্টোরেজ রৈখিকভাবে বৃদ্ধি পায়, যখন প্রতিবেশী অনুসন্ধানের মতো কাজের পরিমাণ প্রায় O(N・k) (k হল নির্দিষ্ট ঘনত্বের প্রতিবেশীর সংখ্যা)। বর্তমানে প্রদর্শিত 10 গুণ ত্বরণ হল একক মেশিন ব্যাকএন্ডের তুলনা। ভবিষ্যতে, অ্যাপল Thunderbolt-এর সমর্থিত RDMA প্রযুক্তির মাধ্যমে, একাধিক মেশিনে ডাইনামিক লোড ব্যালেন্সিং অর্জন করা যাবে, যার ফলে সিমুলেশনটি একাধিক ডিভাইসে স্কেল হবে।
অবশ্যই, এই বিপ্লবটি সম্পূর্ণ GPU শিল্পকে পরিবর্তন করতে এখনও দূরে। বর্তমানে অ্যাপল মেটাল GPU-এর একটি বড় সীমাবদ্ধতা হল উচ্চ নির্ভুলতা ফ্লোটিং-পয়েন্ট গণনার জন্য সমর্থনের অভাব, যেখানে অনেক পেশাদার বৈজ্ঞানিক গণনা ডবল-প্রিসিশন অপারেশনের উপর নির্ভরশীল। তাই, আবহাওয়ার পূর্বাভাস, বিমান ও মহাকাশ অনুকরণের মতো সупারকম্পিউটিং পরিস্থিতিতে, নভেডিয়ার পেশাদার GPU-গুলি এখনও সুবিধা পাচ্ছে।
তবে, কেউ কেউ এই অনুসন্ধানের গুরুত্বকে প্রশ্নবিদ্ধ করেছেন; একজন ইন্টারনেট ব্যবহারকারী বলেছেন: "বাজারে অনেক বেশি উপযুক্ত সিস্টেম আছে, Mac-এ এই ছোট সিমুলেশন চালানোর কী প্রয়োজন?" এর অর্থ হলো, MacBook-এর GPU যতই দ্রুত হোক না কেন, এটি বিজ্ঞানগত গণনার জন্য তৈরি করা হয়নি, এটি শুধুমাত্র একটি প্রদর্শনের মতো শোনায়।
ডেভেলপারের প্রতিক্রিয়া খুব স্পষ্ট: "এর সবচেয়ে বড় উপযোগিতা হলো মজা করা এবং কাজ সহজ করা।" তিনি ব্যাখ্যা করেন যে, টিমের বড় সিমুলেশনগুলি ইতিমধ্যেই ক্লাস্টারে চলছে, এবং এই বিষয়টি যে অ্যাপল আর্কিটেকচারে চলছে, তা ডিভাইস অ্যাবস্ট্রাকশন লেয়ারের ডিজাইনের সত্যতা প্রমাণ করে। আরও ব্যবহারিক কারণটি দৈনন্দিন ডেভেলপমেন্টে লুকিয়ে আছে — বড় সিমুলেশন চালানোর আগে, সবসময় ছোট সিমুলেশন দিয়ে ডিবাগিং করতে হয়, এবং CPU-এর উপর লোকাল ডিবাগিং খুবই ধীর; সিমুলেশনের ফলাফলগুলি প্রায়শই কয়েক GB, SSH-এর মাধ্যমে ফিরিয়ে আনা সম্ভব নয়, আর রিমোট ডেস্কটপও ভারী এবং অসুবিধাজনক, তাই সরাসরি লোকালি চালানোই ভালো। সবচেয়ে চমৎকার বিষয়টি হলো, ল্যাপটপে ডিবাগ করা কোডটি অপরিবর্তিতভাবে GPU ক্লাস্টারে ব্যবহার করলে, এটি 자동으로 স্কেলআউট হয়।

এই অনুসন্ধানটি প্রমাণ করে যে, একই সেটের CUDA/HIP স্টাইলের অ্যালগরিদমগুলি অপেক্ষাকৃত স্বচ্ছভাবে Apple Silicon এর মতো বিভিন্ন হার্ডওয়্যার ব্যাকএন্ডে চলতে পারে। ভবিষ্যতে, সফটওয়্যার ডেভেলপারদের হয়তো একটিমাত্র GPU ইকোসিস্টেমের সাথে আবদ্ধ থাকতে হবে না।

এছাড়াও, এটি দেখায় যে AI (GPT-5.6 Sol) এখন “কোড লেখার সাহায্য করা” থেকে “নিম্নস্তরের সিস্টেম ডিজাইন, অপ্টিমাইজেশন এবং ক্রস-প্ল্যাটফর্ম ইঞ্জিনিয়ারিং ডিবাগিং-এ অংশগ্রহণ”-এর নতুন পর্যায়ে প্রবেশ করছে।
এই অ্যাপল GPU এবার CUDA-এর ব্যবধান পার করেছে, যা শুধু শুরু হতে পারে।
রেফারেন্স লিঙ্ক: https://x.com/Abhinavsns/status/2079774018748694696
এই লেখাটি ওয়েইচ্যাট গ্রুপ "মেশিন মাইন্ড" (ID: almosthuman2014) থেকে এসেছে, লেখক: মেশিন মাইন্ড
