সাম্প্রতিক সময়ে, নভিডিয়া একটি অফিসিয়াল বড় মডেল ইনফারেন্স গাইড প্রকাশ করেছে, কিন্তু এটি পড়তে পড়তে এটি মনে হচ্ছে যেন একটি চীনা টিমের গবেষণা পত্রের সংকলন।
এটা এমন হয়েছে।
সেপ্টেম্বর ২ তারিখে, নভিডিয়া টেকনোলজি ব্লগে একটি দীর্ঘ নিবন্ধ প্রকাশিত হয়েছে: "স্পেকুলেশন-বেসড ডিকোডিং ব্যবহার করে এআই মডেল কো-ডিজাইন"।
প্রধান বিষয় হল একটি সিলেকশন টেবিল, যা বর্তমানে সবচেয়ে জনপ্রিয় 6টি ইনফারেন্স স্পিডিং সমাধানকে এক সারিতে সাজিয়ে ট্রেনিং খরচ এবং প্রয়োগের পরিসর পর্যন্ত পরিষ্কারভাবে উপস্থাপন করে।

এটির গুরুত্ব হলো, এটি চিপের অধিপতি দ্বারা অত্যন্ত দুর্লভভাবে একটি ঔপচারিক ভাবে লেখা নিয়ম, যেখানে "মডেলটিকে হার্ডওয়্যারের ভৌত সীমার সাথে কীভাবে মানিয়ে নেওয়া উচিত" তা বর্ণনা করা হয়েছে।
এবং যখন তারা সিলিকন চিপের সীমানার উপর নাচার জন্য সেরা সমাধান খুঁজছে, তখন গাইডলাইনে অন্তর্ভুক্ত মূল পরিকল্পনাগুলির প্রায় সবগুলি চীনা দল দ্বারা পরিচালিত।
এটি সাধারণ অ্যালগরিদম পর্যালোচনার পরিসরের বাইরে চলে গেছে। এই টেবিলটি কী রহস্য প্রকাশ করেছে? চলুন একটি একটি করে লাইন বিশ্লেষণ করি।
প্রায় শুদ্ধ লাভের ব্যবসা: স্পেকুলেশন ডিকোড কী করছে
এই টেবিলটি বুঝতে হলে প্রথমে বুঝতে হবে যে “স্পেকুলেটিভ ডিকোডিং” কী ধরনের খেলা।
বড় মডেল শব্দগুলি একে একে বের করে। প্রতিটি শব্দ বের করার সময়, কয়েকশত জিবি প্যারামিটারকে গ্রাফিক্স মেমোরিতে পুরোপুরি চালাতে হয়। আসলে, বেশিরভাগ সময়ই কম্পিউটিং পাওয়ার মেমোরি থেকে ডেটা স্থানান্তরের জন্য অপেক্ষা করছে।
স্পেকুলেটিভ ডিকোডিংয়ের সমাধান খুব সরল এবং সরাসরি—
প্রথমে একটি হালকা মডেল ব্যবহার করে পূর্বানুমান করুন, একসাথে 7টি অক্ষর অনুমান করুন; তারপর বড় মডেলটি একসাথে এই 7টি অক্ষরের যাচাই করুন।
7টি অক্ষর যাচাই করা এবং নিজে একটি অক্ষর লেখা প্রায় একই সময় নেয়, কারণ ওজন যাইহোক একবার স্থানান্তরিত হয়।
সঠিক অনুমান করলে সরাসরি গ্রহণ করুন, ভুল অনুমান করলে বিচ্ছিন্ন বিন্দু থেকে পুনরায় শুরু করুন। কারণ বড় মডেল শুধুমাত্র তার নিজের মূলত লেখা অক্ষরগুলিকেই গ্রহণ করে, তাই চূড়ান্ত আউটপুটে কোনও বিরামচিহ্নই পরিবর্তন করার দরকার নেই। এটিই যা বলা হয় «ক্ষতিহীন ত্বরণ»।

এই গেমটিতে, সমস্ত ক্যালকুলেশন একটি কেন্দ্রীয় গাণিতিক প্রত্যাশা সূত্রকে কেন্দ্র করে ঘুরে বেড়ায়:
স্পিডআপ = 𝔼[L] × TtargetTdraft + Tverify
লাভের প্রত্যাশিত মান 𝔼[L] হল লব, যা প্রত্যাশিত গ্রহণযোগ্য দৈর্ঘ্যকে নির্দেশ করে (বড় মডেল প্রতি রাউন্ডে গড়ে কয়টি অক্ষর সঠিকভাবে চিহ্নিত করে)।
হর হল আপনার যে অতিরিক্ত খরচ করেন, সেটি হল ছোট মডেলটির পূর্বানুমানের সময় (Tdraft) এবং বড় মডেলটির চূড়ান্ত যাচাইয়ের সময় (Tverify)।
স্পিডআপ বাড়ানোর জন্য শুধু দুটি পথ আছে: বা তো লব বাড়ান (আরও সঠিকভাবে অনুমান করুন), নাহলে হরকে চরমভাবে কমিয়ে ফেলুন (আরও দ্রুত অনুমান করুন)।
প্রতিযোগীদের কাঁধে চড়ে চতুর্থ প্রজন্মের উন্নতি ঘটানো
নভেডিয়ার এই টেবিলটি উপর থেকে নিচের দিকে অনুসরণ করলে, আপনি একটি স্পষ্ট প্রতিদ্বন্দ্বিতার রেখা দেখতে পাবেন।
প্রথম লাইনটি সবচেয়ে পুরনো "বাহ্যিক ড্রাফ্ট মডেল", যার জন্য একটি ছোট মডেলকে সহায়ক হিসেবে আলাদাভাবে প্রশিক্ষণ দিতে হবে।
NVIDIA সরাসরি একটি অত্যন্ত ব্যয়বহুল বিল প্রকাশ করেছে: শুরু থেকে ট্রেন করতে 1T থেকে 10T টোকেন খরচ হয়, যার খরচ অত্যন্ত বেশি।
কিন্তু এটি এখনও তালিকায় রয়ে গেছে কারণ নভিডিয়া এটিকে একটি নির্দিষ্ট গন্তব্যের জন্য নির্ধারণ করেছে—তারা ২০০ বিলিয়ন ডলার খরচ করে Groq চিপ (LPU) অধিগ্রহণ করেছে।
শেষ লাইনটি হল ট্রেনিং ছাড়াই n-gram টেবিল লুকআপ, যা পূর্ববর্তী টেক্সট থেকে পুনরাবৃত্তি হওয়া অংশগুলি সরাসরি খুঁজে কপি করে, যা শুধুমাত্র বড় পরিমাণে কপি-পেস্টের জন্য উপযুক্ত।
মধ্যবর্তী চারটি লাইনই প্রকৌশলের বিকাশকে প্রতিনিধিত্ব করে।

দ্বিতীয় লাইন: EAGLE-3।
উত্তর বিশ্ববিদ্যালয়ের ইউহুই লি, ওয়াটারলু বিশ্ববিদ্যালয়ের হোংয়াং জাং ইত্যাদির দল থেকে।
ICML থেকে EMNLP পর্যন্ত যাওয়ার পথে, তিন বছরে তিনটি প্রজন্ম প্রকাশ করে, তারা «অক্ষরে অক্ষরে অনুমান» এই সিরিয়াল পুরনো পথকে ভৌত সীমানায় নিয়ে গেছে।
এটি একসময় এই ক্ষেত্রের পূর্ণাঙ্গ অধিপতি ছিল, কিন্তু নভিডিয়ার নতুন তালিকায়, এটিকে শুধুমাত্র "রেফারেন্স পজিশন"-এ ঠেলে দেওয়া হয়েছে, যার কারণ অত্যন্ত সংক্ষিপ্ত: গ্রহণযোগ্য দৈর্ঘ্য পরবর্তী ঢেউ দ্বারা অতিক্রম করা হয়েছে।
তৃতীয় লাইন: MTP (মাল্টি-টোকেন প্রেডিকশন)।
ধারণাটি মেটা দ্বারা ২০২৪ সালে প্রথম চালু করা হলেও, এটিকে বড় মডেল উপসংহারের জন্য মানক করে তোলে কে? DeepSeek -V3।
নভেডিয়াকে এটির প্রশংসা করা হয়েছে অত্যন্ত উচ্চ মানের—GPU-এর জন্য বড় মডেলের সেরা পছন্দ। মূল বিষয় হলো, এই সমাধানটি প্রি-ট্রেনিং পর্যায়েই মূল মডেলের সাথে একসাথে প্রশিক্ষণ করা হতে হবে।
চতুর্থ লাইন: DFlash। 6x ক্ষতিহীন স্পিড নিয়ে আসা হার্ডকোর প্লেয়ার।
তিনজন লেখক জিয়ান চেন, ইয়েশেং লিয়াং, জিজিয়ান লিউ। এটি ইয়াগল এবং এমটিপির মতো “একটি অক্ষর পর একটি অক্ষর অনুমান” করার ক্রমিক পদ্ধতিকে সম্পূর্ণভাবে পরিত্যাগ করে, বরং ডিফিউশন মডেলকে অনুসরণ করে, একবারের ফরওয়ার্ড ক্যালকুলেশনে সরাসরি 7টি টোকেনের পূর্বাভাসিত সিকোয়েন্সটি একসাথে তৈরি করে, যা হর (সময়)কে সর্বোচ্চ পর্যায়ে কমিয়েছে।
একটি পাশাপাশি, গাইড শিক্ষক জিজিয়ান লিউ হলেন ইউসিএসডি-র সহকারী অধ্যাপক, কিন্তু তিনি একইসাথে নভেডিয়া রিসার্চের গবেষক বিজ্ঞানীও।
পঞ্চম লাইন: DSpark। DeepSeek এবং পেকিং বিশ্ববিদ্যালয়ের মিশ্রিত 24 সদস্যের দল দ্বারা পরিচালিত।
DFlash-এর সমান্তরাল আর্কিটেকচার যদিও দ্রুত, তবে একটি মারাত্মক দুর্বলতা রয়েছে: পিছনের দিকে অনুমান করতে করতে এর সঠিকতা কমে যায়। অক্ষরসংখ্যা (অনুমোদিত দৈর্ঘ্য) বাড়ানোর জন্য, DSpark সমান্তরাল ভিত্তির উপর একটি অত্যন্ত হালকা ক্রমিক মডিউল যুক্ত করেছে।
প্রাক্তন ডেটা খুব স্পষ্ট: গ্রহণযোগ্য দৈর্ঘ্য EAGLE-3 এর চেয়ে প্রায় 30% বেশি এবং DFlash এর চেয়ে 18% বেশি। এর DeepSeek V4-এর অনলাইন প্রোডাকশন এনভায়রনমেন্টে, গতি MTP-এর তুলনায় 60% থেকে 85% দ্রুত।
হার্ডওয়্যার কনস্ট্যান্ট, রিভার্স লকড মডেল আর্কিটেকচার
এই চারটি প্রজন্মের প্রযুক্তি শুধুমাত্র অ্যালগরিদমের চাতুর্যের উপর নির্ভর করে এই পর্যন্ত ক্যালকুলেশন ক্ষমতা চুষে নেয়।
অনেকে মনে করে যে যত বেশি ড্রাফট একসাথে অনুমান করবেন, তত বেশি লাভ হবে, কিন্তু এটি সিলিকন চিপের ভৌত নিয়মকে সম্পূর্ণভাবে উপেক্ষা করে।
যখন ধ্যান মেকানিজমটি ডিকোডিং সময়ের বড় অংশ দখল করে, তখন বড় মডেলের যাচাইকরণ পর্যায়ে প্রক্রিয়াকরণ করতে হবে 1+D টোকেন (1টি বাস্তব ইনপুট + Dটি খসড়া পূর্বানুমান)।
এই ডেটা জিপিইউকে দেওয়ার জন্য, হার্ডওয়্যার নিম্ন স্তরে কোয়েরি হেড এবং কেভি হেডকে গ্রুপ করে, প্রতিটি গ্রুপের অ্যাটেনশন কোরের ব্লক আকার অবশ্যই জিপিইউর ভৌত ম্যাট্রিক্সের সীমানা (টাইল সাইজ, বর্তমান আর্কিটেকচারে সাধারণত 128) দ্বারা কঠোরভাবে নিয়ন্ত্রিত হবে।
এটি নিম্নলিখিত অ্যালাইনমেন্ট ফর্মুলা পাওয়া গেল: G × (1 + D) ≤ 128
একটু যুক্তি দিয়েই নিউডিয়া গাইডের চূড়ান্ত ধ্রুবক নীতি পাওয়া যায়:
D = 128G − 1
এখানে, G হল অনুসন্ধান গ্রুপের সংখ্যা (কিউ হেড এবং কেভি হেডের অনুপাত)।
এর অর্থ হলো, আপনার মডেলটি ডিজাইন করার সময় যেভাবে মনোযোগ গ্রুপ করা হয়েছিল, সেটাই সরাসরি নির্ধারণ করে যে কতটি অক্ষর অনুমান করা উচিত যাতে GPU-এর ব্লকগুলি পুরোপুরি পূরণ হয়।
যদি G=8 হয়, তাহলে আপনি ঠিক 15টি অনুমান করতে পারবেন; যদি G=32 হয়, তাহলে শুধুমাত্র 3টি অনুমান করতে পারবেন। হার্ডওয়্যার সীমানা অতিক্রম করতে পারে না, যদিও শেষ Tile-এর অর্ধেক মাত্র ব্যবহার করেন, গণনা ক্ষমতা পুরো Tile-এর জন্যই চার্জ করা হবে।
আগে, স্পেকুলেটিভ ডিকোডিং হল মডেল প্রশিক্ষণ শেষ হওয়ার পরে ইঞ্জিনিয়ারিং টিম দ্বারা অতিরিক্ত স্পিড-আপ প্যাকেজ হিসাবে যোগ করা হত। কিন্তু এখন, ভিত্তির ভৌত সূত্রগুলি আপনাকে বলছে: একটি হার্ডওয়্যার ম্যাট্রিক্সের ধ্রুবকটি সরাসরি মডেল আর্কিটেকচারের ডিজাইন প্যারামিটারগুলিতে ফিরে যায়।
আমাদের ধারণা, কম প্রায়ই চিপ প্রস্তুতকারকরা এমন কিছু করেন যে, একটি বেসিক হার্ডওয়্যারের সীমাবদ্ধতা সমীকরণকে বড় মডেলের ডিজাইন ড্রয়িং-এ অন্তর্ভুক্ত করেন।
শেষ অংশ
মডেল রান করার দক্ষতার প্রতিযোগিতার কেন্দ্র সম্পূর্ণ বদলে গেছে।
বড় প্যারামিটার জমা করার যুগ শেষ হয়ে যাচ্ছে, এখন বিজয়ের চাবিকাঠি হল কে নিজের নিচের সিলিকন চিপের ভৌত সীমার কথা বেশি বুঝে।
এই চিপ বিগ দ্বারা বিপরীত নিয়ম তৈরি করা নতুন মাঠে, চীনা দলগুলি ইতিমধ্যেই বিপ্লবের ডিফল্ট উত্তর হয়ে উঠেছে।
এমন একটি ক্যালকুলেশন বাজারের নেতা যেমন নভিডিয়া, স্টোরের শেলফে কোন অ্যালগরিদম রাখা আছে তা নিয়ে কোনো অপছন্দ করবে না।
কিন্তু সিলিকন ওয়াফার সর্বোচ্চ সীমাকে চরম পর্যন্ত চাপিয়ে দেওয়া এই সেরা সমাধানটি কার হাতে তৈরি হয়েছে, তা স্পষ্টভাবে কাগজে কালি করে লেখা আছে।
এই পোস্টটি ওয়েইচ্যাট গ্রুপ "নিউ জ্ঞান মেটা" থেকে এসেছে, লেখক: ASI প্রতিজ্ঞা
