NVIDIA AI ইনফারেন্স গাইড প্রকাশ করেছে, চীনা দলগুলির নেতৃত্বে 6x লসলেস স্পিডআপ

icon MarsBit
শেয়ার
AI summary iconসারাংশ
NVIDIA 2 সেপ্টেম্বর একটি AI ইনফারেন্স গাইড প্রকাশ করেছে, যাতে ছয়টি ত্বরণ পদ্ধতি উপস্থাপন করা হয়েছে। চীনা দলগুলি স্পেকুলেটিভ ডিকোডিং এবং DFlash-এর মতো প্রধান নবায়নগুলি নেতৃত্ব দিয়েছে, যা 6x লসলেস গতির ব্যবস্থা করে। অল্টকয়েনগুলির জন্য দেখার মতো মূল্যায়নগুলি জনপ্রিয়তা পাচ্ছে, যার ফলে ভয় এবং লালসা সূচকটি এখনও উচ্চ অবস্থায় রয়েছে। GPU টাইল আকারের মতো হার্ডওয়্যার সীমাবদ্ধতা মডেল ডিজাইনকে আকৃতি দেয়। DeepSeek-V3-এর MTP পদ্ধতি এবং অন্যান্য প্রযুক্তিগুলি দক্ষতার জন্য উল্লেখ করা হয়েছে। গাইডটিতে প্রতিটি পদ্ধতির জন্য খরচ এবং ব্যবহারের ক্ষেত্রগুলি বিস্তারিতভাবে উল্লেখ করা হয়েছে।

সাম্প্রতিক সময়ে, নভিডিয়া একটি অফিসিয়াল বড় মডেল ইনফারেন্স গাইড প্রকাশ করেছে, কিন্তু এটি পড়তে পড়তে এটি মনে হচ্ছে যেন একটি চীনা টিমের গবেষণা পত্রের সংকলন।

এটা এমন হয়েছে।

সেপ্টেম্বর ২ তারিখে, নভিডিয়া টেকনোলজি ব্লগে একটি দীর্ঘ নিবন্ধ প্রকাশিত হয়েছে: "স্পেকুলেশন-বেসড ডিকোডিং ব্যবহার করে এআই মডেল কো-ডিজাইন"।

প্রধান বিষয় হল একটি সিলেকশন টেবিল, যা বর্তমানে সবচেয়ে জনপ্রিয় 6টি ইনফারেন্স স্পিডিং সমাধানকে এক সারিতে সাজিয়ে ট্রেনিং খরচ এবং প্রয়োগের পরিসর পর্যন্ত পরিষ্কারভাবে উপস্থাপন করে।

DeepSeek

এটির গুরুত্ব হলো, এটি চিপের অধিপতি দ্বারা অত্যন্ত দুর্লভভাবে একটি ঔপচারিক ভাবে লেখা নিয়ম, যেখানে "মডেলটিকে হার্ডওয়্যারের ভৌত সীমার সাথে কীভাবে মানিয়ে নেওয়া উচিত" তা বর্ণনা করা হয়েছে।

এবং যখন তারা সিলিকন চিপের সীমানার উপর নাচার জন্য সেরা সমাধান খুঁজছে, তখন গাইডলাইনে অন্তর্ভুক্ত মূল পরিকল্পনাগুলির প্রায় সবগুলি চীনা দল দ্বারা পরিচালিত।

এটি সাধারণ অ্যালগরিদম পর্যালোচনার পরিসরের বাইরে চলে গেছে। এই টেবিলটি কী রহস্য প্রকাশ করেছে? চলুন একটি একটি করে লাইন বিশ্লেষণ করি।

প্রায় শুদ্ধ লাভের ব্যবসা: স্পেকুলেশন ডিকোড কী করছে

এই টেবিলটি বুঝতে হলে প্রথমে বুঝতে হবে যে “স্পেকুলেটিভ ডিকোডিং” কী ধরনের খেলা।

বড় মডেল শব্দগুলি একে একে বের করে। প্রতিটি শব্দ বের করার সময়, কয়েকশত জিবি প্যারামিটারকে গ্রাফিক্স মেমোরিতে পুরোপুরি চালাতে হয়। আসলে, বেশিরভাগ সময়ই কম্পিউটিং পাওয়ার মেমোরি থেকে ডেটা স্থানান্তরের জন্য অপেক্ষা করছে।

স্পেকুলেটিভ ডিকোডিংয়ের সমাধান খুব সরল এবং সরাসরি—

প্রথমে একটি হালকা মডেল ব্যবহার করে পূর্বানুমান করুন, একসাথে 7টি অক্ষর অনুমান করুন; তারপর বড় মডেলটি একসাথে এই 7টি অক্ষরের যাচাই করুন।

7টি অক্ষর যাচাই করা এবং নিজে একটি অক্ষর লেখা প্রায় একই সময় নেয়, কারণ ওজন যাইহোক একবার স্থানান্তরিত হয়।

সঠিক অনুমান করলে সরাসরি গ্রহণ করুন, ভুল অনুমান করলে বিচ্ছিন্ন বিন্দু থেকে পুনরায় শুরু করুন। কারণ বড় মডেল শুধুমাত্র তার নিজের মূলত লেখা অক্ষরগুলিকেই গ্রহণ করে, তাই চূড়ান্ত আউটপুটে কোনও বিরামচিহ্নই পরিবর্তন করার দরকার নেই। এটিই যা বলা হয় «ক্ষতিহীন ত্বরণ»।

DeepSeek

এই গেমটিতে, সমস্ত ক্যালকুলেশন একটি কেন্দ্রীয় গাণিতিক প্রত্যাশা সূত্রকে কেন্দ্র করে ঘুরে বেড়ায়:

স্পিডআপ = 𝔼[L] × TtargetTdraft + Tverify

লাভের প্রত্যাশিত মান 𝔼[L] হল লব, যা প্রত্যাশিত গ্রহণযোগ্য দৈর্ঘ্যকে নির্দেশ করে (বড় মডেল প্রতি রাউন্ডে গড়ে কয়টি অক্ষর সঠিকভাবে চিহ্নিত করে)।

হর হল আপনার যে অতিরিক্ত খরচ করেন, সেটি হল ছোট মডেলটির পূর্বানুমানের সময় (Tdraft) এবং বড় মডেলটির চূড়ান্ত যাচাইয়ের সময় (Tverify)।

স্পিডআপ বাড়ানোর জন্য শুধু দুটি পথ আছে: বা তো লব বাড়ান (আরও সঠিকভাবে অনুমান করুন), নাহলে হরকে চরমভাবে কমিয়ে ফেলুন (আরও দ্রুত অনুমান করুন)।

প্রতিযোগীদের কাঁধে চড়ে চতুর্থ প্রজন্মের উন্নতি ঘটানো

নভেডিয়ার এই টেবিলটি উপর থেকে নিচের দিকে অনুসরণ করলে, আপনি একটি স্পষ্ট প্রতিদ্বন্দ্বিতার রেখা দেখতে পাবেন।

প্রথম লাইনটি সবচেয়ে পুরনো "বাহ্যিক ড্রাফ্ট মডেল", যার জন্য একটি ছোট মডেলকে সহায়ক হিসেবে আলাদাভাবে প্রশিক্ষণ দিতে হবে।

NVIDIA সরাসরি একটি অত্যন্ত ব্যয়বহুল বিল প্রকাশ করেছে: শুরু থেকে ট্রেন করতে 1T থেকে 10T টোকেন খরচ হয়, যার খরচ অত্যন্ত বেশি।

কিন্তু এটি এখনও তালিকায় রয়ে গেছে কারণ নভিডিয়া এটিকে একটি নির্দিষ্ট গন্তব্যের জন্য নির্ধারণ করেছে—তারা ২০০ বিলিয়ন ডলার খরচ করে Groq চিপ (LPU) অধিগ্রহণ করেছে।

শেষ লাইনটি হল ট্রেনিং ছাড়াই n-gram টেবিল লুকআপ, যা পূর্ববর্তী টেক্সট থেকে পুনরাবৃত্তি হওয়া অংশগুলি সরাসরি খুঁজে কপি করে, যা শুধুমাত্র বড় পরিমাণে কপি-পেস্টের জন্য উপযুক্ত।

মধ্যবর্তী চারটি লাইনই প্রকৌশলের বিকাশকে প্রতিনিধিত্ব করে।

DeepSeek

দ্বিতীয় লাইন: EAGLE-3।

উত্তর বিশ্ববিদ্যালয়ের ইউহুই লি, ওয়াটারলু বিশ্ববিদ্যালয়ের হোংয়াং জাং ইত্যাদির দল থেকে।

ICML থেকে EMNLP পর্যন্ত যাওয়ার পথে, তিন বছরে তিনটি প্রজন্ম প্রকাশ করে, তারা «অক্ষরে অক্ষরে অনুমান» এই সিরিয়াল পুরনো পথকে ভৌত সীমানায় নিয়ে গেছে।

এটি একসময় এই ক্ষেত্রের পূর্ণাঙ্গ অধিপতি ছিল, কিন্তু নভিডিয়ার নতুন তালিকায়, এটিকে শুধুমাত্র "রেফারেন্স পজিশন"-এ ঠেলে দেওয়া হয়েছে, যার কারণ অত্যন্ত সংক্ষিপ্ত: গ্রহণযোগ্য দৈর্ঘ্য পরবর্তী ঢেউ দ্বারা অতিক্রম করা হয়েছে।

তৃতীয় লাইন: MTP (মাল্টি-টোকেন প্রেডিকশন)।

ধারণাটি মেটা দ্বারা ২০২৪ সালে প্রথম চালু করা হলেও, এটিকে বড় মডেল উপসংহারের জন্য মানক করে তোলে কে? DeepSeek -V3।

নভেডিয়াকে এটির প্রশংসা করা হয়েছে অত্যন্ত উচ্চ মানের—GPU-এর জন্য বড় মডেলের সেরা পছন্দ। মূল বিষয় হলো, এই সমাধানটি প্রি-ট্রেনিং পর্যায়েই মূল মডেলের সাথে একসাথে প্রশিক্ষণ করা হতে হবে।

চতুর্থ লাইন: DFlash। 6x ক্ষতিহীন স্পিড নিয়ে আসা হার্ডকোর প্লেয়ার।

তিনজন লেখক জিয়ান চেন, ইয়েশেং লিয়াং, জিজিয়ান লিউ। এটি ইয়াগল এবং এমটিপির মতো “একটি অক্ষর পর একটি অক্ষর অনুমান” করার ক্রমিক পদ্ধতিকে সম্পূর্ণভাবে পরিত্যাগ করে, বরং ডিফিউশন মডেলকে অনুসরণ করে, একবারের ফরওয়ার্ড ক্যালকুলেশনে সরাসরি 7টি টোকেনের পূর্বাভাসিত সিকোয়েন্সটি একসাথে তৈরি করে, যা হর (সময়)কে সর্বোচ্চ পর্যায়ে কমিয়েছে।

একটি পাশাপাশি, গাইড শিক্ষক জিজিয়ান লিউ হলেন ইউসিএসডি-র সহকারী অধ্যাপক, কিন্তু তিনি একইসাথে নভেডিয়া রিসার্চের গবেষক বিজ্ঞানীও।

পঞ্চম লাইন: DSpark। DeepSeek এবং পেকিং বিশ্ববিদ্যালয়ের মিশ্রিত 24 সদস্যের দল দ্বারা পরিচালিত।

DFlash-এর সমান্তরাল আর্কিটেকচার যদিও দ্রুত, তবে একটি মারাত্মক দুর্বলতা রয়েছে: পিছনের দিকে অনুমান করতে করতে এর সঠিকতা কমে যায়। অক্ষরসংখ্যা (অনুমোদিত দৈর্ঘ্য) বাড়ানোর জন্য, DSpark সমান্তরাল ভিত্তির উপর একটি অত্যন্ত হালকা ক্রমিক মডিউল যুক্ত করেছে।

প্রাক্তন ডেটা খুব স্পষ্ট: গ্রহণযোগ্য দৈর্ঘ্য EAGLE-3 এর চেয়ে প্রায় 30% বেশি এবং DFlash এর চেয়ে 18% বেশি। এর DeepSeek V4-এর অনলাইন প্রোডাকশন এনভায়রনমেন্টে, গতি MTP-এর তুলনায় 60% থেকে 85% দ্রুত।

হার্ডওয়্যার কনস্ট্যান্ট, রিভার্স লকড মডেল আর্কিটেকচার

এই চারটি প্রজন্মের প্রযুক্তি শুধুমাত্র অ্যালগরিদমের চাতুর্যের উপর নির্ভর করে এই পর্যন্ত ক্যালকুলেশন ক্ষমতা চুষে নেয়।

অনেকে মনে করে যে যত বেশি ড্রাফট একসাথে অনুমান করবেন, তত বেশি লাভ হবে, কিন্তু এটি সিলিকন চিপের ভৌত নিয়মকে সম্পূর্ণভাবে উপেক্ষা করে।

যখন ধ্যান মেকানিজমটি ডিকোডিং সময়ের বড় অংশ দখল করে, তখন বড় মডেলের যাচাইকরণ পর্যায়ে প্রক্রিয়াকরণ করতে হবে 1+D টোকেন (1টি বাস্তব ইনপুট + Dটি খসড়া পূর্বানুমান)।

এই ডেটা জিপিইউকে দেওয়ার জন্য, হার্ডওয়্যার নিম্ন স্তরে কোয়েরি হেড এবং কেভি হেডকে গ্রুপ করে, প্রতিটি গ্রুপের অ্যাটেনশন কোরের ব্লক আকার অবশ্যই জিপিইউর ভৌত ম্যাট্রিক্সের সীমানা (টাইল সাইজ, বর্তমান আর্কিটেকচারে সাধারণত 128) দ্বারা কঠোরভাবে নিয়ন্ত্রিত হবে।

এটি নিম্নলিখিত অ্যালাইনমেন্ট ফর্মুলা পাওয়া গেল: G × (1 + D) ≤ 128

একটু যুক্তি দিয়েই নিউডিয়া গাইডের চূড়ান্ত ধ্রুবক নীতি পাওয়া যায়:

D = 128G − 1

এখানে, G হল অনুসন্ধান গ্রুপের সংখ্যা (কিউ হেড এবং কেভি হেডের অনুপাত)।

এর অর্থ হলো, আপনার মডেলটি ডিজাইন করার সময় যেভাবে মনোযোগ গ্রুপ করা হয়েছিল, সেটাই সরাসরি নির্ধারণ করে যে কতটি অক্ষর অনুমান করা উচিত যাতে GPU-এর ব্লকগুলি পুরোপুরি পূরণ হয়।

যদি G=8 হয়, তাহলে আপনি ঠিক 15টি অনুমান করতে পারবেন; যদি G=32 হয়, তাহলে শুধুমাত্র 3টি অনুমান করতে পারবেন। হার্ডওয়্যার সীমানা অতিক্রম করতে পারে না, যদিও শেষ Tile-এর অর্ধেক মাত্র ব্যবহার করেন, গণনা ক্ষমতা পুরো Tile-এর জন্যই চার্জ করা হবে।

আগে, স্পেকুলেটিভ ডিকোডিং হল মডেল প্রশিক্ষণ শেষ হওয়ার পরে ইঞ্জিনিয়ারিং টিম দ্বারা অতিরিক্ত স্পিড-আপ প্যাকেজ হিসাবে যোগ করা হত। কিন্তু এখন, ভিত্তির ভৌত সূত্রগুলি আপনাকে বলছে: একটি হার্ডওয়্যার ম্যাট্রিক্সের ধ্রুবকটি সরাসরি মডেল আর্কিটেকচারের ডিজাইন প্যারামিটারগুলিতে ফিরে যায়।

আমাদের ধারণা, কম প্রায়ই চিপ প্রস্তুতকারকরা এমন কিছু করেন যে, একটি বেসিক হার্ডওয়্যারের সীমাবদ্ধতা সমীকরণকে বড় মডেলের ডিজাইন ড্রয়িং-এ অন্তর্ভুক্ত করেন।

শেষ অংশ

মডেল রান করার দক্ষতার প্রতিযোগিতার কেন্দ্র সম্পূর্ণ বদলে গেছে।

বড় প্যারামিটার জমা করার যুগ শেষ হয়ে যাচ্ছে, এখন বিজয়ের চাবিকাঠি হল কে নিজের নিচের সিলিকন চিপের ভৌত সীমার কথা বেশি বুঝে।

এই চিপ বিগ দ্বারা বিপরীত নিয়ম তৈরি করা নতুন মাঠে, চীনা দলগুলি ইতিমধ্যেই বিপ্লবের ডিফল্ট উত্তর হয়ে উঠেছে।

এমন একটি ক্যালকুলেশন বাজারের নেতা যেমন নভিডিয়া, স্টোরের শেলফে কোন অ্যালগরিদম রাখা আছে তা নিয়ে কোনো অপছন্দ করবে না।

কিন্তু সিলিকন ওয়াফার সর্বোচ্চ সীমাকে চরম পর্যন্ত চাপিয়ে দেওয়া এই সেরা সমাধানটি কার হাতে তৈরি হয়েছে, তা স্পষ্টভাবে কাগজে কালি করে লেখা আছে।

এই পোস্টটি ওয়েইচ্যাট গ্রুপ "নিউ জ্ঞান মেটা" থেকে এসেছে, লেখক: ASI প্রতিজ্ঞা

দাবিত্যাগ: এই পৃষ্ঠার তথ্য তৃতীয় পক্ষের কাছ থেকে প্রাপ্ত হতে পারে এবং অগত্যা KuCoin এর মতামত বা মতামত প্রতিফলিত করে না। এই বিষয়বস্তু শুধুমাত্র সাধারণ তথ্যগত উদ্দেশ্যে প্রদান করা হয়, কোন ধরনের প্রতিনিধিত্ব বা ওয়ারেন্টি ছাড়াই, বা এটিকে আর্থিক বা বিনিয়োগ পরামর্শ হিসাবে বোঝানো হবে না। KuCoin কোনো ত্রুটি বা বাদ পড়ার জন্য বা এই তথ্য ব্যবহারের ফলে যে কোনো ফলাফলের জন্য দায়ী থাকবে না। ডিজিটাল সম্পদে বিনিয়োগ ঝুঁকিপূর্ণ হতে পারে। আপনার নিজের আর্থিক পরিস্থিতির উপর ভিত্তি করে একটি পণ্যের ঝুঁকি এবং আপনার ঝুঁকি সহনশীলতা সাবধানে মূল্যায়ন করুন। আরও তথ্যের জন্য, অনুগ্রহ করে আমাদের ব্যবহারের শর্তাবলী এবং ঝুঁকি প্রকাশ পড়ুন।