source avatarsleepy.md

শেয়ার

গত বছরই বাইটডান্স এই 'নবায়ন'টি প্রকাশ করেছিল। এই পথটি নাম রেকুরেন্ট ডেপ্থ। সহজ কথায়, এটি শুধুমাত্র দীর্ঘতর CoT জেনারেট করে আরও কিছুটা ভাবার পরিবর্তে, একই সেটের Transformer block-গুলিকে hidden state-এর উপর পুনরাবৃত্তি করে, বেশি ক্যালকুলেশনকে latent space-এ ঢোকায়। কঠিন সমস্যাগুলির জন্য আরও কয়েকটি রাউন্ড চলে, সহজ প্রশ্নগুলির জন্য তাড়াতাড়ি বেরিয়ে যায়। প্যারামিটারগুলি যুক্তির গভীরতার সাথে বাড়বে না, এবং test-time compute-কেও আরও নমনীয়ভাবে বণ্টন করা যায়। গত অক্টোবরে, বাইটডান্স Seed Ouro-কে প্রকাশ ও open-source করেছিল, যা Looped Language Model। Ouro-1.4B এবং 2.6B-এ pre-training-এর সময়ই iterative latent reasoning-এর সমন্বয় করা হয়েছিল, 2.6B-এর ডিফল্টভাবে একাধিক recurrent computation-এর সমন্বয় হয়, এবং adaptive exit-কেও সমর্থন করে, যাতে বিভিন্ন প্রশ্নগুলি নিজেদেরই সিদ্ধান্ত নিতে পারে যে, কতগুলি রাউন্ডের প্রয়োজন। গতবছর, এটি শুধুমাত্র বাইটডান্সের দ্বারা small model-এর মধ্যে public verification-এর জন্য একটি side project-এর মতোই। এখন OpenAI-এর latest model-এর মধ্যেও it-কে integrate-করা হয়েছে। এটির অর্থ, recurrent depth-টি শুধুমাত্র academicভাবে "খুবই interesting" design-এর বাইরেও, next-generation large model-এর real engineering pathway-এর দিকেই move-করছে। এবং it-এর带来的 problemগুলি benchmark-এরচেয়েও bumpy। অতীতে reasoning model-এর scalability-এর جন্য, many calculations CoT-এ write-করা হত। Model-টি जতদিন longer think, output-এ reasoning tokens-এর quantityও beshi hoto. Although CoT model-এর full internal state-এর shomossho na, kintu ít least ekta safe monitoring window hishebe kaj kore. recurrent depth-টি calculation-গুলিকে latent space-এ beshi beshi neye jabe. একই set of parameters hidden state-এ multiple times loop korte pare, model-টি internalভাবে already beshi calculation complete kore nite pare, and finally shudhu ekta choto text output kore. তখন ekta real problem utthito hoy: Model-টি real reasoning-টি gradually natural language-এর baireye jete shuru korche. যা Astra-এর jnno current researchers er jnno beshi chinta. OpenAI er khud o protidin Chain-of-Thought monitoring ke prioritize kore ase, karon model ta jodi cheat korte chai, reward hack korte chai, ba rule evade korte chai, sometimes CoT-এr maddhome intention show kore. কিন্তু jodi beshi reasoning latent state-এ hoi, tobe ki monitor korbe? OpenAI-এর report hishebe Astra-কে recurrent depth use korar level limit kore deya hoyechilo, jate beshi readable CoT retain kora jai, sath sath internal state and behavior monitoring ke extra deploy kora jai. এইটা actually interesting. গত 3–4বছর, large model-এর reasoning expand korar path ta khub clear chilo: more token diye, beshi bolte diye. পরবর্তীতে, it possible hoye utthe: beshi internal loop diye, kintu model ta tui prochchho ke bole dibe na.

দাবিত্যাগ: এই পৃষ্ঠার তথ্য তৃতীয় পক্ষের কাছ থেকে প্রাপ্ত হতে পারে এবং অগত্যা KuCoin এর মতামত বা মতামত প্রতিফলিত করে না। এই বিষয়বস্তু শুধুমাত্র সাধারণ তথ্যগত উদ্দেশ্যে প্রদান করা হয়, কোন ধরনের প্রতিনিধিত্ব বা ওয়ারেন্টি ছাড়াই, বা এটিকে আর্থিক বা বিনিয়োগ পরামর্শ হিসাবে বোঝানো হবে না। KuCoin কোনো ত্রুটি বা বাদ পড়ার জন্য বা এই তথ্য ব্যবহারের ফলে যে কোনো ফলাফলের জন্য দায়ী থাকবে না। ডিজিটাল সম্পদে বিনিয়োগ ঝুঁকিপূর্ণ হতে পারে। আপনার নিজের আর্থিক পরিস্থিতির উপর ভিত্তি করে একটি পণ্যের ঝুঁকি এবং আপনার ঝুঁকি সহনশীলতা সাবধানে মূল্যায়ন করুন। আরও তথ্যের জন্য, অনুগ্রহ করে আমাদের ব্যবহারের শর্তাবলী এবং ঝুঁকি প্রকাশ পড়ুন।