এমএল ব্যাকগ্রাউন্ড ছাড়া ব্যক্তি GPT-5.6 Sol ব্যবহার করে সর্বোত্তম মডেল ট্রেন করেন

iconMetaEra
শেয়ার
AI summary iconসারাংশ
একজন এমএল ব্যাকগ্রাউন্ড বিহীন ব্যক্তি GPT-5.6 Sol এবং অন-চেইন ডেটা ব্যবহার করে একটি স্টেট-অফ-দ্য-আর্ট অটোকরেক্ট মডেল ট্রেন করেছেন। 1.7B প্যারামিটার মডেলটি একটি টেস্ট সেটে GPT-5.6 Sol-এর চেয়ে ভালো পারফর্ম করেছে, 91.02% ত্রুটি হ্রাস হার অর্জন করে। ব্যবহারকারী অত্যন্ত কম ইনপুট দিয়েছেন, Sol-এর উপর নির্ভরশীল হয়ে অন-চেইন বিশ্লেষণ, পরীক্ষা এবং পুনরাবৃত্তির জন্য। প্রকল্পটির খরচ শূন্য ডলার এবং MLX ব্যবহার করে MacBook-এর উপর সম্পন্ন হয়েছে।
সবচেয়ে অবাক করা বিষয় হলো: আমার কোনো মেশিন লার্নিংয়ের পটভূমি নেই, মডেল ট্রেনিংয়ের মানক প্রক্রিয়া আমি জানি না, এবং অনেক প্রযুক্তিগত বিস্তারিত আমি বুঝি না। আমি যা করছি, তা হলো শুধু সোলকে নির্দেশ দিচ্ছি, ফলাফলের প্রতিক্রিয়া দিচ্ছি, যাতে এটি নিজেই সমস্যা খুঁজে বার করে, পরীক্ষা ডিজাইন করে এবং ধারাবাহিকভাবে পুনরায় পুনরায় উন্নতি করতে পারে।

লেখক: Anshu

লেখার সংকলন, উৎস: ME News

এটি আমার প্রথম বার যেখানে আমি প্রকৃতপক্ষে অনুভব করেছি যে “AGI আসন্ন হয়েছে।”

আমি আমার নিজের অটো-করেকশন মডেল তৈরি করেছি GPT-5.6 Sol দিয়ে। শেষ পর্যন্ত, এই কেবলমাত্র 17 বিলিয়ন প্যারামিটার বিশিষ্ট স্থানীয় মডেলটি টেস্ট সেটে GPT-5.6 Sol-এর চেয়ে কিছুটা ভালো পারফর্ম করল।

সবচেয়ে অবাক করা বিষয় হলো: আমার কোনো মেশিন লার্নিংয়ের পটভূমি নেই, মডেল ট্রেনিংয়ের মানক প্রক্রিয়া আমি জানি না, এবং অনেক প্রযুক্তিগত বিস্তারিত আমি বুঝি না। আমি যা করছি, তা হলো শুধু সোলকে নির্দেশ দিচ্ছি, ফলাফলের প্রতিক্রিয়া দিচ্ছি, যাতে এটি নিজেই সমস্যা খুঁজে বার করে, পরীক্ষা ডিজাইন করে এবং ধারাবাহিকভাবে পুনরায় পুনরায় উন্নতি করতে পারে।

পুরো প্রক্রিয়াটির জন্য কোনও খরচ নেই।

একটি ক্রমাগত বাড়তে থাকা “টাইপিং সমস্যা” থেকেই সবকিছু শুরু হয়েছিল

দীর্ঘকাল এআই-এর সাথে কথা বলার পর, আমি দেখেছি যে আমার টাইপিং দক্ষতা ধীরে ধীরে খারাপ হয়ে যাচ্ছে।

আমি দ্রুত টাইপ করার অভ্যাস করে ফেলেছি, বানান, অক্ষরের ক্রম বা অক্ষর হারানোর মতো সমস্যাগুলি পরীক্ষা করা বন্ধ করে দিয়েছি। আমার টাইপিং দক্ষতা পুনরায় প্রশিক্ষণের পরিবর্তে, আমি একটি আরও এআই-যুগোপযোগী সমাধান গ্রহণ করেছি: সমস্যার সমাধানের জন্য আরও বেশি এআই ব্যবহার করা।

প্রাচীন স্বয়ংক্রিয় সংশোধন ইনপুটের সময় ধারাবাহিকভাবে টেক্সট পরিবর্তন করে, যা মনোযোগ বিঘ্নিত করে। আমার ধারণা হলো, ব্যবহারকারীকে বিঘ্নহীনভাবে দ্রুত ইনপুট দিতে দেওয়া, যদিও এতে অসংখ্য ভুল থাকে, এবং ইনপুট শেষ হওয়ার পর AI-এর মাধ্যমে একসাথে পরিষ্কার করা।

একইসাথে, আমি চাই এই মডেলটি যতটা সম্ভব ছোট হোক।

ছোট মডেল হলে রান করার গতি বেশি, বিদ্যুৎ খরচ কম এবং সম্পূর্ণভাবে স্থানীয়ভাবে চালানোর জন্য আরও উপযুক্ত। দক্ষতা, ব্যাটারি লাইফ, বা শুধুমাত্র পরীক্ষামূলক আগ্রহের জন্য, আমি দেখতে চাই: একটি যথেষ্ট ছোট স্থানীয় মডেল স্বয়ংক্রিয় সংশোধনকে কতটা পর্যন্ত করতে পারে।

তাই, আমি নিজে একটি প্রশিক্ষণ দেওয়ার সিদ্ধান্ত নিলাম।

সলকে একজন স্বয়ংক্রিয় পরীক্ষা পরিচালনাকারী গবেষক হিসাবে রাখুন

এই প্রকল্পটি আন্দ্রেজ কারপাথির "অটোরিসার্চ" পরীক্ষা থেকে অনুপ্রাণিত।

আমি Codex এর /goal মোডের মাধ্যমে Sol-এর জন্য একটি সাইক্লিক ওয়ার্কফ্লো ডিজাইন করেছি:

একটি পরীক্ষা নির্বাচন করুন, পরীক্ষা চালান, ফলাফল ডকুমেন্টে রেকর্ড করুন; যদি ব্যর্থ হয়, তবে এই পথ ত্যাগ করুন; এরপর পরবর্তী পরীক্ষা পরিকল্পনা করুন, যে ভুলগুলি ইতিমধ্যে যাচাই করা হয়েছে তা পুনরাবৃত্তি এড়াতে।

আমি কেবল কয়েকটি অবশ্যই পাস করার ইনপুট উদাহরণ, কঠোর ল্যাটেন্সি লক্ষ্য এবং চূড়ান্ত প্রাপ্ত ফলাফল প্রদান করেছি, তারপর সোলকে নিজেই চালানোর জন্য ছেড়ে দিয়েছি।

এরপরের ঘটনাগুলি আমার প্রত্যাশার বাইরে চলে গেল।

Sol প্রথমে কয়েকটি প্রার্থী বেস মডেল, যার মধ্যে রয়েছে Qwen 3.5, Gemma 4 এবং Liquid LFM 2.5, সংগ্রহ করে তুলনা করে। তারপর, এটি Hugging Face-এ বাস্তব টাইপিং টেক্সটের সাথে সম্পর্কিত একটি ডেটাসেট খুঁজে পায়।

কিন্তু প্রকৃত ডেটা এখনও যথেষ্ট নয়।

ব্যবহারকারীর প্রকৃত ইনপুটের কাছাকাছি স্পেলিং ভুল তৈরির জন্য, সল একটি “আঙুল দিয়ে ম্যাক কীবোর্ড টিপা” সিমুলেটর লিখেছেন। এটি কীবোর্ডের ভৌত বিন্যাসের ভিত্তিতে, গাউসিয়ান বিন্যাস ব্যবহার করে আঙুলের পড়ার বিন্দু সিমুলেট করে এবং নিম্নলিখিত সাধারণ ভুলগুলি তৈরি করে:

  • পাশের বোতামে ক্লিক করুন;
  • বর্ণমালার ক্রম উল্টো;
  • পুনরাবৃত্তি করুন;
  • অক্ষর বাদ পড়েছে;
  • একসাথে একাধিক বোতামে আঙুল স্পর্শ করুন।

বেস মডেল, টেক্সট ডেটা এবং কীবোর্ড ভুল সিমুলেটর পাওয়ার পর, সল আমার MacBook-এ MLX ব্যবহার করে ফাইন-টিউন করেছে।

এক ঘন্টার কম সময়ের মধ্যে এটি একটি কার্যকরী প্রোটোটাইপ তৈরি করেছিল।

সমস্যা হলো, প্রথম সংস্করণের সঠিকতা পর্যাপ্ত নয়।

প্রথম বাধা: টোকেনাইজার বানানের ভুল বুঝতে পারে না

Sol প্রাসঙ্গিক গবেষণাপত্রগুলি পড়েছেন এবং একটি সিরিজ পরীক্ষা ডিজাইন করেছেন, যার ফলে তিনি সিদ্ধান্ত নিয়েছেন: মডেলের প্রধান বাধা প্রশিক্ষণ ডেটা নয়, বরং Tokenizer, অর্থাৎ টোকেনাইজার।

বড় ভাষা মডেলগুলি সাধারণত অক্ষর দ্বারা অক্ষর পাঠ করে না, বরং প্রথমে টেকনোলজিতে টেক্সট বিভক্ত করে। সাধারণ শব্দগুলি স্থিতিশীল অর্থগত ইউনিটে বিভক্ত হতে পারে, কিন্তু বানানের ভুলগুলি প্রায়শই মূল টোকেন কাঠামোকে বিনষ্ট করে।

এর অর্থ হলো, মানুষের জন্য খুবই স্পষ্ট একটি বর্ণ ভুল, মডেলের দৃষ্টিতে সম্পূর্ণ অপরিচিত টোকেনের একটি সেটে পরিণত হতে পারে।

মডেলটি প্রকৃতপক্ষে ভুলকে “বুঝতে” পারে না, শুধুমাত্র ভুল বানান এবং সঠিক বানানের মধ্যে ম্যাপিং মেমোরাইজ করে। এটি করা শুধুমাত্র জেনারালাইজেশনের ক্ষমতা কমিয়ে দেয় এবং মডেলের মূল ভাষাগত জ্ঞানকে সম্পূর্ণভাবে ব্যবহার করতে পারে না।

Sol প্রথমে Google-এর ByT5 পরীক্ষা করেছিল।

ByT5 হল এমন একটি মডেল যা প্রাচীন টোকেনাইজারের উপর নির্ভর করে না, বরং বাইট সিকোয়েন্সকে সরাসরি প্রক্রিয়া করে। এই প্রচেষ্টাটি উল্লেখযোগ্য উন্নতি আনে, কিন্তু ByT5 প্রকাশের সময়টি পুরনো, এবং মডেলটির ভাষাগত জ্ঞান সীমিত, ফলে চূড়ান্ত কর্মক্ষমতা GPT-5.6 Sol-এর মতো পৌঁছাতে পারেনি।

গবেষণা চালিয়ে যাওয়ার পর, সল বুঝতে পারল যে সমস্যাটি অবশ্যই “টোকেনাইজার সম্পূর্ণ বাতিল” করে সমাধান করতে হবে এমন নয়।

এটি পরিবর্তে T5Gemma নির্বাচন করেছে, যা একটি এনকোডার-ডিকোডার আর্কিটেকচারের মডেল।

একটি শুধুমাত্র পরবর্তী টোকেন পূর্বানুমান করার মডেলের বিপরীতে, এনকোডার-ডিকোডার মডেলটি প্রথমে এনকোডার দ্বারা ইনপুটটি সম্পূর্ণভাবে বুঝতে পারে এবং তারপর ডিকোডার দ্বারা সংশোধিত টেক্সট তৈরি করে। আরও গুরুত্বপূর্ণ বিষয় হল, সল এনকোডারের জন্য পোস্ট-ট্রেনিংও করতে পারে, যাতে মডেলটি স্পেলিং ভুলযুক্ত ইনপুটগুলি আরও ভালভাবে চিনতে পারে।

এই রুটটি মডেলের পারফরম্যান্সের সীমানা উল্লেখযোগ্যভাবে বাড়িয়ে দেয়।

দ্বিতীয় বাধা: প্রচলিত ক্ষতি ফাংশন মডেলকে "পরিবর্তন করবেন না" এর প্রোত্সাহন দেয়

মডেল আর্কিটেকচার পরিবর্তনের পর, একটি নতুন সমস্যা দেখা দিয়েছে।

মডেলটি কিছু ভুল সঠিকভাবে সংশোধন করতে পারে, কিন্তু অন্যান্য স্পষ্ট বানানের ত্রুটি প্রায়শই উপেক্ষা করে। ইনপুটে ভুল থাকলেও এটি সাধারণত সেগুলি অপরিবর্তিত রাখে।

সল শেষ পর্যন্ত বুঝতে পারল যে সমস্যাটি সবচেয়ে সাধারণ ক্রস-এনট্রপি লস ফাংশন থেকে আসছে।

অটো-করেকশন ডেটাতে, বেশিরভাগ অক্ষর মূলতই সঠিক, এবং প্রকৃতপক্ষে সংশোধনের প্রয়োজন হওয়া অক্ষরগুলির অনুপাত খুবই কম। যদি আপনি স্ট্যান্ডার্ড ক্রস-এনট্রপি ব্যবহার করে মডেলটি প্রশিক্ষণ দেন, তাহলে মডেলের সবচেয়ে নিরাপদ কৌশল হবে “যতটা সম্ভব কিছুই পরিবর্তন না করা”。

কারণ মূল পাঠ কপি করলে বেশিরভাগ স্থানে সঠিক উত্তর পাওয়া যায়, কিন্তু সক্রিয়ভাবে পরিবর্তন করলে ভুল হওয়ার সম্ভাবনা বেড়ে যায়।

অন্যভাবে বললে, প্রাচীন প্রশিক্ষণ লক্ষ্যগুলি মডেলকে অপরিবর্তিত রাখার জন্য পুরস্কৃত করছে।

এই সমস্যার সমাধানের জন্য, সল একটি কাস্টম লস ফাংশন লিখেছেন।

এটি প্রথমে মূল টেক্সট এবং লক্ষ্য টেক্সটকে বাইট স্তরে সাজায়, তারপর ডাইনামিক প্রোগ্রামিং অ্যালগরিদম ব্যবহার করে দুটি টেক্সটের মধ্যে ন্যূনতম এডিটিং পথ গণনা করে, যা চিহ্নিত করে যে কোন অবস্থানগুলি কপি, কোনগুলি প্রকৃতপক্ষে সন্নিবেশ, মুছে ফেলা বা প্রতিস্থাপন।

এর উপর ভিত্তি করে, সল সঠিক সংশোধনের জন্য প্রশিক্ষণ ওজন উল্লেখযোগ্যভাবে বাড়িয়েছে এবং শুধুমাত্র অক্ষর কপি করার ফলে লাভ কমিয়েছে।

অনেকগুলি প্যারামিটার সমায়োজনের পর, মডেলের সংশোধন সঠিকতা উল্লেখযোগ্যভাবে বৃদ্ধি পেয়েছে।

তৃতীয় বাধা: মডেল একবার ভুল পথে গেলে ফিরে আসতে পারে না

শেষ প্রধান সমস্যাটি স্ব-পুনরাবৃত্তিমূলক উত্পাদন কৌশল থেকে আসে।

মডেলটি টেক্সট তৈরি করার সময় শুধুমাত্র ইতিমধ্যে তৈরি করা কন্টেন্টের ভিত্তিতে পরবর্তী টোকেনটি পূর্বানুমান করতে পারে। একবার যদি আগের কোনো ধাপে ভুল হয়, তাহলে পরবর্তী তৈরি হওয়া কন্টেন্টটি সেই ভুল ফলাফলের উপর ভিত্তি করে তৈরি হবে, এবং মডেলটি আসলে ফিরে গিয়ে সংশোধন করতে পারে না।

তাত্ত্বিকভাবে, মডেলকে উত্তর দেওয়ার আগে প্রথমে "চিন্তা" করার মতো করে প্রশিক্ষণ দেওয়া যায়, কিন্তু এটি ল্যাটেন্সি বৃদ্ধি করবে এবং তাৎক্ষণিক প্রতিক্রিয়ার প্রয়োজনীয়তা সহ স্বয়ংক্রিয় সংশোধনের পরিস্থিতিতে উপযুক্ত হবে না।

Sol শেষপর্যন্ত একটি আরও সুন্দর সমাধান খুঁজে পেয়েছে: বিম সার্চ, যা বিম অনুসন্ধান।

মডেল এখন প্রতিটি পদক্ষেপে শুধুমাত্র সর্বোচ্চ সম্ভাবনার একক পথ নির্বাচন করে না, বরং একসাথে একাধিক সম্ভাব্য জেনারেশন শাখা রাখে এবং বিভিন্ন সংশোধন ফলাফল সমান্তরালভাবে অনুসন্ধান করে। অনুসন্ধান শেষে, সর্বোচ্চ সঞ্চিত লগ-সম্ভাবনা সহ পূর্ণাঙ্গ পথটি নির্বাচন করা হয়।

এটি একক থ্রেড যুক্তির পরিবর্তে সমান্তরাল অনুসন্ধান ব্যবহার করে।

বিম সার্চ চূড়ান্ত ফলাফলকে উল্লেখযোগ্যভাবে উন্নত করে, কিন্তু একটি অভিজ্ঞতা সমস্যা প্রবর্তন করে: সম্পূর্ণ সার্চ শেষ না হওয়া পর্যন্ত ব্যবহারকারী কোনও আউটপুট দেখতে পান না।

সল পরে একটি খুব বুদ্ধিমানের পর্যবেক্ষণ করেছিল।

প্রতিটি অনুসন্ধানের পরে, বর্তমানে সংরক্ষিত সমস্ত শাখা তুলনা করা যেতে পারে। যতক্ষণ এই শাখাগুলির একই শুরু থাকবে, ততক্ষণ “দীর্ঘতম সাধারণ পূর্ববর্তী” চূড়ান্ত ফলাফলে অবশ্যই উপস্থিত থাকবে।

সুতরাং, সিস্টেম এই কন্টেন্টটি ব্যবহারকারীকে তাত্ক্ষণিকভাবে দেখাতে পারে।

অনুসন্ধান চলাকালীন, দুর্বল পথগুলি ধীরে ধীরে বাদ পড়ে যায় এবং বাকি শাখাগুলির সাধারণ প্রিফিক্স ধীরে ধীরে দীর্ঘ হয়ে ওঠে। শেষ পর্যন্ত, ব্যবহারকারী একবারে হঠাৎ করে ফলাফল দেখেন না, বরং ধারাবাহিকভাবে উত্পন্ন সংশোধিত টেক্সট দেখেন।

Sol একটি কাস্টম MLX ইনফারেন্স পাইপলাইন তৈরি করেছে, যা MacBook GPU ব্যবহার করে প্যারালাল ডিকোডিং করে।

শেষ পর্যন্ত, প্রথম টোকেনের আউটপুট ল্যাটেন্সি মাত্র প্রায় 40 মিলিসেকেন্ড, যা পর্যাপ্ত দ্রুত, এবং পুরো প্রক্রিয়াটি সম্পূর্ণভাবে স্থানীয়ভাবে সম্পন্ন হয়।

শেষ ফলাফল: 17 বিলিয়ন প্যারামিটার মডেল GPT-5.6 Sol কে ছাড়িয়ে গেছে

চূড়ান্ত মূল্যায়নের জন্য "ত্রুটি হ্রাসের হার" মেট্রিক হিসাবে ব্যবহার করা হয়, যেখানে সংখ্যাটি যত বেশি, মডেলটি ইনপুট ত্রুটি তত বেশি ঠিক করে।

প্রতিবেদনটি নিম্নরূপ:

  • অ্যাপল স্বয়ংক্রিয় সংশোধন: 49.66%
  • GPT-5.6 লুনা: 82.47%
  • GPT-5.6 টেরা: 87.64%
  • GPT-5.6 সল: 90.56%
  • আমাদের প্রশিক্ষিত 1.7 বিলিয়ন প্যারামিটার মডেল: 91.02%

এই স্থানীয় ছোট মডেলটি চূড়ান্তভাবে GPT-5.6 Sol-কে খুব কম সুবিধায় ছাড়িয়ে গেছে।

আমি ডেটা লিক বা মডেলের "চালাকি" থাকা কিনা তা বিশেষভাবে পরীক্ষা করেছি। পরীক্ষার সময়, আমরা প্রশিক্ষণ ডেটায় উপস্থিত শব্দগুলি সক্রিয়ভাবে বাদ দিই, যাতে মডেলটি ভুল এবং উত্তরের মধ্যে ম্যাপিংকে শুধুমাত্র মুখস্থ করছে না তা নিশ্চিত হয়।

প্রকল্পটির চূড়ান্ত খরচ হল:

একটি মডেল কোটা রিসেট এবং 0 ডলার নগদ ব্যয়।

যা আমাকে আশ্চর্যচিত করেছে তা শুধু চূড়ান্ত স্কোর নয়

প্রকল্পের সময়, তুলনামূলক শিক্ষা, GRPO, DPO, ডায়নামিক মাস্কিং সহ অনেকগুলি অপ্রকাশিত পরীক্ষা ছিল।

সমস্ত প্রচেষ্টা সফল হয়নি, কিন্তু সল সক্রিয়ভাবে ডকুমেন্টেশন পড়েছে, সমস্যা শনাক্ত করেছে, অনুমান তৈরি করেছে, পরীক্ষা ডিজাইন করেছে, ফলাফল বিশ্লেষণ করেছে এবং ব্যর্থতার অভিজ্ঞতা থেকে পরবর্তী প্রচেষ্টার পরিকল্পনা করেছে।

আমার জন্য, বাস্তবিক অসাধারণ বিষয় হল "একটি 17 বিলিয়ন প্যারামিটার মডেল GPT-5.6 Sol-এর উপরে উঠেছে" এই ঘটনাটি নয়।

বেশি গুরুত্বপূর্ণ বিষয় হলো, মেশিন লার্নিংয়ের কোনো পটভূমি না থাকা একজন ব্যক্তি এখন এআই ব্যবহার করে আগে পেশাদার গবেষণা দলের প্রয়োজন হতো এমন পরীক্ষার প্রক্রিয়া সম্পন্ন করতে পারেন।

আমি সমস্ত অন্তর্নিহিত জ্ঞান অধিকার করি নি এবং পূর্বে কোনো সম্পূর্ণ প্রযুক্তিগত পথ প্রস্তুত করি নি। আমি শুধু নিশ্চিত ছিলাম যে আমি কী সমস্যা সমাধান করতে চাই, এবং তারপর সোলকে উত্তর খুঁজতে অবিরাম উৎসাহিত করেছি।

এটি শুধু কোড লেখে না, বরং গবেষক, প্রকৌশলী এবং পরীক্ষার ডিজাইনারের ভূমিকাও পালন করে।

এটি হতে পারে আমার প্রথম বার আসলে “AGI অনুভব” করার মুহূর্ত।

অভিজ্ঞতার অভাব আপনাকে পরীক্ষা শুরু করতে বাধা দেবে না।

যখন এআই সাধারণ মানুষকে পেশাদার বাধা পার করতে সাহায্য করে, তখন অতীতে যেসব প্রযুক্তিগত প্রকল্প অপ্রাপ্য মনে হত, সেগুলো এখন আর দূরে থাকতে পারে না।

দাবিত্যাগ: এই পৃষ্ঠার তথ্য তৃতীয় পক্ষের কাছ থেকে প্রাপ্ত হতে পারে এবং অগত্যা KuCoin এর মতামত বা মতামত প্রতিফলিত করে না। এই বিষয়বস্তু শুধুমাত্র সাধারণ তথ্যগত উদ্দেশ্যে প্রদান করা হয়, কোন ধরনের প্রতিনিধিত্ব বা ওয়ারেন্টি ছাড়াই, বা এটিকে আর্থিক বা বিনিয়োগ পরামর্শ হিসাবে বোঝানো হবে না। KuCoin কোনো ত্রুটি বা বাদ পড়ার জন্য বা এই তথ্য ব্যবহারের ফলে যে কোনো ফলাফলের জন্য দায়ী থাকবে না। ডিজিটাল সম্পদে বিনিয়োগ ঝুঁকিপূর্ণ হতে পারে। আপনার নিজের আর্থিক পরিস্থিতির উপর ভিত্তি করে একটি পণ্যের ঝুঁকি এবং আপনার ঝুঁকি সহনশীলতা সাবধানে মূল্যায়ন করুন। আরও তথ্যের জন্য, অনুগ্রহ করে আমাদের ব্যবহারের শর্তাবলী এবং ঝুঁকি প্রকাশ পড়ুন।