غیر ایم ایل پس منظر والے صارف نے GPT-5.6 Sol کے ساتھ SOTA ماڈل تربیت دیا

iconMetaEra
بانٹیں
AI summary iconخلاصہ
ایک غیر ML پس منظر والے صارف نے GPT-5.6 Sol اور آن چین ڈیٹا کا استعمال کرتے ہوئے ایک سٹیٹ آف دی آرٹ آٹو کریکٹ ماڈل تربیت دیا۔ 1.7B پیرامیٹر ماڈل نے ٹیسٹ سیٹ پر GPT-5.6 Sol کو پار کر دیا اور 91.02% خطأ کمی کی شرح حاصل کی۔ صارف نے مینیمل ان پٹ فراہم کیا، جس میں آن چین تجزیہ، تجربات اور دہرائی کے لیے Sol پر انحصار کیا گیا۔ اس منصوبے کی لاگت صفر ڈالر تھی اور اسے ایک MacBook پر MLX کا استعمال کرتے ہوئے مکمل کیا گیا۔
سب سے زیادہ عجیب بات یہ ہے کہ میرے پاس کوئی ماشین لرننگ کا پس منظر نہیں ہے، میں ماڈل ٹریننگ کے معیاری عمل کو نہیں جانتا اور بہت سے ٹیکنیکل تفصیلات سے بھی آگاہ نہیں۔ میں جو کچھ کرتا ہوں، وہ صرف سول کو مسلسل درخواستیں دینا، نتائج کا جائزہ لینا اور اسے خود مسائل تلاش کرنے، تجربات ڈیزائن کرنے اور مستقل طور پر ترقی دینے کی اجازت دینا ہے۔

لکھنے والے: Anshu

مضمون ترجمہ، ماخذ: ME News

یہ پہلی بار ہے جب میں نے اصل میں محسوس کیا کہ "AGI اب آ چکا ہے".

میں نے GPT-5.6 Sol کے ساتھ اپنا ایک خودکار اصلاح ماڈل تربیت دیا۔ آخرکار، صرف 17 ارب پیرامیٹرز والے اس مقامی ماڈل نے ٹیسٹ سیٹ پر GPT-5.6 Sol کو تھوڑا سا پیچھے چھوڑ دیا۔

سب سے زیادہ عجیب بات یہ ہے کہ میرے پاس کوئی ماشین لرننگ کا پس منظر نہیں ہے، میں ماڈل ٹریننگ کے معیاری عمل کو نہیں جانتا اور بہت سے ٹیکنیکل تفصیلات سے بھی آگاہ نہیں۔ میں جو کچھ کرتا ہوں، وہ صرف سول کو مسلسل درخواستیں دینا، نتائج کا جائزہ لینا اور اسے خود مسائل تلاش کرنے، تجربات ڈیزائن کرنے اور مستقل طور پر ترقی دینے کی اجازت دینا ہے۔

پورا عمل مفت ہے۔

سب کچھ ایک ہوتے جا رہے "ٹائپنگ کی مسئلہ" سے شروع ہوا

طویل مدت تک AI کے ساتھ بات چیت کرنے کے بعد، میں نے محسوس کیا کہ میری ٹائپنگ کی صلاحیت逐渐 کمزور ہو رہی ہے۔

میں تیزی سے ٹائپ کرنے کے عادی ہو چکا ہوں، اور اب میں تحریری غلطیوں، حروف کے ترتیب یا حروف کی کمی کی تفصیل سے نہیں گزر رہا۔ اپنی ٹائپنگ کی صلاحیت کو دوبارہ تربیت دینے کے بجائے، میں نے AI کے دور کے مطابق ایک زیادہ مناسب حل اپنایا: مسائل کو حل کرنے کے لیے مزید AI استعمال کرنا۔

سنتھیٹک آٹو کریکشن درج کرتے وقت مسلسل متن کو تبدیل کرتا ہے، جس سے خیالات میں رکاوٹ پیدا ہوتی ہے۔ میرا خیال یہ ہے کہ صارفین کو بلا رکاوٹ تیزی سے درج کرنے دیا جائے، چاہے درج کردہ متن میں کتنے ہی غلطیاں ہوں، اور درج کرنا ختم ہونے کے بعد AI ایک ساتھ تمام غلطیوں کو صاف کر دے۔

اسی دوران، میں چاہتا ہوں کہ یہ ماڈل اتنا چھوٹا ہو جتنا ممکن ہو۔

جتنی چھوٹی مدل ہوگی، اتنی ہی تیزی سے چلے گی، کم طاقت استعمال کرے گی، اور مکمل طور پر مقامی طور پر چلانے کے لیے زیادہ مناسب ہوگی۔ چاہے کارکردگی، بیٹری کی مدت، یا صرف تجرباتی دلچسپی کے لیے، میں چاہتا ہوں کہ دیکھوں: ایک کافی چھوٹی مقامی مدل خودکار اصلاح کو کتنی حد تک کر سکتی ہے۔

اس لیے میں نے فیصلہ کیا کہ میں اپنا خود تربیت دوں گا۔

سول کو ایک خودکار تجربہ کرنے والے ریسرچر بنائیں

اس منصوبے کی حوصلہ افزائی اینڈریج کارپاتھی کے "آٹو ریسرچ" تجربے سے ہوئی۔

میں نے Codex کے /goal موڈ کے ذریعے Sol کے لیے ایک سائکلک ورک فلو ڈیزائن کیا:

ایک تجربہ منتخب کریں، تجربہ کریں، اور نتائج کو دستاویز میں درج کریں؛ اگر ناکام ہو جائے، تو اس راستے کو چھوڑ دیں؛ اور اگلے تجربے کی منصوبہ بندی کریں، جبکہ پہلے تصدیق شدہ غلطیوں سے بچیں۔

میں نے صرف کچھ ضروری ان پٹ نمونے، سخت تاخیر کے اہداف، اور حاصل کرنا چاہا جانے والا نتیجہ فراہم کیا، اور اس کے بعد سول کو خود چلانے دے دیا۔

اگلی بات میری توقع سے زیادہ تھی۔

سول نے پہلے کئی امیدوار بنیادی ماڈلز، جن میں Qwen 3.5، Gemma 4 اور Liquid LFM 2.5 شامل ہیں، کو تلاش کیا اور ان کا موازنہ کیا۔ اس کے بعد، اس نے Hugging Face پر اصل ٹائپنگ ٹیکسٹ سے متعلق ایک ڈیٹا سیٹ تلاش کیا۔

لیکن حقیقی ڈیٹا ابھی کافی نہیں ہے۔

تاکہ صارفین کے اصل ان پٹ کے قریب اسپیلنگ کی غلطیاں پیدا کی جائیں، سول نے "انگلیوں کے ذریعہ میک کی بورڈ پر ٹکٹکی" کا ایک محاکہ تیار کیا۔ یہ کی بورڈ کے فزیکل لے آؤٹ کے مطابق، گوسین تقسیم کے ذریعہ انگلیوں کے گرنے کے نقطے کو محاکہ کرتا ہے اور عام غلطیوں کی اقسام جیسے:

  • پاس کے بٹن دبائیں؛
  • حروف کا ترتیب الٹا ہے؛
  • دوبارہ درج کریں؛
  • حروف چھوٹ گئے؛
  • ایک ساتھ متعدد کلیدوں کو ایک ساتھ چھو لیں۔

بنیادی ماڈل، ٹیکسٹ ڈیٹا اور کی بورڈ غلطیوں کے شابہ کے ساتھ، میں نے Sol کو اپنے MacBook پر MLX کے استعمال سے فائن ٹیون کر لیا۔

ایک گھنٹے سے کم وقت میں، اس نے ایک کام کرنے والا پروٹو ٹائپ تیار کر لیا۔

مسئلہ یہ ہے کہ پہلی نسخہ کی درستگی اچھی نہیں تھی۔

پہلا رکاوٹ: ٹوکنائزیر سپیلنگ کی غلطیوں کو نہیں سمجھتا

سول نے متعلقہ تحقیقی مقالہ پڑھا اور ایک سیریز ٹیسٹ ڈیزائن کیے، جس کے بعد انہوں نے فیصلہ کیا کہ ماڈل کا بنیادی瓶颈 ٹریننگ ڈیٹا میں نہیں، بلکہ ٹوکنائزیر، یعنی ٹوکنائزیر میں ہے۔

بڑے زبانی ماڈل عام طور پر حروف کے لحاظ سے متن کو نہیں سمجھتے، بلکہ پہلے متن کو ٹوکن میں تقسیم کر دیتے ہیں۔ عام الفاظ مستقل معنائی اکائیوں میں تقسیم ہو سکتے ہیں، لیکن املائی غلطیاں اکثر ٹوکن کی ساخت کو خراب کر دیتی ہیں۔

اس کا مطلب یہ ہے کہ انسانوں کے لیے واضح ایک حرف کی غلطی، ماڈل کی نظر میں مکمل طور پر نئے ٹوکن کا مجموعہ بن سکتی ہے۔

ماڈل حقیقی طور پر "سمجھ" نہیں سکتا کہ غلطی کیا ہے، بلکہ صرف غلط اور درست اسپیلنگ کے درمیان میپنگ کو مکینیکل طور پر یاد رکھتا ہے۔ ایسا کرنا نہ صرف جنرلائزیشن کی صلاحیت کم کرتا ہے، بلکہ ماڈل کے اصل زبانی علم کا بھی پورا فائدہ نہیں اٹھاتا۔

سول نے سب سے پہلے گوگل کے ByT5 کی کوشش کی۔

ByT5 ایک ایسا ماڈل ہے جو روایتی ٹوکنائزیر پر انحصار نہیں کرتا بلکہ بائٹ سیکوئنس کو ب без ترکیب سے پروسیس کرتا ہے۔ اس کوشش سے واضح بہتری آئی، لیکن ByT5 کا اطلاق زیادہ پہلے ہوا تھا اور ماڈل میں زبان کی معلومات کم ہیں، جس کی وجہ سے آخری کارکردگی GPT-5.6 Sol کے سطح تک نہیں پہنچ سکی۔

مزید تحقیق کے بعد، سول نے سمجھا کہ مسئلہ کو “ٹوکنائزیر کو مکمل طور پر ختم کرنا” ضروری نہیں ہے۔

اس نے بجائے اس کے T5Gemma کو منتخب کیا، جو ایک Encoder-Decoder آرکیٹیکچر کا ماڈل ہے۔

صرف اگلے ٹوکن کا پیشگوئی کرنے والے ماڈل سے الگ، اینکوڈر-ڈیکوڈر ماڈل اینکوڈر کے ذریعے ان پٹ کو مکمل طور پر سمجھ سکتا ہے، اور پھر ڈیکوڈر درست شدہ متن پیدا کرتا ہے۔ اہم بات یہ ہے کہ Sol اینکوڈر کے لیے مزید ٹریننگ بھی کر سکتا ہے تاکہ ماڈل غلط تحریر والے ان پٹ کو بہتر طور پر پہچان سکے۔

یہ راستہ ماڈل کی کارکردگی کی حد کو نمایاں طور پر بڑھاتا ہے۔

دوسرا رکاوٹ: روایتی نقصان فنکشن ماڈل کو "مت تبدیل کریں" کی ترغیب دیتے ہیں

ماڈل آرکیٹیکچر کو تبدیل کرنے کے بعد، ایک نیا مسئلہ ظاہر ہوا۔

ماڈل کچھ غلطیوں کو درست کرنے میں کامیاب ہو گیا ہے، لیکن دیگر واضح املائی مسائل کو اکثر نظرانداز کر دیتا ہے۔ یہ اگرچہ ان پٹ میں غلطیاں ہوں، لیکن انہیں ویسے ہی کا ویسا کا نقل کرنے کا رجحان رکھتا ہے۔

سول نے آخرکار پایا کہ مسئلہ سب سے عام کراس اینٹروپی لاس فنکشن سے آ رہا ہے۔

آٹو کریکشن ڈیٹا میں، زیادہ تر کریکٹرز اصل میں درست ہوتے ہیں، اور صرف بہت کم کریکٹرز میں تبدیلی کی ضرورت ہوتی ہے۔ اگر آپ معیاری کراس اینٹروپی کا استعمال کرکے تربیت دیں، تو ماڈل کے لیے سب سے محفوظ حکمت عملی "جتنا ممکن ہو اصلاح نہ کرنا" ہوگی۔

کیونکہ اصل متن کو کاپی کرنے سے زیادہ تر جگہوں پر صحیح جواب ملتا ہے، جبکہ فعال تبدیلی سے غلطیاں ہو سکتی ہیں۔

دیگر الفاظ میں، روایتی تربیت کے مقاصد ماڈل کو مستقل رکھنے کے لیے انعام دے رہے ہیں۔

اس مسئلے کو حل کرنے کے لیے، سول نے ایک مخصوص نقصان فنکشن تیار کیا۔

یہ پہلے اصل متن اور مقصدی متن کو بائٹ سطح پر مساوی کرتا ہے، پھر دو متنوں کے درمیان کم سے کم ایڈیٹ پاتھ کا حساب لگانے کے لیے ڈائنانمک پروگرامنگ الگورتھم استعمال کرتا ہے، اور پہچانتا ہے کہ کون سی جگہیں کاپی ہیں اور کون سی جگہیں حقیقی درج، حذف یا تبدیلی ہیں۔

اس کے علاوہ، سول نے "درست ترمیم" کے متعلق تربیتی وزن میں کافی اضافہ کیا ہے، جبکہ صرف حروف کی نقل کرنے سے حاصل ہونے والے فوائد کو کم کیا ہے۔

کئی دور کے پیرامیٹر ایڈجسٹمنٹ کے بعد، ماڈل کی اصلاح کی درستگی میں نمایاں بہتری آئی۔

تیسرا رکاوٹ: جب ماڈل غلط راستہ اپنائے تو واپس نہیں جا سکتا

آخری بڑا مسئلہ خودبہ خود تولیدی جنریشن میکنزم سے آیا۔

ماڈل ٹیکسٹ بناتے وقت صرف پہلے سے تخلیق کردہ مواد کے مطابق اگلے ٹوکن کا تخمینہ لگا سکتا ہے۔ اگر کسی ابتدائی مرحلے میں کوئی غلطی ہو جائے، تو باقی تمام تخلیق غلط نتائج پر مبنی ہو جائے گی، اور ماڈل حقیقت میں واپس جا کر اسے درست نہیں کر سکتا۔

نظری طور پر، ماڈل کو ایسے طریقے سے تربیت دی جا سکتی ہے کہ وہ جواب دینے سے پہلے "سوچے"، لیکن اس سے تاخیر میں کافی اضافہ ہوگا اور یہ فوری جواب کی ضرورت والے خودکار اصلاح کے مناظر کے لیے مناسب نہیں ہے۔

سول نے آخرکار ایک زیادہ ایلگزینٹ حل تلاش کیا: بیم سرچ، یعنی بیل سرچ۔

ماڈل اب ہر مرحلے پر صرف اعلیٰ احتمال والی ایک واحد راہ نہیں چنتا، بلکہ متعدد ممکنہ جنریشن شاخوں کو одно ساتھ برقرار رکھتا ہے اور مختلف اصلاح نتائج کا موازنہ کرتا ہے۔ سرچ ختم ہونے کے بعد، سب سے زیادہ جمع لگارتھمک احتمال والی مکمل راہ منتخب کی جاتی ہے۔

یہ منفرد استدلال کے بجائے متوازی تلاش کے برابر ہے۔

بیم سرچ نے آخری نتائج میں واضح بہتری لائی، لیکن ایک تجربے کا مسئلہ بھی پیدا کیا: پوری تلاش مکمل ہونے تک، صارف کو کوئی آؤٹ پٹ نظر نہیں آتا۔

سول نے بعد میں ایک بہت ہی ذکی نظریہ دیا۔

ہر سرچ کے بعد، موجودہ محفوظ شدہ تمام شاخوں کا موازنہ کیا جا سکتا ہے۔ جب تک یہ شاخیں ایک جیسے آغاز رکھتی ہیں، اس "طویل ترین مشترکہ پیش infix" کو حتمی نتیجے میں ضرور شامل کیا جائے گا۔

اس لیے، سسٹم فوراً اس مواد کو صارف کو دکھا سکتا ہے۔

جس طرح تلاش جاری رہتا ہے، کمزور راستے آہستہ آہستہ ختم ہوتے جاتے ہیں، اور باقی شاخوں کا مشترکہ پیش‌لفظ لمبا ہوتا جاتا ہے۔ آخرکار، صارف کو ایک بار میں اچانک ظاہر ہونے والے نتائج نہیں، بلکہ لگاتار ترقی کرتے ہوئے درست کیے گئے متن کو دکھایا جاتا ہے۔

سول نے مک بک GPU کا استعمال کرتے ہوئے ایک کسٹم MLX انفرینس پائپ لائن میں پوری پروسیجر کو تیار کر دیا ہے۔

آخر میں، پہلے ٹوکن کی آؤٹ پٹ لیٹنسی صرف تقریباً 40 ملی سیکنڈ ہے، جو کافی تیز ہے، اور پورا عمل مکمل طور پر لوکل پر مکمل ہوتا ہے۔

نتیجہ: 17 ارب پیرامیٹر ماڈل GPT-5.6 Sol سے آگے

آخری جائزہ "غلطیوں میں کمی کی شرح" کے اعداد و شمار کے ساتھ کیا جاتا ہے، جس میں جتنا زیادہ نمبر ہوگا، اتنا ہی زیادہ ماڈل درج کیے گئے غلطیوں کو درست کرے گا۔

جائزہ درج ذیل ہے:

  • ایپل خودکار درستی: 49.66%
  • GPT-5.6 Luna: 82.47%
  • GPT-5.6 Terra: 87.64%
  • GPT-5.6 Sol: 90.56%
  • ہم نے تربیت دیا گیا 1.7 ارب پیرامیٹر ماڈل: 91.02%

یہ مقامی چھوٹا ماڈل، GPT-5.6 Sol کو بہت ہی کم فرق سے پار کر گیا۔

میں نے ڈیٹا لیک یا ماڈل کے “چیٹ” کرنے کی صورت میں بھی خصوصی طور پر جانچ کی ہے۔ ٹیسٹ کے دوران، ہم تربیتی ڈیٹا میں آنے والے الفاظ کو جان بوجھ کر نکال دیتے ہیں تاکہ یہ تصدیق کی جا سکے کہ ماڈل صرف غلطیوں اور جوابات کے درمیان تعلق کو یاد نہیں رکھ رہا ہے۔

پروجیکٹ کی کل لاگت ہے:

ایک ماڈل کی سیٹنگ ری سیٹ اور 0 امریکی ڈالر نقد اخراج۔

جو مجھے سب سے زیادہ حیران کرتا ہے، وہ صرف آخری اسکور نہیں ہے

پروجیکٹ کے دوران، تقابلی سیکھنے، GRPO، DPO، ڈائنامک ماسکنگ جیسے مختلف رخوں پر کئی ایسے تجربات بھی تھے جنہیں ابھی تک مکمل نہیں کیا گیا۔

ہر کوشش کامیاب نہیں ہوئی، لیکن سول نے مواد کو فعال طور پر پڑھا، مسائل کی پہچان کی، فرضیات بنائیں، تجربات ڈیزائن کیے، نتائج کا تجزیہ کیا، اور ناکامی سے سبق سیکھ کر اگلی کوشش کا منصوبہ بنایا۔

میرے لیے، اصلی طور پر حیران کن بات یہ نہیں ہے کہ "ایک 17 ارب پیرامیٹر ماڈل نے GPT-5.6 Sol کو پار کر لیا"۔

زیادہ اہم بات یہ ہے کہ ایک ایسا شخص جس کے پاس مکین لرننگ کا کوئی تجربہ نہیں، اب AI کی مدد سے وہ تجربات کا عمل مکمل کر سکتا ہے جو پہلے صرف ماہر تحقیقی ٹیمیں ہی کر سکتی تھیں۔

میں نے تمام بنیادی معلومات حاصل نہیں کیں اور نہ ہی مکمل ٹیکنیکل راستہ پہلے سے ڈیزائن کیا۔ میں نے صرف یہ واضح کر لیا کہ میں کس مسئلے کو حل کرنا چاہتا ہوں، اور پھر سول کو جواب تلاش کرنے کے لیے باقاعدگی سے متوجہ رکھا۔

یہ صرف کوڈ لکھنا نہیں، بلکہ ریسرچر، انجینئر اور تجرباتی ڈیزائنر کے کردار بھی ادا کرتا ہے۔

یہ شاید وہ لمحہ ہے جب میں نے پہلی بار حقیقی طور پر “AGI کا احساس” کیا۔

تجربہ کرنے کے لیے تجربہ کی کمی سے مت روکیں۔

جب AI عام لوگوں کو ماہرانہ رکاوٹوں کو پار کرنے میں مدد کر سکے، تو بہت سے ایسے ٹیکنالوجی کے منصوبے جو پہلے ناپید لگتے تھے، اب قریب آ چکے ہو سکتے ہیں۔

اعلان دستبرداری: اس صفحہ پر معلومات تیسرے فریق سے حاصل کی گئی ہوں گی اور یہ ضروری نہیں کہ KuCoin کے خیالات یا خیالات کی عکاسی کرے۔ یہ مواد کسی بھی قسم کی نمائندگی یا وارنٹی کے بغیر صرف عام معلوماتی مقاصد کے لیے فراہم کیا گیا ہے، اور نہ ہی اسے مالی یا سرمایہ کاری کے مشورے کے طور پر سمجھا جائے گا۔ KuCoin کسی غلطی یا کوتاہی کے لیے، یا اس معلومات کے استعمال کے نتیجے میں کسی بھی نتائج کے لیے ذمہ دار نہیں ہوگا۔ ڈیجیٹل اثاثوں میں سرمایہ کاری خطرناک ہو سکتی ہے۔ براہ کرم اپنے مالی حالات کی بنیاد پر کسی پروڈکٹ کے خطرات اور اپنے خطرے کی برداشت کا بغور جائزہ لیں۔ مزید معلومات کے لیے، براہ کرم ہماری استعمال کی شرائط اور خطرے کا انکشاف دیکھیں۔