وانغ يونهه نے اپنی کاروباری شروعات کے بعد پہلی بار بڑے ماڈل کا نتیجہ پیش کیا۔
کوانٹم بٹس کے مطابق، ہواوی نوآ فیش کے سابق ڈائریکٹر، Pangu Large Model ایجنسی نیٹو ماڈل نیوہورس کو جی یوان لیو دونگ، جن کا ادارہ وانگ یونہے نے قائم کیا، نے جاری کیا۔
یہ ماڈل کو وو ونگ شن قیون کی طرف سے بنیادی ڈھانچہ اور انفراسٹرکچر کی بہتری کی صلاحیت فراہم کی گئی ہے، جبکہ تسوہوا یونیورسٹی اور پکنگ یونیورسٹی کے ٹیمز نے الگورتھم اور ٹریننگ طریقہ کار کے تحقیق میں حصہ لیا ہے، تاکہ ایجنٹ کے پوسٹ ٹریننگ میں ڈیٹا کے استعمال کی کارکردگی اور ٹریننگ کے نتائج میں بہتری لائی جا سکے۔
NeoHorse-1 میں 4B اور 9B دونوں ورژن شامل ہیں، جو ایجینٹ کے کام کے دوران درکار صلاحیتوں، جیسے ٹولز کا استعمال، ماحول کی فیڈ بیک کو پڑھنا، غلطیوں کا پتہ لگانا، راستہ تبدیل کرنا، اور آخرکار کام مکمل کرنا، پر مرکوز ہیں۔

ہارنیس ایجنٹ، ٹولز کا استعمال، کوڈ اور ہدایات کی پیروی سمیت 10 جائزہ جات میں، ایجنٹک پوسٹ-ٹریننگ کے بعد، 4B ماڈل کا کل مجموعی کارکردگی 9B بنیادی ماڈل کے برابر یا تھوڑا زیادہ ہو گئی ہے۔

ایک کمپنی جو ہمیشہ متعدد ماڈلز کے تعاون پر زور دیتی رہی، اب اپنا ماڈل تربیت کیوں شروع کر رہی ہے؟ پریمیٹ رِدھم بنیادی ماڈل کے ٹیبل پر شامل ہونے کے لیے تیار ہے؟
نیوہورس کے جواب کے مطابق، رخ ایسے تبدیل نہیں ہوا۔
یہ ماڈل زیادہ تر بنیادی لہجے کی پچھلی تجربات کو مجموعی طور پر اپنے ماڈل پیرامیٹرز میں شامل کرتا ہے۔
ایجینٹ کے لیے ماڈل منتخب کرنے والی کمپنی نے بھی ماڈل ٹریننگ شروع کر دی ہے
ہمیشہ، اسکورز ماڈلز کی ت порی کا مرکزی معیار رہے ہیں۔
لیکن جب ماڈل کو Agent سسٹم میں ڈالا جانے لگا اور مکمل کام سونپا جانے لگا، تو ایک منفرد اسکور کی وضاحت کی طاقت کم ہو جاتی ہے۔
ایک کام میں، ماڈل صرف ایک منطقی جواب دینے کے بجائے، عمل کے دوران ماحول کی فیڈ بیک کو لگاتار پڑھتا ہے، غلطیوں کو حل کرتا ہے، اور اصل پیش رفت کے مطابق اگلے راستے کو تبدیل کرتا ہے؛ مختلف مراحل ماڈل کی صلاحیتوں کے لیے مختلف مانگ کرتے ہیں۔
اس طرح، پریمیٹ لیب ٹیم نے ایک فیصلہ کیا۔
نمودار کا نارملائز نہ ہونا AI صنعت کا ایک طویل عرصے تک قائم رہنے والا ڈھانچہ ہوگا۔
جتنا زیادہ ماڈل ہوں گے، اتنا ہی زیادہ تقسیمِ کام ہوگا، قیمت اور صلاحیت کے فرق زیادہ واضح ہوں گے، اور اس لیے ایک سسٹم کی ضرورت ہوگی جو کچھ سوالات کا جواب دے:
اس مرحلے کے لیے کون سا ماڈل استعمال کیا جانا چاہیے؟ کون سے مراحل کم لاگت والے ماڈلز کو سونپے جا سکتے ہیں؟ کب تک زیادہ طاقتور انفرینس اور ایکزیکیشن والے ماڈلز تک اپ گریڈ کرنے کی ضرورت ہوتی ہے؟ اگر ایک ایکزیکشن پاتھ رک جائے تو اسے کون سنبھالے؟ کیا متعدد ماڈلز ایک ساتھ منصوبے پیش کر سکتے ہیں اور پھر نتائج کو اکٹھا کیا جا سکتا ہے؟
وونگ یونہہ کی ٹیم نے اس سسٹم کو راؤٹنگ ہارنس کہا ہے (ان کے تحت کے متعلقہ اوپن سورس پروجیکٹ OpenSquilla نے متعدد ماڈلز کو شامل کر لیا ہے، جو ایک یکسانہ انٹرفیس کے ذریعے، ایجنٹ کے عمل کے دوران باریک بینی والی راؤٹنگ، ماڈل تبدیلی اور متعدد ماڈلز کے درمیان تعاون کرتا ہے)۔

اسی خیال کے مطابق، پریمیٹ لیب کے پاس اپنا ماڈل تربیت دینے کا کوئی زیادہ مضبوط سبب نہیں لگتا۔ بازار میں ماڈلز کی کافی وسیع فراہمی موجود ہے، اور ضرورت کے مطابق ان کا استعمال کرنا زیادہ لچکدار لگتا ہے۔
جب اسکیڈولنگ سسٹم جاری رہتا ہے، تو دوسری قسم کے اثاثے جمع ہونے لگتے ہیں، جیسے "کس کام کے لیے کون سی صلاحیت درکار ہے"، "ماڈل کس مرحلے پر ناکام ہوتا ہے"، "کون سا مرمت کا راستہ موثر ہے"، اور "کون سا نتیجہ ماحول کی تصدیق سے گزرتا ہے".
یہ معلومات ایک طرف راؤٹنگ کے فیصلے کو بہتر بناتی ہیں، دوسری طرف تربیتی قیمت بھی حاصل کرنے لگتی ہیں۔
یہ ایک ایسے پلیٹ فارم کی طرح ہے جو بہت سے برانڈز اور صارفین کو جوڑتا ہے۔ ٹریڈنگ کے دوران جمع ہونے والی مانگ، جائزے اور استعمال کے ردعمل، مصنوعات کو زیادہ مناسب صارفین تک پہنچنے میں مدد کر سکتے ہیں اور مزید ترقیاتی تجاویز کے طور پر مصنوعات کے ترقیاتی ٹیم کو واپس بھیجے جا سکتے ہیں۔
اس طرح، پلیٹ فارم سروس مارکیٹ کا عمل اگلے مراحل کی مصنوعات کے بہتری کے لیے ڈیٹا کا ذریعہ بن جاتا ہے۔
NeoHorse کا کام ہے کہ وہ Harness میں جمع ہونے والے کچھ اجرائی تجربات کو ماڈل کی صلاحیتوں میں تبدیل کرے۔
متعدد ماڈلز کے ذریعہ طے کی گئی راہ کو ایجنٹ-نیٹو ماڈل میں سیکھیں
NeoHorse کے ڈیٹا کے ذرائع کا ذکر کیا جانا چاہیے۔
اس کا مرکزی مادہ راؤٹنگ ہارنس سے پیدا ہونے والے ایجنٹ ایکزیکیشن سگنلز کو عوامی ڈیٹا کے ساتھ جوڑ کر ایجنٹ کے بعد کی تربیت کے لیے ڈیٹا سسٹم تعمیر کرنا ہے۔
ایجنٹ ہارنیس میں ایک کام مکمل کرنے پر مکمل اجرائی ریکارڈ چھوڑ دیتا ہے۔
- ٹاسک درج کریں → روتر کو کن صلاحیتوں کی ضرورت ہے
- کسی مدل کا انتخاب کریں
- ماڈل استدلال اور ٹول کال کرتا ہے
- → ماحول نتیجہ واپس کرتا ہے
- → ماڈل جاری رکھے یا خطا آئے
- سسٹم ماڈل تبدیل کر رہا ہے یا راستہ ترتیب دے رہا ہے
- → کام مکمل ہو جائے یا ناکام ہو جائے
عام سوالات کے جوابات عام طور پر صرف "سوال" اور "جواب" دو اطراف پر مرکوز ہوتے ہیں۔
روٹنگ ہارنس کے ڈیٹا میں مزید کچھ لیورز کی معلومات بھی شamil ہیں: کام کو کن صلاحیتوں کی ضرورت ہے، سسٹم نے کون سا اجرائی فیصلہ لیا، اور ماحول نے آخرکار کیا ردعمل دیا۔
مثلاً، روتر ابتدائی طور پر یہ جانچ لیتا ہے کہ کوئی کام صرف عام ماڈل کی ضرورت رکھتا ہے، لیکن اگر اس کے عمل کے دوران متعدد ناکامیاں ہوتی ہیں، تو وہ زیادہ طاقتور ماڈل پر اپ گریڈ ہو جاتا ہے اور اس کے بعد ہی کام مکمل ہوتا ہے۔
اس راستے میں ایک ناکامی سے کہیں زیادہ معلومات شامل ہیں۔
سسٹم جان سکتا ہے کہ ابتدائی صلاحیت کا جائزہ نیچے ہو سکتا ہے، ماڈل کس مرحلے پر مسئلہ پیدا ہوا، زیادہ طاقتور ماڈل نے کون سی حکمت عملی اپنائی، کون سا اجرائی راستہ آخرکار ماحول کی تصدیق سے گزرا، اور کام مکمل کرنے کے لیے مزید کتنے ٹوکن اور وقت کا استعمال ہوا۔

اہم بات یہ ہے کہ پریمیٹ رِد کا مشاہدہ کسی ایک ماڈل کے اپنی صلاحیتوں کے بارے میں فیصلہ نہیں، بلکہ متعدد ماڈلز کا ایک جیسے کاموں پر عرض کردہ افقی اداء ہے۔
اس میں کامیاب راستوں کے ساتھ ساتھ درمیان میں ناکام ہونے اور پھر دوسرے ماڈلز کے ذریعے سنبھالے جانے والے اجرائی ریکارڈ بھی شامل ہیں۔
ٹریننگ کے نقطہ نظر سے، ناکام ٹریجکٹریز ممکنہ طور پر زیادہ معلومات فراہم کرتی ہیں۔
آخری جواب ماڈل کو ایک عملی راستہ بتاتا ہے، جبکہ ناکامی اور درستگی کے عمل دو اور قسم کی معلومات فراہم کرتے ہیں: جہاں غلطیاں عام ہوتی ہیں اور غلطی کے بعد کیسے ترمیم کی جائے۔
کئی ماڈلز کے نتائج کے علاوہ، کئی ماڈلز کے کام کے ماحول میں اصل میں طے کی گئی راہیں بھی سیکھی جاتی ہیں"، جو NeoHorse کی ایک نمایاں خصوصیت ہے۔
ایجینٹ کا کام کا روزنامہ کیسے ماڈل کی صلاحیت میں تبدیل ہو جاتا ہے؟
تمام لاگس کو تربیت میں شامل کرنا خود بخود ایک طاقتور ایجنٹ ماڈل حاصل نہیں کرے گا۔
ایجینٹ کا راستہ عام طور پر لمبا ہوتا ہے، جس میں سسٹم کے حوالہ جات، صارف کی درخواستیں، ٹول کے پیرامیٹرز، انجام دیے گئے نتائج، دہرائے گئے کوششیں، غلطیوں کی معلومات اور بہت سارے درمیانی آؤٹ پٹ شامل ہوتے ہیں۔
کچھ مراحل تربیتی قیمت رکھتے ہیں، کچھ زیادہ تر شور کے قریب ہیں۔ کچھ ٹریجکٹری پروسیس مکمل ہوتے ہیں، لیکن نتائج خود غلط ہوتے ہیں۔
ایلیمنٹل رِد کو سب سے پہلے یہ مسئلہ حل کرنا ہوگا کہ ماڈل کو کون سے ڈیٹا سیکھنا چاہیے۔
ٹیکنیکل رپورٹ کے مطابق، ہر ٹریک کو سٹرکچرل چیک سے گزرنا ہوگا تاکہ درخواست، ماڈل کا جواب، ٹول کال اور ماحول کے نتائج کے درمیان مطابقت کی تصدیق کی جا سکے۔
اس کے بعد، سسٹم کارکردگی کی معیار کو ستھرہ ابعاد میں جانچے گا، جن میں صارف کے مقصد کو مکمل کیا گیا یا نہیں، ہدایات کی پابندی کی گئی یا نہیں، ٹولز کا استعمال مناسب تھا یا نہیں، نتائج کی تائید کس طرح ہوئی، غلطی کے بعد بحالی کی گئی یا نہیں، اور ماڈل نے مناسب وقت پر کام ختم کیا یا نہیں۔
یہاں ایجنٹ تربیت کے دوران اکثر ایک دوسرے کے ساتھ گل ملائی جانے والی مسائل بھی شامل ہیں۔
کام ختم ہونا صارف کے مقصد کے پورا ہونے کے برابر نہیں ہے — ماڈل کا "کام مکمل ہو گیا" کہنا صرف اس بات کو ظاہر کرتا ہے کہ اجرائی عمل رک گیا ہے، لیکن یہ ثابت نہیں کرتا کہ پیشکش صارف کی ضروریات کے مطابق ہے۔
اس لیے، مکمل حالت، مقصد کی تکمیل، ماحولیاتی ثبوت اور صارف کی فیڈ باک کو الگ الگ سگنلز کے طور پر ریکارڈ کیا جانا چاہیے۔
ڈیٹا کے فلٹر ہونے کے بعد، راؤٹنگ سگنل ایک اور کردار ادا کرنے لگتا ہے۔
راؤٹر ٹاسک کے لیے درکار صلاحیت کا اندازہ لگاتا ہے اور مختلف صلاحیت کی سطحوں کے سگنلز تشکیل دیتا ہے۔ نیوہورس تربیت کے دوران اس کے مطابق نمونوں کا ترتیب دیتا ہے، پہلے کم صلاحیت کی ضرورت والے ٹاسکس سیکھتا ہے، پھر تدریجاً زیادہ پیچیدہ ایکزیکشن ٹریجکٹریز میں اضافہ کرتا ہے، جبکہ بنیادی ٹاسکس کو بھی کور کرتا رہتا ہے۔
اس طریقہ کو راؤٹنگ گائیڈڈ کریکولم کہا جاتا ہے، یعنی راؤٹنگ گائیڈڈ کریکولم لرننگ۔
سادہ الفاظ میں، راؤٹنگ سگنل آن لائن یہ فیصلہ کرتا ہے کہ کون سا کام کس کو دیا جائے، اور تربیت کے دوران یہ ماڈل کو یہ بھی بتاتا ہے کہ کون سے کام پہلے سیکھنا بہتر ہیں اور کون سے بعد میں۔

معمولی نگرانی کے ساتھ سکھانے کے علاوہ، نیوہورس نے آن-پالیسی ڈسٹلیشن بھی استعمال کیا۔
اسے اس طرح سمجھا جا سکتا ہے کہ پہلے طلبہ اپنے طریقے سے مسائل حل کریں، اور پھر استاد طلبہ کے حقیقی قدم کے مطابق رہنمائی دیں۔
اس طرح، ٹیچر ماڈل کو اسٹوڈنٹ ماڈل کے موجودہ توزیع کے تحت پیش آنے والے مسائل کا سامنا ہوتا ہے، نہ کہ پہلے سے تیار کی گئی مخصوص غلطیوں کا۔

ان مراحل کے بعد، بہت سے ماڈلز کی طرف سے لمبے عرصے تک انجام دیے گئے کاموں کا تجربہ NeoHorse کی پوسٹ ٹریننگ کے لیے استعمال ہونا شروع ہو گیا۔
ٹریننگ کے بعد کیا بہتر ہوتا ہے؟
موجودہ ٹیکنیکل رپورٹ کے نتائج کے مطابق، ایجنٹک پوسٹ-ٹریننگ 4B اور 9B دونوں سائزز پر مستقل بہتری لائی ہے۔
اس میں، NeoHorse-1-4B کا کل مجموعی پرفارمنس (میکرو ایوریج سکور 58.94 سے بڑھ کر 64.87 ہو گیا) اسی سائز کے SOTA کے برابر ہے — تمام قابل موازنہ بینچ مارکس پر اس کے بنیادی ماڈل Qwen3.5-4B کو پیچھے چھوڑ دیا گیا ہے اور 4B سائز کے تمام مقابلہ کرنے والے ماڈلز میں کل طور پر اگے ہے۔

لیکن SOTA کا مطلب یہ نہیں کہ صلاحیتیں یکساں طور پر تقسیم ہوئی ہیں۔
مزید تقسیم کے نتائج سے ظاہر ہوتا ہے کہ 4B ماڈل میں بہتری ایک خاص قسم کے کام پر مرکوز ہے۔
اس قسم کے کام عام طور پر نسبتاً واضح عملی عمل کے ساتھ آتے ہیں، ماحول کی فیڈ بیک قابل مشاہدہ ہوتی ہے، کامیابی اور ناکامی کی تصدیق کی جا سکتی ہے، اور آخری ڈیلیوری معیار بھی واضح ہوتا ہے۔
مثلاً، ایک پراجیکٹ اسکیڈول ٹاسک میں، بنیادی ماڈل نے ورکنگ ڈائریکٹری میں فائل کو تلاش کر لیا، لیکن جدید ڈیپینڈنسی کنسترینٹس والی ای میل کو پڑھنا جاری نہیں رکھا۔
نتیجہ یہ ہوا کہ اس نے ختم ہو چکی معلومات کے مطابق منصوبہ تیار کیا اور فائل غلط جگہ پر محفوظ کر دی۔
پوسٹ-ٹرینڈ ماڈل نئے شواہد کو جاری رکھے گا، پتہ چلے گا کہ پابندیاں تبدیل ہو گئی ہیں، شیڈول کو دوبارہ کیلکولیٹ کرے گا، نتائج کی تصدیق کرے گا، اور ڈیلیوریبلز کو صحیح جگہ محفوظ کرے گا۔
دونوں کے درمیان فرق ایجنٹ ایکزیکشن چین پر ظاہر ہوتا ہے۔
ایک ماڈل کو یہ تقریباً معلوم ہے کہ کام کیسے کرنا ہے، جبکہ دوسرا ماڈل ثبوت حاصل کرنا، پابندیوں کو اپڈیٹ کرنا، انجام دینا، تصدیق کرنا اور تحویل دینا کو ایک مکمل ورک فلو میں جوڑ سکتا ہے۔
اسی سایز کے SOTA تک پہنچنا اس بات کا مطلب نہیں کہ NeoHorse-1-4B کو تمام کاموں کے لیے ذمہ دار بنایا جائے۔ پریمیٹ رِدھم زیادہ توجہ دیتا ہے کہ مختلف ماڈلز کی صلاحیتوں کے حدود کو کیسے بہتر طریقے سے تقسیم کیا جائے۔
4B کے ساتھ مستقل طور پر مکمل کی جانے والی کارروائیوں کو بڑے ماڈلز کے استعمال کو کم کرنے کے لیے استعمال کیا جا سکتا ہے؛ جو کامز طاقتور ماڈلز کے ذریعے مکمل کیے جا سکتے ہیں، انہیں مسلسل سب سے مہنگے فلگشپ ماڈل تک اپ گریڈ کرنے کی ضرورت نہیں ہوتی؛ جب مشکل مزید بڑھ جائے گی، تو اسے ماڈل پول میں زیادہ طاقتور ماڈلز کو سونپ دیا جائے گا۔
یہاں راؤٹنگ ہارنیس اور اپنے خود کے ماڈل کے درمیان مکمل جڑ ہے۔
ماڈل مسلسل اپنے ذمہ داری کے اخراجات کے دائرے کو وسیع کرتا جا رہا ہے، جبکہ راؤٹنگ سسٹم مختلف صلاحیتیں طاقت کے مطابق مناسب جگہوں پر ڈالتا ہے۔

API کال فیس کے علاوہ، اس ماڈل کی کیا قیمت ہے؟
اس بات کو کہتے ہوئے، ایلمنٹل سینک کی مختلف مصنوعات کی لائنیں ایک دوسرے سے کیسے جڑی ہوئی ہیں، وہ بھی واضح ہو گئیں۔
پہلا لیور OpenSquilla اوپن سورس ورژن ہے۔
پریمیٹ رِدیم، مفت، اوپن سورس، لوکل ڈیپلوی اور ڈیسک ٹاپ پروڈکٹس کے ذریعے ملٹی مڈل ایجینٹس کے استعمال کی دروازہ کم کرتا ہے اور ڈویلپرز کو ٹاسک انٹری پوائنٹس سے جوڑتا ہے۔
دوسرا لیور TokenRhythm API ہے۔
یہ "چین کا OpenRouter" کے قریب ہے، جو ایک یکجا انٹرفیس کے ذریعے مختلف ماڈلز کے استعمال کی سہولت فراہم کرتا ہے، ڈولپرز اور کاروباروں کی ماڈل استعمال کی ضروریات کو پورا کرتا ہے، اور ماڈل فرنڈز کو زیادہ سے زیادہ اطلاقی مناظر سے جوڑنے میں مدد کرتا ہے۔
کاروبار کو بہت سارے ماڈل انٹرفیسز کے لیے الگ الگ ایڈجسٹ کرنے کی ضرورت نہیں ہے، وہ ماڈلز کا جائزہ لے سکتے ہیں، منتخب کر سکتے ہیں اور انہیں بدل سکتے ہیں۔
تیسری سطح کاروباری خدمات اور ڈیپلویمنٹ کی صلاحیت پر مبنی ہے۔
فائننس، تیاری جیسے صنعتوں کے لیے اجازت، استحکام، نجی ڈپلویمنٹ اور سروس گارنٹی کی مختلف ضروریات ہوتی ہیں، جس سے مزید تجارتی مواقع پیدا ہوتے ہیں۔
چوتھی سطح ہی NeoHorse ہے۔
نیوہورس نے ایک اہم کنکشن کی تصدیق کی: ہارنس کے عمل کے دوران حاصل کی گئی مؤثر تجربات، فلٹر اور تربیت کے بعد، واقعی مدل کی خود کی صلاحیتوں میں تبدیل ہونے کا موقع رکھتی ہیں۔
اس طرح، ایلمنٹل موشن نے پہلی بار اپنے تجارتی فلائی ویل کا ماڈل لیول کا نتیجہ پیش کیا۔
یہ بات تجزیہ کی اقتصادی حساب کتاب کو بہتر بنانے کا امکان بھی پیدا کرتی ہے۔
اگر نیوہورس بعد میں ایک مجموعہ اعلیٰ ترین اور معیاری طور پر واضح ایجنٹ کاموں کو مستقل طور پر سنبھال سکتا ہے، تو پلیٹ فارم کے پاس ایک خود مختار طریقے سے تفویض کی جانے والی صلاحیت کا اضافہ ہو جائے گا۔
یہ کاموں کو استدلال کی لاگت، جواب کی رفتار اور استحکام کو مزید بہتر بنایا جا سکتا ہے، اور ماڈل کی فراہمی کی ترتیب کو زیادہ لچکدار بناتا ہے۔ جب تک ماڈل جاری رہے گا، اس کے دائرہ کار میں مزید وسعت کا امکان ہے۔
اس منظر سے، پریمیٹ رِد کا مقصد تھوڑا سا تیاری نظام میں ٹیکنالوجی کا تجمع ہے۔
بیرونی ماڈل ایکوسسٹم مختلف صلاحیتیں فراہم کرتا ہے، جبکہ ہارنس ان کے انجام کو منظم کرتا ہے؛ انجام کے دوران حاصل کی گئی تجربات اگلے دور کے ماڈل میں بہتری کے لیے استعمال ہوتی ہیں۔
ماسٹر میکنگ، سروس فراہم کرنے، اور سروس سے حاصل ہونے والے تجربات کو ماسٹر کی صلاحیتوں میں تبدیل کرکے کارکردگی اور معیار میں مزید بہتری لانے تک، یہ ایپی آئی ایکھریٹ پلیٹ فارم کے باہر ماسٹر رِدھم کا ایک اور قدم ہے۔
ماڈل کے باہر، پریمیٹو لیک کیا بنا رہا ہے؟
ایلیمنٹل رِد کے خیال میں چکر کو تقریباً کچھ بزنس لائنز سے جوڑا جا سکتا ہے:
- روٹنگ ہارنس ڈویلپرز کو ایجنٹ کے کاموں سے جوڑتا ہے
- → ٹوکن رِدھم API کنکشن ماڈل: فراہمی اور کال کی درخواست
- → هارنیس اورگنائزیشن کی طرف سے انجام دیا گیا، راؤٹنگ اور ٹاسک ٹریکس کو جمع کیا گیا
- موجودہ ٹریکس کو ماڈل ٹریننگ کے لیے فلٹر کیا گیا ہے
- → اپڈیٹڈ ماڈل Harness واپس کرتا ہے، ایڈاپٹیشن ٹاسک میں شرکت کریں
- ٹاسک کے تجربے کو بہتر بنائیں، بہتر ریسپانس ٹائم اور لاگت کی کارکردگی کا جائزہ لیں
- مستقل استعمال، ادائیگی اور کارکردگی میں اضافہ
- اگلے مرحلے کی خدمات کے بہتر بنانے اور ریسرچ اور ڈویلپمنٹ کے لیے سپورٹ کریں
ایک اہم تبدیلی یہ ہے کہ ماڈل کے ذریعہ پیدا کی گئی ٹریکس صرف استعمال اور کال کے مراحل تک محدود نہیں رہیں گی، بلکہ یہ اگلے ماڈل ٹریننگ کا ذریعہ بھی بن سکتی ہیں۔
ایجینٹ ایک کام مکمل کرتا ہے، تو ہارنس کو صلاحیتوں کی حدود کے بارے میں ایک اور مشاہدہ ملتا ہے۔
ایک ماڈل ناکام ہو گیا، سسٹم جانتا ہے کہ صلاحیت کا فرق کہاں ہو سکتا ہے؛ دوسرا ماڈل کامیابی کے ساتھ ہاتھ بڑھاتا ہے، اور سسٹم کو ایک نیا اصلاح کا راستہ ملتا ہے؛ صارف آخرکار نتیجہ قبول یا مسترد کرتا ہے، جس سے ایک اضافی باہری فیڈ بیک حاصل ہوتا ہے۔
جتنا زیادہ کام جمع ہوگا، اتنا ہی راؤٹنگ کا فیصلہ زیادہ درست ہوگا؛ جب راؤٹنگ کا فیصلہ زیادہ درست ہو جائے گا، تو منتخب کی جانے والی تربیتی ٹریجکٹریاں اصل کاموں کے قریب تر ہوں گی؛ جب ماڈل کاموں کے لیے زیادہ مناسب ہو جائے گا، تو API سروس کو بہتر لاگت اور تجربہ حاصل کرنے کا موقع ملے گا۔
اگر یہ دورہ طویل مدت تک قائم رہے، تو بنیادی لہروں اور عام API ایگریگیشن پلیٹ فارم کے درمیان فرق، روتنگ قواعد اور ماڈل فہرستوں سے آگے بڑھ کر تربیت کے ٹاسک ڈیزائن، تربیت کے طریقے اور ماڈل پیرامیٹرز تک پہنچ جائے گا۔
آخر میں مصنوعات کی کارکردگی کے ذریعے ظاہر ہوگا۔
RSI تک کتنی دوری ہے؟
اوپر RSI (Recursive Self-Improvement، ریکرسیو خود بہتری) کے بارے میں پریمیٹ لیب کی بات شروع ہونے کا پس منظر ہے۔
Primal Rhythm کی موجودہ RSI رینج کی تصدیق ایک مکمل انجینئرنگ سائکل کے قریب ہے، جسے دو حصوں میں تقسیم کیا جا سکتا ہے۔
پہلا Data-RSI ہے۔
ماڈل ہارنیس میں مسلسل کام کرتا رہتا ہے، اور ہر راؤٹنگ، ٹول کال، ناکامی کی بحالی اور آخری نتیجہ، نئے سٹرکچرڈ ریکارڈز کو جنم دیتا ہے۔
ان ریکارڈز کو فلٹر اور پروسیس کرنے کے بعد، انہیں بعد کی تربیت کے لیے ڈیٹا پول میں شامل کیا جا سکتا ہے۔ اس طرح، تربیتی ڈیٹا صرف انسانی طور پر پہلے تیار کردہ ڈیٹا پر مبنی نہیں ہوگا، بلکہ نظام کے استعمال کے ساتھ ساتھ بڑھتا رہے گا۔
دوسرا مدل-آر ایس آئی ہے۔
سسٹم جائزہ کے نتائج کے مطابق موجودہ ماڈل کی کمزوریوں کو شناخت کرتا ہے، اگلے تربیتی ڈیٹا کے تقسیم کو تبدیل کرتا ہے، ماڈل کو اپ ڈیٹ کرتا ہے، اور پھر نیا ماڈل واپس ہارنس میں شامل کر دیتا ہے۔
یعنی ماڈل اپنے انجام دہی کے تجربات سے سیکھتا ہے، اور اپڈیٹ شدہ ماڈل نئے کاموں کو انجام دے کر اگلے تربیتی دور کے لیے نئی فیڈ بیک پیدا کرتا ہے۔

تاہم، نیوہورس کی موجودہ علیحدہ معلومات کے مطابق، اس نظام کو مکمل RSI نہیں سمجھا جا سکتا۔
ٹیکنیکل رپورٹ ابھی تک ایک "انفیکشن—ایوال—چوائس—اپڈیٹ" سائیکل کی تصدیق کر رہی ہے۔ سگنل ڈیزائن، ریوارڈ ڈیزائن اور ٹریننگ پروسیجر اب بھی انسانوں کے ذریعہ طے کیے جا رہے ہیں، اور کئی نسلوں کے ماڈل آئٹریشن کے بعد بھی کیا فائدہ مستقل طور پر حاصل ہو سکے گا، اس کے لیے مزید تجربات کی ضرورت ہے۔
اس لیے زیادہ درست بیان یہ ہے کہ نیوہورس نے اس جاری کرنے میں دو سطحی تصدیق مکمل کر لی ہے۔
ایک لیول تجارتی ہے، جس میں سسٹم کے ذخیرہ کردہ ڈیٹا کو ماڈل ٹریننگ میں استعمال کیا جا سکتا ہے اور اسے قابل پیمائش صلاحیتوں میں تبدیل کیا جا سکتا ہے۔
ایک اور لیور ٹیکنیکل ہے، جس میں وانگ یونہے نے اپنی اسٹارٹ اپ ٹیم کے ساتھ RSI کی طرف ایک منفرد انجینئرنگ ویریفیکیشن مکمل کیا۔
زیادہ ماڈلز کیا اس کمپنی کو زیادہ قیمتی بناتے ہیں؟
بالکل، اصلی ریتم کی کہانی کو کامیاب بنانے کے لیے کچھ رکاوٹوں کو پار کرنا ہوگا۔
سب سے پہلا، اوپن سورس ایکوسسٹم کیا مسلسل API استعمال اور آمدنی میں تبدیل ہو سکتا ہے؟
دوم، جب کام کی قسمیں بڑھیں تو کیا سسٹم تربیت کے لیے کافی اعلیٰ معیار کے ایجنٹ ٹریکس حاصل کرتا رہے گا؟
تیسری بات، ماڈل کی صلاحیتوں میں بہتری کے بعد، کیا یہ مستقل طور پر بہتر ٹاسک کے تجربے اور کارکردگی میں اضافہ لائے گی، جو مزید کاروباری ڈیٹا پر ظاہر ہوگا۔
چوتھا، متعدد مراحل کے ماڈل کے تکرار کے بعد، صلاحیتوں میں اضافہ کتنے عرصے تک جاری رہے گا۔
ان سوالات کے لیے زیادہ وقت کی ضرورت ہے۔
اور ایک اور ناگزیر متغیر — DeepSeek ، کوئن مینی میکس مودل فراہم کنندگان بھی Harness اور Agent مصنوعات کی طرف بڑھ رہے ہیں، جس سے مودل اور Agent انفراسٹرکچر کا عمودی ادغام واضح ہوتا جا رہا ہے۔
مثال کے طور پر ایٹومک رِد کے ساتھ، اس کمپنی کا موجودہ ایک فرق یہ ہے کہ وہ ماڈل نیوٹرل ہے اور ماڈلز کے درمیان انجام دیے جانے والے عمل سے بننے والے افقی تقابلی ڈیٹا۔
لیکن اگر ماڈلز کے درمیان صلاحیتوں کا فرق کافی بڑا ہو، تو ماڈلز کے درمیان شیڈولنگ ایک الگ کاروبار بن سکتی ہے؛ اگر ٹاپ ماڈلز تدریجاً زیادہ کاموں کو کور کرنے لگیں، یا فرماز خود Routing، ٹول کال اور Agent فریم ورک کو ایک ساتھ پیک کر دیں، تو درمیانی لیئر کے لیے جگہ کم ہو جائے گی۔
جب اپسٹریم کی صلاحیتیں زیادہ طاقتور اور سستی ہوتی جا رہی ہوں، تو درمیانی لیئر کیوں موجود رہنی چاہیے؟
نیوہورس نے ایلمنٹل رِد کے لیے اس مسئلے کو ایک نئی نگاہ کا زاویہ فراہم کیا ہے۔
اس نے پہلے ثابت کیا کہ وہ "ماڈل استعمال کرتا ہے"، اب وہ یہ ثابت کرنے کی کوشش کر رہا ہے کہ لمبے عرصے تک ماڈل کے استعمال سے جمع ہونے والے ڈیٹا بھی اپنی ماڈل کی صلاحیت میں تبدیل ہو سکتے ہیں۔
اگر یہ راستہ کامیاب ہو گیا، تو ایلمنٹل موشن کی دفاعی دیوار صرف راؤٹنگ سٹریٹجی تک محدود نہیں ہوگی؛ اگر یہ کامیاب نہ ہو سکا، تو اسے اب بھی تمام ماڈل انٹرمیڈیٹ لیئرز کے سامنے آنے والے مسائل کا سامنا کرنا پڑے گا۔
گیٹھب:https://github.com/TokenRhythm/NeoHorse
ہگ فیس: https://huggingface.co/collections/TokenRhythm/neohorse-1
یہ مضمون ویچن گروپ "Quantum Bit" سے ہے، مصنف: ہنگ یو
