کلود فیبل 5 AI کوڈنگ بینچ مارک میں 64% کامیابی کے ساتھ سب سے زیادہ کامیاب ہوا

icon MarsBit
بانٹیں
AI summary iconخلاصہ
کلود فیبل 5، مِررکوڈ پر 64% کامیابی کے ساتھ AI کوڈنگ بینچ مارکس کی قیادت کر رہا ہے، جو GPT-5.6 Sol اور GPT-5.5 کو پیچھے چھوڑ رہا ہے۔ یہ مقبول اور نشہ والی زبانوں جیسے Go اور Ada دونوں کو سنبھالتا ہے، جبکہ آخری کے لیے صرف 3% کی کارکردگی میں کمی آتی ہے۔ مِررکوڈ کو کوڈ تک رسائی کے بغیر 100% ٹیسٹ کوریج درکار ہوتا ہے، جو فیبل 5 کی منطقی دوبارہ تعمیر کی صلاحیت کو ثابت کرتا ہے۔ جبکہ نظر رکھنے والے آلٹ کوائنز توجہ حاصل کر رہے ہیں، فیئر اینڈ گریڈ انڈیکس مارکٹ جذبات کا پیچھا کرنے والے ٹریڈرز کے لیے ایک اہم میٹرک رہتا ہے۔

کلوڈ نے اس بار AI پروگرامنگ رینکنگ میں حقیقی طور پر کھل کر فرق ڈال دیا!

بالکل ابھی تازہ کردہ MirrorCode رینکنگ میں، کلوڈ فیبل 5 نے 64% مطلق کامیابی کے ساتھ دوبارہ ٹاپ پوزیشن حاصل کی۔

GPT-5.6 Sol کے پیچھے، اس کا اسکور صرف اس کا ایک تہائی ہے!

چوتھے نمبر پر GPT-5.5 اور بھی بدحال ہے۔ اس کا اسکور صرف 10% ہے اور اسے اپنے ہی سابقہ GPT-5.4 نے زمین پر دبایا ہوا ہے۔

ای آئی پروگرامنگ

زیادہ حیران کن بات یہ ہے کہ Go جیسی زیادہ وسائل والی زبانوں کا استعمال کرتے ہوئے Fable 5 کی حل شدہ شرح 64% تھی؛ جبکہ کم استعمال ہونے والی زبان Ada میں بھی اس کی کارکردگی 61% تک رہی۔

یہ جان لیں کہ اوپن سورس دنیا میں، پائیتھن کارپس، ایڈا کے تقریباً 230 گنا زیادہ ہے۔

لیکن Fable 5 تک پہنچ کر، کارکردگی صرف 3 فیصد کم ہو گئی۔

ای آئی پروگرامنگ

یہ دلچسپ ہے۔

اگر ماڈل صرف مقبول زبانوں کے گرامر اور عام تحریری انداز کو یاد رکھنے پر منحصر ہوتا، تو ادا میں تبدیلی کے بعد اس کا اداء کم ہونا چاہیے۔

لیکن موجودہ نتائج دوسری ممکنہ بات کی طرف اشارہ کرتے ہیں—

سب سے طاقتور ماڈل اب مخصوص ڈیٹا کے اثر سے آزاد ہو چکا ہے اور اب اس نے صفر سے ایک مکمل سافٹ ویئر پروجیکٹ بنانے کا طریقہ سیکھنا شروع کر دیا ہے۔

100% پاس لائن پر فاسٹ ہو گیا، 10 ارب ٹوکن کا انتہائی ٹیسٹ

خاص طور پر، مکمل MirrorCode میں 25 ہدف پروگرامز شامل ہیں جو یونکس ٹولز، انتشر، ڈیٹا کوئری، بائیو انفارمیٹکس، کرپٹوگرافی اور کمپریشن ٹولز سمیت مختلف شعبوں کو کور کرتے ہیں۔

یہاں، ماڈل کو انفرادی ماحول میں ڈال دیا جائے گا، جس میں انٹرنیٹ نہیں ہوگا، اصل پروجیکٹ کا سورس کوڈ نہیں دکھائی دے گا، اور تیسری طرف کے منابع ڈاؤن لوڈ نہیں کیے جا سکیں گے۔ اسے صرف اعلیٰ سطح کے دستاویزات، کچھ قابل مشاہدہ ٹیسٹ، اور ایک دوبارہ کال کی جانے والی اصل پروگرام کے ساتھ حاصل ہو گا۔

اس کے بعد، یہ مستقل طور پر اصل پروگرام میں ڈیٹا درج کرے گا، آؤٹ پٹ کا مشاہدہ کرے گا تاکہ اندر کا منطق اندازہ لگائے، اور پھر کلک کریں ایک نیا پروگرام لکھیں جو ایک جیسا رویہ رکھے۔

سب سے حالیہ لسٹ میں سے 15 میڈیم اور لارج ٹارگٹس منتخب کریں۔ ہر ٹارگٹ کو دو عملی زبانوں کے ساتھ مکمل کیا جائے گا، جس میں ہر زبان تین بار چلائی جائے گی۔

اور، ٹیسٹ کی مکمل اور پوشیدہ ٹیسٹ دونوں کی مکملیت 100% ہونی چاہیے، 99.9% کافی نہیں۔

اگر صرف ایک کنارے کا معاملہ چھوٹ جائے، تو پورا عمل ناکام کے طور پر گنتا جائے گا۔

ای آئی پروگرامنگ

آخری کچھ خلا کو بھرنے کے لیے، MirrorCode نے ایک بار کا بجٹ 10 ارب ٹوکن تک بڑھا دیا ہے اور زیادہ سے زیادہ مسلسل 7 دن تک چلنے کی اجازت دی ہے۔

کاغذ میں سب سے زیادہ لاگت والی کارروائی مزید زیادہ ہے: ماڈل نے لگاتار 19 دن تک چلنا جس کی ایک بار کی لاگت 2600 ڈالر تھی۔

اس 19 دنوں کے دوران، ماڈل اصل پروگرام کو دہرائے گا، نتائج کا موازنہ کرے گا، فنکشنلیٹی شامل کرے گا، اور ٹیسٹ دوبارہ چلائے گا۔ اگر کوئی خطا آئے تو وہ وجہ تلاش کرے گا، اگر آؤٹ پٹ مطابقت نہیں رکھتا تو وہ فرضیہ بدلے گا، اور جب تک کہ کوئی حصہ کام نہ کر جائے تو وہ اگلے خلا کی طرف بڑھے گا۔

پوری پروسیس، ایک جنریشن کی بجائے کئی دنوں تک جاری رہنے والی ٹیسٹنگ کی طرح ہے۔

ای آئی پروگرامنگ

gotree کا مثال سب سے زیادہ واضح ہے۔

اس بائیو انفارمیٹکس ٹول میں اصل میں تقریباً 16,000 لائنز Go کوڈ اور 40 سے زیادہ کمانڈز تھے۔

کلود آپس 4.7 نے 14 گھنٹے اور 251 امریکی ڈالر کے خرچ پر 2001 ٹیسٹس میں سے 2000 مکمل کیے، جس سے 99.95% مکملیت حاصل ہوئی۔

اگرچہ ایک نایاب حد کی تاریخ کے نوٹ کو نظرانداز کر دیا گیا، جس نے MirrorCode کی 100% پاس لائن کو روک دیا، لیکن اس نے اصل میں ہفتے کے لیے منصوبہ بند کیے گئے کام کو صرف کئی دہاڑوں میں مکمل کر دیا—

ایپوک کے اندازے کے مطابق، اگر AI کا استعمال نہیں کیا جائے تو انسانی انجینئرز کو ایک ہی کام مکمل کرنے میں کم از کم 2 سے 17 ہفتے لگ سکتے ہیں۔

ایک خالی میدان میں، فیبل 5 نے صرف 3 امتیاز حاصل کیے

MirrorCode کے پیپر نے سابقہ طور پر StarCoder کے عوامی تربیتی مجموعے کو حوالہ کے طور پر استعمال کیا تھا۔

اس میں Python تقریباً 8% ہے، جبکہ Ada صرف 0.034% ہے، جو پہلے کا تقریباً 230 گنا ہے۔

ای آئی پروگرامنگ

بے شک، ہم نہیں جانتے کہ بند ماڈل نے کتنی زیادہ Ada کوڈ دیکھا ہے۔ لیکن عوامی ایکوسسٹم کو حوالہ بناتے ہوئے، Ada کتنی نایاب ہے اس کا اندازہ بہت واضح ہے۔

یہ زبان عام طور پر فضائیہ، دفاع اور دیگر محفوظ نظاموں میں استعمال ہوتی ہے۔ کمیونٹی کے سائز، ٹیوٹوریلز کی تعداد یا اوپن سورس پروجیکٹس کے لحاظ سے یہ پائیتھن، جاوااسکرپٹ یا گو کے مقابلے میں کافی کم ہے۔

اور فیبل 5 واضح طور پر Go کوڈ کو Ada میں لکھرہا ہے۔

یہ زیادہ تر اصل پروگرام کیسے کام کرتا ہے، اسے سمجھنے کے بعد، ایک دوسری زبان میں اسی رویہ کو دوبارہ بنانے جیسا ہے۔

ای آئی پروگرامنگ

اس کے برعکس، دیگر ماڈلز اتنے مستحکم نہیں ہیں۔

GPT-5.6 Sol 24% سے گھٹ کر 19% ہو گیا، GPT-5.4 21% سے گھٹ کر 12% ہو گیا، اور GPT-5.5 تو 17% سے گھٹ کر صرف 5% رہ گیا۔ زبان بدلتے ہی فرق فوراً بڑھ جاتا ہے۔

پورے پروجیکٹ کو AI کو سونپ دیں

اب تک، Cursor نے سو سے زائد ایجنٹس کو ایک ہفتے تک مل کر کام کرنے کے لیے استعمال کیا ہے، جنہوں نے صفر سے شروع کرتے ہوئے 1000 فائلوں میں تقسیم ہوئے 10 لاکھ سے زائد لائنز کا براؤزر کوڈ لکھا ہے۔

اینٹروپک نے 16 کلاڈ ایجینٹس کو متوازی طور پر تقریباً 2000 بار چلایا، جس کے نتیجے میں ایک 100,000 لائن کا C کمپائلر تیار ہوا جو لینکس 6.9 کرنل کو کمپائل کر سکتا ہے۔

OpenAI کی طرف سے مئی تک Codex کے انفرادی صارفین کے نمونے میں، 70.2% نے کم از کم ایک بار ایسا کام جمع کرایا جس میں ایک گھنٹے سے زیادہ انسانی کام کی توقع تھی؛ 25.6% نے آٹھ گھنٹوں سے زیادہ کا کام جمع کرایا۔

لوگ AI کو دے رہے ہیں، جو اب ایک کوڈ سیکشن، ایک بگ سے گزرتے ہوئے ایک دوپہر، ایک ہفتہ، یا پورا منصوبہ بن چکا ہے۔

MirrorCode کا 64%، اس "پروجیکٹ لیول ڈیلیگیشن" کا ایک مقداری جائزہ ہے۔

یہ بتاتا ہے کہ جب ہدف کافی واضح ہو اور نتائج خودکار طور پر قبول کیے جا سکیں، تو اگلی نسل کے ماڈل پہلے ہی کچھ بڑے اور درمیانے سافٹ ویئر کو خود سے مکمل کر سکتے ہیں۔

ہر ایک کے لیے جو اپنا کام AI کو سونپ رہا ہے، تبدیلی قریب ہے—

پہلے آپ کو ہر لائن کوڈ پر نظر رکھنی پڑتی تھی، اب آپ صرف اہم نکات پر چیک کریں گے کہ کیا کچھ غلط ہو رہا ہے۔

کوڈ ہمیشہ سستا ہوتا جائے گا۔

جو لوگ مسائل کو واضح کر سکیں اور نتائج کی تصدیق کر سکیں، وہ لگاتار قیمتی تر ہوتے جائیں گے۔

حوالہ جات: https://epoch.ai/MirrorCode

یہ مضمون ویچن گروپ "نیوزی یوآن" سے ہے، مصنف: ASI وحی؛ ایڈیٹر: موسیٰ

اعلان دستبرداری: اس صفحہ پر معلومات تیسرے فریق سے حاصل کی گئی ہوں گی اور یہ ضروری نہیں کہ KuCoin کے خیالات یا خیالات کی عکاسی کرے۔ یہ مواد کسی بھی قسم کی نمائندگی یا وارنٹی کے بغیر صرف عام معلوماتی مقاصد کے لیے فراہم کیا گیا ہے، اور نہ ہی اسے مالی یا سرمایہ کاری کے مشورے کے طور پر سمجھا جائے گا۔ KuCoin کسی غلطی یا کوتاہی کے لیے، یا اس معلومات کے استعمال کے نتیجے میں کسی بھی نتائج کے لیے ذمہ دار نہیں ہوگا۔ ڈیجیٹل اثاثوں میں سرمایہ کاری خطرناک ہو سکتی ہے۔ براہ کرم اپنے مالی حالات کی بنیاد پر کسی پروڈکٹ کے خطرات اور اپنے خطرے کی برداشت کا بغور جائزہ لیں۔ مزید معلومات کے لیے، براہ کرم ہماری استعمال کی شرائط اور خطرے کا انکشاف دیکھیں۔