ক্লড ফেবল 5 64% সফলতার হার নিয়ে এআই কোডিং বেঞ্চমার্কে শীর্ষে রয়েছে

icon MarsBit
শেয়ার
AI summary iconসারাংশ
Claude Fable 5, MirrorCode-এ 64% সফলতার সাথে AI কোডিং বেঞ্চমার্ক নেতৃত্ব দিচ্ছে, যা GPT-5.6 Sol এবং GPT-5.5-কে ছাড়িয়ে গেছে। এটি Go এবং Ada সহ প্রধান এবং নিচের ভাষাগুলি পরিচালনা করে, যার জন্য কেবলমাত্র 3% পারফরম্যান্স হ্রাস ঘটে। MirrorCode-এর জন্য কোড অ্যাক্সেস ছাড়াই 100% টেস্ট কভারেজ প্রয়োজন, যা Fable 5-এর লজিক পুনর্গঠনের দক্ষতা প্রমাণ করে। যখন লক্ষ্যযোগ্য অল্টকয়েনগুলির দিকে মনোযোগ বৃদ্ধি পাচ্ছে, তখন ফিয়ার অ্যান্ড গ্রিড সূচক বাজার আবেগ ট্র্যাক করার জন্য ট্রেডারদের জন্য একটি গুরুত্বপূর্ণ মেট্রিক।

এবার ক্লড আসলেই AI প্রোগ্রামিং র‍্যাঙ্কিংয়ে বিশাল ফারাক তৈরি করেছে!

সাম্প্রতিক প্রতিফলিত MirrorCode র‍্যাঙ্কিংয়ে, Claude Fable 5 64% পরম সফলতার সাথে আবার শীর্ষে পৌঁছেছে।

এর পিছনে অনুসরণ করছে GPT-5.6 Sol, যার স্কোর শুধুমাত্র এর এক-তৃতীয়াংশ!

চতুর্থ স্থানে থাকা GPT-5.5 আরও খারাপ অবস্থায়। এর স্কোর মাত্র 10% এবং এটি নিজেরই পূর্বসূরি GPT-5.4 দ্বারা মাটিতে চাপা দেওয়া হয়েছে।

এআই প্রোগ্রামিং

আশ্চর্যজনকভাবে, গো এর মতো উচ্চ সম্পদ ভাষা ব্যবহার করার সময় Fable 5-এর সমাধান হওয়ার হার 64%; অ্যাডা নামক একটি অপপ্রচলিত ভাষায় পরিবর্তন করলেও ফলাফল 61% এরও বেশি।

জানা গিয়েছে যে, ওপেন সোর্স বিশ্বে পাইথন কর্পাস আডা-এর প্রায় 230 গুণ।

কিন্তু ফেবল 5-এ এখানে পারফরম্যান্স মাত্র 3 পার্সেন্ট হ্রাস পেয়েছে।

এআই প্রোগ্রামিং

এটা আকর্ষণীয়।

যদি মডেলটি মূলত জনপ্রিয় ভাষার ব্যাকরণ এবং সাধারণ লেখার স্মৃতির উপর নির্ভর করে, তাহলে আদা-তে পরিবর্তনের পর ফলাফল কমে যাওয়া উচিত।

কিন্তু বর্তমান ফলাফলটি অন্য একটি সম্ভাবনার দিকে ইঙ্গিত করে—

সবচেয়ে শক্তিশালী মডেলটি এখন বিশেষ কর্পাসের টান থেকে মুক্ত হয়েছে এবং শূন্য থেকে একটি সম্পূর্ণ সফটওয়্যার প্রকল্প তৈরি করার কৌশল শিখতে শুরু করেছে।

100% পাস লাইনে আটকে যাওয়া, 10 বিলিয়ন টোকেন এক্সট্রিম টেস্ট

বিশেষভাবে, পূর্ণাঙ্গ MirrorCode-এ 25টি লক্ষ্য প্রোগ্রাম রয়েছে, যা Unix টুল, ইন্টারপ্রেটার, ডেটা কুয়েরি, বায়োইনফরমেটিক্স, ক্রিপ্টোগ্রাফি এবং কম্প্রেশন টুলসসহ বিভিন্ন ক্ষেত্রকে কভার করে।

এখানে, মডেলটিকে একটি আইসোলেটেড পরিবেশে রাখা হয়, যেখানে ইন্টারনেট নেই, মূল প্রকল্পের সোর্স কোড দেখা যায় না, এবং তৃতীয় পক্ষের নির্ভরশীলতা ডাউনলোড করা যায় না। এটি কেবল উচ্চস্তরের ডকুমেন্টেশন, কিছু দৃশ্যমান টেস্ট, এবং একটি পুনরাবৃত্তি কলযোগ্য মূল প্রোগ্রাম পেতে পারে।

এরপর, এটি মূল প্রোগ্রামে ডেটা প্রবেশ করাতে থাকবে, আউটপুট পর্যবেক্ষণ করে অভ্যন্তরীণ লজিক অনুমান করবে, এবং পুনরায় পয়েন্ট একটি সমঝোতামূলক আচরণ সহ একটি নতুন প্রোগ্রাম লিখুন।

সর্বশেষ তালিকা থেকে 15টি মাধ্যমিক এবং বড় লক্ষ্য নির্বাচন করুন। প্রতিটি লক্ষ্যের জন্য দুটি বাস্তবায়ন ভাষা ব্যবহার করুন, প্রতিটি ভাষা তিনবার চালান।

এছাড়াও, দৃশ্যমান পরীক্ষা এবং গোপন পরীক্ষা উভয়ের সম্পন্ন হওয়ার হার 100% হতে হবে, 99.9% যথেষ্ট নয়।

একটি মার্জিন কেস বাদ দিলেও সম্পূর্ণ রান ব্যর্থ হিসাবে গণনা করা হবে।

এআই প্রোগ্রামিং

শেষ কয়েকটি ফাঁক পূরণ করার জন্য, মিররকোড একবারের বাজেট বাড়িয়ে 10 বিলিয়ন টোকেনে নিয়ে গেছে এবং সর্বোচ্চ 7 দিন ধরে অবিচ্ছিন্নভাবে চালানোর অনুমতি দিয়েছে।

পেপারে সবচেয়ে ব্যয়বহুল টাস্কটি আরও বেশি চমকপ্রদ: মডেলটি 19 দিন ধরে নিরবচ্ছিন্নভাবে চলেছিল এবং একক খরচ পৌঁছেছিল 2600 ডলারে।

এই ১৯ দিনের মধ্যে, মডেলটি মূল প্রোগ্রামটি পুনরাবৃত্তি করবে, ফলাফল তুলনা করবে, ফাংশন পূরণ করবে, এবং পরীক্ষা আবার চালাবে। ভুল হলে কারণ খুঁজবে, আউটপুট মেলছে না হলে অনুমান পরিবর্তন করবে, স্থানীয়ভাবে সফল হলে পরবর্তী ফাঁকের দিকে এগিয়ে যাবে।

এই প্রক্রিয়াটি একবারের জেনারেশনের চেয়ে কয়েকদিন ধরে চলা ডিবাগিং-এর মতো।

এআই প্রোগ্রামিং

গট্রির উদাহরণটি সবচেয়ে স্পষ্ট।

এই বায়োইনফরমেটিক্স টুলটি মূলত প্রায় 16,000 লাইন গো কোড এবং 40টিরও বেশি কমান্ড নিয়ে গঠিত।

ক্লড ওপাস 4.7 14 ঘন্টা এবং 251 ডলার খরচ করে 2001টি টেস্টের মধ্যে 2000টি পাশ করেছে, যা 99.95% কমপ্লিশন অর্জন করেছে।

একটি তারিখ মন্তব্য প্রক্রিয়াকরণের দুর্লভ বর্ডার উপেক্ষা করেছিল, যা MirrorCode-এর 100% পাস লাইনের সামনে থেমে গিয়েছিল, কিন্তু এটি আসলে সপ্তাহের পরিমাণে গণনা করা প্রকল্পের কাজকে কয়েকটি ঘন্টায় কমিয়েছিল—

এপোক অনুমান করে যে, যদি এআই ব্যবহার না করা হয়, তবে মানুষের ইঞ্জিনিয়ারদের একই কাজ সম্পন্ন করতে কমপক্ষে 2 থেকে 17 সপ্তাহ লাগবে।

কোনো কথার অভাবে, ফেবল 5 শুধু 3 পয়েন্ট ড্রপ করেছে

MirrorCode পেপারটি আগে StarCoder-এর পাবলিক ট্রেনিং মিক্সকে রেফারেন্স হিসেবে ব্যবহার করেছিল।

পাইথন প্রায় 8% এবং আদা মাত্র 0.034%, যা প্রায় 230 গুণ।

এআই প্রোগ্রামিং

অবশ্যই, আমরা জানতে পারি না যে বন্ধ সোর্স মডেলটি কতটা Ada কোড দেখেছে। তবে খোলা ইকোসিস্টেমকে প্রসঙ্গ হিসেবে নিলে, Ada কতটা দুর্লভ তা পর্যাপ্তভাবে পরিষ্কার।

এই ভাষাটি মূলত বিমান ও মহাকাশ, প্রতিরক্ষা এবং অন্যান্য নিরাপত্তা-গুরুত্বপূর্ণ সিস্টেমে ব্যবহৃত হয়। সম্প্রদায়ের আকার, টিউটোরিয়ালের সংখ্যা বা ওপেন-সোর্স প্রকল্পের ক্ষেত্রে এটি Python, JavaScript বা Go-এর তুলনায় অনেক কম।

এবং Fable 5 স্পষ্টতই Go কোডকে অ্যাডা-তে অক্ষরে অক্ষরে অনুবাদ করছে না।

এটি বরং প্রথমে মূল প্রোগ্রামটি কিভাবে কাজ করে তা বুঝে নেওয়া, তারপর একই আচরণটি পুনরায় তৈরি করার জন্য একটি ভিন্ন ভাষা ব্যবহার করা।

এআই প্রোগ্রামিং

অন্যান্য মডেলগুলির তুলনায় এটি এতটাই স্থিতিশীল নয়।

GPT-5.6 সল 24% থেকে 19% এ নেমে আসে, GPT-5.4 21% থেকে 12% এ নেমে আসে, আর GPT-5.5 তো 17% থেকে 5% এ পড়ে যায়। ভাষা পরিবর্তন করলেই এই পার্থক্য তাৎক্ষণিকভাবে বাড়ে।

পুরো প্রকল্পটি এআইকে দিয়ে দিন

এখন পর্যন্ত, কার্সর শত শত এজেন্টকে একসাথে কাজ করিয়ে শূন্য থেকে প্রায় এক সপ্তাহ ধরে ১০০০টি ফাইলে ব্রাউজার কোডের বেশি হয়েছে ১০০ লাখ লাইন।

অ্যানথ্রোপিক 16টি ক্লাউড এজেন্টকে প্রায় 2000 বার সম song সমান্তরালে চালানোর মাধ্যমে একটি 10 লাখ লাইনের C কম্পাইলার তৈরি করেছে, যা Linux 6.9 কার্নেল কম্পাইল করতে সক্ষম।

মে পর্যন্ত Codex ব্যক্তিগত ব্যবহারকারী নমুনার মধ্যে 70.2% কমপক্ষে একবার এক ঘন্টার বেশি মানব কাজের পরিমাণ প্রত্যাশিত কাজ জমা দিয়েছে; 25.6% আট ঘন্টার বেশি কাজ জমা দিয়েছে।

মানুষ যে ইউনিটগুলি এআইকে দিচ্ছে, সেগুলি এখন একটি কোড, একটি বাগ থেকে একটি বিকাল, একটি সপ্তাহ, বা এমনকি পুরো প্রকল্পে পরিণত হচ্ছে।

MirrorCode-এর 64%, এই «প্রোজেক্ট-লেভেল ডিলিগেশন»-এর একটি পরিমাপন।

এটি বলে যে, যদি লক্ষ্যটি পর্যাপ্ত স্পষ্ট হয় এবং ফলাফল স্বয়ংক্রিয়ভাবে গ্রহণযোগ্য হয়, তবে অগ্রণী মডেলগুলি ইতিমধ্যেই কিছু মাঝারি থেকে বড় সফটওয়্যার সম্পূর্ণ করতে সক্ষম।

যারা তাদের কাজ এআই-এর হাতে ছেড়ে দিচ্ছেন, তাদের জন্য পরিবর্তন এখনই কাছাকাছি—

আগে আপনাকে প্রতিটি কোড সেকশন লেখার সময় এটি দেখে থাকতে হত, এখন আপনি শুধুমাত্র কী পয়েন্টগুলিতে এটি বিচ্যুত হয়েছে কিনা তা চেক করবেন।

কোড এখন আরও সস্তা হতে থাকবে।

যারা সমস্যাগুলি পরিষ্কারভাবে ব্যাখ্যা করতে পারে এবং ফলাফলগুলি যাচাই করতে পারে, তারা ক্রমাগত বেশি মূল্যবান হয়ে উঠবে।

প্রসঙ্গ: https://epoch.ai/MirrorCode

এই লেখাটি ওয়েইচ্যাট গ্রুপ "নিউ জিয়েন" থেকে এসেছে, লেখক: ASI প্রতিজ্ঞা; সম্পাদক: মোশে

দাবিত্যাগ: এই পৃষ্ঠার তথ্য তৃতীয় পক্ষের কাছ থেকে প্রাপ্ত হতে পারে এবং অগত্যা KuCoin এর মতামত বা মতামত প্রতিফলিত করে না। এই বিষয়বস্তু শুধুমাত্র সাধারণ তথ্যগত উদ্দেশ্যে প্রদান করা হয়, কোন ধরনের প্রতিনিধিত্ব বা ওয়ারেন্টি ছাড়াই, বা এটিকে আর্থিক বা বিনিয়োগ পরামর্শ হিসাবে বোঝানো হবে না। KuCoin কোনো ত্রুটি বা বাদ পড়ার জন্য বা এই তথ্য ব্যবহারের ফলে যে কোনো ফলাফলের জন্য দায়ী থাকবে না। ডিজিটাল সম্পদে বিনিয়োগ ঝুঁকিপূর্ণ হতে পারে। আপনার নিজের আর্থিক পরিস্থিতির উপর ভিত্তি করে একটি পণ্যের ঝুঁকি এবং আপনার ঝুঁকি সহনশীলতা সাবধানে মূল্যায়ন করুন। আরও তথ্যের জন্য, অনুগ্রহ করে আমাদের ব্যবহারের শর্তাবলী এবং ঝুঁকি প্রকাশ পড়ুন।