এবার ক্লড আসলেই AI প্রোগ্রামিং র্যাঙ্কিংয়ে বিশাল ফারাক তৈরি করেছে!
সাম্প্রতিক প্রতিফলিত MirrorCode র্যাঙ্কিংয়ে, Claude Fable 5 64% পরম সফলতার সাথে আবার শীর্ষে পৌঁছেছে।
এর পিছনে অনুসরণ করছে GPT-5.6 Sol, যার স্কোর শুধুমাত্র এর এক-তৃতীয়াংশ!
চতুর্থ স্থানে থাকা GPT-5.5 আরও খারাপ অবস্থায়। এর স্কোর মাত্র 10% এবং এটি নিজেরই পূর্বসূরি GPT-5.4 দ্বারা মাটিতে চাপা দেওয়া হয়েছে।

আশ্চর্যজনকভাবে, গো এর মতো উচ্চ সম্পদ ভাষা ব্যবহার করার সময় Fable 5-এর সমাধান হওয়ার হার 64%; অ্যাডা নামক একটি অপপ্রচলিত ভাষায় পরিবর্তন করলেও ফলাফল 61% এরও বেশি।
জানা গিয়েছে যে, ওপেন সোর্স বিশ্বে পাইথন কর্পাস আডা-এর প্রায় 230 গুণ।
কিন্তু ফেবল 5-এ এখানে পারফরম্যান্স মাত্র 3 পার্সেন্ট হ্রাস পেয়েছে।

এটা আকর্ষণীয়।
যদি মডেলটি মূলত জনপ্রিয় ভাষার ব্যাকরণ এবং সাধারণ লেখার স্মৃতির উপর নির্ভর করে, তাহলে আদা-তে পরিবর্তনের পর ফলাফল কমে যাওয়া উচিত।
কিন্তু বর্তমান ফলাফলটি অন্য একটি সম্ভাবনার দিকে ইঙ্গিত করে—
সবচেয়ে শক্তিশালী মডেলটি এখন বিশেষ কর্পাসের টান থেকে মুক্ত হয়েছে এবং শূন্য থেকে একটি সম্পূর্ণ সফটওয়্যার প্রকল্প তৈরি করার কৌশল শিখতে শুরু করেছে।
100% পাস লাইনে আটকে যাওয়া, 10 বিলিয়ন টোকেন এক্সট্রিম টেস্ট
বিশেষভাবে, পূর্ণাঙ্গ MirrorCode-এ 25টি লক্ষ্য প্রোগ্রাম রয়েছে, যা Unix টুল, ইন্টারপ্রেটার, ডেটা কুয়েরি, বায়োইনফরমেটিক্স, ক্রিপ্টোগ্রাফি এবং কম্প্রেশন টুলসসহ বিভিন্ন ক্ষেত্রকে কভার করে।
এখানে, মডেলটিকে একটি আইসোলেটেড পরিবেশে রাখা হয়, যেখানে ইন্টারনেট নেই, মূল প্রকল্পের সোর্স কোড দেখা যায় না, এবং তৃতীয় পক্ষের নির্ভরশীলতা ডাউনলোড করা যায় না। এটি কেবল উচ্চস্তরের ডকুমেন্টেশন, কিছু দৃশ্যমান টেস্ট, এবং একটি পুনরাবৃত্তি কলযোগ্য মূল প্রোগ্রাম পেতে পারে।
এরপর, এটি মূল প্রোগ্রামে ডেটা প্রবেশ করাতে থাকবে, আউটপুট পর্যবেক্ষণ করে অভ্যন্তরীণ লজিক অনুমান করবে, এবং পুনরায় পয়েন্ট একটি সমঝোতামূলক আচরণ সহ একটি নতুন প্রোগ্রাম লিখুন।
সর্বশেষ তালিকা থেকে 15টি মাধ্যমিক এবং বড় লক্ষ্য নির্বাচন করুন। প্রতিটি লক্ষ্যের জন্য দুটি বাস্তবায়ন ভাষা ব্যবহার করুন, প্রতিটি ভাষা তিনবার চালান।
এছাড়াও, দৃশ্যমান পরীক্ষা এবং গোপন পরীক্ষা উভয়ের সম্পন্ন হওয়ার হার 100% হতে হবে, 99.9% যথেষ্ট নয়।
একটি মার্জিন কেস বাদ দিলেও সম্পূর্ণ রান ব্যর্থ হিসাবে গণনা করা হবে।

শেষ কয়েকটি ফাঁক পূরণ করার জন্য, মিররকোড একবারের বাজেট বাড়িয়ে 10 বিলিয়ন টোকেনে নিয়ে গেছে এবং সর্বোচ্চ 7 দিন ধরে অবিচ্ছিন্নভাবে চালানোর অনুমতি দিয়েছে।
পেপারে সবচেয়ে ব্যয়বহুল টাস্কটি আরও বেশি চমকপ্রদ: মডেলটি 19 দিন ধরে নিরবচ্ছিন্নভাবে চলেছিল এবং একক খরচ পৌঁছেছিল 2600 ডলারে।
এই ১৯ দিনের মধ্যে, মডেলটি মূল প্রোগ্রামটি পুনরাবৃত্তি করবে, ফলাফল তুলনা করবে, ফাংশন পূরণ করবে, এবং পরীক্ষা আবার চালাবে। ভুল হলে কারণ খুঁজবে, আউটপুট মেলছে না হলে অনুমান পরিবর্তন করবে, স্থানীয়ভাবে সফল হলে পরবর্তী ফাঁকের দিকে এগিয়ে যাবে।
এই প্রক্রিয়াটি একবারের জেনারেশনের চেয়ে কয়েকদিন ধরে চলা ডিবাগিং-এর মতো।

গট্রির উদাহরণটি সবচেয়ে স্পষ্ট।
এই বায়োইনফরমেটিক্স টুলটি মূলত প্রায় 16,000 লাইন গো কোড এবং 40টিরও বেশি কমান্ড নিয়ে গঠিত।
ক্লড ওপাস 4.7 14 ঘন্টা এবং 251 ডলার খরচ করে 2001টি টেস্টের মধ্যে 2000টি পাশ করেছে, যা 99.95% কমপ্লিশন অর্জন করেছে।
একটি তারিখ মন্তব্য প্রক্রিয়াকরণের দুর্লভ বর্ডার উপেক্ষা করেছিল, যা MirrorCode-এর 100% পাস লাইনের সামনে থেমে গিয়েছিল, কিন্তু এটি আসলে সপ্তাহের পরিমাণে গণনা করা প্রকল্পের কাজকে কয়েকটি ঘন্টায় কমিয়েছিল—
এপোক অনুমান করে যে, যদি এআই ব্যবহার না করা হয়, তবে মানুষের ইঞ্জিনিয়ারদের একই কাজ সম্পন্ন করতে কমপক্ষে 2 থেকে 17 সপ্তাহ লাগবে।
কোনো কথার অভাবে, ফেবল 5 শুধু 3 পয়েন্ট ড্রপ করেছে
MirrorCode পেপারটি আগে StarCoder-এর পাবলিক ট্রেনিং মিক্সকে রেফারেন্স হিসেবে ব্যবহার করেছিল।
পাইথন প্রায় 8% এবং আদা মাত্র 0.034%, যা প্রায় 230 গুণ।

অবশ্যই, আমরা জানতে পারি না যে বন্ধ সোর্স মডেলটি কতটা Ada কোড দেখেছে। তবে খোলা ইকোসিস্টেমকে প্রসঙ্গ হিসেবে নিলে, Ada কতটা দুর্লভ তা পর্যাপ্তভাবে পরিষ্কার।
এই ভাষাটি মূলত বিমান ও মহাকাশ, প্রতিরক্ষা এবং অন্যান্য নিরাপত্তা-গুরুত্বপূর্ণ সিস্টেমে ব্যবহৃত হয়। সম্প্রদায়ের আকার, টিউটোরিয়ালের সংখ্যা বা ওপেন-সোর্স প্রকল্পের ক্ষেত্রে এটি Python, JavaScript বা Go-এর তুলনায় অনেক কম।
এবং Fable 5 স্পষ্টতই Go কোডকে অ্যাডা-তে অক্ষরে অক্ষরে অনুবাদ করছে না।
এটি বরং প্রথমে মূল প্রোগ্রামটি কিভাবে কাজ করে তা বুঝে নেওয়া, তারপর একই আচরণটি পুনরায় তৈরি করার জন্য একটি ভিন্ন ভাষা ব্যবহার করা।

অন্যান্য মডেলগুলির তুলনায় এটি এতটাই স্থিতিশীল নয়।
GPT-5.6 সল 24% থেকে 19% এ নেমে আসে, GPT-5.4 21% থেকে 12% এ নেমে আসে, আর GPT-5.5 তো 17% থেকে 5% এ পড়ে যায়। ভাষা পরিবর্তন করলেই এই পার্থক্য তাৎক্ষণিকভাবে বাড়ে।
পুরো প্রকল্পটি এআইকে দিয়ে দিন
এখন পর্যন্ত, কার্সর শত শত এজেন্টকে একসাথে কাজ করিয়ে শূন্য থেকে প্রায় এক সপ্তাহ ধরে ১০০০টি ফাইলে ব্রাউজার কোডের বেশি হয়েছে ১০০ লাখ লাইন।
অ্যানথ্রোপিক 16টি ক্লাউড এজেন্টকে প্রায় 2000 বার সম song সমান্তরালে চালানোর মাধ্যমে একটি 10 লাখ লাইনের C কম্পাইলার তৈরি করেছে, যা Linux 6.9 কার্নেল কম্পাইল করতে সক্ষম।
মে পর্যন্ত Codex ব্যক্তিগত ব্যবহারকারী নমুনার মধ্যে 70.2% কমপক্ষে একবার এক ঘন্টার বেশি মানব কাজের পরিমাণ প্রত্যাশিত কাজ জমা দিয়েছে; 25.6% আট ঘন্টার বেশি কাজ জমা দিয়েছে।
মানুষ যে ইউনিটগুলি এআইকে দিচ্ছে, সেগুলি এখন একটি কোড, একটি বাগ থেকে একটি বিকাল, একটি সপ্তাহ, বা এমনকি পুরো প্রকল্পে পরিণত হচ্ছে।
MirrorCode-এর 64%, এই «প্রোজেক্ট-লেভেল ডিলিগেশন»-এর একটি পরিমাপন।
এটি বলে যে, যদি লক্ষ্যটি পর্যাপ্ত স্পষ্ট হয় এবং ফলাফল স্বয়ংক্রিয়ভাবে গ্রহণযোগ্য হয়, তবে অগ্রণী মডেলগুলি ইতিমধ্যেই কিছু মাঝারি থেকে বড় সফটওয়্যার সম্পূর্ণ করতে সক্ষম।
যারা তাদের কাজ এআই-এর হাতে ছেড়ে দিচ্ছেন, তাদের জন্য পরিবর্তন এখনই কাছাকাছি—
আগে আপনাকে প্রতিটি কোড সেকশন লেখার সময় এটি দেখে থাকতে হত, এখন আপনি শুধুমাত্র কী পয়েন্টগুলিতে এটি বিচ্যুত হয়েছে কিনা তা চেক করবেন।
কোড এখন আরও সস্তা হতে থাকবে।
যারা সমস্যাগুলি পরিষ্কারভাবে ব্যাখ্যা করতে পারে এবং ফলাফলগুলি যাচাই করতে পারে, তারা ক্রমাগত বেশি মূল্যবান হয়ে উঠবে।
প্রসঙ্গ: https://epoch.ai/MirrorCode
এই লেখাটি ওয়েইচ্যাট গ্রুপ "নিউ জিয়েন" থেকে এসেছে, লেখক: ASI প্রতিজ্ঞা; সম্পাদক: মোশে
