জুলাইয়ে শাংহাইয়ে তাপের ঢেউ ছড়িয়ে পড়েছে।
৬৭তম আন্তর্জাতিক গণিত অলিম্পিয়াড আনুষ্ঠানিকভাবে শেষ হয়েছে, চীনের দল ২৩২ পয়েন্ট পেয়ে স্বর্ণপদক জিতেছে। তিনজন যুবক ৪২ পয়েন্টের পূর্ণ স্কোর অর্জন করেছেন।

এখনও উৎসাহের তালি বন্ধ হয়নি, গিটহাবে আরেকটি উল্লেখযোগ্য কর্মসূচি চুপচাপ দেখা দিয়েছে।
পূর্ব গুগল ইঞ্জিনিয়ার ডিডি দাস একটি এআই তুলনামূলক পরীক্ষা প্রকাশ করেছেন: 7টি অগ্রণী বড় মডেল, সম্পূর্ণ স্বাধীনভাবে IMO 2026-এর সমস্ত 6টি প্রশ্ন সমাধান করেছে।
ক্লড ফেবল 5 পূর্ণ অংকে 42 পায়। মাত্র 2.5 ঘন্টায়, 51 ডলার খরচ হয়।
GPT-5.6 Sol-এর xhigh ভার্সনও পূর্ণ মার্কস পেয়েছে। 3.8 ঘন্টা সময় নিয়ে খরচ কেবলমাত্র 20 ডলারে নেমে এসেছে।
কিমি K3 পরেই পূর্ণ মার্কস অর্জন করে। 17.4 ঘন্টা সংগ্রামের পর 31 ডলার খরচ হয়েছে।
AxiomProver এর স্বতন্ত্র সাবমিশনসহ, মোট চারটি পক্ষই পূর্ণ নম্বর অর্জন করেছে।

প্রসঙ্গ হিসেবে, গত সাত বছরে IMO-তে 4,347 জন মানুষ প্রতিযোগিতায় অংশ নিয়েছেন, যার মধ্যে মাত্র 30 জন পূর্ণ নম্বর পেয়েছেন—অনুপাত 0.69%।

প্রচুর ব্যবধানে প্রতিদ্বন্দ্বীকে পরাজিত করা
ফলাফল অনুযায়ী, পূর্ণ মান 42 এবং চতুর্থ স্থানের 28 এর মধ্যে কেবলমাত্র 14 পয়েন্টের ব্যবধান নয়, বরং তিনটি পূর্ণ মানের মডেলও শীর্ষে উঠার পদ্ধতি সম্পূর্ণ ভিন্ন।
ক্লড ফেবল 5 খুব পরিষ্কারভাবে কাজ করেছে। 9টি সংলাপ, 6টি কার্যকর আউটপুট, একক ট্রিপের সর্বোচ্চ সময় 73 মিনিট (P3), মোট 70 লাখ টোকেন আউটপুট।
GPT-5.6 Sol কিছুটা কঠিন ছিল। P2-এ 106 মিনিট ধরে 4 রাউন্ড চালানো হয়েছিল, যার মধ্যে দুইবার নেটওয়ার্ক সমস্যার কারণে বিঘ্নিত হয়েছিল। কিন্তু ক্যালকুলেশন নিয়ন্ত্রণ ভয়ঙ্কর—মোট আউটপুট মাত্র 23 হাজার টোকেন, তিনটি পূর্ণমানের মধ্যে সবচেয়ে কম ব্যবহারকারী।
কিমি K3 একটি অথক দৈত্যের মতো। 2.8 ট্রিলিয়ন প্যারামিটারের MoE মডেলটি একসাথে 154 লাখ টোকেন বের করেছে, যা Sol-এর 6.5 গুণ। শুধু P3-এর একটি প্রশ্নের জন্যই 6 বার আক্রমণ শুরু হয়েছিল, 491 মিনিট পর্যন্ত যুদ্ধ চলেছিল।






গণিতীয় বুদ্ধির সরাসরি সংঘর্ষ
P1 হল সবচেয়ে সহজ অ্যাপেটাইজার, সমস্ত মডেল কয়েক মিনিটে সম্পন্ন করে, মানুষের প্রতিযোগীরাও প্� practically কোনোটিই ভুল করেনি।
বোর্ডে 2026টি 1 এর চেয়ে বড় ধনাত্মক পূর্ণসংখ্যা লেখা আছে। প্রতিটি পদক্ষেপে, দুটি সংখ্যা m এবং n বাছাই করুন, তাদের মুছে ফেলুন এবং gcd(m,n) এবং lcm(m,n)/gcd(m,n) লিখুন। প্রক্রিয়াটি আর চালানো যায় না এমন পর্যন্ত পুনরাবৃত্তি করুন। প্রমাণ করুন: (a) প্রক্রিয়াটি অবশ্যই শেষ হবে, এবং শেষে ঠিক একটি 1 এর চেয়ে বড় সংখ্যা M থাকবে; (b) M-এর মান পদক্ষেপের ক্রমের উপর নির্ভর করে না।

এই প্রশ্নটি বুঝতে সহজ করার জন্য, আমরা একটি সূক্ষ্ম পরীক্ষা করি।
বোর্ডে শুধুমাত্র 12 এবং 18 আছে। 12 = 2² × 3, 18 = 2 × 3²। প্রথম ধাপ: gcd(12,18) = 6, lcm(12,18)/6 = 6, বোর্ড হয়ে যায় [6, 6]। দ্বিতীয় ধাপ: gcd(6,6) = 6, lcm(6,6)/6 = 1, বোর্ড হয়ে যায় [6, 1]। এখন শুধুমাত্র একটি সংখ্যা 1-এর চেয়ে বড়, খেলা শেষ। M = 6।
আপনি যেকোনো ক্রমে অপারেশন করুন না কেন, M সর্বদা 6। কেন?
উত্তরটি প্রাইম ফ্যাক্টরগুলিতে লুকিয়ে আছে।
প্রতিটি মৌলিক সংখ্যা p-এর জন্য, সমস্ত সংখ্যাকে p দিয়ে কতবার ভাগ করা যায় তার গসাগু নিন, এবং এই মৌলিক পাওয়ারগুলি গুণ করুন—এই মানটি প্রথম পদক্ষেপ থেকে শেষ পদক্ষেপ পর্যন্ত অপরিবর্তিত থাকে।
ক্লড ফেবল ৫: প্রতিটি পদক্ষেপে অবশ্যই হ্রাস পাওয়া একটি গণনাকারী তৈরি করেছে।
এই সমস্যার জন্য, Fable 5 একটি রাশি Φ = T + N সংজ্ঞায়িত করে। T হল বোর্ডে থাকা সমস্ত সংখ্যার প্রধান গুণনীয়কের সংখ্যার যোগফল (পুনরাবৃত্তি সহ), N হল 1 এর চেয়ে বড় সংখ্যার সংখ্যা। উদাহরণস্বরূপ, বোর্ড [12, 18] এর জন্য, 12-এর প্রধান গুণনীয়কগুলি 2, 2, 3—মোট 3টি, 18-এর প্রধান গুণনীয়কগুলি 2, 3, 3—মোট 3টি, T = 6, N = 2, Φ = 8।
এরপর এটি প্রমাণ করে যে, প্রতিটি পদক্ষেপে Φ-এর মান কমপক্ষে 1 কমে। দুটি ক্ষেত্রে বিশ্লেষণ করা যাক—যদি gcd(m,n) > 1 হয়, তবে মৌলিক উৎপাদকের মোট সংখ্যা T কমে যায়; যদি gcd(m,n) = 1 হয়, তবে T অপরিবর্তিত থাকে, কিন্তু 1-এর চেয়ে বড় সংখ্যার সংখ্যা একটি কমে যায়, ফলে N-এর মান 1 কমে। Φ একটি ধনাত্মক পূর্ণসংখ্যা, এবং প্রতিটি পদক্ষেপে এটি কমপক্ষে 1 কমে, তাই প্রক্রিয়াটি সীমিত সংখ্যক পদক্ষেপের মধ্যেই শেষ হবে। একটি একক গণনা, একটি ছুরির মতো।

GPT-5.6 সল: পণ্য ট্র্যাক করুন, অক্ষর ক্রম অনুযায়ী মাত্রা হ্রাস করুন।
সল দুটি পরিমাণ দেখে: P = সমস্ত সংখ্যার গুণফল, K = 1 এর চেয়ে বড় সংখ্যার সংখ্যা। প্রতিটি পদক্ষেপে, যদি gcd(m,n) = d > 1 হয়, তবে নতুন দুটি সংখ্যার গুণফল হবে mn/d, যা আগেরটির চেয়ে ছোট, তাই সার্বিক গুণফল P কঠোরভাবে কমে। যদি d = 1 হয়, তবে P অপরিবর্তিত থাকে, কিন্তু K 1 কমে।
(P, K) জোড়াটি অক্ষর ক্রম অনুযায়ী কঠোরভাবে হ্রাস পায়: যা হোক না কেন, P ছোট হয়, অথবা P অপরিবর্তিত থাকে কিন্তু K ছোট হয়। ধনাত্মক পূর্ণসংখ্যার অক্ষর ক্রম অসীমভাবে হ্রাস পাওয়া সম্ভব নয়। বন্ধ।

একই সমস্যার (a) অংশকে দুটি সম্পূর্ণ ভিন্ন পথ দিয়ে সমাধান করা হয়েছে।
(b) অংশে, তিনটি মডেলই একই পথে আসে: প্রতিটি মৌলিক সংখ্যা p-এর জন্য, ব্ল্যাকবোর্ডের সমস্ত সংখ্যাকে p দিয়ে ভাগ করার সর্বোচ্চ সংখ্যার গ.সা.গু. অপারেশনের মধ্যে অপরিবর্তিত থাকে। চূড়ান্ত সূত্রটিও একই—

উদাহরণটি পরীক্ষা করুন: 12 এবং 18। p=2-এর জন্য, v₂(12) = 2, v₂(18) = 1, gcd = 1, অবদান 2¹। p=3-এর জন্য, v₃(12) = 1, v₃(18) = 2, gcd = 1, অবদান 3¹। M = 2 × 3 = 6, যা হাতে গণনা করার ফলাফলের সাথে পুরোপুরি মিলে যায়।
সর্বাধিক সস্তা ব্ল্যাঙ্ক কুপন
P6 এই সংখ্যাতত্ত্ব সমস্যাটি দিন 2-এর শেষ প্রশ্ন, যা পুনরাবৃত্তি অনুক্রমের চূড়ান্তভাবে পৌনঃপুনিক হওয়ার প্রমাণ চায়।
গত বছর IMO 2025-এ শুধুমাত্র 6 জন মানুষ P6 সমাধান করেছিলেন।
ক্লড ফেবল 5: 26 মিনিট, দুটি রাউন্ড, পূর্ণ মার্ক। GPT-5.6 সল: 60 মিনিট, দুটি রাউন্ড, পূর্ণ মার্ক। কিমি K3: 381 মিনিট, চার রাউন্ড, পূর্ণ স্কোর।
Grok 4.5 P6-এ মাত্র 7053টি টোকেন উত্পাদন করে, সবচেয়ে পিছনে। সাবমিট করা ফাইলে স্পষ্টভাবে লেখা আছে: Full proof: (Not yet complete.)
$0.18, সমস্ত পণ্যের মধ্যে সবচেয়ে সস্তা হোয়াইট পেপার।
গ্রকের সমস্যা এটাই নয়। পুরো পরীক্ষার সময় এটি একটি অদ্ভুত হলুদে পড়ে যায়: দাবি করে যে "প্রমাণ ফাইলে লেখা হয়েছে", কিন্তু ব্যাকএন্ডে এটি লেখার টুলটিও স্পর্শ করেনি।
এটি গণিতের ক্ষমতার সমস্যা নয়, বরং এজেন্টের ক্ষমতার সমস্যা। মডেলটি জানে যে এটি ফাইল লিখতে হবে, এবং এটি দাবি করে যে এটি লিখেছে, কিন্তু টুল কলের স্তরে এটি কোনও কাজ করেনি।
তিন বছরে তিনটি ধাপে উন্নতি
সিলিকন-ভিত্তিক মস্তিষ্কের ভয়াবহ বিবর্তন
২০২৪ সালে, ডিপমাইন্ডের অ্যালফাপ্রুফ প্রথমবারের মতো IMO লেভেলে রৌপ্যপদকের সীমানা ছোঁয়ার কথা হয়।
২০২৫ সালে, ওপেনএআই এবং ডিপমাইন্ড একসাথে প্রবেশ করে। ওপেনএআই মডেলটি অপ্রকাশিত অবস্থায় ৫টি প্রশ্ন সমাধান করে ৩৫ পয়েন্টের স্বর্ণপদক জিতেছে, এবং জেমিনি ডিপ থিংক একই স্তরে পৌঁছেছে।
২০২৬ সালে, তিনটি সাধারণ বড় মডেল সরাসরি পূর্ণ মার্ক পেয়েছে। এবার, কোনও বিশেষ গণিত প্রশিক্ষণ ছাড়াই, সবাই এটি ব্যবহার করতে পারবে। এর মধ্যে একটি এমনকি ওপেন-সোর্সও।

মেশিন চ্যালেঞ্জ লিখেছেন
পরীক্ষার শুরু হয়েছিল একটি কোম্পানি এক্সিয়ম ম্যাথ দিয়ে।
তারা IMO 2026-এর সমস্ত ছয়টি প্রশ্নকে মেশিন বুঝতে পারে এমন লিন 4 ফর্মালাইজড প্রশ্নে শব্দে শব্দে অনুবাদ করেছে।
এই মেশিন-পঠনযোগ্য প্রশ্নগুলির সাহায্যে এআই সরাসরি লিয়ান প্রমাণ আউটপুট দিতে পারবে, যা কম্পাইলার দ্বারা স্বয়ংক্রিয়ভাবে মূল্যায়ন করা হবে, মানব পরীক্ষকদের পরীক্ষা করার প্রয়োজন থাকবে না।
প্রশ্নপত্র পাওয়ার পর, ডিডি দাস একটি সম্পূর্ণ স্বয়ংক্রিয় পরীক্ষা ফ্রেমওয়ার্ক তৈরি করেন। বিভিন্ন মডেলগুলি ট্র্যাকে নিজ নিজ গতিতে দৌড়ায় এবং সমস্ত ৬টি চ্যালেঞ্জ শেষ করে। AxiomProver স্বাধীনভাবে পূর্ণমান অর্জন করে।
উল্লেখযোগ্য যে, অ্যাক্সিয়ম ম্যাথের প্রতিষ্ঠাতা হং লেটং মাত্র 25 বছর বয়সী। তিনি গুয়াংজৌয়ে জন্মগ্রহণ করেন এবং মাত্র তিন বছরে এমআইটি-তে গণিত ও পদার্থবিদ্যায় ডিগ্রি অর্জন করেন, এছাড়াও মরগান পুরস্কারের বিজয়ী।
গত বছরের শেষের দিকে, তিনি তৈরি করা AxiomProver পুটনাম গণিত প্রতিযোগিতায় পূর্ণ নম্বর অর্জন করে। এটি প্রতিযোগিতার ৯৮ বছরের ইতিহাসের ষষ্ঠ পূর্ণ নম্বরের অসাধারণ অর্জন।
এই কোম্পানিটি এই বছর মার্চে 2 বিলিয়ন ডলারের এ-রাউন্ড ফান্ডিং সম্পন্ন করে। মূল্যায়ন সরাসরি 16 বিলিয়ন ডলারে পৌঁছায়।

সাধারণ মানুষের জীবন কীভাবে পুনর্গঠিত হবে
4229 লাইনের কঠোর প্রমাণযুক্ত মডেল লিখতে পারা শুধু গণিতের সমস্যা সমাধানের ক্ষমতা নয়।
এটি আসলে দীর্ঘ যুক্তিগত অনুমানকে নিয়ন্ত্রণ করে, প্রতিটি ধাপ বাদ দেওয়া যাবে না, ভুল করা যাবে না, অস্পষ্ট হওয়া যাবে না।
চুক্তির শর্তগুলিতে কোনো ফাঁক আছে কিনা, বীমা দাবির শর্তগুলি পূরণ হয়েছে কিনা, কিংবা কর পরিকল্পনা সঠিক কিনা—প্রতিটি প্রশ্নের পেছনে একই ধরনের সমস্যা লুকিয়ে আছে: উত্তরটি “প্রায় সঠিক” হতে পারে না।
এই ধরনের একটি একটি করে যাচাই আগে শুধুমাত্র পেশাদারদের কাছে সম্ভব ছিল, যারা ঘন্টার হিসাবে চার্জ করত।
এখন, এই ক্ষমতাটি ভোক্তা পণ্যে ব্যাপকভাবে ব্যবহার হচ্ছে, সমস্যা হলে শুধু মোবাইল খুলুন।
প্রসঙ্গ:
https://x.com/deedydas/status/2079409461874332066
এই লেখাটি ওয়েইচ্যাট গ্রুপ "নিউ জ্ঞান মেট্রিক্স" থেকে এসেছে, লেখক: ASI রিভিলেশন, সম্পাদক: মোশে
