ঠিক এখনই, ফ্রন্টিয়ারম্যাথ টিয়ার 4-এর শেষ সমস্যাটি GPT-6 Astra দ্বারা সমাধান করা হয়েছে।
এখন পর্যন্ত, যে গবেষণামূলক পরীক্ষাটি একসময় বড় মডেলের গণিতের স্বপ্নভঙ্গ হিসাবে বিবেচিত হত, তার সমস্ত প্রশ্ন কমপক্ষে একবার এআই দ্বারা সফলভাবে সমাধান করা হয়েছে।
এপোক এআই এও এটিকে অফিসিয়ালভাবে সিদ্ধান্তে পৌঁছেছে, ফ্রন্টিয়ারম্যাথ টিয়ার ৪, সম্পূর্ণ পূর্ণ।

উপরের চিত্র থেকে দেখা যাচ্ছে যে, এস্ট্রা এখনও সরাসরি 100% পৌঁছায়নি, ওপেনএআই নিজেরা প্রকাশ করা ফলাফলও 97.6%।
কিন্তু ইপোকের অ্যালগরিদম অনুযায়ী, "সম্পূর্ণ সমাধান" বলতে বিভিন্ন মডেল এবং বিভিন্ন সময়ের প্রচেষ্টাগুলি একত্রিত করার পরে, টিয়ার 4-এর প্রতিটি প্রশ্নের জন্য কমপক্ষে একবার সফল সমাধান করা হয়েছে বোঝায়।
এবং আস্ট্রা যেটি নির্মূল করেছে, তা হল আগে একমাত্র যেটি এআই দ্বারা আক্রমণের বাইরে ছিল।
সহজ কথায়, এস্ট্রা কোনো একটি টেস্টে ভুল করেছিল, কিন্তু যে প্রশ্নটি সঠিকভাবে উত্তর দিয়েছিল, সেটি আগে কেউ সমাধান করেনি।

সত্যি বলতে কি, এই বিকাশের গতি খুবই অসাধারণ।
যদি আপনি মডেল মূল্যায়নের দিকে নজর রাখেন, তাহলে জানেন যে 2025 সালের 11 জুলাই, টিয়ার 4 চালু হওয়ার সময়, শীর্ষ স্কোর মাত্র প্রায় 5% ছিল।
এখন এক বছর দুই মাস পার হয়ে গেছে, এই পূর্বের “উচ্চ দেয়াল” এখন “পাঁচলা” হয়ে গেছে, এবং AI-এর জন্য সবচেয়ে শেষ কঠিন সমস্যাটিও অতিক্রম করা হয়েছে।
মার্কেট বিশ্ববিদ্যালয়ের গণিতের সহকারী অধ্যাপক জে প্যান্টোন যিনি প্রশ্ন তৈরি করেছেন, তিনি বলেছেন যে আগের সময়গুলিতে AI সবসময় সংখ্যাগত সংক্ষিপ্ত পথ খুঁজে বের করত, কিন্তু এবার AI-এর সমাধানটি তার সমাধানের সাথে খুবই কাছাকাছি।

তবে, সাম্প্রতিককালে যখন GPT-6 Astra গণিত জগতের দিকে প্রচণ্ড আক্রমণ শুরু করেছে এবং প্রায় প্রতিদিন মিলেনিয়াম সমস্যাগুলি সমাধান করছে, তখন Pantone বলেছেন যে তিনি এখন আর অবাক হওয়ার মতো নন!
গণিত হয়ে উঠেছে আস্ট্রার সর্বশেষ সবচেয়ে বেশি প্রচারিত একটি ক্ষেত্র।
2% এর কম থেকে বিশেষভাবে একটি "গবেষণা-স্তরের প্রতিরোধ" যোগ করা
ফ্রন্টিয়ারম্যাথ ২০২৪ সালের ৭ নভেম্বর প্রথম প্রকাশ করা হয়েছিল, এবং এর জন্মের উদ্দেশ্য ছিল গণিতের বেঞ্চমার্ককে এআই দ্বারা দ্রুত পার হওয়া থেকে বাঁচানো।
যখন GSM8K, MATH এর মতো প্রাচীন গাণিতিক বেঞ্চমার্কগুলি শীর্ষ মডেলগুলির মধ্যে পার্থক্য খুঁজে পাওয়ার জন্য ক্রমাগতভাবে কঠিন হয়ে উঠছিল, তখন Epoch AI 60-এরও বেশি গণিতবিদের সাথে মিলে আগে কখনও প্রকাশিত হয়নি এমন অনন্য প্রশ্নের একটি সেট পুনর্নির্মাণ করেছে।
এর মধ্যে রয়েছে টাও জেহুয়ান, টাইমোথি গাউয়ার্স, রিচার্ড বর্চার্ডস সহ ফিল্ডস পুরস্কার বিজয়ীরা।
টেরেン্স টাও কিছু গবেষণামূলক প্রশ্ন দেখার পর সরাসরি বলেছিলেন যে এই প্রশ্নগুলি "অত্যন্ত কঠিন", এবং সবচেয়ে কঠিন টিয়ার 3 প্রশ্নগুলি হয়তো AI-কে আরও কয়েক বছর ধরে আটকে রাখতে পারে।

প্রথম রাউন্ড পরীক্ষার ফলাফল দেখে বোঝা গেল, অগ্রণী মডেলের সঠিকতা মাত্র 2% এর কম।
প্রাথমিকভাবে, ফ্রন্টিয়ারম্যাথের মূল প্রশ্নব্যাংকে ৩০০টি প্রশ্ন ছিল, যা কঠিনতার ভিত্তিতে টিয়ার ১, টিয়ার ২ এবং টিয়ার ৩ তিনটি স্তরে বিভক্ত।

টিয়ার 1 প্রায় উচ্চ কঠিন স্নাতক প্রশ্ন এবং গণিত অলিম্পিয়াডের সমান, তবে উন্নত টুলস ব্যবহারের অনুমতি রয়েছে; টিয়ার 2 উচ্চ বর্ষের গবেষক পর্যায়ের কঠিনতায় পৌঁছেছে; টিয়ার 3 তখন ডক্টরেট ছাত্রদের প্রাথমিক পর্যায়ে সামনে আসা অনুসন্ধানমূলক গবেষণা সমস্যার কাছাকাছি।
কিন্তু রিজনিং মডেলগুলির উত্থানের সাথে সাথে এই তিনটি স্তরও ধীরে ধীরে অপর্যাপ্ত হয়ে পড়ছিল, তাই 2025 সালে, ইপোক একটি নতুন স্তর, টিয়ার 4 যোগ করেছে।
টিয়ার 4 এর বেশিরভাগই গণিতের অধ্যাপক এবং পোস্টডক দ্বারা ডিজাইন করা হয়, যারা প্রত্যেকে নিজের গবেষণার দিকে কেন্দ্রীভূত হয়ে প্রায় কয়েকসপ্তাহের সংক্ষিপ্ত গবেষণা করেন এবং শেষে তাদের ফলাফলকে একটি স্বয়ংক্রিয়ভাবে যাচাইযোগ্য প্রশ্নে সংকুচিত করেন।

প্রাথমিকভাবে, টিয়ার 4-এ মোট ৫০টি প্রশ্ন অন্তর্ভুক্ত ছিল। এগুলি বিশ্লেষণ, সংখ্যাতত্ত্ব, সংযোজনী গণিত, টপোলজি, বীজগাণিতিক জ্যামিতি ইত্যাদি ক্ষেত্রকে কভার করে।
প্রকাশের সময়, সমস্ত মডেলের সমস্ত পরীক্ষার মধ্যে মাত্র তিনটি প্রশ্নই সমাধান করা হয়েছিল, এবং এই সমাধানগুলি কিছু সঠিক, কিন্তু যথেষ্টভাবে প্রমাণিত নয় এমন ধারণার উপর নির্ভর করেছিল।
এই কারণে, অফিসিয়াল ওয়েবসাইটের পাবলিক প্রশ্ন পৃষ্ঠায়, ইপোক একসময় লিখেছিল: এই প্রশ্নগুলির কিছু হয়তো কয়েক দশক ধরে এআই দ্বারা সমাধান করা হবে না।

(এই বাক্যটি এখন থেকে বারবার নির্যাতিত হচ্ছে)
কিন্তু মডেলগুলি যত শক্তিশালী হচ্ছে, অন্য একটি সমস্যা প্রকাশ পাচ্ছে: প্রশ্নব্যাংকটিও এখন এআই-এর “পরীক্ষা” সহ্য করতে পারছে না।
OpenAI পরীক্ষার সময় দেখেছে যে FrontierMath-এ প্রত্যাশিতের চেয়ে বেশি ত্রুটি রয়েছে।
পরবর্তীতে, ইপোক একটি স্বাধীন অডিট শুরু করে, যেখানে প্রথমে GPT-5.5 এবং Claude Opus 4.7 ব্যবহার করে সন্দেহজনক বিষয়গুলি ছাঁটাই করা হয়, তারপর গণিতবিদদের দ্বারা প্রতিটি প্রশ্নের পুনরালোচনা করা হয়। শেষ পর্যন্ত 2026 সালের জুনে v2 সংস্করণ চালু করা হয়, যেখানে টায়ার 4-এ 12টি প্রশ্ন সংশোধন করা হয়, 7টি প্রশ্ন সরিয়ে ফেলা হয়, এবং 43টি প্রশ্ন রাখা হয়।
সংশোধনের পরেও মডেলের স্কোর অবিরাম বাড়ছে।
GPT-5.6 Sol এ 83.0% পেয়েছে, Claude Fable 5 পেয়েছে 90.2%, এবং GPT-6 Astra-এ এই স্কোর বেড়ে দাঁড়িয়েছে 97.6%।

এছাড়াও, অ্যাস্ট্রা আগে কখনও এআই দ্বারা সমাধান করা হয়নি এমন একমাত্র প্রশ্নটি সমাধান করেছে।

এখন পর্যন্ত, টিয়ার 4-এর প্রতিটি প্রশ্ন কমপক্ষে একবার AI দ্বারা সফলভাবে ভাঙা হয়েছে। এই অত্যন্ত শক্তিশালী মডেলগুলির জন্য বিশেষভাবে তৈরি করা গবেষণামূলক প্রতিরোধ ব্যবস্থা চূড়ান্তভাবে ভেঙে ফেলা হয়েছে।
তবে, এর অর্থ এই নয় যে “গণিতকে এআই সমাধান করে ফেলেছে”। বরং, FrontierMath নিজেই পরবর্তী পর্যায়ে এগিয়ে যাচ্ছে।
এখন প্রোজেক্টটি শুধু Tiers 1-4 এর বাইরে আসল Open Problems যোগ করেছে এবং FrontierMath Erdős-এ Erdős ওপেন প্রবলেমগুলিকে Lean-এ ফর্মালাইজ করেছে।

প্রথমটি সরাসরি গণিতের ক্ষেত্রে এখনও সমাধান হয়নি এমন গবেষণা সমস্যা দিয়ে মডেলকে পরীক্ষা করে; দ্বিতীয়টি এআইকে ফর্মাল ভারিফিকেশন পাস করতে পারে এমন পূর্ণাঙ্গ প্রমাণ লিখতে বাধ্য করে।
এবারে, অ্যাস্ট্রা ফ্রন্টিয়ারম্যাথ এর্ডোসের 68টি প্রশ্নের মধ্যে মাত্র 2টি সমাধান করেছে।
গল্পটি এখনও চলছে~
এই লেখাটি ওয়েইচ্যান পাবলিক অ্যাকাউন্ট "Quantum Bit" থেকে এসেছে, লেখক: henry
