নামটি না দেখলে, আপনি নিশ্চয়ই মনে করবেন এটি আবারও একটি শক্তিশালী মডেলের প্রকাশযোগ্য নয় এমন একটি অসাধারণ কর্মক্ষমতার রিপোর্ট:
গবেষণা করুন: একসাথে 7টি শীর্ষস্থানীয় গণিত এবং কম্পিউটার সমস্যা সমাধান করুন, যার 40 পৃষ্ঠার দীর্ঘ প্রমাণ সবচেয়ে কঠোর মেশিন পরীক্ষারও ত্রুটি খুঁজে পাওয়া যায়নি;
ইঞ্জিনিয়ারিং: শূন্য থেকে একটি অত্যন্ত বাস্তবসম্মত CPU সিমুলেটর হাতে লিখেছি, যা সফলভাবে সিস্টেম শুরু করেছে এবং 0.71% ত্রুটি সহ চলছে;
কোড লিখুন: ইগেন এবং প্যারালিহ্যাশ দুটি জনপ্রিয় ওপেন-সোর্স লাইব্রেরির কোর কোডটি সহজেই অপ্টিমাইজ করেছি, যার পরিবর্তনগুলি সরাসরি আপস্ট্রিম মেইন্টেইনারদের দ্বারা একীভূত হয়েছে।
এটি গুগলের অ্যান্টিগ্রাভিটি দল দ্বারা 27 আগস্ট প্রকাশিত একটি পারফরম্যান্স রিপোর্ট।

টিমওয়ার্ক টেকনিক্যাল আর্টিকেলে, গুগলের অ্যান্টিগ্রাভিটি টিম গণিত, সিস্টেম এবং ওপেন সোর্স—এই তিনটি ক্যাটাগরিতে ফলাফল প্রকাশ করেছে।
অপ্রত্যাশিতভাবে, এবার বড় ক্ষমতা বিশিষ্ট মডেলগুলি নয়, বরং "দ্রুত এবং সস্তা" বিষয়ে ফোকাস করা ছোট মডেলটি: Gemini 3.7 Flash কেন্দ্রীয় ভূমিকা পালন করেছে।

গুগলের অফিসিয়াল প্রতিক্রিয়ায় বলা হয়েছে: এটি প্রথমবারের মতো Flash লেভেলের মডেল ডক্টরেট লেভেলের গণিতের গবেষণা করেছে।
কেন সস্তা মডেলগুলি উচ্চতর পর্যায়ের শত্রুদের পরাজিত করতে পারে?
গোপনীয়তা প্যারামিটারে নয়, বরং টিমওয়ার্ক নামক একটি মাল্টি-এজেন্ট অর্কেস্ট্রেশন ফ্রেমওয়ার্কে।
গুগল যা শিল্পের দিকে প্রকৃতপক্ষে বার্তা পাঠাতে চায় তা হল: ফ্ল্যাশ হঠাৎ বুদ্ধিমান হয়ে উঠেছে না, বরং কাজ করার পদ্ধতি পরিবর্তিত হয়েছে।
প্রো নেতৃত্বে অন্বেষণ
ফ্ল্যাশ সফলভাবে পুনরুৎপাদন করা হয়েছে
এই রিপোর্টের মুখ্য চরিত্র কে, গুগলের প্রযুক্তিগত দীর্ঘ নিবন্ধটি খুব কঠোরভাবে সংজ্ঞায়িত করেছে:
7টি গণিত এবং থিওরেটিকাল কম্পিউটার সায়েন্সের ফলাফল, যেগুলি প্রাথমিকভাবে সমস্ত Gemini 3.1 Pro দ্বারা Teamwork-এর লং প্রুফ মোডে অর্জন করা হয়েছিল।
কিন্তু আশ্চর্যের বিষয় হলো, এই তিনটি হার্ডকোর ফলাফলকে জেমিনি 3.7 ফ্ল্যাশ সম্পূর্ণভাবে পুনরাবৃত্তি করেছে।
এই তিনটি কোনো কৌশলগত সমস্যা নয়: ℓp সাবস্পেস আনুমানের কোরসেট গঠন, সর্বাধিক অভ্যন্তরীণ গুণফল এম্বেডিংয়ের মাত্রা নিম্নসীমা, এবং হ্যাডামার্ড কোয়ান্টাইজেশন দ্বারা শীর্ষস্থানীয় ধ্রুবককে প্রায় 5.93 গুণ কমিয়ে আনা।
প্রতিটি বিষয়ই বাস্তবিকভাবে শিক্ষাগত জগতের একটি খোলা সমস্যা।

বাকি চারটি বিষয় কেবলমাত্র 3.1 Pro দ্বারা সমাধান করা হয়েছে, যার মধ্যে রয়েছে স্পার্স কনভেক্স অপ্টিমাইজেশনের কন্ডিশন নম্বরের নিম্নসীমা, প্রিফিক্স ম্যাট্রিক্স ফ্যাক্টরাইজেশনের আনুমানিক অপ্টিমাল নিম্নসীমা, ক্নুথের সাইকলস সমস্যা, এবং অফলাইন অবস্থায় পুনরায় প্রতিটি করা এরদোসের ইউনিট ডিসটেন্স সমস্যা।
এছাড়াও, গুগলের অভ্যন্তরীণ রেকর্ড ভাঙার জন্য TCSBench পরীক্ষায় 71% সর্বোচ্চ স্কোর অর্জন করা হয়েছে, যা 3.7 Flash এবং 3.1 Pro-এর শক্তিশালী সমন্বয়ে অর্জিত, যা আগের প্রজন্মের 3.6 Flash এবং 3.1 Pro-এর সমন্বয়ে অর্জিত 67.7% রেকর্ডকে সরাসরি ছাড়িয়ে গেছে।
যার মধ্যে, আমাদের আসলে মনোযোগ দেওয়া উচিত সংকেতটি হল:
যদি আপনি সঠিকভাবে ফ্রেমওয়ার্ক তৈরি করেন, তাহলে Flash এর মতো হালকা মডেলগুলি সম্পূর্ণরূপে ফ্ল্যাগশিপ মডেলগুলির গবেষণা পুনরায় চালানোর ক্ষমতা রাখে।
এটি আমাদের “ছোট মডেলগুলি কী করতে পারে” সম্পর্কে চিন্তার সীমানা পুনর্বিন্যাস করতে পর্যাপ্ত।
Teamwork এর «找茬» কে একটি কঠোর ব্যবস্থায় পরিণত করেছে
টিমওয়ার্ক হল অ্যান্টিগ্রাভিটি টিম দ্বারা বিকশিত একটি মাল্টি-এজেন্ট অর্কেস্ট্রেশন ফ্রেমওয়ার্ক।
আপনি শুধু একটি /teamwork-preview টাইপ করুন, জেমিনি প্রম্পটটি পড়ে নিজেই মোড বাছাই করবে এবং সাথে একটি “AI বিশেষজ্ঞ দল” গঠন করবে, যা কয়েক ঘন্টা বা এমনকি কয়েক দিন ধরে চলবে।
উল্লিখিত গাণিতিক অর্জনগুলি সম্পূর্ণরূপে দীর্ঘ প্রমাণ (Long Proof) মোড থেকে উদ্ভূত হয়েছে।
এর ডিজাইনের ধারণা অত্যন্ত অপ্রত্যাশিত: প্যারামিটার জমা করে নয়, বরং একটি ফ্ল্যাশ গ্রুপকে একে অপরের সাথে "দোষ খুঁজে বের করা, বিতর্ক করা, দুর্বলতা ধরা" এর মধ্যে নিয়ে আসা।
এই এআই গুলো কিভাবে মিটিং করে? এটি চারটি ধাপে বিশ্লেষণ করা যায়:
প্রথম ধাপ: পাগলামির মতো প্রতিযোগিতামূলক কৌশল অনুসন্ধান।
সিস্টেম একসাথে অনেকগুলি প্রস্তাবনা বিকাশ করবে এবং প্রতিটি প্রস্তাবনার জন্য একজন নিযুক্ত “বিপক্ষ বক্তা” নির্ধারণ করবে, যার একমাত্র KPI হল এই প্রস্তাবনাটি প্রত্যাখ্যান করা।
আকর্ষণীয় বিষয় হলো, যে পরিকল্পনাকে প্রচুর সমালোচনা করা হয়েছে, তাকে সরাসরি রিসাইকেল বক্সে ফেলে দেওয়া হয় না, বরং বিপরীত মতামত নিয়ে প্রক্রিয়ার মধ্যেই রাখা হয়।
প্রকৃতপক্ষে, একটি অপ্রাসঙ্গিক পথের মধ্যেই প্রায়শই বাঁচানোর মতো অনুপ্রেরণা লুকিয়ে থাকে।
দ্বিতীয় ধাপ: চিত্র অনুসরণ করুন, «প্রেসিসিয়ান ডিসাসেম্বল»।
একবার বিশ্বস্ত কৌশল নির্বাচন করা হলে, সিস্টেম এটিকে পরস্পর নির্ভরশীল উপ-সমস্যাগুলিতে বিভক্ত করে একটি কঠোর টপোলজিক্যাল গ্রাফ তৈরি করে। সমান্তরালভাবে প্রগতি সাধনযোগ্য সমস্যাগুলি একসাথে প্রক্রিয়াকরণ করা হয়, এবং ক্রমবিন্যাসযুক্ত সমস্যাগুলি ক্রমানুসারে অপেক্ষা করে।
তৃতীয় ধাপ: পাগলামির মতো অভ্যন্তরীণ প্রতিযোগিতা।
প্রতিটি উপ-সমস্যার ভিতরে একটি বিদায় প্রতিযোগিতা শুরু করুন, নোডগুলি একইসাথে প্রার্থী সমাধানগুলি পড়ে এবং কটূক্তি সমালোচনা দেখে, একসাথে একটি আপগ্রেড করা সংস্করণ তৈরি করুন।
যদি সমন্বয় ব্যর্থ হয়, তবে সঞ্চিত বিরোধিতা নিয়ে পুনরায় চালান, যতক্ষণ না ফাঁদটি সম্পূর্ণভাবে বন্ধ হয়ে যায়।
চতুর্থ ধাপ: একটি শিক্ষামূলক অভিজ্ঞতা থেকে শেখা।
অসফল ড্রাফ্টগুলি পুরোপুরি পরবর্তী রাউন্ডের জন্য রেখে দিন, প্রতিটি বড় ফাঁদ যা ভেরিফায়াররা পার হয়েছে, তা সবই পড়ে যাক 'ট্র্যাপ রেজিস্টার' এ।
প্রতিটি অপ্রয়োজনীয় পথ এবং প্রমাণিত উপসংহার সমস্ত সদস্যের জন্য সময়সাপেক্ষে শেয়ারড জ্ঞান ব্যাংকে সিঙ্ক করা হয়।

লং প্রুফ মোডের টুর্নামেন্ট নেটওয়ার্ক: প্রতিটি প্রস্তাবিত কৌশলের জন্য একজন ফলসিফায়ার নির্ধারিত হয়, এবং অস্বীকৃত পথগুলি বিরোধী মতামত সহ প্রক্রিয়ায় রাখা হয়।
এই প্রক্রিয়াটি চালানোর পর, এটিকে একটি শীতল সুপার মস্তিষ্ক বলার চেয়ে এটিকে একটি অত্যন্ত নির্মম, যেখানে কেউই ভাসা পানির মধ্যে মিশতে পারবে না, একটি একাডেমিক মিটিংয়ের পুনর্নির্মাণ বলা যায়।
এখানে, যে কোনো প্রস্তাবকে প্রথমে কয়েকবার কাটাকাটি করতে হয়, শুধুমাত্র যেগুলো ভাঙে না, সেগুলোই সহজে পার হয়ে যায়।
এটি প্রাচীন বহু-বুদ্ধিমত্তার সবচেয়ে সাধারণ সমষ্টিগত হিস্টিরিয়াকে সরাসরি চিকিৎসা করে:
আগে একটি এআই যদি অকস্মাৎ গতিপথ বিকৃত করে দেয়, অন্যান্য এআই অন্ধভাবে প্রতিধ্বনি করত, এবং শেষপর্যন্ত ভুল ভিত্তির উপরে আরও উঁচুতে গড়ে তোলে।
টিমওয়ার্কের গোপন অস্ত্র হলো, "একে অপরকে খুঁজে বেড়ানো" কে একটি কার্যকরী, কাউকেই এড়ানো যাবে না এমন কঠোর ব্যবস্থায় পরিণত করা।
ক্নুথ সমস্যার সত্য
এই সাতটি অর্জনের মধ্যে সবচেয়ে আকর্ষণীয় এবং সবচেয়ে বেশি ভুলবোঝার ঝুঁকিপূর্ণ হলো ডনাল্ড কনুথ দ্বারা প্রস্তাবিত কনুথের সাইকেলস সমস্যা।
বাস্তবে, এই প্রশ্নটি এই বছরের বসন্তেই এআই দ্বারা সম্পূর্ণ সমাধান করা হয়েছিল।

ডোনাল্ড কনথ, ২০২৩ সালের স্ট্যানফোর্ড ক্রিসমাস লেকচার।
বছরের ফেব্রুয়ারির শেষের দিকে, ক্লড ওপাস 4.6 মাত্র এক ঘন্টার মধ্যে অদ্ভুত পরিস্থিতির গঠন প্রদান করেছিল, যা গুডনারকে পেপারের শুরুতে দুটি 'Shock!' লিখতে বাধ্য করেছিল।

এরপর, GPT-5.3-Codex এবং GPT-5.4 Pro মডেলগুলি আসে এবং সবচেয়ে কঠিন জোড় পরিস্থিতিগুলিও পূরণ করে।
মধ্য এপ্রিলের দিকে, গার্টনার তাঁর পেপারের সংশোধিত সংস্করণে স্পষ্টভাবে ঘোষণা করেন যে জোড় পরিস্থিতি এখন অনিবার্য।
গুগল এবার কী করল?
সহজ ভাষায়, গুগল জোড় সংখ্যার জন্য দুটি আরও সুন্দর এবং সহজ নতুন গঠন খুঁজে পেয়েছে এবং প্রথম দীর্ঘ প্রমাণের দুটি প্রতিবেদন তৈরি করেছে, যার দৈর্ঘ্য যথাক্রমে 40 পৃষ্ঠা এবং 70 পৃষ্ঠা।
40 পৃষ্ঠার এই কঠোর প্রমাণটি Lean ফর্মাল যাচাইকরণের মাধ্যমে যাচাই করা হয়েছে, যাতে মেশিনও কোনো ত্রুটি খুঁজে পায়নি।
এটি অবশ্যই পর্যাপ্ত শক্তিশালী একটি শৈক্ষিক অবদান, কিন্তু এর প্রকৃত গুরুত্ব হল শূন্য থেকে বিপ্লব ঘটানোর পরিবর্তে "একটি আরও সুন্দর প্রমাণ দেওয়া"।
এটি প্রকাশ করে যে Teamwork-এর সত্যিকারের শক্তি কোথায়:
এটি কোনো একক মডেলের “একাকী বুদ্ধিমত্তা” পূরণ করেনি, বরং প্রতিষ্ঠিত খেলা এবং ব্যবস্থাপনার মাধ্যমে একাধিক বুদ্ধিমত্তার অসংগঠিত এবং পরস্পরের সাথে সম্মতি দেওয়ার সহযোগিতার দুর্বলতা সম্পূর্ণভাবে সারিয়েছে, এবং “সমষ্টিগত বুদ্ধিমত্তা” মুক্ত করেছে।
থিওরেম থেকে শেল
এবার সত্যিই ফ্ল্যাশ করেছে
একই ধরনের তুলনামূলক পদ্ধতি, গুগল একটি ভিন্ন মোডে পরিণত করে সরাসরি কঠিন ইঞ্জিনিয়ারিংয়ের দিকে এগিয়ে গেল।
এই প্রযুক্তিগত দীর্ঘ লেখাটিতে স্পষ্টভাবে উল্লেখ করা হয়েছে যে "Gemini 3.7 Flash" ব্যবহার করা হয়েছে। Teamwork শূন্য থেকে একটি পিরিয়ড-লেভেল, অর্ডার-অ্যাসিমেট্রিক RISC-V CPU সিমুলেটর তৈরি করেছে।
অর্ডারহীন কার্যক্রম আধুনিক হাই-পারফরম্যান্স সিপিইউ-এর একটি মানক বৈশিষ্ট্য এবং সিমুলেটরের জন্য সবচেয়ে বেশি ক্রাশ হওয়ার সম্ভাবনা রয়েছে।
টিমওয়ার্ক দুই ধাপে চলে: প্রথমে মাইক্রোআর্কিটেকচারের ফাংশন সঠিক করুন, নিজের হাতে অর্ডার-ইন-এক্সিকিউশন পাইপলাইন এবং রিঅর্ডারিং বাফার লিখুন, এবং xv6 অপারেটিং সিস্টেমকে Shell-এ পৌঁছান; তারপর প্রতিটি সাইকেলের সময়সূচী মেলান।

টিমওয়ার্ক দ্বারা তৈরি RISC-V সিমুলেটর দ্বারা xv6 কার্নেল শুরু করা এবং শেলে প্রবেশ করার প্রক্রিয়া।
সবচেয়ে কঠিন পর্যায়, যা গুগল দ্বারা "সাইলেন্ট এক্সিকিউশন গ্যাপ" নামে পরিচিত।
সিমুলেটরের মাইক্রোআর্কিটেকচার অবস্থা কয়েকশ সাইকেলের মধ্যে চুপিচুপি বিভ্রান্ত হয়ে যেতে পারে, এবং আর্কিটেকচার লেভেলে ত্রুটি ঘটলে মূল কারণটি খুঁজে পাওয়া প্রায় অসম্ভব হয়ে যায়।
টিমওয়ার্কের সমাধান হল রেফারেন্স সিমুলেটর স্পাইককে স্যান্ডবক্স করে বিচ্ছিন্ন করা, যাতে এজেন্টগুলি চালাকি বা অনুলিপি না করতে পারে, এবং প্রতিটি ধাপে সিঙ্ক্রোনাইজড সিমুলেশন চালিয়ে যাওয়া, প্রতিটি ধাপে বই মেলানো।
শেষ পর্যন্ত, এই সিমুলেটরটি 100-এর বেশি RISC-V মানক বেঞ্চমার্ক চালানোর সক্ষম হয়েছে এবং অপরিচিত টেস্ট লোডে BOOM হার্ডওয়্যারের সাথে গড় চক্র ত্রুটি মাত্র 0.71%।

গুগল প্রকাশ করেছে: টিমওয়ার্ক সিমুলেটর এবং BOOM হার্ডওয়্যারের সাইকেল অ্যালাইনমেন্টের তুলনায়, টেস্ট লোডে গড় ত্রুটি 0.71% দেখা যায়নি।
তবে এখানে স্পষ্ট করে বলা দরকার যে, এটি সফটওয়্যার লেভেলের একটি সিমুলেটর, এটি RTL চিপ ডিজাইনের কোনও রূপ নয়, আর তারপরেও চিপ তৈরির কথা বলার কথা নয়।
বাস্তব খোলা উৎস প্রয়োগ
এআই গবেষণার দ্বিতীয় অর্ধেক বাস্তবায়ন এবং গ্রহণযোগ্যতা নিয়ে প্রতিযোগিতা
গণিত এবং সিমুলেটরের তুলনায়, শেষ ধরনের ফলাফলগুলি সবচেয়ে কম দৃশ্যমান মনে হলেও, প্রমাণগুলি সবচেয়ে শক্তিশালী।
ইগেন হল সি++ বিশ্বের একটি অত্যন্ত জনপ্রিয় উচ্চ কার্যক্ষম রৈখিক বীজগণিত লাইব্রেরি।
টিমওয়ার্ক একটি একক লাইন বা একক কলাম ম্যাট্রিক্স ভেক্টর গুণনের অপ্টিমাল নয়া বাস্তবায়ন শনাক্ত করেছে এবং সরাসরি একটি SIMD দ্রুত পথ তৈরি করেছে।
ParlayHash সমান্তরাল হ্যাশ টেবিলে, Teamwork Swiss Table-এর অপ্টিমাইজেশন ধারণাগুলি ব্যবহার করে 64 থ্রেডের প্রাথমিক সন্নিবেশ থ্রুপুটকে দ্বিগুণ করে, একক থ্রেডের মোট থ্রুপুট 1.5 গুণ বাড়ায় এবং প্রতিটি উপাদানের জন্য 25% কম মেমরি ব্যবহার করে।
এই দুটি পরিবর্তন কোনো বন্ধ দরজার পিছনে নিজেদের জন্য বানানো স্কোর নয়, বরং কঠোর ওপেন-সোর্স কোড রিভিউ পার করে বাহ্যিক ম্যান্টেইনারদের দ্বারা আপস্ট্রিম ব্রাঞ্চে অফিসিয়ালি মার্জ করা প্রকৃত কোড।
রানস্কোরের চেয়ে বেশি মনোযোগ দেওয়া উচিত একটি গাণিতিক পেপারের শেষে লেখকের ঘোষণা: প্রমাণটি প্রথমে গুগলের অভ্যন্তরীণ Gemini ইন্টেলিজেন্ট সিস্টেম দ্বারা তৈরি করা হয়েছিল, তারপর লেখকদের দ্বারা যাচাই ও সম্পাদনা করা হয়েছিল।
এজেন্টগুলি অসীম খসড়া কাগজে পাগলামি করে অনুসন্ধান করে, এবং মানুষগুলি স্বাক্ষর এবং চূড়ান্ত অনুমোদনের দায়িত্ব নেয়। এটিই বর্তমানে AI গবেষণার সবচেয়ে বাস্তবিক বিভাজন।
গুগল নিজেই স্পষ্টভাবে বলেছে: এই সমস্যাগুলি মূলত শীর্ষস্থানীয় বিশেষজ্ঞদের কয়েক মাস ধরে সমাধান করতে হত, টিমওয়ার্ক পরীক্ষা-ভুলের চক্রকে সংক্ষিপ্ত করেছে, কিন্তু ড্রাইভিং এবং চূড়ান্ত অনুমোদনের অধিকার এখনও মানুষের হাতে।
এখন এআই গবেষণার দ্বিতীয় অংশে যে মডেলের প্যারামিটার বেশি, তার চেয়ে কার এআই দলটি ভালোভাবে গঠিত, তাই নির্ধারিত হচ্ছে।
যত বেশি মডেল সস্তা এবং দৈনন্দিন ব্যবহারের পণ্যের মতো হবে, মানুষের গ্রহণ এবং নিয়ন্ত্রণ তত বেশি মূল্যবান হবে।
আগে, মানুষ ছিল সমস্যা সমাধানকারী। এখন, মানুষ হয়ে উঠেছে প্রশ্ন তৈরি করে এবং পরীক্ষা করে দেখার।
গার্টনার ক্লডের জন্য হাতে লেখা প্রমাণটি খুঁজে পেয়েছিলেন, পরে জানতে পেরেছিলেন যে কেউ এটিকে লিয়ান দিয়ে যাচাই করেছে, তিনি বললেন, "এটি সত্যিই ভালো বিষয়," কারণ তিনি "সম্প্রতি ভুল করার প্রবণতা বাড়ছে।"
88 বছরের টিউরিং পুরস্কার বিজয়ীর প্রমাণও ভেরিফায়ার দিয়ে পরীক্ষা করতে হয়, তাই AI দ্বারা লেখা প্রমাণের ক্ষেত্রেও ব্যতিক্রম হতে পারে না।
সমাধান করার কাজে, মেশিন আরও বেশি কাজ করবে। গ্রহণের পর্যায়ে, অবশ্যই কারও থাকা দরকার।
প্রসঙ্গ:
https://antigravity.google/blog/teamwork-when-ai-becomes-a-research-partner
https://www-cs-faculty.stanford.edu/~knuth/papers/claude-cycles.pdf
এই পোস্টটি ওয়েইচ্যাট গ্রুপ "নিউ জ্ঞান" থেকে এসেছে, লেখক: ASI প্রকাশনা, সম্পাদক: ইউয়ু
