جولائی میں شنگھائی میں گرمی کی لہریں ہیں۔
67ویں بین الاقوامی ریاضی کے المپیک کا اختتام ہو گیا، چینی ٹیم نے 232 امتیاز حاصل کر کے چھوٹا تاج جیت لیا۔ تین نوجوانوں نے 42 کا مکمل امتیاز حاصل کیا۔

ابھی تک تالیوں کی آواز ختم نہیں ہوئی، GitHub پر ایک اور چمکتا ہوا اثبات ظاہر ہوا۔
سابق گوگل انجینئر ڈیڈی ڈاس نے ایک AI کا موازنہ پیش کیا: 7 جدید بڑے ماڈلز، جنہوں نے IMO 2026 کے تمام 6 سوالات خود کار طور پر حل کیے۔
کلود فیبل 5 نے 42/42 کے مکمل اسکور حاصل کیے۔ صرف 2.5 گھنٹوں میں، 51 امریکی ڈالر کا استعمال ہوا۔
GPT-5.6 Sol کا xhigh ورژن بھی مکمل نمبر حاصل کرتا ہے۔ اس نے صرف 3.8 گھنٹے میں اور صرف 20 امریکی ڈالر کی لاگت پر کام مکمل کیا۔
کیمی K3 نے اس کے بعد مکمل نمبر حاصل کیے۔ 17.4 گھنٹے کی سخت لڑائی کے بعد، 31 امریکی ڈالر خرچ کیے۔
آکسیم پروور کو الگ تھلگ سبمٹ کرتے ہوئے، مجموعی طور پر چاروں طاقتیں مکمل اسکور حاصل کر چکی ہیں۔

حوالہ کے طور پر، پچھلے سات سالوں میں IMO میں 4347 انسانی شرکاء نے حصہ لیا، صرف 30 افراد نے مکمل نمبر حاصل کیے — نسبت 0.69%۔

کامیابی میں دھماکہ خیز فرق
نتائج کے مطابق، صرف 42 اور 28 کے درمیان 14 کا فرق نہیں، بلکہ تین مکمل اسکور والے ماڈلز کی ٹاپ پوزیشن حاصل کرنے کی طرز بھی بالکل مختلف ہے۔
کلود فیبل 5 نے صاف اور مکمل طریقے سے کام کیا۔ 9 مکالموں میں، 6 مکالموں میں موثر آؤٹ پٹ، ایک منفرد سفر میں طویل ترین 73 منٹ (P3)، کل 70 لاکھ ٹوکن آؤٹ پٹ۔
GPT-5.6 Sol کچھ مشکلات کا شکار رہا۔ P2 پر 106 منٹ تک 4 راؤنڈ چلائے گئے، جس کے دوران دو بار نیٹ ورک کی خرابی کی وجہ سے رکاوٹ آئی۔ لیکن کیپیسٹی کنٹرول حیرت انگیز ہے — کل 230,000 ٹوکنز کا آؤٹ پٹ، جو تین میں سب سے زیادہ محفوظ ہے۔
کیمی K3 ایک بے تھک وحش کی طرح ہے۔ 2.8 ٹریلین پیرامیٹرز کا MoE ماڈل، 154 لاکھ ٹوکن ایک ساتھ بھیج دیتا ہے، جو Sol کا 6.5 گنا ہے۔ صرف P3 کے ایک سوال کے لیے 6 بار حملہ کیا گیا، جس میں 491 منٹ تک لڑا گیا۔






ریاضیاتی جذبات کا سیدھا مقابلہ
P1 سب سے سستا اور آسان ایپیٹائزس ہے، جسے تمام ماڈلز کچھ منٹوں میں مکمل کر لیتے ہیں، اور انسانی کھلاڑی بھی تقریباً کوئی غلطی نہیں کرتے۔
بورڈ پر 2026 سے زیادہ اعداد کو 1 سے بڑے مثبت عدد لکھا گیا ہے۔ ہر قدم پر، دو اعداد m اور n منتخب کریں، انہیں مٹائیں، اور gcd(m,n) اور lcm(m,n)/gcd(m,n) لکھیں۔ اس عمل کو تکرار کریں جب تک ممکن ہو۔ ثابت کریں: (a) عمل ضرور ختم ہو جائے گا، اور آخر میں بالکل ایک 1 سے بڑا عدد M باقی رہے گا؛ (b) M کی قیمت عمل کے ترتیب پر منحصر نہیں ہوگی۔

اس سوال کو سمجھنے کے لیے، ہم ایک مائیکرو ایکسپیریمنٹ کرتے ہیں۔
سیاہ تختے پر صرف 12 اور 18 ہیں۔ 12 = 2² × 3، 18 = 2 × 3²۔ اولین قدم: gcd(12,18) = 6، lcm(12,18)/6 = 6، سیاہ تختہ [6, 6] بن جاتا ہے۔ دوسرا قدم: gcd(6,6) = 6، lcm(6,6)/6 = 1، سیاہ تختہ [6, 1] بن جاتا ہے۔ صرف ایک عدد 1 سے بڑا باقی رہ جاتا ہے، کھیل ختم ہو جاتا ہے۔ M = 6۔
آپ کسی بھی طرح آپریشن کے ترتیب کو الٹ دیں، M ہمیشہ 6 ہوتا ہے۔ کیوں؟
جواب عوامل میں چھپا ہوا ہے۔
ہر اول عدد p کے لیے، تمام اعداد کی p سے تقسیم کی جانے والی زیادہ سے زیادہ تعداد کا عادِ اعظم لیں، پھر ان اول عدد کی قوتیں کو ضرب دیں — یہ قیمت پہلے مرحلے سے آخری مرحلے تک مستقل رہتی ہے۔
کلوڈ فیبل 5: ایک ایسا گنتی کا شمار کنندہ بنایا گیا جو ہر قدم پر ضائع ہو جاتا ہے۔
اس سوال کے لیے، فیبل 5 نے ایک مقدار Φ = T + N کو تعریف کیا ہے۔ T، سیاہ تختہ پر تمام اعداد کے بنیادی عوامل کی کل تعداد ہے (دوہرائے گئے عوامل کو بھی شمار کیا جاتا ہے)، جبکہ N، 1 سے بڑے اعداد کی تعداد ہے۔ مثال کے طور پر، اگر سیاہ تختہ [12, 18] ہو، تو 12 کے بنیادی عوامل 2، 2، 3 ہیں جو کہ 3 ہیں، اور 18 کے بنیادی عوامل 2، 3، 3 ہیں جو کہ 3 ہیں، اس لیے T = 6، N = 2، اور Φ = 8۔
پھر یہ ثابت ہوتا ہے کہ ہر عمل کے بعد، Φ کم سے کم 1 کم ہو جاتا ہے۔ دو صورتوں پر غور کریں — اگر gcd(m,n) > 1، تو بنیادی عوامل کی کل تعداد T کم ہو جاتی ہے؛ اگر gcd(m,n) = 1، تو T ویسا ہی رہتا ہے لیکن 1 سے زیادہ والی تعداد ایک کم ہو جاتی ہے، اور N میں 1 کمی آتی ہے۔ Φ ایک مثبت صحیح عدد ہے، اور ہر قدم پر کم سے کم 1 کم ہوتا ہے، اس لیے عمل محدود قدموں میں ختم ہو جائے گا۔ ایک واحد شمار کرنے والا، ایک ہی کٹ سے ختم۔

GPT-5.6 Sol: پروڈکٹس کا ٹریکنگ، لیکسیکوگرافک کم از کم درجہ
سول دو مقداروں پر نظر رکھتا ہے: P = تمام اعداد کا حاصل ضرب، K = 1 سے بڑی اعداد کی تعداد۔ ہر ایک عمل میں، اگر gcd(m,n) = d > 1، تو نئے دو اعداد کا حاصل ضرب mn/d ہوتا ہے، جو اصل سے چھوٹا ہوتا ہے، جس سے کل حاصل ضرب P سختی سے کم ہوتا ہے۔ اگر d = 1، تو P ویسا ہی رہتا ہے، لیکن K ایک سے کم ہو جاتا ہے۔
(پی، کے) جوڑا لفظی ترتیب میں سختی سے کم ہو رہا ہے: یا تو پی چھوٹا ہو رہا ہے، یا پی وہی رہ رہا ہے لیکن کے چھوٹا ہو رہا ہے۔ مثبت صحیح اعداد کی لفظی ترتیب لا متناہی طور پر کم نہیں ہو سکتی۔ ختم۔

ایک ہی مسئلے کے (a) حصے کو دو بالکل مختلف راستوں سے حل کیا گیا۔
بھاگ (b) تک، تینوں ماڈل ایک ہی نتیجہ پر پہنچتے ہیں: ہر اول عدد p کے لیے، بورڈ پر تمام اعداد کو p سے تقسیم کرنے کی زیادہ سے زیادہ باری کا عادِ اعظم عمل کے دوران نہیں بدلتا۔ آخری فارمولا بھی بالکل ایک جیسا ہے—

مثال پر واپس جائیں: 12 اور 18۔ p=2 کے لیے، v₂(12) = 2، v₂(18) = 1، gcd = 1، اس لیے 2¹ کا حصہ۔ p=3 کے لیے، v₃(12) = 1، v₃(18) = 2، gcd = 1، اس لیے 3¹ کا حصہ۔ M = 2 × 3 = 6، جو ہاتھ سے حساب لگانے سے بالکل ملتا جلتا ہے۔
سب سے سستا خالی پیپر
P6 کا یہ نظریہ عددی سوال دن 2 کا آخری سوال ہے، جس میں تکراری تسلسل کے عملی طور پر دورانیہ دار ہونے کا ثبوت دینا ہے۔
گزشتہ سال IMO 2025 میں دنیا بھر میں صرف 6 افراد نے P6 حل کیا۔
کلود فیبل: 5:26 منٹ، دو راؤنڈ، مکمل اسکور۔ جی پی ٹی-5.6 سول: 60 منٹ، دو راؤنڈ، مکمل اسکور۔ کیمی K3: 381 منٹ، چار راؤنڈ، مکمل اسکور۔
Grok 4.5 P6 پر صرف 7053 ٹوکنز پیدا کرتا ہے، جس سے وہ سب سے نیچے رہ جاتا ہے۔ جمع کروائے گئے فائل میں واضح طور پر لکھا ہوا ہے: Full proof: (Not yet complete.)
0.18 ڈالر، پورے مارکیٹ کی سب سے سستی وائٹ ڈیل۔
گروک کی خرابیاں صرف اسی تک محدود نہیں ہیں۔ پورے ٹیسٹ کے دوران یہ بار بار ایک عجیب و غریب الوسواس میں پھنس جاتا ہے: یہ دعویٰ کرتا ہے کہ "ثبوت فائل میں لکھ دیا گیا ہے"، جبکہ بیک اینڈ میں لکھنے کا ٹول تو تکلیف سے بھی نہیں لگایا گیا۔
یہ ریاضی کی صلاحیت کا مسئلہ نہیں، بلکہ ایجینٹ کی صلاحیت کا مسئلہ ہے۔ ماڈل جانتا ہے کہ فائل لکھنی چاہیے، اور دعویٰ کرتا ہے کہ اس نے لکھ دی ہے، لیکن ٹول کال کے سطح پر اس نے کوئی کارروائی نہیں کی۔
تین سال میں تین کوچکیاں
سیلیکون بنیادی دماغ کا خوفناک ترقی
2024 میں، DeepMind کا AlphaProof پہلی بار IMO لیول پر طلائی تمغہ حاصل کرنے کے لیے درپیش ہوا۔
2025ء میں، OpenAI اور DeepMind نے ایک ساتھ کارروائی کی۔ OpenAI نے اپنا ماڈل شائع نہیں کیا، لیکن 5 سوالات حل کرکے 35 نمبروں کا سونے کا تمغہ جیتا، جبکہ Gemini Deep Think نے بھی اسی سطح کو حاصل کر لیا۔
2026 میں، تین عام بڑے ماڈلز نے براہ راست مکمل نمبر حاصل کیے۔ اس بار، انہیں کسی خاص ریاضی کی تربیت نہیں دی گئی تھی، اور سب کو استعمال کرنے کا موقع ملا۔ ایک تو اوپن سورس بھی تھا۔

مکینیکل چیلنج لکھنے والا
پورے ٹیسٹ کا آغاز ایک کمپنی ایکسیوم میتھ سے ہوا۔
انہوں نے IMO 2026 کے تمام 6 سوالات کو، الفاظ الفاظ، ماشین کے لیے سمجھنے والی Lean 4 فارملائزڈ سوالات کے شکل میں ترجمہ کیا۔
اس ماشین پڑھنے والے سوالات کے سیٹ کے ساتھ، AI براہ راست Lean ثبوت پیدا کر سکتا ہے اور کمپائلر خودکار طور پر اسے جانچ سکتا ہے، جس سے انسانی جج کی ضرورت ختم ہو جاتی ہے۔
ٹیسٹ فریم ورک کو فوراً مکمل طور پر آٹومیٹڈ بنانے کے بعد، Deedy Das نے تمام 6 چیلنجز کو مکمل کرنے کے لیے مختلف ماڈلز کو دوڑایا۔ AxiomProver نے بھی الگ طور پر مکمل نمبر حاصل کیے۔
یہ قابل ذکر ہے کہ ایکسیوم میتھ کے بانی ہونگ لیٹونگ صرف 25 سال کی ہیں۔ وہ گوانگژو میں پیدا ہوئیں اور صرف تین سال میں ایم آئی ٹی سے ریاضی اور فزکس دونوں میں ڈگری حاصل کر لی، اور مارگن انعام کی حاصل کنندہ بھی ہیں۔
گزشتہ سال کے آخر میں، اس نے اپنے ہاتھوں سے تیار کیا گیا AxiomProver نے پٹنام ریاضی مقابلے میں مکمل نمبر حاصل کیے۔ یہ مقابلے کی 98 سالہ تاریخ میں چھٹا مکمل نمبر کا معجزہ تھا۔
اس سال مارچ میں، اس کمپنی نے 2 ارب امریکی ڈالر کا A سیریز فنڈنگ مکمل کیا۔ اس کی قیمت 16 ارب امریکی ڈالر تک پہنچ گئی۔

عام لوگوں کی زندگی کو کیسے دوبارہ تشکیل دیا جائے گا
4229 لائنز کا سخت ثبوت والا ماڈل بنانے کی صلاحیت، صرف ریاضی کے مسائل حل کرنے کی صلاحیت نہیں ہے۔
اس کا اصل کنٹرول لمبی منطقی استدلال پر ہے، جس میں ہر قدم کو چھوڑا نہیں جا سکتا، غلط نہیں کیا جا سکتا، اور ابھی تک واضح نہیں ہے۔
کنٹریکٹ کے شرائط میں کوئی خامی تو نہیں، بیمہ دعوؤں کی شرائط پوری ہو رہی ہیں یا نہیں، ٹیکس منصوبہ قانونی ہے یا نہیں — سب کچھ سطحی سطح پر ایک ہی قسم کا مسئلہ ہے: جواب "تقریباً صحیح" نہیں ہو سکتا۔
پہلے اس طرح کی ایک ایک کر کے جانچ صرف ماہرین ہی کر سکتے تھے، جس کا شحص گھنٹے کے حساب سے لیا جاتا تھا۔
اب، جب یہ صلاحیت مصرف کنندہ مصنوعات میں شامل ہو گئی ہے، تو مشکل مسائل کے لیے صرف اپنا فون کھولیں۔
حوالہ جات:
https://x.com/deedydas/status/2079409461874332066
یہ مضمون ویچن گروپ "نیوزی یوآن" سے ہے، مصنف: ASI احکام، ایڈیٹر: موسیٰ
