GPT-6 Astra ay Lutasin ang Huling Hangganan: Matematika Tier 4

icon MarsBit
I-share
AI summary iconSummary
AI + crypto news: Ang GPT-6 Astra ay nalutas ang huling problema sa FrontierMath Tier 4, natapos ang lahat ng hamon sa advanced benchmark. Na-develop ng Epoch AI kasama ang 60+ na matematiko, nakamit ni Astra ang 97.6% na akurasyon at nalutas ang huling hindi nalulutas na problema. Lumilipat na ang proyekto sa bagong yugto na may bukas na pananaliksik at formalisadong hamon, nagtatakda ng mahalagang pahayag sa pag-unlad ng AI.

Kanina lamang, nasira ng GPT-6 Astra ang huling hamon sa FrontierMath Tier 4.

Sa ngayon, ang lahat ng mga tanong sa pagsusulit na ito, na dating itinuturing na isang krisis sa matematika para sa malalaking modelo, ay nakakamit na ng AI sa isang pagkakataon.

Ang Epoch AI ay opisyal na nagbigay ng kongklusyon, ang FrontierMath Tier 4, ay nasa saturation na.

FrontierMath

Kahit na tingnan mula sa itaas na larawan, ang Astra ay hindi pa direktang nakakamit ang 100%, ang sariling inilathala na resulta ng OpenAI ay 97.6%.

Ngunit ayon sa algoritmo ng Epoch, ang "natapos lahat" ay nangangahulugan na pagkatapos ng pagkumulang ng lahat ng mga pagsubok mula sa iba't ibang modelo at panahon, bawat tanong sa Tier 4 ay mayroon nang matagumpay na sagot.

Atin ng Astra ang huling hadlang na hindi pa nasakop ng AI.

(Simpleng pag-unawa ay maaaring may error ang Astra sa isang pagsubok, ngunit tama ang tanong na iyon na hindi pa nabuo bago)

FrontierMath

To be honest, this rate of development is still insane.

Kung ikaw ay sumusunod sa mga pagsusuri ng model, alam mo na noong July 11, 2025, nang ma-launch ang Tier 4, ang pinakamataas na resulta sa listahan ay lamang halos 5%.

Ngayon ay nakaraan na ang isang taon at dalawang buwan, ang dating “mataas na pader” ay naging “hakbang,” at ang huling problema na hindi kayang lutasin ng AI sa pamamagitan ng shortcut ay nalampasan na.

Binigkas din ni Jay Pantone, associate professor ng mathematics sa Marquette University, na sa nakaraan, laging naghahanap ang AI ng mga numerical shortcuts, ngunit sa pagkakataong ito, malapit ang solusyon ng AI sa kanyang sarili.

FrontierMath

Ngunit sa katunayan, sa pagkakataong ito, ang GPT-6 Astra ay nag-atake nang malakas sa mundo ng matematika, at laganap na naglutas ng mga Millennium Prize Problems, kaya ang Pantone ay nagsabi na mahirap na siyang magkaroon ng pagkabigla!

Maaaring sabihin na ang matematika ay naging isa sa mga pinakamalakas na lugar kung saan nagpapakita ng sarili ang Astra sa nakalipas na panahon.

Mula sa mas mababa sa 2%, hanggang sa pagdagdag ng isang espesyal na "research-grade defense"

Ipinakilala ng FrontierMath noong Nobyembre 7, 2024, at ang layunin nito ay upang maiwasan ang masyadong mabilis na pagbabasag ng mathematical benchmark ng AI.

Noong panahong iyon, ang mga tradisyonal na benchmark sa matematika tulad ng GSM8K at MATH ay naging mas mahirap pang ibigay ang pagkakaiba sa pagitan ng mga lider na model, kaya ang Epoch AI ay nagtutulungan kasama ang 60+ na matematiko upang muling disenyo ang isang bagong hanay ng orihinal na tanong na hindi pa nagkakaroon ng pagsasahay.

Kabilang dito ang mga tagapagwagi ng Fields Medal tulad ni Terence Tao, Timothy Gowers, at Richard Borcherds.

Kapag natapos ni Terence Tao ang pagbabasa sa ilan sa mga pag-aaral na tanong, sinabi niya nang direkta na ang mga tanong na ito ay “napakahirap,” at kahit na ang pinakamahirap na Tier 3 ay maaaring magpabilis pa ng ilang taon para sa AI.

FrontierMath

Sa unang pagsubok, ayon sa inaasahan, ang tamang rate ng lider na modelo ay hindi pa umabot sa 2%.

Sa simula, ang pangunahing banko ng tanong ng FrontierMath ay may 300 tanong, na nahahati sa tatlong antas ayon sa kalakasan: Tier 1, Tier 2, at Tier 3.

FrontierMath

Ang Tier 1 ay malapit sa mga mahirap na tanong sa antas ng undergraduate at sa Mathematical Olympiad, ngunit pinapayagan ang paggamit ng mas mataas na mga kasangkapan; ang Tier 2 ay umabot na sa antas ng huling taon ng graduate studies; at ang Tier 3 ay mas malapit sa mga eksploratoryong pananaliksik na kinakaharap ng mga doktorante sa kanilang mga unang taon.

Ngunit kasabay ng paglitaw ng mga inference model, naging hindi sapat na ang mga unang tatlong antas, kaya noong 2025, dagdag pa ni Epoch ang Tier 4.

Ang Tier 4 ay karaniwang dinisenyo ng mga propesor ng matematika at postdoctoral researchers, kung saan bawat isa ay magpapalalim sa kanilang sariling larangan ng pag-aaral sa loob ng ilang linggo, at pagkatapos ay i-compress ang kanilang mga resulta sa isang tanong na maaaring awtomatikong ma-verify.

FrontierMath

Sa simula, binubuo ng Tier 4 ang 50 mga tanong. Kasama sa sakop nito ang analisis, numero theory, kombinatoriks, topolohiya, alhebraik na heometriya…

Sa pagkakalabas, sa lahat ng mga pagsubok ng modelo, lamang tatlong tanong ang naunawaan, at ang mga sagot na ito ay nakabatay sa ilang tama, ngunit hindi sapat na ipinapatunay na mga aksiyoma.

Sa ilalim ng mga ito, ang Epoch ay isinulat din sa pahina ng mga halimbawang tanong ng opisyal na website: ang ilan sa mga tanong na ito ay maaaring hindi lutasin ng AI sa loob ng ilang dekada.

FrontierMath

(Itinutuloy na ngayon ang pagpapakita nito nang paulit-ulit)

Ngunit habang lumalakas ang mga modelo, ipinakita rin ng isang iba pang problema: ang banko ng mga tanong ay nagsisimulang hindi makatanggap sa “pagsusubok” ng AI.

Nakakita ang OpenAI ng higit pang mga kamalian sa FrontierMath kaysa sa inaasahan.

Pagkatapos, sinimulan ng Epoch ang independiyenteng pagsusuri, kung saan una ay ginamit ang GPT-5.5 at Claude Opus 4.7 upang i-screen ang mga posibleng problema, at pagkatapos ay ibinigay sa mga matematiko para sa pagsusuri sa bawat tanong. Sa huli, ipinakilala ang bersyon v2 noong Hunyo 2026, kung saan tinamaan ng Tier 4 ang 12 tanong, inalis ang 7 tanong, at natira ang 43 tanong.

Pagkatapos ng pagpapabuti, patuloy na umuunlad ang marka ng modelo.

GPT-5.6 ay nakamit ang 83.0%, ang Claude Fable 5 ay nakamit ang 90.2%, habang ang GPT-6 Astra ay nakamit na ang 97.6%.

FrontierMath

Mas mahalaga pa, sinagot din ni Astra ang tanging isang tanong na hindi pa kailanman nalutas ng AI.

FrontierMath

Sa ngayon, bawat tanong sa Tier 4 ay napatunayang na-break na ng AI sa isang pagkakataon. Ang espesyal na panlaban na gawa para sa pinakamalakas na modelo, isang research-grade defense, ay nakalampas na rin.

Ngunit hindi ito nangangahulugan na “na-solve na ng AI ang matematika”. Kabilang sa katotohanan, ang FrontierMath ay nagsimula na ring lumipat sa susunod na yugto.

Ngayon, sa buong proyekto, maliban sa Tiers 1-4, idinagdag ang mga tunay na Open Problems, at isinama ang pag-formalize ng mga Erdős Open Problems sa Lean na FrontierMath Erdős.

FrontierMath

Ang una ay direktang sinusubok ang modelo gamit ang mga pananaliksik na problema na hindi pa nalulutas ng matematikong komunidad; ang ikalawa ay hinihingi ng AI na sumulat ng buong patunay na makakapasa sa formal verification.

Sa pagkakataong ito, nalutas ng Astra ang 2 sa 68 na tanong ni FrontierMath Erdős.

Patuloy pa ang kuwento~

Nakuha mula sa WeChat public account na “Quantum Bit”, may-akda: henry

Disclaimer: Ang information sa page na ito ay maaaring nakuha mula sa mga third party at hindi necessary na nagre-reflect sa mga pananaw o opinyon ng KuCoin. Ibinigay ang content na ito para sa mga pangkalahatang informational purpose lang, nang walang anumang representation o warranty ng anumang uri, at hindi rin ito dapat ipakahulugan bilang financial o investment advice. Hindi mananagot ang KuCoin para sa anumang error o omission, o para sa anumang outcome na magreresulta mula sa paggamit ng information na ito. Maaaring maging risky ang mga investment sa mga digital asset. Pakisuri nang maigi ang mga risk ng isang produkto at ang risk tolerance mo batay sa iyong sariling kalagayang pinansyal. Para sa higit pang information, mag-refer sa aming Terms ng Paggamit at Disclosure ng Risk.