Ang GPT-6 Astra ay nakakuha ng skor na malapit sa 100% sa ARC-AGI-3 test, na nagdulot ng pagmamasid. Ang modelo ay nakakapagbuo ng epektibong “symbolic world model” sa pamamagitan ng pag-abstrak ng realidad bilang mga logikal na simbolo at causal code, at sa ganitong paraan ay nakakalikha nang sarili ng isang DSL algebra system upang tandaan ang mga patakaran ng kalikasan sa mga bagong laro na may mga graphic, at nagtatayo ng “virtual sandbox” para sa pag-simulasyon bago gumawa ng aksyon. Gayunpaman, ang mataas na skor ay may kinalaman sa mahal na gastos sa computing—tumatagal ng $360 bawat tanong, at kabuuang $18,000 para sa buong pagsubok. Sinabi ni Greg Kamradt, pangulo ng ARC Prize Foundation, na ang mataas na skor ay nakadepende sa panlabas na framework ng Harness, at hindi isang tunay na pagbuo ng AGI; ito ay nagpapatotoo lamang na ang AI ay nagsisiguro na mas matalino.May-akda ng artikulo, pinagkukunan: Leifengwang

360 dolyar ang nalalabas bawat tanong, natapos na ba ng GPT-6 ang AGI?
Ang pinakamalakas na model ng OpenAI, ang GPT-6 Astra, ay napakita na, at ito ay nagdala ng mga nakakagulat na pag-unlad sa pag-operate ng computer, pananaliksik, at seguridad. Sa mga nakakatangi nitong tagumpay, ang pinakamaraming pag-uusap sa publiko ay ang kanyang resulta sa ARC-AGI-3 test, na malapit na sa 100%.

Ano ang ARC-AGI-3? Ito ay ang pinakakilalang pagsusuri sa "IQ" ng AI sa buong mundo, at maaari mong ilarawan ito bilang pagsusulit para sa pagkakaroon ng kasapi sa club ng Mensa para sa AI.
Ang lahat ng mga tanong sa pagsusulit na ito ay mga pattern na nagbabago nang patuloy, kaya't imposible ang pagpapalakas ng mga tanong; kailangan ng AI na tulad ng tao ay mag-explor ng kapaligiran, mag-impluwensya ng layunin, at gamitin ang kakayahan sa pag-iisip at pagtugon sa pangyayari upang makahanap ng pattern. Ito ay mas mataas na antas sa iba't ibang pagtataya, at mas epektibong sinusukat kung ang AI ay isang simpleng kasangkapan o may totoong inteligensya.
At binuksan ng GPT-6 Astra ang pagsubok na ito, at alam nating ang nakaraang modelo, GPT-5.6 Sol, ay may marka lamang na 38.3%, isang malaking paglalakbay. Ang antas ng katalinuhan nito ay lalong lalong hihigit sa tao; sa 96% ng mga antas, mas mataas ang kanyang efisayensiya kaysa sa mga tao, at mas mababa ang kanilang average na bilang ng mga aksyon ng 51.7% kaysa sa mga tao.
Kung may isang AI na talagang may kakayahang magtatag ng mga lohikal na batas at lutasin ang mga problema sa isang lubos na hindi kilalang kapaligiran, maaari nating isipin na sa hinaharap, maaari itong gumawa ng tamang desisyon sa isang hindi kilalang sitwasyon sa autonomous driving, o mabilis na i-derive ang molecular structure ng isang epektibong gamot kapag may bagong hindi kilalang virus ang lumabas.
Upang suriin kung bakit ganyan matalino ang GPT-6 Astra, pinauunawaan ng opisyal ng ARC Prize ang kanyang backend records at natuklasan na habang lalaro siya, gumagawa siya ng epektibong “symbolic world model”.

Ang Symbol World Model ay isang advanced na derivasyon ng "World Model". Habang ang World Model ay tulad ng isang artista na nagpapahula ng hinaharap gamit ang mga imahe; ang Symbol World Model ay tulad ng isang matematiko na nag-aabstrak sa realidad bilang mga logikal na simbolo at causal code.
Ang teknolohiyang ito ay itinuturing na kailangang daan patungo sa mas mataas na pag-iisip ng AI.
Ano ang Symbol World Model?
Noong nakaraan, isang mahalagang dahilan kung bakit maraming malalaking modelo ay hindi nakakakuha ng mataas na marka sa ARC-AGI series of benchmarks ay dahil sila ay nakauugali sa “brute force trial and error.” Ang AI ay kumukuha ng screen ng laro at hinahati ito sa mga pixel, una ay pinipili nito ang random na punto, kung mali, nagbabago ito ng direksyon, at nagtatapos sa pamamagitan ng pagkakataon.
Sa ilalim ng modelo na ito, kahit may ilang pagtemo ng puntos, ang AI ay hindi talaga nauunawaan o nakakakuha ng pag-unawa sa mga patakaran ng laro.
Ang kakayahang mag-control ng buong laruan ng symbol world model ay nanggagaling sa kanyang sapat na pag-unawa sa mga pisikal na batas at ugnayang sanhi at epekto ng paligid, at paggawa ng mga desisyon sa pamamagitan ng masusing kalkulasyon.
Sa tunay na pagsubok, kapag pumasok ang GPT-6 Astra sa isang bagong larong grafiko, ito ay nagsisimula na gumawa ng maraming tala gamit ang sariling nilikhang DSL, isang eksklusibong sistema ng alhebraikong simbolo. Halimbawa, ito ay tumpak na nagtatala ng mga lihim na patakaran ng laro, isang serye ng mga instruksyon na darating, at kahit paano ang bawat trahektorya ng pixel ay na-map sa isang koordinadong sistema.
Ang paraan ng pag-record na ito ng alhebra ay nagdudulot ng isang tiyak at natatanging estado ng mundo, kumpara sa ambiguidad na nagmumula sa nakaraang modelo na gumagamit ng natural na wika para sa interaksyon; ang pagpapakita na ito ay simboliko at magdudulot ng isang史诗级 na pagtaas sa akurasyon.
Pagkatapos, isusulat muna nito ang isang logika ng Python sa isip: “Kung pindutin ko ang A, babalik ang grapiko 90 degrees patungo sa kaliwa.”
Pagkatapos, ito ay bumubuo ng isang “virtual sandbox” sa loob ng sarili nitong isipan, kung saan ito ay sinusimula ang susunod na plano. Matapos matiyak na may sariling lohikal na pagsasara at tama ang lahat, ito ay magpapatakbo lamang ng unang hakbang sa tunay na laro. Ito ang dahilan kung bakit mas mataas ang kanyang efficiency sa pag-operate kaysa sa mga tao.
Upang masuri ang hangganan ng kakayahan ng GPT-6 Astra, ang red team testing platform na PRO‑LONG ay isinama ito sa isang code sandbox at pinahintulutan ang AI na sarili naming sumulat at jalurin ang custom code.
Bilang resulta, nagsimula ang GPT-6 Astra na maglikha ng mga kasangkapan na “custom-made” para sa bawat laro. Halimbawa, sa isang komplikadong laro ng maliit na daan na may mga bantay na nagpapaligid, isinulat ng GPT-6 Astra ang sarili nitong navigation system, sinundan ng pagdaragdag ng mga patakaran sa pakikidigma, at sinimulan ang pag-simulate ng mga ruta ng pagpapaligid ng mga bantay, at sa huli, nakapag-predict at nakapag-verify nang perpekto gamit ang sariling chain ng mga kasangkapan.
Noong mga unang taon, ang kakayahang mag-isip ng mga simbolo at maglikha ng sariling kasangkapan ay ganap na nakasalalay sa panlabas na Harness framework. Tinutulungan ng panlabas na tool ang modelo sa pagpapalit ng imahe, pagtatala ng estado, at pag-verify ng resulta, ngunit may malaking kahinaan: ang pagpapadala ng data sa pagitan ng modelo at ng panlabas na tool ay nagdudulot ng mataas na latency; ang teknikal na kakayahan ng panlabas na tool ay ganap na hiwalay sa pagtatrabaho ng weights ng malaking modelo; dahil sa malaking pagkakasalalay sa cloud computing environment at panlabas na script, ang mga ito ay mahirap i-deploy sa edge hardware.
Ang GPT-6 Astra ay nag-iimbestiga ng malaking bahagi ng mga kakayahan ni Harness sa sariling timbang ng modelo. Hindi makatigil ang mga lider sa akademya na nagtataguyod ng mga modelo ng simbolikong mundo, si Gary Marcus, na pumupuri sa GPT-6 Astra bilang malaking tagumpay sa direksyong ito.
Sa loob ng huling dalawang taon, maraming pangunahing resulta ang lumabas sa akademya at industriya sa direksyong ito, mula sa Harvard at MIT hanggang sa Google DeepMind, at lahat ay nagtataya sa “symbolic world models.” Sa bawat kahahati-hati sa landas patungo sa AGI, ang industriya ay umuunlad sa isang pangunahing teknikal na pagkakasundo.
Kataas ng score, stable na ba ang AGI?
Ang tagapagbigay ng tanong ay direktang pinagbawalan
Kakaibang, habang ang buong network ay nagsisigaw sa pagkakamit ng iskoring ito, marami ang nag-repost sa pahayag ni Greg Brockman, pangulo ng OpenAI na “Ang AGI ay nandito na,” ngunit si Greg Kamradt, pangulo ng ARC Prize Foundation, ay direktang nagbigay ng malamig na tugon.
Siya ang pangunahing tagapaglikha ng mga tanong, at siya ang may pinakamalaking awtoridad kung paano disenyo ang benchmark at paano i-interpret ang mga marka. Mula sa pananaw ng pagpapahalaga, naniniwala siya na bagaman ang mga marka ay totoo, malayo pa ito sa AGI.
Hanggang sa ngayon, nakita na niya ang maraming tim na nakakuha ng higit sa 90% sa ARC-AGI-3 gamit ang Agent Harness, tulad ng PRO-LONG na may super memory cheat, Tycho na mahusay sa malalim na pagpapalawak, at ang Prime Agent na kayang mag-evolve ng sariling programming environment.
Ang mga produktong ito na nakakakuha ng mataas na marka ay may karaniwang teknikal na recipe, na binubuo ng limang pangunahing bahagi: lossless memory, programmatic analysis, explicit hypothesis testing, persistent state, at low-cost internal computation.
Ang lossless memory ang responsable sa pagtatala, ang programmatic analysis ang responsable sa lohika, ang explicit hypothesis testing ang responsable sa pagdedebate, ang persistent state ang responsable sa konteksto ng maraming round ng interaksyon, at ang low-cost internal computation ang responsable sa murang internal computing power, upang magkaroon ng kakayahan ang AI na mag-try at mali nang marami sa virtual na kapaligiran bago maglabas ng tamang sagot. Ang lahat ng ito ay bumubuo ng isang walang katumbas na Harness na magpapakumpleto sa mga kahinaan ng modelo.
Ang GPT-6 Astra ay malapit sa 100% na marka, gamit ang parehong mahalagang Harness, at ito ay gumagamit ng espesyal na disenyo na “supplier adapter base” upang suportahan ang kanyang logic chain sa pamamagitan ng tuloy-tuloy na diyalogo at pag-compress ng konteksto. Bawat pagkakataong tapos ang laro, kailangan ng 360 dolyar na mahal na computing power. Kung buong pagsusulit ay isasagawa, ang kabuuang bayarin sa computing power ay magiging nakakagulat na 18,000 dolyar (katumbas ng 135,000 piso ng China)!
Maaaring lutasin ng tao ang isang puzzle na may larawan sa loob ng ilang minuto, at kung isasalin sa enerhiyang metaboliko ng utak na 20W, ang kuryente ay mas mababa sa kalahating sentimo; kahit isama ang tunay na bayad sa oras para sa mga kalahok, ang bawat laro ay nagkakahalaga ng $12.78, samantalang ang AI ay nagagastos ng $360. Maaari bang maging AGI na madaling maabot ng karaniwang tao ang ganitong resulta na nakabatay sa “kapangyarihan ng pera”?
Totoo, ang GPT-6 Astra ay nagsisimula nang isama ang kakayahan ng Harness nang paulit-ulit, at kung patuloy itong umunlad, ang potensyal na computing power sa loob ng modelo ay lalalim pa. Gayunpaman, dahil ang proseso ng pag-iisip nito ay nagsisimula nang maging hindi malinaw, hindi alam ng mga developer kung talagang naiintindihan ng AI o kaya ay natagpuan na ito ang mas epektibong paraan ng panggagawian.
Bumalik sa nakaraang tanong, kasalungat ba ng GPT-6 Astra ang AGI?
Sa huling bahagi ng kaniyang mahabang artikulo, ibinigay ni Greg Kamradt ang isang malalim na sagot sa tanong na ito. Bakit itinuturing ang tao bilang “unibersal na intelihensya”? Dahil ang tao ay nakakakilos sa anumang hindi kilalang mundo—kahit ilagay mo ang isang batang sinaunang panahon sa modernong panahon, kaya pa rin niyang matutunan ang paggamit ng metro at ng cellphone. Ang intelihensyang ito ay patuloy na umunlad sa loob ng libu-libong taon at patuloy na nagpapalago sa teknolohiya. Ngunit ang pagsubok na kailangang pabayaran ng industriya ng teknolohiya ay isang “pagsusulit sa match-3 graphics” lamang para sa AI.
Ito ay patotoo lamang na lumalabo ang AI, ngunit hindi ito patunay na dumating na ang AGI.
