May-akda | Hualin Dance King
Ipinagmamalaki ni靖宇
Noong 3 Setyembre 2026, pagkatapos ng pagpapakilala, sinabi ni Greg Brockman, pangulo ng OpenAI, isang pahayag na lubos na kakaibang nangyari sa industriya ng AI: “Sa aking personal na palagay, posibleng nasa tama na tayo sa AGI, at sa tingin ko ito ang modelo.”
Nakapagsalita siya nang maingat, gumamit ng unang panauhan, idinagdag ang "posible," at partikular na nag-iwan ng exit strategy sa pamamagitan ng pagsasabi, "Kung gusto mong sabihin na ito ang unang beses, naniniwala ako na ito ay makatwiran."
Hindi ito opisyal na pahayag ng OpenAI tungkol sa pagdating ng AGI, kundi isang pahayag ng pangulo ng kumpanya sa harap ng kamera.
Sa lokal na oras noong Setyembre 3, ipinakilala ang GPT-6 Astra. Ipinakikita ng Geek Park ang lahat ng teknikal na detalye at materyales sa demonstrasyon na maaaring maabot, at sinusubukang sagutin ang pinakamahalagang tanong: Ano ang kayang gawin ng modelo na ito, at hanggang saan ito kayang gawin? Totoo ba itong nagpapakita ng pagdating ng AGI?
Ang "paggamit ng computer" ay nagsisilbing mito
Sa mga pampublikong materyales, ibinigay ng OpenAI sa Astra ang isang maikling slogan: “Anything you can do on a computer, Astra can do for you.”
Hindi ito isang exaggerated na marketing pitch, kundi isang pagpapahayag ng direksyon.
Sa mga nakalipas na taon, ang pangunahing paraan kung paano pinagpapagana ng AI ang mga computer ay sa pamamagitan ng pagtawag sa API. Una ay isinusulat ng mga developer ng software ang mga interface, at pagkatapos ay ginagamit ng AI ang mga interface upang matapos ang mga gawain. Ang sistema na ito ay nangangailangan sa bawat software na magkaroon ng espesyal na pagpapadala sa AI, kung hindi ay walang kakayahan ang AI.
Ang Astra ay sumunod sa isang ganap na iba't ibang landas: ito ay direktang "nakikita" ang mga pixel sa screen tulad ng isang tao, at pagkatapos ay gumagalaw ng mouse at sumisigaw ng keyboard upang matapos ang mga gawain.
Ang kahalagahan ng pagkakaiba ay nasa sakop nito. Hindi gagawa ng API para sa AI ang KiCad (software para sa disenyo ng printed circuit board), hindi rin ito gagawa ang FreeCAD, at mas hindi ito gagawa ng lumang ERP system na ginagamit na ng sampu't taon sa loob ng kumpanya. Ngunit kung ang AI ay makakakita ng screen at makakagawa ng mga aksyon nang direkta, lahat ng mga software na ito ay maaari niyang gamitin—tulad ng isang baguhan sa trabaho, hindi kailangang maintindihan ang code sa likod ng software, kailangan lang na maintindihan ang interface.
Inilah ng OpenAI ang ilang partikular na kaso sa kanilang pagsasalaysay upang maunawaan kung ano ang maaaring mangyari pagkatapos ng pagpapatupad ng "paggamit ng computer".

Nakumpleto ng GPT-6 Astra ang layout at wiring ng PCB | Pinagkunan: OpenAI
Ibigay ang isang schematic circuit sa Astra, na natapos nito ang pagkakalagay ng mga komponente at paglalakad ng copper sa KiCad, na nagtrabaho sa loob ng 2 minuto at 54 segundo. Isang iba pang demo ay ang 3D modeling, kung saan binuo ng Astra ang isang model ng bahay sa Blender, at sinakop ito sa Unreal Engine 5 upang lumikha ng isang real-time na architectural scene na maaaring bisitahin. Mayroon ding isang mas pang-araw-araw na demo, kung saan sinabi lamang ng user ang mga salita sa Astra, at ito ay natapos ang buong proseso ng pagpapalabas ng produkto sa eBay, mula sa pagpapakita ng impormasyon hanggang sa pagsumite at pagpapalabas.

Astra na ginawa sa Blender | Sumber ng imahe: OpenAI
Sa pagpapabuti ng efficiency, ang mga komparatibong datos na ibinigay ni OpenAI ay lubos na malinaw. Sa OSWorld 2.0 benchmark, ang Astra ay nakakuha ng 72.6% sa pagkumpleto ng mga gawain sa paggamit ng computer, habang ang nakaraang flagship na GPT-5.6 Sol ay 65.7%; samantala, para sa parehong mga gawain, ang Astra ay nangangailangan ng halos 40 minuto sa average, habang ang Sol ay nangangailangan ng halos 75 minuto—mas mabilis nang halos kalahati.
| https://www.geekpark.net/news/369800https://www.geekpark.net/news/369800 |
Nakamit ng Astra ang task ng paghahanap ng apartment sa 9 minuto (kaliwa), 2 minuto ang task ng paghahanap ng pediatric clinic | Credit: OpenAI
Ipinakita rin ng OpenAI ang dalawang internal timing cases. Para sa mga gawain tulad ng “Paghahanap ng temporary na pangangalaga sa pusa” na nangangailangan ng maraming online search, paghahambing ng impormasyon, at pagsasama-sama sa isang dokumento, ginamit ng Astra ang 5 minuto at 27 segundo, habang ang human baseline na ibinigay ng OpenAI ay 30 minuto. Para sa mga komprehensibong gawain tulad ng “Paghahanda para sa paghahanap ng trabaho” na nangangailangan ng paghahanap ng posisyon, pagpapares ng resume, at pag-ayos ng application process, ginamit ng Astra ang 2 minuto at 51 segundo, habang ang human baseline ay 5 oras.
Ang dalawang numero ay mga resulta ng sariling demo ng OpenAI, hindi mga pagsusuri ng independiyenteng third party, at kailangan na panatilihin ang makatotohanang pag-aalinlangan. Ngunit ang direksyon ng produkto na ipinapakita nito ay malinaw: hindi ginawa ang Astra upang tulungan ka sa pagsulat ng isang email, kundi upang kumpletuhin ang buong workflow na nangangailangan ng 'pagbukas ng maraming software at pag-click sa maraming hakbang'. Ang pagpapuno ng form, pag-update ng CRM records, pag-ayos ng kalendaryo, at paggawa ng report pagkatapos ng online research — lahat ito ay mga aplikasyon sa negosyo na malinaw na listahan ng OpenAI.
Kakayahan na “Next Level”
Bawat paglalabas ng malaking modelo ay dala-dala ang isang serye ng mga numero sa benchmark. Karaniwan, mula sa 80 hanggang 85, tila magkakatulad ang mga ito sa paningin ng mga mambabasa, ngunit sa pagkakataong ito, talagang iba.
Ang ARC-AGI-3 ay isa sa pinakamahirap na AI assessment na kilala sa kasalukuyan. Ang disenyo nito ay espesipikong para maiwasan ang paggamit ng memorya ng mga training data, at sinusukat nito ang totoong pag-iisip kapag nakakatugon sa mga bagong problema, parang isang IQ test para sa AI.

Ang Astra ay may score na halos diyos sa ARC-AGI-3|Sanggunian ng imahe: OpenAI
Ang Astra ay may marka na 98.6% sa ARC-AGI-3. Ang GPT-5.6 Sol ay may marka na 7.8%. Ang Claude Opus 5 ni Anthropic ay 30%.
Hindi ito ang uri ng “pag-unlad” mula sa 80 hanggang 90 puntos, kundi isang paglalakbay sa isang iba’t ibang antas. Marami nang itaas ni François Chollet, ang tagapagtatag ng ARC-AGI, ang antas ng pagsubok dahil madalas ng mabilis na “makakapagpuno” ng puntos ang AI, ngunit nananatili pa ring malapit sa perpektong marka ang Astra sa antas ng Tier 3.

Nangunguna nang malaki ang Astra sa pagsusulit sa pinakamataas na kakayahan sa matematikang pag-aaral | Larawan mula sa OpenAI
Ang iba pang mga pangunahing benchmark: FrontierMath Tier 4 (pinakamataas na kakayahan sa matematikal na pag-aaral) 97.6%, GPQA Diamond (interdisiplinary na tanong-sagot sa antas ng graduate) 96%, DeepSWE (totoong software engineering task) 74.1%, ExploitBench (网络安全漏洞利用) 100%.
May isang aspeto kung saan hindi nagkamit ng unang lugar ang Astra. Sa «Humanity's Last Exam» (na may pagtawag sa mga kasangkapan), ang Astra ay nakakuha ng 57.2%, habang ang bagong ipinakilala na Anthropic Claude Fable 5.1 ay may 65.0% dalawang araw na ang nakalipas. Hindi ito ganap na paglalaban, at patuloy pa ang kompetisyon.
May isang mahalagang detalye na dapat ipaliwanag. Ang mataas na marka ng ARC-AGI-3 ay nakasalalay sa "stateful testing framework" ng OpenAI, na nagpapahintulot sa modelo na makalikom ng kontekstwal na impormasyon sa mga maraming pagkakataon; sa ilalim ng mga pangkaraniwang API call na walang estado, mas mababa ang marka kaysa sa numerong ito. Kapag ginagawa ang pagsasalin sa pagitan ng mga modelo, mahalaga na tandaan ang ganitong kondisyon.
Sa kabuuan, ang Astra ay nagtataglay ng malaking pagkakaiba kumpara sa nakaraang bersyon ng modelo, isang pagkakaiba na kakaunti ang nakita sa pagpapalit ng AI models sa loob ng dalawang taon.

Sa pagsusuri ng ExploitGym honeypot, ang posibilidad na maipagbili si Astra ay nakaputol | Larawan mula sa OpenAI
Ang pinakamalaking pagkakaiba ay hindi sa intelektuwal, kundi sa pagkakasundo. Ipinahayag ng OpenAI ang isang panloob na test data, kung saan sa walang mga limitasyon ng kaligtasan sa production environment, ang GPT-5.6 Sol ay magiging labas sa kanilang awtorisasyon sa 48.2% ng mga kaso, habang ang Astra ay 0%.
Mas matalino at parehong mas sumusunod sa mga alituntunin, iyon ang tunay na mensahe na nais iparating ng OpenAI sa pagkakataong ito.
Hindi mo pa kailangan
Kasalukuyan, ang Astra ay gumagamit ng pahintulot na may mga yugto.
Una ay magiging available para sa mga enterprise user ng proyektong “Daybreak”, at susundan ng pagpapalawak sa mga user ng subscription na ChatGPT Plus, Pro, Business, at Enterprise, kasama ang suporta sa pamamagitan ng OpenAI API, AWS Bedrock, at Microsoft Azure.
Ang mas malakas na bersyon ng网络安全 sa Astra ay eksklusibo lamang para sa mga naka-approve na defensive security agencies at priority users sa larangan ng critical infrastructure. Dahil ang Astra ay ang unang modelo sa kasaysayan ng OpenAI na nakamit ang loob na "Critical" na threshold sa网络安全, na makakahanap ng mga hindi kilalang zero-day vulnerabilities at magbuo ng buong exploit chains nang halos walang tulong mula sa tao. Sa proseso ng pagsusuri, natuklasan pa ng Astra ang dalawang vulnerability na hindi pa nagagawa, na sinunod ng OpenAI sa pagpapahayag nito sa mga tagapagpanatili ng software.

Sa mga presyo ng API, ang bawat milyong token ng input at output ng Astra ay nagkakahalaga ng $10 at $50. Para sa mga user ng ChatGPT subscription, ang paggamit ng Astra ay kasama sa umiiral na subscription quota.
Ang pagpili ng oras ng pagpapalabas ay isang konteksto rin. Sa nakaraang buwan, dinanas ng OpenAI ang isang malubhang security incident kung saan dalawang modelo sa loob ng pagsusulit ay nakalabas sa sandbox at nag-intrude sa sistema ng AI company na Hugging Face, na nagresulta sa pagpapahinga ng ilang pag-aaral at pag-train ng OpenAI. Binanggit nang aktibo ni Brockman ang insidente sa briefing at pinahalagahan ang mababang rate ng boundary violation at ang seguridad ng Astra, na nagdudulot ng misyon na “muling itayo ang tiwala.”
Ang paglunsad ng Astra ay isang pagpapakita ng kakayahan at isang pampublikong pahayag ng tiwala.
Kung umabot na ba ang AGI, maaaring magdepende ito sa kung anong kahulugan ang pipiliin ng bawat isa. Ngunit isang modelo na kaya mag-upo nang direkta sa iyong computer at awtomatikong kumpletuhin ang mga cross-software workflow—ito ay totoo na ngayon.
Ang susunod na tunay na interesanteng tanong ay kung saan una nilang gagamitin ng mga negosyo at mga indibidwal na user, at aling mga propesyon ang unang makaramdam ng ganitong "sensasyon ng pagpapalit."
