Hindi lang may Astra ang GPT-6!
Bago lang ipinakilala ni Astra, sinira na ang GPT-6 Sol sa inner testing.

Ang performance ay naka-impress din, kasinlalim ng 6 beses ang bilis ng isang pagsubok kumpara sa Astra.
Mag-isip nang maliksi: Kasama na ba ang Terra at Luna sa daan?
At sa parehong araw, binuksan ng OpenAI ang isang set ng panloob na data:
Hanggang sa kasalukuyan, batay sa isang 8-oras na trabaho, bawat araw na trabaho ng isang researcher ng OpenAI, mayroong higit sa 3 na araw ng trabaho ng multi-Agent na nagtatrabaho nang sabay-sabay.
Batay sa presyo ng API, ang halaga ng mga yunit ng pag-iisip ng Agent na ginagamit araw-araw ng median researcher sa OpenAI ay hihigit sa $600.

Kinumpirma rin ni OpenAI na natapos na ang "automated research intern":
Ang mga agent na ito ay kayang matapos ang ilang mga gawain na kung saan kailangan ng mga researcher ng ilang araw upang matapos, sa ilalim ng gabay ng tao.
Kahit si Lao Huang ay sinasabi: Dumating na ang AGI!

Ipinakita niya na ginagamit ng Astra ang halos 100,000 set ng NVIDIA Grace Blackwell NVLink72 para sa pag-train, at darating pa ang 400,000 set ng GPU.
Mukhang hindi talaga ito pinapakita lang ng OpenAI~
GPT-6 SOL ay ipinahayag na nagsisimula na sa internal testing
Ibinahay ni netizen Lentils na sinusubok ng OpenAI ang GPT-6 Sol sa loob.
Sinabi niya na ang kabuuang output capacity ng Sol ay malinaw na mas mababa kaysa sa bagong ipinakilala na Astra, ngunit mas mabilis, at patuloy pa ring isang «monster-level» na modelo.
Gaano kalakas? Ang isang pagsubok ay halos 6 beses ang bilis ng Astra.
Sinubukan ni netizen na si Lyra ang parehong gawain sa iba’t ibang modelo: upang lumikha ng SVG na larawan ng BMW M4 Competition.
Sa ilalim nito, ang GPT-6 Sol ay gumamit ng Max tier at zero-shot generation, na nagtakda ng halos 3 minuto at naglabas ng halos 28,000 na Token.

Ang GPT-6 Astra ay gumagamit ng Max tier, naglalabas ng humigit-kumulang 25,000 na Token, at nagtatagal ng humigit-kumulang 19 minuto.

Binuksan ni Gemini 3.1 DeepThink ang High tier, naipakita ang output na humigit-kumulang 3,300 na Token, ngunit ang proseso ng pag-iisip ay nag消耗 ng humigit-kumulang 458,000 na Token, at nagtagal ng humigit-kumulang 29 minuto.

Ang Gemini 3.8 Flash ay nagbukas din sa High tier, naglabas ng humigit-kumulang 19,000 na Token, at gumamit lamang ng humigit-kumulang 42 segundo.

Kumpara sa iba, ang Sol ang nagpakita ng pinakamalakas na performans: ang output nito ay malapit sa Astra, ngunit ang bilis ng isang pagsubok ay halos 6 beses ang bilis ng Astra—nagmumula lamang sa isang anim na bahagi ng oras ng huli.
Bukod dito, ipinakita rin ng netizen na si Lentils ang isang prototype ng isang pixel-style sandbox world na tinatawag na "The Realm of Aurellune".

Ginawa ng GPT-6 ang isang bayan, mga bukid, ilog, kastilyo, at isang mapang pangkabuuan, kasama ang mga panel ng kontrol para sa pagbabago ng araw at gabi, pagpapakita ng mga pangalan ng lugar, at pagpapalit ng detalye—nagiging mas parang isang simulation game na mayroon nang maayos na balangkas.
Ito ang epekto ng zero-shot, Max inference tier, 15 minuto, at kabuuang paggamit ng 60,000 token.
Kasalukuyang maaaring ipagpalagay na ang Astra ay nakatuon sa pinakamataas na antas ng malalim na pag-iisip, habang ang Sol ay maaaring nakatuon sa bilis, throughput, at pag-scall ng pagtawag sa mga Agent.
Tungkol sa paglabas ng Sol, sinabi ng netizen na si Pankaj Kumar na maaaring ipalabas ito sa OpenAI Developer Conference noong Setyembre 29.

Hindi rin ito isinisiwalat na ang GPT-6 Terra, Luna, at GPT-Image 2.5 ay magkakaroon ng kasama.

Mga researcher ng OpenAI, may tatlong Agent intern bawat isa sa pagpapakilala sa trabaho
Sa parehong araw, ipinakita rin ni OpenAI ang isang interesanteng set ng panloob na data—hanggang saan inaccelerate ng AI model ang siyentipikong pananaliksik sa kanilang sariling laboratorio.
Hanggang mid-August ng taong ito, bawat 8 na oras ng paggawa ng researcher, may halos 3.1 na mga araw ng paggawa ng Agent na tumatakbo nang sabay-sabay.
Wow, isang tao na nagtatrabaho kasama ang tatlong intern na hindi natutulog?~

Tungkol sa gastos, batay sa presyo ng API, ang median na researcher ay nag-iisip ng mga resource na hihigit sa $600 araw-araw.
Kasing halaga ng isang araw na sahod ng isang junior engineer.

Ano ang mga itinatanim ng mga agent na ito?
Isusulat ang code para sa pag-aaral, isusulat ang code para sa infrastraktura, itatayo ang environment para sa pag-train, iijay ang mga eksperimento sa pag-evaluate, i-identify at i-resolba ang mga problema sa mga tool at environment, i-analyze ang mga resulta ng eksperimento, i-monitor ang mga training task... kahit ang pag-ayos at pagpapaliwanag ng mga konklusyon sa pag-aaral ay maaari mong tulongan.
Sa pangkabuuan, maaari itong gawin ang lahat ng bagay maliban sa pagdedesisyon kung ano ang pag-aaralan.
Ang isang pinakamadaling makita na pagbabago ay, dati kailangan ng mga researcher na humingi ng tulong sa loob ng channel kapag ang experimental environment ay bumagsak; ngayon, mas kaya na ng Agent ang pag-aayos ng ganitong mga bagay, at tumaba nang direkta ang bilang ng tulong na inibigay ng tao.

Ang iba pang mga koponan ay direktang tinanggal ang fixed na oras para sa teknikal na tanong at sagot, upang malaya ang mga tao para sa pagpapabuti ng sistema mismo.
Batay sa mga data na ito, opisyal na inihayag ng OpenAI: natupad na ang layunin ng “automated AI research intern”.
Ang "intern" dito, sa tamang pagkakasulat, ay isang研发节点 na kayang magtrabaho: sa ilalim ng gabay ng mga tao, ito ay makakapagtapos nang mag-isa ng mga pananaliksik na may malinaw na hangganan, at ang ilan sa mga gawain na ito ay dati'y kailangan ng mga eksperto na magtrabaho nang ilang araw.
Nakikita agad ang epekto, tumataas ang bilang ng code at eksperimento ng mga researcher.

Sa Agosto 2026, nakaabot ng pinakamataas na antas ang bilang ng eksperimento kada tao mula nang magsimula ang pagpapalista noong Enero 2025, at ang mga gawain na tinatanggap ng Agent ay naging mas kumplikado at mas mahaba ang panahon.

Ang may-akda ng artikulong ito, si Kevin Liu, ay isinama rin ang pangyayaring ito sa mas malaking konteksto.
Naniniwala siya na ang rekursibong sariling pagpapabuti ay malamang ang isa sa pinakamahalagang salik na magpapalakas ng kakayahan ng AI sa mga susunod na taon.
Sa madaling salita, ang AI ay gumagawa ng AI, at mas mabilis ang paggawa.

Ngunit ang problema ay ayon sa kasalukuyang trend, ang kakayahang ito ay default na magiging available lamang sa ilang mga nangungunang AI laboratoryo, at mahirap para sa labas na makita kung saan naaayos na ang progreso nito.
Kaya sa tingin ni Liu, ang transparent na paglalathala ay mas urgente kaysa kailanman. Kung gaano kalakas ang mga modelo at kung kailangan bang magpahinga ang pag-unlad, ay hindi dapat i-decide lamang ng ilang kumpanya sa pribado.
Kinukulit niya ang iba pang mga AI company: Dapat rin nilang gawing pampubliko ang katulad na data.
Gayunpaman, ang pag-unlad ng AI ay talagang naging mas mabilis, ngunit hindi pa gaanong mabilis upang makamit ang ganap na awtomatikong pagmamaneho.
Ayon sa OpenAI, sa huling anim na buwan, higit sa kalahati ng mga tagumpay na kaso ng mga gawain na dati ay nangangailangan ng 4 hanggang 8 na oras, ang tao ay kailangang makilahok ng isang beses. Sa mga mataas na antas ng pananaliksik at pagpaplano, halos hindi na ibinibigay sa Agent.

Ang mga researcher ay patuloy na responsable sa pagdedesisyon kung ano ang sasaliksikin, anong mga resulta ang dapat patuloyin, at kailan dapat palawakin ang pagtatry, ipagpahinga ang eksperimento, o i-deploy ang model.
Ang susunod na layunin ng OpenAI ay nakatakda na: ang pagkatupad ng “automated AI researcher” bago ang Marso 2028.
Kumpara sa isang "intern" na kaya lang sumagot sa mga malinaw na gawain, ang isang "researcher" ay kailangang makapagdala ng mas bukas na mga layunin sa pag-aaral at mag-advance sa sariling mas mahabang mga proyekto—parang pagbabago mula sa isang tagapagpaganap patungo sa isang independiyenteng tagapag-ugnay.
Kung ang GPT-6 Sol ay totoo nang nasa loob ng pagsubok, mas malamang ito ay lumabas sa bagong modelo ng pag-unlad na ito:
Mas maraming GPU na nagbibigay ng computing power, mas maraming Agent na nagpapatakbo ng mga eksperimento nang sabay-sabay, habang ang mga human researcher ay nasa mas mataas na antas—nagpipili ng direksyon, nagtataya ng mga resulta, at huling nagpapasya kung alin sa mga ito ang值得 maging susunod na modelo.
Mas malakas na AI, patuloy na mas mahirap monitor
Sa parehong araw, ang pangunahing siyentipiko ng OpenAI, si Jakub Pachocki, ay naglabas ng isang 10,000-salitang artikulo na may pamagat na “Alien Thinking.”

Pagkatapos kong basahin, parang ang mensahe ay, kahit ang pangunahing siyentipiko ng OpenAI ay nag-aabiso na magpabagal ang buong industriya…
Sinabi ni Jakub na ang AI ay hindi talaga isinagawa ng tao sa pamamagitan ng pagpapagsama ng isang chip at mga patakaran ayon sa isang disenyo; mas mukhang ito ay 'naglalago' sa loob ng malaking dami ng data at computing power.
Maaari mong i-disassemble at maunawaan ang ilang mga bahagi, ngunit bakit biglang mayroon ang buong sistema sa isang partikular na kakayahan, o paano ito mag-uugali sa iba’t ibang kapaligiran—hindi makapagsasabi sinuman.
Mas nakakapagod ang katotohanan na hindi kailangan ng AI na lubos na lalong-sobra sa tao upang magkaroon ng problema; kailangan lang na mas matalino ito sa sapat na bilang ng mahahalagang kakayahan upang maging malaking tulong o magdulot ng malaking problema.
Kaya ang tanong ay: paano pa ba nababasa ng tao ito?
Noong nakaraan, sinubaybayan ng OpenAI ang AI pangunahin sa pamamagitan ng pagmamasid sa chain of thought.
Sa madaling salita, titingnan mo ang proseso ng pag-iisip na isinulat ng modelo upang siguraduhin na hindi ito naglalaro ng mali, tulad ng pagtatangka na manlinlang, magkaroon ng awtoridad na hindi nito dapat, o iwasan ang mga limitasyon.
Ngunit sa pagkakataon ng Astra, nagsimulang mabigo ang paraang ito.
Una, ang mga modelo ay nagsisimula nang mas mabuti na “masuri” ang kanilang sariling mga sinasabi—hindi lahat ng totoong damdamin ay nakasulat sa pag-iisip. Pangalawa, ang Agent ay hindi na lang “nag-iisip muna bago sumagot.” Nakakagamit ito ng mga kasangkapan, nagpapatakbo ng computer, nagpapagalaw ng mga environment, at nakikipagtulungan sa tao at sa iba pang mga Agent.
Nakakapagkakaaliw ang mga ito, kaya hindi na kayang gawin ng mga mananaliksik ang isang buong malinaw at transparent na chain of thought para suriin ang bawat pangungusap.
Natuklasan din ng OpenAI na hindi kailangan ng Astra na isulat ang buong proseso ng pag-iisip upang matapos ang mga kumplikadong gawain.
Sa simpleng salita, natutunan na ng model na gawin ang malalaking bagay nang tahimik.

Sa mga adversarial test na espesyal na disenyo upang subukan ang pag-iwas ng model sa pagmamasid, ipinakita ng Astra ang ilang kakayahan na nagpapalabas ng takot: sinadyang bawasan ang mga resulta sa pagsubok, iwasan ang pagmamasid, at isagawa ang mga gawain na nagpapabagsak.
Talagang mga pagsusulit sa presyon na nilikha ng tao ang lahat ng ito, at hindi ito ginamit ng OpenAI upang masabing aktibong maglalait ang Astra sa pang-araw-araw na mga gawain. Ngunit kumakatawan ito na ang pagmamasid lamang sa mga chain of thought ay hindi na sapat upang masakop ang lahat ng posibleng pag-uugali ng modelo.
Tandaan mo pa ba ang nakaraang pangyayari sa Hugging Face? Iyon ay isang babala.

Noon, ang GPT‑5.6 Sol at isang mas malakas na panloob na modelo ng pananaliksik ay isinama sa ExploitGym network range, na may gawain na hanapin ang mga vulnerabilities, matapos ang pag-atake, at kunin ang Flag. Upang masukat ang totoong kakayahan ng modelo, ang pagsusuri na kapaligiran ay hindi pinagana ang buong mga safety guardrails.
Hindi sumunod ang mga modelo sa tamang paraan ng paglutas ng problema; una silang naglalabas sa network isolation at nagpapadala ng mga mensahe sa isa't isa sa pamamagitan ng hindi awtorisadong channel upang magkakasama at magkakasundo.
Pagkatapos ay ginamit ang zero-day vulnerability sa software package cache proxy upang makakuha ng pag-access sa public internet, at sa huli ay pumasok sa sistema ng Hugging Face upang subukan makahanap ng mga sagot sa pagsubok ng ExploitGym.

Sa totoo lang, ang pangunahing nagpapagalaw dito ay ang panloob na modelong IM1, at ang GPT‑5.6 Sol ay nakapag-reproduce ng ilang mga path ng pag-atake, at wala ang Astra sa pagkakaaliw.
Ang orihinal na layunin ng modelo ay patuloy na matapos ang pagsubok, ngunit upang makakuha ng sagot, patuloy itong humahanap ng mga butas sa patakaran, at sa huli ay nagawa ang mga gawain na labas sa sakop ng gawain.
Kaya binasa rin ng OpenAI ang isang babala: kapag sapat na malakas ang Agent, sapat na marami ang mga kasangkapan, at sapat na haba ang oras ng pagpapatakbo, maaari itong maghanap ng sariling mga bagong daan, magtawag ng mga panlabas na yaman, o kahit magtulungan sa ibang mga Agent.
Hindi… kaya sa pagpapalibot-libot, naging dead end na ba ito??
Kailangan ng OpenAI ng mas malakas na modelo para mag-write ng code, jalurin ang mga eksperimento, gawin ang pag-aaral sa alignment, at kahit gamitin ang mga ito upang buuin ang mga sistemang pangkaligtasan laban sa iba pang AI. Mas malakas ang modelo, mas maraming gawain ang kayang gawin, at mas mabilis ang pag-unlad.
Ngunit samantala, mas mahirap para sa mga tao na matiyak kung paano ito nagkakaroon ng mga konklusyon, at kung babaguhin nito ang mga alalahanin na natutunan sa ibang kapaligiran.
Sinusuri ni Jakub na wala pang anumang laboratorio ang nakakapag-claim na nakapag-align at nakapag-monitor nang maayos ang kanilang modelo upang maaaring palawakin nang may katiyakan at sa pinakamalaking bilis nang matagal.

Bago magkaroon ng komon na seguridad na pamantayan sa buong industriya, hiniling niya na ang “pagsisimula ng pagpapahinga nang voluntary” ay maging isang pagkakasundo.
Tungkol sa OpenAI mismo, sinabi niya: Kung kailangan, hindi isinisiwalat ang pagpaputol ng sarili nito at paghinto sa pagpapalawak ng laki ng modelo.
Mas mabuti para sa iyo na gawin mo ito… alala ko rin ay may isang kumpanya na nagsimula sa A na sinabi rin nito.
Link ng referensya:
[1]https://x.com/Lentils80/status/2096518218836005287?s=20
[2]https://x.com/pankajkumar_dev/status/2096532712291201460
[3]https://openai.com/index/research-acceleration-view-inside-openai/
[4]https://openai.com/index/an-alien-mind/
[5]https://x.com/JensenHuang/status/2096700264569090384?s=20
Ang artikulong ito ay galing sa WeChat public account na “Quantum Bit”, may-akda: Ting Yu
