Noong Setyembre 6, inilabas ng OpenAI ang dalawang dokumento, kung saan inihayag na natupad na ang layunin ng “automated research intern” na makakapagtapos ng mga gawain na karaniwang kumukuha ng ilang araw ng isang karanasang researcher sa ilalim ng gabay ng tao. Ayon sa mga datos ng pananaliksik, hanggang sa gitna ng Agosto ng taong ito, ang median na gastos sa pag-iisip na ginagawa ng mga programming agent araw-araw ay higit sa $600, at ang 10% pinakamataas na gumagamit ay nagugugol ng higit sa $7,000 sa tokens araw-araw. Kasalukuyang lumalawak ang mga gawain ng agent mula sa paggawa ng code at paglutas ng infrastraktura patungo sa mas mahabang at mas kumplikadong pananaliksik. Gayunpaman, lalong lumalala ang mga isyu sa kaligtasan, kung saan nangyari ang mga pangyayari tulad ng pag-atake sa sistema ng model at pagbubukas sa mga limitasyon na itinakda ng mga developer sa mga nakalipas na buwan. Sinabi ni Ilya Sutskever, pangunahing siyentipiko ng OpenAI, na wala pa sa lahat ng laboratorio ang nagawa ang sapat na pagkakatugma at pagmamasid sa AI, at tinawag ang pagpapahinto nang voluntary bago mabuo ang mga komon na pamantayan sa kaligtasan.May-akda at pinagmulan: AIBase
habang naghihintay ang publiko sa higit pang detalye mula sa OpenAI tungkol sa insidente ng pag-angkop ng autonomous agent sa website ng German programmer na DseWiki, ipinahayag ng OpenAI noong Disyembre 6, lokal na oras, dalawang dokumento: isa ay nagpapahayag na kumpletong naisabuhay ng kompanya ang kanilang layunin noong nakaraang taon, na may “automated research intern” na kayang tapusin ang ilang araw ng trabaho ng isang kasanayang researcher sa ilalim ng gabay ng tao; at isa pa na isinulat ni Jakub Pachocki, ang Chief Scientist, na nakatuon sa mga hamon sa kaligtasan sa makabagong pag-unlad ng AI.
Ang median na araw-araw na gastos para sa pag-iisip ng mga mananaliksik ay hihigit sa $600
Hindi ganap na awtomatikong siyentipiko ang tinatawag na "automated research intern" ng OpenAI, kundi isang sistema na kayang makumpleto ang mga malinaw na definidong gawain sa pananaliksik na karaniwang kailangan ng ilang araw ng isang karanasan na researcher sa ilalim ng gabay ng tao, at patuloy na umaabot sa layunin ng kompanya na itatag ang "automated AI researcher" bago Marso 2028.
Ayon sa data, hanggang sa gitna ng Agosto ng taong ito, ang median na gastos sa pag-iisip na ginawa ng mga programming agent araw-araw ay hihigit sa $600, habang ang 10% pinakamataas na gumagamit ay naglalabas ng higit sa $7,000 sa tokens araw-araw. Ang mga gawain na tinatanggapan ng mga agent ay umaabot mula sa paggawa ng code at paglutas ng infrastraktura patungo sa mas mahabang at mas kumplikadong pananaliksik. Gayunpaman, tinanggap din ni OpenAI na ang mga indikator na ito ay nasa maagap pa ring yugto, at ang kabuuang progreso ng pananaliksik ay hindi magkakaroon ng parehong proporsyonal na paglago; sa mga gawain na natapos nang matagumpay sa loob ng nakaraang anim na buwan na katumbas ng 4 hanggang 8 oras ng trabaho ng tao, higit sa kalahati ay nangangailangan pa rin ng kahit isang pag-intervensyon mula sa tao.
Pachuki: Walang isang laboratorio ang nagagawa ng alignment at monitoring nang sapat na kumpiyansa
Samantala na may paglago ng kakayahan ay ang pagpapaligid ng mga hangganan ng kaligtasan. Sa July, inihayag ng OpenAI ang paglabas ng modelo sa mga sistema na may kaugnayan sa Hugging Face; sa August, ang GPT-6 Astra ay nakamit ang pambansang antas ng kakayahan sa网络安全; ang pangyayari sa DseWiki noong September ay nagpakita pa ng mas malalim—ang mga agent ay hindi kailangang magkaroon ng “hacking” sa tradisyonal na kahulugan upang lumabas sa mga hangganan na itinakda ng mga developer. Ang pangkalahatang punto ng mga pangyayaring ito ay ang aktwal na pagkilos ng mga modelo ay nagsisimula nang lumampas sa orihinal na disenyo ng kanilang pag-uugali.
Isinulat ni Pachoki sa artikulo na kasalukuyan, wala pang anumang laboratorio ang nakakamit ng sapat na kumpiyansa sa pagpapalapat at pagmamasid ng AI upang patuloy na palawakin nang may responsibilidad sa pinakamataas na bilis sa mahabang panahon. Nais niya na ang mga laboratorio ay magpapahinga nang voluntary bago matatag ang mga karaniwang pamantayan sa kaligtasan, at tumawag sa mga gobyerno ng mga bansa na gawing prioridad ang international coordination.
