source avatarsleepy.md

I-share

Ang "innovation" na ito ng OpenAI Astra, ginawa na ng ByteDance noong nakaraang taon. Ang path na ito ay tinatawag na recurrent depth. Sa simpleng salita, hindi na ito nakabatay sa paggawa ng mas mahabang CoT para mag-isip nang higit pa, kundi pinapagana ang parehong grupo ng Transformer block na umuulit sa hidden state, upang ilagay ang higit pang computation sa latent space. Para sa mas mahirap na problema, maraming round; para sa mas simpleng tanong, umalis nang maaga. Hindi kailangan lumaki ang mga parameter kasabay ng depth ng inference, at ang test-time compute ay maaaring mas flexible na ma-allocate. Noong Oktubre ng nakaraang taon, binuksan at inilabas ng ByteDance Seed ang Ouro, na nagawa ang Looped Language Model. Ang Ouro-1.4B at 2.6B ay direktang nagdagdag ng iterative latent reasoning sa pre-training, at ang 2.6B ay default na gumagawa ng maraming round ng recurrent computation, habang sumusuporta rin sa adaptive exit, kung saan ang bawat tanong ay magpapasya kung ilang round ang kailangan. Noong nakaraang taon, ito ay isang simpleng branch na pinatotohanan ng ByteDance gamit ang maliit na model; ngayon, ito ay inilagay ng OpenAI sa kanilang pinakamoderno na model. Ibig sabihin nito ay maaaring hindi na lamang isang akademikong "interesante" na disenyo ang recurrent depth, kundi unti-unting naging totoong engineering path para sa susunod na henerasyon ng malalaking model. At ang mga problema na dinala nito ay mas komplikado kaysa sa benchmark. Noong nakaraan, ang pagpapalawak ng reasoning model ay maraming computation na isinulat sa CoT. Mas mahaba ang pag-iisip ng model, mas marami ang reasoning tokens na inilabas. Bagaman ang CoT ay hindi katumbas ng buong internal state ng model, kung gayon ay nagiging isang ligtas na window para sa monitoring. Ang recurrent depth ay magpapatuloy na ililipat ang computation pabalik sa latent space. Ang parehong grupo ng parameter ay maaaring umuulit maraming beses sa hidden state, at ang model ay nagsagawa na ng malaking bilang ng computation sa loob, at sa huli ay kailangan lang maglabas ng maikling teksto. Kaya may lumabas na isang praktikal na tanong: Ang lugar kung saan natatapos ng model ang pag-iisip ay unti-unting lumalayo sa natural language. Ito ang pangunahing pag-aalala ng mga mananaliksik tungkol sa Astra. Noong nakaraan, napakahalaga ng OpenAI sa Chain-of-Thought monitoring, dahil kung handa ang model na mag-cheat, reward hack, o iwasan ang mga patakaran, minsan ay unang ipapakita nito ang kanyang intensyon sa CoT. Ngunit kung mas maraming reasoning ang nangyayari sa latent state, ano pa ang maaaring i-monitor? Ayon sa mga ulat, limitahan na mismo ng OpenAI ang paggamit ng recurrent depth sa Astra upang panatilihin ang higit pang readable na CoT, habang idinadagdag pa ang internal state at behavior monitoring. Ang bagay na ito ay talagang interesante. Sa nakaraang ilang taon, madaling maintindihan ang landas ng pagpapalawak ng reasoning ng malalaking model: bigyan ito ng higit pang token at hayaan itong magsalita nang higit pa. Sa susunod, maaaring bigyan ito ng higit pang internal loop—ngunit hindi kailangan nito na ipaalam sa iyo ang mga proseso nito.

Disclaimer: Ang information sa page na ito ay maaaring nakuha mula sa mga third party at hindi necessary na nagre-reflect sa mga pananaw o opinyon ng KuCoin. Ibinigay ang content na ito para sa mga pangkalahatang informational purpose lang, nang walang anumang representation o warranty ng anumang uri, at hindi rin ito dapat ipakahulugan bilang financial o investment advice. Hindi mananagot ang KuCoin para sa anumang error o omission, o para sa anumang outcome na magreresulta mula sa paggamit ng information na ito. Maaaring maging risky ang mga investment sa mga digital asset. Pakisuri nang maigi ang mga risk ng isang produkto at ang risk tolerance mo batay sa iyong sariling kalagayang pinansyal. Para sa higit pang information, mag-refer sa aming Terms ng Paggamit at Disclosure ng Risk.