Inayos ng OpenAI ang mga datos sa pagtataya ng GPT-6 Astra, nagdudulot ng mga alalahanin tungkol sa transparensya

icon MarsBit
I-share
AI summary iconSummary
Ipinagbago ng OpenAI ang data sa pagtataya ng GPT-6 Astra, na nagdulot ng mga alalahanin tungkol sa transparensya. Bumaba ang rate ng hallucination ng Astra mula sa 4.2% patungo sa 2%, habang bumaba ang mga marka sa matematika ng mga kompetidor tulad ng Anthropic at GPT-5.6 Sol. Sinasabi ng OpenAI na ang mga pagbabago ay nagpapakita ng akuratong performance, ngunit babala ang mga siyentipiko sa Stanford tungkol sa “benchmaxxing.” Habang tumataas ang populasyon ng mga altcoin na dapat subaybayan sa gitna ng mga pagbabago sa merkado, mahalaga pa rin ang tiyak na data. Ang mga trend sa impormasyon ng inflasyon ay nagpapakita rin ng pangangailangan para sa malinaw at maaaring muling ipakita ang mga benchmark sa sektor ng AI at crypto.

Ang Beating AI News Flash ay nag-uulat na mula nang ipaglaban ni OpenAI ang GPT-6 Astra noong Setyembre 3, patuloy na binabago ang mga datos ng mga benchmark ng pag-e-evaluate, kung saan ang ilang pagbabago ay nagpapabuti sa pagganap ng Astra, samantalang ang ilang mga modelo ng kalaban ay nagkakaroon ng pagbaba sa kanilang mga resulta, na nagdulot ng mga tanong mula sa labas tungkol sa "score manipulation" at transparensya ng pag-e-evaluate. Sa partikular, ang rate ng hallucination ng Astra ay binalik mula sa 4.2% pababa sa 2%, habang ang GPT-5.6 Sol ay bumaba mula sa 12.2% hanggang 9.4%, ngunit pareho ay bumalik sa 4.2% at 12.2%. Sa matematikal na pag-e-evaluate, ang marka ng Fable 5.1 ng Anthropic ay bumaba mula sa 87.8% hanggang 78%, at ngayon ay bumalik na sa 83%; samantala, ang GPT-5.6 Sol ay bumaba mula sa 83% hanggang 80.5%, at bumalik din sa 83%. Bukod dito, ang resulta ng Astra sa ARC-AGI-3 benchmark ay tumaas mula sa 98.6% sa draft na bersyon bago ang paglaban, hanggang sa 99.99% sa pinal na pahina, at ang kanyang resulta sa programming benchmark ay maliit na tumaas mula sa 57.7% hanggang 57.9%. Sinabi ni OpenAI na ang mga resulta ng pag-e-evaluate ay maaapektuhan ng bersyon ng modelo, konpigurasyon ng mga kasangkapan, antas ng pag-iisip, at mga pagpapatakbo ng pagsusulit, at ang mga pagbabagong ito ay ginawa upang siguraduhing mas tumpak na ipinapakita ng datos ang pinakamahusay na pagganap ng modelo. Gayunpaman, naniniwala ang mga siyentipiko ng Stanford University na ang madalas na pagpapatakbo muli ng mga benchmark ay maaaring magkakaroon ng "Benchmaxxing"—o pagpapalaki ng mga marka sa benchmark sa pamamagitan ng pagbabago ng mga kondisyon ng pagsusulit. Sinabi ng mga eksperto sa industriya na habang lumalalim ang kompetisyon sa mga AI model, ang mga datos ng benchmark ay naging mahalagang kasangkapan upang masukat ang kakayahan ng modelo at makipagkompetensya sa merkado, at ang pagpapabuti sa transparensya at reproducibility ng mga benchmark ay nagsisimulang makuha ang mas maraming pansin.

Disclaimer: Ang information sa page na ito ay maaaring nakuha mula sa mga third party at hindi necessary na nagre-reflect sa mga pananaw o opinyon ng KuCoin. Ibinigay ang content na ito para sa mga pangkalahatang informational purpose lang, nang walang anumang representation o warranty ng anumang uri, at hindi rin ito dapat ipakahulugan bilang financial o investment advice. Hindi mananagot ang KuCoin para sa anumang error o omission, o para sa anumang outcome na magreresulta mula sa paggamit ng information na ito. Maaaring maging risky ang mga investment sa mga digital asset. Pakisuri nang maigi ang mga risk ng isang produkto at ang risk tolerance mo batay sa iyong sariling kalagayang pinansyal. Para sa higit pang information, mag-refer sa aming Terms ng Paggamit at Disclosure ng Risk.