Natamo ng OpenScience ang 75.7% sa Terminal-Bench Science, lalong naging mas mataas kaysa sa Codex

iconKuCoinFlash
I-share
AI summary iconSummary
Ang OpenScience, isang research agent mula sa startup na Synthetic Sciences sa Y Combinator 2026 Winter Batch, ay nakakuha ng 75.7% sa Terminal-Bench Science, na higit sa Codex. Ang tool ay awtomatikong nagpapatakbo ng mga eksperimento, sumusulat ng code, at gumagamit ng mga scientific database. Ang tampok na Autoresearch nito ay nagpapahintulot sa iteratibong pagsubok. Ang on-chain news ay nagpapakita ng tumataas na interes sa AI-driven na mga tool para sa pananaliksik. Ang impormasyon tungkol sa inflasyon ay patuloy na isang pangunahing metrikang sinusubaybayan ng mga investor para sa mga makro trend.
ME AI mensahe, ang Synthetic Sciences, isang kumpanya sa Y Combinator 2026 Winter Batch (YC W26), ay opisyal na ipinakilala ang open-source na siyentipikong Agent na OpenScience. Kaya nito ang paghahanap ng mga papel, pagproseso ng data, pagsusulat ng code, at paggamit ng siyentipikong database; ang bagong idinagdag na Autoresearch ay nagpapahintulot sa AI na magpapatuloy na mag-run ng mga eksperimento. Halimbawa, kapag tinuturuan ang isang model, ang isang mananaliksik ay kailangan lang sabihin sa ito, “Bawasan ang validation set loss.” Ang OpenScience ay magpapatakbo muna ng baseline, pagkatapos ay magpapropose ng sariling mga pagbabago, at magpapatuloy na mag-execute ng mga eksperimento. Kung mas mainam ang resulta, ito ay iiwan; kung mas masama, babalik sa dating bersyon, at batay sa mga nakaraang resulta, pipili ng susunod na gagawin. Maaari ring magbigay ang user ng mga limitasyon sa bilang ng pagpapatupad, kabuuang oras, at mga kondisyon para sa paghinto, o maaari ring tukuyin ang “Sundin lamang ang pagbabago sa optimizer.” Ang OpenScience ay awtomatiko ang pag-uulit ng eksperimento na karaniwang nangangailangan ng patuloy na pagmamasid mula sa mananaliksik: pagpapropose ng plano, pagpapatupad ng eksperimento, paghahambing ng mga indikador, pag-alis ng mga nabigo, at pagpapatuloy sa susunod na siklo. Maaaring tumakbo ang mga eksperimento sa lokal na machine o isaalang-alang ang remote GPU, SSH server, at Slurm/PBS cluster. Ang code, resulta, at desisyon bawat siklo ay iiwan bilang rekord para sa madaling pagsusuri. Sumusuporta rin ito sa direkta na login sa ChatGPT/Codex subscription, maaari ring i-integrate ang sariling API Key, lokal na model, o gamitin ang opisyal na bayad-per-use na Ace. Ayon sa pagsusuri ng tagapaglikha, natapos ng OpenScience ang 53 sa 70 na Terminal-Bench Science tasks, na may marka na 75.7%. Bilang komparasyon, ang publikong resulta ng Codex + GPT-6 Astra ay 68.1%. (Source: BlockBeats)
Disclaimer: Ang information sa page na ito ay maaaring nakuha mula sa mga third party at hindi necessary na nagre-reflect sa mga pananaw o opinyon ng KuCoin. Ibinigay ang content na ito para sa mga pangkalahatang informational purpose lang, nang walang anumang representation o warranty ng anumang uri, at hindi rin ito dapat ipakahulugan bilang financial o investment advice. Hindi mananagot ang KuCoin para sa anumang error o omission, o para sa anumang outcome na magreresulta mula sa paggamit ng information na ito. Maaaring maging risky ang mga investment sa mga digital asset. Pakisuri nang maigi ang mga risk ng isang produkto at ang risk tolerance mo batay sa iyong sariling kalagayang pinansyal. Para sa higit pang information, mag-refer sa aming Terms ng Paggamit at Disclosure ng Risk.