OpenScience 在 Terminal-Bench 科學測試中取得 75.7% 成績,表現優於 Codex

iconKuCoinFlash
分享
AI summary icon精華摘要
OpenScience 是 Y Combinator 2026 年冬季批次初創公司 Synthetic Sciences 的研究代理,在 Terminal-Bench Science 中取得 75.7% 的分數,表現優於 Codex。該工具可自動進行實驗、撰寫程式碼並使用科學資料庫,其 Autoresearch 功能支援迭代測試。鏈上新聞顯示,市場對 AI 驅動的研究工具興趣日益增加。通膨數據仍是投資者追蹤宏觀趨勢的關鍵指標。
ME AI 消息,Y Combinator 2026 冬季批次(YC W26)公司 Synthetic Sciences 正式發布開源科研 Agent OpenScience。它能查詢論文、處理數據、寫代碼和調用科研數據庫,新加入的 Autoresearch 還能讓 AI 自己連續跑實驗。 比如訓練一個模型,研究者只需要告訴它「把驗證集 loss 降下來」。OpenScience 會先跑基線,再自己提出修改方案,一輪輪執行實驗。結果變好就保留,變差就回退,再根據前面的結果決定下一步試什麼。用戶也可以提前限制運行次數、總時長和停止條件,或者規定「接下來只改優化器」。 OpenScience 把原本需要研究者反覆盯著做的實驗迭代自動化了:提出方案、執行實驗、比較指標、淘汰失敗方案,再繼續下一轮。實驗可以在本機運行,也可以交給遠程 GPU、SSH 伺服器和 Slurm/PBS 集群。每輪實驗的代碼、結果和判斷都會留下記錄,方便後續檢查。 它還支援直接登入 ChatGPT/Codex 訂閱,也可以接入自己的 API 密鑰、本地模型,或使用官方按量付費的 Ace。 官方自測中,OpenScience 在 70 道 Terminal-Bench Science 任務中完成 53 道,得分 75.7%。作為對比,Codex + GPT-6 Astra 的公開成績為 68.1%。 (來源:BlockBeats)
免責聲明:本頁面資訊可能來自第三方,不一定反映KuCoin的觀點或意見。本內容僅供一般參考之用,不構成任何形式的陳述或保證,也不應被解釋為財務或投資建議。 KuCoin 對任何錯誤或遺漏,或因使用該資訊而導致的任何結果不承擔任何責任。 虛擬資產投資可能存在風險。請您根據自身的財務狀況仔細評估產品的風險以及您的風險承受能力。如需了解更多信息,請參閱我們的使用條款和風險披露 。