OpenScience、Terminal-Bench Scienceで75.7%を達成し、Codexを上回る

iconKuCoinFlash
共有
AI summary icon概要
Y Combinator 2026年冬期バッチのスタートアップSynthetic Sciencesの研究エージェントであるOpenScienceは、Terminal-Bench Scienceで75.7%のスコアを記録し、Codexを上回りました。このツールは実験を自動化し、コードを記述し、科学データベースを利用します。Autoresearch機能により、反復的なテストが可能になります。オンチェーンのニュースでは、AI駆動の研究ツールへの関心が高まっていることが示されています。インフレーションデータは、マクロトレンドを追跡する投資家にとって重要な指標です。
ME AIのニュースによると、Y Combinator 2026年冬期バッチ(YC W26)の企業Synthetic Sciencesが、オープンソースの科学研究エージェント「OpenScience」を正式にリリースしました。OpenScienceは論文の検索、データ処理、コード作成、科研データベースの呼び出しを実行でき、新たに追加されたAutoresearch機能により、AIが自ら連続して実験を実行できます。 たとえばモデルを訓練する場合、研究者は「検証セットのlossを下げて」と指示するだけで済みます。OpenScienceはまずベースラインを実行し、その後自ら改良案を提案して実験を段階的に実施します。結果が改善すればその変更を保持し、悪化すれば元に戻し、前回の結果に基づいて次に試す方法を決定します。ユーザーは実行回数や総実行時間、停止条件を事前に制限することもでき、「次は最適化手法のみを変更する」などと指定することも可能です。 OpenScienceは、研究者が繰り返し監視していた実験の反復プロセス——案の提案、実験の実行、指標の比較、失敗案の排除、次のサイクルへの移行——を自動化します。実験はローカルで実行できるほか、リモートGPU、SSHサーバー、Slurm/PBSクラスタにも委託できます。各実験サイクルのコード、結果、判断はすべて記録され、後で確認・検証が容易です。 また、OpenScienceはChatGPT/Codexのサブスクリプションに直接ログインできるほか、独自のAPIキー、ローカルモデルの接続、または公式が提供する従量課金制のAceも利用可能です。 公式によるテストでは、OpenScienceは70問のTerminal-Bench Scienceタスクのうち53問を完了し、75.7%のスコアを記録しました。対照的に、Codex + GPT-6 Astraの公開スコアは68.1%です。 (出典:BlockBeats)
免責事項: 本ページの情報はサードパーティからのものであり、必ずしもKuCoinの見解や意見を反映しているわけではありません。この内容は一般的な情報提供のみを目的として提供されており、いかなる種類の表明や保証もなく、金融または投資助言として解釈されるものでもありません。KuCoinは誤記や脱落、またはこの情報の使用に起因するいかなる結果に対しても責任を負いません。 デジタル資産への投資にはリスクが伴います。商品のリスクとリスク許容度をご自身の財務状況に基づいて慎重に評価してください。詳しくは利用規約およびリスク開示を参照してください。