OpenScience obtient 75,7 % sur Terminal-Bench Science, surpassant Codex

iconKuCoinFlash
Partager
AI summary iconRésumé
OpenScience, un agent de recherche issu de la startup Synthetic Sciences, issue de la cohorte hiver 2026 de Y Combinator, a obtenu 75,7 % sur Terminal-Bench Science, surpassant Codex. L'outil automatise les expériences, écrit du code et utilise des bases de données scientifiques. Sa fonction Autoresearch permet des tests itératifs. Les nouvelles sur chaîne révèlent un intérêt croissant pour les outils de recherche pilotés par l'IA. Les données sur l'inflation restent une métrique clé pour les investisseurs suivant les tendances macroéconomiques.
ME AI : La société Synthetic Sciences, membre de la cohorte hiver 2026 de Y Combinator (YC W26), lance officiellement OpenScience, un agent scientifique open source. Il peut rechercher des articles, traiter des données, écrire du code et appeler des bases de données scientifiques. Le nouveau module Autoresearch permet à l'IA d'exécuter automatiquement des expériences en chaîne. Par exemple, pour entraîner un modèle, un chercheur n'a qu'à dire : « Réduisez la perte sur l'ensemble de validation ». OpenScience lancera d'abord une ligne de base, puis proposera automatiquement des modifications, exécutera des expériences en boucle, conservera les améliorations, annulera les dégradations et décidera des prochaines étapes en fonction des résultats précédents. Les utilisateurs peuvent également définir à l'avance des limites de nombre d'essais, de durée totale et de conditions d'arrêt, ou imposer des contraintes comme « Modifiez uniquement l'optimiseur à partir de maintenant ». OpenScience automatisera les itérations expérimentales qui nécessitaient auparavant une surveillance constante de la part des chercheurs : proposer une solution, exécuter l'expérience, comparer les indicateurs, éliminer les échecs et passer à la prochaine itération. Les expériences peuvent être exécutées localement ou déléguées à des GPU distants, des serveurs SSH ou des clusters Slurm/PBS. Chaque itération enregistre le code, les résultats et les décisions prises, facilitant les vérifications ultérieures. Il prend en charge la connexion directe aux abonnements ChatGPT/Codex, ainsi que l'intégration de votre propre clé API, de modèles locaux ou de l'offre payante à l'utilisation Ace proposée officiellement. Dans les tests internes, OpenScience a accompli 53 tâches sur 70 du Terminal-Bench Science, avec un score de 75,7 %. À titre de comparaison, le score public de Codex + GPT-6 Astra est de 68,1 %. (Source : BlockBeats)
Clause de non-responsabilité : les informations sur cette page peuvent avoir été obtenues auprès de tiers et ne reflètent pas nécessairement les points de vue ou opinions de KuCoin. Ce contenu est fourni à titre informatif uniquement, sans aucune représentation ou garantie d’aucune sorte, et ne doit pas être interprété comme un conseil en investissement. KuCoin ne sera pas responsable des erreurs ou omissions, ni des résultats résultant de l’utilisation de ces informations. Les investissements dans les actifs numériques peuvent être risqués. Veuillez évaluer soigneusement les risques d’un produit et votre tolérance au risque en fonction de votre propre situation financière. Pour plus d’informations, veuillez consulter nos conditions d’utilisation et divulgation des risques.