OpenScience logra un 75,7 % en Terminal-Bench Science, superando a Codex

iconKuCoinFlash
Compartir
AI summary iconResumen
OpenScience, un agente de investigación de la startup Synthetic Sciences del lote de invierno 2026 de Y Combinator, obtuvo un 75,7% en Terminal-Bench Science, superando a Codex. La herramienta automatiza experimentos, escribe código y utiliza bases de datos científicas. Su función Autoresearch permite pruebas iterativas. Las noticias on-chain muestran un creciente interés en herramientas de investigación impulsadas por IA. Los datos de inflación siguen siendo una métrica clave para los inversores que siguen tendencias macroeconómicas.
ME AI Mensaje: La empresa Synthetic Sciences, parte de la cohorte de invierno de Y Combinator 2026 (YC W26), ha lanzado oficialmente OpenScience, un agente científico de código abierto. Puede buscar artículos académicos, procesar datos, escribir código y acceder a bases de datos científicas. La nueva función Autoresearch permite que la IA ejecute experimentos de forma continua por sí misma. Por ejemplo, para entrenar un modelo, el investigador solo necesita decir: "Reduce la pérdida en el conjunto de validación". OpenScience primero ejecutará una línea base, luego propondrá modificaciones por sí mismo y llevará a cabo experimentos en ciclos sucesivos. Si los resultados mejoran, se conservan; si empeoran, se revertirán, y según los resultados anteriores, decidirá qué probar a continuación. Los usuarios también pueden establecer previamente límites en el número de ejecuciones, la duración total y las condiciones de detención, o especificar: "Sólo modifica el optimizador a partir de ahora". OpenScience automatiza la iteración experimental que antes requería que los investigadores supervisaran constantemente: proponer soluciones, ejecutar experimentos, comparar métricas, descartar soluciones fallidas y continuar con el siguiente ciclo. Los experimentos pueden ejecutarse en la máquina local o asignarse a servidores GPU remotos, servidores SSH y clústeres Slurm/PBS. Cada ciclo de experimento registra el código, los resultados y las decisiones tomadas, facilitando su revisión posterior. Además, admite el inicio de sesión directo con suscripciones a ChatGPT/Codex, así como la integración con claves de API propias, modelos locales o el servicio oficial de pago por uso Ace. En pruebas internas, OpenScience completó 53 de 70 tareas de Terminal-Bench Science, obteniendo un puntaje del 75,7%. Para comparación, el rendimiento público de Codex + GPT-6 Astra es del 68,1%. (Fuente: BlockBeats)
Descargo de responsabilidad: La información contenida en esta página puede proceder de terceros y no refleja necesariamente los puntos de vista u opiniones de KuCoin. Este contenido se proporciona solo con fines informativos generales, sin ninguna representación o garantía de ningún tipo, y tampoco debe interpretarse como asesoramiento financiero o de inversión. KuCoin no es responsable de ningún error u omisión, ni de ningún resultado derivado del uso de esta información. Las inversiones en activos digitales pueden ser arriesgadas. Evalúa con cuidado los riesgos de un producto y tu tolerancia al riesgo en función de tus propias circunstancias financieras. Para más información, consulta nuestras Condiciones de uso y la Declaración de riesgos.