OpenScience alcança 75,7% no Terminal-Bench Science, superando o Codex

iconKuCoinFlash
Compartilhar
AI summary iconResumo
OpenScience, um agente de pesquisa da startup Synthetic Sciences, da turma de inverno de 2026 da Y Combinator, obteve 75,7% no Terminal-Bench Science, superando o Codex. A ferramenta automatiza experimentos, escreve código e utiliza bancos de dados científicos. Seu recurso Autoresearch permite testes iterativos. Notícias on-chain mostram crescente interesse em ferramentas de pesquisa impulsionadas por IA. Os dados de inflação permanecem como uma métrica-chave para investidores que acompanham tendências macroeconômicas.
ME AI mensagem: a empresa Synthetic Sciences, da turma de inverno de 2026 do Y Combinator (YC W26), lançou oficialmente o Agente Científico OpenSource de código aberto. Ele pode pesquisar artigos, processar dados, escrever código e acessar bancos de dados científicos; o novo recurso Autoresearch permite que a IA execute experimentos automaticamente em sequência. Por exemplo, ao treinar um modelo, o pesquisador apenas precisa dizer: “reduza a perda no conjunto de validação”. O OpenScience primeiro executa uma linha de base, depois propõe e executa modificações em ciclos. Se os resultados melhorarem, mantém as alterações; se piorarem, reverte e decide o próximo passo com base nos resultados anteriores. Os usuários também podem definir limites antecipados para número de execuções, duração total e condições de parada, ou especificar: “a partir de agora, modifique apenas o otimizador”. O OpenScience automatiza a iteração experimental que antes exigia atenção constante do pesquisador: propor soluções, executar experimentos, comparar métricas, descartar soluções falhas e continuar para a próxima rodada. Os experimentos podem ser executados localmente ou enviados para GPUs remotas, servidores SSH e clusters Slurm/PBS. Cada rodada registra o código, os resultados e as decisões tomadas, facilitando auditorias posteriores. Ele também suporta login direto com assinaturas do ChatGPT/Codex, além de integração com sua própria chave API, modelos locais ou uso do Ace da plataforma com pagamento por uso. Nos testes internos da equipe oficial, o OpenScience completou 53 das 70 tarefas do Terminal-Bench Science, obtendo pontuação de 75,7%. Para comparação, o desempenho público do Codex + GPT-6 Astra é de 68,1%. (Fonte: BlockBeats)
Aviso legal: as informações nesta página podem ter sido obtidas de terceiros e não refletem necessariamente os pontos de vista ou opiniões da KuCoin. Este conteúdo é fornecido apenas para fins informativos gerais, sem qualquer representação ou garantia de qualquer tipo, nem deve ser interpretado como aconselhamento financeiro ou de investimento. A KuCoin não é responsável por quaisquer erros ou omissões, ou por quaisquer resultados do uso destas informações. Os investimentos em ativos digitais podem ser arriscados. Avalie cuidadosamente os riscos de um produto e a sua tolerância ao risco com base nas suas próprias circunstâncias financeiras. Para mais informações, consulte nossos termos de uso e divulgação de risco.