OpenScience показала 75,7% на Terminal-Bench Science, превзойдя Codex

iconKuCoinFlash
Поделиться
AI summary iconСводка
OpenScience, исследовательский агент от стартапа Synthetic Sciences, участника зимнего набора Y Combinator 2026, показал результат 75,7% на Terminal-Bench Science, превзойдя Codex. Инструмент автоматизирует эксперименты, пишет код и использует научные базы данных. Его функция Autoresearch позволяет проводить итеративное тестирование. Ончейн-новости демонстрируют растущий интерес к инструментам исследований на основе ИИ. Данные по инфляции остаются ключевым показателем для инвесторов, отслеживающих макроэкономические тренды.
ME AI сообщает: компания Synthetic Sciences, участник зимнего набора Y Combinator 2026 (YC W26), официально выпустила открытый научный агент OpenScience. Он может искать научные статьи, обрабатывать данные, писать код и взаимодействовать с научными базами данных. Новая функция Autoresearch позволяет ИИ самостоятельно запускать серию экспериментов. Например, при обучении модели исследователю достаточно сказать: «Снизь loss на валидационном наборе». OpenScience сначала запустит базовую модель, затем самостоятельно предложит улучшения и последовательно проведёт эксперименты. Если результат улучшается — изменения сохраняются, если ухудшается — откатываются, а следующий шаг определяется на основе предыдущих результатов. Пользователь может заранее задать ограничения: максимальное количество попыток, общее время выполнения и условия остановки, либо указать, например: «Далее меняй только оптимизатор». OpenScience автоматизирует цикл экспериментов, который раньше требовал постоянного внимания исследователя: формулирование гипотез, запуск экспериментов, сравнение метрик, отбраковка неудачных вариантов и переход к следующему циклу. Эксперименты можно запускать как локально, так и на удалённых GPU, SSH-серверах или кластерах Slurm/PBS. Код, результаты и решения каждого эксперимента сохраняются для последующего анализа. Также поддерживается прямая интеграция с подписками ChatGPT/Codex, подключение собственного ключа API, локальных моделей или использование официальной платформы Ace по принципу «оплата за использование». В собственных тестах OpenScience справился с 53 из 70 задач Terminal-Bench Science, набрав 75,7%. Для сравнения: публичный результат Codex + GPT-6 Astra составляет 68,1%. (Источник: BlockBeats)
Отказ от ответственности: Информация на этой странице может быть получена от третьих лиц и не обязательно отражает взгляды или мнения KuCoin. Данный контент предоставляется исключительно в общих информационных целях, без каких-либо заверений или гарантий, а также не может быть истолкован как финансовый или инвестиционный совет. KuCoin не несет ответственности за ошибки или упущения, а также за любые результаты, полученные в результате использования этой информации. Инвестиции в цифровые активы могут быть рискованными. Пожалуйста, тщательно оценивайте риски, связанные с продуктом, и свою устойчивость к риску, исходя из собственных финансовых обстоятельств. Для получения более подробной информации, пожалуйста, ознакомьтесь с нашими Условиями использования и Уведомлением о риске.