OpenScience досягла 75,7% на Terminal-Bench Science, перевершивши Codex

iconKuCoinFlash
Поділитися
AI summary iconКороткий зміст
OpenScience, дослідницький агент від стартапу Synthetic Sciences з зимового набору Y Combinator 2026, набрав 75,7% на Terminal-Bench Science, перевершивши Codex. Інструмент автоматизує експерименти, пише код і використовує наукові бази даних. Його функція Autoresearch дозволяє проводити ітеративне тестування. Новини у блокчейні свідчать про зростаючий інтерес до інструментів досліджень на основі ШІ. Дані про інфляцію залишаються ключовим показником для інвесторів, які стежать за макротрендами.
ME AI повідомлення: компанія Synthetic Sciences, учасниця зимового набору Y Combinator 2026 (YC W26), офіційно запустила відкритий науковий агент OpenScience. Він може шукати наукові статті, обробляти дані, писати код і викликати наукові бази даних; нова функція Autoresearch дозволяє штучному інтелекту самостійно проводити серії експериментів. Наприклад, щоб навчити модель, дослідникам достатньо сказати: «Зменште loss на валідаційному наборі». OpenScience спочатку запустить базовий тест, потім самостійно запропонує модифікації і послідовно виконає експерименти. Якщо результат покращується — його зберігають, якщо погіршується — відкатують, а потім на основі попередніх результатів вирішують, що спробувати далі. Користувач також може заздалегідь обмежити кількість спроб, загальну тривалість і умови зупинки, або вказати: «Наступним кроком змінити лише оптимізатор». OpenScience автоматизує ітерації експериментів, які раніше вимагали постійного контролю з боку дослідників: формулювання гіпотез, виконання експериментів, порівняння показників, виключення невдалих підходів і перехід до наступного циклу. Експерименти можна запускати локально або передавати на віддалені GPU, SSH-сервери та кластери Slurm/PBS. Кожен етап експерименту — код, результати та висновки — зберігається для подальшого аналізу. Крім того, OpenScience підтримує прямий доступ до ChatGPT/Codex за підпискою, підключення власного ключа API, локальних моделей або використання офіційного платного за використанням сервісу Ace. За результатами внутрішніх тестувань, OpenScience вирішив 53 із 70 завдань Terminal-Bench Science, отримавши 75,7%. Для порівняння: публічний результат Codex + GPT-6 Astra становить 68,1%. (Джерело: BlockBeats)
Відмова від відповідальності: Інформація на цій сторінці може бути отримана від третіх осіб і не обов'язково відображає погляди або думки KuCoin. Цей контент надається лише для загального інформування, без будь-яких запевнень або гарантій, а також не може розглядатися як фінансова або інвестиційна порада. KuCoin не несе відповідальності за будь-які помилки або упущення, а також за будь-які результати, отримані в результаті використання цієї інформації. Інвестиції в цифрові активи можуть бути ризикованими. Будь ласка, ретельно оцініть ризики продукту та свою толерантність до ризику, виходячи з ваших власних фінансових обставин. Для отримання додаткової інформації, будь ласка, зверніться до наших Умов використання та Розкриття інформації про ризики.