OpenScience Mencapai 75,7% pada Terminal-Bench Science, Melampaui Codex

iconKuCoinFlash
Bagikan
AI summary iconRingkasan
OpenScience, agen penelitian dari startup Synthetic Sciences dari Batch Musim Dingin 2026 Y Combinator, mendapatkan skor 75,7% pada Terminal-Bench Science, mengungguli Codex. Alat ini mengotomatisasi eksperimen, menulis kode, dan menggunakan database ilmiah. Fitur Autoresearch-nya memungkinkan pengujian iteratif. Berita on-chain menunjukkan meningkatnya minat terhadap alat penelitian berbasis AI. Data inflasi tetap menjadi metrik utama bagi investor yang memantau tren makro.
ME AI mengumumkan bahwa perusahaan Y Combinator 2026 Winter Batch (YC W26), Synthetic Sciences, secara resmi meluncurkan Agent ilmiah open-source bernama OpenScience. OpenScience mampu mencari paper, memproses data, menulis kode, dan memanggil database ilmiah. Fitur baru Autoresearch memungkinkan AI menjalankan eksperimen secara berurutan sendiri. Misalnya, saat melatih model, peneliti hanya perlu memberi perintah: "Turunkan loss pada validation set." OpenScience akan menjalankan baseline terlebih dahulu, lalu secara mandiri mengusulkan modifikasi, menjalankan eksperimen secara berulang. Jika hasil membaik, perubahan dipertahankan; jika memburuk, dikembalikan ke versi sebelumnya, lalu menentukan langkah berikutnya berdasarkan hasil sebelumnya. Pengguna juga dapat membatasi jumlah percobaan, durasi total, dan kondisi penghentian, atau menetapkan aturan seperti "hanya ubah optimizer selanjutnya." OpenScience mengotomatisasi iterasi eksperimen yang biasanya memerlukan perhatian berulang dari peneliti: mengusulkan solusi, menjalankan eksperimen, membandingkan metrik, menyingkirkan solusi gagal, lalu melanjutkan ke siklus berikutnya. Eksperimen dapat dijalankan di perangkat lokal atau dialihkan ke GPU jarak jauh, server SSH, atau klaster Slurm/PBS. Setiap kode, hasil, dan keputusan dari setiap siklus eksperimen dicatat untuk memudahkan pemeriksaan di masa mendatang. OpenScience juga mendukung login langsung ke langganan ChatGPT/Codex, serta integrasi dengan kunci API milik pengguna, model lokal, atau penggunaan Ace resmi berbasis pembayaran sesuai penggunaan. Dalam pengujian internal, OpenScience menyelesaikan 53 dari 70 tugas Terminal-Bench Science dengan skor 75,7%. Sebagai perbandingan, hasil publik Codex + GPT-6 Astra adalah 68,1%. (Sumber: BlockBeats)
Penafian: Informasi pada halaman ini mungkin telah diperoleh dari pihak ketiga dan tidak mencerminkan pandangan atau opini KuCoin. Konten ini disediakan hanya untuk tujuan informasi umum, tanpa representasi atau jaminan apa pun, dan tidak dapat ditafsirkan sebagai saran keuangan atau investasi. KuCoin tidak bertanggung jawab terhadap segala kesalahan atau kelalaian, atau hasil apa pun yang keluar dari penggunaan informasi ini. Berinvestasi di aset digital dapat berisiko. Harap mengevaluasi risiko produk dan toleransi risiko Anda secara cermat berdasarkan situasi keuangan Anda sendiri. Untuk informasi lebih lanjut, silakan lihat Ketentuan Penggunaan dan Pengungkapan Risiko.