OpenScience mencapai 75,7% pada Terminal-Bench Science, melampaui Codex

iconKuCoinFlash
Kongsi
AI summary iconRingkasan
OpenScience, agen penyelidikan daripada permulaan Synthetic Sciences, kumpulan Musim Sejuk 2026 Y Combinator, mendapat 75.7% dalam Terminal-Bench Science, melebihi Codex. Alat ini mengotomatiskan eksperimen, menulis kod, dan menggunakan pangkalan data saintifik. Ciri Autoresearchnya membolehkan pengujian berulang. Berita di rantai menunjukkan minat yang semakin meningkat terhadap alat penyelidikan berasaskan AI. Data inflasi tetap menjadi ukuran utama bagi pelabur yang memantau trend makro.
ME AI mesej, syarikat Y Combinator 2026 Winter Batch (YC W26), Synthetic Sciences, secara rasmi melancarkan Agent ilmiah sumber terbuka OpenScience. Ia boleh mencari kertas kerja, memproses data, menulis kod, dan memanggil pangkalan data ilmiah; Autoresearch yang baharu membolehkan AI menjalankan eksperimen secara berterusan sendiri. Sebagai contoh, apabila melatih model, penyelidik hanya perlu memberitahunya, "Turunkan loss set pengesahan." OpenScience akan menjalankan garis dasar terlebih dahulu, kemudian mencadangkan perubahan sendiri dan menjalankan eksperimen secara berulang. Jika hasil membaik, ia akan kekal; jika memburuk, ia akan dipulihkan, dan seterusnya menentukan langkah seterusnya berdasarkan hasil sebelumnya. Pengguna juga boleh menetapkan had bilangan pelaksanaan, tempoh masa keseluruhan, dan syarat penghentian, atau menentukan "Hanya ubah pengoptimum seterusnya." OpenScience mengautomatiskan iterasi eksperimen yang biasanya memerlukan penyelidik memantau secara berterusan: mencadangkan penyelesaian, menjalankan eksperimen, membandingkan metrik, menyingkirkan cadangan yang gagal, dan meneruskan kepada gelung seterusnya. Eksperimen boleh dijalankan secara tempatan atau dihantar ke GPU jauh, pelayan SSH, dan cluster Slurm/PBS. Setiap kod, hasil, dan penilaian bagi setiap gelung eksperimen akan direkodkan untuk kemudahan semakan seterusnya. Ia juga menyokong log masuk terus ke langganan ChatGPT/Codex, serta boleh disambungkan ke Kekunci API sendiri, model tempatan, atau menggunakan Ace yang ditawarkan secara bayaran berdasarkan penggunaan oleh pihak rasmi. Dalam ujian dalaman rasmi, OpenScience berjaya menyelesaikan 53 daripada 70 tugas Terminal-Bench Science, dengan skor 75.7%. Sebagai perbandingan, hasil awam Codex + GPT-6 Astra ialah 68.1%. (Sumber: BlockBeats)
Penafian: Maklumat yang terdapat pada halaman ini mungkin telah diperoleh daripada pihak ketiga dan tidak semestinya menggambarkan pandangan atau pendapat KuCoin. Kandungan ini adalah disediakan bagi tujuan maklumat umum sahaja, tanpa sebarang perwakilan atau waranti dalam apa jua bentuk, dan juga tidak boleh ditafsirkan sebagai nasihat kewangan atau pelaburan. KuCoin tidak akan bertanggungjawab untuk sebarang kesilapan atau pengabaian, atau untuk sebarang akibat yang terhasil daripada penggunaan maklumat ini. Pelaburan dalam aset digital boleh membawa risiko. Sila menilai risiko produk dan toleransi risiko anda dengan teliti berdasarkan keadaan kewangan anda sendiri. Untuk maklumat lanjut, sila rujuk kepada Terma Penggunaan dan Pendedahan Risiko kami.