OpenScience đạt 75,7% trên Terminal-Bench Science, vượt trội hơn Codex

iconKuCoinFlash
Chia sẻ
AI summary iconTóm tắt
OpenScience, một tác nhân nghiên cứu từ startup Synthetic Sciences thuộc lô mùa Đông 2026 của Y Combinator, đạt 75,7% trên Terminal-Bench Science, vượt trội hơn Codex. Công cụ này tự động hóa các thí nghiệm, viết mã và sử dụng các cơ sở dữ liệu khoa học. Tính năng Autoresearch cho phép thử nghiệm lặp đi lặp lại. Tin tức trên chuỗi cho thấy sự quan tâm ngày càng tăng đối với các công cụ nghiên cứu do AI hỗ trợ. Dữ liệu lạm phát vẫn là chỉ số quan trọng đối với các nhà đầu tư theo dõi các xu hướng vĩ mô.
ME AI tin nhắn, công ty Synthetic Sciences thuộc lô mùa đông Y Combinator 2026 (YC W26) chính thức ra mắt OpenScience — một Agent nghiên cứu khoa học mã nguồn mở. Nó có thể tìm kiếm bài báo, xử lý dữ liệu, viết mã và gọi các cơ sở dữ liệu khoa học; tính năng Autoresearch mới cho phép AI tự động chạy thí nghiệm liên tiếp. Ví dụ, khi huấn luyện một mô hình, nhà nghiên cứu chỉ cần nói: “Hãy giảm loss trên tập xác thực”. OpenScience sẽ chạy baseline trước, sau đó tự đề xuất các phương án điều chỉnh và thực hiện thí nghiệm từng vòng. Nếu kết quả cải thiện, nó sẽ giữ lại; nếu xấu đi, nó sẽ hoàn nguyên và dựa trên kết quả trước đó để quyết định bước tiếp theo cần thử gì. Người dùng cũng có thể giới hạn trước số lần chạy, tổng thời gian và điều kiện dừng, hoặc quy định “chỉ thay đổi bộ tối ưu hóa từ giờ trở đi”. OpenScience tự động hóa chu kỳ thí nghiệm vốn đòi hỏi nhà nghiên cứu phải liên tục theo dõi: đề xuất phương án, thực hiện thí nghiệm, so sánh chỉ số, loại bỏ các phương án thất bại, rồi tiếp tục vòng mới. Thí nghiệm có thể chạy trên máy cục bộ hoặc giao cho GPU từ xa, máy chủ SSH và cụm Slurm/PBS. Mã nguồn, kết quả và quyết định của mỗi vòng thí nghiệm đều được ghi lại để dễ dàng kiểm tra sau này. Nó cũng hỗ trợ đăng nhập trực tiếp vào tài khoản ChatGPT/Codex đã đăng ký, đồng thời có thể tích hợp với khóa API riêng, mô hình cục bộ hoặc sử dụng Ace của chính hãng theo mức sử dụng. Theo kiểm tra nội bộ, OpenScience đã hoàn thành 53/70 nhiệm vụ trong Terminal-Bench Science với điểm số 75,7%. Để so sánh, kết quả công khai của Codex + GPT-6 Astra là 68,1%. (Nguồn: BlockBeats)
Tuyên bố miễn trừ trách nhiệm: Thông tin trên trang này có thể được lấy từ bên thứ ba và không nhất thiết phản ánh quan điểm hoặc ý kiến của KuCoin. Nội dung này chỉ được cung cấp cho mục đích thông tin chung, không có bất kỳ đại diện hay bảo đảm nào dưới bất kỳ hình thức nào và cũng không được hiểu là lời khuyên tài chính hay đầu tư. KuCoin sẽ không chịu trách nhiệm về bất kỳ sai sót hoặc thiếu sót nào hoặc về bất kỳ kết quả nào phát sinh từ việc sử dụng thông tin này. Việc đầu tư vào tài sản kỹ thuật số có thể tiềm ẩn nhiều rủi ro. Vui lòng đánh giá cẩn thận rủi ro của sản phẩm và khả năng chấp nhận rủi ro của bạn dựa trên hoàn cảnh tài chính của chính bạn. Để biết thêm thông tin, vui lòng tham khảo Điều khoản sử dụng và Tiết lộ rủi ro của chúng tôi.