Động thái Beating AI, sau khi OpenAI ra mắt GPT-6 Astra vào ngày 3 tháng 9, nhiều dữ liệu đánh giá mô hình trên các tiêu chuẩn đã liên tục được điều chỉnh; một số sửa đổi giúp Astra thể hiện tốt hơn, trong khi một số mô hình đối thủ lại ghi điểm giảm, gây ra nghi ngờ từ bên ngoài về hành vi “lừa dối bảng xếp hạng” và tính minh bạch của các bài đánh giá. Trong đó, tỷ lệ ảo giác của Astra từng được giảm từ 4,2% xuống 2%, trong khi GPT-5.6 Sol giảm từ 12,2% xuống 9,4%, sau đó cả hai đều trở lại mức 4,2% và 12,2%. Trong bài đánh giá toán học, điểm số của Fable 5.1 do Anthropic từng giảm từ 87,8% xuống 78%, hiện đã phục hồi lên 83%; GPT-5.6 Sol cũng giảm từ 83% xuống 80,5%, sau đó phục hồi về 83%. Ngoài ra, điểm số của Astra trong bài đánh giá ARC-AGI-3 đã tăng từ 98,6% trong bản nháp trước khi ra mắt lên 99,99% trên trang cuối cùng, và điểm đánh giá lập trình cũng được điều chỉnh nhẹ từ 57,7% lên 57,9%. OpenAI cho biết kết quả đánh giá có thể bị ảnh hưởng bởi phiên bản mô hình, cấu hình công cụ, mức độ suy luận và các yếu tố chạy thử nghiệm; các điều chỉnh lần này nhằm đảm bảo dữ liệu phản ánh chính xác hiệu suất tối ưu của mô hình. Tuy nhiên, các nhà nghiên cứu tại Đại học Stanford cho rằng việc chạy lại bài đánh giá thường xuyên có thể liên quan đến hiện tượng “Benchmaxxing” — tức là điều chỉnh điều kiện kiểm tra để tối đa hóa điểm số trên tiêu chuẩn. Các chuyên gia trong ngành chỉ ra rằng, khi cạnh tranh giữa các mô hình AI ngày càng gay gắt, dữ liệu đánh giá đã trở thành công cụ quan trọng để đo lường năng lực mô hình và cạnh tranh thị trường; cách thức nâng cao tính minh bạch và khả năng tái tạo của các bài kiểm tra chuẩn đang ngày càng nhận được sự quan tâm.
OpenAI điều chỉnh dữ liệu đánh giá GPT-6 Astra, gây ra lo ngại về tính minh bạch
MarsBitChia sẻ
OpenAI được cho là đã thay đổi dữ liệu đánh giá của GPT-6 Astra, gây ra lo ngại về tính minh bạch. Tỷ lệ ảo giác của Astra giảm từ 4,2% xuống 2%, trong khi các đối thủ như Anthropic và GPT-5.6 Sol ghi nhận sự sụt giảm điểm toán học. OpenAI cho biết các thay đổi này phản ánh hiệu suất chính xác, nhưng các nhà nghiên cứu tại Stanford cảnh báo về hiện tượng "benchmaxxing". Trong bối cảnh các altcoin cần theo dõi đang thu hút sự chú ý do biến động thị trường, dữ liệu đáng tin cậy vẫn là yếu tố then chốt. Xu hướng dữ liệu lạm phát cũng nhấn mạnh nhu cầu về các tiêu chuẩn rõ ràng, có thể tái tạo trong các lĩnh vực AI và tiền điện tử.
Nguồn:Hiển thị bản gốc
Tuyên bố miễn trừ trách nhiệm: Thông tin trên trang này có thể được lấy từ bên thứ ba và không nhất thiết phản ánh quan điểm hoặc ý kiến của KuCoin. Nội dung này chỉ được cung cấp cho mục đích thông tin chung, không có bất kỳ đại diện hay bảo đảm nào dưới bất kỳ hình thức nào và cũng không được hiểu là lời khuyên tài chính hay đầu tư. KuCoin sẽ không chịu trách nhiệm về bất kỳ sai sót hoặc thiếu sót nào hoặc về bất kỳ kết quả nào phát sinh từ việc sử dụng thông tin này.
Việc đầu tư vào tài sản kỹ thuật số có thể tiềm ẩn nhiều rủi ro. Vui lòng đánh giá cẩn thận rủi ro của sản phẩm và khả năng chấp nhận rủi ro của bạn dựa trên hoàn cảnh tài chính của chính bạn. Để biết thêm thông tin, vui lòng tham khảo Điều khoản sử dụng và Tiết lộ rủi ro của chúng tôi.