Mô hình suy luận mới nhất của OpenAI, GPT-6 Astra, đã ra mắt vào ngày 3 tháng 9 với điểm số 97,6% trên FrontierMath Tier 4 (v2). Đó là con số khiến bạn phải ngỡ ngàng, đặc biệt khi bạn biết rằng phiên bản nội bộ trước đó của mô hình này gần như chỉ đạt được 17% trong các đánh giá khả năng toán học.
Hành trình từ 17% lên 47% trong nội bộ, sau đó tiến gần đến sự hoàn hảo trên các tiêu chuẩn công khai, nén lại những tiến bộ thường mất nhiều năm vào một chu kỳ phát triển duy nhất.
Cuộc thi benchmark
Trên ARC-AGI-3, được đo lường trong bộ đánh giá của chính OpenAI, Astra đạt điểm 99,9%. Trên ExploitBench, nó đạt điểm tuyệt đối 100%. GPQA Diamond, một bài kiểm tra suy luận khoa học cấp độ sau đại học, đạt 96,0%. Terminal-Bench Science 0.1 đạt điểm 64,6%.
Kết quả FrontierMath Tier 4 (v2) là con số chính. GPT-5.6 Sol, tiền nhiệm của Astra, đạt 83,0% trên cùng tiêu chuẩn này. 97,6% của Astra thể hiện sự cải thiện 14,6 điểm phần trăm.
Từ 17% đến đẳng cấp thế giới
Các phiên bản đầu tiên của mô hình sẽ trở thành Astra đạt khoảng 17% trên các bài đánh giá khả năng toán học. Qua các cải tiến lặp đi lặp lại, con số này tăng lên khoảng 47% trước khi mô hình được tinh chỉnh thêm cho phiên bản công khai.
OpenAI cũng ghi nhận Astra đã đóng góp những hiểu biết mới về khoảng cách số nguyên tố, một lĩnh vực nổi tiếng khó khăn trong lý thuyết số đã thu hút các nhà toán học con người trong hàng thế kỷ.
Ai được truy cập và khi nào
Việc triển khai Astra tuân theo tiếp cận từng giai đoạn. Các tổ chức được chọn đã có quyền truy cập vào ngày ra mắt, với khả năng truy cập rộng rãi hơn được mở rộng cho các thuê bao ChatGPT Plus, Pro, Business và Enterprise ngay sau đó. Truy cập API có sẵn thông qua OpenAI trực tiếp, cũng như thông qua Azure và AWS Bedrock.
Bối cảnh cạnh tranh
Các đánh giá độc lập đã xếp Astra vào nhóm các mô hình AI hiệu suất cao nhất hiện có, mặc dù một số đánh giá ghi nhận rằng một số biến thể Claude từ Anthropic vượt trội hơn trong các bài kiểm tra trí tuệ tổng quát.
Việc tăng từ 83,0% lên 97,6% trên FrontierMath trong một lần tạo mô hình cho thấy ngưỡng tối đa của khả năng suy luận toán học của AI, nếu có, vẫn chưa được đạt đến.
