GPT-6 Astra giải quyết bài toán cấp độ 4 về Toán học

icon MarsBit
Chia sẻ
AI summary iconTóm tắt
Tin tức AI + tiền mã hóa: GPT-6 Astra đã giải quyết vấn đề cuối cùng trong FrontierMath Tier 4, hoàn thành tất cả các thách thức trong bộ tiêu chuẩn nâng cao. Được phát triển bởi Epoch AI với hơn 60 nhà toán học, Astra đạt độ chính xác 97,6% và giải được vấn đề cuối cùng chưa từng được giải. Dự án hiện chuyển sang giai đoạn mới với nghiên cứu mở và các thách thức được chuẩn hóa, đánh dấu một thông báo quan trọng về tiến bộ trong lĩnh vực AI.

Vừa rồi, câu đố Tier 4 cuối cùng của FrontierMath đã được GPT-6 Astra giải quyết.

至此,这套曾被视为大模型数学噩梦的研究级测试,所有题目都已被AI成功解答至少一次。

Epoch AI cũng đã chính thức kết luận rằng FrontierMath Tier 4 đã bão hòa.

FrontierMath

Mặc dù từ biểu đồ trên có thể thấy, Astra chưa trực tiếp đạt đến 100%, kết quả do OpenAI tự công bố là 97,6%.

Tuy nhiên, theo thuật toán của Epoch, "giải hết tất cả" có nghĩa là sau khi gộp lại tất cả các nỗ lực từ các mô hình và thời điểm khác nhau, mỗi câu hỏi trong Tier 4 đều đã từng được giải thành công.

Và điều mà Astra đã vượt qua chính là rào cản duy nhất trước đây chưa từng bị AI phá vỡ.

(Nói đơn giản là Astra có thể đã mắc lỗi trong một lần kiểm tra, nhưng câu hỏi mà nó trả lời đúng là câu chưa ai giải được trước đó)

FrontierMath

Nói thật thì tốc độ phát triển này vẫn khá là kinh ngạc.

Nếu bạn theo dõi đánh giá mô hình, bạn sẽ biết rằng vào ngày 11 tháng 7 năm 2025, khi Tier 4 vừa ra mắt, thành tích cao nhất trên bảng xếp hạng chỉ khoảng 5%.

Đã qua đúng một năm hai tháng, bức “tường cao” từng tồn tại nay đã trở thành “bậc thang”, và vấn đề khó khăn cuối cùng mà AI không thể vượt qua bằng cách đi tắt cũng đã được vượt qua.

Người ra đề, Phó Giáo sư Toán học Jay Pantone từ Đại học Marquette, cũng cho biết trước đây AI thường tìm các lối tắt số học, nhưng lần này, cách giải của AI rất gần với cách của ông.

FrontierMath

Tuy nhiên, ngay gần đây, khi GPT-6 Astra liên tục tấn công mạnh mẽ vào giới toán học và liên tục giải quyết các vấn đề thiên niên kỷ, Pantone cho biết mình đã khó mà ngạc nhiên nữa!

Có thể nói, toán học rõ ràng đã trở thành một trong những lĩnh vực mà Astra gần đây tăng cường sự hiện diện mạnh mẽ nhất.

Từ dưới 2%, đến việc thêm riêng một "hàng rào nghiên cứu cấp cao"

FrontierMath được phát hành lần đầu tiên vào ngày 7 tháng 11 năm 2024, và mục đích ra đời của nó chính là để tránh việc các benchmark toán học bị AI vượt quá nhanh chóng.

Lúc đó, các benchmark toán học truyền thống như GSM8K và MATH ngày càng khó để phân biệt khoảng cách giữa các mô hình hàng đầu, vì vậy Epoch AI đã hợp tác với hơn 60 nhà toán học để thiết kế lại một bộ câu hỏi gốc chưa từng được công bố trước đây.

Trong đó bao gồm các người đoạt giải Fields như Terence Tao, Timothy Gowers, Richard Borcherds.

Sau khi xem qua một số câu hỏi cấp độ nghiên cứu, Terence Tao trực tiếp nhận xét rằng những câu hỏi này “rất khó”, thậm chí cho rằng câu hỏi khó nhất ở cấp độ Tier 3 có thể vẫn khiến AI mắc kẹt trong vài năm nữa.

FrontierMath

Sau khi kiểm tra vòng đầu tiên, kết quả như dự đoán, tỷ lệ chính xác của mô hình dẫn đầu chưa đến 2%.

Cụ thể, ban đầu, thư viện câu hỏi chính của FrontierMath gồm 300 câu hỏi, được chia thành ba cấp độ: Tier 1, Tier 2 và Tier 3 theo độ khó.

FrontierMath

Tier 1 gần với các bài toán cấp đại học khó và toán học Olympic, nhưng được phép sử dụng các công cụ nâng cao hơn; Tier 2 đã đạt đến mức độ khó của sinh viên sau đại học năm cuối; Tier 3 thì gần với các vấn đề nghiên cứu mang tính khám phá mà sinh viên tiến sĩ giai đoạn đầu thường gặp.

Tuy nhiên, với sự xuất hiện của các mô hình suy luận, ba lớp đầu tiên bắt đầu trở nên ngày càng không đủ, do đó vào năm 2025, Epoch đã thêm một lớp mới, Tier 4.

Hạng 4 chủ yếu được các giáo sư toán học và nghiên cứu sinh sau tiến sĩ thiết kế, mỗi người sẽ thực hiện nghiên cứu ngắn hạn trong khoảng vài tuần xung quanh hướng nghiên cứu của mình, sau đó tóm tắt thành quả thành một câu hỏi có thể được xác minh tự động.

FrontierMath

Ban đầu, Tier 4 bao gồm 50 câu hỏi. Chúng bao phủ các lĩnh vực như phân tích, lý thuyết số, toán học tổ hợp, tô pô, hình học đại số…

Ngay từ khi ra mắt, trong tất cả các lần kiểm tra của các mô hình, chỉ có 3 câu hỏi từng được giải, và những lời giải này còn dựa vào một số giả định đúng nhưng chưa được chứng minh đầy đủ.

Do đó, trên trang mẫu câu hỏi công khai của trang web, Epoch từng viết: Một số câu hỏi này có thể chưa được AI giải quyết trong vài chục năm.

FrontierMath

(Câu này hiện đang bị lặp lại chỉ trích)

Tuy nhiên, khi mô hình ngày càng mạnh mẽ, một vấn đề khác cũng dần lộ ra: chính bộ đề thi cũng bắt đầu không chịu nổi sự “kiểm tra” của AI.

Trong quá trình kiểm thử, OpenAI phát hiện rằng các lỗi trong FrontierMath nhiều hơn dự kiến.

Sau đó, Epoch tiến hành kiểm toán độc lập, ban đầu sử dụng GPT-5.5 và Claude Opus 4.7 để sàng lọc các điểm nghi vấn, sau đó giao cho các nhà toán học rà soát từng câu hỏi. Cuối cùng, phiên bản v2 được ra mắt vào tháng 6 năm 2026, trong đó Tier 4 đã sửa đổi 12 câu hỏi, loại bỏ 7 câu hỏi và giữ lại 43 câu hỏi.

Sau khi được cập nhật, hiệu suất của mô hình vẫn tiếp tục tăng lên không ngừng.

GPT-5.6 Sol đạt 83,0%, Claude Fable 5 đạt 90,2%, đến GPT-6 Astra, thành tích đã đạt 97,6%.

FrontierMath

Quan trọng hơn, Astra còn giải được câu hỏi duy nhất trước đây chưa từng có AI nào giải được.

FrontierMath

Tới nay, mỗi câu hỏi trong Tier 4 đều đã ít nhất một lần bị AI phá vỡ thành công. Hàng rào nghiên cứu được thiết kế đặc biệt cho các mô hình mạnh nhất cuối cùng cũng đã bị vượt qua.

Tuy nhiên, điều này không có nghĩa là “toán học đã được AI giải quyết”. Ngược lại, FrontierMath chính nó đã bắt đầu bước sang giai đoạn tiếp theo.

Hiện tại, ngoài các Tier 1-4, dự án còn bổ sung các Open Problems thực sự, cũng như hình thức hóa các vấn đề mở Erdős vào FrontierMath Erdős trong Lean.

FrontierMath

Người đầu tiên đưa ra các vấn đề nghiên cứu chưa được giải quyết bởi cộng đồng toán học để kiểm tra mô hình; người thứ hai yêu cầu AI viết ra các chứng minh đầy đủ có thể được xác minh hình thức.

Lần này, Astra chỉ giải được 2 trong số 68 bài toán của FrontierMath Erdős.

Câu chuyện vẫn đang tiếp diễn~

Bài viết này đến từ tài khoản chính thức WeChat "Quantum Bit", tác giả: henry

Tuyên bố miễn trừ trách nhiệm: Thông tin trên trang này có thể được lấy từ bên thứ ba và không nhất thiết phản ánh quan điểm hoặc ý kiến của KuCoin. Nội dung này chỉ được cung cấp cho mục đích thông tin chung, không có bất kỳ đại diện hay bảo đảm nào dưới bất kỳ hình thức nào và cũng không được hiểu là lời khuyên tài chính hay đầu tư. KuCoin sẽ không chịu trách nhiệm về bất kỳ sai sót hoặc thiếu sót nào hoặc về bất kỳ kết quả nào phát sinh từ việc sử dụng thông tin này. Việc đầu tư vào tài sản kỹ thuật số có thể tiềm ẩn nhiều rủi ro. Vui lòng đánh giá cẩn thận rủi ro của sản phẩm và khả năng chấp nhận rủi ro của bạn dựa trên hoàn cảnh tài chính của chính bạn. Để biết thêm thông tin, vui lòng tham khảo Điều khoản sử dụngTiết lộ rủi ro của chúng tôi.