Vừa rồi, câu đố Tier 4 cuối cùng của FrontierMath đã được GPT-6 Astra giải quyết.
至此,这套曾被视为大模型数学噩梦的研究级测试,所有题目都已被AI成功解答至少一次。
Epoch AI cũng đã chính thức kết luận rằng FrontierMath Tier 4 đã bão hòa.

Mặc dù từ biểu đồ trên có thể thấy, Astra chưa trực tiếp đạt đến 100%, kết quả do OpenAI tự công bố là 97,6%.
Tuy nhiên, theo thuật toán của Epoch, "giải hết tất cả" có nghĩa là sau khi gộp lại tất cả các nỗ lực từ các mô hình và thời điểm khác nhau, mỗi câu hỏi trong Tier 4 đều đã từng được giải thành công.
Và điều mà Astra đã vượt qua chính là rào cản duy nhất trước đây chưa từng bị AI phá vỡ.
(Nói đơn giản là Astra có thể đã mắc lỗi trong một lần kiểm tra, nhưng câu hỏi mà nó trả lời đúng là câu chưa ai giải được trước đó)

Nói thật thì tốc độ phát triển này vẫn khá là kinh ngạc.
Nếu bạn theo dõi đánh giá mô hình, bạn sẽ biết rằng vào ngày 11 tháng 7 năm 2025, khi Tier 4 vừa ra mắt, thành tích cao nhất trên bảng xếp hạng chỉ khoảng 5%.
Đã qua đúng một năm hai tháng, bức “tường cao” từng tồn tại nay đã trở thành “bậc thang”, và vấn đề khó khăn cuối cùng mà AI không thể vượt qua bằng cách đi tắt cũng đã được vượt qua.
Người ra đề, Phó Giáo sư Toán học Jay Pantone từ Đại học Marquette, cũng cho biết trước đây AI thường tìm các lối tắt số học, nhưng lần này, cách giải của AI rất gần với cách của ông.

Tuy nhiên, ngay gần đây, khi GPT-6 Astra liên tục tấn công mạnh mẽ vào giới toán học và liên tục giải quyết các vấn đề thiên niên kỷ, Pantone cho biết mình đã khó mà ngạc nhiên nữa!
Có thể nói, toán học rõ ràng đã trở thành một trong những lĩnh vực mà Astra gần đây tăng cường sự hiện diện mạnh mẽ nhất.
Từ dưới 2%, đến việc thêm riêng một "hàng rào nghiên cứu cấp cao"
FrontierMath được phát hành lần đầu tiên vào ngày 7 tháng 11 năm 2024, và mục đích ra đời của nó chính là để tránh việc các benchmark toán học bị AI vượt quá nhanh chóng.
Lúc đó, các benchmark toán học truyền thống như GSM8K và MATH ngày càng khó để phân biệt khoảng cách giữa các mô hình hàng đầu, vì vậy Epoch AI đã hợp tác với hơn 60 nhà toán học để thiết kế lại một bộ câu hỏi gốc chưa từng được công bố trước đây.
Trong đó bao gồm các người đoạt giải Fields như Terence Tao, Timothy Gowers, Richard Borcherds.
Sau khi xem qua một số câu hỏi cấp độ nghiên cứu, Terence Tao trực tiếp nhận xét rằng những câu hỏi này “rất khó”, thậm chí cho rằng câu hỏi khó nhất ở cấp độ Tier 3 có thể vẫn khiến AI mắc kẹt trong vài năm nữa.

Sau khi kiểm tra vòng đầu tiên, kết quả như dự đoán, tỷ lệ chính xác của mô hình dẫn đầu chưa đến 2%.
Cụ thể, ban đầu, thư viện câu hỏi chính của FrontierMath gồm 300 câu hỏi, được chia thành ba cấp độ: Tier 1, Tier 2 và Tier 3 theo độ khó.

Tier 1 gần với các bài toán cấp đại học khó và toán học Olympic, nhưng được phép sử dụng các công cụ nâng cao hơn; Tier 2 đã đạt đến mức độ khó của sinh viên sau đại học năm cuối; Tier 3 thì gần với các vấn đề nghiên cứu mang tính khám phá mà sinh viên tiến sĩ giai đoạn đầu thường gặp.
Tuy nhiên, với sự xuất hiện của các mô hình suy luận, ba lớp đầu tiên bắt đầu trở nên ngày càng không đủ, do đó vào năm 2025, Epoch đã thêm một lớp mới, Tier 4.
Hạng 4 chủ yếu được các giáo sư toán học và nghiên cứu sinh sau tiến sĩ thiết kế, mỗi người sẽ thực hiện nghiên cứu ngắn hạn trong khoảng vài tuần xung quanh hướng nghiên cứu của mình, sau đó tóm tắt thành quả thành một câu hỏi có thể được xác minh tự động.

Ban đầu, Tier 4 bao gồm 50 câu hỏi. Chúng bao phủ các lĩnh vực như phân tích, lý thuyết số, toán học tổ hợp, tô pô, hình học đại số…
Ngay từ khi ra mắt, trong tất cả các lần kiểm tra của các mô hình, chỉ có 3 câu hỏi từng được giải, và những lời giải này còn dựa vào một số giả định đúng nhưng chưa được chứng minh đầy đủ.
Do đó, trên trang mẫu câu hỏi công khai của trang web, Epoch từng viết: Một số câu hỏi này có thể chưa được AI giải quyết trong vài chục năm.

(Câu này hiện đang bị lặp lại chỉ trích)
Tuy nhiên, khi mô hình ngày càng mạnh mẽ, một vấn đề khác cũng dần lộ ra: chính bộ đề thi cũng bắt đầu không chịu nổi sự “kiểm tra” của AI.
Trong quá trình kiểm thử, OpenAI phát hiện rằng các lỗi trong FrontierMath nhiều hơn dự kiến.
Sau đó, Epoch tiến hành kiểm toán độc lập, ban đầu sử dụng GPT-5.5 và Claude Opus 4.7 để sàng lọc các điểm nghi vấn, sau đó giao cho các nhà toán học rà soát từng câu hỏi. Cuối cùng, phiên bản v2 được ra mắt vào tháng 6 năm 2026, trong đó Tier 4 đã sửa đổi 12 câu hỏi, loại bỏ 7 câu hỏi và giữ lại 43 câu hỏi.
Sau khi được cập nhật, hiệu suất của mô hình vẫn tiếp tục tăng lên không ngừng.
GPT-5.6 Sol đạt 83,0%, Claude Fable 5 đạt 90,2%, đến GPT-6 Astra, thành tích đã đạt 97,6%.

Quan trọng hơn, Astra còn giải được câu hỏi duy nhất trước đây chưa từng có AI nào giải được.

Tới nay, mỗi câu hỏi trong Tier 4 đều đã ít nhất một lần bị AI phá vỡ thành công. Hàng rào nghiên cứu được thiết kế đặc biệt cho các mô hình mạnh nhất cuối cùng cũng đã bị vượt qua.
Tuy nhiên, điều này không có nghĩa là “toán học đã được AI giải quyết”. Ngược lại, FrontierMath chính nó đã bắt đầu bước sang giai đoạn tiếp theo.
Hiện tại, ngoài các Tier 1-4, dự án còn bổ sung các Open Problems thực sự, cũng như hình thức hóa các vấn đề mở Erdős vào FrontierMath Erdős trong Lean.

Người đầu tiên đưa ra các vấn đề nghiên cứu chưa được giải quyết bởi cộng đồng toán học để kiểm tra mô hình; người thứ hai yêu cầu AI viết ra các chứng minh đầy đủ có thể được xác minh hình thức.
Lần này, Astra chỉ giải được 2 trong số 68 bài toán của FrontierMath Erdős.
Câu chuyện vẫn đang tiếp diễn~
Bài viết này đến từ tài khoản chính thức WeChat "Quantum Bit", tác giả: henry
