Tháng Bảy ở Thượng Hải, làn sóng nhiệt cuộn trào.
Kỳ thi Olympic Toán học Quốc tế lần thứ 67 đã chính thức kết thúc, đội Trung Quốc giành ngôi vô địch với 232 điểm. Ba cậu bé trẻ tuổi đã đạt điểm tuyệt đối 42.

Tiếng vỗ tay tại chỗ vẫn chưa tan, một bảng thành tích nổi bật khác đã lặng lẽ xuất hiện trên GitHub.
Cựu kỹ sư Google Deedy Das thực hiện một bài đánh giá AI: 7 mô hình lớn tiên tiến, tự chủ giải quyết toàn bộ 6 câu hỏi của IMO 2026.
Claude Fable 5 đạt điểm tuyệt đối 42. Chỉ mất 2,5 giờ và tiêu tốn 51 USD.
Phiên bản xhigh của GPT-5.6 Sol cũng đạt điểm tuyệt đối. Thời gian sử dụng là 3,8 giờ, chi phí thậm chí được giảm xuống mức cực thấp là 20 đô la.
Kimi K3 tiếp theo giành trọn điểm tuyệt đối. Sau 17,4 giờ chiến đấu, chi phí 31 đô la.
Cộng thêm AxiomProver với bài thi độc lập, cả bốn thế lực đều đạt điểm tuyệt đối.

Để tham khảo, trong 7 năm qua tại IMO, trong số 4.347 thí sinh là con người, chỉ có 30 người đạt điểm tuyệt đối — tỷ lệ 0,69%.

Đánh bại với khoảng cách quá lớn
Từ kết quả, không chỉ có khoảng cách 14 điểm giữa điểm tuyệt đối 42 và vị trí thứ tư với 28 điểm, mà ba mô hình đạt điểm tuyệt đối còn leo lên đỉnh cao theo những cách hoàn toàn khác nhau.
Claude Fable 5 hoạt động gọn gàng và hiệu quả. 9 cuộc hội thoại, 6 lần đầu ra hiệu quả, thời gian dài nhất một lần là 73 phút (P3), tổng đầu ra 700.000 token.
GPT-5.6 Sol dường như gặp chút khó khăn. Trên P2, nó mất 106 phút để chạy 4 vòng, bị gián đoạn hai lần do sự cố mạng. Nhưng việc kiểm soát năng lực tính toán thật đáng kinh ngạc—tổng đầu ra chỉ có 230.000 token, ít nhất trong ba trường hợp đạt điểm tối đa.
Kimi K3 như một con quái vật không biết mệt mỏi. Mô hình MoE với 2,8 nghìn tỷ tham số đã liên tục tạo ra 1,54 triệu token, gấp 6,5 lần Sol. Chỉ riêng câu hỏi P3 đã khởi động 6 đợt tấn công, chiến đấu suốt 491 phút.






Sự đối đầu trực tiếp của trực giác toán học
P1 là món khai vị nhẹ nhàng nhất全场, tất cả các mô hình đều xử lý trong vài phút, và các thí sinh con người cũng gần như không ai thất bại.
Trên bảng đen có ghi 2026 số nguyên dương lớn hơn 1. Mỗi bước, chọn hai số m và n, xóa chúng đi và thay bằng gcd(m,n) và lcm(m,n)/gcd(m,n). Lặp lại thao tác này cho đến khi không thể tiếp tục. Chứng minh rằng: (a) Quá trình nhất định sẽ kết thúc và cuối cùng chỉ còn lại một số duy nhất lớn hơn 1 là M; (b) Giá trị của M không phụ thuộc vào thứ tự các thao tác.

Để dễ hiểu hơn về câu hỏi này, chúng ta hãy thực hiện một thí nghiệm thu nhỏ.
Trên bảng chỉ có 12 và 18. 12 = 2² × 3, 18 = 2 × 3². Bước đầu tiên: gcd(12,18) = 6, lcm(12,18)/6 = 6, bảng trở thành [6, 6]. Bước thứ hai: gcd(6,6) = 6, lcm(6,6)/6 = 1, bảng trở thành [6, 1]. Chỉ còn một số lớn hơn 1, trò chơi kết thúc. M = 6.
Dù bạn có hoán đổi thứ tự thao tác thế nào đi nữa, M luôn là 6. Tại sao?
The answer lies in the factors.
Với mỗi số nguyên tố p, lấy ước chung lớn nhất của số lần tất cả các số chia hết cho p, sau đó nhân các lũy thừa của các số nguyên tố này lại — giá trị này không thay đổi từ bước đầu tiên đến bước cuối cùng.
Claude Fable 5: Tạo ra một bộ đếm giảm dần chắc chắn ở mỗi bước.
Đối với bài toán này, Fable 5 định nghĩa một đại lượng Φ = T + N. T là tổng số thừa số nguyên tố của tất cả các số trên bảng (đếm cả các thừa số lặp lại), N là số lượng các số lớn hơn 1. Ví dụ, với bảng [12, 18], các thừa số nguyên tố của 12 là 2, 2, 3 (tổng cộng 3 thừa số), của 18 là 2, 3, 3 (tổng cộng 3 thừa số), nên T = 6, N = 2, Φ = 8.
Sau đó, nó chứng minh rằng: mỗi khi thực hiện một thao tác, Φ ít nhất giảm đi 1. Có hai trường hợp—nếu gcd(m,n) > 1, tổng số thừa số nguyên tố T sẽ giảm; nếu gcd(m,n) = 1, T không đổi nhưng số lượng số lớn hơn 1 giảm đi một, N giảm đi 1. Φ là số nguyên dương, mỗi bước ít nhất giảm 1, quá trình buộc phải kết thúc sau một số hữu hạn bước. Một bộ đếm duy nhất, cắt đứt gọn gàng.

GPT-5.6 Sol: Theo dõi sản phẩm, giảm chiều theo thứ tự từ điển.
Sol quan tâm đến hai đại lượng: P = tích của tất cả các số, K = số lượng số lớn hơn 1. Trong mỗi bước thao tác, nếu gcd(m,n) = d > 1, tích của hai số mới là mn/d, nhỏ hơn trước đó, do đó tích toàn cục P giảm nghiêm ngặt. Nếu d = 1, P không đổi, nhưng K giảm đi 1.
Cặp (P, K) giảm nghiêm ngặt theo thứ tự từ điển: hoặc P giảm, hoặc P không đổi nhưng K giảm. Thứ tự từ điển của các số nguyên dương không thể giảm vô hạn. Kết thúc.

Hai con đường hoàn toàn khác nhau đã giải quyết phần (a) của cùng một vấn đề.
Đến phần (b), ba mô hình đều đi đến cùng một kết luận: đều chứng minh rằng với mỗi số nguyên tố p, ước chung lớn nhất của số lần chia hết cho p của tất cả các số trên bảng không thay đổi trong quá trình thao tác. Công thức cuối cùng cũng hoàn toàn giống nhau—

Quay lại ví dụ kiểm tra: 12 và 18. Với p=2, v₂(12) = 2, v₂(18) = 1, gcd = 1, đóng góp 2¹. Với p=3, v₃(12) = 1, v₃(18) = 2, gcd = 1, đóng góp 3¹. M = 2 × 3 = 6, trùng hoàn toàn với kết quả tính tay.
Phiếu trắng rẻ nhất toàn sàn
Bài toán số học P6 là bài cuối cùng của Ngày 2, yêu cầu chứng minh dãy đệ quy cuối cùng sẽ có tính tuần hoàn.
Năm ngoái, tại IMO 2025, chỉ có 6 người trên toàn cầu giải được P6.
Claude Fable 5: 26 phút, hai vòng, điểm tối đa. GPT-5.6 Sol: 60 phút, hai vòng, điểm tối đa. Kimi K3: 381 phút, bốn vòng, điểm tối đa.
Grok 4.5 trên P6 chỉ tạo ra 7.053 token, đứng cuối bảng. Trong tệp nộp lên ghi rõ một câu: Full proof: (Chưa hoàn thành.)
0,18 USD, tờ trắng rẻ nhất toàn sàn.
Vấn đề của Grok không chỉ dừng lại ở đây. Trong suốt quá trình kiểm tra, nó liên tục rơi vào ảo giác kỳ lạ: khẳng định chắc nịch rằng “bằng chứng đã được ghi vào tệp”, trong khi phía sau hậu trường thậm chí chưa hề chạm vào công cụ ghi.
Đây không phải là vấn đề về khả năng toán học, mà là vấn đề về khả năng của agent. Mô hình biết rằng cần phải viết tệp và tuyên bố đã viết, nhưng ở cấp độ gọi công cụ thì không thực hiện hành động nào.
Ba bước nhảy trong ba năm
Sự tiến hóa kinh hoàng của bộ não silic
Năm 2024, AlphaProof của DeepMind lần đầu tiên chạm đến ngưỡng huy chương bạc ở cấp độ IMO.
Năm 2025, OpenAI và DeepMind cùng hành động. OpenAI không công khai mô hình, giải được 5 câu hỏi và giành huy chương vàng 35 điểm, Gemini Deep Think đạt đến cấp độ tương đương.
Năm 2026, ba mô hình lớn phổ thông đều đạt điểm tuyệt đối. Lần này, không chỉ không được huấn luyện chuyên sâu về toán học, mà còn ai cũng có thể sử dụng. Thậm chí còn có một mô hình là mã nguồn mở.

Người viết thư thách đấu của máy móc
Điểm khởi đầu của toàn bộ cuộc thử nghiệm là một công ty có tên Axiom Math.
Họ đã dịch từng chữ, từng câu cả sáu bài toán của IMO 2026 sang dạng hình thức Lean 4 mà máy tính có thể hiểu được.
Với bộ câu hỏi có thể đọc được bởi máy này, AI mới có thể trực tiếp đầu ra chứng minh Lean và được trình biên dịch chấm điểm tự động, không còn cần giám khảo con người chấm bài.
Sau khi nhận đề bài, Deedy Das nhanh chóng xây dựng khung kiểm thử tự động hóa hoàn toàn. Các mô hình lớn chạy đua trên sân khấu, hoàn thành cả 6 chặng. AxiomProver cũng tự mình đạt điểm tuyệt đối.
Đáng chú ý là người sáng lập Axiom Math, Hồng Lạc Đồng, mới chỉ 25 tuổi. Cô sinh ra ở Quảng Châu và chỉ trong ba năm đã hoàn thành bằng kép về Toán học và Vật lý tại MIT, đồng thời là người nhận giải Morgan Prize.
Cuối năm ngoái, AxiomProver do cô ấy sáng tạo đã đạt điểm tuyệt đối trong kỳ thi toán Putnam. Đây là kỳ tích điểm tuyệt đối thứ 6 trong lịch sử 98 năm của cuộc thi này.
Tháng 3 năm nay, công ty này đã hoàn tất vòng gọi vốn A trị giá 200 triệu USD. Định giá đạt ngay 1,6 tỷ USD.

Cuộc sống của người bình thường sẽ được tái cấu trúc như thế nào
Có thể viết một mô hình với 4.229 dòng chứng minh chặt chẽ, trong tay không chỉ là khả năng giải bài toán.
Nó thực sự kiểm soát chuỗi logic suy luận dài, mỗi bước không được bỏ qua, không được sai và không được mơ hồ.
Các điều khoản hợp đồng có lỗ hổng không, điều kiện bồi thường bảo hiểm có được đáp ứng không, phương án thuế có tuân thủ không—bóc tách ra khỏi bề mặt, tất cả đều là cùng một loại vấn đề: câu trả lời không thể “gần đúng”.
Trước đây, việc kiểm tra từng mục như vậy chỉ có chuyên gia mới thực hiện được, tính phí theo giờ.
Bây giờ, với khả năng này được tích hợp vào các sản phẩm tiêu dùng, khi gặp vấn đề khó khăn, bạn chỉ cần mở điện thoại là xong.
Tài liệu tham khảo:
https://x.com/deedydas/status/2079409461874332066
Bài viết này đến từ tài khoản WeChat "New Intelligence Yuan", tác giả: Apocalypses of ASI, biên tập: Moses
