Nếu không nhìn vào tên, bạn chắc chắn sẽ nghĩ đây lại là một mô hình đỉnh cao mạnh mẽ đến mức không thể phát hành công khai, với thành tích “đánh bùng” vừa được công bố:
Nghiên cứu khoa học: Giải liền 7 bài toán khó nhất trong lĩnh vực toán học và máy tính, bản chứng minh dài 40 trang mà ngay cả hệ thống kiểm tra tự động khắt khe nhất cũng không tìm ra sai sót;
Làm kỹ thuật: Tự viết từ đầu một bộ mô phỏng CPU cực kỳ chân thực, không chỉ khởi động thành công hệ thống mà còn đạt độ sai lệch 0,71%.
Viết mã: vô tình tối ưu hóa mã lõi của hai thư viện mã nguồn mở phổ biến là Eigen và ParlayHash, các thay đổi đã được người duy trì upstream hợp nhất.
Đây là bảng thành tích vừa được nhóm Antigravity của Google công bố vào ngày 27 tháng 8.

Trong bài viết kỹ thuật của Teamwork, nhóm Antigravity của Google đã công bố tập trung ba loại thành tựu: toán học, hệ thống và mã nguồn mở.
Điều bất ngờ là người đảm nhiệm vai trò chính lần này không phải là con quái vật tiêu thụ năng lượng tính toán, mà là mô hình nhỏ nhấn mạnh vào “nhanh và rẻ”: Gemini 3.7 Flash.

Google chính thức đánh giá: Đây là lần đầu tiên một mô hình cấp Flash đạt được thành tựu toán học ở trình độ tiến sĩ.
Tại sao các mô hình giá rẻ lại có thể vượt cấp đánh quái?
Bí mật không nằm ở các tham số, mà nằm ở một khung dây chuyền đa tác nhân có tên Teamwork.
Tín hiệu thực sự mà Google muốn truyền tải đến ngành là: không phải Flash đột nhiên trở nên thông minh, mà là cách thức tổ chức công việc đã thay đổi.
Pro dẫn đầu khám phá
Flash đã tái hiện thành công
Ai là nhân vật chính trong bảng điểm này, bài viết kỹ thuật dài của Google đã đưa ra định nghĩa rất chặt chẽ:
7 kết quả toán học và khoa học máy tính lý thuyết, ban đầu đều được Gemini 3.1 Pro đạt được trong chế độ chứng minh dài của Teamwork.
Điều đáng kinh ngạc là trong số đó, 3 thành quả cốt lõi đã được Gemini 3.7 Flash tái tạo hoàn chỉnh.
Ba vấn đề này hoàn toàn không phải là những vấn đề phụ thuộc để lấp đầy: xây dựng coreset cho xấp xỉ không gian con ℓp, giới hạn dưới về chiều của nhúng tích trong lớn nhất, và lượng tử hóa Hadamard giúp giảm trực tiếp hằng số dẫn đầu khoảng 5,93 lần.
Mỗi vấn đề đều là những bài toán mở trong giới học thuật chính thống.

Bốn nhiệm vụ còn lại do 3.1 Pro đảm nhiệm độc lập, bao gồm giới hạn dưới của số điều kiện cho tối ưu hóa lồi thưa, giới hạn dưới xấp xỉ tối ưu cho phân tích ma trận tiền tố, bài toán Knuth's Cycles, và vấn đề khoảng cách đơn vị Erdős được tái tạo độc lập trong điều kiện mất kết nối mạng.
Không chỉ vậy, điểm cao nhất 71% trong bài đánh giá TCSBench, phá vỡ kỷ lục nội bộ của Google, cũng được tạo ra bởi sự kết hợp giữa 3.7 Flash và 3.1 Pro, vượt qua kỷ lục trước đó là 67,7% do 3.6 Flash kết hợp với 3.1 Pro đạt được.
Trong đó, tín hiệu thực sự đáng chú ý là:
Chỉ cần thiết lập khung bố cục đúng cách, các mô hình nhỏ tập trung vào tính nhẹ như Flash hoàn toàn có thể tái tạo lại các nghiên cứu đã tạo ra mô hình cao cấp.
Điều này đủ để làm mới ranh giới nhận thức của chúng ta về “những mô hình nhỏ có thể làm được gì”.
Teamwork biến "tìm lỗi" thành một chính sách nghiêm ngặt
Teamwork là khung sắp xếp đa tác nhân do nhóm Antigravity phát triển.
Bạn chỉ cần gõ một lệnh /teamwork-preview, Gemini sẽ đọc hết các hướng dẫn, tự chọn chế độ và lập tức kêu gọi thành lập một “đội ngũ chuyên gia AI”, chạy liên tục trong vài giờ thậm chí vài ngày.
Các thành tựu toán học được đề cập ở trên đều xuất phát từ chế độ Chứng minh Dài (Long Proof).
Ý tưởng thiết kế của nó cực kỳ phản trực giác: không dựa vào việc tích lũy thông số, mà dựa vào việc để một nhóm Flash tụ tập lại cùng nhau “chỉ trích, tranh cãi, tìm điểm yếu”.
Vậy những AI này thực sự họp hành như thế nào? Phân tích ra tổng cộng có bốn bước:
Bước đầu tiên: “Tìm kiếm chiến lược cạnh tranh” đầy sự cạnh tranh khốc liệt.
Hệ thống sẽ đồng thời ươm mầm nhiều phương án ứng cử, và giao cho mỗi phương án một chuyên viên phản biện chuyên trách, với KPI duy nhất là bác bỏ phương án đó.
Điều thú vị là các phương án bị chỉ trích nặng nề không hề bị xóa bỏ ngay lập tức, mà vẫn giữ lại trong quy trình với đầy rẫy những ý kiến phản đối.
Sau tất cả, trong một con đường sai lầm không thể đi tiếp, thường ẩn chứa những ý tưởng có thể cứu sống bạn.
Bước thứ hai: Theo hình tìm kiếm, "phân tích chính xác".
Sau khi chọn được chiến lược đáng tin cậy, hệ thống sẽ chia nó thành nhiều vấn đề con có mối quan hệ phụ thuộc và vẽ thành sơ đồ topo chặt chẽ. Những phần có thể song song sẽ được tiến hành độc lập, những phần có thứ tự ưu tiên sẽ tuân thủ sắp xếp theo trình tự.
Bước thứ ba: "Giải đấu nội bộ" với sự cạnh tranh khốc liệt.
Mỗi vấn đề con sẽ tổ chức một vòng loại trực tiếp, các nút vừa đọc các phương án ứng cử, vừa xem các lời phê bình sắc sảo, cùng nhau phối hợp tạo ra một phiên bản nâng cấp.
Nếu tổng thể thất bại, hãy chạy lại với các ý kiến phản đối đã tích lũy cho đến khi vá hết lỗ hổng.
Bước thứ tư: “Học qua trải nghiệm” để rút kinh nghiệm.
Bản nháp thất bại được giữ nguyên để dành cho vòng tiếp theo, mọi bẫy mà bộ xác thực đã đi qua đều được ghi lại vào “Sổ đăng ký bẫy”.
Tất cả các con đường đã đi qua và các kết luận đã được chứng minh đều được đồng bộ hóa thời gian thực vào kho tri thức chung, để mọi người có thể truy cập bất cứ lúc nào.

Mạng lưới giải đấu ở chế độ Long Proof: Mỗi chiến lược ứng cử được gán một falsifier, các đường dẫn bị bác bỏ sẽ được giữ lại trong quy trình kèm theo ý kiến phản đối.
Chạy hết quy trình này, thay vì nói nó là một siêu bộ não lạnh lùng, tốt hơn nên nói nó tái tạo một buổi họp nhóm học thuật cực kỳ khắc nghiệt, không ai có thể lách luật.
Ở đây, bất kỳ kế hoạch nào cũng phải trải qua vài vòng chỉ trích dữ dội; chỉ những xương cứng không thể phá vỡ mới có thể vượt qua suôn sẻ.
Điều này trực tiếp chữa khỏi chứng hoang tưởng tập thể mà các tác nhân đa trí tuệ truyền thống dễ mắc phải:
Trước đây, một AI vô tình làm lệch nhịp độ, các AI khác sẽ mù quáng làm “con vẹt đáp lại”, cuối cùng xây dựng ngày càng cao trên nền tảng sai lầm.
Bí quyết của Teamwork chỉ là biến việc “đi tìm lỗi của nhau” thành một hệ thống cứng nhắc mà không ai có thể trốn tránh.
Sự thật về bài toán Knuth
Trong số 7 thành tựu này, điều đáng chú ý nhất và dễ bị hiểu lầm nhất chính là bài toán Knuth's Cycles do Donald Knuth đề xuất.
In fact, this question was already solved by AI earlier this spring.

Donald Knuth, bài giảng Giáng sinh Stanford 2023.
Cuối tháng 2 năm nay, Claude Opus 4.6 chỉ mất khoảng một giờ để đưa ra cấu trúc cho các tình huống lẻ, khiến Donald Knuth phải viết hai từ “Shock!” ngay ở đầu bài báo.

Tiếp theo, các mô hình như gpt-5.3-codex và GPT-5.4 Pro đã lần lượt ra mắt, hoàn thiện cả những tình huống chẵn khó nhất.
Vào giữa tháng 4, Gartner đã xác nhận rõ ràng trong bản sửa đổi của bài báo rằng tình huống chẵn đã không còn nghi ngờ gì nữa.
Lần này Google đã làm gì?
Nói một cách đơn giản, Google đã tìm ra hai cấu trúc mới tinh tế và đơn giản hơn cho trường hợp số chẵn, đồng thời công bố hai chứng minh đầu tiên dài tới hơn 40 trang và 70 trang.
Trong đó, bản chứng minh cứng cáp hơn 40 trang đã được xác minh hình thức bởi Lean, đến cả máy tính cũng không thể tìm ra bất kỳ lỗi nào.
Đây chắc chắn là một đóng góp học thuật khá vững chắc, nhưng ý nghĩa thực sự của nó nằm ở việc “đưa ra một chứng minh đẹp hơn”, chứ không phải thực sự phá vỡ mọi thứ từ con số không.
Điều này ngược lại cho thấy điểm mạnh thực sự của Teamwork:
Nó không cố gắng bù đắp cho “chỉ số thông minh cô lập” của từng mô hình đơn lẻ, mà thông qua các trò chơi và sắp xếp có hệ thống, đã khắc phục hoàn toàn điểm yếu hợp tác của nhiều tác nhân thông minh—tình trạng rời rạc và đồng thuận vô điều kiện—giải phóng được “trí tuệ tập thể”.
From Theorem to Shell
Lần này đúng là do Flash làm
Cơ chế tìm lỗi giống nhau, Google thay đổi mô hình và trực tiếp áp dụng vào các dự án kỹ thuật nặng.
Bài viết kỹ thuật lần này rõ ràng ghi rõ «sử dụng Gemini 3.7 Flash». Teamwork đã xây dựng từ đầu một bộ mô phỏng CPU RISC-V thực hiện tuần tự và thực thi hỗn loạn.
Thực thi hỗn loạn là tính năng tiêu chuẩn của các CPU hiệu năng cao hiện đại và cũng là nơi dễ khiến trình mô phỏng bị sập nhất.
Hợp tác nhóm chia làm hai bước: trước tiên đảm bảo chức năng vi kiến trúc chính xác, tự viết đường ống phân tán và bộ đệm sắp xếp lại, thành công khởi động hệ điều hành xv6 đến Shell; sau đó căn chỉnh thời gian từng chu kỳ.

Quá trình trình mô phỏng RISC-V do Teamwork xây dựng khởi động nhân xv6 và vào Shell.
Khó khăn nhất là bước ngoặt, Google gọi đây là "khoảng cách thực thi im lặng".
Trạng thái vi kiến trúc của bộ mô phỏng có thể dần lệch đi trong vài trăm chu kỳ, và khi lỗi ở cấp độ kiến trúc được báo cáo thì đã quá muộn để tìm ra nguồn gốc.
Giải pháp của Teamwork là cô lập bộ mô phỏng tham chiếu Spike trong môi trường sandbox để ngăn chặn hành vi gian lận và sao chép của tác nhân, sau đó thực hiện mô phỏng phối hợp đồng bộ toàn bộ quá trình, đối chiếu từng bước.
Cuối cùng, bộ mô phỏng này đã chạy thành công hơn 100 tiêu chuẩn chuẩn RISC-V, với sai số chu kỳ trung bình chỉ 0,71% so với phần cứng BOOM trên các tải kiểm tra chưa từng thấy.

Google tiết lộ: So sánh căn chỉnh chu kỳ giữa bộ mô phỏng Teamwork và phần cứng BOOM, không thấy sai số trung bình 0,71% trên tải kiểm tra.
Tuy nhiên, cần làm rõ rằng đây là trình mô phỏng ở cấp phần mềm, hoàn toàn không phải thiết kế chip RTL, càng không nói đến việc sản xuất chip.
Thực chiến mã nguồn mở chân chính
Ở giai đoạn sau của nghiên cứu AI, sự cạnh tranh nằm ở việc ứng dụng thực tế và nghiệm thu
So sánh với toán học và mô phỏng, kết quả thuộc loại cuối cùng trông có vẻ khiêm tốn nhất, nhưng bằng chứng lại vững chắc nhất.
Eigen là thư viện đại số tuyến tính hiệu năng cao được sử dụng rộng rãi trong thế giới C++.
Teamwork đã phát hiện ra một cách triển khai không tối ưu cho phép nhân ma trận vectơ một hàng hoặc một cột, và tự tay tạo ra một đường dẫn nhanh dựa trên SIMD.
Trong bảng băm đồng thời ParlayHash, Teamwork đã áp dụng các ý tưởng tối ưu hóa của Swiss Table, giúp tăng gấp đôi thông lượng chèn ban đầu với 64 luồng, tăng 1,5 lần thông lượng tổng thể trên một luồng, đồng thời giảm 25% bộ nhớ sử dụng cho mỗi phần tử.
Hai thay đổi này không phải là những bài kiểm tra tự phát được thực hiện trong phòng kín, mà là những đoạn mã thật sự đã trải qua đánh giá mã nguồn mở nghiêm ngặt và chính thức được các nhà duy trì bên ngoài hợp nhất vào nhánh upstream.
Điều đáng chú ý hơn so với điểm chạy là một tuyên bố của tác giả ở cuối bài luận toán học: chứng minh ban đầu được thực hiện bởi hệ thống tác nhân Gemini nội bộ của Google, sau đó được tác giả xác minh và chỉnh sửa.
Các tác nhân chịu trách nhiệm khám phá điên cuồng trên những trang nháp vô tận, trong khi con người chịu trách nhiệm ký tên và xác nhận cuối cùng. Đây chính là sự phân công thực tế nhất trong nghiên cứu AI hiện nay.
Google tự nói rõ ràng: Những vấn đề này vốn cần các chuyên gia hàng đầu dành vài tháng để giải quyết, Teamwork đã rút ngắn chu kỳ thử nghiệm, nhưng tay lái và quyền ký quyết định cuối cùng vẫn nằm trong tay con người.
Ở giai đoạn sau của nghiên cứu AI, điều quan trọng không còn là ai có mô hình với thông số lớn hơn, mà là ai xây dựng được đội ngũ AI tốt hơn.
Mô hình càng rẻ và càng giống như hàng tiêu dùng dùng xong bỏ, thì sự đánh giá và kiểm soát của con người càng trở nên quý giá.
Trước đây, con người là người giải bài toán. Hiện nay, con người là người ra đề và nghiệm thu.
Gartner đã tự tay viết ra chứng minh cho Claude, sau đó mới biết rằng đã có người xác minh nó bằng Lean, anh ấy nói: “Đây thực sự là một điều tốt”, vì bản thân anh ấy “gần đây càng ngày càng dễ mắc lỗi hơn”.
Ngay cả chứng minh của nhà nhận giải Turing 88 tuổi cũng phải qua kiểm tra của trình xác minh, chứng minh do AI viết càng không thể ngoại lệ.
Công việc giải quyết vấn đề, máy sẽ làm ngày càng nhiều. Nhưng khâu nghiệm thu, nhất định phải có người giám sát.
Tài liệu tham khảo:
https://antigravity.google/blog/teamwork-when-ai-becomes-a-research-partner
https://www-cs-faculty.stanford.edu/~knuth/papers/claude-cycles.pdf
Bài viết này đến từ tài khoản WeChat "New Intelligence Yuan", tác giả: ASI Revelation, biên tập: Yuan Yu
