Jika bukan kerana namanya, anda pasti akan menyangka ini sekali lagi merupakan model top yang terlalu kuat untuk diterbitkan secara umum, dengan rekod yang luar biasa:
Melakukan penyelidikan: Menyelesaikan tujuh masalah matematik dan komputer terkemuka dalam satu tarikan nafas, dengan bukti panjang 40 halaman yang tidak dapat ditemui sebarang kesalahan oleh pemeriksaan mesin yang paling ketat;
Rekabentuk kejuruteraan: Menulis semula simulator CPU yang sangat realistik dari awal, berjaya memulakan sistem dengan ralat 0.71%;
Menulis kod: Secara tidak sengaja mengoptimumkan kod utama dua perpustakaan sumber terbuka utama, Eigen dan ParlayHash, dan perubahan tersebut secara langsung digabungkan oleh pengekalan hulu.
Ini adalah keputusan terkini yang dikeluarkan oleh pasukan Antigravity Google pada 27 Ogos.

Dalam artikel teknikal Teamwork, pasukan Antigravity Google mengumumkan tiga kategori pencapaian: matematik, sistem, dan sumber terbuka.
Secara mengejutkan, yang menjadi tulang belakang kali ini bukanlah mesin pemakan daya komputasi, melainkan model kecil yang menonjolkan「cepat dan murah」: Gemini 3.7 Flash.

Google rasmi bahkan menetapkan: Ini adalah pertama kalinya model Flash menghasilkan kajian matematik peringkat doktor.
Mengapa model yang murah mampu mengalahkan musuh yang lebih tinggi?
Rahsianya bukan terletak pada parameter, tetapi dalam kerangka kerja pengaturan agen pelbagai bernama Teamwork.
Sinyal sebenarnya yang ingin disampaikan Google kepada industri ini adalah: bukan Flash tiba-tiba menjadi lebih bijak, tetapi cara organisasi bekerja telah berubah.
Pro memimpin eksplorasi
Flash berjaya direplikasi
Siapakah tokoh utama dalam laporan pencapaian ini? Teks teknikal Google memberikan definisi yang sangat ketat:
7 keputusan dalam matematik dan sains komputer teori, yang awalnya semuanya dicapai oleh Gemini 3.1 Pro dalam mod bukti panjang Teamwork.
Namun, yang menakjubkan adalah tiga hasil keras tersebut telah sepenuhnya direplikasi oleh Gemini 3.7 Flash.
Ketiga-tiga perkara ini bukanlah isu pinggiran yang hanya untuk melengkapkan: pembinaan coreset untuk penghampiran ruang ℓp, had bawah dimensi untuk penyisipan hasil darab maksimum, serta kuantisasi Hadamard yang secara langsung mengurangkan pemalar terkemuka sebanyak 5.93 kali.
Setiap satu adalah masalah terbuka yang serius di kalangan akademik.

Empat lagi ditangani sepenuhnya oleh 3.1 Pro, termasuk batas bawah nombor kondisi untuk pengoptimuman cembung jarang, batas bawah hampir optimum untuk pemfaktoran matriks awalan, masalah Kitaran Knuth, serta masalah jarak unit Erdős yang diperoleh secara bebas dalam keadaan tiada sambungan internet.
Selain itu, penilaian TCSBench yang memecahkan rekod dalaman Google dengan skor tertinggi 71% juga dihasilkan oleh gabungan kuat 3.7 Flash dan 3.1 Pro, secara langsung melampaui rekod sebelumnya sebanyak 67.7% yang dicapai oleh 3.6 Flash bersama 3.1 Pro.
Di antaranya, isyarat yang benar-benar perlu kita perhatikan ialah:
Selagi kerangka penyusunan ditetapkan dengan betul, model kecil yang ringan seperti Flash sepenuhnya boleh mengulangi semula penyelidikan yang menghasilkan model unggul.
Ini cukup untuk memperluas batasan kita terhadap “apa yang boleh dilakukan oleh model kecil”.
Teamwork menjadikan "mencari kesalahan" sebagai sistem yang ketat
Teamwork ialah kerangka pengaturan agen pelbagai yang dibangunkan oleh pasukan Antigravity.
Hanya perlu ketik /teamwork-preview, Gemini akan membaca petunjuk, memilih modus sendiri, serta mengumpulkan segera sebuah "pasukan pakar AI" yang boleh berjalan selama beberapa jam bahkan beberapa hari.
Hasil matematik yang disebutkan sebelumnya semuanya berasal daripada mod Long Proof.
Pendekatan rekaannya sangat bertentangan dengan intuisi: bukan bergantung pada penambahan parameter, tetapi dengan membiarkan sekumpulan Flash berkumpul dan saling "mencari kesalahan, berdebat, dan menyerang kelemahan".
Lalu, bagaimana sebenarnya AI ini mengadakan mesyuarat? Secara terperinci, ia terdiri daripada empat langkah:
Langkah pertama: "Pencarian strategi persaingan" yang sangat kompetitif.
Sistem akan mengembangkan banyak skema kandidat secara serentak dan menugaskan seorang "spesialis perbantahan" khusus untuk setiap skema, dengan KPI tunggal ialah membantah skema tersebut.
Yang menariknya, cadangan yang dipersoalkan habis-habisan tidak langsung dibuang ke tong sampah, tetapi kekal dalam proses dengan membawa semua pendapat bertentangan.
Setelah semua, di jalan sesat yang tidak boleh dilalui, seringkali tersembunyi inspirasi yang boleh menyelamatkan nyawa.
Langkah kedua: Ikuti gambar, "uraikan secara tepat".
Setelah strategi yang boleh dipercaya dipilih, sistem akan memecahkannya menjadi sekumpulan masalah kecil yang saling bergantung, kemudian menggambarkannya sebagai graf topologi yang ketat. Masalah yang boleh dijalankan secara serentak akan diproses secara berasingan, manakala masalah yang memerlukan urutan tertentu akan menunggu giliran dengan tertib.
Langkah ketiga: "Pertandingan dalaman" yang sangat kompetitif.
Setiap subsoal akan diadakan pertandingan kalah gugur sendiri, di mana nod akan membaca cadangan sambil mempertimbangkan kritikan tajam, bekerjasama untuk menghasilkan versi yang ditingkatkan.
Jika gagal secara komprehensif, jalankan semula dengan cadangan bertentangan yang telah dikumpulkan, sehingga semua kelemahan ditutup sepenuhnya.
Langkah keempat: "Pembelajaran lintas roda" yang menjadikan pengalaman buruk sebagai pelajaran.
Draf yang gagal dibiarkan tanpa perubahan untuk sesi seterusnya, setiap jebakan yang dilalui validator direkodkan secara penuh dalam 'Buku Pencatatan Jebakan'.
Semua jalan buntu yang telah dilalui dan kesimpulan yang telah dibuktikan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan disegerakan dis

Jaringan pertandingan mod Long Proof: Setiap strategi calon dilengkapi dengan seorang falsifier, dan laluan yang ditolak tetap berada dalam proses dengan keberatan yang diajukan.
Setelah menjalani proses ini, ia bukan sekadar otak super yang dingin, tetapi lebih seperti meniru mesyuarat akademik yang sangat kejam, di mana tiada siapa pun boleh bermain air keruh.
Di sini, sebarang cadangan mesti melalui beberapa putaran kritik sengit; hanya tulang keras yang tidak dapat dihancurkan yang akan berjaya melalui tahap ini.
Ini secara langsung menyembuhkan histeria kumpulan yang paling sering dilakukan oleh agen majmuk tradisional:
Dahulu, apabila satu AI tanpa sengaja mengubah irama, AI lain akan secara buta menjadi "peniru", akhirnya membina lebih tinggi di atas tapak yang salah.
Kelebihan kerja pasukan hanyalah mengubah "saling mencari kesalahan" menjadi satu sistem ketat yang tidak boleh dielakkan oleh siapa pun.
Kebenaran tentang teka-teki Knuth
Mengenai tujuh pencapaian ini, yang paling menarik perhatian dan paling mudah disalahertikan ialah masalah Knuth's Cycles yang dicadangkan oleh Donald Knuth.
Sebenarnya, soal ini telah selesai dipecahkan oleh AI pada musim bunga tahun ini.

Donald Knuth, Kuliah Krismas Stanford 2023.
Pada akhir Februari tahun ini, Claude Opus 4.6 hanya memerlukan sekitar satu jam untuk secara kilat memberikan konstruksi kesan ganjil, memaksa Knuth menulis dua kali 「Shock!」 di awal makalahnya.

Seterusnya, model seperti gpt-5.3-codex dan GPT-5.4 Pro menyusul, melengkapkan kes-kes nombor genap yang paling sukar.
Pada pertengahan April, Gartner secara jelas mengesahkan dalam versi semakan kertas kerjanya: kes genap sudah tidak diragukan lagi.
Apa yang Google lakukan kali ini?
Secara ringkas, Google menemukan dua konstruksi baru yang lebih elegan dan lebih mudah untuk kesan genap, sekaligus mengeluarkan dua bukti panjang pertama yang masing-masing berjumlah lebih dari 40 halaman dan 70 halaman.
Bukti ketat berjumlah lebih daripada 40 muka surat itu juga telah melalui pengesahan formal Lean, sehingga mesin pun tidak dapat menemui sebarang kesalahan.
Ini tentu merupakan sumbangan akademik yang cukup kukuh, tetapi makna sebenarnya terletak pada "memberikan bukti yang lebih indah", bukan pada keberhasilan benar-benar memecahkan masalah dari awal.
Ini justru menunjukkan kekuatan sebenar Teamwork:
Ia tidak cuba memperbaiki "kecerdasan pulau" bagi satu model individu, tetapi dengan permainan dan pengaturan yang diinstitusikan, ia telah memperbaiki kelemahan kolaborasi pelbagai agen yang tersebar dan saling menyetujui, melepaskan "kecerdasan kumpulan".
Dari teorem ke Shell
Ini benar-benar kerjaan Flash
Mekanisme cari kesalahan yang sama, Google tukar modus, terus teruskan ke rekabentuk teknikal yang rumit.
Tulisan teknikal kali ini secara jelas menyatakan «menggunakan Gemini 3.7 Flash». Teamwork membina simulator CPU RISC-V berperingkat dan pelaksanaan tidak berurutan dari awal.
Eksekusi rawak adalah standard untuk CPU berprestasi tinggi moden, dan juga tempat paling mudah untuk simulator gagal.
Kerja sama dilakukan dalam dua langkah: pertama, pastikan fungsi mikroarkitektur betul, tulis saluran pesanan rawak dan penyangga penyusunan semula sendiri, berjaya memulakan sistem operasi xv6 hingga ke Shell; kemudian, selaraskan masa setiap kitaran.

Proses memulakan kernel xv6 dan memasuki Shell oleh simulator RISC-V yang dibina oleh Teamwork.
Tahap paling sukar, yang dipanggil Google sebagai "kesenjangan pelaksanaan senyap".
Keadaan mikroarkitektur simulator mungkin berpaling sedikit demi sedikit dalam ratusan kitar, dan apabila ralat pada peringkat arkitektur dilaporkan, punca asalnya sudah tidak dapat dikenal pasti.
Penyelesaian Teamwork adalah dengan mengisolasikan simulator rujukan Spike dalam sandbox untuk mencegah agen menipu atau menjiplak, kemudian menjalankan simulasi bersama secara serentak dengan pengesahan pada setiap langkah.
Pada akhirnya, simulator ini menjalankan lebih daripada 100 standard benchmark RISC-V, dengan ralat purata siklus hanya 0.71% berbanding peranti BOOM pada beban ujian yang tidak pernah dilihat sebelumnya.

Google mengungkap: Perbandingan selarasan siklus antara simulator Teamwork dan perangkat keras BOOM, tanpa ralat purata 0.71% pada beban ujian.
Namun, perlu ditekankan di sini bahawa ini adalah simulator perisian, bukan reka bentuk cip RTL, apalagi pembuatan cip melalui proses pelarian.
Pembangunan sumber terbuka secara langsung
Di separuh kedua penyelidikan AI, yang ditentukan adalah pelaksanaan dan pengesahan.
Dibandingkan dengan matematik dan simulator, hasil kelas terakhir kelihatan paling tidak menonjol, tetapi buktinya paling kukuh.
Eigen adalah pustaka algebra linear berprestasi tinggi yang digunakan secara meluas di dunia C++.
Teamwork mengesan satu pelaksanaan suboptimal bagi pendaraban vektor matriks satu baris atau satu lajur, dan secara langsung mencipta laluan pantas SIMD.
Dalam ParlayHash, Teamwork memperkenalkan pengoptimuman Swiss Table, yang menjadikan throughput permulaan dengan 64 benang berlipat ganda, meningkatkan throughput keseluruhan satu benang sebanyak 1.5 kali, serta mengurangkan penggunaan memori setiap elemen sebanyak 25%.
Perubahan-perubahan ini bukan sekadar penilaian diri yang dilakukan secara tertutup, tetapi kod sebenar yang telah melalui tinjauan kod sumber terbuka yang ketat dan secara rasmi digabungkan ke dalam cabang hulu oleh pengekalkan manusia luar.
Yang lebih patut diperhatikan selain skor lari ialah satu pernyataan pengarang di akhir sebuah kertas matematik: bukti pertama kali dihasilkan oleh sistem agen Gemini dalaman Google, kemudian disemak dan diedit oleh pengarang.
Agen bertanggung jawab untuk menjelajahi kertas draf tanpa henti, sementara manusia bertanggung jawab untuk menandatangani dan menyetujui akhir. Ini adalah pembahagian tugas paling sebenar dalam penyelidikan AI semasa ini.
Google sendiri menyatakan dengan jelas: masalah-masalah ini sebelumnya memerlukan pakar terkemuka untuk menyelesaikannya selama beberapa bulan, Teamwork memperpendek siklus percubaan, tetapi arah dan hak tanda tangan terakhir masih berada di tangan manusia.
Paruh kedua penyelidikan AI bukan lagi tentang siapa yang mempunyai parameter model yang lebih besar, tetapi siapa yang membina pasukan AI yang lebih baik.
Semakin murah dan semakin seperti barangan yang boleh digunakan secara serta-merta, semakin berharga pengesahan dan pengawasan manusia.
Dahulu, manusia ialah orang yang menyelesaikan masalah. Sekarang, manusia ialah orang yang mencipta dan mengesahkan soalan.
Gartner mendapati bukti tulisan tangan untuk Claude, kemudian mendapat tahu bahawa seseorang telah mengesahkannya menggunakan Lean, beliau berkata, "Ini benar-benar perkara yang baik," kerana beliau "semakin mudah membuat kesilapan belakangan ini."
Bukti daripada penerima Anugerah Turing berusia 88 tahun pun perlu melalui pemeriksa, apalagi bukti yang ditulis oleh AI.
Semakin banyak tugas yang diselesaikan, semakin banyak tugas yang akan datang. Pada tahap penerimaan, pastikan ada seseorang yang mengawasi.
Rujukan:
https://antigravity.google/blog/teamwork-when-ai-becomes-a-research-partner
https://www-cs-faculty.stanford.edu/~knuth/papers/claude-cycles.pdf
Artikel ini berasal daripada akaun微信公众号 "Sinzhiyuan", penulis: ASI Revelation, penyunting: Yuan Yu
