Jika tidak melihat namanya, Anda pasti mengira ini lagi-lagi merupakan model unggulan yang terlalu kuat untuk dirilis publik, dengan catatan prestasi yang luar biasa:
Melakukan penelitian: Menyelesaikan tujuh masalah matematika dan komputer paling canggih sekaligus, dengan bukti panjang 40 halaman yang bahkan peninjauan otomatis paling ketat sekalipun tidak bisa menemukan kesalahan;
Engineering: Wrote a highly realistic CPU simulator from scratch, successfully booted the system with an error rate of 0.71%;
Menulis kode: Secara tidak sengaja mengoptimalkan kode inti dari dua perpustakaan open-source utama, Eigen dan ParlayHash, dan perubahan tersebut langsung digabungkan oleh pemelihara upstream.
Ini adalah hasil kerja tim Antigravity Google yang baru saja dirilis pada 27 Agustus.

Dalam artikel teknis Teamwork, tim Antigravity Google secara terpusat mengumumkan tiga pencapaian: matematika, sistem, dan open source.
Yang mengejutkan, yang menjadi tulang punggung kali ini bukanlah mesin pemakan daya komputasi, melainkan model kecil yang menonjolkan kecepatan dan harga terjangkau: Gemini 3.7 Flash.

Google resmi menyatakan: Ini adalah pertama kalinya model sekelas Flash menghasilkan temuan matematika setara tingkat doktor.
Mengapa model murah bisa mengalahkan musuh yang lebih tinggi level?
Rahasianya bukan pada parameter, tetapi pada kerangka orkestrasi multi-agente bernama Teamwork.
Sinyal sebenarnya yang ingin disampaikan Google kepada industri adalah: bukan Flash tiba-tiba menjadi lebih cerdas, tetapi cara organisasi bekerja telah berubah.
Pro memimpin eksplorasi
Flash berhasil direproduksi
Siapa pemeran utama dalam transkrip ini, artikel teknis Google memberikan definisi yang sangat ketat:
7 hasil dalam matematika dan ilmu komputer teoretis, awalnya seluruhnya diraih oleh Gemini 3.1 Pro dalam mode bukti panjang Teamwork.
Namun, yang menakjubkan adalah tiga hasil inti di antaranya berhasil direplikasi sepenuhnya oleh Gemini 3.7 Flash.
Ketiga hal ini sama sekali bukan masalah pinggiran yang hanya untuk melengkapi: konstruksi coreset untuk pendekatan ruang sub ℓp, batas bawah dimensi untuk embedding produk maksimum, serta kuantisasi Hadamard yang secara langsung menurunkan konstanta terdepan sekitar 5,93 kali.
Setiap item adalah masalah terbuka yang serius di kalangan akademis.

Empat sisanya hanya ditangani oleh 3.1 Pro, termasuk batas bawah kondisi untuk optimasi cekung jarang, batas bawah hampir optimal untuk dekomposisi matriks awalan, masalah Knuth's Cycles, serta masalah jarak satuan Erdős yang direproduksi secara independen dalam kondisi terputus dari jaringan.
Selain itu, skor tertinggi 71% dalam evaluasi TCSBench yang memecahkan rekor internal Google juga dicapai oleh kolaborasi kuat antara 3.7 Flash dan 3.1 Pro, langsung melampaui rekor sebelumnya sebesar 67,7% yang diraih oleh 3.6 Flash bersama 3.1 Pro.
Di antaranya, sinyal yang benar-benar patut kita perhatikan adalah:
Hanya dengan menyusun kerangka kerja dengan benar, model kecil yang berfokus pada ringan seperti Flash sepenuhnya dapat mengulangi kembali penelitian yang menghasilkan model unggulan.
Ini cukup untuk memperluas batasan kita tentang apa yang bisa dilakukan oleh model kecil.
Teamwork menjadikan "mencari kesalahan" sebagai sistem yang ketat
Teamwork adalah kerangka kerja orkestrasi agen ganda yang dikembangkan oleh tim Antigravity.
Kamu hanya perlu ketik /teamwork-preview, Gemini akan membaca petunjuknya, memilih mode sendiri, dan langsung mengajak orang-orang untuk membentuk «tim ahli AI», berjalan selama beberapa jam bahkan beberapa hari.
Hasil matematis yang disebutkan sebelumnya seluruhnya berasal dari mode Long Proof.
Desainnya sangat kontra-intuitif: bukan dengan menumpuk parameter, tetapi dengan membiarkan sekelompok Flash berkumpul saling 'mencari kesalahan, berdebat, dan menyerang kelemahan'.
Lalu, bagaimana sebenarnya para AI ini mengadakan rapat? Dijelaskan secara rinci, total ada empat langkah:
Langkah pertama: "Pencarian strategi persaingan" yang sangat kompetitif.
Sistem akan secara bersamaan mengembangkan sejumlah skenario kandidat dan menugaskan masing-masing skenario dengan seorang "spesialis sanggahan" khusus, dengan satu-satunya KPI yaitu membantah skenario tersebut.
Yang menarik, rencana yang dikritik habis-habisan tidak langsung dibuang ke tempat sampah, tetapi tetap bertahan dalam proses dengan membawa berbagai pendapat penolakan.
Setelah semua, di jalan buntu sering kali tersembunyi inspirasi yang bisa menyelamatkan nyawa.
Langkah kedua: Ikuti petunjuk gambar, "uraikan secara tepat".
Setelah strategi yang andal dipilih, sistem akan memecahnya menjadi sejumlah masalah sub dengan ketergantungan, lalu menggambarkannya sebagai graf topologis yang ketat. Masalah yang dapat diparalelkan akan diproses secara independen, sementara yang memiliki urutan prioritas akan antri dengan tertib.
Langkah ketiga: "Turnamen Internal" yang sangat kompetitif.
Di dalam setiap submasalah, adakan turnamen eliminasi baru, di mana node membaca solusi kandidat sambil mempertimbangkan kritik tajam, dan bersama-sama menyempurnakan versi yang ditingkatkan.
Jika gagal secara komprehensif, jalankan ulang dengan oposisi yang terakumulasi hingga celahnya benar-benar tertutup.
Langkah keempat: "Pembelajaran lintas siklus" yang membuat Anda belajar dari pengalaman.
Draf yang gagal dibiarkan utuh untuk putaran berikutnya, setiap jebakan yang diinjak oleh validator dicatat secara mendalam di "Buku Pencatatan Jebakan".
Jalan buntu yang telah dilalui dan kesimpulan yang telah dibuktikan, semuanya disinkronkan secara real-time ke dalam basis pengetahuan bersama, tersedia untuk semua anggota kapan saja.

Jaringan turnamen mode Long Proof: setiap strategi kandidat diberi satu falsifier, dan jalur yang ditolak tetap dalam proses dengan sanggahan yang diajukan.
Setelah menjalani proses ini, lebih tepat dikatakan ia meniru sebuah pertemuan kelompok akademik yang sangat kejam, di mana tidak ada yang bisa bermain-main.
Di sini, setiap proposal harus melalui beberapa putaran kritik sengit; hanya tulang keras yang tak tergoyahkan yang bisa lolos dengan lancar.
Ini langsung menyembuhkan histeria kelompok paling umum yang sering dilakukan oleh agen tradisional:
Dulu, ketika satu AI tanpa sengaja mengalihkan ritme, AI lainnya akan secara buta meniru, sehingga semakin membangun di atas fondasi yang salah.
Senjata andalan teamwork hanyalah mengubah "saling mencari kesalahan" menjadi sebuah sistem keras yang tak bisa dihindari siapa pun.
Kebenaran tentang teka-teki Knuth
Dari ketujuh pencapaian ini, yang paling menarik dan paling mudah salah tafsir adalah tantangan Knuth's Cycles yang diajukan oleh Donald Knuth.
Faktanya, soal ini sudah selesai dipecahkan oleh AI secara bergiliran pada musim semi tahun ini.

Donald Knuth, kuliah Natal Stanford 2023.
Pada akhir Februari tahun ini, Claude Opus 4.6 hanya membutuhkan sekitar satu jam untuk secara kilat memberikan konstruksi kasus ganjil, sehingga membuat Knuth menulis dua kali 「Shock!」 di awal makalahnya.

Selanjutnya, model-model seperti gpt-5.3-codex dan GPT-5.4 Pro melanjutkan untuk menyelesaikan kasus genap yang paling sulit.
Pada pertengahan April, Gartner secara jelas menegaskan dalam versi revisi makalahnya: kasus genap sudah tidak diragukan lagi.
Apa yang dilakukan Google kali ini?
Secara sederhana, Google menemukan dua konstruksi baru yang lebih elegan dan lebih sederhana untuk kasus genap, sekaligus menghasilkan dua bukti panjang pertama masing-masing berjumlah lebih dari 40 halaman dan 70 halaman.
Bukti keras berjumlah lebih dari 40 halaman tersebut bahkan telah melalui verifikasi formal Lean, sehingga bahkan mesin pun tidak dapat menemukan kesalahan apa pun.
Ini tentu merupakan kontribusi akademis yang cukup kuat, tetapi makna sebenarnya terletak pada "memberikan bukti yang lebih elegan", bukan benar-benar memecahkan masalah dari nol.
Ini justru menunjukkan kekuatan sejati Teamwork:
Ia tidak mencoba memperbaiki "kecerdasan pulau" dari satu model tunggal, tetapi secara radikal mengatasi kelemahan kolaborasi agen jamak yang terpecah belah dan saling menyetujui melalui permainan dan pengaturan yang terinstitusionalisasi, melepaskan "kecerdasan kelompok".
Dari teorema ke Shell
Ini benar-benar ulah Flash
Mekanisme pencarian perbedaan yang sama, Google mengganti mode, langsung mengambil dan menyelesaikan rekayasa inti.
Artikel teknis kali ini secara jelas menyatakan "menggunakan Gemini 3.7 Flash". Teamwork membangun simulator CPU RISC-V berbasis siklus dan eksekusi out-of-order dari nol.
Out-of-order execution adalah fitur standar pada CPU berperforma tinggi modern, dan juga tempat paling mudah menyebabkan emulator crash.
Kerja tim dilakukan dalam dua langkah: pertama, pastikan fungsi mikroarsitektur benar, buat pipeline out-of-order dan reorder buffer sendiri, berhasil menjalankan sistem operasi xv6 hingga ke Shell; kemudian selaraskan timing per siklus.

Proses memulai kernel xv6 dan masuk ke Shell oleh emulator RISC-V yang dibangun oleh Teamwork.
Tahap paling sulit, yang disebut Google sebagai "chasm of silent execution".
Status mikroarsitektur simulator mungkin menyimpang secara halus dalam ratusan siklus, dan ketika kesalahan tingkat arsitektur muncul, akar masalahnya sudah tidak dapat ditemukan lagi.
Solusi Teamwork adalah mengisolasi simulator referensi Spike dalam sandbox untuk mencegah agen mencontek atau curang, lalu melakukan simulasi sinkronisasi penuh dengan verifikasi langkah demi langkah.
Akhirnya, simulator ini berhasil menjalankan lebih dari 100 benchmark standar RISC-V, dengan rata-rata kesalahan siklus hanya 0,71% dibandingkan perangkat keras BOOM pada beban uji yang tidak pernah dilihat sebelumnya.

Google mengungkapkan: Perbandingan sinkronisasi siklus antara simulator Teamwork dan perangkat keras BOOM, tanpa menunjukkan rata-rata kesalahan 0,71% pada beban pengujian.
Namun perlu ditekankan di sini bahwa ini adalah simulator tingkat perangkat lunak, sama sekali bukan desain chip RTL, apalagi proses fabrikasi chip.
Open source praktis dengan tindakan nyata
Di paruh kedua penelitian AI, yang dipertaruhkan adalah penerapan dan penerimaan
Dibandingkan matematika dan simulator, hasil kategori terakhir tampak paling sederhana, tetapi buktinya paling kuat.
Eigen adalah perpustakaan aljabar linier berkinerja tinggi yang sangat luas digunakan di dunia C++.
Tim bekerja sama untuk mengidentifikasi implementasi suboptimal dari perkalian vektor matriks baris atau kolom tunggal, lalu secara langsung membuat jalur cepat SIMD.
Sementara itu, dalam hash table paralel ParlayHash, Teamwork memperkenalkan optimasi dari Swiss Table, yang langsung menggandakan throughput awal insert pada 64 thread, meningkatkan throughput keseluruhan per thread sebesar 1,5 kali, serta mengurangi penggunaan memori per elemen sebesar 25%.
Perubahan ini sama sekali bukan performa self-serving yang dibuat sendiri, melainkan kode asli yang telah melalui tinjauan kode sumber terbuka yang ketat dan secara resmi digabungkan ke dalam cabang utama oleh pemelihara manusia eksternal.
Yang lebih patut diperhatikan daripada skor lari adalah pernyataan penulis di akhir sebuah makalah matematika: bukti awalnya dibuat oleh sistem agen Gemini internal Google, lalu diverifikasi dan diedit oleh penulis.
Agen bertanggung jawab untuk secara liar mengeksplorasi kertas draf tanpa batas, sementara manusia bertanggung jawab untuk menandatangani dan menyetujui akhir. Ini adalah pembagian tugas paling nyata dalam penelitian AI saat ini.
Google sendiri menjelaskan dengan jelas: masalah-masalah ini awalnya akan memakan waktu berbulan-bulan bagi para ahli terkemuka, tetapi Teamwork memperpendek siklus percobaan dan kesalahan, sementara kendali dan hak penandatanganan akhir tetap berada di tangan manusia.
Di babak kedua penelitian AI, yang menjadi ukuran bukan lagi siapa yang memiliki parameter model lebih besar, tetapi siapa yang membentuk tim AI lebih baik.
Semakin murah dan semakin seperti barang sehari-hari yang bisa digunakan kapan saja, semakin berharga evaluasi dan pengawasan manusia.
Dulu, manusia adalah orang yang memecahkan soal. Sekarang, manusia adalah orang yang membuat soal dan memeriksa hasilnya.
Gartner menemukan bukti tulisan tangan untuk Claude, lalu mengetahui bahwa seseorang telah memverifikasinya dengan Lean, dan dia berkata, "Ini benar-benar hal yang baik," karena dia "semakin mudah membuat kesalahan belakangan ini."
Bukti dari penerima Turing Award berusia 88 tahun pun harus melewati validator, apalagi bukti yang ditulis oleh AI.
Semakin banyak tugas yang diselesaikan, semakin banyak pekerjaan yang akan datang. Untuk tahap penerimaan, pastikan ada orang yang mengawasi.
Referensi:
https://antigravity.google/blog/teamwork-when-ai-becomes-a-research-partner
https://www-cs-faculty.stanford.edu/~knuth/papers/claude-cycles.pdf
Artikel ini berasal dari akun WeChat "Sinzhiyuan", penulis: ASI Revelation, editor: Yuanyu
