Kung hindi mo pansin ang pangalan, siguradong isisip mo na ito ay isa pa ring tagumpay na 'cheat code' mula sa isang makapangyarihang model na hindi maaaring ipalabas sa publiko:
Gumawa ng pananaliksik: Isang hinga lang, nalutas ang 7 mga pinakamataas na problema sa matematika at computer science, at ang 40-pahina na patotoo na ipinasa ay hindi nakakatuklas ng anumang kamalian kahit sa pinakamahigpit na pag-aaral ng machine:
Engineering: Sinulat nang mula sa zero ang isang CPU simulator na napakatotoo, na nakapagsimula ng sistema at may error na 0.71%;
Isulat ang code: Sinadya kong pinabuti ang pangunahing code ng dalawang pangunahing open-source library, ang Eigen at ParlayHash, at direkta na kinabibilangan ng mga tagapangalaga ng upstream.
Ito ang bagong resulta na ipinakita ng Google Antigravity team noong Agosto 27.

Sa isang teknikal na artikulo ng Teamwork, ang Google Antigravity team ay nagpahayag ng tatlong uri ng mga resulta: matematika, sistema, at open source.
Sa pagkakataong ito, ang hindi inaasahan ay hindi isang malaking modelong kumakain ng computing power, kundi ang maliit na modelong nakatuon sa 'mabilis at murang' Gemini 3.7 Flash.

Kahit ang opisyal na Google ay nagbigay ng pagtukoy: Ito ang unang beses na ang isang Flash-class model ay nagawa ang isang doktoral na antas ng matematikal na pag-aaral.
Bakit kayang lumampas sa antas ng mga mas murang modelo?
Hindi sa mga parameter ang lihim, kundi sa isang framework para sa pag-organisa ng maraming agent na tinatawag na Teamwork.
Ang tunay na mensahe na nais iparating ng Google sa industriya ay: hindi nagmaliit ang Flash, kundi nagbago ang paraan ng pagpapatakbo.
Pro ang nagtataguyod ng pag-aaral
Flash ay nakapag-reproduce na
Sino ang pangunahing tauhan sa transcript na ito, ayon sa mahabang teknikal na artikulo ng Google:
7 na matematikal at teoretikal na kompyuter na agham na resulta, na unang nakamit lahat ng Gemini 3.1 Pro sa long-proof mode ng Teamwork.
Ngunit ang nakakapanatang bahagi ay ang tatlong makapal na resulta ay na-replicate nang buo ng Gemini 3.7 Flash.
Hindi ito tatlong pangalawang isyu para lamang sa pagsasaklaw: ang pagbuo ng coreset para sa pag-aaproxima ng ℓp subspace, ang ibaba ng dimensyon para sa maximum inner product embedding, at ang Hadamard quantization na direktang bawasan ang leading constant nang humigit-kumulang 5.93 beses.
Bawat isa ay isang seriyosong bukas na problema sa akademya.

Ang natitirang apat ay iniiwanan ng 3.1 Pro, kabilang ang mas mababang hangganan ng bilang ng kondisyon para sa sparse convex optimization, mas mababang hangganan ng approximately optimal para sa prefix matrix factorization, ang Knuth's Cycles problem, at ang Erdős unit distance problem na muling isinulat nang independiyente sa kawalan ng internet.
Hindi lang iyon, ang pinakamataas na marka na 71% sa TCSBench na nag-break ng internal record ng Google ay nakuha rin ng 3.7 Flash at 3.1 Pro, na direktang lalong inilampas ang nakaraang rekord na 67.7% na nakuha ng 3.6 Flash at 3.1 Pro.
Kung saan, ang tunay na signal na dapat nating tandaan ay:
Kung tama ang framework ng pagkakasunod-sunod, ang mga maliit na modelo tulad ng Flash na nakatuon sa lightweight ay kumpleto ang pagpapatakbo muli ng mga pag-aaral na naglabas ng flagship models.
Sapat na ito upang palawakin ang ating pag-unawa sa mga kakayahan ng maliit na modelo.
Ang Teamwork ay ginawa ang "找茬" bilang isang matibay na patakaran
Ang Teamwork ay isang framework para sa pag-organisa ng maraming agent na nilikha ng team ng Antigravity.
Kailangan mo lang i-type ang /teamwork-preview, at sasabihin ng Gemini ang prompt, pipili ng mode, at agad na hihingi ng mga tauhan upang bumuo ng isang “team ng AI expert,” na magpapatakbo nang ilang oras o kahit ilang araw.
Ang mga matematikal na resulta na nabanggit sa nakaraan, lahat ay galing sa Long Proof mode.
Ang kanyang desenyong isip ay lubos na kontraintuitibo: hindi nakasalalay sa pagpupuno ng mga parameter, kundi sa pagpupulong ng isang grupo ng Flash upang mag-isa-isa, magtalo, at maghanap ng mga kahinaan.
Paano ba talaga nagkikita ang mga AI na ito? Pagkatapos ng pagpapakita, mayroon lamang apat na hakbang:
Unang hakbang: Ang "paghahanap ng pagsusulong sa kompetisyon" na puno ng pagkakaroon ng sobrang pagpapalakas.
Sisimulan ng sistema ang paghahanda ng maraming kandidatong solusyon at ibibigay ang isang espesyal na “tagapagbantay” sa bawat solusyon, kung saan ang tanging KPI ay ang pagpapatunay na mali ang solusyon.
Kakaibang bagay, ang mga plano na pinagtatalunan nang malakas ay hindi agad itinatapon sa basurahan, kundi nananatili sa proseso kasama ang lahat ng mga kontra.
Sa katotohanan, sa isang 'maling daan' na hindi makakarating sa hangad, madalas na nakatago ang isang inspirasyon na makakatulong sa pagliligtas.
Pangalawang hakbang: Sundin ang larawan, "masusing i-decompose".
Pagkatapos piliin ang kapanatagan na estratehiya, ihihiwalay ng sistema ito sa isang hanay ng mga sub-problema na may mga pagkakabasehan, at isasagawa ito sa isang mahigpit na topological diagram. Ang mga independiyenteng bahagi ay maaaring masagawa nang paralelo, habang ang mga may pagkakasunod-sunod ay magpapahintulot nang maayos.
Hakbang 3: Ang pambihirang "loob na paligsahan".
Sa loob ng bawat sub-question, maglalabas ng isang elimination tournament; ang bawat node ay magbabasa ng mga kandidatong solusyon habang sinusuri ang mga masasamang komento, at magkakasama silang hahawakan upang lumikha ng isang upgraded na bersyon.
Kung bumigo ang komprehensibong pagsubok, i-rerun ito kasama ang nakumpol na mga pagtutol hanggang sa matapos ang mga butas.
Hakbang 4: Ang “cross-cycle learning” na nagtuturo sa iyo mula sa bawat pagkakamali.
Iwanan nang buo ang nabigo mong draft para sa susunod na round, at ang bawat malaking kalokohan na dinala ng validator ay ipon sa “Registry ng Trap”.
Ang lahat ng mga daang patay at mga konklusyon na patunay ay sinasalaysay nang real-time sa shared knowledge base, para sa paggamit ng lahat ng miyembro kahit kailan.

Sa tournament network ng Long Proof mode: bawat kandidatong estratehiya ay may isang falsifier, at ang mga apektadong ruta ay nananatili sa proseso kasama ang kanilang mga pagtutol.
Pagkatapos mong pasabugin ang proseso na ito, higit itong katulad ng isang napakahirap at walang patawad na sesyon ng akademikong grupo kaysa isang malamig na super utak.
Dito, kailangan munang masiraan ng ilang beses ang anumang plano bago makapag-pass ang mga matitigas na hamon.
Ito ang diretso paggamot sa group hysteria na karaniwang ginagawa ng tradisyonal na multi-agent:
Kanina, kapag isang AI ay nagkamali at nagpalit ng ritmo, ang iba pang AI ay magiging mga «tugon-ayon» nang walang pag-iisip, at sa huli ay lalayo pa sa maling pundasyon.
Ang pangunahing lakas ng teamwork ay ang pagpapalit ng "paghahanap ng mali sa isa't isa" sa isang matibay na sistema na walang makakalikas.
Totoo sa Knuth Challenge
Tungkol sa mga resultang ito, ang pinakamakapagpabigla at pinakamadaling maliitin ay ang Knuth's Cycles problem na inilahad ni Donald Knuth.
Sa totoo lang, natapos na ng AI ang tanong na ito noong tag-init ng taong ito.

Donald Knuth, 2023 Stanford Christmas Lecture.
Noong huling bahagi ng Pebrero ng taong ito, ginamit lamang ni Claude Opus 4.6 ang isang oras upang biglaan ang pagbuo ng mga kaso ng odd, na nagpilit kay Knuth na isulat ang dalawang «Shock!» sa simula ng kanyang papel.

Agad ay sumunod ang mga modelo tulad ng gpt-5.3-codex at GPT-5.4 Pro upang mapuno ang pinakamahirap na mga kaso ng even numbers.
Sa mid-April, tiyak na sinabi ng Gartner sa revised paper na ang even cases ay walang alinlangan.
Ano ang ginawa ng Google ngayon?
Sa simpleng salita, natagpuan ng Google ang dalawang mas elegante at mas simpleng konstruksyon para sa mga even case, at inilabas agad ang dalawang unang mahabang patotoo na may habang 40+ pahina at 70+ pahina.
Ang isang 40+ pahina na matibay na patunay ay na-verify na sa Lean formal verification, kaya't kahit ang machine ay hindi makakahanap ng anumang kamalian.
Ito ay siguradong malaking akademikong kontribusyon, ngunit ang tunay na kahalagahan nito ay ang "pagbibigay ng mas magandang patunay," hindi nang talagang magsimula mula sa sero.
Ito ay nagpapakita ng totoong lakas ng Teamwork:
Hindi ito naglalayong kompletuhin ang “island intelligence” ng isang hiwalay na modelo, kundi sa pamamagitan ng institutionalized na paglalaro at pagpaplano, ito ay lubos na nilutas ang kahinaan sa pakikipagtulungan ng maraming mga agent na nasa kalagayang kawalan ng pagkakaisa at patuloy na pagsang-ayon, at ipinakita ang “collective intelligence”.
Mula sa theorem hanggang Shell
Totoo naman na si Flash ang gumawa nito
Sama na sistema ng paghahanap ng pagkakaiba, nagbago ang Google ng mode, at direkta itong ginamit para harapin ang mga matitigas na inhinyeriya.
Sa patuloy na teknikal na artikulo, sinasabi nang malinaw na «gumamit ng Gemini 3.7 Flash». Gumawa ang Teamwork ng isang RISC-V CPU simulator na may cycle-level at out-of-order execution mula sa zero.
Ang out-of-order execution ay standard sa modernong high-performance CPU at ang pinakamadaling mag-cause ng crash sa emulator.
Ang teamwork ay nagsasagawa sa dalawang hakbang: una, siguraduhin ang tamang paggana ng microarchitecture, isulat ang sarili mong out-of-order pipeline at reorder buffer, at matagumpay na i-start ang xv6 operating system hanggang sa Shell; pagkatapos, i-align ang timing sa bawat cycle.

Ang proseso ng pagpapagana ng xv6 kernel at pagpasok sa Shell ng isang RISC-V simulator na binuo ng Teamwork.
Ang pinakamahirap na hamon, tinatawag ng Google na "silent execution gap".
Ang estado ng microarchitecture ng simulator ay maaaring magkamali nang tahimik sa loob ng mga sandaling siklo, at nang magkakaroon ng error sa arkitektural na antas, ay nasa dulo na ang pinagmulan.
Ang solusyon sa teamwork ay ang pag-isolate ang reference simulator Spike sa isang sandbox upang maiwasan ang pag-cheat at pag-copy ng mga agent, at pagkatapos ay mag-synchronize nang buong proseso sa simulation, na may pagpapatotoo sa bawat hakbang.
Sa wakas, ang simulator na ito ay nakapasa sa higit sa 100 RISC-V standard benchmark, at ang average error sa bilang ng cycle ay lamang 0.71% sa mga test load na hindi nakikita bago.

Ipinakita ng Google: Walang average error na 0.71% sa pagkakasunod ng cycle sa Teamwork simulator at BOOM hardware sa mga test load.
Ngunit kailangang malinaw dito na ito ay isang simulator sa software level, hindi ito RTL chip design, at mas hindi pa ang paggawa ng chip.
Open-source na pagsasagawa nang totoo
Sa ikalawang bahagi ng AI research, ang pagtatapos at pagpapatotoo ang pinagsasapian.
Kumpara sa matematika at simulator, ang huling klase ng resulta ay tila pinakamaliit, ngunit ang ebidensya nito ay pinakamalakas.
Ang Eigen ay isang mataas na performance na library ng linear algebra na malawak na ginagamit sa mundo ng C++.
Ang Teamwork ay natuklasan ang isang hindi optimal na implementasyon ng pagpaparami ng vector ng matrix sa isang row o column, at direktang isinulat nila ang isang mabilis na path gamit ang SIMD.
Sa paralel na hash table na ParlayHash, ipinakilala ng Teamwork ang mga pagpapabuti ng Swiss Table, na nagdulot ng pagdoble sa initial insertion throughput sa 64 threads, pagtaas ng 1.5 beses sa overall throughput sa isang thread, at pagbawas ng 25% sa memorya bawat elemento.
Hindi ito mga pagbabagong gawa sa pribado o sariling pagpapahalaga, kundi totoong code na nauunawaan nang buong disiplina sa proseso ng pagrerebyu ng bukas na code at opisyal na isinama sa upstream branch ng mga panatilihang tao.
Mas mahalaga kaysa sa score ranking ay ang isang pahayag ng may-akda sa dulo ng isang matematikong papel: ang patotoo ay unang ginawa ng loob na sistema ng Gemini AI ng Google, at pagkatapos ay tiniyak at in-edit ng may-akda.
Ang mga agent ay naglalayong mag-explore nang walang hanggan sa mga papel ng draft, habang ang mga tao ang nagpapahintulot at nagtatapos ng pagpapakita. Ito ang pinakatotoong paghahati ng trabaho sa kasalukuyang pananaliksik sa AI.
Sinabi nang malinaw ng Google: ang mga problema na ito ay karaniwang kailangan ng mga eksperto na mag-attend ng ilang buwan, ngunit pinapabilis ng Teamwork ang cycle ng pagsubok at pagkakamali—ang direksyon at huling pagsang-ayon ay nasa kamay ng tao pa rin.
Sa pangalawang bahagi ng pag-aaral ng AI, hindi na ang pinag-uusapan kung sino ang may mas malaking parameter ng modelo, kundi sino ang mas magandang nagbuo ng kanilang AI team.
Mas mahalaga ang pagtanggap at pagmamasid ng tao kung mas mura at mas parang pang-araw-araw na gamit ang modelo.
Kahit sa nakaraan, ang tao ay naglutas ng mga problema. Ngayon, ang tao ay naglalikha at nagpapatotoo ng mga problema.
Natagpuan ni Gartner ang konstruksyon ng hand-written proof para kay Claude, at nang malaman niya na may nag-verify nito gamit ang Lean, sinabi niya, "Ito ay talagang magandang bagay," dahil siya ay "lalong madaling magsalang sa huling panahon."
Kahit ang patotoo ng 88-taong-gulang na tagapagwagi ng Parangal Turing ay kailangang pumasok sa validator, mas hindi ito maaaring iwasan ng mga patotoo na isinulat ng AI.
Sa paglutas ng mga problema, mas marami ang gagawin ng machine. Sa pagsusuri, dapat may tao na nakaabang.
Mga sanggunian:
https://antigravity.google/blog/teamwork-when-ai-becomes-a-research-partner
https://www-cs-faculty.stanford.edu/~knuth/papers/claude-cycles.pdf
Nakamula sa WeChat public account na “Xinzhiyuan,” may-akda: ASI Revelation, in-edit ni Yuanyu
