İsimine bakmazsan, bu, yeniden halka açık olamayacak kadar güçlü bir üst modelin sunduğu bir “hileli” performans olduğunu düşüneceksin:
Bilimsel araştırma yapın: 7 adet önde gelen matematik ve bilgisayar sorununu tek seferde çözün, sunduğunuz 40 sayfa uzunluğundaki kanıt en titiz makine denetimlerinden bile hata bulunmaz;
Mühendislik: Sıfırdan, son derece gerçekçi bir CPU simülatörü yazdım, sistem başarıyla başlatıldı ve hata oranı %0,71;
Kod yazın: Eigen ve ParlayHash gibi iki ana açık kaynak kütüphanesinin çekirdek kodunu optimize edin, değişiklikler doğrudan üst düzey bakım ekibince birleştirildi.
Bu, Google Antigravity ekibinin 27 Ağustos'ta açıkladığı bir performans raporudur.

Teamwork teknik makalesinde, Google Antigravity ekibi matematik, sistem ve açık kaynak olmak üzere üç kategoriye ait sonuçları duyurdu.
Beklenmedik bir şekilde, bu kez büyük hacimli hesaplama kaynakları yutan bir model değil, "hızlı ve ucuz" vurgusunu yapan küçük model Gemini 3.7 Flash öne çıktı.

Google resmi olarak şöyle belirtti: Bu, Flash seviyesindeki bir modelin ilk kez doktora düzeyinde bir matematik çalışması gerçekleştirdiği durum.
Neden düşük maliyetli modeller üst seviyede mücadele edebiliyor?
Sırrı parametrelerde değil, Teamwork adlı çoklu akıllı sistem düzenleme çerçevesinde saklıdır.
Google'un endüstriye gerçekten iletmek istediği sinyal, Flash'in ani olarak akıllılaşmadığı, ancak çalışmanın organizasyon şeklinin değiştiği.
Pro öncülük ediyor
Flash başarıyla yeniden üretildi
Bu raporun ana karakteri kim? Google'ın teknik uzun yazısı çok titiz bir tanımlama yapmıştır:
7 matematik ve teorik bilgisayar bilimi sonucu, başlangıçta tümü Gemini 3.1 Pro tarafından Teamwork uzun kanıt modunda elde edildi.
Ancak şaşırtıcı olan, bu üç temel sonuçtan tamamının Gemini 3.7 Flash tarafından tam olarak yeniden üretilmiş olması.
Bu üç şey, sadece doldurma amaçlı kenar sorunları değildir: ℓp alt uzayı yaklaşımı için coreset yapısı, maksimum iç çarpım gömme boyut alt sınırı ve Hadamard kantizasyonuyla önde gelen sabitleri doğrudan yaklaşık 5,93 kat azaltma.
Her biri, akademik dünyada açıkça tanımlanmış bir sorundur.

Kalan 4 maddesi ise 3.1 Pro tarafından tek başına ele alınmıştır: seyrek konveks optimizasyon için koşul sayısı alt sınırı, önek matris ayrışımı için yaklaşık en iyi alt sınır, Knuth's Cycles zorluğu ve ağ bağlantısı kesildiğinde bağımsız olarak yeniden üretilen Erdős birim mesafe problemi.
Ayrıca, Google'un dahili kayıtlarını güncelleyen TCSBench testindeki %71 lik en yüksek puan, 3.7 Flash ile 3.1 Pro'nun birlikte çalıştırılmasıyla elde edildi ve önceki nesil olan 3.6 Flash ile 3.1 Pro'nun elde ettiği %67,7 rekorunu doğrudan geçti.
Bu arada, dikkat etmemiz gereken gerçek sinyal:
Düzenleme çerçevesini doğru şekilde kurarsanız, Flash gibi hafif modeller, üst düzey modellerin ürettiği araştırmaları tamamen tekrar çalıştırabilir.
Bu, "küçük modellerin ne yapabileceğini" kavramımızın sınırlarını yeniden tanımlamak için yeterlidir.
Teamwork, "Bulmaca"yı sert bir sistem haline getirdi
Teamwork, Antigravity ekibi tarafından geliştirilen çoklu ajan koordinasyon çerçevesidir.
Sadece /teamwork-preview yazın, Gemini ipucunu okuyup kendi kendine modu seçer, hemen bir "AI Uzman Takımı" kurar ve saatlerce hatta günlerce çalışır.
Önceden bahsedilen matematiksel başarılar, tamamıyla Long Proof (Uzun Kanıt) modundan kaynaklanmaktadır.
Tasarım fikri son derece karşıt: parametreleri biriktirmek yerine, bir grup Flash'ın birbirleriyle "eleştirmek, tartışmak, zayıf noktaları bulmak" için bir araya gelmesine dayanıyor.
Peki bu AI'lar tam olarak nasıl toplantı yapıyor? İnceleme sonucunda toplamda dört adım var:
Adım 1: Çılgın rekabetin "Rekabet Stratejisi Arama"
Sistem aynı anda birçok aday方案'u eş zamanlı olarak geliştirir ve her birine yalnızca bu方案'u çürütme görevi verilen özel bir "tartışma uzmanı" atar.
İlginç olan, sert eleştirilere maruz kalan önerilerin doğrudan çöpe atılmaması, aksine tüm karşı görüşlerle süreçte kalmasıdır.
Aslında, gidilemeyen bir “yan yol”da sıklıkla hayati ilham gizlidir.
İkinci adım: Şekle göre ilerleyin, «doğru şekilde ayrıştırın».
Güvenilir bir strateji seçildiğinde, sistem bunu bağımlılıkları olan bir dizi alt soruna ayırır ve sıkı bir topolojik grafik oluşturur. Paralel olarak yürütülebilenler ayrı ayrı ilerler, sıralama gerektirenler ise sıraya girer.
Üçüncü adım: Çılgın iç rekabet olan «İç Turnuva».
Her alt soru içinde bir eleme turnuvası başlatın, düğüm, aday çözümleri okurken sert eleştirileri göz önünde bulundurarak bir üst versiyonu birlikte geliştirin.
Toplu başarısızlık durumunda, birikmiş karşı görüşlerle tekrar çalıştırın ve boşlukları tamamen kapatana kadar devam edin.
Dördüncü adım: “Çarklar arası öğrenme” ile ders çıkarmak.
Başarısız taslaklar, bir sonraki tur için aynen bırakılacak, her bir doğrulayıcının yaşadığı her büyük hata, "Tuzağın Kayıt Defteri'ne" kaydedilecektir.
Geçilen kapalı yollar ve çıkarılan sonuçlar, tüm çalışanların her an erişebileceği şekilde paylaşım bilgi bankasına gerçek zamanlı olarak senkronize edilir.

Long Proof modundaki turnuva ağı: Her aday stratejiye bir falsifier atanır; reddedilen yollar, itirazlarla süreçte kalır.
Bu süreci tamamlamak, soğuk bir süper zekâ gibi değil, kimse suda karanlık olamayacak kadar çok sert bir akademik toplantıyı yeniden oluşturuyor.
Burada, herkesin önerisi önce birkaç tur sertçe incelenir; sadece dayanıklı olanlar başarıyla geçer.
Bu, geleneksel çoklu ajanların en sık yaptığı toplu histeriyeyi doğrudan tedavi eder:
Daha önce bir yapay zeka rastgele ritmi bozduğunda, diğer yapay zekalar körükçe "yanıt sineği" gibi davranıp, yanlış temel üzerine giderek daha da yüksek binalar inşa etti.
İş birliğinin gizli silahı, "birbirini aramak"ı, kimse kaçamayacak bir sert sistem haline getirmektir.
Knuth zorluklarının gerçeği
Bu yedi başarıdan en dikkat çekici ve en çok yanlış anlaşılabilen, Donald Knuth tarafından ortaya atılan Knuth's Cycles zorluğudur.
Aslında bu soru bu yıl bahar seasonunda zaten AI tarafından tamamlandı.

Donald Knuth, 2023 Stanford Noel Dersleri.
Bu yılın Şubat sonunda, Claude Opus 4.6, sadece yaklaşık bir saat içinde tek durumların yapısını hızla ortaya koydu ve Knuth, makalenin başında iki kez "Şok!" yazmak zorunda kaldı.

Daha sonra gpt-5.3-codex ve GPT-5.4 Pro gibi modeller, en zorlu çift durumları da tamamladı.
Orta Nisan'a gelindiğinde, Gartner, makaleinin revize edilmiş versiyonunda çift durumun artık kesinleştiğini açıkça onayladı.
Peki Google bu sefer ne yaptı?
Kısaca, Google, çift durumlar için daha zarif ve basit iki yeni yapı buldu ve aynı zamanda ilk uzun kanıtlarından ikisini, sırasıyla 40 sayfa ve 70 sayfa uzunluğunda yayınladı.
Bu 40 sayfadan fazla olan sert kanıt, Lean formel doğrulamasından da geçti ve makine bile hiçbir hatayı bulamadı.
Bu elbette oldukça sağlam bir akademik katkıdır, ancak gerçek önemi, tamamen sıfırdan bir çözüm üretmekten ziyade «daha güzel bir kanıt sunmak»tedir.
Bu, Teamwork'un gerçekten güçlü olduğu noktayı gösterir:
Bu, tek bir modelin “yalnızca bireysel zeka” sorununu gidermek yerine, kurallı oyunlar ve düzenlemeler yoluyla çoklu akıllı sistemlerin dağılmış ve birbirini taklit eden iş birliği eksikliğini tamamen gidererek “kitle zekası”nı serbest bırakır.
Teorem'den Shell'e
Bu sefer gerçekten Flash yaptı.
Aynı hata bulma mekanizması, Google farklı bir modu değiştirdi ve doğrudan karmaşık mühendisliği yedi.
Bu teknik makalede açıkça "Gemini 3.7 Flash kullanımı" yazmaktadır. Teamwork, sıfırdan bir döngü bazlı, sırasız yürütme RISC-V CPU simülatörü oluşturdu.
Sırasız yürütme, modern yüksek performanslı CPU'ların standart özelliğidir ve simülatörlerin en kolay çöken yeridir.
İş birliği iki aşamada ilerler: Önce mikro mimari fonksiyonlarının doğru çalıştığından emin olun, kendi sıralamalı boru hattınızı ve yeniden sıralama arabelleğinizi yazın ve xv6 işletim sistemini Shell'e kadar başlatın; ardından her döngü için zamanlamayı eşitleyin.

Teamwork tarafından oluşturulan RISC-V simülatörü, xv6 çekirdeğini başlatır ve Shell'e girer.
En zor aşama, Google tarafından "sessiz yürütme boşluğu" olarak adlandırılır.
Simülatörün mikro mimari durumu, yüzlerce çevrim içinde sessizce sapabilir ve mimari düzeyde hata bildirildiğinde kök neden zaten bulunamaz olur.
İşbirliği çözümü, referans simülatörün Spike sandbox ortamına alınarak ajanların çalma ve kopyalama yapmasını engellemek ve tamamen senkronize bir şekilde simülasyon yaparak her adımda denetim yapmaktır.
Sonuç olarak, bu simülatör, RISC-V standart benchmark'larının 100'den fazlasını çalıştırdı ve görülmemiş test yüklerinde BOOM donanımıyla ortalama döngü hatası %0,71 oldu.

Google açıkladı: Teamwork simülatörü ile BOOM donanımının döngü hizalaması karşılaştırmasında, test yükünde ortalama hata %0,71 olarak gözlemlenmedi.
Ancak burada açıkça belirtmek gerekir ki, bu bir yazılım seviyesindeki simülatördür, RTL çip tasarımı değildir ve daha da ötesinde çip üretimi söz konusu değildir.
Gerçek açık kaynak uygulaması
AI araştırmasının ikinci yarısında yerel uygulama ve kabul ön planda.
Matematik ve simülatörlere kıyasla, son kategori sonuçlar en az görkemli görünse de, kanıtları en güçlüdür.
Eigen, C++ dünyasında yaygın olarak kullanılan yüksek performanslı doğrusal cebir kütüphanesidir.
Takım, tek satır veya tek sütun matris vektör çarpımı için en iyi olmayan bir uygulama tespit etti ve doğrudan bir SIMD hızlandırılmış yol oluşturdu.
ParlayHash paralel hash tablosunda, Teamwork, Swiss Table'un iyileştirme fikirlerini benimseyerek 64 iş parçacıklı başlangıç ekleme verimliliğini iki katına çıkarttı, tek iş parçacıklı toplam verimliliği %50 artırdı ve aynı zamanda her bir öğe %25 daha az bellek kullandı.
Bu iki değişiklik, kendi kendine yapılan bir puanlama oyunu değil, sıkı açık kaynak kodu incelemesinden geçerek dışarıdan insan bakıcılar tarafından üst akıma resmen kabul edilen gerçek kodlardır.
Daha dikkat edilmesi gereken, bir matematik makalesinin sonunda yer alan yazar açıklaması: Kanıt, önce Google içi Gemini akıllı sistemi tarafından oluşturuldu, ardından yazarlar tarafından doğrulandı ve düzenlendi.
Akıllı ajanlar sonsuz taslak kağıtlarında çılgınca araştırmayı yürütüyor, insanlar ise imza atıyor ve nihai onayı veriyor. Bu, şu anki AI araştırmasının en gerçekçi分工.
Google kendi kendini çok açıkça ifade ediyor: Bu sorunlar orijinal olarak en iyi uzmanlar tarafından aylarca çözülecek kadar karmaşıktı; Teamwork, deneme-yanılma döngüsünü kısaltıyor, yön ve son onay yetkisi hâlâ insan elinde.
Yapay zeka araştırmasının ikinci yarısında, artık model parametrelerinin kimin daha büyük olduğu değil, kimin yapay zeka ekibini daha iyi kurduğu ölçütüdür.
Model ne kadar ucuz ve anlık kullanım günlük bir ürün gibi olursa, insanların kabulü ve denetimi o kadar değerli olur.
Daha önce insanlar soruyu çözenlerdi. Şimdi insanlar soruyu oluşturan ve kabul edenler.
Gartner, Claude için el yazısıyla kanıt oluşturdu; daha sonra birinin bunu Lean ile doğruladığını öğrendiğinde, "Bu gerçekten iyi bir şey" dedi, çünkü "son zamanlarda daha kolay hata yapmaya başladım".
88 yaşındaki Turing Ödülü sahibinin kanıtı bile doğrulayıcıdan geçmek zorunda, AI tarafından yazılan kanıtlar da istisna olamaz.
Çözüm üretirken makine daha da fazla iş yapar. Kabul aşamasında mutlaka biri gözlemlemelidir.
Kaynaklar:
https://antigravity.google/blog/teamwork-when-ai-becomes-a-research-partner
https://www-cs-faculty.stanford.edu/~knuth/papers/claude-cycles.pdf
Bu yazı WeChat hesabından "Yeni Zihin" tarafından paylaşılmıştır, yazar: ASI Vahiyleri, editör: Yuan Yu
