Google'in Gemini 3.8 Flash'ı, düşük maliyetle ve yüksek performansla en iyi AI modellerini zorluyor

icon MarsBit
Paylaş
AI summary iconÖzet
Google, Gemini 3.8 Flash ve kiber güvenlik varyantı Gemini 3.8 Flash Cyber’i tanıttığında en üst seviye altcoin haberleri patlıyor. Model, tek görevler için milyon token başına 0,58 dolar, girdi için 0,75 dolarla GPT-5.6 Sol ve Grok 4.6’yı aşıyor ya da eşitliyor. Gemini 3.8 Flash Cyber, CyberGym testlerinde %86,2 puan alıyor ve iki saatte kritik hataları tespit ediyor. Google’ın hız, düşük maliyet ve yinelemeli akıl yürütme üzerine odaklanması, AI + kripto haber dünyasını sarsıyor ve “büyüklük daha iyidir” modelini zorluyor.

Tam olarak şimdi, Google geri döndü!

Bu gece, Google resmen Gemini 3.8 Flash ve kiber güvenliğe odaklanmış Gemini 3.8 Flash Cyber'ı yayınladı.

Bu, Google'ın altı hafta içinde yayımladığı üçüncü Flash sürümü.

İki önceki güncellemeler sadece ısınma gibi görünüyordu, çünkü bu sefer Google doğrudan fiyat-performans oranını öne çıkartıyor—

Tek görev maliyeti 0,58 dolar! Girdi sadece 0,75 dolar/milyon Token!

Bu kadar düşük bir fiyata sahip küçük model, birkaç temel performans testinde küresel en üst düzey Opus 5, GPT-5.6 Sol ve Grok 4.6'nın seviyesine ulaştı.

Google DeepMind'in uzmanı Yao Shunyu, model için bunun sadece küçük bir adım olduğunu, ancak RSI için büyük bir sıçrama olduğunu söyledi.

Google

X'te geliştiriciler patladı.

Birisi deneme yaptıktan sonra şöyle sordu: “Tanrım, Google yanlış ürün mü gönderdi? Bu, daha önce piyasaya sürülmeyen Gemini 3.5 Pro mu? Flash fiyatıyla Pro işlevini yapıyor!”

Google

Google

DeepMind ekibinde, temmuzdan beri kimse gözünü kapatmamış olabilir.

Herkes Fable 5.1'i hâlâ sindirirken, Google tekrar masayı devirdi.

Google'nin "en çok çalışanı" geri döndü: En iyi fiyat-performans oranı

Uzun süredir sessiz kalan Google, dünya karşısına son derece rekabetçi bir şekilde büyük iblisin geri döndüğünü ilan etti.

Google

Gemini 3.8 Flash'ın yarattığı etkiyi anlamak için şu anki AI pazarının durumuna bakmalıyız.

Aslında, Artificial Analysis testinde çok katı bir engel oluşmuştu. Üst düzey bir zekâya (Intelligence Index yaklaşık 60 puan) sahip olmak için yüksek bir Token maliyeti ödemek zorundasınız.

Sonuç olarak, Gemini 3.8 Flash bir suikastçı gibi davranıyor, tamamen kurallara uymuyor.

Artificial Analysis'ın yüksek akıl yürütme modunda, Gemini 3.8 Flash'in zeka indeksi 59 puana ulaştı!

Google

Bu nedir? Bu, en üst düzey GPT-5.6 Sol ve Grok 4.6'ya sadece bir adım uzaklıkta ve bazı boyutlarda Claude Opus 5'i bile aşıyor!

Ancak bunu yapmanın maliyeti nedir? Tek bir görevin maliyeti sadece 0,58 dolar.

Özellikle, giriş maliyeti 0,75 dolar/milyon Token, çıkış maliyeti 3,75 dolar/milyon Token olarak sabitlenmiştir.

Google bir grafik hazırladı: Zeka ve maliyetin Pareto ön yüzünde, Gemini 3.8 Flash’ı temsil eden mavi nokta, yazılım mühendisliği benchmarkı DeepSWE’nin sağ üst köşesinde yer alıyor ve ikinci sıradakini uzakta bırakıyor.

Google

Gemini 3.8 Flash sadece akıllı değil, aynı zamanda inanılmaz hızlı. Üretim hızı 305 token/s ile şaşırtıcı bir seviyede, bir sonraki model ise sadece 154 token/s hızla yetişebiliyor.

Hızlı, akıllı ve bedava gibi ucuz—bu, insanların gerçekten günlük olarak kullanabileceği model.

Google

Özellikle uzun dönemli yazılım mühendisliği benchmark'ında (DeepSWE v1.1), 3.8 Flash %73,7'lik çarpıcı bir performans sergiledi.

Bu, yapay zekânın karmaşık mühendislik problemlerini kendi başına çözmek ve端到端 kod yazmak gerektiren testinde, çoğu pahalı ileri düzey büyük modeli aştı ve maliyeti sadece onların bir kesri kadar.

Unutmayın, bu sadece «Flash» sürümü, «Pro» değil, daha çok «Ultra» değil.

Bu sefer Google, küçük modellerin üst düzey modellerin işini ele geçirmesine izin verdi.

Biri Gemini 3.8 Flash ve Opus 5'i aynı görev için denedi.

Google

Bu programlama becerisindeki büyük atlamalar rastlantısal değildir.

Google

Bu programlama becerisindeki büyük atlamalar rastlantısal değildir.

Google'in iç kod aracı Jetski testlerinde, Google mühendislerinin Anthropic'ın Opus modelinden daha çok 3.8 Flash'ı tercih ettiği rapor ediliyor.

Google

Bu, Google'nın yıl başından beri makine öğrenmesinde, yani model eğitiminin "son aşama düzeltmeleri" aşamasında kaynakları yoğun bir şekilde harcamasıdır; modelin deneme-yanılma yoluyla gerçekten iş yapmayı öğrenmesini sağlar.

Google DeepMind, programlama modellerinin yeteneklerini geliştirmeye odaklanan bir kod vurgu ekibi kurdu; bu ekip, DeepMind CTO tarafından yönetiliyor ve kurucu ortak Sergey Brin tarafından doğrudan denetleniyor.

Hedefleri, özyinelemeli kendini geliştirme sürecini zorlamak ve programlama modelini tamamen otomatikleştirilmiş bir AI araştırmacısına dönüştürerek tüm araştırma döngüsünü tamamen entegre etmektir.

Google

İç notta Google doğrudan şunu söyledi:

Son hız için, akıllı ajan yürütmesindeki boşluğu acilen kapatıp modellerimizi ana geliştiricilere dönüştürmeliyiz.

Google

Ayrıca Google, Thinking Machines Lab ortak kurucusu ve eski OpenAI sonrası eğitim sorumlusu olan Barret Zoph'u kadrosuna katarak araştırma başkanı olarak takviye yaptı ve pekiştirilmiş öğrenme ile sonrası eğitim alanlarını yönetecek. Bu hamle, tamamen kararlı olduğunu gösteriyor.

Geçen ay, kurucu ortak ve Nobel Ödüllü Demis Hassabis, CEO pozisyonundan ayrıldı ve yerine geçen Koray Kavukçuoglu, hemen hızlanma, hızlanma, tekrar hızlanma dedi.

Temel "su doldurma" mı, yoksa üstünlük mü?

Ancak alkışlar arasında, Google'ın şampanyayı erken açtığı ve çok erken sevindiği söyleniyor.

Google

En çok sinir bozan Meta——

Meta'nın Muse Spark 1.3 ve Gemini 3.8 Flash birbirine çarptı;前者, Artificial Analysis akıllı endeksinde 62 puan alarak Claude Fable 5 ile eşitlenerek en üst düzeyde yer aldı.

Muse'un girdi maliyeti, Fable 5'e göre 8 kat daha düşük ve çıktı maliyeti neredeyse 12 kat daha düşük, maliyet-verim oranı maksimum seviyede.

Meta'nın baş AI görevlisi Alexandr Wang, Artificial Analysis akıllı endeksinde Gemini'nin hiçbir şey olmadığını, sadece diğer modellerin egzoz gazlarını yediğini söyledi.

Google

Google

Muse Spark 1.3, GPT-5.6 Sol, Grok 4.6 ve Gemini 3.8 Flash'tan daha yüksek puan aldı, ancak şu anda sınırlı önizleme durumunda.

Bazıları, 3.8 Flash'in performans grafiğinin iyi göründüğünü, ancak pratikte böyle olmayabileceğini belirtti.

Gerçekten de, Gemini 3.8 Flash, Terminal-Bench 2.1, HLE gibi testlerde GPT-5.6 Sol ve Opus 5'i geçti, ancak TBench 2.1 ile TBench 4 arasındaki büyük puan farkı, bu durumda bir miktar "listeye sahtekârlık" olabileceğini ortaya koyuyor.

Yani, eğitim veri setine dahil edilmemiş yeni gerçek dünya Zero-shot zorluklarıyla karşılaşıldığında, 3.8 Flash muhtemelen Opus 5 gibi parametre devi kadar iyi olmayacaktır.

Ancak Google'un çözümü son derece akıllıca—çalışkanlık eksikliği giderir.

Google'un resmi blogunda belirttiği gibi: "Bu performans artışı, temel tasarım seçimlerinden kaynaklanıyor: 3.8 Flash daha çok çalışıyor."

Karmaşık görevlerle karşılaşıldığında, 3.8 Flash ekstra akıl yürütme adımlarını yürütme ve araçları sürekli tekrar çağırma şekilde tasarlanmıştır. Bilmediği sorularla karşılaştığında doğrudan pes etmez, daha fazla Token tüketerek dahili olarak hızlı bir şekilde kendini doğrular ve yankılar.

Çok sayıda döngüsel düşünme işlemi yaparak daha fazla Token tüketmesine rağmen, temel birim fiyatı çok ucuz olduğu için (milyon Token başına 0,75 dolar), toplam maliyet olarak doğrudan GPT-5.6 kullanmaktan çok daha ucuzdur!

Bu strateji, geçmişteki "büyük parametreler = güçlü yetenek" tek boyutlu rekabetini doğrudan bozuyor.

Bu, mükemmel bir Agent döngüsünde hızın ve çok düşük çıkarım maliyetinin kendisinin güçlü bir zeka olduğunu kanıtlar.

Flash neden gönderiliyor? «İptal edilen» Pro sürümü

Bu sefer Google gerçekten yanlış ürün göndermedi mi?

Gemini 3.5 Pro hâlâ gölgesi bile yok. Sonraki nesil asıllı Gemini 4 ise ön eğitim verileri oldukça iyi görünüyor, ancak sonrası eğitim aşaması henüz tamamlanmadı.

Google

Aslında, Google'nın Pro sürümünü uzun süre yayınlamamasının ardında acı bir tarih var.

Pichai, bu yıl Mayıs'ta "bir sonraki ay" daha güçlü Pro serisini çıkaracağını iddia etti, ancak hâlâ erteledi.

Aslında, Google içinden orijinal olarak birkaç 3.5 Pro adayı vardı, ancak hepsi şu anki Flash serisinden yeterince üstün olmaması nedeniyle acımasızca iptal edildi!

Aynı zamanda, tüm kullanıcıların beklediği bir sonraki nesil fiş Gemini 4, ön eğitim değerlendirmesinde iyi performans gösterse de şu anda en kritik sonrası eğitim aşamasında takılı kalmıştır.

Sonuç olarak, tüm bu rastlantılar Flash serisinin çılgınca geliştirilmesini sağladı.

2 saatte aylarca bulunamayan bir güvenlik açığı keşfedildi: Ağ güvenliği kategorisinde liderlik yaptı

Bu sefer Google, 3.8 Flash'ı sıradan görevlerde fiyatları sadece mı kırdı?

Çok daha fazlası.

Bu tanıtımın gerçek silahı, ikiz kardeşi Gemini 3.8 Flash Cyber.

Geliştiriciler bile şaşırıyor: “Google, Flash için özel olarak bir Cyber varyantı çıkarmayı neden hak etti?”

Google'un cevabı: Geleceğin AI hakerlerine karşı mücadele etmek için.

CyberGym adlı güvenlik testi platformunda 3.8 Flash Cyber, %86.2 puan alarak listeyi tek başına liderlik ederek önceki büyük modelleri büyük bir farkla geride bıraktı.

Ayrıca, gerçek dünyadaki kodlar sadece C/C++ değil.

Google'da 20 farklı programlama dilindeki karmaşık kod tabanlarında yapılan kapsamlı testlerde, bu model geniş çaplı açıkları bulma başarısı %70'in üzerinde oldu.

Daha da etkileyici olan, gerçek dünyadaki savaş deneyimleridir.

Chrome güvenlik ekibi tarafından test edildi ve önceki piyasadaki en iyi, ancak çok daha büyük ticari modelin 2,6 katı doğru onarım yaması üretti.

Wiz Güvenlik şirketi, penetration test sırasında召回率%7,5-9,7 arttığını ve maliyeti 2,3 ila 5,2 kat azaldığını tespit etti.

En şaşırtıcı olan, Google Cloud güvenlik araştırma ekibinin bu yöntemi kullanarak, daha önce insan üst düzey uzmanların bulması genellikle aylar süren kritik bir temel zafiyeti yalnızca 2 saatte keşfetmesiydi!

CWE-Bench (patching capability test)’de, 3.8 Flash Cyber’in ilk geçiş oranı %47,2’ye ulaştı ve en önde gelen öncü büyük modellerle (%47,8) neredeyse eşit seviyede olmasına rağmen, fiyatı onların sadece bir kesri kadar.

Google

3.8 Flash Cyber'in ağ savunma ve saldırı gücü o kadar etkileyici olduğu için, Google bunu tamamen açık kaynak yapmak yerine, tamamen yeni Fairwind planı aracılığıyla yalnızca güvenilen kurumlara açıklandı.

OpenAI, Anthropic ve Google: Büyük modellerin üçlü mücadelesi kritik noktaya ulaştı

Gemini 3.8 Flash'in piyasaya sürülmesiyle, günümüzün AI üçlüsünün tamamen farklı gelişim yollarına ulaştığı görülmektedir.

Anthropic (Claude serisi), "bilgi güvenilirliği ve kararlılığı"na odaklanıyor.

AA-Omniscience gibi bilgi kapsama ve gerçeklik doğruluğuna odaklanan testlerde Claude hâlâ üstünlük sağlıyor.

İlk yedi yer tamamen Claude serisine ait; şu anda kurumsal görevlerde hata yapmama yeteneğini güçlendirerek kararlı çıktılar sağlamaya çalışıyorlar.

OpenAI (GPT serisi), "derin çıkarım ve anlama" üzerine bahis yapıyor.

Fiziksel ve matematiksel türetimlere dayalı CritPt testinde GPT-5.6 Sol, keskin bir şekilde öne çıkıyor.

OpenAI, modelin kimse cevabı söylemeden kendisi bilim insanı gibi "düşünebilmesini" istiyor.

Google (Gemini serisi), «sonsuz döngüde süper hızlı çalışan» oluşturuyor.

Bu sefer Google üçüncü cevabı verdi: Belki bir seferde en zor fizik sorusunu çözemem, ancak çok hızlı tepki veriyorum ve maliyetim çok düşük.

Agent eraında, saniyede 100 kez düşünebilirim, kod yazabilirim, çalıştırabilirim, hata alabilirim, düzeltebilirim ve çok düşük maliyetle brute force iterasyonlarla doğru sonucu zorla çıkarabilirim.

Agen, gerçek dünyada karşılaştığı sorunlarla uğraşırken, tekrarlı deneme-yanılma yapmalı, araçları çağırmalı ve dinamik olarak ayarlamalıdır.

Gemini 3.8 Flash, tam olarak bu "uzun mesafeli iş akışı" için tasarlanmıştır.

Google Antigravity'de yalnızca bir ipucu ve döngü komutu kullanarak 3.8 Flash, bulmaca, ortam haritaları ve 3D seviyeleri içeren tam bir oyun oluşturabilir.

Sokak görünümü ve navigasyonlu bir DOS sürümü Google Haritaları oluşturmak için bunu tek tıkla kullanabilirsiniz.

Gemini 3.8 Flash'ın kolay kullanımı ve maliyeti, belirli bir noktayı aştı.

Gemini 3.8 Flash'in gelişi, Google'ın tüm sektörüne büyük modellerin artık "sadece devlerin kullanabileceği" durumdan çıkıp hesaplama gücüne erişimin herkese açılması yönünde ilerlediğini ilan ettiği gibi görünüyor.

Daha önce on binlerce dolar harcayıp günlerce süren ajan görevleri, şimdi birkaç fincan kahvenin maliyetiyle birkaç dakikada tamamlanabilir.

Sıradan insanların süper bireyler çağının gerçekten geldi.

Bu, küçük modellerin uyanma anıdır.

Kaynaklar:

https://x.com/alexandr_wang/status/2095266112212754659?s=20

https://blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber/

Düzenleyen: Aeneas David

Bu yazı, WeChat hesabından "Yeni Zihin" tarafından yazılmıştır, yazar: ASI Vahiy

Yasal Uyarı: Bu sayfadaki bilgiler üçüncü şahıslardan alınmış olabilir ve KuCoin'in görüşlerini veya fikirlerini yansıtmayabilir. Bu içerik, herhangi bir beyan veya garanti olmaksızın yalnızca genel bilgilendirme amacıyla sağlanmıştır ve finansal veya yatırım tavsiyesi olarak yorumlanamaz. KuCoin, herhangi bir hata veya eksiklikten veya bu bilgilerin kullanımından kaynaklanan sonuçtan sorumlu değildir. Dijital varlıklara yapılan yatırımlar riskli olabilir. Lütfen bir ürünün risklerini ve risk toleransınızı kendi finansal koşullarınıza göre dikkatlice değerlendirin. Daha fazla bilgi için lütfen Kullanım Koşullarımıza ve Risk Açıklamamıza bakınız.