Google, 2 Haziran 2026 tarihinde Gemini 3.8 Flash ve güvenilir ağ savunma kurumları için Gemini 3.8 Flash Cyber’ı yayınladı. Standart sürüm, 1 milyon tokenlik bağlam sahibi olup programlama, Agent ve uzmanlık görevlerine odaklanıyor; Google’ın açıkladığı testlerde uzun dönemli yazılım mühendisliği performansı %73,7 ile Claude Opus 5’in %74,0’ine yakın bir seviyede ve finansal Agent, hukuki Agent ve bazı entegre akıl yürütme performansları test edilen modellerin üzerinde. Cyber sürümü, kendi kendine açığı bulup onarım patch’leri oluşturabiliyor: Google’ın 20 farklı programlama dilinde gerçekleştirdiği iç testlerde başarı oranı %70’in üzerinde ve Chrome ekibi, büyük ticari modellerin 2,6 katı kadar doğru patch aldı. Şu an API indirimli fiyatı, milyon başına 0,75 dolar girdi tokeni ve 3,75 dolar çıktı tokeni; ancak model, performans için daha fazla akıl yürütme adımı ve araç çağrısı kullanıyor; bağımsız değerlendirme sonuçları, tek bir görev başına maliyetinin 3.7 Flash’ten yaklaşık %40 daha yüksek olduğunu gösteriyor. Bu yayın, geçmişte pahalı bayrak modellerine ait olan Agent yeteneklerinin düşük maliyetli ve ölçeklenebilir “iş modeline” girdiğini gösteren önemli bir sinyal; ancak yetenek verileri hâlâ Google ve ortaklarının testlerine dayanıyor ve Cyber sürümü genel kullanıcılar için açık değil.Yazan: DeepMind
Altı haftada üç kez güncellendi, Google Flash'ı ana model haline getirdi
Gemini 3.8 Flash, 3.7 Flash'ten sadece üç hafta sonra ve Google'ın altı hafta içinde sunduğu üçüncü Flash sürümüdür.
Geçmişte “Flash” genellikle hızlı ve düşük maliyetli, ancak bayrak modelinden açıkça daha zayıf yeteneklere sahip anlamına geliyordu. Gemini 3.8’in konumu değişiyor: Google hâlâ bunu büyük ölçekli dağıtım için bir “çalışma modeli” olarak tanımlıyor, ancak uzun dönemli programlama, sürekli araç çağrısı ve profesyonel analiz gibi yetenekleri öne çıkarıyor, sadece sohbet, özetleme gibi hafif görevleri üstlenmekle kalmıyor.
Yeni model, metin, görüntü, ses, video ve PDF girdilerini destekler, 1 milyon Token bağlam ve 64 bin Token maksimum çıktıya sahiptir ve arama, fonksiyon ve bilgisayar işlem araçlarını çağırabilir. Test önizlemesi değil, resmi olarak açılmıştır ve Gemini API, Google AI Studio, Gemini Enterprise, Google Antigravity, Gemini uygulaması, arama AI Modu ve Google Sheets aracılığıyla kullanılabilir.
Google'un barındırdığı Agent Antigravity, varsayılan olarak 3.8 Flash'ı da kullanıyor. Bu, modelin tek seferlik soru-cevap değil, sürekli planlama, araç çağırma, sonuç kontrolü ve düzeltme gerektiren Agent'lara yönelik olduğunu gösteriyor.
Programlama puanları pahalı üst düzey modellere yaklaştı
Google'un duyurduğu DeepSWE v1.1 uzun dönem yazılım mühendisliği testinde, Gemini 3.8 Flash %73,7 puan alarak, 3.7 Flash'ın %65,3 ve GPT‑5.6 Sol'ün %72,7'sinden yüksek, Claude Opus 5'in %74,0'inden ise 0,3 puan düşük sonuç elde etti.
Bu tür testler, modelin gerçek kod tabanına girerek, birden fazla dosya arasındaki ilişkileri anlayıp, sorunları tanımlayıp testleri geçebilecek şekilde düzeltmeyi gerektirir. Bu, bağımsız bir fonksiyon üretmekten daha gerçekçi bir programlama Agent işini yakından yansıtır.
Vals Finance Agent v2'de 3.8 Flash %61,4 aldı; test edilen 3.7 Flash, Claude Opus 5 ve GPT‑5.6 Sol sırasıyla %59,0, %58,6 ve %53,8 aldı.
Harvey Hukuk Agent testinde, 3.8 Flash %10,0 ile 3.7 Flash'ın %8,8'i, Claude Opus 5'in %6,7'si ve GPT‑5.6 Sol'un %2,5'inden daha yüksek. Ancak tüm modellerin bu değerlendirme içindeki mutlak puanları oldukça düşük; "birinci sırada olmak", karmaşık hukuki görevleri güvenilir bir şekilde yönetebildiği anlamına gelmez.
Çok disiplinli akıl yürütme testi HLE-Verified'de 3.8 Flash %54,9, GPT‑5.6 Sol ve Claude Opus 5 ise sırasıyla %54,5 ve %54,4 puan aldı; bu üç model arasındaki fark çok küçük olup, herhangi bir modelin kapsamlı ve kararlı bir üstünlüğe sahip olduğunu kanıtlamak için yeterli değildir.
Bu sonuçlar, Google'nın kendi yapılandırmasına göre yayınlanmıştır. Model, Agent çerçevesi, çıkarım gücü, araç izinleri ve test bütçesi sonucu etkileyeceğinden, daha mantıklı sonuç: Flash seviyesindeki modeller, bazı pahalı üst düzey modellere yaklaşmıştır; Gemini'nin tüm görevlerde tamamen önde olduğu değildir.
"Daha çaba göstermek" daha akıllıca anlamına gelir, aynı zamanda daha pahalı da olabilir.
Google, 3.8 Flash yeteneğindeki iyileştirmeyi, modeli "daha çok çaba göstermek" için yapılan açık bir tasarım seçimi olarak açıklıyor.
Karmaşık görevlerde, daha fazla ara adım kullanır, araçları tekrar tekrar çağırır ve tamamlanan işleri aktif olarak kontrol eder. Geliştiriciler, düşük, orta ve yüksek olmak üzere üç düşünme seviyesi seçebilir; orta seviye varsayılan ayarlıdır. Yüksek seviye, zor programlama ve çok adımlı muhakeme için uygundur; düşük seviye ise gerçek zamanlı sohbet, taslak oluşturma ve gecikmeye duyarlı görevler için uygundur.
Bu, Agent'in erken durması, adımları atlaması veya bir araç çağrısı başarısız olduktan sonra hedeften tamamen sapma olasılığını azaltır, ancak daha fazla Token tüketir.
Artificial Analysis'ın bağımsız testlerinde, 3.8 Flash, yüksek düşünme seviyesindeki akıllılık indeksi 59 puanla 3.7 Flash'a göre 3 puan yükselmiştir ve GPT‑5.6 Sol'un en yüksek çıkarım yapılandırmasının dışında kalan versiyonlarıyla benzer düzeydedir. Ortalama çıktı hızı saniyede yaklaşık 300 Token olup, tekil testleri tamamlamak ortalama 2,5 dakika sürmektedir.
Ancak 3.8 Flash'in ortalama çıktı token sayısı yaklaşık %30 arttı ve Agent değerlendirmelerindeki yürütme döngüleri de daha fazla oldu. Her token fiyatı yükselmese de, ortalama tek görev maliyeti 0,58 dolar olup, 3.7 Flash'in 0,40 dolarına göre yaklaşık %40 daha yüksek.
Bu nedenle, “düşük birim fiyat” her görevin mutlaka daha ucuz olduğu anlamına gelmez. Görev kendisi karmaşık bir çıkarım gerektirmiyorsa, 3.8 Flash’ı yoğun bir şekilde çalıştırmak yalnızca zaman ve maliyeti artırabilir. Google, düşüncelerin seviyesini düşürmek veya hâlâ desteklenen 3.7 Flash’ı kullanmaya devam etmek için verimliliğe öncelik veren iş akışları önermektedir.
Şu anki düşük fiyat geçici bir tekliftir
31 Aralık 2026 tarihine kadar Gemini 3.8 Flash için teklif fiyatı, milyon girdi Token başına 0,75 dolar ve milyon çıktı Token başına 3,75 dolar olup, 3.7 Flash'in mevcut fiyatı ile aynıdır.
1 Ocak 2027 itibarıyla standart fiyat, milyon girdi Token başına 1,50 dolar ve milyon çıktı Token başına 7,50 dolar olacak, tam olarak iki katına çıkacaktır. Geliştiriciler uzun vadeli maliyetleri değerlendirirken, yayın süresi fiyatlarını kalıcı fiyat olarak göremezler.
Gelecek standart fiyatlarına göre bile, bu fiyat bazı üst düzey modellerden daha düşük; ancak on binlerce Token üretmek ve onlarca araç çağrısı çalıştırmak gereken bir Agent için, sadece milyon Token başına fiyat tablosundaki rakamları değil, tam görev maliyetini karşılaştırmalısınız.
Cyber sürümünün amacı açıklığı açıklamak değil, doğrudan düzeltmeyi teslim etmektir.
Google, Gemini 3.8 Flash Cyber'ı aynı anda yayınladı. Temel yetenekleri normal sürümle paylaşır, ancak daha odaklı bir siber güvenlik eğitimi almıştır ve daha gevşek siber güvenlik kısıtlamalarına sahiptir; bu da normal modellerin reddedebileceği güvenlik açıkları analizlerini yapmasını sağlar.
CyberGym güvenlik açığı bulma standardında, Google bu seviyeye ulaştığını açıkladı. CyberGym özellikle C ve C++ projelerine odaklandığı için, şirket 20 farklı programlama dilini kapsayan ve karmaşık gerçek kod kütüphanelerini içeren bir dahili test seti geliştirdi. 3.8 Flash Cyber'nin güvenlik açığı bulma başarı oranı %70'in üzerinde.
Bulgu keşfi sadece ilk adımdır. Google, Cyber sürümünün eğitiminin saldırı exploit'leri üretmek yerine sorunları düzeltmeye odaklandığını özellikle vurguladı.
Collinear tarafından yürütülen CWE-Bench yama testinde, 3.8 Flash Cyber'in ilk gönderim geçme oranı %47,2 iken, karşılaştırılan önde gelen üst düzey modelin oranı %47,8'dir. İki sonuç da yakındır, ancak Google, Flash Cyber'in çalıştırma maliyetinin daha düşük olduğunu belirtmiştir.
Bu, ağ güvenliği aracısının hedefinin, “mühendislere burada olası bir sorun var” demekten, açıkları anlama, düzeltme yazma, test yürütme ve değişiklikleri doğrulama yönüne doğru dönüştüğünü gösterir. Sonuç yeterince güvenilirse, güvenlik ekibinin bir açıkları tespit etmesi ile düzeltmeyi dağıtması arasındaki süreyi kısaltabilir.
Chrome, 2.6 kat doğru düzeltme kazandı, ancak hâlâ üretici ve ortak test aşamasında.
Google, Flash Cyber'ı iç kod güvenlik çalışmalarında kullanıyor.
Chrome güvenlik ekibi, oluşturduğu doğru güvenlik açığı onarım sayısının daha büyük ticari modellerin 2,6 katı olduğunu belirtti. Güvenlik şirketi Wiz ise, kendi nüfuz testi referanslarında Flash Cyber'in açık geri çağırma oranının diğer önde gelen modellere göre %7,5 ile %9,7 daha yüksek olduğunu ve maliyetinin 2,3 ile 5,2 kat daha düşük olduğunu ifade etti.
Google Cloud güvenlik araştırma ekibi, modelin bir kritik temel açığı iki saatten kısa bir sürede keşfettiğini de belirtti; benzer araştırmalar genellikle aylar sürebilir.
Bu sonuçlar pratik referans değeri taşır, ancak bağımsız ve tekrarlanabilir bir genel değerlendirme olarak kabul edilemez. Google, o kritik açığı, karşılaştırılan modeller listesini ve tam çalışma izini kamuoyuna açmadı; Chrome verileri Google'ın dahili kaynaklarından gelir ve Wiz de Fairwind ortağıdır. Bu nedenle, bu sonuçlar modellerin gerçek güvenlik çalışmalarına katılabildiğini kanıtlar, ancak tüm kod kütüphanelerinde ve tüm güvenlik açıkları türlerinde aynı düzeyde kararlı bir performans sağladığını kanıtlamaz.
En güçlü ağ güvenliği yetenekleri yalnızca güvenilir kurumlara açıktır.
Flash Cyber, Google tarafından kurulan Fairwind Programı aracılığıyla sunulmaktadır ve şu anda 650'den fazla katılımcıya sahiptir; bunlar arasında hükümet siber güvenlik kurumları, kritik altyapı operatörleri, yazılım bakımcıları ve büyük güvenlik şirketleri yer almaktadır.
Katılım kuruluşları, iç erişim kullanıcılarını sınırlamalı ve çok faktörlü kimlik doğrulama gibi güvenlik önlemleri uygulamalıdır. Model, CodeMender Agent ile birleştirildiğinde, kuruluşun kendi bulut ortamında açıkları bulabilir, doğrulayabilir ve düzeltebilir.
Normal Google Cloud müşterileri, CodeMender'i genel Gemini modeliyle kullanmaya devam edebilir, ancak Flash Cyber'ın tam yeteneklerine doğrudan erişemiyor.
Bu "bir temel model, iki yetki seviyesi" yaklaşımı, Anthropic'in Claude'u Fable ve Mythos olarak sınıflandırma yoluyla çok benzerdir: genel programlama ve analiz yetenekleri piyasaya açılırken, daha kolay saldırı yeteneğine dönüştürülebilen siber güvenlik işlevleri, kimlik doğrulama, erişim kontrolü ve sürekli izleme yoluyla sağlanır.
Güvenlik belirgin bir şekilde yükseltilemedi, ancak bazı İngilizce dışı gösterimlerde gerileme yaşandı.
Standart Versiyon 3.8 Flash, kimyasal, biyolojik, radyoaktif, nükleer içerikler ve ağ saldırıları için güvenlik kısıtlamalarına sahiptir; Cyber Versiyonu, profesyonel savunma görevlerini tamamlamak için ağ güvenlik kısıtlamaları daha gevşektir ve bu nedenle yalnızca onaylanmış kurumlara açıktır.
Google model kartı, 3.8 Flash'ın, 3.7 Flash ile karşılaştırıldığında şirketin öncelikli güvenlik çerçevesi tarafından ele alınan yüksek riskli alanlarda önemli yeni yetenekler sunmadığını ve bu nedenle daha yüksek bir risk seviyesi tetiklenmediğini belirtiyor. Gray Swan dolaylı ipucu enjeksiyon testlerindeki koruması da iyileştirildi.
Ancak model kartı, 3.8 Flash'ın otomatik çok dilli güvenlik testlerinde 3.7 Flash'a göre %5,4 gerilediğini de açıklıyor. Google, insan kontrolü sonrası bu farkların çoğunun yanlış pozitif veya ciddi olmayan içerikler olduğunu belirtti, ancak tam örnekler ve dil bazlı veriler paylaşılmadı.
Model, illüzyonlar, ara sıra yavaş yanıt verme veya zaman aşımı, ve performansı artırmak için fazla token kullanımı gibi büyük dil modellerinin yaygın sorunlarını korumaktadır. Bilgi kesim tarihi Mart 2026 olarak belirtilmiştir, ancak Google, bazı alanlarda güvenilir bilgilerin hâlâ yaklaşık Ocak 2025 seviyesinde güncellendiğini açıklamaktadır; en son bilgiler için hâlâ çevrimiçi doğrulama gerekmektedir.
Gerçek rekabet, "kim en akıllı"dan "kim büyük ölçekli olarak kullanılabilir" yönüne kaymaktadır.
Gemini 3.8 Flash'ın en dikkat çekici noktası, bir belirteçte sıfırda birkaç puan öne geçmesi değil, Google'ın uzun dönemli programlama, profesyonel analiz ve kendi araçlarını çağırma yeteneklerini Flash fiyat aralığına sokması.
Üst düzey modeller, yüksek değerli ve düşük frekanslı zor görevler için uygundur; ancak gerçek işletme müşteri hizmetleri, programlama hatları, finansal analiz ve güvenlik taramalarında çalışan Agent'ler günlük milyonlarca çağrı işleyebilir. Bu senaryolarda, hız, birim maliyet ve birim görev başarı oranı genellikle sıralamada birinci olmaktan daha önemlidir.
3.8 Flash, bu rota çelişkisini de gösteriyor: Model ne kadar iyi tekrar kontrol edip sürekli çalışırsa, o kadar çok Token üretir ve “ucuz model”in tek bir görev başına maliyeti artar. Bu nedenle, gelecekteki Agent rekabetinin çekirdeği sadece en iyi cevabı veren kimse olmakla kalmaz, aynı zamanda ne zaman düşünmeye devam edileceğini, ne zaman araçlar çağrılacağını ve ne zaman durulacağını nasıl karar verdiğidir.
