Google merilis Gemini 3.8 Flash dan 3.8 Flash Cyber untuk pertahanan siber pada 2 September. Hanya tiga minggu setelah peluncuran 3.7 Flash, ini merupakan pembaruan ketiga dari seri Flash dalam enam minggu. Google menempatkan 3.8 sebagai model Flash terkuat saat ini untuk penalaran dan pemrograman; versi umum kini tersedia di Gemini API, Google AI Studio, Android Studio, Gemini Enterprise, dan sejumlah produk konsumen; versi Cyber hanya tersedia secara eksklusif melalui Fairwind Program baru untuk lembaga pemerintah tepercaya, operator infrastruktur kritis, dan pemelihara perangkat lunak. Keduanya berbagi kecerdasan dasar yang sama, tetapi izin penyebaran dan perlindungan keamanannya berbeda.
Harga pengenalan untuk Flash 3.8 tetap $0.75 per juta token masukan dan $3.75 per juta token keluaran, sama seperti 3.7. Namun, harga ini hanya berlaku hingga 31 Desember 2026; mulai 1 Januari 2027, harga resmi akan naik menjadi $1.50 per juta token masukan dan $7.50 per juta token keluaran. Yang lebih mudah diabaikan adalah bahwa model akan menjalankan lebih banyak langkah penalaran dan memanggil alat berulang kali untuk tugas yang kompleks, dan Google secara eksplisit memperingatkan bahwa tingkat usaha tinggi dapat menghabiskan lebih banyak token. Kenaikan harga satuan tidak berarti total tagihan untuk sebuah tugas pasti tetap sama.
Flash mulai bersaing dalam tugas panjang, selain kecepatan, lebih menekankan tingkat penyelesaian
Bukti yang diberikan Google mencakup encoding jangka panjang, analisis profesional, dan penalaran multi-langkah. 3.8 Flash melebihi sebagian besar model mutakhir yang lebih besar dalam evaluasi rekayasa perangkat lunak jangka panjang DeepSWE v1.1; mencapai 54,9% di HLE-Verified. Perusahaan juga mengutip benchmark agen keuangan dan agen hukum, menunjukkan upayanya untuk mengembangkan Flash dari model pertanyaan-jawab latensi rendah menjadi model kerja yang mampu merencanakan secara berkelanjutan, memanggil alat, dan menghasilkan hasil lengkap. Demonstrasi seperti visualisasi dekomposisi perangkat keras, pembuatan peta versi DOS dari satu prompt, dan game 3D menekankan bahwa model ini tidak hanya menghasilkan fragmen kode, tetapi juga dapat terus memeriksa dan memodifikasi hasilnya dalam siklus.
Namun, skor dasar tidak dapat langsung ditukar menjadi produktivitas perusahaan. Tingkat keberhasilan tugas panjang sering dipengaruhi oleh ukuran repositori kode, lingkungan dependensi, kualitas pengujian, otorisasi alat, dan anggaran percobaan ulang. Strategi “lebih giat” pada 3.8 yang meningkatkan tingkat penyelesaian juga meningkatkan waktu eksekusi dan penggunaan Token. Tim pengembang perlu mencatat harga per panggilan, total Token per tugas, jumlah panggilan alat, jumlah percobaan ulang sebelum berhasil, dan waktu kerja ulang manual untuk mengetahui apakah pembaruan benar-benar lebih murah. Untuk beban kerja yang mengutamakan latensi atau anggaran, Google tetap menyarankan menurunkan tingkat upaya, atau terus menggunakan 3.7 Flash; versi lama tidak langsung dihentikan dukungannya karena peluncuran produk baru.
Versi umum telah tersedia untuk pengembang dan perusahaan, dan pengguna Google AI Pro serta Ultra juga dapat menggunakannya di aplikasi Gemini, Mode AI Pencarian, dan Gemini in Sheets. Fungsi, kuota, dan cakupan wilayah yang tersedia dapat berbeda di setiap akses, sehingga “model telah dirilis” tidak boleh diartikan bahwa semua pengguna dan semua produk mendapatkan kemampuan yang identik. Terutama untuk alur kerja yang dilengkapi alat otonom, peluncurannya bergantung pada apakah aplikasi menyediakan alat, izin, dan lingkungan eksekusi yang dapat dipulihkan yang sesuai untuk model.
Versi Cyber lebih kuat dan lebih sempit, 47,2% bukan janji perbaikan otomatis
Gemini 3.8 Flash Cyber berfokus pada penemuan kerentanan dan generasi patch. Google menyatakan bahwa model ini mencapai tingkat keberhasilan lebih dari 70% dalam evaluasi internal penemuan kerentanan yang mencakup 20 bahasa pemrograman; dalam evaluasi patch eksternal CWE-Bench, pass@1 mencapai 47,2%, mendekati 47,8% dari model unggulan terkemuka, tetapi dengan biaya lebih rendah. Hasil penggunaan internal tim keamanan Chrome menunjukkan bahwa jumlah patch kerentanan yang benar yang dihasilkan oleh 3.8 Flash Cyber adalah 2,6 kali lebih banyak daripada model komersial besar terbaik. Wiz juga melaporkan peningkatan recall sebesar 7,5 hingga 9,7 poin persentase dalam benchmark penetrasi internal mereka, dengan biaya 2,3 hingga 5,2 kali lebih rendah.
Angka-angka ini memiliki nilai referensi dan batasan. Sampel, petunjuk, dan metode penilaian manusia untuk tolok ukur internal tidak diuraikan secara lengkap dalam pengumuman; 47,2% pass@1 juga berarti satu generasi tidak menjamin lebih dari separuh masalah diperbaiki dengan benar. Google memprioritaskan "perbaikan" daripada "eksploitasi", serta menambahkan perlindungan terhadap penyalahgunaan kimia, biologi, radiasi, nuklir, dan siber untuk versi umum 3.8. Versi Cyber, yang dirancang untuk memenuhi kebutuhan pertahanan profesional, menggunakan batasan keamanan siber yang lebih longgar, sehingga tidak dirilis secara luas, tetapi hanya tersedia bagi para pembela tepercaya dalam program Fairwind.
Yang benar-benar berubah dalam rilis ini adalah kompromi pada seri Flash: bukan lagi hanya mengandalkan harga rendah dan kecepatan untuk menarik permintaan massal, tetapi menggunakan siklus inferensi yang lebih panjang untuk mengejar tingkat penyelesaian tugas kompleks. Kesalahan paling umum yang dilakukan perusahaan jika langsung mengganti 3.7 dengan 3.8 adalah hanya membandingkan harga per juta Token. Pendekatan yang lebih aman adalah menguji tugas nyata secara berlapis: batasi tingkat usaha untuk permintaan sederhana, izinkan lebih banyak siklus untuk tugas panjang, dan pertahankan persetujuan manusia serta lingkungan terisolasi untuk tugas keamanan. Flash 3.8 sudah tersedia, Cyber juga telah memasuki rencana terbatas; apakah ia dapat menyelesaikan lebih banyak tugas produksi dengan biaya total lebih rendah, masih harus dijawab oleh data end-to-end masing-masing tim.
