Google meluncurkan Gemini 3.8 Flash dan Gemini 3.8 Flash Cyber untuk lembaga pertahanan siber terpercaya pada 2 September 2026. Versi umum memiliki konteks 1 juta token, difokuskan pada pemrograman, agen, dan pekerjaan keahlian; dalam pengujian yang dirilis Google, kinerjanya dalam rekayasa perangkat lunak jangka panjang mencapai 73,7%, mendekati 74,0% Claude Opus 5, sementara kinerja agen keuangan, agen hukum, dan sebagian penalaran komprehensif unggul dibanding model yang diuji. Versi Cyber mampu secara mandiri menemukan kerentanan dan menghasilkan patch: tingkat keberhasilan pengujian internal Google melintasi 20 bahasa pemrograman melebihi 70%, dan tim Chrome menerima jumlah patch yang benar 2,6 kali lebih banyak dibanding model komersial besar. Harga promosi API saat ini adalah $0,75 per juta token masukan dan $3,75 per juta token keluaran, tetapi model ini menukar kinerja dengan lebih banyak langkah penalaran dan pemanggilan alat; evaluasi independen menunjukkan biaya per tugasnya justru sekitar 40% lebih tinggi daripada 3.7 Flash. Sinyal utama peluncuran ini adalah kemampuan agen yang sebelumnya hanya dimiliki model unggulan mahal kini memasuki kategori "model kerja" yang murah dan dapat dideploy secara skala besar, namun data kemampuan masih didasarkan terutama pada pengujian Google dan mitranya, dan versi Cyber tidak tersedia untuk pengguna umum.Penulis artikel, sumber: DeepMind
Tiga kali pembaruan dalam enam minggu, Google menjadikan Flash sebagai model utama
Gemini 3.8 Flash dirilis hanya tiga minggu setelah 3.7 Flash, dan merupakan versi Flash ketiga yang dirilis Google dalam enam minggu.
Dulu, "Flash" biasanya berarti cepat dan hemat biaya, tetapi kemampuannya jelas lebih lemah dibandingkan model unggulan. Posisi Gemini 3.8 sedang berubah: Google tetap menyebutnya sebagai "model kerja" yang cocok untuk penerapan skala besar, tetapi kini menekankan kemampuan utamanya pada pemrograman jangka panjang, pemanggilan alat berkelanjutan, dan analisis profesional, bukan hanya tugas ringan seperti obrolan atau ringkasan.
Model baru mendukung input teks, gambar, audio, video, dan PDF, dengan konteks 1 juta Token dan output maksimum 64.000 Token, serta dapat memanggil alat pencarian, fungsi, dan operasi komputer. Model ini telah secara resmi dirilis, bukan dalam versi pra-pengujian, dan dapat digunakan melalui Gemini API, Google AI Studio, Gemini Enterprise, Google Antigravity, aplikasi Gemini, Mode AI Pencarian, dan Google Sheets.
Agent Antigravity yang dihosting oleh Google juga telah secara default mengadopsi 3.8 Flash. Ini menunjukkan bahwa model ini benar-benar ditujukan untuk Agent yang memerlukan perencanaan berulang, pemanggilan alat, pemeriksaan hasil, dan koreksi berkelanjutan, bukan hanya pertanyaan dan jawaban sekali saja.
Performa pemrograman telah mendekati model unggulan yang mahal
Dalam uji coba jangka panjang DeepSWE v1.1 yang diumumkan oleh Google, Gemini 3.8 Flash mencapai skor 73,7%, lebih tinggi daripada 3.7 Flash dengan 65,3% dan GPT-5.6 Sol dengan 72,7%, serta hanya selisih 0,3 poin persentase dari Claude Opus 5 yang mencapai 74,0%.
Uji coba semacam ini memerlukan model untuk masuk ke repositori kode nyata, memahami hubungan antar berkas, menemukan masalah, dan melakukan perubahan yang dapat melewati uji coba. Ini lebih mendekati pekerjaan agen pemrograman nyata dibandingkan hanya menghasilkan satu fungsi secara terpisah.
Dalam Vals Finance Agent v2, 3.8 Flash mendapatkan 61,4%, sedangkan 3.7 Flash, Claude Opus 5, dan GPT‑5.6 Sol yang diuji masing-masing mendapatkan 59,0%, 58,6%, dan 53,8%.
Dalam pengujian Harvey Legal Agent, Flash 3.8 mencapai 10,0%, lebih tinggi daripada Flash 3.7 sebesar 8,8%, Claude Opus 5 sebesar 6,7%, dan GPT-5.6 Sol sebesar 2,5%. Namun, semua model mendapatkan skor absolut yang sangat rendah dalam evaluasi ini; "peringkat pertama" tidak berarti sudah mampu menangani pekerjaan hukum kompleks secara andal.
Dalam ujian penalaran multidisiplin HLE-Verified, 3.8 Flash mendapatkan 54,9%, GPT‑5.6 Sol dan Claude Opus 5 masing-masing mendapatkan 54,5% dan 54,4%, selisih ketiganya sangat kecil dan tidak cukup untuk membuktikan bahwa salah satu model memiliki keunggulan komprehensif yang stabil.
Hasil-hasil ini terutama dipublikasikan oleh Google sesuai konfigurasi mereka sendiri. Model, kerangka Agent, kekuatan inferensi, izin alat, dan anggaran pengujian semuanya memengaruhi hasil akhir, sehingga kesimpulan yang lebih masuk akal adalah: model kelas Flash telah mendekati sebagian model unggulan mahal, bukan Gemini yang unggul secara menyeluruh di semua tugas.
“Lebih keras” berarti lebih cerdas, dan mungkin juga berarti lebih mahal
Google mengatribusikan peningkatan kemampuan Flash 3.8 pada pilihan desain yang langsung: membuat model "berusaha lebih keras".
Saat menghadapi tugas yang kompleks, ia akan menggunakan lebih banyak langkah penalaran antara, memanggil alat berulang kali, dan secara aktif memeriksa pekerjaan yang telah selesai. Pengembang dapat memilih tiga tingkat pemikiran: rendah, menengah, dan tinggi; tingkat menengah adalah pengaturan default; tingkat tinggi cocok untuk pemrograman sulit dan penalaran multi-langkah, sedangkan tingkat rendah cocok untuk obrolan real-time, pembuatan draf, dan tugas yang sensitif terhadap keterlambatan.
Ini dapat mengurangi kemungkinan Agent berhenti terlalu dini, melewatkan langkah-langkah, atau benar-benar menyimpang dari tujuan setelah satu panggilan alat gagal, tetapi juga akan menghabiskan lebih banyak Token.
Dalam uji independen Artificial Analysis, 3.8 Flash mencapai skor indeks kecerdasan 59 pada tingkat pemikiran tinggi, meningkat 3 poin dibandingkan 3.7 Flash, dan berada pada tingkat yang sebanding dengan konfigurasi inferensi non-tertinggi GPT‑5.6 Sol. Kecepatan output rata-ratanya sekitar 300 Token per detik, dengan rata-rata waktu penyelesaian uji tunggal sekitar 2,5 menit.
Namun, rata-rata output Token Flash 3.8 meningkat sekitar 30%, dan jumlah putaran eksekusi dalam evaluasi Agent juga lebih banyak. Meskipun harga per Token tidak naik, biaya rata-rata per tugas sekitar $0,58, lebih tinggi sekitar 40% dibandingkan $0,40 dari Flash 3.7.
Oleh karena itu, "harga rendah" tidak sama dengan "setiap tugas pasti lebih murah". Jika tugas itu sendiri tidak memerlukan penalaran kompleks, menjalankan 3.8 Flash dengan intensitas tinggi mungkin hanya akan menambah waktu dan biaya. Google juga menyarankan untuk menggunakan alur kerja yang mengutamakan efisiensi dengan menurunkan tingkat pemikiran, atau terus menggunakan 3.7 Flash yang masih didukung.
Harga rendah saat ini hanya penawaran terbatas
Hingga 31 Desember 2026, harga promosi untuk Gemini 3.8 Flash adalah $0,75 per juta token masukan dan $3,75 per juta token keluaran, sama dengan harga saat ini untuk 3.7 Flash.
Mulai 1 Januari 2027, harga standar akan menjadi $1,50 per juta Token masuk dan $7,50 per juta Token keluar, tepat dua kali lipat. Pengembang tidak boleh menganggap harga masa peluncuran sebagai harga permanen saat mengevaluasi biaya jangka panjang.
Meskipun dihitung berdasarkan harga standar masa depan, harganya masih lebih rendah daripada beberapa model unggulan; namun untuk Agent yang memerlukan generasi puluhan ribu Token dan menjalankan puluhan siklus pemanggilan alat, sebaiknya bandingkan biaya tugas secara keseluruhan, bukan hanya angka per juta Token pada daftar harga.
Tujuan versi Cyber bukanlah menjelaskan kerentanan, tetapi langsung menyediakan patch
Google juga meluncurkan Gemini 3.8 Flash Cyber. Ia berbagi kemampuan dasar dengan versi biasa, tetapi telah dilatih lebih terfokus pada keamanan siber dan menggunakan batasan keamanan siber yang lebih longgar, sehingga mampu menyelesaikan analisis kerentanan yang mungkin ditolak oleh model biasa.
Dalam benchmark penemuan kerentanan CyberGym, Google menyatakan telah mencapai tingkat terdepan. Karena CyberGym terutama berfokus pada proyek C dan C++, perusahaan merancang serangkaian pengujian internal yang mencakup 20 bahasa pemrograman dan berisi kode nyata yang kompleks, dengan tingkat keberhasilan Flash Cyber 3.8 dalam menemukan kerentanan melebihi 70%.
Menemukan kerentanan hanyalah langkah pertama. Google secara khusus menekankan bahwa fokus pelatihan Cyber adalah memperbaiki masalah, bukan menghasilkan eksploit serangan.
Dalam uji coba patch CWE-Bench yang dijalankan oleh Collinear, tingkat keberhasilan pertama kali pengiriman Flash Cyber adalah 47,2%, dibandingkan dengan model unggulan terkemuka lainnya sebesar 47,8%. Kedua hasilnya sangat dekat, tetapi Google menyatakan bahwa biaya operasional Flash Cyber lebih rendah.
Ini menandakan bahwa tujuan agen keamanan siber berpindah dari “memberi tahu insinyur bahwa mungkin ada masalah di sini” menjadi memahami kerentanan, menulis patch, menjalankan pengujian, dan memverifikasi perubahan. Jika hasilnya cukup andal, ini dapat memperpendek waktu yang dibutuhkan tim keamanan dari menemukan kerentanan hingga menerapkan perbaikan.
Chrome mendapatkan patch yang benar 2,6 kali, tetapi masih dalam pengujian oleh pabrikan dan mitra
Google telah menggunakan Flash Cyber untuk pekerjaan keamanan kode internal.
Tim keamanan Chrome menyatakan bahwa jumlah patch kerentanan yang dihasilkannya adalah 2,6 kali lebih banyak dibandingkan model komersial besar lainnya. Perusahaan keamanan siber Wiz menyatakan bahwa dalam benchmark pengujian penetrasi mereka, tingkat recall kerentanan Flash Cyber lebih tinggi 7,5 hingga 9,7 poin persentase dibandingkan model terdepan lainnya, dengan biaya 2,3 hingga 5,2 kali lebih rendah.
Tim penelitian kerentanan Google Cloud juga menyatakan bahwa model tersebut menemukan kerentanan kritis dalam waktu kurang dari dua jam, sementara penelitian serupa biasanya dapat berlangsung selama berbulan-bulan.
Hasil-hasil ini memiliki nilai referensi nyata, tetapi tidak dapat dianggap sebagai evaluasi publik yang independen dan dapat direproduksi. Google tidak mengungkapkan detail spesifik dari kerentanan kunci tersebut, daftar model perbandingan, dan lintasan operasi lengkap; data Chrome berasal dari internal Google, dan Wiz juga merupakan mitra Fairwind. Oleh karena itu, hasil ini membuktikan bahwa model telah mampu terlibat dalam pekerjaan keamanan nyata, tetapi tidak membuktikan bahwa ia secara stabil mencapai efek setara di semua kodebase dan jenis kerentanan.
Kemampuan keamanan siber terkuat hanya dibuka untuk lembaga terpercaya
Flash Cyber disediakan melalui Program Fairwind baru Google, dengan lebih dari 650 peserta saat ini, yang terutama mencakup lembaga keamanan siber pemerintah, operator infrastruktur kritis, pemelihara perangkat lunak, dan perusahaan keamanan besar.
Lembaga yang berpartisipasi harus membatasi jangkauan pengakses internal dan menerapkan langkah-langkah keamanan seperti autentikasi multi-faktor. Setelah digabungkan dengan CodeMender Agent, model dapat mencari, memverifikasi, dan memperbaiki kerentanan di lingkungan cloud milik lembaga tersebut.
Pelanggan Google Cloud biasa masih dapat menggunakan CodeMender bersama model Gemini versi publik, tetapi tidak dapat langsung memperoleh seluruh kemampuan Flash Cyber.
Cara peluncuran "satu model dasar, dua tingkat izin" ini sangat mirip dengan pendekatan sebelumnya Anthropic yang membagi Claude menjadi Fable dan Mythos: kemampuan pemrograman dan analisis umum dibuka ke pasar, sementara fitur keamanan siber yang lebih mudah diubah menjadi kemampuan serangan disediakan melalui verifikasi identitas, kontrol akses, dan pemantauan berkelanjutan.
Keamanan tidak mengalami peningkatan signifikan, tetapi sebagian kinerja non-Inggris mengalami penurunan
Versi Biasa 3.8 Flash mencakup batasan keamanan terkait kimia, biologi, radiasi, nuklir, serta serangan siber; Versi Cyber, karena diperlukan untuk menyelesaikan tugas pertahanan profesional, memiliki batasan keamanan siber yang lebih longgar, sehingga hanya tersedia untuk institusi yang telah melalui proses verifikasi.
Kartu model Google menyatakan bahwa, dibandingkan dengan 3.7 Flash, 3.8 Flash tidak menunjukkan kemampuan baru yang signifikan di bidang-bidang berisiko tinggi yang menjadi fokus kerangka keamanan terdepan perusahaan, sehingga tidak memicu peningkatan tingkat risiko. Perlindungannya dalam pengujian Gray Swan indirect prompt injection juga meningkat.
Namun, kartu model juga mengungkapkan bahwa 3.8 Flash mengalami penurunan sebesar 5,4 poin persentase dalam pengujian keamanan otomatis multibahasa dibandingkan 3.7 Flash. Setelah diperiksa secara manual oleh Google, sebagian besar perbedaan dianggap sebagai false positive atau konten yang tidak serius, tetapi sampel lengkap dan data per bahasa tidak dirilis.
Model juga masih memiliki masalah umum pada model bahasa besar, termasuk halusinasi, respons yang terkadang lambat atau timeout, serta penggunaan terlalu banyak token untuk meningkatkan kinerja. Batas pengetahuan ditandai sebagai Maret 2026, tetapi Google menjelaskan bahwa pengetahuan yang andal di beberapa bidang mungkin masih hanya diperbarui hingga sekitar Januari 2025; untuk informasi terbaru, tetap perlu diverifikasi secara online.
Persaingan sejati sedang berpindah dari "siapa yang paling cerdas" menjadi "siapa yang dapat digunakan secara massal"
Yang paling patut diperhatikan dari Gemini 3.8 Flash bukanlah satu benchmark yang unggul sebesar beberapa persen, melainkan Google sedang memasukkan kemampuan pemrograman jangka panjang, analisis profesional, dan pemanggilan alat mandiri ke dalam kisaran harga Flash.
Model unggulan cocok untuk tugas sulit bernilai tinggi dan frekuensi rendah; namun, Agent yang benar-benar dijalankan di layanan pelanggan perusahaan, pipeline pemrograman, analisis keuangan, dan pemindaian keamanan mungkin menangani jutaan panggilan setiap hari. Dalam skenario-skenario ini, kecepatan, harga per unit, dan tingkat keberhasilan per tugas sering kali lebih penting daripada peringkat pertama.
3.8 Flash juga menunjukkan kontradiksi dalam jalur ini: semakin baik model dalam memeriksa ulang dan bekerja terus-menerus, semakin besar kemungkinan ia menghasilkan lebih banyak Token, sehingga meningkatkan biaya tugas tunggal untuk "model murah". Oleh karena itu, inti persaingan Agent di masa depan tidak hanya siapa yang menjawab paling baik, tetapi juga siapa yang mampu menilai kapan harus terus berpikir, kapan memanggil alat, dan kapan harus berhenti.
