Google memperkenalkan Gemini 3.8 Flash dan 3.8 Flash Cyber untuk pertahanan siber pada 2 September. Hanya tiga minggu selepas pelancaran 3.7 Flash, ini merupakan pembaruan ketiga dalam rangkaian Flash dalam tempoh enam minggu. Google menempatkan 3.8 sebagai model Flash terkuat untuk penalaran dan pengkodean semasa ini; versi biasa kini tersedia melalui Gemini API, Google AI Studio, Android Studio, Gemini Enterprise, dan beberapa produk pengguna; versi Cyber pula hanya boleh diakses melalui Program Fairwind baharu oleh agensi kerajaan yang dipercayai, pengendali infrastruktur penting, dan pemelihara perisian. Kedua-dua versi berkongsi kecerdasan asas, tetapi memiliki kebenaran pelaksanaan dan perlindungan keselamatan yang berbeza.
Harga pengenalan untuk Flash 3.8 masih tetap pada $0.75 per juta token input dan $3.75 per juta token output, sama seperti 3.7. Namun, harga ini hanya berlaku sehingga 31 Disember 2026; mulai 1 Januari 2027, harga yang disenaraikan rasmi akan naik kepada $1.50 untuk input dan $7.50 untuk output. Yang lebih mudah diabaikan ialah model akan menjalankan lebih banyak langkah penalaran dan memanggil alat berulang kali untuk tugas yang kompleks, dan Google secara jelas memperingatkan bahawa tahap usaha yang tinggi mungkin menghabiskan lebih banyak token. Kenaikan harga unit tidak bermakna jumlah bil untuk satu tugas akan tetap sama.
Flash mula bersaing untuk tugas panjang, bukan hanya kelajuan tetapi juga kadar penyelesaian
Bukti yang diberikan oleh Google merangkumi pengkodengan jangka panjang, analisis profesional, dan penalaran berbilang langkah. 3.8 Flash melebihi kebanyakan model terkini yang lebih besar dalam penilaian rekabentuk perisian jangka panjang DeepSWE v1.1; mencapai 54.9% di HLE-Verified. Syarikat juga merujuk kepada tolok agen kewangan dan agen undang-undang untuk menunjukkan bahawa ia berusaha mengubah Flash daripada model soal-jawab latensi rendah kepada model kerja yang mampu merancang secara berterusan, memanggil alat, dan menghantar hasil lengkap. Demo seperti visualisasi pembongkaran peranti keras, penghasilan peta versi DOS melalui satu petunjuk, dan permainan 3D menekankan bahawa model ini tidak hanya mengeluarkan petikan kod, tetapi juga mampu memeriksa dan memodifikasi hasil secara berterusan dalam kitaran.
Namun, skor asas tidak boleh ditukar terus kepada produktiviti perusahaan. Kejayaan tugas panjang sering dipengaruhi oleh saiz repositori kod, persekitaran bergantung, kualiti ujian, kebenaran alat, dan anggaran percubaan semula. Strategi “lebih giat” 3.8 yang meningkatkan kadar penyelesaian juga meningkatkan masa pelaksanaan dan penggunaan token. Pasukan pembangunan perlu merekodkan harga panggilan tunggal, jumlah token tugas, bilangan panggilan alat, bilangan percubaan semula sebelum kejayaan, dan masa kerja semula manual untuk mengetahui sama ada peningkatan tersebut benar-benar lebih murah. Untuk beban kerja yang mengutamakan latensi atau anggaran, Google masih menyarankan untuk mengurangkan tahap usaha, atau terus menggunakan 3.7 Flash; versi lama tidak dihentikan secara serta-merta setelah pelancaran produk baharu.
Versi biasa telah dibuka kepada pembangun dan perusahaan, dan pengguna Google AI Pro serta Ultra juga boleh menggunakannya dalam aplikasi Gemini, Mod AI Carian, dan Gemini dalam Sheets. Fungsi, kuota, dan lingkup ketersediaan wilayah mungkin berbeza mengikut laluan masuk, jadi “model telah dilancarkan” tidak boleh dianggap bermaksud semua pengguna dan semua produk mendapat kemampuan yang sama sepenuhnya. Terutamanya untuk alur kerja dengan alat autonomi, pelancarannya bergantung pada sama ada aplikasi menyediakan alat, kebenaran, dan persekitaran pelaksanaan yang boleh dipulihkan yang sesuai kepada model.
Versi Cyber lebih kuat dan lebih sempit, 47.2% bukan janji pembaikan automatik
Gemini 3.8 Flash Cyber berfokus pada penemuan lubang keamanan dan penghasilan pemaikan. Google menyatakan bahawa ia mencapai kejayaan lebih daripada 70% dalam penilaian dalaman penemuan lubang keamanan yang meliputi 20 bahasa pengaturcaraan; dalam penilaian pemaikan CWE-Bench luaran, pass@1 adalah 47.2%, hampir sama dengan model terkemuka terkini pada 47.8%, tetapi dengan kos yang lebih rendah. Hasil penggunaan dalaman oleh pasukan keselamatan Chrome menunjukkan bahawa jumlah pemaikan lubang keamanan yang betul yang dihasilkan oleh 3.8 Flash Cyber adalah 2.6 kali ganda berbanding model komersial besar terbaik. Wiz juga melaporkan peningkatan kadar pemulihan sebanyak 7.5 hingga 9.7 peratus dalam piawai ujian penetrasi dalaman mereka, dengan kos 2.3 hingga 5.2 kali lebih rendah.
Nombor-nombor ini mempunyai nilai rujukan dan batasan. Sampel, petunjuk, dan kaedah penilaian manusia untuk tolok ukur dalaman tidak dijelaskan sepenuhnya dalam pengumuman; 47.2% pass@1 juga bermaksud satu generasi tidak menjamin separuh lebih banyak soalan diperbaiki dengan betul. Google mengutamakan “pembaikan” berbanding “eksploitasi”, serta menambah perlindungan terhadap penyalahgunaan kimia, biologi, radioaktif, nuklear, dan maya kepada versi biasa 3.8. Versi Cyber, yang memenuhi keperluan pertahanan profesional, menggunakan sekatan keselamatan maya yang lebih longgar, oleh itu tidak dipaparkan secara menyeluruh, tetapi hanya disediakan kepada pembela tepercaya dalam rancangan Fairwind.
Yang benar-benar berubah dalam pelancaran ini ialah kompromi dalam siri Flash: ia tidak lagi bergantung semata-mata pada harga rendah dan kelajuan untuk menarik permintaan berskala besar, tetapi mengejar kadar penyelesaian tugas kompleks melalui kitaran inferens yang lebih panjang. Syarikat yang secara langsung menggantikan 3.7 dengan 3.8 paling mudah membuat kesilapan dengan hanya membandingkan harga per juta token. Pendekatan yang lebih selamat ialah menguji tugas sebenar mengikut peringkat: bataskan usaha untuk permintaan ringkas, benarkan lebih banyak kitaran untuk tugas panjang, dan kekal dengan pengesahan manusia serta persekitaran terpisah untuk tugas keselamatan. Flash 3.8 sudah boleh digunakan, dan Cyber juga telah memasuki rancangan terhad; sama ada ia mampu menyelesaikan lebih banyak tugas pengeluaran dengan kos keseluruhan yang lebih rendah, masih perlu dijawab oleh data end-to-end setiap pasukan sendiri.
