Google Melancarkan Gemini 3.8 Flash, Menutup Kesenjangan Prestasi dengan Model Unggulan

iconMetaEra
Kongsi
AI summary iconRingkasan
Google melancarkan Gemini 3.8 Flash dan varian keselamatan siber, Gemini 3.8 Flash Cyber, pada 2 September 2026, sebagai sebahagian daripada berita on-chain terkini. Model standard menyokong 1 juta token dan mendapat skor 73.7% dalam DeepSWE v1.1, hampir menyamai Claude Opus 5. Versi Cyber secara automatik mengesan dan membaiki kelemahan, mencapai kejayaan lebih daripada 70% dalam 20 bahasa. Kedua-dua model kini tersedia melalui Gemini API dan Google AI Studio, dengan potensi untuk pencatatan token baru.
Google melancarkan Gemini 3.8 Flash dan Gemini 3.8 Flash Cyber untuk organisasi pertahanan rangkaian tepercaya pada 2 September 2026. Versi biasa mempunyai konteks 1 juta token, berfokus pada pengaturan, agen, dan kerja profesional; dalam ujian yang dianjurkan oleh Google, prestasi kejuruteraan perisian jangka panjangnya mencapai 73.7%, hampir setara dengan 74.0% Claude Opus 5, sementara agen kewangan, agen undang-undang, dan sebahagian prestasi penarikan kesimpulan menyeluruh mengungguli model yang diuji. Versi Cyber mampu mencari kelemahan secara automatik dan menghasilkan pemaafan: kejayaan ujian dalaman Google merentas 20 bahasa pengaturcaraan melebihi 70%, dan pasukan Chrome menerima jumlah pemaafan yang betul sebanyak 2.6 kali ganda berbanding model komersial besar. Harga promosi API semasa ialah $0.75 setiap juta token input dan $3.75 setiap juta token output, tetapi model ini menukar prestasi dengan lebih banyak langkah penarikan kesimpulan dan pemanggilan alat; penilaian bebas menunjukkan kos tugas tunggalnya sebenarnya 40% lebih tinggi berbanding 3.7 Flash. Isyarat utama pelancaran ini ialah kemampuan agen yang dahulunya hanya tersedia pada model unggul mahal kini memasuki kategori “model kerja” yang murah dan boleh diperluaskan, tetapi data kemampuan masih berdasarkan ujian Google dan rakan kongsi sahaja, dan versi Cyber tidak tersedia untuk pengguna biasa.

Penulis artikel, sumber: DeepMind

Tiga kali dikemas kini dalam enam minggu, Google menjadikan Flash sebagai model utama

Gemini 3.8 Flash hanya tiga minggu selepas pelancaran 3.7 Flash, dan merupakan versi Flash ketiga yang dikeluarkan oleh Google dalam tempoh enam minggu.

Dahulu, “Flash” biasanya bermaksud cepat dan berkos rendah, tetapi kemampuannya jelas lebih lemah berbanding model unggulan. Posisi Gemini 3.8 sedang berubah: Google masih memanggilnya sebagai “model kerja” yang sesuai untuk pelaksanaan berskala besar, tetapi kini menekankan kemampuan utamanya seperti pengaturan jangka panjang, pemanggilan alat berterusan, dan analisis profesional, bukan sekadar tugas ringan seperti perbualan atau ringkasan.

Model baru menyokong input teks, gambar, audio, video, dan PDF, dengan konteks 1 juta Token dan output maksimum 64 ribu Token, serta boleh memanggil alat carian, fungsi, dan operasi komputer. Ia telah dibuka secara rasmi, bukan dalam mod ujian pra-pelancaran, dan boleh digunakan melalui Gemini API, Google AI Studio, Gemini Enterprise, Google Antigravity, aplikasi Gemini, Mod AI Carian, dan Google Sheets.

Agent Antigravity yang dihoskan oleh Google juga telah secara lalai mengambil alih 3.8 Flash. Ini menunjukkan bahawa model ini benar-benar bertujuan kepada agen yang memerlukan perancangan berulang, pemanggilan alat, pemeriksaan keputusan, dan penyesuaian berterusan, bukan hanya soal-jawab sekali sahaja.

Pencapaian pemrograman telah hampir menyamai model unggulan yang mahal

Dalam ujian kejuruteraan perisian jangka panjang DeepSWE v1.1 yang diumumkan oleh Google, Gemini 3.8 Flash mencapai 73.7%, lebih tinggi daripada 3.7 Flash pada 65.3% dan GPT‑5.6 Sol pada 72.7%, serta hanya 0.3 peratus lebih rendah daripada Claude Opus 5 pada 74.0%.

Ujian semacam ini memerlukan model untuk memasuki repositori kod sebenar, memahami hubungan antara beberapa fail, mengesan isu, dan melaksanakan perubahan yang dapat lulus ujian. Ia lebih dekat dengan pekerjaan agen pengaturcaraan sebenar berbanding menghasilkan fungsi secara berasingan.

Dalam Vals Finance Agent v2, 3.8 Flash mendapat 61.4%, manakala 3.7 Flash, Claude Opus 5, dan GPT‑5.6 Sol yang diuji masing-masing mendapat 59.0%, 58.6%, dan 53.8%.

Dalam ujian Harvey Legal Agent, Flash 3.8 mencapai 10.0%, lebih tinggi daripada Flash 3.7 pada 8.8%, Claude Opus 5 pada 6.7%, dan GPT-5.6 Sol pada 2.5%. Namun, semua model mendapat skor mutlak yang sangat rendah dalam penilaian ini; "berada di peringkat pertama" tidak bermakna mampu menangani kerja undang-undang yang kompleks dengan boleh dipercayai.

Dalam ujian penalaran multidisiplin HLE-Verified, 3.8 Flash mendapat 54.9%, GPT‑5.6 Sol dan Claude Opus 5 masing-masing mendapat 54.5% dan 54.4%, dengan perbezaan yang sangat kecil antara ketiga-tiga model tersebut, tidak mencukupi untuk membuktikan bahawa salah satu model memiliki keunggulan menyeluruh yang stabil.

Keputusan-keputusan ini terutamanya diumumkan oleh Google mengikut konfigurasi sendiri. Model, kerangka Agent, kekuatan inferens, kebenaran alat, dan bajet ujian semuanya akan mempengaruhi keputusan akhir; oleh itu, kesimpulan yang lebih munasabah ialah: model tingkatan Flash telah hampir menyamai sebahagian model unggul mahal, bukan Gemini yang telah memimpin secara menyeluruh dalam semua tugas.

“Bekerja lebih keras” bermaksud bekerja lebih pintar, mungkin juga bermaksud lebih mahal

Google mengaitkan peningkatan kemampuan Flash 3.8 kepada pilihan reka bentuk yang terus terang: membuat model "berusaha lebih keras".

Semasa menghadapi tugas yang kompleks, ia akan menggunakan lebih banyak langkah penalaran sederhana, memanggil alat berulang kali, dan secara aktif memeriksa kerja yang telah selesai. Pembangun boleh memilih tiga tahap pemikiran: rendah, sederhana, dan tinggi; tahap sederhana adalah tetapan lalai; tahap tinggi sesuai untuk pemrograman yang sukar dan penalaran berbilang langkah, manakala tahap rendah sesuai untuk perbualan masa nyata, penghasilan draf, dan tugas yang peka kepada kelewatan.

Ini dapat mengurangkan kebarangkalian agen berhenti terlalu awal, melewatkan langkah, atau menyimpang sepenuhnya dari matlamat selepas satu panggilan alat gagal, tetapi juga akan menghabiskan lebih banyak token.

Dalam ujian bebas Artificial Analysis, 3.8 Flash mencapai skor indeks kecerdasan 59 pada tahap pemikiran tinggi, meningkat 3 poin berbanding 3.7 Flash, dan berada pada tahap yang serupa dengan konfigurasi inferensi bukan tertinggi GPT‑5.6 Sol. Kelajuan output puratanya kira-kira 300 token per saat, dengan masa purata 2.5 minit untuk menyelesaikan setiap ujian.

Namun, output purata Token pada 3.8 Flash meningkat sekitar 30%, dan jumlah pusingan pelaksanaan dalam penilaian Agen juga lebih banyak. Walaupun harga setiap Token tidak meningkat, kos purata tugas tunggalnya ialah sekitar USD 0.58, iaitu lebih tinggi sebanyak 40% berbanding USD 0.40 pada 3.7 Flash.

Oleh itu, "harga rendah" tidak bermaksud "setiap tugas pasti lebih murah". Jika tugas itu sendiri tidak memerlukan penaakulan yang kompleks, menjalankan 3.8 Flash pada kekuatan tinggi mungkin hanya akan meningkatkan masa dan kos. Google juga mencadangkan aliran kerja yang mengutamakan kecekapan untuk mengurangkan tahap pemikiran, atau terus menggunakan 3.7 Flash yang masih disokong.

Harga rendah semasa ini hanyalah tawaran terhad

Sehingga 31 Disember 2026, harga promosi untuk Gemini 3.8 Flash ialah US$0.75 per juta Token input dan US$3.75 per juta Token output, sama seperti harga semasa 3.7 Flash.

Dari 1 Januari 2027, harga standard akan berubah menjadi $1.50 per juta token masuk dan $7.50 per juta token keluar, tepat dua kali ganda. Pembangun tidak boleh menganggap harga tempoh pelancaran sebagai harga kekal semasa menilai kos jangka panjang.

Walaupun dihitung mengikut harga standard masa depan, ia masih lebih rendah daripada beberapa model unggul; namun, untuk Agent yang memerlukan penghasilan puluhan ribu Token dan menjalankan puluhan pusingan pemanggilan alat, seharusnya bandingkan kos tugas penuh, bukan hanya nombor setiap juta Token dalam senarai harga.

Matlamat versi Cyber bukanlah untuk menjelaskan lubang keamanan, tetapi untuk memberikan pampasan secara langsung

Google juga melancarkan Gemini 3.8 Flash Cyber. Ia berkongsi kemampuan asas dengan versi biasa, tetapi telah dilatih secara lebih terfokus dalam keselamatan siber dan menggunakan sekatan keselamatan siber yang lebih longgar, membolehkannya menjalankan analisis lubang keamanan yang mungkin ditolak oleh model biasa.

Dalam piawai penemuan lubang keamanan CyberGym, Google menyatakan ia telah mencapai tahap terkini. Oleh kerana CyberGym terutama berfokus pada projek C dan C++, syarikat tersebut telah merekabentuk ujian dalaman yang meliputi 20 bahasa pengaturcaraan dan mengandungi perpustakaan kod sebenar yang kompleks, dengan kejayaan Flash Cyber 3.8 dalam menemui lubang keamanan melebihi 70%.

Penemuan lubang keamanan hanyalah langkah pertama. Google secara khusus menekankan bahawa fokus latihan Cyber ialah memperbaiki masalah, bukan menghasilkan program eksploitasi serangan.

Dalam ujian patch CWE-Bench yang dijalankan oleh Collinear, kadar lulus pertama kali untuk 3.8 Flash Cyber ialah 47.2%, manakala model unggul terkemuka yang dibandingkan ialah 47.8%. Kedua-duanya mencapai keputusan yang hampir sama, tetapi Google menyatakan bahawa kos operasi Flash Cyber lebih rendah.

Ini menunjukkan bahawa matlamat agen keselamatan siber berubah dari “memberitahu jurutera bahawa mungkin terdapat masalah di sini” kepada memahami kelemahan, menulis pampasan, menjalankan ujian, dan mengesahkan perubahan. Jika hasilnya cukup boleh dipercayai, ia boleh memendekkan masa yang diambil oleh pasukan keselamatan daripada menemui kelemahan hingga melaksanakan pampasan.

Chrome mendapat patch yang betul sebanyak 2.6 kali, tetapi masih dalam ujian pembuat dan rakan kongsi

Google telah menggunakan Flash Cyber untuk kerja keselamatan kod dalaman.

Pasukan keselamatan Chrome menyatakan bahawa jumlah pembaikan lalai yang dihasilkannya adalah 2.6 kali ganda berbanding model komersial besar lain. Syarikat keselamatan siber Wiz pula menyatakan bahawa dalam piawai ujian penetrasi mereka, kadar pemulihan lalai Flash Cyber lebih tinggi sebanyak 7.5 hingga 9.7 peratus berbanding model terkini lain, dengan kos 2.3 hingga 5.2 kali lebih rendah.

Talian penyelidikan kelemahan Google Cloud juga menyatakan bahawa model tersebut menemui satu kelemahan penting dalam masa kurang daripada dua jam, manakala penyelidikan serupa biasanya boleh berlangsung selama berbulan-bulan.

Hasil-hasil ini mempunyai nilai rujukan praktikal, tetapi tidak boleh dianggap sebagai penilaian awam yang bebas dan boleh diulang. Google tidak mengumumkan butiran spesifik kelemahan kunci itu, senarai model perbandingan, dan trajektori penuh operasi; data Chrome berasal daripada dalaman Google, dan Wiz juga merupakan rakan kongsi Fairwind. Oleh itu, ia membuktikan bahawa model telah mampu terlibat dalam kerja keselamatan sebenar, tetapi tidak membuktikan bahawa ia mencapai kesan setara secara stabil di semua kod dan jenis kelemahan.

Kemampuan keselamatan siber terkuat hanya dibuka kepada institusi yang boleh dipercayai

Flash Cyber disediakan melalui Program Fairwind baharu Google, dengan lebih daripada 650 peserta terlibat, terutamanya agensi keselamatan siber kerajaan, pengendali infrastruktur penting, pemelihara perisian, dan syarikat keselamatan besar.

Institusi yang terlibat perlu membatasi lingkup pengguna yang boleh mengakses dalaman, serta mengamalkan langkah-langkah keselamatan seperti pengesahan berbilang faktor. Selepas digabungkan dengan CodeMender Agent, model ini boleh mencari, mengesahkan, dan membaiki lubang keamanan di persekitaran awan institusi sendiri.

Pelanggan Google Cloud biasa masih boleh menggunakan CodeMender bersama model Gemini versi awam, tetapi tidak dapat memperoleh sepenuhnya keupayaan Flash Cyber.

Cara pelancaran “satu model asas, dua peringkat kebenaran” ini sangat serupa dengan pendekatan Anthropic sebelumnya yang memisahkan Claude menjadi Fable dan Mythos: kemampuan pengaturan dan analisis umum dibuka kepada pasaran, manakala fungsi keselamatan siber yang lebih mudah diubah menjadi kemampuan serangan diberikan melalui pengesahan identiti, kawalan akses, dan pemantauan berterusan.

Keselamatan tidak mengalami peningkatan yang ketara, tetapi sebahagian prestasi bukan bahasa Inggeris menurun

Versi Biasa 3.8 Flash mengandungi sekatan keselamatan berkaitan kimia, biologi, radioaktif, nuklear dan serangan siber; Versi Cyber, yang memerlukan penyelesaian tugas pertahanan profesional, mempunyai sekatan keselamatan siber yang lebih longgar, oleh itu hanya dibuka kepada institusi yang telah disemak.

Kad model Google menyatakan bahawa, berbanding dengan 3.7 Flash, 3.8 Flash tidak menunjukkan kemampuan baru yang signifikan dalam bidang-bidang berisiko tinggi yang menjadi perhatian kerangka keselamatan terkini syarikat, oleh itu tidak memicu peningkatan tahap risiko. Perlindungannya dalam ujian penyuntikan petunjuk Gray Swan secara tidak langsung juga telah diperbaiki.

Namun, kad model juga mengungkapkan bahawa 3.8 Flash menunjukkan penurunan 5.4 peratus dalam ujian keselamatan automatik pelbagai bahasa berbanding 3.7 Flash. Selepas semakan manual oleh Google, ia menyatakan bahawa kebanyakan perbezaan adalah kesalahan laporan atau kandungan yang tidak serius, tetapi sampel penuh dan data per bahasa tidak diumumkan.

Model ini juga mengekalkan masalah biasa model bahasa besar, termasuk halusinasi, respons yang kadang-kadang perlahan atau masa habis, serta penggunaan token berlebihan untuk meningkatkan prestasi. Tarikh penghujung pengetahuan ditandakan sebagai Mac 2026, tetapi Google menjelaskan bahawa pengetahuan yang boleh dipercayai dalam beberapa bidang mungkin masih hanya diperbaharui hingga sekitar Januari 2025; semasa berkaitan dengan maklumat terkini, pengesahan dalam talian masih diperlukan.

Persaingan sebenar sedang berpindah dari "siapa yang paling bijak" kepada "siapa yang boleh digunakan secara besar-besaran"

Yang paling patut diperhatikan mengenai Gemini 3.8 Flash bukanlah satu ukuran tertentu yang memimpin sedikit sahaja, tetapi Google sedang memasukkan kemampuan pemrograman jangka panjang, analisis profesional, dan pemanggilan alat autonom ke dalam julat harga Flash.

Model unggulan sesuai untuk tugas sukar dengan nilai tinggi dan frekuensi rendah; namun, agen yang sebenarnya beroperasi dalam perkhidmatan pelanggan korporat, saliran pengaturcaraan, analisis kewangan, dan pengimbasan keselamatan mungkin mengendalikan jutaan panggilan setiap hari. Dalam skenario ini, kelajuan, harga per unit, dan kejayaan tugas per unit sering kali lebih penting daripada tempat pertama dalam senarai peringkat.

3.8 Flash juga menunjukkan kontradiksi dalam jalan ini: semakin cekap model dalam semakan berulang dan kerja berterusan, semakin besar kemungkinannya menghasilkan lebih banyak Token, yang meningkatkan kos tugas tunggal bagi "model murah". Oleh itu, inti persaingan agen masa depan bukan sahaja siapa yang menjawab paling baik, tetapi juga siapa yang mampu menilai kapan meneruskan pemikiran, kapan menggunakan alat, dan kapan harus berhenti.

Penafian: Maklumat yang terdapat pada halaman ini mungkin telah diperoleh daripada pihak ketiga dan tidak semestinya menggambarkan pandangan atau pendapat KuCoin. Kandungan ini adalah disediakan bagi tujuan maklumat umum sahaja, tanpa sebarang perwakilan atau waranti dalam apa jua bentuk, dan juga tidak boleh ditafsirkan sebagai nasihat kewangan atau pelaburan. KuCoin tidak akan bertanggungjawab untuk sebarang kesilapan atau pengabaian, atau untuk sebarang akibat yang terhasil daripada penggunaan maklumat ini. Pelaburan dalam aset digital boleh membawa risiko. Sila menilai risiko produk dan toleransi risiko anda dengan teliti berdasarkan keadaan kewangan anda sendiri. Untuk maklumat lanjut, sila rujuk kepada Terma Penggunaan dan Pendedahan Risiko kami.