Baru saja, Google kembali!
Malam ini, Google secara resmi meluncurkan Gemini 3.8 Flash, serta Gemini 3.8 Flash Cyber yang khusus dirancang untuk keamanan siber.
Ini adalah versi Flash ketiga yang dirilis oleh Google dalam waktu enam minggu.
Dua pembaruan sebelumnya tampaknya hanya pemanasan, karena kali ini, Google langsung mendorong nilai terbaik ke garis depan—
Biaya tugas tunggal hanya $0,58! Input hanya $0,75/juta Tokens!
Model kecil dengan harga "sangat murah" ini secara nyata mencapai ambang batas model unggulan terkuat dunia, Opus 5, GPT-5.6 Sol, dan Grok 4.6, dalam berbagai tes benchmark utama.
Ahli Google DeepMind, Yao Shunyu, menilai: Bagi model, ini hanyalah satu langkah kecil; tetapi bagi RSI, ini adalah lompatan besar.

Di X, para pengembang sudah heboh.
Setelah diuji coba oleh seseorang, ia mengajukan pertanyaan mendalam: "Astaga, apakah Google salah kirim barang? Ini bukankah Gemini 3.5 Pro yang selama ini belum dirilis? Harganya seperti Flash, tapi fungsinya seperti Pro!"


Di tim DeepMind, mungkin ada yang tidak tidur sejak Juli.
Saat semua orang masih mencerna Fable 5.1, Google sekali lagi mengacaukan meja.
Google "Raja Penggulung" kembali: Raja Nilai Terbaik
Google yang telah lama sunyi, dengan cara yang sangat kompetitif, mengumumkan kepada dunia: Sang Raksasa Telah Kembali.

Untuk memahami dampak yang dibawa oleh Gemini 3.8 Flash, kita harus terlebih dahulu melihat peta situasi pasar AI saat ini.
Awalnya, dalam pengujian Artificial Analysis, telah terbentuk tembok yang sangat ketat. Untuk memiliki kecerdasan tingkat atas (Indeks Kecerdasan sekitar 60 poin), Anda harus membayar biaya Token yang tinggi.
Hasilnya, Gemini 3.8 Flash seperti seorang pembunuh, benar-benar tidak mengikuti aturan.
Dalam mode penalaran tinggi Artificial Analysis, indeks kecerdasan Gemini 3.8 Flash melonjak hingga 59 poin!

Apa konsep ini? Ini hanya selangkah lagi dari GPT-5.6 Sol dan Grok 4.6 teratas, bahkan melampaui Claude Opus 5 di beberapa dimensi!
Dan berapa biaya untuk mencapai semua ini? Biaya per tugasnya hanya $0.58.
Secara khusus, biaya input tetap pada $0,75 per juta Tokens, dan output pada $3,75 per juta Tokens.
Google membuat sebuah grafik: pada frontier Pareto antara kecerdasan dan biaya, titik biru yang mewakili Gemini 3.8 Flash berada di sudut kanan atas pada benchmark perangkat lunak DeepSWE, jauh meninggalkan peringkat kedua.

Gemini 3.8 Flash tidak hanya cerdas, tetapi juga sangat cepat. Kecepatan generasinya mencapai 305 token/detik yang menakjubkan, sementara model di tingkat berikutnya hanya mampu mencapai 154 token/detik.
Model yang cepat, cerdas, dan murah seolah-olah gratis—inilah model yang benar-benar bisa digunakan manusia setiap hari.

Terutama pada benchmark rekayasa perangkat lunak jangka panjang (DeepSWE v1.1), 3.8 Flash mencapai hasil menakjubkan 73,7%.
Dalam pengujian yang memerlukan AI untuk secara mandiri menyelesaikan masalah teknis kompleks dan menulis kode secara end-to-end, ia tidak hanya melampaui sebagian besar model besar mutakhir yang mahal, tetapi juga biayanya hanya sebagian kecil dari model tersebut.
Perlu diketahui, ini hanya versi «Flash», bukan «Pro», apalagi «Ultra».
Kali ini, Google sekali lagi membiarkan model kecil merebut pangsa pasar model unggulan.
Seseorang telah menguji langsung Gemini 3.8 Flash dan Opus 5 untuk tugas yang sama.

Peningkatan besar dalam kemampuan pemrograman ini bukanlah kebetulan.

Peningkatan besar dalam kemampuan pemrograman ini bukanlah kebetulan.
Dilaporkan bahwa dalam pengujian alat kode internal Google, Jetski, insinyur Google bahkan lebih memilih 3.8 Flash daripada model Opus dari Anthropic.

Di balik ini adalah Google yang mulai mengalokasikan sumber daya besar untuk pembelajaran penguatan sejak awal tahun—yaitu tahap "penyempurnaan akhir" dalam pelatihan model, sehingga model benar-benar belajar bekerja melalui percobaan dan kesalahan.
Google DeepMind membentuk tim serangan kode yang berfokus pada peningkatan kemampuan model pemrograman, tim ini dipimpin oleh CTO DeepMind dan diawasi langsung oleh salah satu pendiri, Sergey Brin.
Tujuan mereka adalah memaksa evolusi mandiri rekursif, mengubah model pemrograman secara paksa menjadi peneliti AI otomatis penuh, dan secara menyeluruh menghubungkan seluruh siklus pengembangan.

Dalam memo internal, Google secara langsung mengatakan:
Untuk memenangkan sprint terakhir, kami harus segera menutup kesenjangan dalam eksekusi agen dan menjadikan model kami sebagai pengembang utama.

Selain itu, Google juga merekrut Barret Zoph, salah satu pendiri Thinking Machines Lab dan mantan kepala pasca-pelatihan di OpenAI, yang kini menjabat sebagai Wakil Presiden Riset, mengawasi bidang pembelajaran penguatan dan pasca-pelatihan. Operasi ini jelas menunjukkan komitmen mereka untuk bertarung habis-habisan.
Bulan lalu, co-founder dan penerima Nobel Demis Hassabis melepaskan jabatan CEO, dan penggantinya, Koray Kavukcuoglu, langsung menyatakan: percepat, percepat, lagi percepat.
Basis "pemompaan", atau keunggulan nyata?
Namun, dalam pujiannya, Google banyak dikritik karena sudah terlalu cepat merayakan kemenangan.

Yang paling tidak menyenangkan adalah Meta—
Muse Spark 1.3 dari Meta dan Gemini 3.8 Flash bertemu dalam pertandingan sengit, dengan Muse Spark 1.3 memperoleh skor 62 pada indeks kecerdasan Artificial Analysis, sejajar dengan Claude Fable 5, dan masuk ke jajaran teratas.
Biaya input Muse 8 kali lebih rendah daripada Fable 5, dan biaya outputnya hampir 12 kali lebih rendah, menjadikan rasio harga-kinerja maksimal.
Chief AI Officer Meta, Alexandr Wang, langsung menyindir: Di indeks cerdas Artificial Analysis, Gemini tidak berarti apa-apa dan hanya bisa menghirup knalpot model lain.


Muse Spark 1.3 mendapat skor lebih tinggi daripada GPT-5.6 Sol, Grok 4.6, dan Gemini 3.8 Flash, tetapi saat ini hanya tersedia dalam versi pratinjau terbatas.
Ada yang menunjukkan bahwa meskipun grafik benchmark 3.8 Flash terlihat bagus, dalam praktiknya belum tentu demikian.
Memang, Gemini 3.8 Flash mengungguli GPT-5.6 Sol dan Opus 5 dalam pengujian seperti Terminal-Bench 2.1 dan HLE, tetapi perbedaan skor besar antara TBench 2.1 dan TBench 4 mengungkapkan kemungkinan adanya elemen "manipulasi peringkat".
Artinya, ketika menghadapi tantangan Zero-shot dunia nyata yang asing dan belum termasuk dalam kumpulan pelatihan, 3.8 Flash kemungkinan besar masih kalah dibandingkan raksasa parameter seperti Opus 5.
Namun solusi Google sangat cerdas—kerja keras dapat mengatasi kekurangan.
Seperti yang disebutkan Google di blog resminya: "Peningkatan kinerja ini berasal dari pilihan desain inti: 3.8 Flash bekerja lebih keras."
Saat menghadapi tugas yang kompleks, 3.8 Flash dirancang untuk menjalankan langkah penalaran tambahan dan terus-menerus mengulangi pemanggilan alat. Saat menghadapi pertanyaan yang tidak dipahami, ia tidak langsung menyerah, tetapi melakukan verifikasi dan refleksi diri yang cepat di dalam dengan menghabiskan lebih banyak Token.
Meskipun ia menghabiskan lebih banyak Token melalui beberapa siklus pemikiran, karena harga dasarnya sangat murah (0,75 dolar per juta token), secara keseluruhan, ia tetap jauh lebih murah daripada Anda langsung memanggil GPT-5.6!
Strategi ini secara langsung menghancurkan persaingan satu dimensi masa lalu yang menyatakan "parameter besar = kemampuan kuat".
Ini membuktikan bahwa dalam siklus Agent yang sempurna, kecepatan dan biaya inferensi yang sangat rendah, pada dasarnya merupakan kecerdasan yang kuat.
Mengapa mengirim Flash? Versi Pro yang "dibatalkan"
Apakah Google kali ini benar-benar tidak mengirimkan barang yang salah?
Gemini 3.5 Pro sampai sekarang belum terlihat sama sekali. Gemini 4 generasi berikutnya, meskipun data pra-pelatihannya cukup bagus, tetapi tahap pasca-pelatihan belum selesai.

Faktanya, Google lama sekali merilis versi Pro, yang di belakangnya menyimpan sejarah yang menyedihkan.
Pai Chai pernah membanggakan diri pada Mei tahun ini bahwa ia akan meluncurkan seri Pro yang lebih kuat "bulan depan", tetapi terus menunda.
Sebenarnya, di dalam Google awalnya ada beberapa kandidat model 3.5 Pro, tetapi semuanya akhirnya dihapus tanpa ampun—karena tidak unggul cukup signifikan dibandingkan dengan seri Flash saat ini!
Sementara itu, Gemini 4 generasi berikutnya yang ditunggu-tunggu, meskipun menunjukkan kinerja baik dalam evaluasi pra-pelatihan, saat ini masih terjebak di tahap pasca-pelatihan paling kritis.
Secara keseluruhan, semua kebetulan telah menciptakan iterasi gila dari seri Flash.
2 jam menemukan kerentanan yang memakan waktu berbulan-bulan untuk ditemukan: Mendominasi dunia keamanan siber
Apakah Google kali ini hanya membuat 3.8 Flash bersaing harga dalam tugas sehari-hari?
Jauh lebih dari itu.
Senjata utama sebenarnya dari peluncuran ini adalah saudara kembarannya—Gemini 3.8 Flash Cyber.
Para pengembang pun terkejut: "Apa tugas keamanan semacam itu yang membuat Google secara khusus merilis varian Cyber khusus untuk Flash?"
Jawaban Google adalah: untuk melawan peretas AI di masa depan.
Pada benchmark CyberGym yang menemukan kerentanan, 3.8 Flash Cyber mendapatkan skor 86,2%, langsung mendominasi daftar peringkat dan menjauhkan model besar sebelumnya.
Selain itu, kode di dunia nyata tidak hanya terbatas pada C/C++.
Dalam pengujian komprehensif terhadap kode yang kompleks di dalam Google yang mencakup 20 bahasa pemrograman, model ini berhasil menemukan kerentanan luas dengan tingkat keberhasilan melebihi 70%.
Yang lebih mengejutkan adalah rekam jejaknya di dunia nyata.
Tim keamanan Chrome mengujinya dan menemukan bahwa jumlah patch perbaikan yang benar yang dihasilkannya adalah 2,6 kali lebih banyak daripada model komersial terbaik sebelumnya yang jauh lebih besar.
Wiz Security menemukan bahwa tingkat recall dalam pengujian penetrasi meningkat sebesar 7,5-9,7%, sementara biaya berkurang 2,3 hingga 5,2 kali lipat.
Yang paling mengejutkan adalah, tim peneliti kerentanan Google Cloud memanfaatkannya dan dalam waktu hanya 2 jam, menemukan kerentanan kritis yang mendasar—padahal biasanya, para ahli manusia teratas membutuhkan berbulan-bulan untuk menemukan kerentanan semacam ini!
Dalam CWE-Bench (uji kemampuan patching), tingkat keberhasilan pertama 3.8 Flash Cyber mencapai 47,2%, hampir sebanding dengan model besar terdepan (47,8%), tetapi harganya hanya sebagian kecil saja.

Karena kekuatan serangan dan pertahanan jaringan 3.8 Flash Cyber terlalu menakjubkan, Google tidak memilih untuk sepenuhnya mengopen-sourcenya, tetapi hanya membukanya untuk lembaga terpercaya melalui program Fairwind yang baru.
OpenAI, Anthropic, dan Google: Perang Tiga Negara Model Besar Memasuki Titik Balik
Melalui peluncuran Gemini 3.8 Flash, terlihat bahwa tiga raksasa AI saat ini telah menempuh tiga jalur evolusi yang sama sekali berbeda.
Anthropic (keluarga Claude), fokus pada "keandalan dan stabilitas pengetahuan".
Dalam tes yang berfokus pada cakupan pengetahuan dan akurasi fakta (seperti AA-Omniscience), Claude tetap menjadi dominasi yang tak terbantahkan.
Tujuh besar semuanya adalah keluarga Claude, yang kini jelas memperkuat kemampuan mereka untuk tidak membuat kesalahan dalam tugas enterprise, berusaha menghasilkan output yang stabil.
OpenAI (seri GPT), mempertaruhkan pada "penalaran mendalam dan kejadian tiba-tiba".
Dalam tes CritPt yang cenderung pada derivasi fisika dan matematika, GPT-5.6 Sol unggul jauh.
OpenAI seolah berusaha mencapai munculnya kecerdasan murni, menuntut model untuk bisa "mengerti" sendiri seperti seorang ilmuwan ketika tidak diberi tahu jawabannya.
Google (keluarga Gemini), menciptakan "pekerja supercepat yang berputar tanpa henti".
Google kali ini memberikan jawaban ketiga: Mungkin saya tidak bisa memecahkan soal fisika paling sulit sekaligus, tetapi saya bereaksi sangat cepat dan dengan biaya sangat rendah.
Di era Agent, saya bisa berpikir 100 kali dalam satu detik, menulis kode, menjalankan, mengalami kesalahan, memperbaiki, dengan iterasi brutal berbiaya sangat rendah, memaksa munculnya hasil yang benar.
Agen menghadapi masalah di dunia nyata, memerlukan percobaan dan kesalahan berulang, pemanggilan alat, dan penyesuaian dinamis.
Sementara itu, Gemini 3.8 Flash benar-benar dirancang khusus untuk "alur kerja jangka panjang" semacam ini.
Anda dapat menggunakan Google Antigravity, hanya dengan satu prompt ditambah perintah loop, untuk membuat 3.8 Flash secara otomatis menghasilkan game lengkap yang mencakup teka-teki, texture lingkungan, dan level 3D.
Anda dapat menggunakannya untuk secara otomatis membuat peta Google versi DOS dengan tampilan jalan dan navigasi.
Jelas, kemudahan penggunaan dan biaya Gemini 3.8 Flash telah melewati titik balik tertentu.
Kedatangan Gemini 3.8 Flash seolah-olah Google mengumumkan kepada seluruh industri: model besar sedang meninggalkan era "hanya bisa diakses oleh raksasa", dan berlari menuju普惠 komputasi.
Tugas agen yang sebelumnya memerlukan biaya puluhan ribu dolar dan berjalan selama beberapa hari, sekarang bisa diselesaikan dalam beberapa menit dengan biaya setara beberapa cangkir kopi.
Zaman individu super untuk orang biasa benar-benar telah tiba.
Ini adalah momen kesadaran untuk model kecil.
Referensi:
https://x.com/alexandr_wang/status/2095266112212754659?s=20
https://blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber/
Diedit oleh Aeneas David
Artikel ini berasal dari akun WeChat "Sinzhiyuan", penulis: ASI Revelation
