Google Meluncurkan Tiga Model Gemini Baru untuk Meningkatkan Efisiensi dan Kecepatan Agen AI

iconTechFlow
Bagikan
AI summary iconRingkasan
Google telah meluncurkan tiga model Gemini baru—3.6 Flash, 3.5 Flash-Lite, dan 3.5 Flash Cyber—untuk meningkatkan kinerja AI Agent. Model 3.6 Flash mengurangi penggunaan token sebesar 17% dan meningkatkan tugas pemrograman serta pengetahuan. Model 3.5 Flash-Lite mencapai 350 token per detik, tercepat dalam serinya. Model 3.5 Flash Cyber berfokus pada mengidentifikasi dan menyelesaikan masalah keamanan siber dalam kode. Pembaruan ini selaras dengan berita AI + kripto dan dapat memengaruhi daftar token baru di ruang ini.

Penulis: Google DeepMind

Diterjemahkan oleh Deep潮 TechFlow

Panduan DeepCha: Tiga model yang dirilis Google kali ini fokus pada solusi nyata untuk tantangan komersialisasi AI Agent—biaya dan kecepatan. 3.6 Flash menghemat 17% token dibanding generasi sebelumnya, dengan harga lebih rendah namun kualitas lebih baik; 3.5 Flash-Lite mencapai kecepatan 350 token/detik, menjadi model seri 3.5 tercepat saat ini; sementara model khusus keamanan siber, Flash Cyber, menargetkan pasar yang sangat dibutuhkan yaitu perbaikan kerentanan kode. Ini bukan sekadar pertandingan performa, melainkan langkah mempersiapkan penerapan skala besar AI Agent.

Google DeepMind hari ini meluncurkan tiga model Gemini baru: 3.6 Flash, 3.5 Flash-Lite, dan 3.5 Flash Cyber. Model-model ini dirancang khusus untuk efisiensi, latensi, dan keandalan yang dibutuhkan dalam membangun AI Agent dalam skala besar.

Gemini 3.6 Flash: Lebih efisien, lebih berkualitas

3.6 Flash dikembangkan berdasarkan umpan balik pengembang terhadap 3.5 Flash. Tidak hanya lebih maju dalam pemrograman dan pekerjaan pengetahuan, tetapi juga secara signifikan meningkatkan efisiensi token. Menurut Artificial Analysis Index, 3.6 Flash mengurangi konsumsi token output sebesar 17% dibandingkan 3.5 Flash. Pada beberapa pengujian benchmark seperti DeepSWE dari Datacurve, pengurangannya mencapai hingga 65%. Jumlah langkah inferensi dan pemanggilan alat yang diperlukan untuk menyelesaikan alur kerja multi-langkah juga lebih sedikit.

Peningkatan efisiensi ini juga disertai dengan harga yang lebih rendah. Dengan harga $1,5 per juta token masukan dan $7,5 per juta token keluaran, 3.6 Flash menurunkan biaya total per tugas Agent, membuat pembuatan dan pelaksanaan Agent lebih ekonomis.

Meskipun lebih efisien, performa 3.6 Flash lebih unggul dibanding 3.5 Flash dalam berbagai kasus penggunaan:

Pengeditan kode menjadi lebih akurat, mengurangi perubahan dan siklus eksekusi yang tidak perlu, mencapai 49% di DeepSWE (3.5 Flash: 37%), dan meningkat signifikan menjadi 63,9% di benchmark penelitian machine learning MLE Bench (3.5 Flash: 49,7%)

Kemampuan operasi komputer ditingkatkan, skor OSWorld-Verified 83,0% (3,5 Flash sebesar 78,4%). Operasi komputer kini tersedia melalui Gemini API dan Gemini Enterprise sebagai alat klien bawaan.

Kinerja pekerjaan pengetahuan lebih baik, seperti skor benchmark GDPval-AA v2 sebesar 1421 (3.5 Flash sebesar 1349). Klien seperti Hebbia dan Harvey menemukan bahwa ia sangat unggul dalam tugas multimodal seperti pemrosesan dokumen, analisis grafik dan data, serta penyusunan laporan.

Umpan balik pelanggan: 3.6 Flash merupakan kemajuan dalam biaya dan kualitas, menyeimbangkan efisiensi token, akurasi, dan kecepatan dalam alur kerja kompleks dan tugas berbasis pengetahuan.

Desain keamanan

3.6 Flash dilengkapi dengan langkah-langkah perlindungan keamanan mutakhir yang mencakup bidang kimia, biologi, radiasi, dan nuklir (CBRN) serta penyalahgunaan serangan siber. Perlindungan ini meningkatkan ketahanan model terhadap serangan jailbreak. Seiring itu, model telah dilatih untuk meminimalkan penolakan terhadap penggunaan yang bermanfaat.

Gemini 3.5 Flash-Lite: Dibuat untuk menskalakan alur kerja Agent

3.5 Flash-Lite dirancang untuk tugas latensi rendah dan skenario pengembangan yang membutuhkan throughput tinggi, seperti pencarian Agent dan pemrosesan dokumen.

3.5 Flash-Lite adalah model tercepat dalam seri 3.5. Menurut pengukuran Artificial Analysis, kecepatannya mencapai 350 token output per detik. Harganya sebesar $0,3 per juta token input dan $2,5 per juta token output, dengan kualitas jauh lebih unggul dibanding 3.1 Flash-Lite, memberikan nilai terbaik bagi pengembang dan pelanggan yang menjalankan tugas produksi dengan volume tinggi.

3.5 Flash-Lite mendukung ekspansi efisien sistem Agent. Pada setiap tingkat pemikiran, model ini secara signifikan unggul dibandingkan 3.1 Flash-Lite. Pengembang dapat mengonfigurasi model sesuai beban kerja: menggunakan tingkat pemikiran minimum dan rendah untuk tugas massal, dengan prioritas pada latensi rendah dan biaya eksekusi rendah; atau mengaktifkan tingkat pemikiran lebih tinggi untuk menangani beban kerja sub-Agent multi-langkah. Model ini sekarang juga menyertakan operasi komputer sebagai alat bawaan, mendukung tugas Agent lintas antarmuka secara andal.

Ini menunjukkan peningkatan signifikan dalam pengkodean dan tugas Agent, seperti skor Terminal-Bench 2.1 sebesar 54% (3.1 Flash-Lite: 31%), konteks panjang seperti GDM-MRCR v2 dengan skor 72,2% (3.1 Flash-Lite: 60,1%), dan pelaksanaan tugas nyata seperti GDPval-AA v2 dengan skor 1140 (3.1 Flash-Lite: 642).

Sebenarnya, dalam banyak evaluasi agen dan pengkodean, 3.5 Flash-Lite bahkan melebihi 3 Flash, termasuk SWE-Bench Pro (54,2% vs 49,6%) dan OSWorld-Verified (74,0% vs 65,1%), menjadikannya pilihan yang lebih cepat dan lebih kuat untuk beban kerja 2.5 dan 3 Flash.

Pelanggan awal menekankan kombinasi unik kecepatan, kecerdasan, dan efisiensi biaya dari 3.5 Flash-Lite dalam memperluas alur kerja Agent dan tugas pemrosesan data.

Gemini 3.5 Flash Cyber di CodeMender: Menemukan dan memperbaiki kerentanan secara efisien

Model AI menemukan kerentanan keamanan lebih cepat daripada sistem saat ini memperbaikinya. Menanggapi ancaman yang semakin serius ini memerlukan pendekatan keamanan perangkat lunak yang efisien dan kuat.

Kinerja dan efisiensi Flash menjadikannya dasar ideal untuk deteksi, verifikasi, dan perbaikan masalah keamanan kode dalam skala besar. Gemini 3.5 Flash Cyber dibangun berdasarkan 3.5 Flash, disesuaikan secara khusus untuk menemukan dan memperbaiki kerentanan keamanan siber, dengan harga per token lebih rendah daripada model besar.

Di CodeMender, beberapa 3.5 Flash Cyber Agent bekerja sama menghasilkan satu laporan komprehensif, mencapai tingkat kompetitif terdepan di benchmark populer CyberGym.

Mengingat sifat penggunaan ganda dari teknologi ini, kami mengambil pendekatan penerapan yang hati-hati. Model ini akan segera disediakan secara eksklusif kepada pemerintah dan mitra tepercaya melalui CodeMender dalam bentuk proyek uji coba dengan akses terbatas. Ini akan memungkinkan para pelindung garis depan untuk mendeteksi dan memperbaiki kerentanan kritis sebelum dimanfaatkan, sekaligus mengurangi risiko penyalahgunaan yang lebih luas.

Mulai sekarang

3.6 Flash dan 3.5 Flash-Lite tersedia mulai hari ini:

Developer dapat menggunakan melalui Google AI Studio dan Gemini API di Android Studio. 3.6 Flash juga tersedia di Google Antigravity

Enterprise dapat digunakan di platform Gemini Enterprise Agent. 3.6 Flash juga tersedia di aplikasi Gemini Enterprise.

Semua orang dapat menggunakannya melalui aplikasi Gemini. 3.5 Flash-Lite juga sedang diluncurkan di Google Search.

Silakan berikan umpan balik untuk meningkatkan model Gemini mendatang, kami menantikan rilis 3.5 Pro segera.

Penafian: Informasi pada halaman ini mungkin telah diperoleh dari pihak ketiga dan tidak mencerminkan pandangan atau opini KuCoin. Konten ini disediakan hanya untuk tujuan informasi umum, tanpa representasi atau jaminan apa pun, dan tidak dapat ditafsirkan sebagai saran keuangan atau investasi. KuCoin tidak bertanggung jawab terhadap segala kesalahan atau kelalaian, atau hasil apa pun yang keluar dari penggunaan informasi ini. Berinvestasi di aset digital dapat berisiko. Harap mengevaluasi risiko produk dan toleransi risiko Anda secara cermat berdasarkan situasi keuangan Anda sendiri. Untuk informasi lebih lanjut, silakan lihat Ketentuan Penggunaan dan Pengungkapan Risiko.