Google melancarkan tiga model Gemini baru untuk meningkatkan kecekapan dan kelajuan agen AI

iconTechFlow
Kongsi
AI summary iconRingkasan
Google telah melancarkan tiga model Gemini baru—3.6 Flash, 3.5 Flash-Lite, dan 3.5 Flash Cyber—untuk meningkatkan prestasi Agen AI. Model 3.6 Flash mengurangkan penggunaan token sebanyak 17% dan meningkatkan tugas pengaturcaraan dan pengetahuan. Model 3.5 Flash-Lite mencapai 350 token per saat, paling pantas dalam siri ini. Model 3.5 Flash Cyber berfokus pada mengenal pasti dan menyelesaikan isu keselamatan siber dalam kod. Kemas kini ini selari dengan berita AI + kripto dan mungkin mempengaruhi pencatatan token baru di ruang ini.

Penulis: Google DeepMind

Diterjemahkan oleh Deep潮 TechFlow

Pengantar DeepChao: Tiga model yang dikeluarkan oleh Google kali ini secara inti menyelesaikan titik kesakitan sebenar dalam komersialisasi AI Agent—kos dan kelajuan. 3.6 Flash mengurangkan token sebanyak 17% berbanding generasi sebelumnya, dengan harga lebih rendah tetapi kualiti lebih baik; 3.5 Flash-Lite mencapai kelajuan 350 token/detik, menjadikannya model siri 3.5 paling pantas saat ini; manakala model keselamatan siber khas, Flash Cyber, menargetkan pasaran keperluan asas bagi pembaikan lubang kod. Ini bukan permainan ujian prestasi, tetapi langkah untuk membina jalan bagi pelaksanaan AI Agent dalam skala besar.

Google DeepMind memperkenalkan tiga model Gemini baru hari ini: 3.6 Flash, 3.5 Flash-Lite, dan 3.5 Flash Cyber. Model-model ini direka khas untuk kecekapan, latensi, dan kebolehpercayaan yang diperlukan dalam pembinaan AI Agent dalam skala besar.

Gemini 3.6 Flash: Lebih cekap, lebih berkualiti

3.6 Flash telah diperbaiki berdasarkan maklum balas pengembang terhadap 3.5 Flash. Ia tidak hanya melangkah lebih jauh dalam pengkodean dan kerja pengetahuan, tetapi juga meningkatkan kecekapan token secara ketara. Menurut Artificial Analysis Index, 3.6 Flash mengurangkan penggunaan token output sebanyak 17% berbanding 3.5 Flash. Dalam beberapa ujian piawai seperti DeepSWE Datacurve, pengurangan mencapai 65%. Langkah penalaran dan panggilan alat yang diperlukan untuk menyelesaikan alur kerja berbilang langkah juga lebih sedikit.

Peningkatan kecekapan ini juga disertai dengan harga yang lebih rendah. Dihargaikan pada $1.5 per juta token input dan $7.5 per juta token output, 3.6 Flash mengurangkan kos keseluruhan setiap tugas Agen, menjadikan pembinaan dan pengendalian Agen lebih ekonomik.

Walaupun lebih cekap, 3.6 Flash menunjukkan prestasi yang lebih baik daripada 3.5 Flash dalam pelbagai kes penggunaan:

Pengeditan kod menjadi lebih tepat, mengurangkan perubahan dan kitaran pelaksanaan yang tidak perlu, mencapai 49% di DeepSWE (3.5 Flash ialah 37%), dan meningkat secara ketara kepada 63.9% di piawaian penyelidikan pembelajaran mesin MLE Bench (3.5 Flash ialah 49.7%)

Kemampuan pengendalian komputer ditingkatkan, skor OSWorld-Verified 83.0% (3.5 Flash ialah 78.4%). Pengendalian komputer kini disediakan sebagai alat klien dalaman melalui Gemini API dan Gemini Enterprise

Pekerjaan pengetahuan menunjukkan prestasi yang lebih baik, seperti skor rujukan GDPval-AA v2 sebanyak 1421 (3.5 Flash adalah 1349). Pelanggan seperti Hebbia dan Harvey mendapati ia sangat unggul dalam tugas multimodal seperti penguraian dokumen, grafik dan analisis data, serta penyusunan laporan.

Ulasan pelanggan: 3.6 Flash menunjukkan kemajuan dari segi kos dan kualiti, menyeimbangkan kecekapan token, ketepatan, dan kelajuan dalam alur kerja yang kompleks dan tugas berbasis pengetahuan.

Reka bentuk keselamatan

3.6 Flash dilengkapi dengan langkah-langkah perlindungan keselamatan canggih yang diperkukuh, mencakup bidang kimia, biologi, radiasi dan nuklear (CBRN) serta penyalahgunaan serangan siber. Perlindungan ini meningkatkan ketahanan model terhadap serangan jailbreak. Sementara itu, model telah dilatih untuk meminimumkan penolakan terhadap penggunaan yang bermanfaat.

Gemini 3.5 Flash-Lite: Dicipta untuk penskalaan alur kerja Agen

3.5 Flash-Lite direka untuk tugas latensi rendah dan senario pembangunan yang memerlukan throughput tinggi, seperti carian Agent dan pemprosesan dokumen.

3.5 Flash-Lite ialah model paling pantas dalam siri 3.5. Menurut pengukuran Artificial Analysis, ia beroperasi pada kecepatan 350 token output per saat. Harganya ialah $0.3 per juta token input dan $2.5 per juta token output, dengan kualiti yang jauh lebih baik daripada 3.1 Flash-Lite, memberikan nilai terbaik kepada pembangun dan pelanggan yang menjalankan tugas pengeluaran dengan arus tinggi.

3.5 Flash-Lite menyokong penskalaan berkesan sistem Agent. Pada setiap peringkat pemikiran, model ini secara signifikan lebih unggul berbanding 3.1 Flash-Lite. Pembangun boleh mengkonfigurasi model mengikut beban kerja: gunakan peringkat pemikiran minimum dan rendah untuk tugas berskala besar, dengan memprioritaskan latensi rendah dan pelaksanaan berkos rendah; atau aktifkan peringkat pemikiran yang lebih tinggi untuk menangani beban kerja Agent sub-langkah ganda. Model ini kini juga menyediakan operasi komputer sebagai alat bawaan, menyokong tugas Agent merentas antaramuka dengan boleh dipercayai.

Ia menunjukkan peningkatan ketara dalam pengkodean dan tugas Agen, seperti skor Terminal-Bench 2.1 sebanyak 54% (3.1 Flash-Lite ialah 31%), konteks panjang seperti GDM-MRCR v2 mendapat skor 72.2% (3.1 Flash-Lite ialah 60.1%), dan pelaksanaan tugas sebenar seperti GDPval-AA v2 mendapat skor 1140 (3.1 Flash-Lite ialah 642).

Sebenarnya, dalam banyak penilaian agen dan pengkodean, 3.5 Flash-Lite melebihi 3 Flash, termasuk SWE-Bench Pro (54.2% vs 49.6%) dan OSWorld-Verified (74.0% vs 65.1%), menjadikannya pilihan yang lebih pantas dan lebih kuat untuk beban kerja 2.5 dan 3 Flash.

Pelanggan awal menekankan kombinasi unik kelajuan, kecerdasan, dan kecekapan kos 3.5 Flash-Lite dalam mengembangkan alur kerja Agen dan tugas pemprosesan data.

Gemini 3.5 Flash Cyber di CodeMender: Menemukan dan memperbaiki lubang keamanan dengan cekap

Model AI menemui lubang keamanan lebih pantas daripada sistem semasa memperbaikinya. Mengatasi ancaman yang semakin serius ini memerlukan pendekatan keselamatan perisian yang cekap dan kuat.

Kekuatan dan kecekapan Flash menjadikannya asas ideal untuk pengesanan, pengesahan, dan pembaikan masalah keselamatan kod dalam skala besar. Gemini 3.5 Flash Cyber dibina berdasarkan 3.5 Flash, telah dituning khusus untuk mengesan dan membaiki lubang keamanan siber, dengan harga setiap token lebih rendah berbanding model besar.

Dalam CodeMender, beberapa 3.5 Flash Cyber Agent bekerjasama untuk menghasilkan satu laporan komprehensif, mencapai tahap kompetitif terkini di benchmark popular CyberGym.

Mengingat sifat penggunaan ganda teknologi ini, kami mengambil pendekatan penyebaran yang berhati-hati. Model ini akan segera disediakan secara eksklusif kepada pemerintah dan rakan kongsi tepercaya melalui CodeMender dalam bentuk projek uji coba dengan akses terhadap. Ini akan membolehkan para pertahanan di garis depan mengesan dan membaiki kelemahan kritikal sebelum ia dimanfaatkan, sambil mengurangkan risiko penyalahgunaan yang lebih luas.

Mulakan sekarang

3.6 Flash dan 3.5 Flash-Lite kini tersedia mulai hari ini:

Pembangun boleh menggunakan melalui Google AI Studio dan Gemini API di Android Studio. 3.6 Flash juga boleh digunakan di Google Antigravity

Perusahaan boleh menggunakan Gemini Enterprise Agent. 3.6 Flash juga boleh digunakan dalam aplikasi Gemini Enterprise.

Semua orang boleh menggunakannya melalui aplikasi Gemini. 3.5 Flash-Lite juga sedang dilancarkan di Google Search.

Sila berikan maklum balas untuk memperbaiki model Gemini masa depan, kami menantikan pelancaran 3.5 Pro segera.

Penafian: Maklumat yang terdapat pada halaman ini mungkin telah diperoleh daripada pihak ketiga dan tidak semestinya menggambarkan pandangan atau pendapat KuCoin. Kandungan ini adalah disediakan bagi tujuan maklumat umum sahaja, tanpa sebarang perwakilan atau waranti dalam apa jua bentuk, dan juga tidak boleh ditafsirkan sebagai nasihat kewangan atau pelaburan. KuCoin tidak akan bertanggungjawab untuk sebarang kesilapan atau pengabaian, atau untuk sebarang akibat yang terhasil daripada penggunaan maklumat ini. Pelaburan dalam aset digital boleh membawa risiko. Sila menilai risiko produk dan toleransi risiko anda dengan teliti berdasarkan keadaan kewangan anda sendiri. Untuk maklumat lanjut, sila rujuk kepada Terma Penggunaan dan Pendedahan Risiko kami.