Gemini 3.8 Flash Google Menantang Model AI Teratas dengan Kos Rendah dan Prestasi Tinggi

icon MarsBit
Kongsi
AI summary iconRingkasan
Berita altcoin teratas muncul apabila Google melancarkan Gemini 3.8 Flash dan varian keselamatan siber, Gemini 3.8 Flash Cyber. Model ini mencapai $0.58 per juta token untuk tugas tunggal dan $0.75 untuk input, melebihi atau menyamai GPT-5.6 Sol dan Grok 4.6. Gemini 3.8 Flash Cyber mendapat skor 86.2% dalam ujian CyberGym dan mengesan kelemahan kritikal dalam dua jam. Fokus Google pada kelajuan, kos rendah, dan penaakulan berulang mengguncang dunia berita AI + kripto, mencabar model 'semakin besar semakin baik'.

Baru sahaja, Google kembali!

Malam ini, Google secara rasmi melancarkan Gemini 3.8 Flash, serta Gemini 3.8 Flash Cyber yang khusus ditujukan untuk keselamatan siber.

Ini adalah versi Flash ketiga yang dikeluarkan oleh Google dalam tempoh enam minggu.

Dua kemas kini sebelum ini kelihatan seperti pemanasan sahaja, kerana kali ini, Google secara langsung membawa nilai terbaik ke garis depan—

Kos tugas tunggal 0.58 dolar AS! Input hanya 0.75 dolar AS/ juta Token!

Model kecil yang harganya begitu murah ini berjaya mencapai tahap model unggul terkemuka dunia seperti Opus 5, GPT-5.6 Sol, dan Grok 4.6 dalam beberapa ujian piawai utama.

Ahli Google DeepMind, Yao Shunyu, menilai: Bagi model, ini hanyalah satu langkah kecil; tetapi bagi RSI, ini adalah lompatan besar.

Google

Di X, para pembangun telah bergolak.

Setelah diuji secara langsung, seseorang mempertanyakan: "Astaga, adakah Google menghantar barang yang salah? Ini bukankah Gemini 3.5 Pro yang selama ini belum dilancarkan? Dengan harga Flash, tapi melakukan tugas Pro!"

Google

Google

Dalam pasukan DeepMind, mungkin ada seseorang yang tidak tidur sejak Julai.

Sementara semua orang masih sedang mencerna Fable 5.1, Google sekali lagi telah membalikkan meja.

Google "raja penggulung" kembali: raja nilai terbaik

Google yang telah lama tenang, dengan cara yang sangat kompetitif, mengumumkan kepada dunia: Sang Raksasa Telah Kembali.

Google

Untuk memahami kesan yang dibawa oleh Gemini 3.8 Flash, kita perlu melihat gambaran pasaran AI semasa ini.

Sebelum ini, dalam ujian Artificial Analysis, telah terbentuk penghalang yang sangat ketat. Untuk memiliki kecerdasan tertinggi (Indeks Kecerdasan sekitar 60), anda perlu membayar kos Token yang tinggi.

Hasilnya, Gemini 3.8 Flash bagaikan seorang pembunuh bayaran, benar-benar tidak mengikuti peraturan.

Dalam mod penalaran tinggi Artificial Analysis, indeks kecerdasan Gemini 3.8 Flash meningkat kepada 59!

Google

Apakah konsep ini? Ia hanya selangkah lagi daripada GPT-5.6 Sol dan Grok 4.6 yang paling tinggi, bahkan melampaui Claude Opus 5 dalam beberapa dimensi!

Namun, berapakah harga untuk mencapai semua ini? Kos tugas tunggalnya hanya $0.58.

Secara khusus, kos input kekal pada $0.75 per juta Token, dan output pada $3.75 per juta Token.

Google membuat satu gambar: pada garis pareto kecerdasan dan kos, titik biru yang mewakili Gemini 3.8 Flash berada di sudut kanan atas piawai kejuruteraan perisian DeepSWE, meninggalkan pesaing kedua jauh di belakang.

Google

Gemini 3.8 Flash tidak hanya pintar, tetapi juga sangat pantas. Kelajuan penghasilannya mencapai 305 token/detik yang menakjubkan, sementara model seterusnya hanya mampu mencapai 154 token/detik.

Cepat, pintar, dan murah seperti tak ada harganya—inilah model yang benar-benar boleh digunakan manusia setiap hari.

Google

Terutama pada benchmark rekabentuk perisian jangka panjang (DeepSWE v1.1), 3.8 Flash mencatatkan pencapaian menakjubkan sebanyak 73.7%.

Dalam ujian yang memerlukan AI menyelesaikan masalah kejuruteraan kompleks secara autonomi dan menulis kod secara end-to-end, ia tidak hanya melampaui kebanyakan model besar canggih yang mahal, tetapi juga berkos hanya sebahagian kecil sahaja.

Perlu diketahui, ini hanyalah versi «Flash», bukan «Pro», apalagi «Ultra».

Kali ini, Google sekali lagi membiarkan model kecil merampas rezeki model unggulan.

Seseorang telah menguji sendiri Gemini 3.8 Flash dan Opus 5 untuk tugas yang sama.

Google

Peningkatan besar dalam kemampuan pemrograman ini bukanlah kebetulan.

Google

Peningkatan besar dalam kemampuan pemrograman ini bukanlah kebetulan.

Dilaporkan bahawa dalam ujian alat kod dalaman Google, Jetski, jurutera Google bahkan lebih menggemari 3.8 Flash berbanding model Opus dari Anthropic.

Google

Di sebaliknya, Google telah mengalokasikan sumber daya besar kepada pembelajaran penguatan sejak awal tahun—iaitu peringkat "penyempurnaan akhir" dalam latihan model, membolehkan model belajar benar-benar melakukan tugas melalui percubaan dan kesilapan.

Google DeepMind membentuk pasukan serangan kod yang berfokus pada peningkatan kemampuan model pemrograman, dengan ketua teknologi DeepMind memimpin pasukan ini dan penubuh bersama Sergey Brin mengawasi secara langsung.

Mereka bertujuan untuk memaksa evolusi diri berulang, mengubah model pemrograman secara paksa menjadi penyelidik AI automatik sepenuhnya, dan membuka sepenuhnya keseluruhan kitaran penyelidikan dan pembangunan.

Google

Dalam memo dalaman, Google secara langsung mengatakan:

Untuk memenangi sprints terakhir, kami perlu segera menutup jurang dalam pelaksanaan agen dan menjadikan model kami sebagai pembangun utama.

Google

Selain itu, Google juga merekrut Barret Zoph, salah seorang penubuh Thinking Machines Lab dan bekas ketua pasca-pelatihan di OpenAI, yang kini memegang jawatan Ketua Penyelidikan, mengendalikan arah kajian pembelajaran penguatan dan pasca-pelatihan. Tindakan ini jelas menunjukkan komitmen mereka untuk terus berjuang hingga akhir.

Bulan lalu, ko-pendiri dan penerima Hadiah Nobel, Demis Hassabis, meletakkan jawatan sebagai CEO, dan penggantinya, Koray Kavukcuoglu, segera menyatakan: percepat, percepat, lagi percepat.

Pengukuran dasar "pembengkakan", atau kekuatan yang luar biasa?

Namun, dalam pujiannya, Google secara umum dituduh minum sampanye terlalu awal, terlalu gembira.

Google

Yang paling tidak menyenangkan ialah Meta——

Muse Spark 1.3 milik Meta dan Gemini 3.8 Flash bertemu dalam pertandingan sengit, dengan Muse Spark 1.3 memperoleh skor 62 dalam indeks kecerdasan Artificial Analysis, sejajar dengan Claude Fable 5, dan masuk ke kalangan teratas.

Sementara itu, kos input Muse lebih rendah 8 kali ganda berbanding Fable 5, dan kos output lebih rendah hampir 12 kali ganda, menjadikan nilai terbaiknya maksimum.

Ketua AI Meta, Alexandr Wang, secara langsung menyindir: Di indeks pintar Artificial Analysis, Gemini tidak bererti apa-apa dan hanya mampu mengejar asap sisa model lain.

Google

Google

Muse Spark 1.3 mendapat skor lebih tinggi daripada GPT-5.6 Sol, Grok 4.6, dan Gemini 3.8 Flash, tetapi kini hanya tersedia dalam pra-pandangan terhad.

Ada yang menunjukkan bahawa walaupun graf ujian prestasi 3.8 Flash kelihatan menarik, ia mungkin tidak sebegitu baik dalam praktik.

Memang, Gemini 3.8 Flash melepasi GPT-5.6 Sol dan Opus 5 dalam ujian seperti Terminal-Bench 2.1 dan HLE, tetapi jurang skor yang besar antara TBench 2.1 dan TBench 4 menunjukkan kemungkinan adanya elemen "penipuan senarai" di sini.

Dengan kata lain, apabila menghadapi cabaran Zero-shot dunia nyata yang asing dan belum termasuk dalam set latihan, 3.8 Flash kemungkinan besar masih kalah berbanding raksasa parameter seperti Opus 5.

Namun, penyelesaian Google sangat bijak—kerajinan dapat menggantikan kekurangan bakat.

Seperti yang dinyatakan oleh Google dalam blog rasmi mereka: "Peningkatan prestasi ini berasal daripada pilihan reka bentuk utama: 3.8 Flash bekerja lebih keras."

Semasa menghadapi tugas yang kompleks, 3.8 Flash direka untuk menjalankan langkah penarikan tambahan dan berulang kali memanggil alat. Apabila menghadapi soalan yang tidak difahami, ia tidak akan menyerah terus, tetapi sebaliknya menghabiskan lebih banyak Token untuk menjalankan pengesahan dan refleksi diri yang pantas di dalam.

Walaupun ia menghabiskan lebih banyak token melalui berbilang putaran pemikiran, kerana harga asasnya sangat murah (0.75 dolar / juta token), secara keseluruhan, ia masih jauh lebih murah berbanding anda memanggil GPT-5.6 secara langsung!

Strategi ini secara langsung menghancurkan persaingan satu dimensi lama yang menyatakan "parameter besar = kemampuan kuat".

Ia membuktikan bahawa: dalam satu kitaran Agent yang sempurna, kelajuan dan kos inferens yang sangat rendah itu sendiri merupakan satu kecerdasan yang kuat.

Mengapa menghantar Flash? Versi Pro yang "dibatalkan"

Apakah Google kali ini benar-benar tidak mengirimkan barang yang salah?

Gemini 3.5 Pro sehingga kini belum kelihatan langsung. Gemini 4 generasi seterusnya, walaupun data pra-latihan nampak cantik, tetapi peringkat pasca-latihan masih belum selesai.

Google

Sebenarnya, kegagalan Google untuk mengeluarkan versi Pro disebabkan oleh sejarah yang penuh kesukaran.

Pi Chai pernah membuat janji pada Mei tahun ini bahawa siri Pro yang lebih kuat akan dilancarkan "bulan depan", tetapi terus menunda.

Sebenarnya, terdapat beberapa model calon 3.5 Pro di dalam Google, tetapi semuanya akhirnya ditiadakan—kerana ia tidak lebih unggul daripada rangkaian Flash semasa ini dengan jarak yang mencukupi!

Sementara itu, Gemini 4 generasi seterusnya yang ditunggu-tunggu, walaupun menunjukkan prestasi baik dalam penilaian pra-pelatihan, kini masih terhenti pada peringkat pasca-pelatihan yang paling kritikal.

Secara keseluruhan, semuanya berlaku secara kebetulan, menciptakan iterasi gila bagi siri Flash.

Lubang keamanan yang memakan berbulan-bulan untuk ditemukan, ditemukan dalam 2 jam: Telah mendominasi dunia keselamatan siber

Apakah Google kali ini hanya memaksa 3.8 Flash untuk bersaing harga dalam tugas biasa?

Jauh lebih daripada itu.

Senjata sebenar dalam pelancaran ini ialah saudara kembarannya—Gemini 3.8 Flash Cyber.

Pembangun pun terkejut: “Apakah tugas keselamatan yang sedemikian hebat sehingga Google mengeluarkan versi khas Cyber khusus untuk Flash?”

Jawapan Google ialah: untuk melawan hacker AI masa depan.

Di atas platform ujian CyberGym yang menemukan lubang keamanan, 3.8 Flash Cyber mencapai skor 86.2%, secara langsung memimpin papan pemeringkatan dan menjauhkan model besar sebelumnya.

Selain itu, kod dunia nyata tidak hanya terbatas pada C/C++.

Dalam ujian komprehensif terhadap kod basi yang kompleks yang meliputi 20 bahasa pengaturcaraan di dalam Google, model ini berjaya mengesan kelemahan yang luas dengan kadar lebih daripada 70%.

Yang lebih menakjubkan ialah rekod pertempuran sebenarnya di dunia nyata.

Pasukan keselamatan Chrome mengujinya dan mendapati bahawa jumlah pampasan betul yang dihasilkannya adalah 2.6 kali ganda lebih banyak berbanding model komersial terbaik sebelum ini yang jauh lebih besar.

Wiz Security menemukan bahawa kecekapan pengembalian dalam ujian penetrasi meningkat sebanyak 7.5-9.7%, sementara kos berkurang sebanyak 2.3 hingga 5.2 kali.

Yang paling mengejutkan ialah, pasukan penyelidik lubang keamanan Google Cloud menggunakannya dan berjaya menemui satu lubang keamanan penting dalam masa hanya 2 jam—sementara biasanya, pakar terkemuka manusia memerlukan berbulan-bulan untuk menemui lubang seperti ini!

Dalam CWE-Bench (uji keupayaan pembaikan), kadar lulus pertama 3.8 Flash Cyber mencapai 47.2%, hampir sejajar dengan model besar terkini terdepan (47.8%), tetapi harganya hanya sebahagian kecil sahaja.

Google

Just because the network attack and defense capabilities of 3.8 Flash Cyber are so astonishing, Google has chosen not to fully open-source it, but instead to make it available only to trusted institutions through the new Fairwind program.

OpenAI, Anthropic, dan Google: Perang tiga besar model memasuki titik balik

Melalui pelancaran Gemini 3.8 Flash, kelihatan bahawa tiga pemain utama AI hari ini telah mengikuti tiga lintasan evolusi yang berbeza.

Anthropic (siri Claude), fokus pada "kebolehpercayaan dan ketabahan pengetahuan".

Dalam ujian yang menekankan cakupan pengetahuan dan ketepatan fakta (seperti AA-Omniscience), Claude masih merupakan serangan yang sangat unggul.

Tujuh teratas semuanya adalah keluarga Claude, yang kini jelas memperkuat kemampuan mereka untuk tidak membuat kesalahan dalam tugas perusahaan, dengan tujuan menghasilkan output yang stabil.

OpenAI (siri GPT), menumpukan pada "penalaran mendalam dan keinsafan tiba-tiba".

Dalam ujian CritPt yang cenderung kepada penghuraian fizik dan matematik, GPT-5.6 Sol memimpin dengan jarak yang sangat besar.

OpenAI seolah-olah mengejar satu kemunculan kecerdasan tulen, meminta model untuk mampu 'memikirkan' jawapannya sendiri seperti seorang saintis tanpa diberitahu jawapannya.

Google (siri Gemini), menciptakan "pekerja berkelajuan tinggi tanpa henti".

Google kali ini memberikan jawapan ketiga: Mungkin saya tidak dapat memikirkan soal fizik paling sukar sekaligus, tetapi saya bertindak pantas dan kosnya sangat rendah.

Di era Agent, saya boleh berfikir 100 kali dalam satu saat, menulis kod, menjalankan, mendapat ralat, memperbaiki, dan memaksa mencapai hasil yang betul melalui pengulangan berkuasa dengan kos yang sangat rendah.

Agen menghadapi masalah dalam dunia nyata, yang memerlukan percubaan dan kesilapan berulang, pemanggilan alat, dan penyesuaian dinamik.

Sementara itu, Gemini 3.8 Flash secara khusus direka untuk alur kerja jangka panjang ini.

Anda boleh menggunakan Google Antigravity, hanya dengan satu petua ditambah arahan perulangan, untuk membolehkan 3.8 Flash menghasilkan permainan penuh yang mengandungi teka-teki, peta persekitaran, dan peringkat 3D.

Anda boleh menggunakannya untuk menghasilkan peta Google versi DOS dengan pemandangan jalan dan navigasi dengan sekali klik.

Jelas bahawa kemudahan penggunaan dan kos Gemini 3.8 Flash telah melangkau satu titik pelompatan.

Kedatangan Gemini 3.8 Flash seolah-olah Google mengumumkan kepada seluruh industri: model besar sedang meninggalkan persepsi "hanya raksasa yang mampu menggunakannya" dan berlari menuju keadilan komputasi.

Tugasan agen yang dahulu memerlukan beribu-ribu dolar AS dan berhari-hari untuk diselesaikan, kini boleh diselesaikan dalam beberapa minit dengan kos setara beberapa cawan kopi.

Zaman individu super untuk orang biasa telah tiba.

Ini adalah saat kebangunan model kecil.

Rujukan:

https://x.com/alexandr_wang/status/2095266112212754659?s=20

https://blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber/

Disunting oleh Aeneas David

Artikel ini berasal daripada akaun微信公众号 "XinZhiYuan", penulis: Revelation of ASI

Penafian: Maklumat yang terdapat pada halaman ini mungkin telah diperoleh daripada pihak ketiga dan tidak semestinya menggambarkan pandangan atau pendapat KuCoin. Kandungan ini adalah disediakan bagi tujuan maklumat umum sahaja, tanpa sebarang perwakilan atau waranti dalam apa jua bentuk, dan juga tidak boleh ditafsirkan sebagai nasihat kewangan atau pelaburan. KuCoin tidak akan bertanggungjawab untuk sebarang kesilapan atau pengabaian, atau untuk sebarang akibat yang terhasil daripada penggunaan maklumat ini. Pelaburan dalam aset digital boleh membawa risiko. Sila menilai risiko produk dan toleransi risiko anda dengan teliti berdasarkan keadaan kewangan anda sendiri. Untuk maklumat lanjut, sila rujuk kepada Terma Penggunaan dan Pendedahan Risiko kami.