Google akan melancarkan Gemini 3.8 Flash esok, berfokus pada pengkodean dan pemahaman video

icon MarsBit
Kongsi
AI summary iconRingkasan
Google dijangka melancarkan Gemini 3.8 Flash esok, satu acara berita pelancaran token utama dalam bidang AI. Model ini, yang diberi kod 'Skimaki', meningkatkan pemahaman pengkodean dan video sambil mengurangkan penggunaan token sehingga 88%. Gemini 3.5 Pro telah dibatalkan, dengan pembangunan dialihkan ke Gemini 4.0. Berita on-chain menunjukkan Google juga memperkenalkan pemahaman video agen untuk analisis kandungan dinamik.

Claude 5.1 baru sahaja dilancarkan, sementara itu OpenAI Astra segera tiba.

Sekarang, Google pun telah mengambil tindakan baru. Bocoran terkini menyatakan bahawa Gemini 3.8 Flash akan dilancarkan esok.

Google

Google

Tampaknya dunia AI akan "merayakan Tahun Baru" lagi.

Gemini 3.5 Pro dibatalkan, versi besar seterusnya 4.0

Berbanding dengan pelancaran Gemini 3.8 Flash, ramai lagi penasaran: Kapan Gemini 3.5 Pro akan tiba?!

Maaf, jangan tunggu lagi, Google telah meninggalkan...

Google

Sejak pengumuman konferensi I/O pada Mei tahun ini, telah berlalu hampir 4 bulan, dan perkembangan Gemini 3.5 Pro tidak seberapa dibandingkan Flash.

Google juga terpaksa, secara langsung "mengorbankan bidak".

Untunglah, Gemini 4.0 menunjukkan penilaian yang cemerlang dalam pra-pelatihan, dan pelatihan selepasnya masih berjalan lancar.

Google

Google

Pendedaan eksklusif dari WSJ ini juga secara mengejutkan meramalkan kekuatan pemrograman Gemini 3.8 Flash (kodename "Skimaki").

Dikatakan bahawa dalam ujian perbandingan alat pengkodean dalaman Google, Jetski, 3.8 Flash secara langsung mengalahkan model Opus.

Selain itu, model ini telah dikembangkan selama beberapa bulan, bermula sebelum kegoyahan besar di peringkat kepimpinan Google.

Hassabis meletakkan jawatan, Jeff Dean, saintis utama, mengundurkan diri, menyebabkan ramai meragui masa depan Gemini.

Google

Namun, sejauh ini, semuanya berjalan dengan lancar di dalam.

Sekarang, Google merancang untuk melancarkan Gemini 3.8 Flash terlebih dahulu kerana model ini mempunyai parameter yang kecil, memerlukan pengiraan yang kurang, dan lebih mudah untuk menghasilkan hasil.

Menurut sumber dalaman, sejak awal tahun ini, Google telah melaburkan lebih banyak tenaga dan kuasa pengiraan secara khusus untuk meningkatkan kemampuan Gemini dalam menulis kod.

Khususnya, peningkatan pelaburan dalam "pembelajaran penguatan" membolehkan AI belajar kemahiran baru melalui percubaan dan kesilapan yang berterusan.

Selain itu, Google DeepMind dan makmal lain sedang memajukan beberapa projek secara serentak, jadi sekiranya satu projek gagal, projek lain masih boleh menggantikannya.

Gemini 3.5 Pro tidak mencapai jangkaan, tetapi Gemini 4.0 belum dilancarkan.

Sekarang, "dua raksasa" Silicon Valley, OpenAI dan Anthropic, telah menunjukkan kekuatan besar dalam model canggih dan agen pemrograman.

Maklumat menyatakan bahawa Astra generasi seterusnya OpenAI juga menggunakan kaedah inferensi baru bernama «kedalaman berulang», yang mengurangkan token pemikiran sambil meningkatkan prestasi secara besar-besaran.

The trump card will be revealed this week.

Google

Sementara itu, Google perlu menunjukkan sesuatu.

Setelah janji untuk memecah kayu, selama beberapa bulan berikutnya, selain melancarkan 3.7 Flash, tiada model lain yang dikeluarkan yang mampu membuat komuniti AI bersemangat.

Mungkin malam ini, Gemini 3.8 Flash akan tampil.

Google

Gemini pertama kali, boleh menonton video sendiri

Sebelum pengumuman ini, Google terlebih dahulu memperkenalkan promosi hari ini, menanamkan kemampuan baru ke dalam Gemini—

Pemahaman Video Agensik

Fungsi ini benar-benar mendapat skor tinggi.

Muat naik video I/O Conference, model yang sama Gemini 3.7 Flash, penggunaan token turun secara langsung sebanyak 88%.

Google

Google dalam blog rasminya menyatakan bahawa tiga model Gemini 3.7 Flash, 3.6 Flash, dan 3.5 Flash-Lite boleh menggunakan kemampuan pemahaman video agen, yang boleh diakses melalui Google AI Studio dan Gemini Enterprise Agent Platform.

Buka suis ini pada piawai analisis video standard, penggunaan token boleh turun sehingga 88%, kos analisis boleh turun sehingga 66%, dan ketepatan pula meningkat sehingga 7%.

Google

Dan tiada caj tambahan, harga token masih mengikuti harga API piawai. Menjimatkan wang dan meningkatkan ketepatan biasanya bertembung. Tapi kali ini tidak berlaku.

Google

Kerana Gemini telah belajar "menyeret slaid masa".

Pendekatan sebelumnya dikenali sebagai pemprosesan "statik", di mana model menerima aliran gambar dengan kadar bingkai tetap secara pasif, di mana kadar bingkai ditetapkan oleh parameter API, dan model tidak mempunyai suara.

Sekarang, model boleh membuat keputusan sendiri tentang bahagian mana yang ingin dilihat, seberapa pantas ia ingin melihat, sama ada melihat gambar, mendengar audio, atau membaca teks transkripsi secara langsung.

Google

Ini bukan pertama kalinya Google melakukan ini.

Visi agentic sebelumnya menggabungkan pelaksanaan kod dengan pemahaman imej asli Gemini, membolehkan model menulis kod sendiri untuk memperbesar, memotong, dan membandingkan imej.

Kali ini giliran video, idea yang sama, hanya alatnya ditukar kepada alat video asli.

Empat tugas yang sebelumnya sukar dilakukan

Blog rasmi juga menyenaraikan beberapa senario penggunaan yang sukar.

Pencarian segmen sub-detik. Sebelum ini, model 'melihat' video dengan mengambil satu gambar setiap saat. Masalahnya, banyak perkara berlaku dalam kurang daripada satu saat.

Sekarang kita boleh menentukan momen-momen ini dengan tepat kurang dari satu saat.

Ini bermakna bahawa "pengeditan automatik" kini menjadi mungkin untuk pertama kalinya: sebelum ini, editor perlu memeriksa garis masa secara manual, frame demi frame, untuk menentukan di mana harus membuat pemotongan; kini, model boleh memindai terlebih dahulu dan menandakan titik-titik potongan yang dicadangkan, sebelum manusia memilih.

Google

Mencari jarum dalam jerami panjang. Tanya soalan kompleks dalam bahan beberapa jam, tanpa perlu membakar jutaan token.

Pengesanan anomali. Selepas model memantau jendela masa tertentu, ia boleh meningkatkan kadar bingkai secara khusus untuk mengambil semula sampel pada bahagian itu, untuk melihat pergerakan pantas dan kecacatan halus dalam gambar. Ini sangat berguna dalam pemeriksaan kualiti lini pengeluaran dan pengawasan keselamatan, kerana anomali biasanya hanya berlaku dalam beberapa saat itu sahaja.

Hitung. Model sebelum ini selalu salah menjawab soal seperti berapa kali tindakan diulang, atau berapa banyak objek berbeza dalam adegan, kerana sebab yang sangat mudah—frame yang terlepas mengandungi objek tersebut.

Google

Agen akhirnya memperhatikan video itu

Video, selalu yang paling mahal di antara semua modality.

Teks murah, gambar baik-baik saja, video pula besar dan panjang, satu minit sudah boleh menggantikan token buku satu buah.

Jadi, dalam dua tahun ini, semua orang berbincang tentang Agent, lebih banyak membincangkan kemampuannya untuk membaca, menulis, dan memanggil alat.

Masalahnya, seorang agen yang bergantung terutama pada pemahaman teks untuk memahami dunia sebenarnya hanya melihat dunia yang telah 「diterjemahkan」 oleh orang lain.

Ia tidak tahu apa-apa tentang perkara yang ditangkap oleh kamera, direkodkan dalam mesyuarat, atau berlalu di lini pengeluaran, yang tiada siapa bersedia meluangkan masa untuk ditukar menjadi teks.

Sekarang, lengkung kos ini telah dipotong separuh.

Seorang agen yang mampu menerjemahkan sendiri beberapa jam pemantauan, puluhan jam kursus, dan ratusan bahan tanpa membakar anggaran akan mengubah cara ia berinteraksi dengan dunia.

Ia tidak perlu lagi menunggu seseorang menggambarkan gambar menjadi teks untuknya, dan tidak perlu lagi memilih antara "boleh lihat" dan "lihat tepat".

Google, yang terlebih dahulu menjadi perintis ini.

Pertarungan AI, giliran seterusnya

Dalam beberapa hari ini, jadual pelancaran keempat-empatnya hampir bertindih.

Claude 5.1 baru tiba, OpenAI Astra sudah berada di pintu, dan Google yang telah menahan selama beberapa bulan akhirnya mengeluarkan Gemini 3.8 Flash untuk bertarung.

Selepas kemas kini ini, Claude kini berfokus pada dua bidang utama: pengaturcaraan + penyelidikan.

Astra generasi seterusnya akan menjadi sebuah "agen berterusan", mengikut perkataan Ultraman, keupayaan komputernya telah mencapai tahap manusia.

Google

Gemini 3.8 Flash juga akan mengalami lompatan besar dalam bidang pemrograman.

Sekarang, OpenAI, Anthropic, Google, dan SpaceXAI semuanya telah beroperasi sepenuhnya.

Google

Musk mengumumkan Grok 4.7 akan dilancarkan dalam sepuluh hari

Pertempuran ini baru saja memasuki bahagian paling sengit.

Rujukan:

https://x.com/Google/status/2094840983913402704

https://deepmind.google/blog/introducing-agentic-video-in-gemini/

Artikel ini berasal daripada公众号 WeChat "Sinzhiyuan", penulis: Wahyu ASI

Penafian: Maklumat yang terdapat pada halaman ini mungkin telah diperoleh daripada pihak ketiga dan tidak semestinya menggambarkan pandangan atau pendapat KuCoin. Kandungan ini adalah disediakan bagi tujuan maklumat umum sahaja, tanpa sebarang perwakilan atau waranti dalam apa jua bentuk, dan juga tidak boleh ditafsirkan sebagai nasihat kewangan atau pelaburan. KuCoin tidak akan bertanggungjawab untuk sebarang kesilapan atau pengabaian, atau untuk sebarang akibat yang terhasil daripada penggunaan maklumat ini. Pelaburan dalam aset digital boleh membawa risiko. Sila menilai risiko produk dan toleransi risiko anda dengan teliti berdasarkan keadaan kewangan anda sendiri. Untuk maklumat lanjut, sila rujuk kepada Terma Penggunaan dan Pendedahan Risiko kami.