Claude 5.1 baru sahaja dilancarkan, sementara itu OpenAI Astra segera tiba.
Sekarang, Google pun telah mengambil tindakan baru. Bocoran terkini menyatakan bahawa Gemini 3.8 Flash akan dilancarkan esok.


Tampaknya dunia AI akan "merayakan Tahun Baru" lagi.
Gemini 3.5 Pro dibatalkan, versi besar seterusnya 4.0
Berbanding dengan pelancaran Gemini 3.8 Flash, ramai lagi penasaran: Kapan Gemini 3.5 Pro akan tiba?!
Maaf, jangan tunggu lagi, Google telah meninggalkan...

Sejak pengumuman konferensi I/O pada Mei tahun ini, telah berlalu hampir 4 bulan, dan perkembangan Gemini 3.5 Pro tidak seberapa dibandingkan Flash.
Google juga terpaksa, secara langsung "mengorbankan bidak".
Untunglah, Gemini 4.0 menunjukkan penilaian yang cemerlang dalam pra-pelatihan, dan pelatihan selepasnya masih berjalan lancar.


Pendedaan eksklusif dari WSJ ini juga secara mengejutkan meramalkan kekuatan pemrograman Gemini 3.8 Flash (kodename "Skimaki").
Dikatakan bahawa dalam ujian perbandingan alat pengkodean dalaman Google, Jetski, 3.8 Flash secara langsung mengalahkan model Opus.
Selain itu, model ini telah dikembangkan selama beberapa bulan, bermula sebelum kegoyahan besar di peringkat kepimpinan Google.
Hassabis meletakkan jawatan, Jeff Dean, saintis utama, mengundurkan diri, menyebabkan ramai meragui masa depan Gemini.

Namun, sejauh ini, semuanya berjalan dengan lancar di dalam.
Sekarang, Google merancang untuk melancarkan Gemini 3.8 Flash terlebih dahulu kerana model ini mempunyai parameter yang kecil, memerlukan pengiraan yang kurang, dan lebih mudah untuk menghasilkan hasil.
Menurut sumber dalaman, sejak awal tahun ini, Google telah melaburkan lebih banyak tenaga dan kuasa pengiraan secara khusus untuk meningkatkan kemampuan Gemini dalam menulis kod.
Khususnya, peningkatan pelaburan dalam "pembelajaran penguatan" membolehkan AI belajar kemahiran baru melalui percubaan dan kesilapan yang berterusan.
Selain itu, Google DeepMind dan makmal lain sedang memajukan beberapa projek secara serentak, jadi sekiranya satu projek gagal, projek lain masih boleh menggantikannya.
Gemini 3.5 Pro tidak mencapai jangkaan, tetapi Gemini 4.0 belum dilancarkan.
Sekarang, "dua raksasa" Silicon Valley, OpenAI dan Anthropic, telah menunjukkan kekuatan besar dalam model canggih dan agen pemrograman.
Maklumat menyatakan bahawa Astra generasi seterusnya OpenAI juga menggunakan kaedah inferensi baru bernama «kedalaman berulang», yang mengurangkan token pemikiran sambil meningkatkan prestasi secara besar-besaran.
The trump card will be revealed this week.

Sementara itu, Google perlu menunjukkan sesuatu.
Setelah janji untuk memecah kayu, selama beberapa bulan berikutnya, selain melancarkan 3.7 Flash, tiada model lain yang dikeluarkan yang mampu membuat komuniti AI bersemangat.
Mungkin malam ini, Gemini 3.8 Flash akan tampil.

Gemini pertama kali, boleh menonton video sendiri
Sebelum pengumuman ini, Google terlebih dahulu memperkenalkan promosi hari ini, menanamkan kemampuan baru ke dalam Gemini—
Pemahaman Video Agensik
Fungsi ini benar-benar mendapat skor tinggi.
Muat naik video I/O Conference, model yang sama Gemini 3.7 Flash, penggunaan token turun secara langsung sebanyak 88%.

Google dalam blog rasminya menyatakan bahawa tiga model Gemini 3.7 Flash, 3.6 Flash, dan 3.5 Flash-Lite boleh menggunakan kemampuan pemahaman video agen, yang boleh diakses melalui Google AI Studio dan Gemini Enterprise Agent Platform.
Buka suis ini pada piawai analisis video standard, penggunaan token boleh turun sehingga 88%, kos analisis boleh turun sehingga 66%, dan ketepatan pula meningkat sehingga 7%.

Dan tiada caj tambahan, harga token masih mengikuti harga API piawai. Menjimatkan wang dan meningkatkan ketepatan biasanya bertembung. Tapi kali ini tidak berlaku.

Kerana Gemini telah belajar "menyeret slaid masa".
Pendekatan sebelumnya dikenali sebagai pemprosesan "statik", di mana model menerima aliran gambar dengan kadar bingkai tetap secara pasif, di mana kadar bingkai ditetapkan oleh parameter API, dan model tidak mempunyai suara.
Sekarang, model boleh membuat keputusan sendiri tentang bahagian mana yang ingin dilihat, seberapa pantas ia ingin melihat, sama ada melihat gambar, mendengar audio, atau membaca teks transkripsi secara langsung.

Ini bukan pertama kalinya Google melakukan ini.
Visi agentic sebelumnya menggabungkan pelaksanaan kod dengan pemahaman imej asli Gemini, membolehkan model menulis kod sendiri untuk memperbesar, memotong, dan membandingkan imej.
Kali ini giliran video, idea yang sama, hanya alatnya ditukar kepada alat video asli.
Empat tugas yang sebelumnya sukar dilakukan
Blog rasmi juga menyenaraikan beberapa senario penggunaan yang sukar.
Pencarian segmen sub-detik. Sebelum ini, model 'melihat' video dengan mengambil satu gambar setiap saat. Masalahnya, banyak perkara berlaku dalam kurang daripada satu saat.
Sekarang kita boleh menentukan momen-momen ini dengan tepat kurang dari satu saat.
Ini bermakna bahawa "pengeditan automatik" kini menjadi mungkin untuk pertama kalinya: sebelum ini, editor perlu memeriksa garis masa secara manual, frame demi frame, untuk menentukan di mana harus membuat pemotongan; kini, model boleh memindai terlebih dahulu dan menandakan titik-titik potongan yang dicadangkan, sebelum manusia memilih.

Mencari jarum dalam jerami panjang. Tanya soalan kompleks dalam bahan beberapa jam, tanpa perlu membakar jutaan token.
Pengesanan anomali. Selepas model memantau jendela masa tertentu, ia boleh meningkatkan kadar bingkai secara khusus untuk mengambil semula sampel pada bahagian itu, untuk melihat pergerakan pantas dan kecacatan halus dalam gambar. Ini sangat berguna dalam pemeriksaan kualiti lini pengeluaran dan pengawasan keselamatan, kerana anomali biasanya hanya berlaku dalam beberapa saat itu sahaja.
Hitung. Model sebelum ini selalu salah menjawab soal seperti berapa kali tindakan diulang, atau berapa banyak objek berbeza dalam adegan, kerana sebab yang sangat mudah—frame yang terlepas mengandungi objek tersebut.

Agen akhirnya memperhatikan video itu
Video, selalu yang paling mahal di antara semua modality.
Teks murah, gambar baik-baik saja, video pula besar dan panjang, satu minit sudah boleh menggantikan token buku satu buah.
Jadi, dalam dua tahun ini, semua orang berbincang tentang Agent, lebih banyak membincangkan kemampuannya untuk membaca, menulis, dan memanggil alat.
Masalahnya, seorang agen yang bergantung terutama pada pemahaman teks untuk memahami dunia sebenarnya hanya melihat dunia yang telah 「diterjemahkan」 oleh orang lain.
Ia tidak tahu apa-apa tentang perkara yang ditangkap oleh kamera, direkodkan dalam mesyuarat, atau berlalu di lini pengeluaran, yang tiada siapa bersedia meluangkan masa untuk ditukar menjadi teks.
Sekarang, lengkung kos ini telah dipotong separuh.
Seorang agen yang mampu menerjemahkan sendiri beberapa jam pemantauan, puluhan jam kursus, dan ratusan bahan tanpa membakar anggaran akan mengubah cara ia berinteraksi dengan dunia.
Ia tidak perlu lagi menunggu seseorang menggambarkan gambar menjadi teks untuknya, dan tidak perlu lagi memilih antara "boleh lihat" dan "lihat tepat".
Google, yang terlebih dahulu menjadi perintis ini.
Pertarungan AI, giliran seterusnya
Dalam beberapa hari ini, jadual pelancaran keempat-empatnya hampir bertindih.
Claude 5.1 baru tiba, OpenAI Astra sudah berada di pintu, dan Google yang telah menahan selama beberapa bulan akhirnya mengeluarkan Gemini 3.8 Flash untuk bertarung.
Selepas kemas kini ini, Claude kini berfokus pada dua bidang utama: pengaturcaraan + penyelidikan.
Astra generasi seterusnya akan menjadi sebuah "agen berterusan", mengikut perkataan Ultraman, keupayaan komputernya telah mencapai tahap manusia.

Gemini 3.8 Flash juga akan mengalami lompatan besar dalam bidang pemrograman.
Sekarang, OpenAI, Anthropic, Google, dan SpaceXAI semuanya telah beroperasi sepenuhnya.

Musk mengumumkan Grok 4.7 akan dilancarkan dalam sepuluh hari
Pertempuran ini baru saja memasuki bahagian paling sengit.
Rujukan:
https://x.com/Google/status/2094840983913402704
https://deepmind.google/blog/introducing-agentic-video-in-gemini/
Artikel ini berasal daripada公众号 WeChat "Sinzhiyuan", penulis: Wahyu ASI
