Claude 5.1 baru saja diluncurkan, di sisi lain OpenAI Astra segera menyusul.
Sekarang, Google pun memiliki langkah baru. Bocoran terbaru mengungkapkan bahwa Gemini 3.8 Flash akan tampil besok.


Tampaknya, dunia AI akan lagi "merayakan Tahun Baru".
Gemini 3.5 Pro dihapus, versi besar berikutnya adalah 4.0
Daripada peluncuran Gemini 3.8 Flash, banyak orang lebih penasaran: Kapan Gemini 3.5 Pro akan tiba?!
Maaf, jangan tunggu lagi, Google telah meninggalkan......

Sejak pengumuman konferensi I/O bulan Mei tahun ini, telah berlalu hampir 4 bulan, dan evolusi Gemini 3.5 Pro bahkan tidak sebanding dengan Flash.
Google juga terpaksa, langsung "mengorbankan".
Untungnya, Gemini 4.0 menunjukkan performa unggul dalam evaluasi pra-pelatihan, dan pelatihan lanjutan sedang berjalan lancar.


Laporan eksklusif dari WSJ ini juga secara signifikan memperkenalkan kemampuan pemrograman kuat Gemini 3.8 Flash (kode nama "Skimaki").
Diklaim bahwa dalam pengujian perbandingan alat pemrograman internal Google, Jetski, 3.8 Flash langsung mengungguli model Opus.
Selain itu, model ini telah dikembangkan selama beberapa bulan, bahkan sebelum gempa besar di jajaran pimpinan Google.
Hassabis mengundurkan diri, ilmuwan utama Jeff Dean meninggalkan posisinya, membuat banyak orang khawatir tentang masa depan Gemini.

Namun, tampaknya saat ini semuanya berjalan lancar di dalam.
Saat ini, Google berencana meluncurkan Gemini 3.8 Flash terlebih dahulu karena model ini memiliki parameter kecil, membutuhkan komputasi lebih sedikit, dan lebih mudah menghasilkan hasil.
Menurut informasi dari dalam, sejak awal tahun ini, Google telah meningkatkan lebih banyak sumber daya manusia dan daya komputasi secara khusus untuk meningkatkan kemampuan Gemini dalam menulis kode.
Secara khusus, meningkatkan investasi pada "pembelajaran penguatan," sehingga AI dapat benar-benar mempelajari keterampilan baru melalui percobaan dan kesalahan berulang.
Dan Google DeepMind serta laboratorium lainnya secara bersamaan mengembangkan beberapa proyek, sehingga jika satu proyek gagal, proyek lainnya masih bisa menggantikan.
Gemini 3.5 Pro tidak sesuai harapan, tetapi Gemini 4.0 belum dirilis.
Saat ini, dua perusahaan unggulan Silicon Valley, OpenAI dan Anthropic, telah sangat unggul dalam model mutakhir dan Agent pemrograman.
Informasi menyebutkan bahwa Astra generasi berikutnya dari OpenAI juga menggunakan metode inferensi baru bernama "recurrent depth", yang mengurangi jumlah token pemikiran sekaligus secara signifikan meningkatkan kinerja.
Kartu truf ini akan diumumkan minggu ini.

Sementara itu, Google harus menyerahkan sesuatu.
Setelah janji劈柴, selama beberapa bulan berikutnya, selain merilis satu model 3.7 Flash, tidak ada lagi model yang membuat komunitas AI bersemangat.
Mungkin malam ini, Gemini 3.8 Flash akan tampil.

Gemini pertama kali, bisa menonton video sendiri
Sebelum rilis ini, Google hari ini memulai promosi awal dengan menambahkan kemampuan baru ke Gemini—
Pemahaman Video Agensik
Fitur ini benar-benar mendapatkan nilai tinggi.
Unggah video I/O Conference, model yang sama, Gemini 3.7 Flash, konsumsi token langsung turun 88%.

Google menyatakan di blog resminya bahwa tiga model, Gemini 3.7 Flash, 3.6 Flash, dan 3.5 Flash-Lite, kini dapat menggunakan kemampuan pemahaman video agen, yang dapat diakses melalui Google AI Studio dan Gemini Enterprise Agent Platform.
Aktifkan tombol ini pada benchmark analisis video standar, konsumsi token bisa turun hingga 88%, biaya analisis bisa turun hingga 66%, dan akurasi justru meningkat hingga 7%.

Dan tidak ada biaya tambahan, tetap menggunakan penetapan harga token API standar. Menghemat uang dan meningkatkan akurasi biasanya saling bertentangan. Kali ini tidak ada pertengkaran.

Karena Gemini belajar "menggeser slider waktu".
Pendekatan sebelumnya disebut pemrosesan "statis", di mana model menerima aliran gambar dengan frame rate tetap secara pasif, dengan frame rate yang ditetapkan oleh parameter API, sehingga model tidak memiliki suara.
Sekarang model dapat memutuskan sendiri, bagian mana yang dilihat, seberapa cepat melihatnya, apakah melihat gambar, mendengarkan audio, atau langsung membaca transkrip teks.

Ini bukan pertama kalinya Google melakukan hal ini.
Visi agentic sebelumnya menggabungkan eksekusi kode dengan pemahaman gambar asli Gemini, sehingga model dapat menulis kode sendiri untuk memperbesar, memotong, dan membandingkan gambar.
Kali ini giliran video, ide yang sama, hanya saja alatnya diganti dengan alat video asli.
Empat pekerjaan yang sebelumnya sulit dilakukan
Blog resmi juga mencantumkan beberapa skenario aplikasi dengan tingkat kesulitan tinggi.
Pencarian fragmen sub-detik. Sebelumnya, model "melihat" video dan hanya mengambil satu gambar per detik. Masalahnya, banyak hal berlalu dalam waktu kurang dari satu detik.
Sekarang kita bisa menemukan momen-momen ini dengan presisi kurang dari satu detik.
Ini berarti bahwa "pengeditan otomatis" pertama kalinya benar-benar menjadi mungkin: sebelumnya, editor harus memeriksa garis waktu secara manual, frame demi frame, untuk menentukan di mana harus memotong; sekarang, model dapat memindai terlebih dahulu dan menandai titik-titik potong kandidat, lalu manusia memilihnya.

Mencari jarum di tumpukan jerami panjang. Tanyakan pertanyaan kompleks dalam bahan berjam-jam tanpa harus membakar jutaan token.
Deteksi anomali. Setelah model memfokuskan pada jendela waktu tertentu, ia dapat secara khusus meningkatkan frame rate dan melakukan pengambilan sampel ulang pada periode tersebut untuk melihat gerakan cepat dan cacat gambar halus. Ini sangat berguna untuk pemeriksaan kualitas lini produksi dan pemantauan keamanan, karena anomali biasanya hanya terjadi dalam beberapa detik tersebut.
Hitung. Pertanyaan seperti berapa kali suatu tindakan diulang, atau berapa banyak objek berbeda dalam adegan, dulu sering salah secara konsisten, dan alasannya sangat sederhana: beberapa frame yang terlewatkan tepat berisi objek tersebut.

Agen akhirnya memperhatikan video tersebut
Video, selalu yang paling mahal di antara semua modality.
Teks murah, gambar cukup baik, video ukurannya besar dan panjang, satu menit bisa menghabiskan token sebanyak buku.
Jadi selama dua tahun terakhir, semua orang membahas Agent, lebih banyak membahas kemampuannya untuk membaca, menulis, dan memanggil alat.
Masalahnya, seorang agen yang sangat bergantung pada pemahaman teks untuk memahami dunia sebenarnya hanya melihat dunia yang telah "diterjemahkan" oleh orang lain.
Kamera yang merekam, rapat yang direkam, atau yang lewat di jalur produksi—hal-hal yang tidak ada yang mau bersusah payah mengubahnya menjadi teks—tidak diketahuinya sama sekali.
Sekarang, kurva biaya ini dipotong jauh lebih rendah.
Sebuah agen yang mampu menerjemahkan sendiri beberapa jam pemantauan, puluhan jam kursus, dan ratusan bahan, tanpa menghabiskan anggaran, maka cara ia berinteraksi dengan dunia akan berubah.
Ia tidak perlu lagi menunggu seseorang menggambarkan gambar menjadi teks untuknya, dan tidak perlu lagi memilih antara “bisa melihat” dan “bisa melihat dengan akurat”.
Google, yang pertama kali menjadi pelopor ini.
Pertarungan AI, ronde berikutnya
Dalam beberapa hari ini, jadwal rilis keempatnya hampir bertabrakan.
Claude 5.1 baru datang, OpenAI Astra sudah di pintu, dan Google yang telah menahan selama beberapa bulan akhirnya mengeluarkan Gemini 3.8 Flash untuk bersaing.
Setelah pembaruan ini, Claude kini berfokus pada dua bidang utama: pemrograman + penelitian ilmiah.
Astra generasi berikutnya akan menjadi sebuah "agen berkelanjutan", dengan kemampuan komputasi setara manusia, menurut kata-kata Ultraman.

Gemini 3.8 Flash juga akan mengalami lompatan besar dalam hal pemrograman.
Sekarang, OpenAI, Anthropic, Google, dan SpaceXAI telah secara bersamaan beroperasi penuh.

Musk memprediksi Grok 4.7 akan dirilis dalam sepuluh hari
Pertarungan ini baru saja memasuki bagian paling sengit.
Referensi:
https://x.com/Google/status/2094840983913402704
https://deepmind.google/blog/introducing-agentic-video-in-gemini/
Artikel ini berasal dari akun WeChat "Sinzhiyuan", penulis: ASI Revelation
