Google akan meluncurkan Gemini 3.8 Flash besok, fokus pada pemrograman dan pemahaman video

icon MarsBit
Bagikan
AI summary iconRingkasan
Google akan meluncurkan Gemini 3.8 Flash besok, sebuah acara berita peluncuran token besar di bidang AI. Model ini, dengan kode nama 'Skimaki', meningkatkan pemahaman pemrograman dan video sekaligus mengurangi penggunaan token hingga 88%. Gemini 3.5 Pro telah dibatalkan, dengan pengembangan dialihkan ke Gemini 4.0. Berita on-chain menunjukkan bahwa Google juga memperkenalkan pemahaman video agen untuk analisis konten dinamis.

Claude 5.1 baru saja diluncurkan, di sisi lain OpenAI Astra segera menyusul.

Sekarang, Google pun memiliki langkah baru. Bocoran terbaru mengungkapkan bahwa Gemini 3.8 Flash akan tampil besok.

Google

Google

Tampaknya, dunia AI akan lagi "merayakan Tahun Baru".

Gemini 3.5 Pro dihapus, versi besar berikutnya adalah 4.0

Daripada peluncuran Gemini 3.8 Flash, banyak orang lebih penasaran: Kapan Gemini 3.5 Pro akan tiba?!

Maaf, jangan tunggu lagi, Google telah meninggalkan......

Google

Sejak pengumuman konferensi I/O bulan Mei tahun ini, telah berlalu hampir 4 bulan, dan evolusi Gemini 3.5 Pro bahkan tidak sebanding dengan Flash.

Google juga terpaksa, langsung "mengorbankan".

Untungnya, Gemini 4.0 menunjukkan performa unggul dalam evaluasi pra-pelatihan, dan pelatihan lanjutan sedang berjalan lancar.

Google

Google

Laporan eksklusif dari WSJ ini juga secara signifikan memperkenalkan kemampuan pemrograman kuat Gemini 3.8 Flash (kode nama "Skimaki").

Diklaim bahwa dalam pengujian perbandingan alat pemrograman internal Google, Jetski, 3.8 Flash langsung mengungguli model Opus.

Selain itu, model ini telah dikembangkan selama beberapa bulan, bahkan sebelum gempa besar di jajaran pimpinan Google.

Hassabis mengundurkan diri, ilmuwan utama Jeff Dean meninggalkan posisinya, membuat banyak orang khawatir tentang masa depan Gemini.

Google

Namun, tampaknya saat ini semuanya berjalan lancar di dalam.

Saat ini, Google berencana meluncurkan Gemini 3.8 Flash terlebih dahulu karena model ini memiliki parameter kecil, membutuhkan komputasi lebih sedikit, dan lebih mudah menghasilkan hasil.

Menurut informasi dari dalam, sejak awal tahun ini, Google telah meningkatkan lebih banyak sumber daya manusia dan daya komputasi secara khusus untuk meningkatkan kemampuan Gemini dalam menulis kode.

Secara khusus, meningkatkan investasi pada "pembelajaran penguatan," sehingga AI dapat benar-benar mempelajari keterampilan baru melalui percobaan dan kesalahan berulang.

Dan Google DeepMind serta laboratorium lainnya secara bersamaan mengembangkan beberapa proyek, sehingga jika satu proyek gagal, proyek lainnya masih bisa menggantikan.

Gemini 3.5 Pro tidak sesuai harapan, tetapi Gemini 4.0 belum dirilis.

Saat ini, dua perusahaan unggulan Silicon Valley, OpenAI dan Anthropic, telah sangat unggul dalam model mutakhir dan Agent pemrograman.

Informasi menyebutkan bahwa Astra generasi berikutnya dari OpenAI juga menggunakan metode inferensi baru bernama "recurrent depth", yang mengurangi jumlah token pemikiran sekaligus secara signifikan meningkatkan kinerja.

Kartu truf ini akan diumumkan minggu ini.

Google

Sementara itu, Google harus menyerahkan sesuatu.

Setelah janji劈柴, selama beberapa bulan berikutnya, selain merilis satu model 3.7 Flash, tidak ada lagi model yang membuat komunitas AI bersemangat.

Mungkin malam ini, Gemini 3.8 Flash akan tampil.

Google

Gemini pertama kali, bisa menonton video sendiri

Sebelum rilis ini, Google hari ini memulai promosi awal dengan menambahkan kemampuan baru ke Gemini—

Pemahaman Video Agensik

Fitur ini benar-benar mendapatkan nilai tinggi.

Unggah video I/O Conference, model yang sama, Gemini 3.7 Flash, konsumsi token langsung turun 88%.

Google

Google menyatakan di blog resminya bahwa tiga model, Gemini 3.7 Flash, 3.6 Flash, dan 3.5 Flash-Lite, kini dapat menggunakan kemampuan pemahaman video agen, yang dapat diakses melalui Google AI Studio dan Gemini Enterprise Agent Platform.

Aktifkan tombol ini pada benchmark analisis video standar, konsumsi token bisa turun hingga 88%, biaya analisis bisa turun hingga 66%, dan akurasi justru meningkat hingga 7%.

Google

Dan tidak ada biaya tambahan, tetap menggunakan penetapan harga token API standar. Menghemat uang dan meningkatkan akurasi biasanya saling bertentangan. Kali ini tidak ada pertengkaran.

Google

Karena Gemini belajar "menggeser slider waktu".

Pendekatan sebelumnya disebut pemrosesan "statis", di mana model menerima aliran gambar dengan frame rate tetap secara pasif, dengan frame rate yang ditetapkan oleh parameter API, sehingga model tidak memiliki suara.

Sekarang model dapat memutuskan sendiri, bagian mana yang dilihat, seberapa cepat melihatnya, apakah melihat gambar, mendengarkan audio, atau langsung membaca transkrip teks.

Google

Ini bukan pertama kalinya Google melakukan hal ini.

Visi agentic sebelumnya menggabungkan eksekusi kode dengan pemahaman gambar asli Gemini, sehingga model dapat menulis kode sendiri untuk memperbesar, memotong, dan membandingkan gambar.

Kali ini giliran video, ide yang sama, hanya saja alatnya diganti dengan alat video asli.

Empat pekerjaan yang sebelumnya sulit dilakukan

Blog resmi juga mencantumkan beberapa skenario aplikasi dengan tingkat kesulitan tinggi.

Pencarian fragmen sub-detik. Sebelumnya, model "melihat" video dan hanya mengambil satu gambar per detik. Masalahnya, banyak hal berlalu dalam waktu kurang dari satu detik.

Sekarang kita bisa menemukan momen-momen ini dengan presisi kurang dari satu detik.

Ini berarti bahwa "pengeditan otomatis" pertama kalinya benar-benar menjadi mungkin: sebelumnya, editor harus memeriksa garis waktu secara manual, frame demi frame, untuk menentukan di mana harus memotong; sekarang, model dapat memindai terlebih dahulu dan menandai titik-titik potong kandidat, lalu manusia memilihnya.

Google

Mencari jarum di tumpukan jerami panjang. Tanyakan pertanyaan kompleks dalam bahan berjam-jam tanpa harus membakar jutaan token.

Deteksi anomali. Setelah model memfokuskan pada jendela waktu tertentu, ia dapat secara khusus meningkatkan frame rate dan melakukan pengambilan sampel ulang pada periode tersebut untuk melihat gerakan cepat dan cacat gambar halus. Ini sangat berguna untuk pemeriksaan kualitas lini produksi dan pemantauan keamanan, karena anomali biasanya hanya terjadi dalam beberapa detik tersebut.

Hitung. Pertanyaan seperti berapa kali suatu tindakan diulang, atau berapa banyak objek berbeda dalam adegan, dulu sering salah secara konsisten, dan alasannya sangat sederhana: beberapa frame yang terlewatkan tepat berisi objek tersebut.

Google

Agen akhirnya memperhatikan video tersebut

Video, selalu yang paling mahal di antara semua modality.

Teks murah, gambar cukup baik, video ukurannya besar dan panjang, satu menit bisa menghabiskan token sebanyak buku.

Jadi selama dua tahun terakhir, semua orang membahas Agent, lebih banyak membahas kemampuannya untuk membaca, menulis, dan memanggil alat.

Masalahnya, seorang agen yang sangat bergantung pada pemahaman teks untuk memahami dunia sebenarnya hanya melihat dunia yang telah "diterjemahkan" oleh orang lain.

Kamera yang merekam, rapat yang direkam, atau yang lewat di jalur produksi—hal-hal yang tidak ada yang mau bersusah payah mengubahnya menjadi teks—tidak diketahuinya sama sekali.

Sekarang, kurva biaya ini dipotong jauh lebih rendah.

Sebuah agen yang mampu menerjemahkan sendiri beberapa jam pemantauan, puluhan jam kursus, dan ratusan bahan, tanpa menghabiskan anggaran, maka cara ia berinteraksi dengan dunia akan berubah.

Ia tidak perlu lagi menunggu seseorang menggambarkan gambar menjadi teks untuknya, dan tidak perlu lagi memilih antara “bisa melihat” dan “bisa melihat dengan akurat”.

Google, yang pertama kali menjadi pelopor ini.

Pertarungan AI, ronde berikutnya

Dalam beberapa hari ini, jadwal rilis keempatnya hampir bertabrakan.

Claude 5.1 baru datang, OpenAI Astra sudah di pintu, dan Google yang telah menahan selama beberapa bulan akhirnya mengeluarkan Gemini 3.8 Flash untuk bersaing.

Setelah pembaruan ini, Claude kini berfokus pada dua bidang utama: pemrograman + penelitian ilmiah.

Astra generasi berikutnya akan menjadi sebuah "agen berkelanjutan", dengan kemampuan komputasi setara manusia, menurut kata-kata Ultraman.

Google

Gemini 3.8 Flash juga akan mengalami lompatan besar dalam hal pemrograman.

Sekarang, OpenAI, Anthropic, Google, dan SpaceXAI telah secara bersamaan beroperasi penuh.

Google

Musk memprediksi Grok 4.7 akan dirilis dalam sepuluh hari

Pertarungan ini baru saja memasuki bagian paling sengit.

Referensi:

https://x.com/Google/status/2094840983913402704

https://deepmind.google/blog/introducing-agentic-video-in-gemini/

Artikel ini berasal dari akun WeChat "Sinzhiyuan", penulis: ASI Revelation

Penafian: Informasi pada halaman ini mungkin telah diperoleh dari pihak ketiga dan tidak mencerminkan pandangan atau opini KuCoin. Konten ini disediakan hanya untuk tujuan informasi umum, tanpa representasi atau jaminan apa pun, dan tidak dapat ditafsirkan sebagai saran keuangan atau investasi. KuCoin tidak bertanggung jawab terhadap segala kesalahan atau kelalaian, atau hasil apa pun yang keluar dari penggunaan informasi ini. Berinvestasi di aset digital dapat berisiko. Harap mengevaluasi risiko produk dan toleransi risiko Anda secara cermat berdasarkan situasi keuangan Anda sendiri. Untuk informasi lebih lanjut, silakan lihat Ketentuan Penggunaan dan Pengungkapan Risiko.