ChainThink, 14 April — Menurut pemantauan 1M AI News, Google DeepMind meluncurkan Gemini Robotics-ER 1.6, yang ditujukan sebagai model penalaran tingkat tinggi untuk robot. Model ini menunjukkan peningkatan signifikan dalam penalaran spasial dan pemahaman multi-perspektif dibandingkan pendahulunya, ER 1.5 dan Gemini 3.0 Flash, dan kini telah tersedia bagi pengembang melalui Gemini API dan Google AI Studio.
Peningkatan inti mencakup tiga kemampuan: pertama, peningkatan akurasi penunjukan, yang memungkinkan deteksi objek yang tepat, penghitungan, penalaran hubungan spasial, dan perencanaan lintasan gerak, serta mampu menolak penunjukan objek yang tidak ada dalam gambar; kedua, deteksi berhasil dari berbagai sudut pandang, yang mampu menggabungkan gambar dari beberapa kamera untuk menilai status penyelesaian tugas, tetap akurat meskipun dalam kondisi terhalang atau dinamis; ketiga, penambahan kemampuan membaca instrumen, yang mampu membaca instrumen industri seperti meter tekanan melingkar, indikator tingkat cairan vertikal, dan layar digital, melalui agentic vision untuk melakukan penalaran bertahap.
Kemampuan pembacaan dashboard ini berasal dari kolaborasi DeepMind dengan Boston Dynamics. Pada hari yang sama, Boston Dynamics mengumumkan telah mengintegrasikan Gemini dan Gemini Robotics-ER 1.6 ke dalam produk Orbit AIVI-Learning, yang diluncurkan untuk semua pelanggan AIVI-Learning pada 8 April. Setelah integrasi, dashboard baru didukung, memungkinkan robot berkaki empat Spot untuk melakukan inspeksi mandiri di fasilitas industri dan membaca data dari alat ukur seperti pressure gauge.
Boston Dynamics menyatakan bahwa dengan memanfaatkan kemampuan penalaran Gemini, AIVI-Learning meningkatkan kinerja dasar dan akurasi pada tugas-tugas seperti inspeksi visual, penghitungan palet, dan deteksi cairan terakumulasi. DeepMind menyatakan bahwa ER 1.6 adalah "model robot paling aman" mereka, dengan tingkat kepatuhan terhadap perintah keamanan yang lebih unggul dibanding ER 1.5 dalam tugas penalaran spasial adversarial; dalam pengujian identifikasi risiko keamanan berdasarkan laporan cedera nyata, model seri ER unggul 6% dalam skenario teks dan 10% dalam skenario video dibanding Gemini 3.0 Flash.
