Google DeepMind baru sahaja melancarkan Gemini Robotics ER 2, dan ini adalah jenis kemas kini yang membuat anda memikir semula apa yang sebenarnya mampu dilakukan oleh robot. Model baharu ini tidak hanya menjadikan robot individu lebih pintar. Ia menjadikan kumpulan robot yang sama sekali berbeza bekerja bersama seolah-olah mereka berkongsi otak yang sama.
Spot dari Boston Dynamics dan Apollo dari Apptronik, dua robot yang kelihatan sangat berbeza dan melakukan perkara yang sangat berbeza, kini boleh berkoordinasi melalui pemahaman semantik bersama yang dikuasai oleh AI Google.
Apa yang sebenarnya dilakukan oleh Gemini Robotics ER 2
Inovasi utama di sini ialah apa yang DeepMind sebut sebagai “kecerdasan temporer.” Dalam bahasa Inggeris: robot boleh memantau apa yang berlaku melalui aliran video berterusan, memahami di mana ia berada dalam tugas berbilang langkah, dan merancang langkah seterusnya secara sewajarnya.
Nombor-nombor tersebut menceritakan kisah yang menarik. Model mencapai ketepatan 57.4% untuk pengelasan kemajuan dan 91.3% untuk penemuan momen, dengan ralat min hanya 0.96 saat. Pengelasan kemajuan, kemampuan untuk memahami sejauh mana suatu tugas telah dicapai, masih mempunyai ruang untuk berkembang. Tetapi penemuan momen, yang menentukan tepatnya bila suatu peristiwa tertentu berlaku dalam aliran video, sangat tepat dengan ketepatan di bawah satu saat.
Integrasi dengan API Gemini Live Google menambahkan lapisan tambahan. Ia membolehkan penghantaran dua hala berlatensi rendah antara model AI dan robot, yang bermaksud sistem boleh menyesuaikan secara masa nyata tanpa jeda tidak semula jadi yang menjadi masalah pada pengawal robot sebelumnya.
Keselamatan juga mengalami peningkatan yang bermakna. Piawaian mengikuti arahan yang diperbaiki dan pengesanan kedekatan yang lebih baik bermaksud robot-robot ini kurang cenderung menyebabkan kecederaan kepada rakan sekerja manusia.
Blok-blok pembinaan berpunca pada tahun 2025
ER 2 tidak muncul secara tiba-tiba. Ia dibina atas asas yang dimulakan Google pada Mac 2025 dengan model robotik Gemini pertama, diikuti oleh kemas kini pada September tahun yang sama. Setiap iterasi secara berterusan memperluaskan apa yang boleh dilakukan robot dengan AI generatif, bergerak dari pelaksanaan tugas asas kepada jenis tingkah laku agen yang membolehkan mesin membuat keputusan kontekstual secara serta-merta.
Google juga tidak beroperasi dalam ruang hampa. Keputusan untuk menyokong peranti pihak ketiga seperti robot Boston Dynamics dan Apptronik menunjukkan bahawa Google ingin menjadi lapisan sistem pengendalian untuk robotik, bukan sekadar penjual peranti keras.
