Binalik ng Google DeepMind ang Gemini Robotics ER 2, at isang uri itong pag-update na nagpapabago sa iyong pag-iisip kung ano talaga ang kayang gawin ng mga robot. Ang bagong modelong ito ay hindi lang nagpapatalas ng isang robot. Ito ay nagpapagana ng mga grupo ng iba’t ibang robot na magtrabaho nang magkakasama tulad ng may iisang utak.
Ang Spot ng Boston Dynamics at Apollo ng Apptronik, dalawang robot na hindi magkakatulad ang anyo at nagpapagawa ng iba’t ibang mga gawain, ay ngayon ay nakakapag-coordinate sa pamamagitan ng isang karaniwang semantic understanding na pinapagana ng AI ng Google.
Ano ang tunay na ginagawa ng Gemini Robotics ER 2
Ang pangunahing inobasyon dito ay ang tinatawag ng DeepMind na “temporal intelligence.” Sa Ingles: ang robot ay makakakita kung ano ang nangyayari sa pamamagitan ng tuloy-tuloy na video feed, maiintindihan kung saan ito nasa isang maraming hakbang na gawain, at magplano ng kanyang susunod na galaw ayon dito.
Ang mga numero ay nagpapakita ng interesanteng kuwento. Nakakamit ng modelo ang 57.4% na akurasye para sa pagklasipikasyon ng progreso at 91.3% para sa paghahanap ng momento, kasama ang mean error na lang ng 0.96 segundo. Ang pagklasipikasyon ng progreso, ang kakayahan na maunawaan kung gaano kalayo ang isang gawain, ay mayroon pa ring espasyo para umunlad. Ngunit ang paghahanap ng momento, ang pagtukoy nang eksakto kung kailan nangyari ang isang partikular na pangyayari sa isang video stream, ay nakakapanatili ng napakatumpak na akurasye sa ilalim ng isang segundo.
Ang integrasyon sa Google’s Gemini Live API ay nagdaragdag ng isa pang antas. Ito ay nagpapahintulot sa low-latency, bidirectional streaming sa pagitan ng AI model at ang robot, kaya maaaring mag-adjust ang sistema sa real time nang walang kakaibang pagtigil na nagpapahirap sa mga dating robotic controller.
Nagkaroon rin ng mas makabuluhang pagpapabuti sa kaligtasan. Ang mas mabuting pagsubok sa pagsumbong ng mga panuto at mas mabuting pagkilala sa proximidad ay nangangahulugan na mas maliit ang posibilidad na magdulot ng pinsala ang mga robot sa mga kasamang tao.
Ang mga pundasyon ay nagsimula noong 2025
Hindi nagmula sa kahit anong lugar ang ER 2. Ito ay nagtatayo sa isang pundasyon na sinimulan ng Google noong Marso 2025 kasama ang mga unang Gemini robotics models, sumunod ng isang update noong Setyembre ng parehong taon. Bawat iterasyon ay patuloy na nagpapalawak sa kaya ng mga robot gamit ang generative AI, mula sa pangunahing pagpapatupad ng mga gawain patungo sa uri ng agentic behavior na nagpapahintulot sa mga makina na gumawa ng mga desisyon sa konteksto sa pamamagitan ng pagkakataon.
Hindi rin nagtatrabaho ang Google sa isang vacuum. Ang desisyon na suportahan ang third-party hardware tulad ng mga robot na Boston Dynamics at Apptronik ay nagpapahiwatig na gusto ng Google na maging ang operating system layer para sa robotics, hindi lamang isang vendor ng hardware.
