[Ang Axis ay nagpapakita ng 100 oras ng Egocentric Data, paano i-organize ang tao’s gawain bilang data para sa pagkatuto ng robot] @KaitoAI X @axisrobotics Link sa pagkakaaliw sa Axis (referral): https://t.co/hUbWSVsBVR Hindi kalkulahin ng tao ang anggulo ng mga daliri o trahektorya ng wrist kapag hinahawakan ang baso. Kakalawin lamang nito nang natural ang baso sa harap at ilalagay sa ibang lugar. Nagkakaiba ang kuwento kapag tinuturuan ang robot na gawin ang parehong bagay. Kailangan i-separate ang galaw: kung kailan dumidikit ang kamay sa bagay, kung kailan talaga ito hinawakan, ang landas na dinala pagkatapos ay itinataas, at kung kailan ibinaba naman ito. Ang isang tuloy-tuloy na galaw sa mata ng tao ay kailangang i-decompose sa data para sa pagkatuto ng robot. Ang axis-ego-samples na isinagawa ni Axis noong unang bahagi ng Setyembre ay nagpapakita ng proseso na ito sa pamamagitan ng mga aktwal na file. Ang kasalukuyang ipinapakilala na egocentric video ay 100 oras. Ito ay first-person footage mula sa paningin ng manggagawa, na nakakategorya sa mga tunay na work environment tulad ng edukasyon, akomodasyon, retail, warehouse, handicraft, catering, office, production, at logistics. Ang data ay naka-organisa sa LeRobot format at kasama na ang unang yugto ng dense action annotation sa parehong bundle. Ang mga galaw na nakikita sa video ay hindi espesyal. Ito ay pagkuha ng bagay at paglalagay nito sa ibang lugar, paggamit ng kasangkapan, o pagpapaliwanag ng workbench. Mga eksena na madalas mong makikita sa araw-araw o sa trabaho. Ngunit upang maging data para sa pagkatuto ng robot, kailangan ng mas detalyadong paghihiwalay. Ang annotation review ay binubuo ng 101 clip, at ang frame-by-frame language annotation ay nahahati sa 80,090 segment. Hindi lamang isang pangalan ng gawain ang ibinibigay sa buong video—kundi hinahati ito batay sa bawat pagbabago ng galaw upang tukuyin kung anong kilos ang naganap sa bawat sandali. Kahit ang paglipat ng isang baso ay nahahati sa parehong paraan. Ang pagkakadikit ng kamay sa baso at ang totoong paghawak nito ay magkakaibang punto; parehong magkakaiba ang estado habang ito ay dinala at ang sandali kung kailan ito ibinaba. Ang isang natural na galaw sa mata ng tao ay nahahati sa maraming hakbang sa loob ng data. Kailangan ito dahil hindi pareho ang katawan ng tao at ng robot. Ang tao’s kamay ay may malayang paggalaw sa maraming joints at daliri, habang ang robot ay may iba’t ibang sakop ng galaw depende sa disenyo nito. Mayroon ding robot na gumagamit lamang ng simpleng gripper, at iba’t iba ang posisyon ng camera. Hindi masosolusyunan ang problema sa pamamagitan ng pagkopya nang direkta ng galaw ng tao bilang robot action. Kailangan muna mahanap ang mga segment ng galaw at estado ng bagay sa video, tapos i-reconnect ito sa isang representation ng action na maaaring i-execute ng robot. Gumagamit din sila ng iba’t ibang uri ng equipment. Ang axis-ego-samples ay naglalaman ng sample mula sa iba’t ibang capture device: dual fisheye, six-camera RGB+SLAM, MEgo, Gen DAS Ego, FEAGINE EGO, GI Labs, atbp. Kahit pareho ang gawain, magkakaiba ang video depende sa configuration ng camera. Magkakaiba ang field of view, posisyon ng kamay sa screen, at paraan ng pagkuha ng location data batay sa device. Mahirap iwasan ang mga pagkakaiba nito kapag pinipili mong kumuha ng malaking dami ng data mula sa tunay na kapaligiran. Kailangan din ng proseso na mag-organisa ng iba’t ibang input para gamitin sa pagkatuto—hindi lamang mag-asa na mayroon kang iisang uri ng device at isang kondisyon sa pagkuha. Sa hiwalay na sample-150h-10cat folder, ipinapakita ang 10 episode mula sa 150-oras na delivery corpus, bawat isa ay nakakategorya. Gayunpaman, ang publikong repository ay naglalaman lamang ng 10 sample na ito—hindi buong 150-oras na corpus. Ang kabuuang laki ng lahat ng file sa axis-ego-samples repository ay humigit-kumulang 770GB. Maaari mo ring tingnan kung paano konektado ang data na ito sa iba pang produkto ni Axis. Ang Mobile Egocentric App ay ginawa upang subaybayan nang real-time ang hand pose habang tumatawid ang tao, at i-convert ito sa robotic motion. Sa browser simulation, direktang kinokontrol ng tao ang virtual robot upang lumikha ng state at action. Sa egocentric capture, una ay kinukuha ang gawain na ginagawa ng tao sa totoong espasyo, tapos mula doon ay hinahanap ang mga galaw na kailangan para sa pagkatuto ng robot. Ang isa ay paraan kung paano gumawa ng data habang direktang kinokontrol ang robot; ang isa pa naman ay paraan kung paano i-convert ang mga gawain na ginagawa na ng tao bilang data. Dito ay lumilitaw ang isang interesanteng punto: Hindi kailangan magpatuloy na galawin ang robot upang bigyan ito ng karanasan. Ang tao ay nagtatrabaho araw-araw sa maraming bagay. Maraming beses nating hinahawakan ang baso, binubuksan ang pinto, inaayos ang kahon, at ginagamit ang kasangkapan—mga gawain na paulit-ulit sa paligid natin. Kung ma-record natin nang sapat na akma ang mga gawaing ito at mai-link natin ito sa galaw ng robot, maaaring maging pinagmulan mismo ng data para sa pagkatuto ng robot ang araw-araw na gawain na ginagawa ng tao. Paano ginagamit ito sa tunay na pananaliksik tungkol sa robot—maaari mong tingnan sa EgoScale, isang pananaliksik na hiwalay kay Axis.Ang EgoScale, na ipinakilala noong Pebrero 2026, ay unang pre-trained gamit ang 20,854 na oras ng action-labeled egocentric human video, bago ito ay patuloy na tinuturuan gamit ang human-robot aligned data. Sa pagtataya sa 22-DoF dexterous robotic hand, ang average success rate ng final policy ay 54% mas mataas kaysa sa no-pretraining baseline. Ang EgoScale ay isang Axis-independent na pag-aaral at hindi nangangahulugan na ang pagdagdag ng maraming human video ay agad na gagawing mahusay ang robot. Ito ay isang halimbawa kung paano nag-improve ang performance pagkatapos muna mag-learn ng malawak na karanasan mula sa mga gawaing tao, at pagkatapos ay dagdagan ng data na nakatuon sa actual robot embodiment at action. Ang Axis ay naglalakbay din sa pagkonekta ng data na ito sa totoong collaborative applications. Sa pagpapahayag noong Agosto 28, ang Axis ay naglabas ng pahayag na gagawin nila ang malaking production ng egocentric, simulation, at real-world data para sa VLA at world model ng Dexmal. Mayroon pa ring mga bahagi na hindi pa ipinakilala. Ang eksaktong laki ng data na ipinadala sa Dexmal at kung paano ito nag-apekto sa model performance ay hindi pa ipinahayag. Gayunpaman, mula sa kasalukuyang ipinakilalang materyales, sapat na malinaw kung ano ang ginagawa ng Axis. Ang 100 oras ng LeRobot data ay nasa ilalim na at ang frame-by-frame annotation ay nahati sa 80,090 segment. Kasama rin ang mga sample mula sa iba’t ibang capture device. Ito ay proseso ng pagkuha ng maikling gawaing natural na ginagawa ng tao sa totoong mundo, paghahati nito sa mga hangganan ng aksyon, pagpapaliwanag ng galaw ng bagay at kamay, at pagpapalit nito sa anyo na maaring matutunan ng robot. Ang ilang segundo na parang walang kahulugan para sa tao ay naging isang pagkatuto para sa robot. Ang ipinakikita ng Axis ngayon ay ang resulta ng prosesong ito sa anyo ng totoong data. #PhysicalAI #RobotLearning
Grid (❖,❖) 🟩 🐬TermMax 🚢I-share

Source:Ipakita ang original
Disclaimer: Ang information sa page na ito ay maaaring nakuha mula sa mga third party at hindi necessary na nagre-reflect sa mga pananaw o opinyon ng KuCoin. Ibinigay ang content na ito para sa mga pangkalahatang informational purpose lang, nang walang anumang representation o warranty ng anumang uri, at hindi rin ito dapat ipakahulugan bilang financial o investment advice. Hindi mananagot ang KuCoin para sa anumang error o omission, o para sa anumang outcome na magreresulta mula sa paggamit ng information na ito.
Maaaring maging risky ang mga investment sa mga digital asset. Pakisuri nang maigi ang mga risk ng isang produkto at ang risk tolerance mo batay sa iyong sariling kalagayang pinansyal. Para sa higit pang information, mag-refer sa aming Terms ng Paggamit at Disclosure ng Risk.