source avatarGrid (❖,❖) 🟩 🐬TermMax 🚢

साझा करें

[एक्सिस द्वारा प्रकाशित 100 घंटे का एगोसेंट्रिक डेटा, मानव कार्य को रोबोट शिक्षण डेटा के रूप में संगठित करने का तरीका] @KaitoAI X @axisrobotics एक्सिस में शामिल होने का लिंक (रेफरल): https://t.co/hUbWSVsBVR मनुष्य जब कप को उठाता है, तो उंगलियों के कोण या कलाई की गति की गणना नहीं करता। वह सिर्फ सामने वाले कप को प्राकृतिक रूप से उठाकर कहीं और रख देता है। एक ही कार्य रोबोट को सिखाने के लिए अलग होता है। हाथ को वस्तु के पास ले जाने का समय, वास्तविक संपर्क का क्षण, उठाने के बाद गति का पथ, और फिर से रखने का समय—इन सभी को अलग-अलग चरणों में विभाजित करना होता है। मनुष्य के लिए यह एक सतत क्रिया है, लेकिन रोबोट को सीखने के लिए, इसके भीतर क्या हुआ, उसे डेटा में विघटित करना होगा। एक्सिस द्वारा सितंबर की शुरुआत में अपडेट किया गया axis-ego-samples, मानव कार्य को रोबोट शिक्षण डेटा में परिवर्तित करने की प्रक्रिया को वास्तविक फ़ाइलों के माध्यम से प्रदर्शित करता है। वर्तमान में प्रकाशित egocentric video 100 घंटे है। यह 1वें-व्यक्ति के दृष्टिकोण से ली गई वीडियो है, जिसमें प्रशिक्षण, आवास, खुदरा, स्टोरहाउस, हस्तशिल्प, कैटरिंग, कार्यालय, उत्पादन, लॉजिस्टिक्स जैसे वास्तविक कार्य परिदृश्यों को scene category के रूप में वर्गीकृत किया गया है। डेटा LeRobot format में संगठित है, और 1वें-स्तरीय dense action annotation भी समान पैकेज में सम्मिलित है। वीडियो में प्रदर्शित क्रियाएँ विशेष नहीं हैं। वस्तुओं को निकालकर कहीं और रखना, उपकरणों का प्रयोग करना, या कार्यमेज़ साफ़ करना—ये सभी सामान्य, प्रतिदिन के प्रकृति की हैं। ऐसी सामान्य क्रियाओं को भी रोबोट शिक्षण डेटा में परिवर्तित करने के लिए, प्रक्रिया को कहीं अधिक सूक्ष्म होना होगा। Annotation review में 101 clips हैं, और frame-by-frame language annotation 80,090 segments में विभाजित है। पूरी लंबी वीडियो पर सिर्फ़ एक ही कार्य-नाम नहीं, बल्कि प्रत्येक क्रिया परिवर्तन के समय पर segment-वार प्रदर्शन है—यह प्रति-क्षण सटीकता से पता है कि कब-कब-कौन-सी हरकत हुई। एक ही कप को हटाने की प्रक्रिया में भी, समान पद्धति से समय-समय पर समय-खंडों में बँटती है। हाथ कप के पास पहुँचने का समय, हथेली में पकड़ने का समय, हवा में संचलन,और पुनः स्थापन—ये सभी पृथक्-पृथक् समय-खंड हैं। मनुष्य की आँखों में, एक ही प्राकृतिक हरकत है, परंतु डेटा में, इसे कई पदचिह्नों में समझा जाता है। इस प्रक्रिया कीआवश्यकता है, क्योंकि मनुष्य और रोबोट के शरीर समान नहीं हैं। मनुष्य हथेली में कई joint and fingers स्वतंत्रतापूर्वक प्रयोग करता है, परंतु रोबोट में, प्रत्येक संरचना में हलचल की सीमा होती है। कुछ में सरल gripper होते हैं,और कुछ में camera position different होते हैं। मनुष्य हथेली की हरकतों को सीधे robot action में copy-करने से समस्या हल नहीं होगी। पहले video में action segments and object states पहचानने होंगे,फिर unifying them into action representations that the specific robot can actually execute. Recording devices bhi kai prakar ke istemal kiye gaye hain. axis-ego-samples में dual fisheye, six-camera RGB+SLAM, MEgo, Gen DAS Ego, FEAGINE EGO, GI Labs—जैसे alag-alag capture devices se prāpt samples public kiye gaye hain. Ek hi karya ko bhi alag-alag camera configuration ke karan alag-alag video ban sakta hai. Field of view alag hoga, haath screen par kahan dikhega—ye sab bhi device ke hisaab se alag hoga. Position data prāpt karne ka tarika bhi har device ke liye alag hai. Vastavik paridrishya mein badi paryapt data ekatrit karne ke liye in bhedon se bhaagne ka koi upay nahi hai. Ek hi type ke device aur ek hi recording condition ke liye assume karne ki bajaye, alag-alag inputs ko training ke liye samarth banane ki prakriya bhi avashyak hai. Ek alag sample-150h-10cat folder mein delivery corpus se 150 ghante ki data mein se 10 episodes category-wise prakat kiye gaye hain. Kewal public repository mein ye 10 samples hi upalabdh hain; 150 ghante ka pura corpus abhi tak public nahi kiya gaya hai. वर्तमान में axis-ego-samples repository ka total file size ~770GB है। इस data ko Axis ke dusre products se kaise joda ja sakta hai—yeh bhi dekha ja sakta hai। Mobile Egocentric App—yeh ek aisa app hai jo insaan ke chalne ke dauran hand pose ko real-time track karta hai aur usi movement ko robotic motion mein badalne ki disha mein banaya gaya hai। Browser simulation mein—insaan ek virtual robot ko directly control karke state aur action generate karta hai। Egocentric capture mein—vastavik sthal par insaan dwara kiye gaye karya ko pehle record kiya jata hai aur phir usmein robot training ke liye avashyak actions ko dhundha jata hai। Ek approach mein robot ko directly move karke data generate kiya jata hai; dusre approach mein—insaan dwara pehle se hi kiye ja rahe karya ko data mein badal diya jata hai। Yahan ek mazedaar baat uthti hai: Robot ko experience dene ke liye zaroori nahi ki robot ko lagan-badan chalaya jaaye। Insan rozana bahut si vastuon ko handle kar raha hota hai। Kap uthana aur rakhna, darwaza kholna, box organize karna, upkaran ka upyog karna—yeh sab vastavik jeevan mein bahut baar repeat ho rahe hain। Agar aise karya ko puri tarah se sahi tareeke se record kiya ja sake aur robot ke movement se connect kiya ja sake toh—insaan ke daily life mein khud hi generate hone wale vyavahar hi robot training data ka source ban sakte hain। Yeh vichar robot research mein kaise istemal hota hai—yeh Axis ke alawa EgoScale naamak ek anya research mein bhi dekha ja sakta hai।2026 फरवरी में लॉन्च किया गया EgoScale ने पहले 20,854 घंटे से अधिक action-लेबल्ड egocentric human video के साथ VLA को pre-train किया, और फिर human-robot aligned data के साथ अतिरिक्त प्रशिक्षण दिया। 22-DoF दक्ष रोबोटिक हाथ के मूल्यांकन में, अंतिम policy की औसत सफलता दर no-pretraining baseline से 54% अधिक थी। EgoScale एक Axis-अनुभागीय शोध है, और केवल इंसानी वीडियो को बहुत अधिक डालने से रोबोट सीधे अच्छी तरह से काम नहीं करने लगता। यह एक ऐसा उदाहरण है जहां पहले मानव के व्यवहार से व्यापक अनुभव का प्रशिक्षण दिया गया, और फिर वास्तविक रोबोट के embodiment और action के साथ मेल खाने वाले डेटा को जोड़ने पर प्रदर्शन में सुधार हुआ। Axis इस डेटा को वास्तविक सहयोग में भी जोड़ रहा है। 28 अगस्त को प्रकाशित Dexmal के सहयोग में, Axis ने Dexmal के VLA और world model के लिए विशाल egocentric, simulation, real-world data production की जिम्मेदारी संभालने की पुष्टि की। अभी तक प्रकाशित नहीं हुए पहलुओं की संख्या है। Dexmal को वास्तव में कितना डेटा प्रदान किया गया है, और इस डेटा ने मॉडल प्रदर्शन में क्या परिवर्तन किया है, इसकी कोई सूचना प्रकाशित नहीं हुई है। हालांकि, केवल अभी तक प्रकाशित सामग्री से ही Axis किस प्रकार का कार्य कर रहा है, यह पूरी तरह से स्पष्ट है। 100 घंटे का LeRobot data वास्तव में प्रकाशित हो चुका है, और frame-by-frame annotation 80,090 segment में विभाजित है। कई capture device से प्राप्त samples भी साझा किए गए हैं। यह प्रक्रिया है: मनुष्य के प्राकृतिक, वास्तविक परिदृश्य में किए जाने वाले संक्षिप्त कार्यों को कैमरे से कैप्चर करना, उनमें action boundaries को पहचानना, objects aur hands की हरकतों को संगठित करना, और फिर इसे robot training के लिए सुलभ प्रारूप में परिवर्तित करना। जो कुछ मनुष्य के लिए कुछ सेकंड में सामान्य है, वही robot के लिए एक प्रशिक्षण-अनुभव है। Axis जो प्रकाशित कर रहा है, वही है — इस प्रक्रिया का वास्तविक data में परिणाम। #PhysicalAI #RobotLearning

No.0 picture
डिस्क्लेमर: इस पेज पर दी गई जानकारी थर्ड पार्टीज़ से प्राप्त की गई हो सकती है और यह जरूरी नहीं कि KuCoin के विचारों या राय को दर्शाती हो। यह सामग्री केवल सामान्य सूचनात्मक उद्देश्यों के लिए प्रदान की गई है, किसी भी प्रकार के प्रस्तुतीकरण या वारंटी के बिना, न ही इसे वित्तीय या निवेश सलाह के रूप में माना जाएगा। KuCoin किसी भी त्रुटि या चूक के लिए या इस जानकारी के इस्तेमाल से होने वाले किसी भी नतीजे के लिए उत्तरदायी नहीं होगा। डिजिटल संपत्तियों में निवेश जोखिम भरा हो सकता है। कृपया अपनी वित्तीय परिस्थितियों के आधार पर किसी प्रोडक्ट के जोखिमों और अपनी जोखिम सहनशीलता का सावधानीपूर्वक मूल्यांकन करें। अधिक जानकारी के लिए, कृपया हमारे उपयोग के नियम और जोखिम प्रकटीकरण देखें।