source avatarGrid (❖,❖) 🟩 🐬TermMax 🚢

مشاركة

[طريقة تحويل بيانات Egocentric البشريّة التي كشفت عنها Axis، والتي تبلغ 100 ساعة، إلى بيانات تدريب للروبوتات] @KaitoAI X @axisrobotics رابط المشاركة في Axis (إحالة): https://t.co/hUbWSVsBVR عندما يلتقط الإنسان كوبًا، لا يحسب زوايا الأصابع أو مسار المعصم. فقط يلتقط الكوب بسلاسة أمامه ويضعه في مكان آخر. لكن تدريب الروبوت على نفس المهمة يتطلب نهجًا مختلفًا. يجب تقسيم الحركة إلى مراحل: لحظة اقتراب اليد من الجسم، لحظة اللمس الفعلية، المسار الذي تسلكه بعد رفعه، ولحظة وضعه مرة أخرى. بينما يرى الإنسان هذا كحركة واحدة متصلة، يجب على الروبوت فهم ما حدث داخل هذه الحركة من خلال تحويلها إلى بيانات. يُظهر axis-ego-samples، الذي قامت Axis بتحديثه في أوائل سبتمبر، هذه العملية بالضبط من خلال ملفات حقيقية تُظهر كيفية تحويل سلوك الإنسان إلى بيانات تدريب للروبوتات. الفيديوهات المُتاحة حاليًا من نوع Egocentric تبلغ 100 ساعة. هي مقاطع من منظور الشخص الذي يؤدي المهمة، وتصنّف حسب بيئات العمل الفعلية مثل التعليم، الإقامة، التجزئة، المستودعات، الحرف اليدوية، التغذية، المكاتب، الإنتاج، واللوجستيات. تم تنظيم البيانات بتنسيق LeRobot، وتشمل أيضًا تسميات إجرائية كثيفة (dense action annotation) من الدرجة الأولى ضمن نفس المجموعة. الحركات التي تظهر في الفيديوهات ليست استثنائية. إنها تشمل إخراج الأشياء ووضعها في أماكن أخرى، استخدام الأدوات، أو تنظيم طاولات العمل. إنها مشاهد شائعة في الحياة اليومية أو مكان العمل. لكن حتى هذه السلوكيات العادية تحتاج إلى تفصيل دقيق جدًا لتُصبح بيانات تدريب للروبوتات. يتضمن مراجعة التسميات 101 مقطعًا، وتُقسّم التسميات اللغوية على مستوى الإطار إلى 80,090 جزءًا. بدلاً من تسمية الفيديو الكامل باسم مهمة واحدة، يتم تقسيم الفيديو عند كل تغيير في السلوك لتسجيل ما حدث بالضبط في كل لحظة. حتى حركة نقل كوب واحد تُقسّم بنفس الطريقة: فترة اقتراب اليد من الكوب تختلف عن لحظة الإمساك الفعلية، كما تختلف حالة الحركة أثناء النقل عن لحظة وضع الكوب. ما يبدو للعين البشرية كحركة طبيعية واحدة، ينقسم داخل البيانات إلى مراحل متعددة. السبب في الحاجة إلى هذه العملية هو أن أجسام البشر والروبوتات ليست متطابقة. اليد البشرية تستطيع استخدام مفاصل وأصابع بحرية، بينما يختلف نطاق الحركة في الروبوتات حسب هيكله. قد يستخدم بعض الروبوتات ممسكًا بسيطًا، بينما تكون الكاميرات مثبتة في مواقع مختلفة. لا يمكن حل هذا ببساطة عن طريق نسخ حركات اليد البشرية مباشرة كأفعال روبوتية. يجب أولاً تحديد فترات السلوك والحالة الفيزيائية للجسم في الفيديو، ثم ربطها بتمثيلات إجرائية يمكن للروبوت تنفيذها فعليًا. كما تُستخدم أجهزة تصوير متعددة. يحتوي axis-ego-samples على عينات تم جمعها من أجهزة تسجيل مختلفة مثل: dual fisheye، six-camera RGB+SLAM، MEgo، Gen DAS Ego، FEAGINE EGO، وGI Labs. حتى عند تصوير نفس المهمة، يمكن أن تختلف الفيديوهات حسب تركيب الكاميرا: زاوية الرؤية تتغير، وموقع اليد داخل الإطار يتغير، وطريقة الحصول على معلومات الموقع تختلف بين الأجهزة. عند جمع البيانات على نطاق واسع في بيئات فعلية، من الصعب تجنب هذه الاختلافات. لذلك، لا يكفي افتراض استخدام جهاز واحد أو ظروف تصوير واحدة فقط — بل يجب أيضًا تنظيم البيانات بحيث يمكن استخدام مدخلات متنوعة في التدريب. يحتوي المجلد المنفصل sample-150h-10cat على 10 حلقات تم اختيارها من مجموعة بيانات التسليم التي تبلغ 150 ساعة، مصنفة حسب الفئة. لكن ما تم نشره في المستودع العام هو فقط هذه العينات العشر، وليس المجموعة الكاملة البالغة 150 ساعة. حجم الملفات الكامل لمستودع axis-ego-samples حاليًا حوالي 770 جيجابايت. يمكن أيضًا رؤية كيفية ارتباط هذه البيانات بمنتجات Axis الأخرى. يتم تطوير تطبيق Mobile Egocentric لتتبع وضع اليد في الوقت الحقيقي أثناء تحرك الإنسان، ثم تحويل هذا الحركة إلى حركة روبوتية. في المحاكاة عبر المتصفح، يقوم الإنسان بتشغيل روبوت افتراضي مباشرة لإنشاء الحالة والإجراء. في التسجيل Egocentric، يتم أولاً تسجيل المهام التي يقوم بها الإنسان في الفضاء الحقيقي، ثم استخلاص السلوكيات اللازمة لتدريب الروبوت منها. إحدى الطريقيين تعتمد على تحريك الروبوت مباشرة لإنشاء البيانات، بينما تعتمد الأخرى على تحويل السلوكيات التي يقوم بها الإنسان بالفعل إلى بيانات. هنا يظهر جانب مثير للاهتمام: لا يحتاج الأمر بالضرورة إلى تحريك الروبوت باستمرار لجمع الخبرات له. فالإنسان يتعامل يوميًا مع عدد هائل من الأشياء: يلتقط الأكواب وينقلها، يفتح الأبواب، يرتب الصناديق، ويستخدم الأدوات — وكل هذه الحركات تتكرر في كل مكان في الحياة الواقعية. إذا تم تسجيل هذه السلوكيات بدقة كافية وربطها بحركات الروبوت المناسبة، فإن السلوكيات اليومية التي ينتجها الإنسان نفسها يمكن أن تصبح مصدرًا أساسيًا لبيانات تدريب الروبوتات. يمكن الاطلاع على كيفية استخدام هذه الفكرة في أبحاث الروبوتات الواقعية أيضًا في دراسة EgoScale، والتي تعد مستقلة عن Axis.تم الكشف عن EgoScale في فبراير 2026، حيث تم التدريب المسبق لـ VLA باستخدام أكثر من 20,854 ساعة من مقاطع فيديو إيكوسيينترية مُوسومة بالإجراءات، ثم تم تدريبها إضافيًا على بيانات متماشية بين الإنسان والروبوت. في تقييم اليد الروبوتية المتميزة ذات 22 درجة من الحرية، كان متوسط معدل النجاح للسياسة النهائية أعلى بنسبة 54% مقارنة بقاعدة لا تتضمن تدريبًا مسبقًا. EgoScale ليس بحثًا مرتبطًا بـ Axis، ولا يعني ببساطة أن إدخال مقاطع فيديو بشرية كافية سيجعل الروبوتات تتحرك بشكل جيد فورًا. بل هو مثال على تحسين الأداء عند تعلم تجارب واسعة من سلوك الإنسان أولاً، ثم إضافة بيانات متوافقة مع جسم الروبوت وأفعاله الفعلية. يقوم Axis أيضًا بربط هذه البيانات بالتطبيقات العملية. في التعاون المعلن عنه في 28 أغسطس مع Dexmal، أوضح Axis أنه سيتولى إنتاج كميات كبيرة من بيانات إيكوسيينترية ومحاكاة وعالم حقيقي لاستخدامها في VLA ونموذج العالم الخاص بـ Dexmal. لا تزال هناك أجزاء غير معلنة حتى الآن. لم يتم الكشف عن حجم البيانات المنقولة فعليًا إلى Dexmal، أو كيف أثرت هذه البيانات على أداء النموذج. لكن حتى بناءً على المواد المعلنة حاليًا، يمكننا التحقق بوضوح من نوع المهام التي يجريها Axis. تم رفع 100 ساعة من بيانات LeRobot فعليًا، مع تجزئة الترميز على مستوى الإطار إلى 80,090 جزءًا. كما تم نشر عينات مأخوذة من أجهزة تصوير متعددة. إنها عملية تصوير سلوكيات قصيرة ينفذها الإنسان بشكل طبيعي في العالم الحقيقي، ثم تقسيم الحدود بين هذه السلوكيات، وتنظيم حركة الأشياء واليدين، وأخيرًا تحويلها إلى شكل يمكن للروبوت التعلم منه. بضع ثوانٍ تمر دون انتباه للإنسان تصبح تجربة تعلم واحدة للروبوت. ما ينشره Axis حاليًا هو نتيجة هذا العملية المُطبقة على بيانات فعلية. #PhysicalAI #RobotLearning

No.0 picture
إخلاء المسؤولية: قد تكون المعلومات الواردة في هذه الصفحة قد حصلت عليها من أطراف ثالثة ولا تعكس بالضرورة وجهات نظر أو آراء KuCoin. يُقدّم هذا المحتوى لأغراض إعلامية عامة فقط ، دون أي تمثيل أو ضمان من أي نوع ، ولا يجوز تفسيره على أنه مشورة مالية أو استثمارية. لن تكون KuCoin مسؤولة عن أي أخطاء أو سهو ، أو عن أي نتائج ناتجة عن استخدام هذه المعلومات. يمكن أن تكون الاستثمارات في الأصول الرقمية محفوفة بالمخاطر. يرجى تقييم مخاطر المنتج بعناية وتحملك للمخاطر بناء على ظروفك المالية الخاصة. لمزيد من المعلومات، يرجى الرجوع إلى شروط الاستخدام واخلاء المسؤولية.