Одна вещь, которая бросилась мне в глаза при изучении GitHub @continuumlabs_, — это то, что сбор данных роботов — это не конечная цель. Это именно то место, где начинается другая проблема. Что делать со всем этим сырым данными? Представьте, что вы записываете тысячи демонстраций роботов. Некоторые движения могут быть слишком шумными. Некоторые траектории — несогласованными. Некоторые данные могут вообще не подходить для обучения. Нельзя просто бросить всё это в модель и надеяться на лучшее. Здесь на сцену выходит Continuum Data Cleaning. Это набор инструментов в экосистеме Axis, предназначенный для обработки и оценки траекторий роботов до их дальнейшего использования в конвейере. И честно говоря, об этой части слишком мало говорят. Мы много слышим о сборе большего количества данных. Но больше данных — это не автоматически лучшие данные. Представьте траекторию робота как запись всего, что происходило во время выполнения задачи. Если запись содержит лишний шум или нерегулярности, модель может научиться на этих недостатках, а не на поведении, которое вам действительно интересно. Поэтому данные нужно проверить и обработать. Continuum Data Cleaning включает инструменты для сглаживания и повторной выборки траекторий, а также метрики, помогающие оценить качество траекторий. Например, сглаживание помогает уменьшить нежелательный шум в данных движения. Повторная выборка делает траектории более согласованными по распределению точек данных во времени. А метрики оценки позволяют понять, выглядит ли траектория разумно, вместо того чтобы предполагать, что каждая записанная демонстрация полезна. Также есть валидация на уровне задачи. Это важно, потому что траектория может выглядеть технически корректно, но всё равно не выполнять саму задачу. Робот, плавно движущийся по траектории, не обязательно успешно завершил то, что должен был сделать. Поэтому важно задавать оба вопроса: «Чистая ли эта траектория?» и «Удалось ли роботу реально выполнить задачу?» Это различие имеет значение при создании наборов данных для Physical AI. Интересно то, что в Axis можно начать видеть, как различные репозитории соединяются вместе. Continuum Task Gen помогает создавать задачи. Люди могут демонстрировать эти задачи через телеперевод. Эти взаимодействия порождают траектории. Затем такие инструменты, как Continuum Data Cleaning, помогают обработать и оценить эти данные траекторий. Только после этих шагов вы действительно начинаете приближаться к данным, готовым к обучению. Это гораздо более полный подход к робототехнике. Это не просто… собирать как можно больше данных. Это… → собирать → проверять → очищать → валидировать → улучшать → обучать. Потому что если роботы будут учиться на человеческих демонстрациях, качество этих демонстраций имеет значение. И именно поэтому я считаю, что менее зрелищные части конвейера — очистка, валидация и оценка данных — могут оказаться столь же важными, как и яркие AI-модели, о которых все говорят. Завтра я подробнее рассмотрю, что именно происходит, когда вы очищаете и обрабатываете траекторию робота с помощью @continuumlabs_.
Abul Hasanat ManikПоделиться

Источник:Показать оригинал
Отказ от ответственности: Информация на этой странице может быть получена от третьих лиц и не обязательно отражает взгляды или мнения KuCoin. Данный контент предоставляется исключительно в общих информационных целях, без каких-либо заверений или гарантий, а также не может быть истолкован как финансовый или инвестиционный совет. KuCoin не несет ответственности за ошибки или упущения, а также за любые результаты, полученные в результате использования этой информации.
Инвестиции в цифровые активы могут быть рискованными. Пожалуйста, тщательно оценивайте риски, связанные с продуктом, и свою устойчивость к риску, исходя из собственных финансовых обстоятельств. Для получения более подробной информации, пожалуйста, ознакомьтесь с нашими Условиями использования и Уведомлением о риске.