Присоединяйтесь к нашим ежедневным и еженедельным информационным бюллетеням для последних обновлений и эксклюзивного контента в лидирующем отраслевом освещении искусственного интеллекта. Узнать больше
Одной из больших проблем робототехники является количество усилий, которые необходимо приложить в модели учебного машинного обучения для каждого робота, задачи и окружающей среды. Теперь новый проект Google DeepMind и 33 других исследовательских учреждений направлены на решение этой проблемы, создав систему ИИ общего назначения, которая может работать с различными типами физических роботов и выполнять множество задач.
«Мы заметили, что роботы — великие специалисты, но бедные генералисты», — сказал Venturebeat, бедняки », — сказал Pannag Sanketi, старший инженер -программист Google Robotics. «Как правило, вам нужно тренировать модель для каждой задачи, робота и среды. Изменение одной переменной часто требует, чтобы начать с нуля».
Чтобы преодолеть это и сделать гораздо проще и быстрее обучение и развертывание роботов, новый проект, получивший название Open-X, вводит два ключевых компонента: набор данных, содержащий данные о нескольких типах роботов и семейство моделей, способных передавать навыки в широком диапазоне задач. Исследователи проводят модели на тест в лаборатории робототехники и на разные типы роботов, достигая превосходных результатов по сравнению с часто используемыми методами для обучающих роботов.
Объединение данных о робототехнике
Как правило, каждый отличный тип робота с его уникальным набором датчиков и приводов требует специализированной программной модели, очень похожая на то, как мозг и нервная система каждого живого организма развивались, чтобы стать настроенным на тело и окружающую среду этого организма.
Проект Open X-Embodiment был рожден из интуиции, что объединение данных из различных роботов и задач может создать обобщенную модель, превосходящую специализированные модели, применимые ко всем видам роботов. Эта концепция была частично вдохновлена большими языковыми моделями (LLMS), которые, когда они обучались на крупных общих наборах данных, могут соответствовать или даже превзойти более мелкие модели, обученные узким, конкретным наборам данных. Удивительно, но исследователи обнаружили, что тот же принцип применяется к робототехнике.
Чтобы создать открытый набор данных X-Embodent, исследовательская группа собрала данные из 22 вариантов осуществления роботов в 20 учреждениях из разных стран. Набор данных включает в себя примеры более 500 навыков и 150 000 задач в течение более 1 миллиона эпизодов (эпизод — это последовательность действий, которые робот предпринимает каждый раз, когда он пытается выполнить задачу).
Сопутствующие модели основаны на трансформаторе, архитектура глубокого обучения также используется в моделях крупных языков. RT-1-X построен на вершине робототехнического трансформатора 1 (RT-1), многочасовой модели для реальной робототехники в масштабе. RT-2-X построен на преемнике RT-1 RT-2, модели Vision-Language-Action (VLA), которая узнала как из робототехники, так и из веб-данных и может реагировать на команды естественного языка.
Исследователи протестировали RT-1-X на различных задачах в пяти различных исследовательских лабораториях на пяти часто используемых роботах. По сравнению со специализированными моделями, разработанными для каждого робота, RT-1-X имел на 50% более высокий уровень успеха в таких задачах, как выбор и перемещение объектов и открывающие двери. Модель также смогла обобщить свои навыки в разных средах, в отличие от специализированных моделей, которые подходят для конкретной визуальной настройки. Это говорит о том, что модель, обучающаяся на разнообразном наборе примеров, превосходит специализированные модели в большинстве задач. Согласно статье, модель может быть применена к широкому диапазону роботов, от рук роботов до четвероногих.
«Для тех, кто провел исследования робототехники, вы узнаете, насколько это замечательно: такие модели« никогда »не работают с первой попытки, но это сделало»,-пишет Сергей Левин, доцент в Калифорнийском университете в Беркли и соавтор статьи.
RT-2-X был в три раза выше, чем RT-2, на возникающих навыках, новых задачах, которые не были включены в набор обучения. В частности, RT-2-X показал лучшую производительность в задачах, которые требуют пространственного понимания, например, сообщать разницу между перемещением яблока возле ткань в отличие от размещения на ткани
«Наши результаты показывают, что совместное обучение с данными из других платформ Imbues RT-2-X с дополнительными навыками, которые не присутствовали в оригинальном наборе данных, что позволяет ему выполнять новые задачи»,-пишут исследователи в блоге, в котором объявляются Open X и RT-X.
Принять будущие шаги для исследований робототехники
Заглядывая в будущее, ученые рассматривают направления исследований, которые могут объединить эти достижения с пониманием Robocat, самосовершенной модели, разработанной DeepMind. Robocat учится выполнять различные задачи в разных роботизированных руках, а затем автоматически генерирует новые учебные данные для повышения его производительности.
Другим потенциальным направлением, согласно Sanketi, может быть дальнейшее изучение того, как различные смеси наборов данных могут повлиять на обобщение поперечного эмбодирования и как улучшенное обобщение.
Команда открыла открытый набор данных X-Embodiment и небольшую версию модели RT-1-X, но не модель RT-2-X.
«Мы считаем, что эти инструменты преобразуют способ обучения роботов и ускорить эту область исследований», — сказал Санкети. «Мы надеемся, что открытое поиск данных и предоставление безопасных, но ограниченных моделей снизит барьеры и ускоряет исследования. Будущее робототехники опирается на то, чтобы роботы учиться друг у друга, и, что наиболее важно, что позволяет исследователям учиться друг у друга».
Источник
