Введение
Преобразование инструкций на естественном языке в непрерывное управление для четвероногих роботов представляет собой основную проблему в области взаимодействия между языком и действием. Существующие методы не способны эффективно соединить высокоуровневое семантическое понимание с низкоуровневым управлением, что приводит к нестабильной привязке и слабой обобщаемости в реальных условиях.
MobileVLA-R1
Чтобы решить эти проблемы, мы представляем MobileVLA-R1 — унифицированную платформу для взаимодействия между языком и действием, которая обеспечивает явное рассуждение и непрерывное управление для четвероногих роботов.
Создание датасета MobileVLA-CoT
Мы разработали MobileVLA-CoT — крупномасштабный датасет многогранной цепочки рассуждений (CoT) для эмбодированных траекторий, обеспечивающий структурированное управление рассуждениями для выравнивания.
Двухступенчатая схема обучения
На основе данного фундамента мы вводим двухступенчатую схему обучения, которая сочетает в себе управляемое выравнивание CoT и обучение с подкреплением GRPO. Это позволяет улучшить согласованность рассуждений, стабильность управления и выполнение долгосрочных задач.
Результаты и тестирование
Обширные оценки по задачам VLN и VLA показывают превосходные результаты по сравнению с сильными базовыми моделями, с улучшением примерно на 5%. Реальное развертывание на четвероногом роботе подтверждает надежную работу в сложных условиях.
Интересно, что MobileVLA-R1 улучшает управление четвероногими роботами, а стабильность и высокая производительность звучат многообещающе. Надо будет посмотреть, как это повлияет на реальное применение в робототехнике.
Да, буду следить за новостями, интересно, что из этого выйдет!