Один мозг на всех Одна и та же команда для разных роботов всегда «выглядит» по-разному: у каждого свои конструкция, число суставов и способ управления движением. Чтобы устранить этот пробел и упростить обучение, команда Xiaomi Embodied Intelligence Team и Университета Макао разработала систему UCAG-P, которая позволяет одной VLA-модели учиться на данных от совершенно разных «тел», будь то робот-манипулятор или робот-гуманоид. Система описывает движение через две опорные точки, которые можно определить у роботов: конец манипулятора и центр захвата. Их траектория задается в трехмерном пространстве относительно камеры. Для человеческих демонстраций аналогами этих точек становятся запястье и середина между большим и указательным пальцами. Затем отдельный модуль преобразует такую универсальную траекторию в команды под конкретного робота. Для этого он учитывает его текущее состояние, кинематику и калибровку камеры. В обучении помогали 11 наборов данных — в сумме около 6370 часов демонстраций на 9 типах роботов. При этом на одну треть часов пришлись видео с человеческими руками. В симуляции одну и ту же обученную модель без дополнительной настройки проверили сразу на нескольких бенчмарках. В LIBERO она успешно выполнила 98,3% заданий, в RoboTwin для двуруких роботов — около 89%, а в усложненном LIBERO-Plus — 82%. Отдельно модель проверили на гуманоиде GR-1 с 29-ю степенями свободы — там результат составил 62%. Но полностью игнорировать душевную организацию конкретного робота пока не получается. Когда модель, обученную на двуруком ALOHA, без дополнительной настройки перенесли на робота ARX другой конструкции, успех выполнения задач упал до 35%. Отдельно UCAG-P проверили на манипуляторах Piper (они, кстати, на видео). Здесь уже использовали по 100 демонстраций для адаптации каждой задачи. Система помогла роботу успешно схватить круассан в 60% случаев против 20% у π0.5, открыть ящик — в 90% против 85%, а также разложить тарелки — в 75% против 65%. Хотя не все мы идеальны. UCAG-P пока не с первого раза справляется с определением положения кисти или калибровкой камеры. Вызывают сложности и открывание-закрывание дверей и ящиков. К слову, в скором времени ждем исходный код на GitHub. @anti_robots