
Американская компания Dyna Robotics представила новую фундаментальную модель для роботов DYNA-2, обученную на более чем 1 млн часов видеозаписей человека. По словам разработчиков, такой объём данных позволяет преодолеть одно из главных ограничений в обучении роботов выполнению физических задач.
Обучение на человеческих видео
Модель DYNA-2 World-Action Model была обучена исключительно на эгоцентричных видеозаписях человека, а не на данных о действиях роботов. Набор данных эквивалентен примерно 170 годам непрерывного опыта бодрствования. Такой подход позволяет роботам осваивать физические навыки, наблюдая за тем, как люди взаимодействуют с объектами и окружающей средой, что снижает зависимость от ручного сбора данных телеуправления.
В ходе тестирования компания сообщила, что DYNA-2 повысила показатель успешного выполнения задач в высокоточном производстве с 20% до 80–90% только за счёт увеличения масштаба предварительного обучения. Модель также продемонстрировала перенос навыков между стационарными роботизированными манипуляторами, прототипами гуманоидов и многофункциональными роботизированными руками.
Преимущества перед предыдущей версией
DYNA-2 использует архитектуру мирового моделирования, которая объединяет прогнозирование следующего кадра и следующего действия. Это позволяет переносить знания, полученные из поведения человека, на различное роботизированное оборудование. В одном из тестов всего 13 минут данных хватило, чтобы DYNA-2 управляла парой пятипалых роботизированных рук и открутила крышку бутылки.
В сравнении с предыдущей моделью DYNA-1, использующей архитектуру vision-language-action, DYNA-2 показала значительно лучшие результаты. В ходе развёртывания у заказчика без предварительной настройки DYNA-2 достигла 87% прохождения контроля качества против 46% у DYNA-1. Новая модель также лучше восстанавливалась при сбоях: во время задач по нарезке продуктов и уборке рабочего пространства она могла продолжить работу без вмешательства человека.
Метод совместного обучения на видео повысил результаты на 133% при выполнении задач, требующих различных физических движений по команде.
Масштабирование без телеуправления
«Годами общая робототехника задыхалась из-за узкого места в данных: ручной сбор данных телеуправления физическими действиями просто не может масштабироваться до общего интеллекта, — заявил сооснователь Dyna Robotics Джейсон Ма. — Данных о действиях мало, но видео есть повсюду, и с DYNA-2 мы показали, что физическая интуиция не требует миллионов часов тренировок на роботизированной руке — её можно получить непосредственно из человеческих видео».
Роботы Dyna Robotics на базе предыдущей модели DYNA-1 уже развёрнуты в отелях, ресторанах и прачечных. Компания рассматривает DYNA-2 как шаг к созданию роботов, способных осваивать новые физические задачи без больших объёмов специализированных данных. Основателями Dyna Robotics выступили Линдон Гао, Йорк Янг и бывший научный сотрудник DeepMind Джейсон Ма. Инвесторами компании являются CRV и First Round.