Робот, который понимает фразу «принеси синюю коробку со стола» - уже не демонстрация, а рабочий стек из трёх слоёв моделей.
Соединение больших языковых моделей и гуманоидных роботов - главное направление робототехники последних двух лет. Языковая модель отвечает за понимание задачи и планирование, а специализированные модели движения переводят план в действия суставов. Разбираем, как устроен этот стек и что он реально умеет.
| Языковой слой | LLM разбирает команду, задаёт вопросы, строит план из шагов |
| Визуально-языковой слой | VLM находит объекты на изображении, оценивает сцену, проверяет результат |
| Слой действий | VLA или политика движения переводит шаг плана в траектории рук и ног |
Vision-Language-Action - модель, которая на вход получает изображение с камер и текстовую инструкцию, а на выход даёт команды приводам. Она обучается на телеоперационных данных: оператор в костюме захвата движений выполняет задачи, робот записывает видео и положения суставов. После десятков тысяч демонстраций модель выполняет похожие задачи сама, включая те, которые не видела в точности.
Именно поэтому производители гуманоидов строят центры сбора данных: AgiBot записывает миллионы эпизодов, Unitree и Noetix открывают платформы для сбора данных исследователями.
Unitree H2 поставляется с открытым SDK и вычислителем, на который ставятся собственные модели: университеты запускают на нём VLA-политики и связывают с LLM через ROS 2. AgiBot A3 идёт с экосистемой моделей производителя и датасетами для дообучения. Noetix Bumi - компактная платформа для отработки речевого взаимодействия и простых задач манипуляции в учебных курсах.
Зависит от конфигурации. Компактные модели работают на борту, крупные - в облаке или на локальном сервере лаборатории.
Да, на платформах с открытым SDK. Стандартная схема: LLM выдаёт план, ROS 2 передаёт шаги контроллеру движения.
Языковой слой понимает русский, если используется мультиязычная модель. Речевое распознавание настраивается отдельно.
+7 925 995-49-15 · info@100xbot.ru