Гуманоиды с языковыми моделями

Робот, который понимает фразу «принеси синюю коробку со стола» - уже не демонстрация, а рабочий стек из трёх слоёв моделей.

Соединение больших языковых моделей и гуманоидных роботов - главное направление робототехники последних двух лет. Языковая модель отвечает за понимание задачи и планирование, а специализированные модели движения переводят план в действия суставов. Разбираем, как устроен этот стек и что он реально умеет.

Три слоя управления

Языковой слойLLM разбирает команду, задаёт вопросы, строит план из шагов
Визуально-языковой слойVLM находит объекты на изображении, оценивает сцену, проверяет результат
Слой действийVLA или политика движения переводит шаг плана в траектории рук и ног

Что такое VLA-модель

Vision-Language-Action - модель, которая на вход получает изображение с камер и текстовую инструкцию, а на выход даёт команды приводам. Она обучается на телеоперационных данных: оператор в костюме захвата движений выполняет задачи, робот записывает видео и положения суставов. После десятков тысяч демонстраций модель выполняет похожие задачи сама, включая те, которые не видела в точности.

Именно поэтому производители гуманоидов строят центры сбора данных: AgiBot записывает миллионы эпизодов, Unitree и Noetix открывают платформы для сбора данных исследователями.

Что умеют сегодня

Ограничения

Как это выглядит на конкретных платформах

Unitree H2 поставляется с открытым SDK и вычислителем, на который ставятся собственные модели: университеты запускают на нём VLA-политики и связывают с LLM через ROS 2. AgiBot A3 идёт с экосистемой моделей производителя и датасетами для дообучения. Noetix Bumi - компактная платформа для отработки речевого взаимодействия и простых задач манипуляции в учебных курсах.

Гуманоиды в каталоге

Вопросы и ответы

Нужен ли интернет для работы языковой модели

Зависит от конфигурации. Компактные модели работают на борту, крупные - в облаке или на локальном сервере лаборатории.

Можно ли подключить свою LLM

Да, на платформах с открытым SDK. Стандартная схема: LLM выдаёт план, ROS 2 передаёт шаги контроллеру движения.

Работают ли модели на русском языке

Языковой слой понимает русский, если используется мультиязычная модель. Речевое распознавание настраивается отдельно.

Смотрите также

+7 925 995-49-15 · info@100xbot.ru