Physical AI · Гуманоидные роботы · AgenticFocus · VLA модели · Обработка видео · MWS · Обучение с подкреплением2 сентября в 11:02 · 4 мин

AgenticFocus: переработка видео от первого лица в данные для обучения гуманоидных роботов

Развитие физически-ориентированного искусственного интеллекта (Physical AI) тормозится нехваткой качественных данных для обучения моделей управления действиями. Команда MWS представила AgenticFocus — пайплайн, способный превращать обычные видеозаписи от первого лица (FPV) в синхронизированные датасеты для гуманоидных роботов, сохраняя геометрию объектов и адаптируя человеческие движения под кинематику машины.

Крупно: стеклянная глазоподобная капсула над холодным приливом. Туман, серебро, камни.

# AgenticFocus: мост между человеческим зрением и моторикой роботов

Развитие Physical AI сегодня упирается в отсутствие достаточного количества размеченных данных. В то время как модели «Зрение-Язык» (VLM) обучаются на огромных массивах текста, модели, требующие понимания мира и действий (VLA и world-action), страдают от голода. Несмотря на обилие открытых видео от первого лица, где человек выполняет бытовые манипуляции, использовать их «как есть» невозможно из-за различий в перспективе и отсутствии привязки к конкретному роботу.

Я — Артём Лыков, руководитель направления Physical AI в MWS. В этой статье описывается методика AgenticFocus: технология, которая берет любое FPV-видео и трансформирует его в полноценный обучающий набор для гуманоидов. Главный принцип — создание видео «смешанной реальности», где фон и объекты исходного кадра сохраняются, но руки человека заменяются виртуальными манипуляторами робота.

*Технический нюанс:* В отличие от простых методов удаления человека, AgenticFocus не просто стирает фигуру из кадра. Он восстанавливает 3D-геометрию объектов, которые были перекрыты руками, и рендерит их заново вместе с виртуальной кистью робота. Это решает проблему потери информации о контакте пальцев с поверхностью.

Проблемы использования сырых видео от первого лица

Использование видеозаписей с человеческого тела для обучения роботов сопряжено с рядом фундаментальных технических препятствий:

1. Несовпадение ракурсов: Камера на голове человека и сенсоры на роботе имеют разные системы координат. Совместить эти данные напрямую крайне сложно. 2. Потеря геометрии: При манипуляциях руки часто перекрывают объекты, особенно в зонах контакта. Существующие алгоритмы удаления людей могут искажать или уничтожать эту критически важную информацию о границах объектов. 3. Отсутствие привязки к железу (Embodiment): Даже синхронизированное видео не гарантирует, что движения соответствуют кинематике конкретного робота. Без согласования с физикой конкретного устройства (механикой суставов, длиной рычагов) обучение политик действия бессмысленно.

Существующие методы обработки либо чрезмерно упрощают движения, либо требуют дорогостоящего оборудования для захвата движений (motion capture).

Как работает пайплайн AgenticFocus

AgenticFocus строит видео «смешанной реальности», разделяя сцену на несколько слоев информации: фон, объекты и кинематику робота. Процесс обработки включает три ключевых этапа:

Восстановление объектов (Object-centric restoration) Метод идентифицирует значимые для задачи объекты по всем кадрам и восстанавливает их эталонные 3D-модели. Это позволяет получить цельную геометрию объекта, даже если в исходном видео он был скрыт рукой человека.

Ретаргетинг кисти (Camera-relative full-hand retargeting) После выделения объектов реконструируется полная траектория движения кисти. Движения переносятся в систему координат камеры, а не базы робота. Человеческие руки заменяются на виртуальные манипуляторы гумоида, максимально похожие на оригинал. Траектории запястья и пальцев сглаживаются для устранения шума, а вносятся фиксированные коррекции ориентации, учитывающие разницу в расположении суставов у робота.

Многослойный композитинг На финальном этапе формируется синхронизированное видео. Исходный фон накладывается с виртуальным роботом и восстановленными объектами с учетом глубины. Робот рендерится раздельно: основной сочлененной рукой и отдельным слоем большого пальца в зоне контакта. Это позволяет создать реалистичное перекрытие пальцами объектов, которое обучит нейросеть правильному захвату.

Результаты оценки точности и плавности

Для проверки эффективности методика была протестирована на видеорядах из публичного датасета EPIC-KITCHENS и внутренних записях. Сравнивались показатели с бенчмарками Masquerade и Do as I Do.

* Точность траекторий: AgenticFocus демонстрирует наименьшую ошибку реконструкции положения среди сравниваемых методов. Использование системы координат камеры и перенос полного движения кисти сокращает пространственное несоответствие. * Плавность движений: Применялась метрика SPARC (Spectral Arc Length), анализированная на частотном составе профиля скорости запястья. Чем ближе значение к нулю, тем плавнее движение. AgenticFocus показал результат –5,18, что优于 (лучше) показателей конкурентов (–5,56 и –6,05). Это означает улучшение плавности движения запястья робота примерно на 7–14% по сравнению с существующими решениями.

Заключение

AgenticFocus представляет собой эффективное решение для снижения порога входа в обучение гуманоидных роботов. Технология позволяет преобразовывать обычные видео от первого лица в данные высокого качества без использования дорогих систем захвата движений. Результатом является датасет, где каждое визуальное наблюдение жестко привязано к действиям и состоянию робота, что критически важно для развития сложных world-action моделей.

Работа была презентована на конференции ISMAR 2026 под названием "AgenticFocus: Object-Preserving Mixed Reality Synthesis from Human FPV Video for Dexterous Humanoid Learning".

Первоисточники

Habr AI
← Вернуться в эфир