Искусственный интеллект · Физический ИИ · Робототехника · Sber Robotics · Green Challenge 2026 · VLA-модели · Physical AI28 сентября в 16:33 · 5 мин

Сбер запускает конкурс Physical AI для управления антропоморфным роботом «Грин»

Sber Robotics объявляет о начале Green Challenge 2026 — соревнования по разработке моделей Physical AI для робота «Грин». Участники смогут протестировать алгоритмы управления в симуляторе на задачах мобильной манипуляции, где ключевым вызовом является устойчивость системы к отклонениям от идеальных траекторий и координация движений всего тела.

# Green Challenge 2026: новый вызов для физического ИИ от Sber Robotics

Управление роботизированными системами, способными понимать текстовые инструкции и визуальные данные, перешло из фазы экспериментов в этап активного развития. Модели класса Vision-Language-Action (VLA) уже демонстрируют результаты на простых задачах с фиксированными манипуляторами. Однако следующий шаг в робототехнике требует принципиально иного подхода: необходимо научить машину управлять целым телом — антропоморфным роботом.

Сбер представляет новый масштабный конкурс Green Challenge 2026, который станет частью программы AI Journey 2026. Его цель — создать или дообучить систему управления для робота «Грин» — первого антропоморфного робота компании. Задача здесь сложнее простого захвата предмета: алгоритм должен координировать движения 41 степени свободы, включая ноги и корпус, сохраняя баланс при выполнении бытовых действий.

Сложность задачи: управление всем телом

В отличие от стандартных робототехнических платформ с одной манипуляцией, антропоморфный робот представляет собой динамическую систему. Управление «Грином» требует согласованности между мобильной платформой, двуногой ходьбой и работой рук.

Для участия в конкурсе разработчикам предстоит создать модель, которая принимает на вход: * Визуальные данные: RGB-изображения с трех камер (в голове и на запястьях). * Текстовые команды: полные инструкции сценария и текущие подзадачи. * Проприоцептивное состояние: данные о текущем положении всех суставов и ориентации корпуса.

На выходе модель должна предсказать целевые значения углов для каждого из 51 параметра состояния робота. Эти команды затем исполняет Whole-Body Controller (WBC) — низкоуровневый контроллер, отвечающий за реальный привод. Ошибка на любом этапе — от неверного шага до срыва предмета — может привести к падению робота и провалу всего сценария.

Что такое Out-of-Distribution (OOD)?

Главный технический вызов конкурса называется устойчивостью к состояниям вне обучающего распределения, или OOD. Если обучить модель только на записях успешных действий, она не сможет справляться с реальными ошибками.

На практике робот редко действует идеально. Из-за неточностей симуляции, накопления ошибок движения или незначительного смещения объекта фактическое состояние системы может сильно отличаться от того, на котором модель была обучена. Система должна уметь не просто повторять заложенные траектории, но и адаптироваться в реальном времени, восстанавливая равновесие и корректируя действия.

Наборы данных и инструменты

Сбер предоставляет участникам полноценный стек для разработки, включая симулятор на базе NVIDIA Isaac Sim и открытую базовую модель Green-VLA объемом 1,3 млрд параметров.

Объем обучающей выборки внушителен. В базе GreenChallengeData содержится более 24 тысяч эпизодов, общим временем около 140,5 часов. Данные имеют три источника происхождения:

1. Скриптовые демонстрации:约占 71% по времени. Генерируются автоматическими политиками, которые разбивают задачу на логические этапы (ходьба к объекту, захват, перенос). Это обеспечивает разнообразие начальных положений, но охватывает преимущественно успешные стратегии. 2. Синтетическое расширение (Mimic): Генерирует новые траектории на основе скриптовых данных, увеличивая объем выборки. 3. Телеоперация: Записи с ручным управлением реальным роботом (около 2,7 часа), представляющие наиболее «человечные» и разнообразные сценарии.

Структура данных

Кроме видео и данных о суставах, набор включает метаданные о подзадачах и сегментацию эпизодов. Это позволяет исследовать, как изменение пропорций разных типов данных влияет на качество обучения модели. Участникам также предоставляются инструменты для анализа данных в формате LeRobot v2.1 и примеры кода для запуска инференса.

Архитектура и сценарии

В основе конкурса лежит модель Green-VLA, построенная на базе мультимодального бэкбона Qwen3.5-0.8B. Она использует метод flow matching для генерации траекторий движения. Инференс работает в замкнутом контуре: модель обновляет прогноз каждые 80 миллисекунд, получая от симулятора актуальные наблюдения.

Соревнование проходит в трех доменах: * «Сбер Шоп»: Робот взаимодействует с упаковкой, сдвигает коробки и возвращает их на место. * «Даркстор»: Задача по сортировке и размещению предметов (например, банок) в ограниченном пространстве. * «Кухня»: Сценарии, связанные с бытовыми манипуляциями.

Валидация сценариев длится от 35 до 70 секунд. Успех оценивается не только по количеству выполненных действий, но и по устойчивости системы к помехам.

Сравнение с другими бенчмарками

Green Challenge выделяется на фоне существующих соревнований, таких как HumanoidBench или BEHAVIOR Challenge, сочетанием нескольких факторов: * Использование антропоморфной платформы с управлением всем телом. * Наличие многопалых кистей с детализированным управлением. * Смешанный набор данных, включающий скрипты, синтез и реальные записи. * Интеграция с низкоуровневым контроллером WBC.

Пока что конкурсные сценарии фокусируются на задачах у рабочего места, но архитектура допускает расширение функционала в будущем.

Философия открытой разработки

Для участников доступны не только модели и сценарии, но и полная открытость архитектуры. Код симулятора GreenSim, ассеты для сцен и веса базовой модели опубликованы в публичных репозиториях. Это позволяет исследователям не просто соревноваться, но и развивать направления Physical AI, изучая влияние архитектуры сети и состава данных на качество управления сложными динамическими системами.

Конкурс подчеркивает переход от статичных манипуляторов к мобильным роботам, способным воспринимать мир через зрение и текст, принимать решения и безопасно действовать в неструктурированной среде.

Первоисточники

Habr AI ↗
← Вернуться в эфир