Эховерс: как Microsoft научила ИИ-агентов работать в реалистичных, эволюционирующих средах
Команда Microsoft Research представила Echoverse — систему глубоких, эволюционирующих сред для обучения компьютерных агентов. В отличие от простых наборов задач, Echoverse строит полноценные симуляции приложений с реальной логикой состояния, что позволило модели размером в 9 миллиардов параметров почти вдвое улучшить свои показатели и приблизиться к результатам GPT-5.4.
# Echoverse: Глубокое обучение агентов через эволюционирующие среды
Разработка компьютерных агентов (computer-use agents), способных автономно выполнять сложные многошаговые задачи — от написания писем до поддержки клиентов — сталкивается с фундаментальной проблемой: нехватка данных для обучения.
"Сегодня мы видим огромный разрыв между задачами в бенчмарках и реальными приложениями в интернете, — объясняет руководитель исследования Кевин Ву (Kevin Wu). — Если бенчмарк требует всего четыре действия, то в реальных приложениях процесс может занять десятки. Мы не можем просто копировать весь веб, потому что он постоянно меняется и содержит огромное количество шума."
Команда Microsoft Research в сотрудничестве с Microsoft Open AI и Microsoft GitHub создала Echoverse — систему, которая генерирует глубокие, эволюционирующие среды для обучения агентов. Эти среды не просто имитируют интерфейс приложения, но и полностью воспроизводят его логику работы, включая состояние базы данных и историю действий. Это позволяет агентам учиться на реалистичных, долгосрочных задачах, где результат зависит от последовательности действий, а не от единичного клика.
Ключевая инновация: Глубина, а не ширина
Основная идея Echoverse — сместить фокус с количества данных на их качество и глубину. В отличие от традиционных подходов, которые создают множество изолированных, простых задач, Echoverse фокусируется на полных рабочих процессах (workflows).
* Исследование: Эксперименты показали, что обучение на глубоких задачах (глубокие мировые среды) значительно эффективнее, чем на простых. Модели, обученные на глубоких средах, демонстрируют лучшее переносимое умение решать задачи в новых, сложных приложениях. * Причина: Глубокие задачи заставляют агентов учитывать зависимости между шагами и долгосрочные последствия своих действий. Это формирует более устойчивые паттерны мышления, которые можно перенести на реальные приложения, где задачи часто многоэтапны.
Архитектура Echoverse
Система состоит из двух ключевых компонентов:
1. Фабрика сред (World Factory) Это процесс генерации реалистичных приложений для обучения агентов.
* Семантические спецификации: Вместо использования шаблонов UI, Echoverse начинается с описания семантического состояния приложения (например, "пользователь имеет заказ", "заказ содержит товары", "сумма заказа равна X"). * Генерация кода: На основе этих спецификаций система автоматически генерирует полноценное приложение с React-интерфейсом, FastAPI-бэкендом и SQLite-базой данных. * Валидация: Система проверяет сгенерированный код на соответствие спецификации. Если есть несоответствия, приложение автоматически исправляется, пока не будет полностью соответствовать заданным правилам. Это гарантирует, что среда работает корректно и предсказуемо.
2. Генерация и валидация задач После создания среды система генерирует задачи для обучения.
* Грунтовка на реальных данных: Задачи создаются на основе реальных данных из базы данных приложения (например, реальные имена пользователей, реальные товары), а не на основе случайных шаблонов. * Многоуровневая валидация: Каждая задача проходит через панель аналитиков и специализированных агентов-исправителей. Это гарантирует, что задача: * Опирается на реальные сущности (реальные пользователи, реальные товары). * Имеет реалистичную сложность. * Может быть выполнена агентом в реальном интерфейсе. * Гибридная верификация: Ответ на задачу проверяется двумя способами: * Сравнение с базой данных: Изменяется ли состояние базы данных ожидаемым образом? * Сравнение с текстовым ответом: Совпадает ли вывод агента с ожидаемым текстовым ответом?
Типы сред в Echoverse
Echoverse включает два типа сред, каждый из которых служит определенной цели:
Полноценные доменные среды (Full Domain Worlds) Это симуляции реальных приложений, таких как системы бронирования отелей, финансовые платформы или системы поддержки клиентов.
* Примеры: 10 различных сред, включая системы бронирования (EchoStay), финансовые транзакции (EchoBank), поддержку (EchoSupport) и другие. * Сложность: Эти среды имитируют сложные, многоэтапные рабочие процессы с взаимозависимыми данными (например, бронирование отеля включает поиск, фильтрацию, выбор даты, оплату и подтверждение). * Цель: Обучать агентов решать задачи, требующие понимания долгосрочных последствий и последовательности действий.
Среды отдельных навыков (Capability Worlds) Эти среды фокусируются на обучении конкретных навыков, таких как работа с датами, фильтрация и поиск.
* Примеры: Среда для работы с датами (date picker), среда для вложенных фильтров (nested filters). * Сложность: Эти среды генерируют тысячи вариаций одного и того же типа интерфейса (например, разные виды календарей, разные комбинации фильтров), чтобы научить агентов обобщать свои знания. * Цель: Обучать агентов решать задачи, которые требуют работы с конкретными типами интерфейсных элементов.
Результаты и применение
* Улучшение моделей: Модель размером в 9 миллиардов параметров (GPT-5.4), обученная на Echoverse, продемонстрировала значительное улучшение в решении задач использования компьютера по сравнению с предыдущими моделями. * Переносимость: Модели, обученные на глубоких средах, лучше переносят свои знания на новые, незнакомые приложения, что критически важно для реального применения. * Будущее: Echoverse открывает возможности для создания более умных и автономных агентов, способных решать сложные задачи в реальных приложениях, от управления финансами до технической поддержки.
Заключение
Echoverse представляет собой важный шаг вперед в области обучения компьютерных агентов. Смещая фокус на глубину данных и реалистичность сред, команда Microsoft создала платформу, которая не только улучшает производительность агентов, но и подготавливает их к решению реальных задач в сложных, динамичных средах. Это исследование демонстрирует, что для создания truly умных агентов недостаточно просто увеличить объем данных; необходимо создавать среды, которые точно отражают сложность реального мира.