Искусственный интеллект · Агенты ИИ · Orchard · Microsoft Research · Обучение с подкреплением · Открытые технологии · Программная инженерия3 августа в 19:31 · 5 мин

Orchard: открытая экосистема для создания масштабируемых агентов искусственного интеллекта

Microsoft Research представила Orchard — открыто-исource-фреймворк, призванный демократизировать исследования в области агентского ИИ. Новая система, основанная на повторно используемой инфраструктуре, позволяет обучать и оценивать автономных агентов для сложных задач, таких как программная инженерия и веб-навигация, без необходимости создания дорогостоящей специализированной среды. Результаты тестов показывают, что модели с меньшим количеством параметров, обученные на этой платформе, могут приближаться к производительности передовых закрытых систем, многократно превосходящих их по объёму вычислительных ресурсов.

# Orchard: открытая экосистема для создания масштабируемых агентов искусственного интеллекта

В мире, где возможности искусственного интеллекта стремительно расширяются от простых ответов на вопросы к полноценной автономности, исследователи сталкиваются с новой проблемой. Создание передовых агентных систем часто требует доступа к проприетарной инфраструктуре, закрытым песочницам и уникальным наборам данных, которые недоступны большинству учёных. Именно для преодоления этого барьера Microsoft Research выпустила Orchard — открытую платформу, которая делает исследования в области агентского ИИ доступными, воспроизводимыми и экономически эффективными.

Архитектура как общий язык: концепция Orchard Env

Центральным элементом новой платформы является Orchard Env — лёгкая, нативная для Kubernetes среда выполнения. Если представить создание агента как строительство здания, то существующие методы часто предлагали возводить уникальный фундамент для каждого нового проекта. Orchard меняет этот подход: среда становится отдельным, повторно используемым сервисом.

Она предоставляет изолированные компоненты для управления задачами, запуска команд и контроля доступа к файлам. Такая архитектура позволяет одной и той же инфраструктуре поддерживать совершенно разные типы агентов: от программного обеспечения для написания кода до помощников, умеющих управлять календарём или искать информацию в интернете. Исследователи могут внедрять новые алгоритмы или метрики оценки, не переписывая базовую систему каждый раз с нуля.

Система разработана так, чтобы работать внутри сложных инструментов развёртывания, называемых «харнессами» (harnesses). Современные агенты редко работают как простые модели; они функционируют в окружениях, таких как Codex или OpenClaw, которые управляют многоступенчатым рассуждением и подключением к внешним системам. Orchard позволяет обучать агентов напрямую внутри этих реальных окружений, устраняя разрыв между тем, как агент учится в симуляции, и тем, как он работает в продакшене.

*«Окружение имеет значение»*, — отмечают авторы исследования. Превращение инфраструктуры в открытый, лёгкий и переносимый ресурс снижает стоимость исследований и ускоряет прогресс в сообществе.

Тестирование в реальном мире: успехи в трёх ключевых направлениях

Разработчики продемонстрировали мощь платформы на трёх конкретных сценариях: программной инженерии (Orchard-SWE), веб-навигации (Orchard-GUI) и продуктивности (Orchard-Claw). В каждом случае акцент сделан на эффективности использования ресурсов.

Программная инженерия

Создание программного обеспечения — одна из самых сложных областей для автономных систем. Агенты должны уметь работать с реальными кодограми, использовать инструменты и исправлять ошибки. Методика Orchard-SWE использует технологию дистилляции данных: из 107 000 взаимодействий двух мощных моделей были извлечены полезные фрагменты, даже если полная задача не была решена. Это значительно расширило объём обучающих данных.

Применение методов обратной связи с плотным вознаграждением (dense rewards), где модель обучается по шагам решения проблемы, а не только по финальному результату, позволило достичь поразительных результатов. Модель Orchard-SWE, состоящая всего из ~3 миллиардов активных параметров, достигла 69,7% успеха на тестовом бенчмарке SWE-bench Verified. С использованием дообучения модели (value-model reranking) показатель вырос до 73%, что ставит её на уровень систем, в десятки раз более крупных.

Веб-навигация и поиск

Задача веб-навигации требует от агента понимания визуального контента и способности последовательно взаимодействовать с веб-интерфейсом. Модель Orchard-GUI, использующая всего 4 миллиарда параметров, показывает высокую эффективность благодаря обучению на реальных веб-страницах.

В таблице ниже представлены результаты модели на различных бенчмарках:

| Бенчмарк | Результат (Orchard-GUI) | --- | --- | | WebVoyager | 74,1% | | Online-Mind2Web | 67,0% | | DeepShop | 64,0% | | Среднее значение | 68,4% |

Эти результаты делают Orchard-GUI одним из самых сильных открытых агентов веб-навигации, сопоставимых с проприетарными решениями от OpenAI и Google. Важно отметить, что обучение потребовало всего 400 демонстраций, дистиллированных из более мощных моделей, в сочетании с 2200 открытыми задачами, что демонстрирует высокую эффективность методики.

Продуктивность и персональный помощник

Одним из самых перспективных направлений является создание личных помощников для управления повседневными делами, такими как написание писем, поиск информации или координация задач между приложениями. Orchard-Claw был обучен на базе 200 синтетических задач, сгенерированных с помощью другой модели.

На бенчмарке Claw-Eval, который оценивает агентов по реалистичным рабочим процессам, модель достигла 59,6% успеха при использовании до трёх попыток. С добавлением более сложной системы ZeroClaw этот показатель вырос до 73,9%.

*Ключевым фактором успеха стала способность обучаться внутри «реальных» оболочек (Codex, ZeroClaw и других). Это позволило модели адаптироваться к нюансам практического применения, что невозможно при обучении на упрощённых симуляциях.*

Будущее агентов: от изоляции к накопленному знанию

Orchard предлагает более чем просто инструмент для обучения; он закладывает основу для новой парадигмы в разработке агентов. Авторы исследования выдвигают гипотезу, что опыт обучения может накапливаться со временем, а не просто исчезать после завершения каждого проекта.

Этот принцип кумулятивного обучения (cumulative agent learning) подразумевает, что траектории обучения предыдущих поколений агентов могут быть «дистиллированы» и переданы следующим. Представьте себе цепочку, где каждый новый агент наследует опыт и знания своих предшественников, становясь всё более совершенным. Такой подход позволит создавать всё более сложные системы без необходимости каждый раз начинать обучение с чистого листа.

Согласно этому видению, будущее может прийти в форме специализированных «супер-агентов» для конкретных сфер, таких как веб-навигация или кодирование, которые обучаются на огромных массивах данных, доступных на платформе Orchard, и становятся незаменимыми помощниками.

Заключение

Orchard представляет собой важный шаг к демократизации искусственного интеллекта. Делая среду, данные и методы обучения открытыми, исследователи ускоряют прогресс в области создания автономных систем, позволяя им решать реальные задачи с минимальными затратами ресурсов. Платформа доказывает, что сложность и масштаб — это не обязательно синонимы производительности, и открывает двери для новых открытий в области агентного ИИ.

Авторы исследования

* Baolin Peng — Principal Research Manager, Microsoft Research * Wenlin Yao — Principal Researcher, Microsoft Research * Qianhui Wu — Senior Researcher, Microsoft Research * Hao Cheng — Principal Researcher, Microsoft Research * Jianfeng Gao — Technical Fellow & Corporate Vice President, Microsoft Research

Первоисточники

Microsoft Research
← Вернуться в эфир