искусственный интеллект · большие языковые модели · агенты · архитектура · планирование действий · инструменты · appworld5 августа в 11:01 · 4 мин

HyperAgent: новая стратегия планирования действий для агентств на базе больших языковых моделей

В стремлении больших языковых моделей (LLM) выполнять сложные реальные задачи через использование внешних инструментов, исследователи столкнулись с проблемой ненадежного планирования. Новая работа, опубликованная на arXiv, предлагает решение в виде гиперграфов схем инструментов, позволяющих агентам динамически подстраивать свои действия и сокращать количество бессмысленных запросов к API.

# HyperAgent: Планирование и действие над гиперграфами схем инструментов

Развитие интеллектуальных агентов, управляемых большими языковыми моделями (LLM), столкнулось с критической проблемой: способность надежно использовать внешние инструменты для выполнения задач в реальном мире. Традиционные подходы, полагаясь на неявные рассуждения модели, часто приводят к неэффективному поиску решений и ошибкам исполнения. Исследователи из группы авторов во главе с Цянем Цзай (Zian Zhai) предлагают архитектурное решение, переносающее фокус с текста на структуру данных.

В новой статье, размещенной на платформе arXiv под идентификатором 2608.02650, представлена концепция HyperAgent — фреймворка, использующего направленные гиперграфы схем инструментов для динамического планирования и выполнения операций.

От текста к структуре: Гиперграфы как основа логики

Основная трудность существующих агентов заключается в том, что они часто полагаются на текстовое описание инструментов для вывода, какой набор инструментов следует использовать. Это создает ситуацию, когда агент тратит ресурсы на перебор вариантов, которые не работают, или не понимает взаимосвязей между входными и выходными данными разных утилит. Новый метод решает эту проблему, смещая акцент на уровень схем (schema-level).

Центральным элементом предложенной архитектуры является Tool--Schema Hypergraph (Гиперграф схем инструментов). В этой модели инструменты представляются не просто как отдельные сущности, а как гиперребра (hyperedges). Каждое такое ребро соединяет узлы требуемых входных схем с узлами выходных схем. Такой подход позволяет формализовать зависимости между инструментами, создавая карту, где каждый путь демонстрирует, как данные преобразуются от одной стадии к другой.

По словам авторов, это позволяет перейти от хаотичного поиска решений к структурированному навигации. Вместо того чтобы просить модель «думать» о том, какой инструмент использовать следующим, HyperAgent строит вычислительный граф, где логический переход уже предопределен связями между типами данных.

Динамическое планирование через DAG и дефицит

Работа HyperAgent состоит из двух ключевых этапов: предварительного контекста и динамического выполнения.

1. Экстракция контекста: При постановке задачи агент сначала анализирует доступный инструментарий и выделяет подграф, релевантный для конкретной цели. На основе этого контекста строится ориентированный ациклический граф задач (Task DAG), который учитывает специфику схем данных. Этот граф служит дорожной картой для выполнения. 2. Дефицит-ориентированное расширение: Во время фактического исполнения задач агент не просто следует по плану, но и адаптируется к текущему состоянию. Метод, называемый «дефицит-ориентированным расширением» (deficit-oriented expansion), работает следующим образом: система выявляет нерешенные требования (дефицит данных или действий) и, ориентируясь на текущее состояние агента, извлекает поддерживающие инструменты-производители.

Этот процесс описывается через построение графа поддержки инструментов, зависимого от состояния. Такой механизм гарантирует, что каждое подзадание реализуется только тогда, когда условия для его выполнения выполнены и необходимые входы собраны.

Экспериментальные результаты в среде AppWorld

Для проверки эффективности предложенного фреймворка исследователи провели эксперименты в симулированной среде AppWorld, которая моделирует сложные реальные сценарии использования приложений.

Результаты сравнения с существующими базовыми линиями (baselines) показали явное преимущество новой архитектуры: * Увеличение завершаемости задач: Агент HyperAgent демонстрирует более высокую способность доводить сложные цепочки действий до успешного конца. * Снижение избыточности: Количество бессмысленных вызовов API уменьшилось, как и количество взаимодействий с большой языковой моделью. * Экономия токенов: Благодаря более точному планированию, общее потребление токенов сократилось, что делает процесс более рентабельным.

Эти метрики подтверждают, что формализация зависимостей инструментов на уровне схем позволяет значительно оптимизировать работу агентов, делая их более предсказуемыми и эффективными в динамических условиях.

*Примечание редактора* > Стоит отметить, что данная работа находится на стадии препринта и описывает концептуальную валидацию метода. Переход от теории графов к стабильным промышленным агентам потребует дополнительной адаптации к конкретным бизнес-средам, где «схемы» инструментов могут меняться быстрее, чем обновляется сама архитектура планирования.

Заключение

Работа над проектом HyperAgent демонстрирует важный тренд в развитии ИИ-агентов: движение от полного доверия к «черному ящику» нейросети к созданию прозрачных, структурно обоснованных систем принятия решений. Хотя проблема надежности использования инструментов остается открытой в полной мере, переход на уровень схем данных предлагает новый вектор для создания агентов, способных автономно решать сложные задачи с минимальными ошибками и затратами ресурсов.

Первоисточники

arXiv cs.AI
← Вернуться в эфир