LLM agents · AI safety · local-first · governance · arXiv17 августа в 21:33 · 4 мин

Агенто: новый стандарт контроля за действиями локальных агентов на базе LLM

Вместо того чтобы полагаться исключительно на доверие к модели, исследователи из arXiv представили «Agentao» — среду выполнения, которая разделяет идеи действий, сгенерированные нейросетью, и их фактическое выполнение. Этот подход призван снизить риски злоупотреблений и улучшить прозрачность процессов в локальных вычислительных средах.

# Агенто: архитектура контроля для локальных агентов

В эпоху, когда модели больших языков (LLM) всё чаще выступают в роли активных агентов, способных вызывать внешние инструменты, изменять состояние системы и взаимодействовать с протоколами, возникает критическая проблема безопасности. Агенты, обладающие такой гибкостью, становятся уязвимыми перед рисками избыточных привилегий, слабых механизмов аудита и инъекций промптов.

В работе, опубликованной на arXiv с номером 2608.13574, авторы предлагают решение, названное Agentao. Это локально-ориентированная среда выполнения (runtime), созданная для того, чтобы обеспечить контроль над действиями агентов, не жертвуя при этом их полезностью. Проект ориентирован на сценарии, где агент работает на устройстве пользователя, и требует максимальной прозрачности и безопасности.

*«Agentao не дает формальных гарантий безопасности, но демонстрирует, как права доступа, состояние и границы протоколов можно превратить в явные абстракции среды выполнения»*, — отмечают авторы. Это сдвиг парадигмы: от попытки «обучить» модель быть аккуратной к строительству жесткой архитектурной рамки, в которой она действует.

Архитектура разделения обязанностей

Ключевая инновация Agentao заключается в четком разделении двух процессов: генерации предложения о действии и самого его выполнения. Модель LLM может предложить «сделать что-то», но окончательное решение о том, что и как делать, принимает хост-система через слой авторизации.

Система построена на многоуровневой архитектуре: 1. Поверхности, ориентированные на хоста: Интерфейсы взаимодействия, контролируемые окружением. 2. Договор хоста (Host Contract): Набор правил, определяющих, какие действия разрешены. 3. Ядро среды выполнения (Runtime Core): Механизм, обеспечивающий работу агента в соответствии с правилами. 4. Система инструментов с медиацией прав: Инструменты доступны агенту только после проверки соответствия требованиям безопасности.

Такой подход минимизирует возможность «подставания» (tool poisoning) или выполнения вредоносных инструкций, так как модель никогда не получает прямого доступа к критическим ресурсам без проверки хост-системой.

Как работают инструменты и память

Для сложных задач агентам часто требуется использовать память и специальные навыки (skills). Agentao предоставляет подсистемы для управления памятью и воспроизведения действий (replay). Это позволяет не только сохранять историю действий, но и проверять их в случае возникновения проблем, создавая надежный механизм аудита.

Подсистема также поддерживает интеграцию с внешними протоколами и суб-агентами, но делает это в рамках строгой политики безопасности. Каждое взаимодействие с внешним миром проходит через фильтры, предотвращающие неконтролируемые побочные эффекты.

Модели угроз и управление рисками

Авторы исследования детально проработали модель угроз, с которой должна справляться система. Основными рисками, которые рассматривались при разработке Agentao, являются: * Избыточные привилегии: Когда модель имеет больше прав, чем необходимо для конкретной задачи. * Слабая аудируемость: Невозможность точно отследить, что именно вызвало то или иное действие. * Инъекции промптов: Попытки обмана модели через изменение входных данных. * Отравление инструментов: Внесение изменений в логику работы инструментов до их использования.

Agentao решает эти проблемы за счет создания явных абстракций для управления правами доступа. Вместо того чтобы полагаться на интуитивное поведение модели, система заставляет каждое действие проходить через заранее определенную структуру. Это делает агентов более управляемыми и пригодными для развертывания в окружениях, контролируемых человеком.

*«Мы проводим тестирование и анализ этого фреймворка, и ожидаемые экспериментальные результаты появятся в будущих версиях»*, — пишут разработчики в сопроводительном сообщении. Это указывает на то, что проект находится в стадии активного развития и проверки.

Заключение

Agentao представляет собой важный шаг вперед в области безопасности агентных систем на базе больших языковых моделей. Вместо абстрактных обещаний безопасности система предлагает конкретную инженерную реализацию, где контроль распределен между моделью и хост-средой.

Код проекта уже доступен в открытом доступе на GitHub, что позволяет сообществу исследователей и разработчиков изучать его, предлагать улучшения и интегрировать в свои собственные решения. Для тех, кто работает с автономными агентами, эта технология может стать фундаментом для создания более надежных и предсказуемых систем.

Таким образом, Agentao демонстрирует, что баланс между автономностью ИИ и человеческим контролем достижим через правильную архитектуру, а не только через обучение моделей.

Первоисточники

arXiv cs.AI
← Вернуться в эфир