Искусственный интеллект · Языковые модели · Автоматизация · Машинное обучение · Архитектура памяти2 октября в 08:02 · 4 мин

Архитектура долговременной памяти: как агенты ИИ учатся экономить токены, сохраняя точность

В разработке автономных языковых агентов, работающих на долгосрочные горизонты, возникает критическая проблема нехватки контекстного окна. Новое исследование, опубликованное на arXiv, предлагает революционный подход к управлению памятью: вместо равномерного распределения ресурсов, система должна использовать математические свойства «тяжелых хвостов» для выделения основной информации, сохраняя редкие, но важные данные в сжатом виде. Авторы демонстрируют, что такой метод не только экономит значительное количество вычислительных ресурсов, но и снижает ошибки прогнозирования в сложных сценариях.

# Тяжелые хвосты в памяти агентов: новый взгляд на оптимизацию контекста

Современные языковые агенты, способные планировать многошаговые действия в виртуальных средах, все чаще зависят от внешних систем памяти. Эти системы функционируют как «замороженные мировые модели», позволяя агенту сохранять состояние мира между отдельными шагами выполнения задач. Однако традиционные подходы к организации такой памяти сталкиваются с фундаментальным ограничением: размер контекстного окна конечен, а стоимость вычисления каждого вставленного токена высока.

Форма использования памяти и проблема концентрации

Исследователи из статьи, озаглавленной *«Heavy-Tailed Memory Traces in Long-Horizon Language Agents»*, утверждают, что ключ к оптимизации кроется не просто в количестве сохраняемой информации, а в самой форме ее распределения. Когда агент повторяет процесс извлечения данных из ограниченного контекста, память естественным образом склонна концентрироваться на небольшом «ядре» наиболее часто используемых фактов. При этом редкие, уникальные состояния отбрасываются в длинный «хвост», где накапливаются ошибки прогноза из-за того, что они либо не хранятся, либо занимают неоправданно много места при попытке полного дублирования.

Авторы провели консервативный аудит распределения памяти и пришли к выводу, что этот эффект воспроизводим, но зависит от политики агента. Агенты, работающие по принципу случайного блуждания, генерируют артефакты извлечения, совместимые с логарифмически нормальным распределением. В то же время, агенты, использующие семантические модели на основе LLM (Large Language Models), демонстрируют наиболее сильные следы, описываемые усеченным степенным законом. Это означает, что большинство важных данных сосредоточено в начале распределения, а редкие случаи имеют меньшую плотность, но существенное влияние на итоговый результат.

*Примечание редактора:* Представьте себе библиотеку, где самые популярные книги стоят на видном месте у входа, а редкие манускрипты аккуратно сложены в подвал. Если вы попытаетесь вынести все книги наружу для инвентаризации, вы перегрузите входную зону и потеряете доступ к часто используемым ресурсам. Новые методы управления памятью стремятся имитировать разумную организацию такой библиотеки.

Core–Tail World Model: алгоритмический прорыв

На основе этих наблюдений команда авторов предложила новую архитектуру, названную Core–Tail World Model (CTWM). Это ранжирующий контроллер памяти, который распределяет бюджет запросов (prompt budget) с использованием единого показателя степени τ (τ), автоматически выделяя основное ядро информации и оставляя хвост в виде сжатой сводки.

В отличие от предыдущих решений, требующих сложных эвристик для выбора того, что запомнить, CTWM использует математическую модель для автоматического определения важности элементов памяти. Это позволяет системе сохранять полное покрытие состояний и переходов в окружении при одновременном резком снижении количества потребляемых токенов.

Результаты экспериментов на реальных платформах

Тестирование модели CTWM было произведено на нескольких стандартных средах для оценки агентов, включая Synthetic Graph World, ALFWorld и LongMemEval.

На платформе Synthetic Graph World новая методика показала впечатляющие результаты по сравнению с базовой моделью памяти на графах. CTWM сохранила полное покрытие состояний и переходов, сократив при этом количество токенов в запросе на 5,9%. Более того, ошибка прогнозирования в нижней половине «хвоста» распределения (то есть в тех сложных и редких ситуациях, где обычно происходят сбои) уменьшилась на 13,6%.

Аналогичные сравнения на других платформах подтвердили устойчивость подхода. На среде ALFWorld были достигнуты стабильные экономии токенов. В случае LongMemEval, где задачи требуют длительного контекста и высокой точности, модель продемонстрировала уменьшение использования токенов на 24,48% при сохранении общей точности выполнения задач на уровне baseline. Эти цифры свидетельствуют о том, что учет структуры «тяжелых хвостов» может стать не только диагностическим инструментом для понимания ограничений конечной памяти, но и практическим сигналом управления для создания более эффективных мировых моделей агентов.

Исследование подчеркивает, что будущее автономных систем лежит не в простом расширении контекстного окна, а в интеллектуальном управлении структурой хранимой информации. Переход от равномерного хранения к адаптивному распределению ресурсов открывает путь к созданию более масштабируемых и экономичных искусственных интеллектов, способных работать в сложных, долгоживущих сценариях без чрезмерного расходования вычислительных ресурсов.

Первоисточники

arXiv cs.AI ↗
← Вернуться в эфир