AutoMem: Как алгоритмы научились самостоятельно проектировать архитектуру долговременной памяти для ИИ
Долгое время дизайн систем памяти для крупных языковых моделей (LLM) оставался сложной задачей, требующей ручного подбора компонентов под каждую новую задачу. Новый фреймворк AutoMem, представленный на arXiv, меняет парадигму, предлагая систему автономого поиска архитектур. Используя текстовые градиенты и анализ собственных неудач, алгоритм способен создавать конфигурации памяти, превосходящие лучшие решения, разработанные людьми, с приростом точности до 2,8% на различных бенчмарках.

# AutoMem: Автономный поиск архитектуры памяти для ИИ-агентов
Долгосрочная память становится все более критической для развития автономности агентов на основе больших языковых моделей. Однако процесс проектирования этой памяти остается крайне непростой архитектурной проблемой. Исследователи сталкиваются с необходимостью выбора того, что именно кодировать, как хранить данные, какие механизмы retrieval (поиска) использовать и как управлять состоянием памяти. Эти параметры сильно варьируются в зависимости от конкретной задачи и используемой базовой модели.
Новый подход, представленный в исследовании «AutoMem: A Text-Gradient Recursive Self-Improvement Framework for Automated Memory Architectures Search», предлагает решение этой проблемы через автоматизированный поиск. Вместо того чтобы полагаться на интуицию разработчиков, система использует текстовые градиенты для рекурсивного самоусовершенствования, адаптируя архитектуру памяти под конкретные требования задач.
Почему единой архитектуры не существует
В ходе изучения пространства возможных решений исследователи сконструировали дискретное пространство поиска, включающее 5 типов энкодеров (кодировщиков), 5 хранилищ, 6 ретриEVERов (механизмов поиска) и 4 менеджеров. Результаты эксперимента показали, что ни одна конфигурация не доминирует над всеми остальными в любых условиях.
Это означает, что для задач, требующих глубокого логического анализа, может быть оптимальна одна связка модулей, тогда как для задач, связанных с навигацией по вебу, эффективнее другая комбинация. Отказ от поиска универсального решения привел к открытию значительных разрывов в эффективности между различными архитектурами на разных типах задач. Именно эта нестабильность и стала мотивацией для создания AutoMem.
Механизм работы: опыт и диагностика
Сердцем предложенного фреймворка является двукомпонентная система оптимизации факторизованного пространства:
1. Experience-Guided Architecture Search (Поиск архитектуры, ориентированный на опыт). Этот модуль анализирует исторические траектории предыдущих поисков и накапливаемые размышления системы. На основе этого опыта он формирует кандидатов для новых архитектур, избегая тупиков, в которых система застревала ранее. 2. Failure-Guided Module Diagnosis (Диагностика модулей, ориентированная на неудачи). Когда система совершает ошибку, этот модуль локализует причину в конкретном компоненте памяти. Вместо простого сообщения об ошибке, она генерирует целенаправленную текстовую обратную связь, указывая, как именно нужно изменить этот модуль, чтобы избежать повторения ошибки.
Этот процесс позволяет системе учиться на своих ошибках так же эффективно, как и на успехах, постепенно улучшая свой «интеллект» в части компоновки систем памяти.
Результаты: точность и эффективность
Тестирование проводилось на трех различных бенчмарках: GAIA (оценка общих возможностей агентов), WebWalkerQA (вопросы по веб-страницам) и xBench-DeepSearch (глубокий поиск). Эксперименты проводились с использованием двух различных базовых моделей (backbones).
Ключевые выводы исследования: * AutoMem последовательно обнаруживает архитектуры памяти, которые превосходят самые сильные человеческие бейзлайны (исходные решения, созданные людьми). * В среднем по шести настройкам бенчмарков и базовых моделей точность выросла на 2,8%. * Достигнут favorable accuracy-efficiency trade-off (благоприятный компромисс между точностью и эффективностью). При использовании модели Qwen3.5-122B-A10B стоимость токенов (вычислительные затраты) снизилась на 14,3% по сравнению с самыми точными базовыми архитектурами.
Важно отметить, что система находила более сильные архитектуры, чем это могли бы сделать substantially larger random searches (значительно более масштабные случайные поиски), используя лишь несколько итераций направленного поиска. Это свидетельствует о высокой эффективности метода.
Простое объяснение терминов
* Backbone Model (Базовая модель): Это основная нейросеть, на которую «надевается» система памяти. В данном контексте это могут быть разные версии моделей, таких как Llama или Qwen. Одна и та же система памяти может работать по-разному в зависимости от того, на каком мозгу (backbone) она установлена. * Encoder (Энкодер): Модуль, отвечающий за то, как информация преобразуется в форму, которую можно хранить в памяти. Представьте его как переводчика, который решает, какие детали события важны, а какие можно игнорировать. * Retriever (Ретривер): Механизм поиска. Когда агенту нужно решить задачу, он не помнит всё сразу, поэтому он использует ретривер, чтобы найти в хранилище наиболее релевантную ранее полученную информацию. * Текстовый градиент: В отличие от классических математических градиентов, которые используются для настройки весов внутри нейросети, здесь используется текстовый формат для передачи информации о том, как улучшить архитектуру. Система «говорит» себе, какие модули работают плохо, и какие изменения в их связке требуются, используя человеческоеподобный язык инструкций.
Заключение
Развитие агентов искусственного интеллекта все больше зависит от их способности запоминать и извлекать информацию. Исследование AutoMem демонстрирует, что дизайн этой памяти может быть делегирован самим алгоритмам, которые способны к рефлексии и адаптации. Полученные результаты подтверждают, что автоматизированный поиск может не только упростить процесс разработки, но и достичь уровня эффективности, превосходящего человеческий опыт в этой специфической области. Хотя технология еще находится на стадии предварительных публикаций в arXiv, её потенциал для создания более эффективных и дешевых ИИ-агентов выглядит значимым.
*Как всегда в мире исследований, стоит помнить, что результаты опубликованы на стадии preprint (предварительной версии) и могут быть уточнены после полного рецензирования и выхода в финальных версиях статей.*