искусственный интеллект · большие языковые модели · knowledge distillation · архитектура нейросетей · арXiv1 сентября в 01:31 · 3 мин

Перенос памяти между нейросетями: когда внешний хранилище данных становится переносимым активом

Ученые изобрели новый метод кросс-модельного переноса памяти, позволяющий извлекать знания, обученные одной нейросетью, и использовать их в другой модели. Исследование показывает, что ключевым фактором успеха является не просто сама таблица памяти, а способность целевой модели корректно «читать» эти данные через адаптированный интерфейс.

Прозрачная капсула памяти из морского стекла парит в тумане над волнами причала Тихой бухты.

# Перенос памяти между нейросетями: когда внешний хранилище данных становится переносимым активом

В современном мире больших языковых моделей (LLM) вопрос эффективного использования знаний остается центральным. Традиционно существуют два основных подхода: параметрическая адаптация и непараметрическая检索. Первый вид встраивает информацию напрямую в весовую матрицу модели, делая её инференс быстрым, но затрудняя обновление и аудит знаний. Второй вариант позволяет гибко обращаться к внешним источникам, но вносит задержки и требует значительного количества контекста на вход.

Между этими крайностями исследователи из области компьютерных наук предложили подход, основанный на так называемом «энграммном» хэш-памяти. Этот метод хранит выученную информацию во внешней адресной таблице, которая потребляется небольшой обученной моделью-читателем. Новая работа, опубликованная в arXiv (статья 2608.17050), ставит перед собой фундаментальный вопрос: если переместить такую заморозленную память от одной архитектуры модели к другой, что важнее — сама таблица данных или механизм её чтения?

Дилемма переноса: весы баланса

Исследование фокусируется на кросс-модельном извлечении замороженной памяти. В рамках этого процесса таблица памяти, обученная на исходной модели (source model), замораживается и подключается к целевой модели (target model). При этом единственной частью, которая подвергается обучению заново, является небольшой модуль-читатель.

Абстракция исследования указывает на то, что обе сущности — и содержание памяти, и правильное адресование данных — имеют значение. Однако критически важным фактором оказывается то, насколько адаптер (reader), разработанный для целевой модели, способен эффективно взаимодействовать с перенесенной таблицей. Без правильной настройки читателя перенесенные данные остаются недоступными для глубокого понимания новой архитектурой, независимо от качества самой информации, записанной в табличную структуру.

Архитектура решения: роль адаптера

Результаты экспериментов подтверждают гипотезу о доминирующей роли интерфейса чтения. Исследователи разработали двухслойный читатель с четырьмя ветвями обработки. Использование такой архитектуры в задачах на генерацию ответов позволило практически полностью нивелировать разрыв между сценарием повторного использования памяти внутри одной модели и переносом памяти между разными моделями. Под строгим протоколом оценки средний показатель качества достиг 38.8 баллов.

Интересен и другой сценарий: когда интерфейс читателя от поставщика данных изначально совместим с целевым API, замороженный артефакт может приносить существенную пользу без необходимости дообучения компонентов целевой модели. Однако исследование отмечает, что опциональная адаптация читателя по запросу целевой модели способна дать дополнительное улучшение показателей точности. Это свидетельствует о том, что Engram может служить универсальным переносимым артефактом внешних знаний, при условии наличия у целевой системы доступа к совместимому интерфейсу чтения.

Значение для индустрии

Эти выводы имеют практическое значение для разработки систем искусственного интеллекта. Они предлагают путь к созданию модульных нейросетей, где базы знаний не привязаны жестко к весам конкретной архитектуры, а могут перетекать между разными моделями, адаптируясь к их потребностям. Такой подход снижает затраты на хранение и обучение, позволяя использовать проверенные наборы знаний в различных контекстах. Главное условие здесь — наличие универсального и гибкого механизма интерпретации внешней памяти, который становится главным регулятором эффективности переноса.

Первоисточники

arXiv cs.CL
← Вернуться в эфир