ИИ · мультимодальные системы · персонализация · архитектура нейросетей · архив arXiv1 сентября в 08:02 · 4 мин

Параметрическая мультимодальная память: Сохранение того, что не могут передать подписи

Персонализированные агенты искусственного интеллекта традиционно полагаются на текстовые транскрипции и подписи для создания профиля пользователя. Однако новые исследования показывают, что этот подход игнорирует критически важные перцептивные данные: тембр голоса, выражение лица при разных условиях освещения или усталость. Авторы научной статьи предлагают архитектуру, разделяющую хранение фактов и параметров личности, что позволяет системе помнить не только сказанное, но и то, кем является пользователь.

Стеклянно-ледяная спираль в форме профиля человека на скалистом берегу ночного моря

# Сохранение того, что не могут передать подписи

В современном ландшафте искусственного интеллекта персонализированные агенты становятся всё более распространённым явлением. Их ключевой функцией является построение непрерывной модели пользователя — своего рода цифрового профиля, который позволяет ИИ адаптировать свои ответы под конкретного человека. На сегодняшний день доминирующим подходом является использование текстовых данных: транскрипции диалогов, заголовки чатов и подписи, извлекаемые по принципу сходства.

Этот метод эффективно охватывает "текстовую половину" человеческой личности — факты вроде «у меня есть кошка по имени Биб» или «я работаю в IT». Однако он принципиально не способен сохранить «перцептивную половину»: как именно звучит голос человека, как меняется выражение его лица в зависимости от освещения или возраста, как его усталость отражается на интонации.

Разрыв между подписью и восприятием

Авторы исследования, опубликованного на arXiv под названием «Parametric Multimodal User Memory: Storing What Captions Cannot Carry», провели масштабную оценку этого пробела. Они сравнили способность стандартных текстовых идентификаторов восстанавливать информацию с использованием специализированных энкодеров (кодировщиков), настроенных на обработку мультимодальных сигналов.

Результаты оказались ошеломляюще скромными. Система, основанная исключительно на текстовых описаниях (caption-based re-identifier), смогла восстановить лишь 0,11 от того количества информации, которое смог бы извлечь специализированный энкодер. В ситуациях, где речь шла о сигналах, которые невозможно описать словами, точность текстового метода практически полностью стремилась к уровню случайного догадывания.

Проблема заключается в природе текстовых данных. Текст фиксирует смысл, но теряет контекстуальные нюансы, такие как мимика или акустический оттенок, которые часто являются определяющими для восприятия личности собеседника.

Архитектура гибридной памяти

Для решения этой проблемы исследователи предложили новую архитектурную схему, которая закладывает перцептивную память непосредственно в модель. Ключевая идея заключается в декомпозиции задачи воспоминания на два независимых подзадач:

1. Определение референта (кто и где): Здесь используется модель типа Vision-Language Model (VLM). Её задача — заземлить объект внимания в контексте, отвечая на вопросы «что это?» и «где это происходит». Это связывает абстрактный перцептивный признак с конкретной ситуацией. 2. Экстракция ключа идентичности (кто): Специализированный энкодер извлекает уникальный ключ, описывающий личность пользователя. Этот ключ хранится в виде одного inline-токена (встроенного токена), который считывается механизмом внимания модели в момент генерации ответа.

Важнейшим преимуществом данного подхода является отсутствие необходимости в дополнительных внешних циклах обратной связи. Токен идентичности уже присутствует внутри системы и используется напрямую.

Однако ни один из компонентов не работает изолированно эффективно. Исследования показали, что VLM с трудом распознаёт лица человека в разные периоды жизни (точность — 0,54), в то время как специализированный кодировщик лиц достигает 0,81. Аналогично, не заземлённый кодировщик практически не может идентифицировать объект в сцене с двумя персонажами (точность 0,05).

Только объединение этих двух подходов позволяет достичь точности уровня идеального oracle (оракла) — 0,96, особенно в задачах с распознаванием речи нескольких человек и видеоаналитикой.

Параметрическая природа и практическая реализация

Сердцем этой системы является механизм, не требующий переобучения. Это означает, что система способна воспроизвести точность оригинального кодировщика на любой «замороженной» модели (frozen model) с минимальными затратами регистрации сложности O(1). Это критически важно для масштабируемости, так как позволяет внедрять новую память без длительных и ресурсоёмких процессов дообучения всей нейросети.

В ходе тестирования на бенчмарке PerceptMem, который охватывает 12 доменов и 1 080 задач, исследователи пришли к важному выводу о различии в типе памяти: * Перцептивная идентичность обладает ограничением по ёмкости (capacity-limited). Это означает, что система может запомнить лишь конечное количество вариаций внешности или голоса, поэтому такие данные идеально ложатся в параметрический банк. * Точные факты обладают ограничением по связыванию (binding-limited). Они требуют хранения конкретных деталей и лучше подходят для обычных текстовых хранилищ.

Таким образом, идеальная архитектура персонализированного агента представляет собой симбиоз двух типов памяти: текст хранит историю событий, а параметрический банк сохраняет «сущность» пользователя. Агенты с такой двойной памятью способны помнить не только сказанные пользователем слова, но и то, каким человеком он является. Это приближает ИИ к настоящему пониманию контекста человеческой жизни, выходя далеко за рамки сухой обработки транскрипций.

Первоисточники

arXiv cs.CL
← Вернуться в эфир