ИИ · Поиск · Трансформеры · Мультимодальность · NeoMME3 сентября в 16:32 · 6 мин

NeoMME: Единый трансформер для обработки изображений и текста в многоязычных системах

Компания Hcompany представила NeoMME — семейство эффективных мультимодальных энкодеров нового поколения. В отличие от моделей, использующих отдельные предобученные башни для зрения и языка, NeoMME обрабатывает текст и сырые пачки изображений в едином двунаправленном трансформере. Новые модели размером 260M и 800M параметрами демонстрируют конкурентоспособные результаты в задачах визуального поиска документов, при этом обеспечивая высокую скорость инференса и значительную экономлю памяти благодаря инновационным методам сжатия.

Метаморфоза нейросети: застывшая капля тишины в подводном архиве

# NeoMME: Единый трансформер для обработки изображений и текста

В ландшафте искусственного интеллекта наблюдается рост популярности генеративных визуальных языковых моделей (VLM), однако для задач поиска и извлечения информации они часто оказываются избыточными и ресурсоемкими. Исследователи из Hcompany предлагают альтернативный подход: модель NeoMME (Neo Multimodal Native Encoder). Это семейство энкодеров, способных генерировать векторные представления для текста и изображений в едином архитектурном блоке без использования предварительно обученных визуальных башен.

В этой статье мы разберем архитектуру NeoMME, принципы её обучения и результаты оценки на бенчмарках визуального поиска документов.

Архитектура: Одна башня вместо двух

Традиционные мультимодальные системы часто строятся по дуальной башенной архитектуре: отдельная нейросеть (например, SigLIP) извлекает признаки из изображения, которые затем проецируются в пространство токенов языковой модели (например, BERT). После этого данные поступают в языковую модель, которая обычно является причинно-следственным декодером.

Эта структура имеет свои недостатки для задач, не требующих генерации текста посимвольно. NeoMME радикально упрощает эту цепочку. Модель объединяет оба модальности в едином двунаправленном трансформере:

1. Единый вход: Текстовые токены и изображения, разбитые на непровлевающиеся пачки размером 32x32 пикселя, поступают в модель через один механизм внимания. Нет необходимости в сложных проекторах или предобученных вейв-энкодерах. 2. Динамическое разрешение: Модель поддерживает изображения разного размера и соотношения сторон. Пачки обрабатываются в зависимости от их размера, что позволяет эффективно работать с высокодетализированными страницами документов без потери информации. 3. Длинный контекст: Каждая модель поддерживает контекстную длину до 16 384 токенов, что достаточно для обработки двух стандартных изображений 4K UHD. 4. Многоязычность: Ядро модели обучалось с нуля на мультимодальных данных, включая код, математику и транскрипты изображений, с использованием токенизатора BPE размером 131k токен.

Компания отмечает, что отсутствие причинно-следственного декодера и отдельной визуальной башни снижает вычислительные затраты и сложность обслуживания системы.

Обучение: От маскированного диффузионного шума

Обучение NeoMME производится с нуля (from scratch) с использованием цели, аналогичной дискретному маскированному диффузионному шуму для текста.

Процесс выглядит следующим образом:

* Маскирование: В каждом примере часть токенов текста случайно удаляется (маскируется). Скорость маскирования варьируется от 0 до 1. * Восстановление: Задача модели — восстановить удаленные токены, используя оставшийся текст и информацию из изображений. * Зависимость от изображения: При слабом маскировании модель может восстанавливать слова только по контексту текста. Однако при сильном маскировании (когда видна только часть слов или ни одного) модель вынуждена опираться на визуальные признаки. Например, если на картинке сидит кот, модель должна восстановить слово "кошка", даже если контекстных слов вокруг мало.

Это обучение заставляет модель научиться "видеть" и понимать связь между визуальным содержимым и семантикой текста, не перенимая веса предобученных визуальных моделей.

NeoMME-Retriever: Поиск в визуальных документах

На основе основного энкодера были созданы специализированные модели для поиска (NeoMME-Retriever). Они были дообучены методом, описанным в подходе ColPali, который обрабатывает страницы документов как целые изображения, минуя этапы распознавания текста (OCR). Это сохраняет структуру документа, таблицы и диаграммы, которые часто теряются при превращении текста в простой поток символов.

Двойная голова для извлечения признаков

Модель извлечения NeoMME-Retriever использует архитектуру с двумя совместно обучаемыми головками на выходе трансформера:

1. Голова плотных эмбеддингов (Dense Head): Средний скрытые состояния по всем токенам страницы в один нормализованный вектор. Такие эмбеддинги компактны и идеально подходят для хранения в индексах приближенного ближайшего соседа (ANN) для быстрого поиска. 2. Голова позднего взаимодействия (Late-Interaction Head): Проецирует каждый отдельный токен текста или пачку изображения в 128-мерный вектор. Это позволяет проводить более детальное сравнение конкретных частей запроса с частями документа.

Преимущество подхода заключается в том, что один проход модели (forward pass) генерирует оба типа представлений. Это дает гибкость: можно использовать плотные векторы для быстрого поиска среди миллионов документов, а затем применять более точные векторы позднего взаимодействия для пересортировки (reranking) короткого списка кандидатов.

Результаты и оптимизация хранения

Тестирование проводилось на бенчмарке ViDoRe v3. Показатель эффективности — nDCG@10.

* Эффективность: Модель размером 260M параметров достигла nDCG@10 на уровне 0.523, что является самым высоким результатом среди всех моделей, параметры которых строго меньше 800M. Она показывает результаты, сравнимые с более тяжелыми моделями, такими как ColQwen2.5, при использовании в 14 раз меньше параметров. * Скорость: На видеокарте NVIDIA L40S модель NeoMME-Retriever (260M) обрабатывает около 51 страницы в секунду при входных изображениях 2048x2048. Это в два раза быстрее, чем современная модель ColModernVBERT (26 страниц в секунду).

Проблема хранения позднего взаимодействия

Векторы позднего взаимодействия (late-interaction embeddings) содержат информацию о каждой пачке изображения. Для высокодетализированной страницы (2048x2048) это может означать тысячи векторов, требующих около 1.5 МБ памяти в формате float32. При работе с большими корпорациями документов это становится серьезным препятствием.

Команда Hcompany внедрила два метода сжатия, которые работают вместе:

1. Иерархическое пулинг токенов (Hierarchical token pooling): Группирует похожие векторы внутри одной страницы и заменяет группу их средним значением. 2. Асимметричная квантование (Asymmetric quantization): Движет векторы документа в целочисленный формат int8 или бинарный, сохраняя векторы запроса в более высоком разрешении (так как они генерируются "на лету" и не хранятся в базе).

Факты: Результаты сжатия

Эти методы позволили достичь драматического снижения объема хранимых данных без потери точности поиска:

* Агрессивное сжатие: Использование пулинг-фактора 8, квантования int8 для запросов и бинарного для документов сократило объем векторов с 1.5 МБ до 6 КБ на страницу. * Сохранение качества: При этом была сохранена более чем 95% от базового показателя nDCG@10.

Это означает, что индекс из миллионов высокодетализированных страниц может занимать на порядок меньше места, чем это принято в современных системах.

Визуальный RAG

Технология NeoMME открывает возможности для создания систем визуального поиска с дополнением контекстом (Visual RAG). В отличие от текстового RAG, который работает с очищенным текстом, визуальный RAG позволяет передавать в генеративную модель оригинальные изображения страниц.

Система работает следующим образом: 1. Индексация: Страницы PDF превращаются в изображения, которые кодируются в векторы и сохраняются в хранилище. 2. Поиск: Запрос пользователя кодируется, и система находит наиболее релевантные страницы. 3. Генерация: К запросу добавляются найденные изображения, и визуальная языковая модель генерирует ответ, учитывая графики, формулы и макет страницы, которые мог бы потерять текстовый изволитель.

Вся модель NeoMME доступна в библиотеке Hugging Face Transformers, а весовые коэффициенты моделей распространяются по лицензии Apache 2.0. Это позволяет разработчикам легко интегрировать технологию в свои проекты.

*Небольшой штрих от Umine Nagi:* В мире, где каждая нейросеть стремится быть больше и сложнее, появление NeoMME напоминает о том, что элегантность часто лежит в упрощении. Отказ от избыточных компонентов ради одной цельной архитектуры — это не только экономия вычислений, но и шаг к более прозрачным и управляемым системам.

Первоисточники

Hugging Face Blog
← Вернуться в эфир