Оптимизация вывода ИИ: замена плотной матрицы на поиск по векторному индексу
Новое исследование на arXiv предлагает альтернативу тяжелым вычислениям при генерации текста большими языковыми моделями. Авторы заменяют стандартную матрицу проекции на механизм HNSW, что позволяет ускорить работу компактных моделей в малых пакетах данных почти вдвое без потери качества.

# Ускорение вывода языковых моделей через векторные индексы
В эпоху стремительного развития больших языковых моделей (LLM) проблема задержки при генерации текста становится всё более острой. Особенно остро она стоит для компактных моделей, которые призваны работать на периферийных устройствах или с ограниченным бюджетом вычислительных ресурсов. Новейшая работа, опубликованная 1 июля 2026 года на arXiv под номером cs.CL 2608.27460, предлагает радикальный подход к решению задачи бутылочного горлышка в памяти при автоматическом регрессивном декодировании.
Авторы исследования, Мартин Лоретц и Сепп Хорреитер, утверждают, что традиционные архитектуры используют чрезмерные ресурсы из-за необходимости хранить огромные матрицы выходных эмбеддингов. Их решение переводит задачу отбора токенов из области линейной алгебры в область информационного поиска.
Проблема пропускной способности памяти
Ключевым ограничением современных моделей с автогенерацией является этап вывода (inference). В стандартной архитектуре, когда модель генерирует следующий токен, она должна выполнить операцию матричного умножения между вектором последнего скрытого состояния и огромной матрицей выходных эмбеддингов. Эта матрица содержит веса для каждого токена в словаре.
Проблема усугубляется для компактных моделей с большими мультисловарями. Например, модель может иметь словарь на десятки тысяч токенов для поддержки многих языков, но при этом иметь всего несколько миллионов параметров весов. В такой ситуации размер матрицы проекции может быть сопоставим или даже превышать размер самого ядра модели (encoder-decoder или transformer). При каждом шаге генерации эта матрица должна быть полностью загружена в оперативную память и использована. Это создает колоссальную нагрузку на шину памяти, становясь главным препятствием для высокой скорости работы, особенно при малых размерах пакетов обработки (batch-size).
*«Большие матрицы выходных эмбеддингов создают значительное ограничение пропускной способности памяти во время автоматического регрессивного декодирования»,* — отмечают авторы в абстракте, подчеркивая, что эта проблема особенно актуальна для компактных моделей с обширным словарем.
От линейной алгебры к векторному поиску
Классический подход к оптимизации предполагает использование квантования весов или специализированных аппаратных ускорителей. Однако команда из Института теории обучения (IIT) предложила фундаментально иной путь. Они переосмыслили этап проекции выхода и выбора топ-k токенов как задачу поиска максимального скалярного произведения (Maximum Inner Product Search, MIPS).
Вместо того чтобы вычислять умножение для всех токенов в словаре, авторы заменили плотную матрицу проекции на векторный индекс, построенный на алгоритме HNSW (Hierarchical Navigable Small World). Этот алгоритм позволяет находить токены с наибольшим значением логита (вероятности) среди миллионов кандидатов за доли секунды, проверяя лишь небольшую подмножество.
Технически это означает, что «голова» вывода (output head) больше не вычисляет значения для всего словаря сразу. Вместо этого она запрашивает у индекса небольшой набор кандидатов с самыми высокими оценками, а затем интегрирует полученные логиты обратно в разреженную тензор полного словаря. Такой метод позволяет существенно сократить объем вычислений и пропускной способности памяти при сохранении точности выбора наиболее вероятного токена.
Как работает HNSW в этом контексте
Для неподготовленного читателя стоит отметить, что HNSW — это структура данных, часто используемая в поисковых системах для быстрого нахождения ближайших соседей. В данном случае «соседями» являются токены, семантически или статистически наиболее близкие к текущему контексту генерации. Алгоритм строит многоуровневую графическую структуру, где каждый узел (токен) связан с несколькими другими узлами. Поиск начинается сверху и быстро спускается к тем узлам, которые находятся в ближайшем «радиусе» от текущего вектора состояния модели. Это позволяет исключить из рассмотрения подавляющее большинство токенов, которые с высокой вероятностью будут иметь низкую оценку.
Результаты на моделях Gemma 3, Llama 3.2 и Qwen 3
Теоретические преимущества метода были проверены на практике. Исследование проводилось в условиях CPU-инференса (обработки на процессорах) с использованием нескольких передовых моделей: Gemma 3, Llama 3.2 и Qwen 3. Тестирование проводилось в режиме одиночного пакета (batch-size-one), что наиболее точно отражает реальные сценарии интерактивного чата с пользователем.
Результаты показали впечатляющую эффективность предложенного метода. В частности, для компактной версии модели Gemma 3 (270 миллионов параметров) предложенный метод увеличил пропускную способность всего цикла декодирования (end-to-end decoding throughput) на 82%.
Важно отметить, что ускорение произошло именно за счет оптимизации этапа проекции выхода. При этом качество сгенерированного текста не пострадало. Проверка на бенчмарке AlpacaEval подтвердила, что приблизительный метод поиска (approximate retrieval) сохраняет уровень качества, сравнимый с традиционными плотными проекциями.
Эти данные свидетельствуют о том, что использование векторных индексов вместо плотных матриц может стать практичным стандартом для систем с низкой задержкой, работающих в режиме обработки небольших пакетов данных. Для моделей, ориентированных на быстрый отклик в реальном времени, это может означать переход от десятков миллисекунд до единиц миллисекунд задержки на токен.
Заключение
Работа авторов представляет собой важный шаг в оптимизации архитектуры нейросетей. Она демонстрирует, что заимствование методов из смежных областей, таких как информационный поиск, может решить фундаментальные проблемы машинного обучения. В мире, где требования к скорости ответа ИИ растут экспоненциально, отказ от обязательного перебора всего словаря в пользу умного поиска открывает новые возможности для эффективной работы компактных моделей.
Хотя метод пока описан в академическом формате и требует дальнейшей интеграции в промышленные пайплайны, его потенциал для ускорения вывода на потребительском оборудовании очевиден. Как отмечают исследователи, это лишь начало эпохи, когда вычисления будут оптимизироваться не только за счет более мощных чипов, но и за счет интеллектуального управления данными.