Искусственный интеллект · Языковые модели · Визуальный анализ · Железо · Hugging Face · Liquid AI · Спекулятивное декодирование26 сентября в 11:32 · 5 мин

Экспериментальный ускоритель LFM2.5-VL-DSpark: ускорение работы моделей на основе зрения и языка

Компания Liquid AI представила экспериментальную модель-проектировщик LFM2.5-VL-DSpark, предназначенную для повышения скорости работы визуально-языковых моделей (VLM). Это дополнение, использующее технику спекулятивного декодирования, позволяет сократить время обработки текста на 2.62 раза на мобильных устройствах и до 2.27 раза на мощных GPU, добавляя при этом лишь 8.9% к исходному размеру памяти.

# Uскорение визуально-языковых моделей: обзор LFM2.5-VL-DSpark

Компания Liquid AI, известная своими работами в области архитектур больших моделей, анонсировала новый инструмент для оптимизации работы визуально-языковых моделей (Vision-Language Models, VLM). В блоге Hugging Face 24 сентября 2026 года была опубликована статья о выпуске экспериментальной модели LFM2.5-VL-DSpark. Данная модель служит "проектировщиком" (drafter) для основной модели LFM2.5-VL-3B и демонстрирует значительное ускорение генерации текста без потери качества вывода.

В отличие от предыдущих итераций, ориентированных преимущественно на текстовые данные, новая версия интегрирована с визуальными модулями. Технический подход строится на спекулятивном декодировании, который позволяет предсказывать следующие tokens, чтобы целевая модель могла только проверять их валидность, экономя вычислительные ресурсы.

Как работает спекулятивное декодирование для VLM

Ключевой механизм, лежащий в основе ускорения, называется спекулятивным декодированием. В традиционных языковых моделях каждый токен генерируется последовательно с полным вычислением нейронной сети. Спекулятивное декодирование вводит дополнительный, более легкий "проектировщик" (draft model), который пытается предсказать блок из $k$ кандидатов на основе скрытого состояния целевой модели.

Для визуально-языковых моделей реализация имеет свои особенности. Архитектура проектировщика LFM2.5-VL-DSpark идентична текстовым аналогам: она захватывает скрытые состояния целевой модели на фиксированном наборе слоев. Важным нюансом является работа с мультимодальными данными: пэты изображений и текстовые токены проецируются в единое пространство представлений перед входом в слои проектировщика. Это позволяет алгоритму работать с векторами скрытых состояний одинаковой размерности, независимо от того, обрабатывается ли вход как картинка или текст.

Проектировщик добавляет к основной модели около 280 миллионов параметров, что составляет всего 8.9% от общего числа параметров целевой модели LFM2.5-VL-3B. При этом объем памяти увеличивается лишь незначительно, в то время как потенциальное ускорение генерации оказывается существенным.

Результаты ускорения на CPU и GPU

Команда LiquidAI провела тестирование на шести различных задачах, включая общий визуальный вопрос-ответ (VQA), генерацию подписей к изображениям, анализ диаграмм и сложные логические рассуждения. Использовался бенчмарк MMSpec для оценки эффективности.

Результаты показали значительный разрыв между производительностью на периферийных устройствах и серверном оборудовании:

* На мобильных устройствах (Edge): * Используя MLX на чипе M5 Max, скорость декодирования увеличилась от 2.30x до 3.13x в зависимости от задачи. * Общее время задержки (end-to-end latency) сократилось в диапазоне от 1.56x до 2.62x. * На базе llama.cpp для чипа M3 Ultra улучшения составили 1.30x–1.77x для полного цикла работы.

* На мощных GPU (Datacenter): * На процессорах H100 ускорение декодирования достигло от 20.4x до 2.66x. * Общее ускорение задержки составило от 1.64x до 2.27x.

Стоит отметить, что прирост скорости варьируется в зависимости от конкретной задачи, что связано с тем, как разные типы запросов (текст, изображения, диаграммы) взаимодействуют с визуальным энкодером и языковым стеком.

Ограничения и физика ускорения

Несмотря на впечатляющие цифры, статья честно указывает на фундаментальные ограничения спекулятивного декодирования в контексте визуально-языковых задач. В чисто текстовых больших языковых моделях (LLM) этап предобработки (prefill) часто является вычислительно интенсивным, но его стоимость растет субквадратично относительно длины промпта.

Ситуация с VLM иная. Картинка сначала проходит через визуальный энкодер, превращаясь в сотни визуальных токенов, а затем языковая часть модели обрабатывает их вместе с текстовым запросом. На периферийных устройствах с ограниченным вычислительным потенциалом этап предобработки занимает существенную долю от общего времени выполнения запроса. Это проявляется в задержке до первого токена (time-to-first-token) и в общей метрике.

Спекулятивное декодирование ускоряет только стадию декодирования (generate), но не влияет на время работы визуального энкодера или на этапе предобработки (prefill). Согласно закону Амдаля, общее ускорение системы ограничено самой медленной, неизменной частью работы. Поэтому, даже при значительном ускорении генерации текста, итоговое сокращение времени ответа может быть скромным, если доминирующим фактором является именно обработка изображения.

Практическое применение и доступность

Модель LFM2.5-VL-DSpark разработана для немедленного внедрения (day-one support) в популярные открытые экосистемы. Поддержка интегрирована в следующие инструменты:

1. SGLang: Требуется специальная сборка с поддержкой DSPARK для целей LFM. Запуск сервера осуществляется через стандартные CLI-параметры, где необходимо указать путь к модели и к модели-проектировщику, а также задать размер блока speculation (рекомендуется 8 или 9). 2. llama.cpp: Для работы на стороне клиента и сервера требуется соответствующая сборка. Процесс запуска включает указание флагов спецификации типа "draft-dspark" и параметров количества предсказываемых токенов. 3. MLX-VLM: Интеграция предусмотрена для пользователей, работающих на экосистеме Apple Silicon.

Важно понимать, что спекулятивное декодирование является точным методом: целевая модель проверяет каждый предложенный проектировщиком токен, поэтому итоговый вывод остается идентичным тому, который дала бы основная модель сама. Метрики времени ответа отдельно фиксируют количество предложенных токенов и количество принятых.

Технические детали архитектуры

Архитектурный стек модели-проектировщика включает: * Стек декодера LFM2.5-VL-3B (4 слоя): 193.0M параметров. * Проекцию скрытых состояний: 21.0M. * Голову Маркова и нормализацию: 65.5M и 6.4k соответственно. * Итого: около 279.5M параметров.

Обучение проводилось по рецепту DSpark с использованием смеси данных, взвешенных по ожидаемым рабочим нагрузкам. Тренировочный процесс включал 10 эпох, что позволило достичь оптимального баланса между размером модели и точностью предсказания.

Модели доступны на платформе Hugging Face в форматах Safetensors и GGUF, что облегчает их загрузку и использование как в коммерческих, так и в исследовательских целях. Желание команды Liquid AI заключается в создании универсального семейства моделей, которые можно развернуть "где угодно" — от смартфона до суперкомпьютера, сохраняя при этом открытый вес и гибкость кастомизации.

Первоисточники

Hugging Face Blog ↗
← Вернуться в эфир