Как запускать модели на 176 млрд параметров на устаревшей видеокарте GTX 1080 Ti
Технологии локального запуска больших языковых моделей демонстрируют впечатляющую адаптивность. Недавние эксперименты на платформе Habr доказали, что мультимодальная MoE-архитектура Qwen3.8-Flash-Next, требующая более 100 ГБ памяти, может успешно работать на игровой видеокарте GTX 1080 Ti с объемом видеопамяти всего 11 ГБ. Секрет успеха кроется в гибридном распределении вычислений между GPU и оперативной памятью с использованием обновленного llama.cpp.
# 176 млрд параметров против 11 ГБ VRAM: эксперимент с Qwen3.8-Flash-Next
В мире искусственного интеллекта часто складывается впечатление, что современные мега-модели доступны лишь обладателям топового оборудования. Однако практика показывает обратное. Недавний эксперимент, опубликованный сообществом разработчиков, продемонстрировал возможность запуска модели класса 176B (125 млрд параметров в ядре плюс 51 млрд параметров таблиц эмбеддингов) на устаревшем гейминг-железе.
Испытательным полигоном стала видеокарта NVIDIA GeForce GTX 1080 Ti, выпущенная еще в 2017 году, оснащенная всего 11 ГБ видеопамяти (VRAM). Соседняя с ней система располагала процессором Intel Core i9-9900K и 64 ГБ оперативной памяти. Результат превзошел ожидания: модель запустилась стабильно, обеспечивая скорость генерации текста на уровне 11–19 токенов в секунду.
Архитектура, позволяющая экономить ресурсы
Модель Qwen3.8-Flash-Next использует структуру Mixture of Experts (MoE), которая кардинально отличается от традиционной плотной архитектуры. Основная особенность заключается в том, что не все параметры модели участвуют в обработке каждого конкретного запроса.
В данной модели используется 512 экспертов, из которых активна только небольшая часть (около 10 маршрутизируемых экспертов плюс общий «shared» эксперт) на каждый входящий токен. Это позволяет загружать веса в оперативную память (RAM), а не в дефицитную видеопамять (VRAM), так как для выполнения вычислений используется лишь малая их доля. Гибридная архитектура Gated DeltaNet (GDN) и Qwen Sparse Attention (QSA) также способствует эффективному управлению контекстным окном размером до 262 144 токенов.
Для экспериментов использовался квантованный файл GGUF формата UD-Q4_K_XL. Общее весовое значение модели составило около 111 ГБ, что в десятки раз превышает вместимость видеокарты. Ключевым решением стало использование утилиты llama-gguf-split для объединения разбитых частей модели в единый файл, который затем корректно распараллеливался между CPU и GPU.
Техническая реализация: от сборки до инференса
Запуск такой конфигурации требует тщательной настройки среды. Официальная экосистема Ollama на момент эксперимента не поддерживала необходимые форматы для Linux-систем с картами NVIDIA, поэтому разработчики обратились к более гибким инструментам:
1. llama.cpp: Основная библиотека, управляющая вычислениями. Версия должна поддерживать модуль qwen4exp, появившийся в августе 2026 года (по данным источника). Для GTX 1080 Ti критически важна правильная настройка архитектуры CUDA (значение 61) и использование компиляции с поддержкой GPU. 2. DeepSeek Harness (DSH): Агентная оболочка, предоставляющая интерфейс для взаимодействия с моделью. В ней используется сторонний плагин dsh-local-llm-controller, который позволяет управлять процессом llama-server непосредственно из веб-интерфейса. 3. Распределение нагрузки: Вместо попыток загрузить все слои на видеокарту (параметр -ngl 999), авторы эксперимента позволили системе автоматически определять оптимальное количество слоев для GPU. Оставшаяся часть нагрузки и веса модели размещались на процессоре и в оперативной памяти. Это предотвратило ошибки нехватки видеопамяти.
После объединения файлов shards общий размер модели составлял примерно 111 ГБ. При запуске сервер потребляет около 9,5 ГБ VRAM, используя оперативную память для хранения остального веса и кэша KV. Скорость декодирования составила 11 токенов в секунду, что признано достаточным для задач пакетной обработки и агентных сценариев.
*Иногда старое железо способно удивить нас больше, чем новейшие чипы, если подходы к их использованию будут соответствовать архитектуре модели.*
Ограничения и перспектива развития
Несмотря на успешный запуск, важно учитывать ограничения конфигурации. Производительность сильно зависит от пропускной способности оперативной памяти и скорости SSD/NVMe диска. Для более быстрых карт, таких как RTX 4090, скорость может быть значительно выше, а использование параметра --n-cpu-moe позволит вручную оптимизировать распределение экспертов. Кроме того, полное использование контекстного окна в 256K токенов на 11-гигабайтной карте может привести к проблемам с ядром CUDA, поэтому рекомендуется начинать с окон 16K–64K.
Эксперимент также показал, что режимы логического razoning (размышления) и сохранения их истории требуют отдельного управления параметрами API, так как старые методы отключения (enable_thinking) устаревают в новых сборках llama.cpp.
В заключение, запуск модели Qwen3.8-Flash-Next на GTX 1080 Ti доказывает жизнеспособность локальных MoE-систем даже на бюджетном оборудовании. Это открывает возможности для пользователей, чье внимание к конфиденциальности данных перевешивает потребность в максимальной скорости, и позволяет延长的 жизнь старому железу за счет грамотного программного распределения ресурсов.