Qwen 4: архитектура Mixture-of-Experts, которая меняет правила игры для локального ИИ
Пока общественность обсуждает релиз Qwen 3.8 27B, компания Alibaba уже представила архитектуру Qwen 4 в лице модели Qwen3.8-Flash-Next. Это раннее превью демонстрирует радикальное переосмысление обработки контекста и распределения памяти, сочетая плотную модель MoE объемом 125 млрд параметров с таблицами N-gram на 51 млрд. Авторский подход позволяет запускать модели с 180 млрд общих весов на локальных машинах с 128 ГБ ОЗУ, достигая скорости генерации до 30 токенов в секунду без использования специализированных GPU-кластеров.
# Qwen 4: как архитектура Mixture-of-Experts обходит ограничения локальных рабочих станций
В сфере разработки больших языковых моделей (LLM) гонка параметров часто приводит к тому, что передовой искусственный интеллект становится доступным лишь узкому кругу пользователей с мощными GPU-кластерами. Компания Alibaba, создатель серии моделей Qwen, решила эту дилемму с неожиданной стороны. Вместо того чтобы просто увеличивать плотность модели, инженеры компании выпустили архитектурный предшественник Qwen 4 — модель Qwen3.8-Flash-Next.
Этот релиз знаменует собой переход от монолитных архитектур к гибридному подходу, который значительно снижает требования к видеопамяти, сохраняя при этом способность обрабатывать контексты огромной длины и решать сложные агентские задачи.
Переосмысление памяти: Mixture-of-Experts и N-gram эмбеддинги
Ключевой инновацией Qwen 4 (представленной через Flash-Next) является разделение вычислительной нагрузки между высокоскоростными процессорами/видеокартами и стандартной оперативной памятью (RAM).
Модель построена как Mixture-of-Experts (MoE). Общий объем параметров модели составляет около 180 миллиардов, что распределено следующим образом: * Основной граф MoE: 125 млрд параметров. * N-gram таблицы (PLE): 51 млрд параметров. * Многоточковая предсказательная голова (MTP): 4 млрд параметров.
На каждый генерируемый токен активировано всего 6 миллиардов параметров (512 маршрутизируемых экспертов из которых работают только 10 плюс общий эксперт). Это делает вычислительную нагрузку на токен сопоставимой с компактными моделями, которые обычно весят около 6 млрд параметров, но с интеллектуальным уровнем, превосходящим тяжеловесные модели на 70 млрд.
Самой необычной особенностью стала добавленная память N-gram эмбеддингов. Традиционно память модели должна храниться в видеопамяти (VRAM) для быстрого доступа. Однако в Qwen 4 отдельная таблица из 51 млрд параметров, содержащая частотные фразы и языковые паттерны (биграммы и триграммы), вынесена из VRAM. Эти данные могут храниться в обычной оперативной памяти (RAM) или даже на SSD/NVMe.
Технически это реализуется через механизм mmap: система асинхронно загружает нужные куски таблицы в память при необходимости. Поскольку ключи в этой таблице являются детерминированными хешами, модель может точно предсказывать адрес данных без сложных матричных умнолений. Это позволяет работать с таблицей размером 51 млрд параметров на обычных системах, где видеокарта освободжена для основных вычислений в нейросетевых экспертах.
Механизм внимания: от полного сканирования к точечному поиску
Для обработки контекстов до 262 тысяч токенов (с возможностью расширения до 1 миллиона с помощью YaRN) стандартные механизмы внимания (Attention) становятся ресурсозатратными. В предыдущих версиях, таких как Qwen 3.8 27B, использовался Gated Attention, который обеспечивал высокую точность, но линейно увеличивал затраты памяти с ростом контекста.
В новой архитектуре применен гибридный механизм GDN + QSA (Qwen Sparse Attention):
1. Gated DeltaNet (GDN): 36 из 48 слоев модели используют этот механизм. Он действует как линейный рекуррентный сжиматель, превращая длинную историю в фиксированное состояние. Это предотвращает взрывной рост потребления памяти. 2. Qwen Sparse Attention (QSA): Оставшиеся 12 слоев используют новый алгоритм разреженного внимания. Вместо того чтобы анализировать каждый токен в истории, модель разбивает контекст на микроблоки и выбирает только самые релевантные области для анализа.
В результате, на контекстах длиной в миллион токенов скорость фазы предварительной обработки (Prefill) увеличивается в 8,6 раза. Модель сама решает, сколько информации считать, экономя вычислительные ресурсы.
Gated Residual и скорость генерации
Стабильность обучения и емкость слоев сохраняются благодаря инновации Gated Residual (GR). Этот метод разделяет единый поток остаточных связей на четыре ветки, где динамические вентили управляют чтением слоев, а скалярные вентили контролируют запись информации. Одна из веток служит «магистралью» для сквозного переноса данных из ранних слоев в глубокие, что критически важно для обучения на больших объемах.
Дополнительно модель оснащена слоем MTP (Multi-Token Prediction), который предсказывает несколько токенов вперед. Это создает встроенный механизм спекулятивного декодирования, позволяя генерировать текст быстрее без потери точности.
Сравнение бенчмарков и производительность
Сравнение Qwen3.8-Flash-Next (архитектура Qwen 4) с плотной моделью Qwen 3.8 27B показывает существенные преимущества новой архитектуры, несмотря на меньшее количество активных параметров на токен.
| Бенчмарк | Qwen3.8-Flash-Next | Qwen 3.8 27B | Прирост | | :--- | :--- | :--- | :--- | | DeepSWE 1.1 (агентский код) | 58.7 | 42.2 | +16,5% | | SWE-bench Pro | 62.5 | 61.7 | +0,8% | | SWE-bench Multilingual | 81.0 | 73.8 | +7,2% | | Agents' Last Exam (Score) | 51.2 | 42.9 | +8,3% | | GPQA Diamond | 91.7 | 89.2 | +2,5% | | LiveCodeBench v6 | 91.9 | 90.3 | +1,6% |
Эти результаты свидетельствуют о том, что новая архитектура не просто быстрее, но и эффективнее справляется с задачами, требующими агентского мышления и сложного логического анализа. В некоторых тестах модель уже приближается к уровню Claude Opus 4.8.
Локальный запуск на 128 ГБ ОЗУ
Главной практической пользой этой архитектуры является возможность запуска на обычных рабочих станциях. Благодаря тому, что таблица N-gram занимает основное место в потреблении памяти и может быть выгружена в RAM/SSD, требования к видеокарте снимаются.
Исследования с использованием фреймворков Unsloth и llama.cpp показывают, что 4-битная квантованная версия модели (GGUF UD-Q4_K_XL) требует около 85–110 ГБ оперативной памяти для полной загрузки. На системах с 128 ГБ ОЗУ (например, Mac Studio на Apple Silicon или ПК с большим объемом памяти) скорость генерации достигает 20–30 токенов в секунду.
Таким образом, Alibaba демонстрирует путь, где передовой искусственный интеллект перестает быть привилегией облачных сервисов, становясь доступным инструментом для локальных агентов и персональных ассистентов на мощных, но доступных машинах.
*На фоне шума вокруг минорных обновлений важно видеть фундаментальные сдвиги. Архитектура Qwen 4 не просто улучшает старый путь — она открывает новую эру эффективного ИИ, где знания хранятся отдельно от вычислений, а скорость достигается не за счет растущих затрат на железо, а за счет умного алгоритмического распределения.*