Qwen3.8-Flash-Next · архитектура · Qwen4 · Alibaba · MoE · Gated DeltaNet · sparse attention · N-gram embedding31 августа в 05:02 · 5 мин

Qwen3.8-Flash-Next: экспериментальная архитектура будущего, открывшаяся миру

Команда Alibaba выпустила Qwen3.8-Flash-Next, позиционируя её как предварительный просмотр архитектуры будущей модели Qwen4. Это уникальное событие в мире open-source ИИ, где модель с заявленными 125 миллиардами параметров демонстрирует эффективность, эквивалентную значительно меньшей модели, за счет инноваций в области внимания и оптимизации памяти.

Объемное стеклянное ядро со свернувшимися волнами на скалистом маяке в ночи

# Qwen3.8-Flash-Next: архитектура будущего уже здесь

26 августа 2026 года в сообществе искусственного интеллекта произошло событие, которое заставило пересмотреть границы возможного. Компания Alibaba Cloud открыла исходный код Qwen3.8-Flash-Next, описав её как «экспериментальную версию архитектуры, которая ляжет в основу Qwen4». Однако, прежде чем восхищаться цифрами, необходимо внести ясность: полноценной модели с именем Qwen4 на данный момент не существует. Это лишь мощный прототип, демонстрирующий направление развития.

Парадокс эффективности: 125 миллиардов на 6

Цифры, озвученные разработчиками, изначально казались нереалистичными. Модель заявляет о общем количестве 125 миллиардов параметров, что само по себе является огромным показателем. Более того, существует дополнительный слой из 51 миллиарда параметров. Но ключевой момент заключается в механизме их работы: на каждый обрабатываемый токен активируется всего 6 миллиардов параметров.

Такой подход, известный как MoE (Mixture of Experts), позволяет модели обладать гигантским резервом знаний (потенциалом 125B+), но работать с эффективностью компактной сети. В результатах бенчмарков Qwen3.8-Flash-Next показывает результаты, сравнимые или превосходящие модели-конкуренты с большим активным числом параметров. Например, в тесте JobBench при работе с 6 миллиардами активных параметров она обогнала Claude Opus 4.6, которая опирается на значительно больше ресурсов.

Уминэ Наги. В тишине огромных дата-центров иногда рождается самое главное. Это напоминает о том, что истинная мощь — не в количестве лампочек, светящихся одновременно, а в умении системы выбирать лишь тот луч света, который необходим именно сейчас. Это экономия вычислений ради качества.

Четыре столпа новой архитектуры

Разработчики объясняют превосходство модели модернизацией по четырем ключевым направлениям: внимание, остаточный поток, эмбеддинг и оптимизация.

1. Гибридное внимание: GDN и QSA Классический механизм внимания в трансформерах становится слишком ресурсоемким при работе с огромными контекстами. Qwen3.8-Flash-Next использует гибридную схему. Модель разделена на блоки, где три слоя применяют Gated DeltaNet (GDN). Этот механизм непрерывно сжимает историю диалога, создавая компактное, но информативное резюме контекста.

Четвертый слой каждого блока использует Qwen Sparse Attention (QSA). В отличие от традиционного подхода, где анализируются все токены, индексатор в QSA сначала оценивает важность блоков данных. Затем внимание работает только с отобранными фрагментами. На контексте в один миллион токенов это ускоряет процесс предобработки (prefill) в 7,6 раза, а декодирование — в 4,9 раза.

2. Gated Residual: четыре полосы сигнала В обычной архитектуре все слои нейросети передают информацию через единый поток данных. Глубокая сеть может размывать важные признаки. Qwen решает эту проблему, разделяя поток информации на четыре параллельные ветки. Динамический гейт определяет, сколько данных проходить по каждой ветке и куда записывать результат. Архитектура сама научилась создавать обходные пути (байпасы) для критически важной информации, что снижает нагрузку на память, позволяя хранить состояние потока в формате FP8.

3. N-gram Embedding: локальная память паттернов Самое инновационное изменение касается того, как модель понимает слова. Вместо простого сопоставления вектора одному токену, N-gram embedding анализирует текущий символ и его предшественников. Система использует таблицу из 20 миллионов записей биграмм и триграмм, вычисляет нужные позиции заранее и подгружает данные из обычной оперативной памяти (RAM), а не из дорогой видеопамяти (VRAM). Это дает доступ к огромной «локальной памяти паттернов» без увеличения времени вычислений.

4. Муон оптимизатор Обучение модели проходило с использованием оптимизатора Muon, заменившего собой классический AdamW. Команда отказалась от плавного увеличения размера батча в начале обучения (warmup), что позволило сэкономить более 18% шагов оптимизации без потери качества. Это привело к значительному сокращению времени и ресурсов, необходимых для обучения.

Реальность запуска: требования и подводные камни

Несмотря на впечатляющие обещания, запуск модели требует серьезного подхода к ресурсам.

Требования к памяти Квантование модели (сжатие весов) показывает интересные результаты, но имеет свои ограничения: * 1-bit квант: требует 75 ГБ RAM. * 4-bit квант: требуется 112 ГБ RAM.

Важно отметить, что таблица N-gram, составляющая почти 40% файла модели, не квантуется агрессивнее 4 бит из-за чувствительности механизма поиска. Именно она раздувает объем даже при минимальном сжатии весов.

Производительность на CPU и GPU Модель была протестирована на десктопе без видеокарт, используя только процессор Intel Core Ultra 9. Результаты генерации составили около 11 токенов в секунду, что указывает на зависимость скорости от памяти, а не от вычислительной мощности. Однако подключение видеокарты NVIDIA RTX 5090 (32 ГБ VRAM) ускорило процесс в пять раз.

Однако здесь кроется подвох: попытки перенести слишком многие слои модели на видеокарту приводят к обвалу производительности. Драйвер видеокарты при переполнении VRAM может начать сбрасывать данные через PCI-е интерфейс в системную память, что делает работу системы в разы медленнее. Оптимальным считается разделение слоев между CPU и GPU, чтобы избежать переполнения памяти карты.

Качество на русском языке Несмотря на глобальные успехи в математике, программировании и работе с визуальными данными, пользователи отмечают снижение качества ответов на русском языке по сравнению с предыдущими версиями Qwen. Модель может путаться в окончаниях слов и формах глаголов. Для серьезных проектов на русском языке требуется тщательное тестирование и использование строгих системных инструкций.

Сравнение с конкурентами

В тот же день, когда Qwen анонсировала свою модель, китайская лаборатория Zhipu AI выпустила GLM-5.3-Flash. Сравнение показывает разные стратегии: * GLM-5.3-Flash: Обладает нативным контекстом в 1 миллион токенов и показывает лучшие результаты в задачах по кодированию (DeepSWE). * Qwen3.8-Flash-Next: Имеет меньший активный вес на токен, что критично для локального запуска на мощном, но не бесконечном железе.

Заключение

Qwen3.8-Flash-Next — это не просто еще одна большая модель. Это демонстрация того, как архитектурные инновации могут снизить стоимость токена и повысить доступность передового ИИ. Полноценный Qwen4, основанный на этих разработках, ожидается позже в 2026 году, но уже сейчас его прототип открывает новые горизонты для локального развертывания и исследований в области эффективного машинного обучения.

*Метки: Qwen3.8-Flash-Next, архитектура, Qwen4, Alibaba, MoE, Gated DeltaNet, sparse attention, N-gram embedding, Muon optimizer, GLM-5.3-Flash.*

Первоисточники

Habr AI
← Вернуться в эфир