Новое не всегда лучше: сравнительный анализ Qwen3.5 и Qwen3.6 в локальном инференсе
Переход к новым версиям больших языковых моделей (LLM) — стандартная практика, но в сценариях локального использования это правило не действует автоматически. Длительное независимое исследование, проведенное экспертами в области локального инференса, показало, что модели Qwen3.6 и их квантованные варианты не демонстрируют ожидаемого качественного скачка по сравнению с устоявшейся версией Qwen3.5. В некоторых задачах старое поколение сохраняет превосходство или даже обходит новые разработки, особенно в контексте программирования на редких языках.
# Битва поколений: Qwen3.5 против Qwen3.6 в локальном инференсе
Почему замена модели требует обоснования
В экосистеме искусственного интеллекта логика проста: если модель B новее модели A, то B должна быть умнее, быстрее и эффективнее. Однако для разработчиков, работающих с локальными инфраструктурами и чувствительными данными, эта логика часто сталкивается с реальностью. Финансовые и конфиденциальные данные клиентов требуют обработки внутри периметра безопасности, что делает облачные провайдеры недоступными. В таких условиях выбор конкретного веса модели (weights) становится критическим решением.
Технология MoE (Mixture of Experts) позволяет использовать модели с огромным количеством параметров (например, 35 миллиардов), активируя при этом лишь небольшую их часть (например, 3 миллиарда) для обработки каждого запроса. Это обеспечивает высокую эффективность при сохранении качества ответа. Однако ключевым фактором для локального разворачивания остается объем видеопамяти (VRAM).
На практике организации часто используют квантованные версии моделей. Квантование — это процесс уменьшения точности чисел, из которых состоят веса модели, переходя от 16-битного формата к 4-битному (Int4). Это позволяет поместить модель в память одной видеокарты, значительно снизив стоимость инфраструктуры. Логика гласит: если веса сжимаются, модель должна терять в точности. В реальности благодаря специализированным алгоритмам квантования (таким как GPTQ, AWQ) потеря точности минимальна, а выигрыш в производительности и емкости кэша контекста огромен.
Методология: 8 дней и миллиард токенов
Для ответа на вопрос о целесообразности перехода на Qwen3.6 автор исследования провел эксперимент, который длился восемь дней. В ходе тестирования модели «сожгли» почти миллиард токенов, обработав 1.8 ГБ входных данных. Результат анализа занял еще 4.6 ГБ дискового пространства.
Исследование не ограничилось стандартными бенчмарками. Оно включало шесть групп специфических тестов, созданных с целью проверки реальных бизнес-задач. В роли технического ассистента выступали мощные модели: Anthropic Opus 5, занимавшаяся сбором и обработкой данных, и OpenAI GPT-6 Astra, проводившая кросс-чекинг выводов.
Базовой моделью («инкумбентом») для сравнения служила Qwen3.5-35B-A3B-GPTQ-Int4. Это официально квантованная версия от авторов модели, использующая метод GPTQ и группу размером 128 экспертов. Именно на ней выстроен текущий опыт работы.
В качестве соперников были отобраны пять различных квантов модели Qwen3.6-35B-A3B, созданных разными сообществами и использующих различные подходы: * cyankiwi: использовал метод AWQ с защитой каналов активации. * QuantTrio: применял AWQ, но, как выяснилось, фактически реализовал простое округление. * btbtyler09: квантование методом GPTQ с крупной калибровкой. * palmfuture: GPTQ с минимальным набором калибровочных данных. * TheHouseOfTheDude: использовал метод RTN (слепое округление), дополнительно сжав слои полного внимания.
Кроме того, в исследование вошла модель Ornith-1.5-35B-A3B, разработанная специально для программирования, которая, по заявлению авторов, должна была превосходить конкурентов в коде. Также был создан авторский квант Humo-Coder на базе Ornith-1.5 с индивидуальной калибровкой на специфических доменах (банки, право).
Детали квантования и калибровки
Основное различие между участниками заключалось не только в названиях, но и в методологии сжатия и калибровки.
Методы квантования: 1. GPTQ: калибруется на данных, сжимает веса слоями, подправляя соседей для сохранения выхода слоя. Обеспечивает баланс точности и скорости. 2. AWQ (Activation-aware Weight Quantization): анализирует активации модели на калибровочном датасете и защищает важные каналы от грубого округления. Это требует тщательного выбора данных для калибровки. 3. RTN (Randomized Tensor Normalization): простой метод округления весов до ближайшего целочисленного значения без предварительной калибровки. Быстро, но менее точно.
Проблема калибровки: Качество кванта напрямую зависит от того, на каких данных он обучался. Если квантовать на коде, модель может «подзабыть» русский язык или общие знания. Например, один из авторов Qwen3.6 использовал метод «data-free», заявив, что отказался от калибровочных данных, чтобы не ограничивать модель конкретными темами. Однако анализ весов показал, что метод AWQ без данных по своей сути вырождается в простое округление, так как механизм защиты каналов (коэффициенты масштабирования) отсутствует. Другая модель, QuantTrio, хотя и называлась AWQ, также не содержала следов защитных коэффициентов, что сделало её поведение идентичным базовому округлению.
В результате, фактический «интеллект» моделей в тестах оказался ближе к тому, что обеспечивают простые методы округления (GPTQ и RTN), а не к теоретическим возможностям сложных алгоритмов вроде AWQ без данных.
Результаты тестов: где новое проигрывает старому
Тестирование охватывало несколько категорий задач, включая работу с русским языком, генерацию кода, анализ данных и инструментальный вызов.
В задачах, связанных с русским языком и общими запросами, Qwen3.5 показала устойчивость и предсказуемость. Квантованные версии Qwen3.6 не продемонстрировали системного повышения качества. Более того, в ряде сценариев, требующих работы с малоизвестными нишевыми языками программирования (о которых жаловались разработчики), инкумбент оказался надежнее новых вариантов.
Ситуация с Ornith-1.5 и её квантом Humo-Coder была интересной. Модель, заточенная под программирование, теоретически должна была доминировать. Однако результаты показали, что при использовании собственных шаблонов и калибровочных наборов, старые архитектуры могут быть адаптированы так же эффективно. Модель Humo-Coder, созданная на базе Ornith-1.5 с индивидуальной настройкой, показала достойные результаты, но не превзошла стабильность Qwen3.5 в сложных многошаговых сценариях.
Ключевым выводом стало то, что разница в памяти (VRAM) между квантами незначительна. Разброс объема выделяемой памяти под KV-кэш (контекст) составил всего несколько гигабайт, что не позволяет сделать однозначный выбор в пользу одной модели исключительно по параметрам емкости. Модели занимают примерно одинаковое пространство, предлагая пользователю тот же объем контекста.
Выводы: стратегия стабильности
Результаты исследования бросают вызов индустриальной инерции переходить на новое просто потому, что оно новое. Для задач локального инференса, где важна предсказуемость, низкая задержка и отсутствие зависимости от внешних API, Qwen3.5-35B-A3B остается мощным и валидным решением.
Новые версии Qwen3.6, несмотря на маркетинговые обещания, не показали существенного прогресса в локальных условиях при использовании квантования Int4. В некоторых аспектах они даже отстали из-за особенностей калибровки или неоптимальной архитектуры для конкретных задач.
Переход на новую модель должен базироваться не на дате выпуска, а на конкретных метриках производительности в целевом домене. Если текущая модель успешно решает задачи обработки данных клиентов с нужной точностью, смена «железа» и переобучение/переквантование инфраструктуры может быть не только неоправданно затратной, но и привести к потере качества. В мире искусственного интеллекта иногда стоит ценить проверенное стабильное решение выше гипотетического потенциала нового.
*