Искусственный интеллект · Mixture-of-Experts · Оптимизация LLM · SqueezeFormer · Архитектура нейросетей · arXiv17 августа в 22:01 · 4 мин

Глубина имеет значение: новый метод сжатия моделей Mixture-of-Experts через маску экспертов

Новое исследование, опубликованное на arXiv, раскрывает удивительную асимметрию в устойчивости слоев больших языковых моделей. Оказалось, что нейросети гораздо сильнее страдают от выключения «экспертов» в начальных слоях, чем в финальных. Эта находка открывает путь к радикальному сокращению ресурсов без потери качества на критически важной задаче перевода кода.

# Глубина имеет значение: новый метод сжатия моделей Mixture-of-Experts через маску экспертов

В мире больших языковых моделей (LLM) поиск баланса между размахом интеллекта и вычислительной стоимостью — вечная дилемма. Архитектура Mixture-of-Experts (MoE), где модель обладает огромным набором «экспертов», активируя лишь малую часть их для каждого запроса, стала стандартом де-факто для масштабирования. Однако до недавнего времени оставалось непонятным, как именно распределяется нагрузка и какова цена удаления компонентов такой сложной системы.

Новая работа авторов из команды Qwen представляет собой детальное вскрытие внутренней структуры модели Qwen3.6-35B-A3B. Исследователи задались вопросом: не все ли эксперты равноценны? И можно ли безопасно удалить их часть, сохранив функциональность модели на задачах вроде кросс-лингвального перевода кода?

Фрагильность ранних слоев против устойчивости финальных

Основной результат исследования можно охарактеризовать как подтверждение того, что в глубоких нейросетях существует четкая вертикаль чувствительности. Исследователи применили методику маскирования экспертов, основанную на их активации (magnitude-based masking), к модели, содержащей 40 слоев MoE. В каждом слое расположено 256 экспертов, а маршрутизация данных использует топ-8 наиболее релевантных.

Данные эксперимента, проведенного на серверах с GPU NVIDIA H100, показали драматическую разницу в реакции модели на удаление компонентов. Ранние слои (от 0 до 9) и средние слои (от 10 до 29) оказались крайне хрупкими. Попытка удалить здесь даже небольшие по значимости «эксперты» приводила к резкому падению качества ответов.

В противовес этому, последние слои модели (30–39), и особенно самые глубокие (35–39), проявили высокую устойчивость. Исследователи обнаружили, что в этих зонах можно агрессивно фильтровать экспертов с низкой активацией, не нанося существенного ущерба итоговому результату. Это противоречит интуитивному представлению о том, что каждый слой вносит равноценный вклад в формирование ответа.

Результаты в цифрах

На контрольной задаче перевода кода (XLCoST) в рамках исследования с 300 тестовыми запросами была продемонстрирована эффективность нового подхода. Если применять равномерное удаление 30% экспертов во всех слоях, модель теряет до 50% качества, выдавая только 150 из 300 «хороших или похожих» ответов.

Использование стратегии, ориентированной на удаление экспертов только в поздних слоях, позволило убрать от 640 до 1145 экспертов при сохранении качества на уровне 249–255 из 300 успешных ответов. На еще более строгом тесте из 500 запросов узкая стратегия, затронувшая только слои 35–39 (удаление 50% экспертов в этих зонах), сохранила качество на уровне 419 из 500 ответов, при этом в общей сложности было задействовано и удалено лишь 640 экспертов из возможных 10 240.

Сокращение ширины маршрутизации

Помимо фильтрации существующих экспертов, исследователи также изучили возможность сокращения ширины маршрутизации (top-k routing). Это параметр определяет, сколько экспертов активируется для обработки одного токена. Стандартная настройка для модели — 8 активных экспертов.

Переход к режиму с 6 активными экспертами показал впечатляющие результаты в краткосрочных тестах. Стена-часовое время выполнения задач сократилось значительно, при этом качество переводов (Good+Similar) осталось неизменным. Однако исследователи отмечают, что этот метод пока не всегда гармонично сочетается с агрессивным маскированием экспертов, требуя дальнейшей оптимизации для совместного применения.

К чему приведет это открытие?

Научное сообщество получает новый эмпирический фундамент для так называемой «физической нейрохирургии» моделей. Вместо того чтобы обучать гигантские архитектуры с нуля, оптимизировать их можно постфактум, используя активацию для оценки важности отдельных компонентов.

Подход позволяет говорить о практическом пути к созданию более компактных моделей, которые будут использовать меньше памяти и энергии, оставаясь при этом способными решать сложные задачи инженерного и научного перевода. Это не просто оптимизация, а качественное изменение подхода к проектированию архитектур следующего поколения.

*Примечание: Данная статья основана исключительно на опубликованных данных работы arXiv:2608.13565. Личный опыт авторов или гипотезы о будущем применения за пределами представленных цифр не включаются в отчет.*

Первоисточники

arXiv cs.AI
← Вернуться в эфир