искусственный интеллект · архитектура нейросетей · Mixture-of-Experts · алгоритм Хаффмана · архитектура модели24 июля в 13:01 · 3 мин

Маршрутизация в MoE как код Хаффмана: Закон частоты и разнообразия в цепочках размышлений

Архитектуры смесей экспертов (MoE) кардинально изменили масштабирование искусственного интеллекта, однако логика их маршрутизации оставалась загадкой. Новое исследование, опубликованное в базе arXiv, утверждает, что работа современных моделей не является случайным отбором ресурсов, а представляет собой проявление алгоритма Хаффмана. Ученые выявили фундаментальный принцип, который мы называем «Закон частоты и разнообразия»: для распространенных токенов модели эффективно используют мало ресурсов, тогда как для редких и сложных задач вызывают комитеты экспертов высокого разнообразия. Это открытие переосмысливает маршрутизацию как механизм сжатия информации, движимый принципом минимального описания.

# МоЕ-маршрутизация как код Хаффмана: Новый взгляд на работу нейросетей

Архитектуры смесей экспертов (Mixture-of-Experts или MoE) стали стандартом в разработке больших языковых моделей, позволяя создавать системы колоссального размера без непропорционального роста вычислительной сложности. Однако до недавнего времени внутренняя логика выбора, какие «эксперты» (подсети нейронов) будут отвечать на конкретный запрос, оставалась черным ящиком. Исследователи из группы, опубликовавшие работу в области вычислительного лингвистики (cs.CL), доказывают, что за этой «магией» стоят строгие законы информационной теории.

Закон частоты и разнообразия

Центральным открытием статьи «Is MoE Routing a Huffman Code? Discovering the Frequency-Diversity Law in Chain-of-Thought» стало выявление паттерна, напоминающего алгоритм сжатия данных Хаффмана. В этой алгоритме частые символы кодируются короткими последовательностями битов, а редкие — длинными.

Исследование показывает, что передовые модели, такие как Phi-3.5-MoE и Gemma-4-27B-A4B, действуют именно так: они спонтанно превращаются в информационно-теоретические двигатели. Когда нейросеть встречает распространенные паттерны данных (частые токены), она маршрутизирует запрос через узкие пути с малым количеством активированных экспертов. С другой стороны, при обработке редких, сложных задач, требующих цепочек размышлений (Chain-of-Thought), модель активирует комитеты экспертов высокого разнообразия. Это создает функциональную глубину, необходимую для решения нестандартных проблем.

*Умный редактор отмечает, что природа этих механизмов напоминает работу библиотеки, где популярные книги хранятся в легкодоступных корешках, а сложные архивные тома разбросаны по разным отделам, требуя от библиотекаря (процессора) поиска уникального пути.*

Тупик избыточности в Qwen3.5

Несмотря на общую закономерность, исследователи обнаружили критическую уязвимость в архитектуре Qwen3.5-35B-A3B. Проблема возникает, когда эффективная разреженность (k/E_eff) снижается до критического уровня. В этом случае стандартные механизмы балансировки нагрузки, призванные равномерно распределить вычислительную нагрузку, начинают вводить функциональную избыточность. Это создает «ловушку», скрывающий истинную эффективность, заложенную в алгоритме Хаффмана. Вместо того чтобы работать экономно, система дублирует функции, что маскирует её способность к сжатию информации.

Хирургическая стратегия: Subset Difference Pruning

Для преодоления этой проблемы авторы предлагают стратегию «Subset Difference Pruning» (Подгонка разностного подмножества). Этот подход описывается как хирургическая операция: метод позволяет безболезненно устранить функциональные дубликаты, не жертвуя качеством логических выводов. Результаты тестов показали, что такая чистка не ухудшает рассуждения модели, а, наоборот, высвобождает её скрытую эффективность Хаффмана, заставляя логику «схлопываться» в оптимизированные, высокоплотные пути обработки данных.

Будущее: от эвристики к MDL-оптимальности

Итоговый вывод работы меняет парадигму проектирования архитектуры нейросетей. Исследователи призывают следующий поколение MoE-моделей отказаться от насильственного балансирования нагрузки в пользу оптимизации по принципу минимального описания (Minimum Description Length или MDL). В идеальном мире маршрутизация будет присваивать краткие коды экспертов наиболее частой информации и длинные, разнообразные коды — редким данным. Таким образом, маршрутизация трансформируется из эвристического приема в принципиальный механизм сжатия, максимизирующий эффективность использования вычислительных ресурсов.

Первоисточники

arXiv cs.CL
← Вернуться в эфир