Искусственный интеллект · Большие языковые модели · Прореживание · Оптимизация · Физика спинов · Компьютерные технологии21 сентября в 17:03 · 5 мин

Проблема удаления блоков больших языковых моделей: физический подход оптимизации

Команда Multiverse Computing представила новый метод сжатия больших языковых моделей (LLM), основанный на принципах статистической физики. Авторы переосмыслили процесс удаления трансформерных блоков как задачу минимизации энергии в системе спинов (задача Исина), что позволило находить оптимальные конфигурации сжатия там, где традиционные методы теряют точность.

# Простирание границ оптимизации: как физика помогает обрезать нейросети

Технологии искусственного интеллекта часто развиваются по принципу «больше значит лучше»: больше параметров, больше слоев, больше вычислительной мощности. Однако с ростом масштабов моделей перед исследователями встает вопрос эффективности. Один из самых простых способов ускорить работу модели — удалить лишние слои, то есть применить «прореживание» (pruning). Но как решить, какие именно блоки удалить, не разрушив способность модели генерировать точные ответы?

Команда Multiverse Computing в своем новом исследовании предлагает неожиданный ответ на этот вопрос: использовать аппарат, созданный для изучения магнетизма. Они преобразуют сложную задачу выбора блоков нейросети в задачу поиска состояния с минимальной энергией в системе спинов, известной в физике как задача Исина.

Почему простое сравнение не работает

Традиционные методы прореживания обычно работают последовательно или независимо. Алгоритм оценивает каждый блок нейросети по отдельности (по их важности, чувствительности к изменениям или влиянию на итоговый результат) и удаляет те, которые кажутся наименее полезными. В терминах физики это напоминает «среднеполевую теорию», где взаимодействие между соседними элементами игнорируется, и каждый элемент рассматривается в усредненном поле.

Однако слои в современных больших языковых моделях не являются независимыми. Удаление блока №20 может кардинально изменить влияние соседнего блока №19. Эти взаимодействия, или «связи» (couplings), создают сложную сеть зависимостей, которую трудно описать простыми рейтингами. Когда нужно удалить значительную часть модели (например, половину), такие упрощения приводят к резкому падению качества. Задача превращается из линейного рейтинга в комбинаторную проблему с экспоненциально растущим пространством вариантов.

От машинного обучения к физике спинов

Исследователи из Multiverse Computing предложили математический подход, который переводит проблему в язык физики конденсированного состояния. Каждый трансформерный блок получает бинарную переменную: 0, если блок остается, 1, если он удаляется. Это аналогично тому, как в магните каждый атомный спин может быть направлен вверх или вниз.

С помощью вторичного развития Тейлора функции потерь модели авторы сконструировали матрицу гессиана. Диагональные элементы этой матрицы показывают индивидуальную важность каждого блока, а внедиагональные элементы описывают силу взаимодействия между ними. Таким образом, вопрос «какие блоки удалить?» трансформируется в задачу оптимизации:

Найти конфигурацию удалений, которая минимизирует энергию системы спинов, при условии фиксированного количества удаленных блоков.

В физике такая система называется «спиновым стеклом» (Ising glass) — системой со сложными взаимодействиями и множеством локальных минимумов. Ключевым открытием стало то, что энергия этой системы является надежным предиктором качества модели: состояния с низкой энергией соответствуют моделям, демонстрирующим высокие результаты на бенчмарках.

Это означает, что вместо того чтобы тестировать каждую возможную комбинацию блоков на полноценной валидационной выборке, можно просто вычислить «энергию» конфигурации. Это позволяет оценивать тысячи потенциальных вариантов за секунды, используя лишь один начальный расчет, а не запускать модель целиком.

Точные решения и квантовые симуляторы

Для большинства моделей пространство всех возможных комбинаций блоков все еще достаточно велико для полного перебора на современных графических процессорах. В тесте на модели Llama-3.3-70B-Instruct перебор более 29 миллиардов конфигураций занял около двух дней на одном GPU.

Однако когда число удаляемых блоков увеличивается, полный перебор становится невозможным. Здесь на помощь приходят методы, разработанные для решения задач оптимизации в физике, таких как квантовое отжигание или квантово-вдохновленные алгоритмы (например, алгоритм поиска запрета — tabu search). Эти инструменты способны находить хорошие, близкие к оптимальным, решения в сложном ландшафте энергии за доли секунды, даже если глобальный минимум найти невозможно.

Важно отметить, что в данной задаче нет необходимости найти абсолютное глобальное минимум энергии. Достаточно найти несколько состояний с низкими значениями энергии, чтобы выбрать лучший из них для финальной настройки.

Значение возбужденных состояний

Удивительным результатом исследования стало обнаружение того, что самая удачная конфигурация для сжатия модели часто не является основным (глобальным) минимумом энергии. В терминах физики, это «возбужденное состояние».

На примере модели Llama-3.1-8B-Instruct было показано, что основное состояние предлагает удалить блоки в конце модели, что интуитивно понятно, но не всегда эффективно. Среди возбужденных состояний модель нашла конфигурацию, удаляющую блок в начале архитектуры. После легкого дообучения (retraining) эта конфигурация превзошла основное состояние по нескольким ключевым метрикам. Этот факт доказывает, что поиск только одного идеального решения недостаточен — нужно исследовать весь спектр возможных состояний системы.

Практические результаты

Эксперименты проводились на трех различных моделях: Llama-3.1-8B-Instruct, Qwen3-14B и Llama-3.3-70B-Instruct. Метод оптимизации на основе задачи Исина (CBO) показал результаты, сопоставимые или превосходящие современные стандарты (state-of-the-art).

Наибольший выигрыш наблюдался при глубоком сжатии модели Llama-3.3-70B-Instruct без дополнительного дообучения. При удалении 40 из 80 блоков (50% глубины модели) предложенный метод сохранил точность на бенчмарке MMLU на уровне около 77%, в то время как лучшие существующие методы с использованием схожей стратегии упали до середины диапазона 50-60%.

Метод также успешно применялся к гетерогенным архитектурам, таким как NVIDIA-Nemotron-3-Nano-30B, где слои внимания и экспертов (MoE) переплетены. Исследование подтвердило, что избыточность в таких моделях распределена неравномерно, и только учет сложных взаимодействий между блоками позволяет найти эффективные точки для удаления.

Выводы

Превращение задачи машинного обучения в задачу физики спинов демонстрирует, как междисциплинарные подходы могут решать практические проблемы индустрии. Использование аппаратной и алгоритмической базы, созданной для квантовых и классических симуляторов, позволяет находить конфигурации сжатия моделей, которые недоступны для традиционных эвристических методов.

Код для воспроизведения результатов исследования доступен в открытом доступе, что позволит сообществу инженеров и исследователей интегрировать этот метод в свои пайплайны сжатия нейросетей.

Первоисточники

Hugging Face Blog
← Вернуться в эфир