искусственный интеллект · квантование · LLM · нейросети · оптимизация · Hugging Face8 сентября в 00:32 · 5 мин

Трансформер меньше и точнее: метод квантовосознательного исцеления

Команда Multiverse Computing представила новый подход к сжатию языковых моделей, который превращает квантование из источника ошибок в возможность улучшить точность. Используя метод «квантовосознательного исцеления» (QAH), исследователи создали 4-битную модель с 60 миллиардами параметров, которая опередила свою 16-битную версию высокого разрешения на 7 из 9 ключевых бенчмарков.

4-битная модель как кристалл над морем у каменного маяка

# Квантовосознательное исцеление: когда сжатая модель мощнее оригинала

Создание компактных нейросетей традиционно связано с компромиссами. Стандартная процедура оптимизации включает в себя два этапа: архитектурное сжатие (удаление слоев и нейронов) и квантование весов (сокращение битности с 16 до 4). Несмотря на значительную экономию памяти и вычислительных ресурсов, этот путь неизбежно ведет к деградации способности модели к логическому мышлению, решению математических задач и генерации кода.

Для исправления этого эффекта индустрия применяет процедуру, называемую «исцелением» (healing). Однако новые исследования, опубликованные на платформе Hugging Face, демонстрируют, что стандартные методы реабилитации часто неэффективны. Команда Multiverse Computing разработала технологию, позволяющую сжатой модели превзойти свои полноразмерные аналоги по точности.

Почему стандартные методы исцеления не работают

Существующие подходы к восстановлению функций модели обычно разделяют стратегии на две группы: обучение с квантованием (Quantization-Aware Training, QAT) и квантовосознательную дистилляцию (Quantization-Aware Distillation, QAD).

QAT требует повторного запуска процесса дообучения модели. В процессе обучения в сеть вводятся имитационные операторы квантования, заставляя веса адаптироваться к низкой точности. Однако этот метод требует значительных вычислительных ресурсов и времени. Кроме того, исследования показывают, что продолжительное обучение может привести к нестабильности результатов и резкому падению метрик после достижения пика.

QAD предлагает альтернативу, используя дистилляцию знаний. Вместо пересмотра задачи, модель учится копировать выводы «учителя» — большой полноразмерной нейросети — через функцию расхождения Кульбака-Лейблера (KL-divergence). Эта методология эффективна, если существует эталонная модель той же архитектуры, зафиксированная в высоком разрешении.

Проблема возникает, когда модель уже подверглась структурному сжатию. В такой ситуации полноценной эталонной версии меньшей архитектуры не существует. Единственным кандидатом на роль учителя становится уже восстановленная 16-битная модель, которая сама по себе является лишь приближением оригинала. Таким образом, квантованная «ученическая» модель вынуждена стремиться к уже искаженной цели, что ограничивает ее потенциальную точность.

Новый подход: QAH и прямой доступ к оригиналу

Метод квантовосознательного исцеления (QAH) от Multiverse Computing устраняет это ограничение, меняя саму логику обучения. В этой схеме «ученик» — это сжатая 4-битная модель с 60 миллиардами параметров, а в качестве учителя выступает полная версия модели на 120 миллиардов параметров, работающая в бавитовом формате (bfloat16).

Ключевое нововведение заключается в том, что учитель и ученик используют разную архитектуру. В отличие от классической дистилляции, где модели схожи, QAH позволяет передавать знания между моделями разного размера. Поскольку распределение выходов учителем не зависит от его архитектуры, информация передается корректно, несмотря на различия в количестве параметров.

Уникальность QAH в том, что он не воспринимает квантование как неизбежное последствие сжатия. Напротив, это дополнительный этап обучения, во время которого сжатая модель получает те знания, которые не успели или не смогли перенести предыдущие этапы восстановления. Более того, использование функции KL-divergence обеспечивает большую стабильность: модель перестает «дрейфовать» после того, как успешно скопирует учителя, тогда как методы, основанные на минимизации кросс-энтропии, продолжают толкать веса к перенастройке.

Для работы с большими контекстами (до 32 тысяч токенов) исследователи применили оптимизированную версию функции потерь, которая обрабатывает данные порционно, экономя память графического процессора.

Результаты: превосходство над 16-битной версией

Эксперименты были проведены на базе модели gpt-oss-120b, которая была сначала сжата до 60 миллиардов параметров, восстановлена в 16-битном формате, а затем подвергнута квантованию MXFP4 с применением метода QAH.

Сравнивая полученный 4-битный чекпоинт с его 16-битным аналогом, команда Multiverse Computing зафиксировала превосходство на 7 из 9 протестированных бенчмарков. При этом наиболее значимые улучшения пришлись именно на те способности, которые страдают от сжатия сильнее всего:

* Рассуждение в длинном контексте (AA-LCR): Показатели выросли на 7,4 пункта. Сжатая модель достигла 42,7 против 35,3 у 16-битной версии. Это значит, что модель, занимающая четверть от веса оригинала, справляется с логическими цепочками лучше, чем более тяжелая 16-битная версия. * Математика (AIME 2025): Прирост составил 5,6 пунктов (76,3 против 70,7). * Генерация кода (Aider, LiveCodeBench): Улучшения составили от 2,3 до 2,7 пунктов. * Научные знания (GPQA Diamond): 67,4 против 65,7 у восстановленной версии.

Интересно отметить, что сжатая модель также оказалась лучше и полной версии учителя (120B) в задачах генерации кода (LiveCodeBench) и близка к ней в сложных научных вопросах (GPQA Diamond).

Малое отставание зафиксировано только на бенчмарках MMLU-Pro и SciCode, где разница составляет менее полутора пунктов. Исследователи связывают это с фундаментальными ограничениями сжатия архитектуры, но утверждают, что в абсолютном большинстве задач экономия памяти перевешивает незначительную потерю в узких нишах.

Практические выводы для индустрии

Разработка Multiverse Computing демонстрирует принципиальный сдвиг в понимании эффективности нейросетей. Традиционно квантование рассматривалось как плата, которую необходимо заплатить за возможность размещения модели на менее мощном оборудовании. Новый метод превращает это ограничение в преимущество.

Сравнивая 4-битную модель QAH и её 16-битный предшественник, видно, что первая требует в четыре раза меньше памяти для весов и вычислений на токен. Учитывая сокращение количества параметров с 120 до 60 миллиардов, совокупная экономия ресурсов приближается к восьмикратному показателю по сравнению с оригиналом.

Кроме того, метод QAH показывает высокую устойчивость во время обучения. Если процесс квантовосознательной дистилляции (QAT) требует тщательного контроля остановки, чтобы избежать падения метрик, то модель, обученная с помощью QAH, достигает стабильного пика уже на 100-й итерации и сохраняет его, не требуя дополнительного внимания. Это делает деплой более надежным и предсказуемым процессом.

В будущем подобные методы могут стать стандартом для распределения моделей в условиях ограниченных ресурсов, позволяя запускать мощные LLM на edge-устройствах без потери критически важных когнитивных способностей.

Первоисточники

Hugging Face Blog
← Вернуться в эфир