Где искать «умные» слои у модели: эксперимент с градиентами против активаций
Гипотеза о том, что для каждого типа контента можно выделить уникально «активные» слои нейросети, была проверена на модели Qwen3-1.7B. Результаты показали: статика активаций не видит тематики, а градиенты фиксируют общие архитектурные узлы, но не различают домены. Выборочный тон-тюнинг, основанный на «умных» слоях, в текущей реализации не дает прироста качества.

# Где искать «умные» слои у модели: эксперимент с градиентами против активаций
В эпоху, когда дообучение больших языковых моделей (LLM) становится стандартом, инженеры ищут способы оптимизировать процесс без потери точности. Одним из популярных направлений является метод LoRA (Low-Rank Adaptation), который добавляет небольшие адаптеры к линейным слоям трансформера. Традиционный подход предполагает применение этих адаптеров ко всем слоям модели, независимо от их активности во время обработки конкретного запроса.
Возникает логичный вопрос: раз разные слои модели задействованы с разной интенсивностью при чтении текста, не стоит ли ограничиться только наиболее «умными» или активными для текущей задачи слоями? Это должно ускорить обучение и сэкономить ресурсы. Однако есть предположение, что попытка игнорировать остальные слои может ухудшить способность модели к генерации.
Чтобы разобраться в этом, был проведен эксперимент на модели Qwen3-1.7B. Исследование опирается на работы, в частности статью Act‑LoRA, но добавляет новые метрики и статистическую проверку, чтобы отделить реальный сигнал от шума архитектуры.
Активации: статика, которая не видит контекст
Первая проверка гипотезы заключалась в анализе L2-норм активаций слоев. Логика метода Act‑LoRA такова: если слой активно «горит» при обработке промпта, значит он важен для этой задачи.
Для эксперимента были подготовлены корпуса текстов, разделенные по тематикам, но похожие по жанру, чтобы исключить влияние стиля изложения: медицинские абстракты из PubMed, физические статьи с arXiv и фрагменты кода Python. Также был использован нейтральный корпус для контроля.
Авторы предыдущих исследований предполагали, что активации отражают структуру, заложенную при предобучении. Эксперимент подтвердил этот вывод: при расчете средних активаций для медицины, физики и кода полученные рейтинги слоев оказались практически идентичными.
Набор топ-10 наиболее активных слоев для всех трех тематик совпал полностью: слои 18, 19, 20, 21, 22, 23, 24, 25, 26 и 27. Это означает, что метрика активаций не обладает тематической чувствительностью. Модель одинаково «светится» в одних и тех же зонах, независимо от того, о чем ей нужно рассказать. Следовательно, выбор слоев только по активации не позволит создать специализированный адаптер.
Градиенты: где скрыт шум оптимизации
Поскольку активации не показали различий, исследователи перешли к анализу градиентов лосса. В отличие от активаций, показывающих состояние в прямом проходе, градиенты зависят от разницы между предсказанием модели и целью. Теоретически, если модель плохо справляется с определенной темой, градиенты должны быть сильнее в слоях, отвечающих за эту задачу.
Методика включала расчет нормы градиентов по всем слоям после прогона текстов из различных доменов. Как и ожидалось из анализа данных, результат не стал однозначным победителем. В среднем, топ-10 слоев по значению градиентов также оказался очень похож для медицины, физики и кода, различаясь лишь в одном-двух случаях.
Здесь важно разделять два понятия: сигнал (различие между доменами) и шум (различие между случайными выборками данных). Статистический анализ с использованием коэффициента корреляции Кендалла и меры Жаккара показал, что внутри одной тематики (например, разные статьи физики) ранжирование слоев остается стабильным (высокая корреляция между выборками). Однако при переходе от одной тематики к другой (например, физика → код) ранжирование меняется значительно.
Это указывает на то, что градиентная метрика действительно не фиксирует специфическую «умную» структуру для каждой темы. Скорее всего, наблюдаемые различия вызваны шумом оптимизации или естественной вариабельностью данных, а не фундаментальным разделением труда между слоями модели в зависимости от предметной области.
Выводы и практическое значение
Эксперимент привел к интересному выводу: доменный эффект (связь темы с определенным слоем) существует, но он скрыт в относительных весах внутри набора слоев, а не в отборе отдельных «лидеров».
Модель Qwen3-1.7B демонстрирует устойчивое ядро активных слоев, которое одинаково задействовано при решении задач в медицине, физике и программировании. Попытка отобрать «топ-К» слоев на основе статической активации или градиентных норм приведет к тому, что мы случайно выберем те же самые слои, что и в полном дообучении, либо потеряем важные компоненты, необходимые для общей логики модели.
Именно поэтому, при выборе стратегии тонкой настройки (fine-tuning) на малых данных, использование полного набора слоев LoRA часто остается более надежным вариантом, чем попытка оптимизировать выбор слоев. Экономия вычислительных ресурсов на этапе отбора слоев не оправдана, так как она может привести к деградации качества модели на общих задачах или отсутствии прироста на узкоспециализированных данных.
Технический нюанс, упомянутый в исследованиях, касается также устойчивости метрик. Градиентные нормы, хотя и информативнее активаций в контексте обучения, менее стабильны и подвержены влиянию инициализации и сходимости оптимизации. Это делает их применение в качестве статического фильтра для выбора слоев рискованным.
В будущем, возможно, появятся методы, способные динамически отслеживать важность слоев в процессе обучения, но в текущей статике модель ведет себя более целостно, чем предполагают упрощенные теории локализации функций. Для разработчиков, планирующих внедрение LoRA, рекомендация остается классической: охватывать модель равномерно, сохраняя баланс между эффективностью и качеством вывода.