ИИ · Обучение с подкреплением · MLOps · Исследования · Нейросети · Математические задачи · Архитектура моделей · arXiv31 июля в 09:31 · 4 мин

Структура мышления больших моделей: почему обучение с подкреплением работает лучше, чем простое обучение с учителем

Новое исследование на arXiv выявляет глубокие различия в внутренней архитектуре нейросетей, обученных методом обучения с подкреплением (RL) и с учителем (SFT). Эксперименты показывают, что RL не просто улучшает точность, а фундаментально перестраивает то, как модели обрабатывают математические задачи, создавая иерархическую структуру, где глубокие слои играют критическую роль.

# Происхождение логики: что происходит внутри модели при решении математических задач

В мире развития искусственного интеллекта наблюдается очевидный факт: модели, отточенные методом обучения с подкреплением (Reinforcement Learning, RL), регулярно демонстрируют превосходство над моделями, обученными лишь с учителем (Supervised Fine-Tuning, SFT), в задачах, требующих сложного рассуждения. Однако, как именно достигается этот результат, долгое время оставалось загадкой. Новое исследование, опубликованное на платформе arXiv, отменяет эту неопределенность, вскрывая внутренние механизмы, которые заставляют одни модели мыслить глубже, а другие — просто запоминать шаблоны.

Линейно разделяемые представления: качество структуры

Одной из главных находок работы является анализ так называемых «скрытых состояний» нейросети. Исследователи использовали метод линейных проб (linear probes), чтобы проверить, насколько точно скрытые слои модели могут предсказать правильность ответа. Результат оказался показательным: у моделей с RL эти слои обладают более высокой структурой и линейной разделимостью. Простыми словами, это означает, что внутри модели информация о правильном и неправильном ответе выстроена в четкие, понятные паттерны, которые легко интерпретировать. В то время как модели SFT сохраняют данные более хаотично и менее структурировано.

Этот феномен можно представить как сравнение библиотеки. В модели SFT книги (информация) могут быть разбросаны по этажам в случайном порядке. В модели RL же книги сформулированными правилами логики расположены строго по полкам. Такая структура значительно облегчает процесс поиска правильного решения, делая модель более эффективной в задачах, выходящих за рамки простого повторения обучающей выборки.

Иерархическая архитектура против равномерного распределения

Вторым ключевым открытием стало наблюдение за тем, как модели распределяют вычислительную нагрузку между своими слоями. У моделей, обученных методом SFT, важность каждого слоя распределена относительно равномерно. Ни один этаж здания их знаний не выделяется特别 сильно. Напротив, модели, прошедшие этап обучения с подкреплением, развивают истинную иерархию. В них нижние слои (первые этажи) отвечают за базовые вычисления, а глубокие слои (верхние этажи) становятся критически важными для финальных рассуждений и обобщения.

Это изменение фундаментально меняет способ обработки информации. Если представить рассуждение как восхождение по лестнице, то SFT модель стоит на каждом ступеньке с одинаковым усилием, не опираясь на прочный фундамент высшего интеллекта. RL же учит модель полагаться на вершину этой лестницы, где происходит синтез всех предыдущих этапов мышления. Именно эта иерархия позволяет RL моделям справляться с задачами, требующими многошаговой логики.

Адативное распределение вычислений и стабильность решений

Исследователи также провели анализ того, как модели распределяют ресурсы (токены) при решении одной и той же задачи многократно. Здесь результаты оказались неоднозначными. Некоторые модели с RL показывали высокую вариативность в потреблении вычислительных ресурсов, то есть они «колебались» в подходах к решению. Это может указывать на неустойчивость их политики действий — модель ищет решение, но не знает наверняка, какой путь приведет к успеху.

В других случаях, особенно у моделей с устойчивой политикой, наблюдалась сильная согласованность. Это говорит о том, что вариативность распределения токен-счета зависит не столько от выбора между RL и SFT, сколько от общего пайплайна обучения. Исследователи делают вывод, что эта вариативность раскрывает «разброс» возможных траекторий рассуждения. Модели с низкой вариативностью демонстрируют стабильное поведение, тогда как модели с высокой вариативностью могут проявлять неопределенность, граничащую с неидентифицируемостью решения. Другими словами, они могут предлагать множество разных путей решения, но не всегда понимать, какой из них является единственным правильным.

Вывод: RL меняет природу модели

В совокупности эти данные подтверждают, что переход от SFT к RL — это не просто техническая доработка, а качественное изменение в природе модели. Обучение с подкреплением перестраивает внутреннюю карту знаний, делая её более структурированной, иерархичной и устойчивой. Это открытие важно не только для разработчиков, но и для понимания того, как компьютеры начинают мыслить подобно людям: через выстраивание иерархий и использование глубоких слоев для синтеза сложных выводов. Пока мы изучаем эти механизмы, понимание того, что лежит в основе их успехов, становится не просто полезным, но необходимым шагом на пути к созданию более прозрачных и надежных систем искусственного интеллекта.

Первоисточники

arXiv cs.AI
← Вернуться в эфир