IBM Granite 4.2: Как строятся модели для глубокого рассуждения и агентных действий
IBM выпустила новую семейную линию языковых моделей Granite 4.2, сфокусированную на логике и самостоятельном выполнении задач. Представленные модели (3B, 8B и 30B параметров) прошли сложный путь обучения: от предобучения на 15 триллионах токенов до многоступенчатой системы обучения с подкреплением. Главная особенность семейства — возможность переключения между режимами работы и способность «агентов» взаимодействовать с реальными инструментами и средами.

# Granite 4.2: Архитектура рассуждений и агентов
Фамилия IBM получила обновление: вышли модели семейства Granite 4.2. Это не просто новые версии ассистентов, которые умеют писать код или отвечать на вопросы, это инструменты, спроектированные специально для рассуждения (reasoning) и агентности (agency). В отличие от предыдущих релизов, ориентированных на следование инструкциям, Granite 4.2 умеет строить цепочки мыслей перед выдачей ответа и принимать решения, когда задача требует более глубокого анализа.
Семейство состоит из трех плотных (dense) моделей размером 3 миллиарда, 8 миллиардов и 30 миллиардов параметров. Они поддерживаются под лицензией Apache 2.0 и доступны для коммерческого использования.
Архитектура и основы предобучения
Технически все модели в семействе Granite 4.2 построены на одинаковой архитектуре — плотный трансформер, работающий только на декодере (decoder-only). Это обеспечивает высокую эффективность и предсказуемость генерации текста. Ключевые особенности архитектуры:
* Внимание: Используется групповое запросное внимание (Grouped Query Attention) с 40 головами внимания и 8 головами контекстной памяти (KV heads). Это позволяет эффективно обрабатывать длинные последовательности. * Контекстное окно: Модели обучены работать с последовательностями длиной до 131 072 токенов, но базовая предобучающая стратегия позволила расширить окно контекста до 512 000 токенов. Это критично для задач, требующих анализа огромных документов. * Масштаб данных: Каждая модель обучалась «с нуля» на приблизительно 15 триллионов токенов. Стратегия предобучения включала пять фаз, где данные постепенно менялись от общих веб-источников к более качественным и отфильтрованным материалам.
Режимы работы
Одной из главных инноваций стало введение переключателя режимов работы. Пользователи могут выбрать:
1. Thinking Mode (Режим рассуждения): Модель тратит вычислительные ресурсы на построение промежуточных шагов (chain-of-thought), прежде чем дать финальный ответ. Это улучшает точность в сложных логических и математических задачах. 2. Non-Thinking Mode (Обычный режим): Стандартное быстрое реагирование без глубокого анализа, подходящее для простых запросов. 3. Low-Effort Thinking: Компромиссный режим, где модель использует ограниченный бюджет рассуждений для простых вопросов, экономя ресурсы.
Все модели поддерживают нативное вызов инструментов (tool calling) в формате OpenAI, что позволяет им взаимодействовать с внешними API и функциями.
Обучение с подкреплением: путь от навыков к действиям
Самая значимая часть разработки — это многоступенчатый пайплайн обучения с подкреплением (Reinforcement Learning, RL). Процесс не был линейным; он состоял из множества независимых этапов, каждый из которых совершенствовал определенную способность модели.
Базовое обучение (Foundational RL)
Первым этапом для всех моделей стал RLVR (Verifiable Rewards) — обучение с проверочными наградами. На этом этапе модель учится решать задачи с четким верифицируемым ответом: математика, программирование, наука. Система использует объективные проверки, такие как прохождение скрытых тестов или форматирование кода, чтобы поощрять правильные ответы.
Затем следовали короткие «бустеры» навыков (Skill Boosters), которые фокусировались на конкретных аспектах: многополярные диалоги, структурированный вывод и оптимизация кода. Здесь применялся мягкий штраф (KL penalty), чтобы модель не слишком сильно отклонялась от своего предыдущего состояния, сохраняя уже acquired знания.
Агентное обучение (Agentic RL)
Уникальной чертой моделей 8B и 30B является блок агентного обучения, который отсутствует в версии 3B. На этом этапе модель учится не просто отвечать, а действовать в реальной среде.
Процесс включал три ключевые фазы, каждая из которых была самостоятельной тренировкой в конкретной «песочнице»:
1. SWE Agent (Software Engineering): Модель работает в реальном репозитории кода в изолированном контейнере. Она читает файлы, вносит правки и запускает тесты. Награда выдается только тогда, когда все скрытые тесты проходят успешно. Это учит модель системному мышлению и отладке. 2. Terminal Agent: Модель получает задачи, требующие выполнения команд в терминале. Она должна планировать последовательность действий, наблюдать вывод команд и восстанавливаться при ошибках. Это фаза, где модель действительно управляет операционной системой. 3. Search Agent: Для решения сложных вопросов модели требуется глубокий поиск в интернете. Она должна находить информацию, перепроверять факты и синтезировать ответ. Здесь используется награда от другой модели (LLM judge), так как правильность ответа в открытых вопросах сложно проверить автоматически.
Для всех агентов используется алгоритм GRPO (Group Relative Policy Optimization), который позволяет эффективно оценивать качество действий без необходимости строить отдельную оценочную сеть.
Контроль качества и финальное выравнивание
Перед тем как данные попадут в процесс обучения, они проходят строгий контроль. Микс данных для SFT (обучения с учителем) содержит около 7,2 миллиона образцов, из которых значительная часть (более 30%) связана с агентными задачами. Данные нормализуются, фильтруются с помощью других крупных моделей (включая GPT-OSS-120B) для удаления галлюцинаций и неверных вызовов инструментов, а затем дедуплицируются.
Финальным этапом для всех моделей является обучение с подкреплением с участием человека (RLHF). На этом этапе используется генеративная наградная модель для оценки предпочтений людей и отдельная система безопасности для предотвращения джейлбрейков. Это обеспечивает безопасное и полезное поведение моделей в финальной сборке.
Результаты и применение
Granite 4.2 представляет собой переход от простых чат-ботов к полноценным агентам, способным решать инженерные задачи, исследовать код и анализировать открытые источники. Модели уже интегрированы в платформы вроде OpenCode Pi и OpenHands, что демонстрирует готовность к использованию в сложных рабочих процессах. Благодаря открытой лицензии и поддержке библиотек типа vLLM и SGLang, сообщество разработчиков имеет полный доступ к моделям и их использованию.