ИИ · IBM Granite · Large Language Models · Machine Learning · Agentic AI · Software Engineering29 августа в 18:32 · 5 мин

IBM Granite 4.2: Как строятся модели для глубокого рассуждения и агентных действий

IBM выпустила новую семейную линию языковых моделей Granite 4.2, сфокусированную на логике и самостоятельном выполнении задач. Представленные модели (3B, 8B и 30B параметров) прошли сложный путь обучения: от предобучения на 15 триллионах токенов до многоступенчатой системы обучения с подкреплением. Главная особенность семейства — возможность переключения между режимами работы и способность «агентов» взаимодействовать с реальными инструментами и средами.

Прозрачная сфера морского стекла парит в туманном подводном архиве.

# Granite 4.2: Архитектура рассуждений и агентов

Фамилия IBM получила обновление: вышли модели семейства Granite 4.2. Это не просто новые версии ассистентов, которые умеют писать код или отвечать на вопросы, это инструменты, спроектированные специально для рассуждения (reasoning) и агентности (agency). В отличие от предыдущих релизов, ориентированных на следование инструкциям, Granite 4.2 умеет строить цепочки мыслей перед выдачей ответа и принимать решения, когда задача требует более глубокого анализа.

Семейство состоит из трех плотных (dense) моделей размером 3 миллиарда, 8 миллиардов и 30 миллиардов параметров. Они поддерживаются под лицензией Apache 2.0 и доступны для коммерческого использования.

Архитектура и основы предобучения

Технически все модели в семействе Granite 4.2 построены на одинаковой архитектуре — плотный трансформер, работающий только на декодере (decoder-only). Это обеспечивает высокую эффективность и предсказуемость генерации текста. Ключевые особенности архитектуры:

* Внимание: Используется групповое запросное внимание (Grouped Query Attention) с 40 головами внимания и 8 головами контекстной памяти (KV heads). Это позволяет эффективно обрабатывать длинные последовательности. * Контекстное окно: Модели обучены работать с последовательностями длиной до 131 072 токенов, но базовая предобучающая стратегия позволила расширить окно контекста до 512 000 токенов. Это критично для задач, требующих анализа огромных документов. * Масштаб данных: Каждая модель обучалась «с нуля» на приблизительно 15 триллионов токенов. Стратегия предобучения включала пять фаз, где данные постепенно менялись от общих веб-источников к более качественным и отфильтрованным материалам.

Режимы работы

Одной из главных инноваций стало введение переключателя режимов работы. Пользователи могут выбрать:

1. Thinking Mode (Режим рассуждения): Модель тратит вычислительные ресурсы на построение промежуточных шагов (chain-of-thought), прежде чем дать финальный ответ. Это улучшает точность в сложных логических и математических задачах. 2. Non-Thinking Mode (Обычный режим): Стандартное быстрое реагирование без глубокого анализа, подходящее для простых запросов. 3. Low-Effort Thinking: Компромиссный режим, где модель использует ограниченный бюджет рассуждений для простых вопросов, экономя ресурсы.

Все модели поддерживают нативное вызов инструментов (tool calling) в формате OpenAI, что позволяет им взаимодействовать с внешними API и функциями.

Обучение с подкреплением: путь от навыков к действиям

Самая значимая часть разработки — это многоступенчатый пайплайн обучения с подкреплением (Reinforcement Learning, RL). Процесс не был линейным; он состоял из множества независимых этапов, каждый из которых совершенствовал определенную способность модели.

Базовое обучение (Foundational RL)

Первым этапом для всех моделей стал RLVR (Verifiable Rewards) — обучение с проверочными наградами. На этом этапе модель учится решать задачи с четким верифицируемым ответом: математика, программирование, наука. Система использует объективные проверки, такие как прохождение скрытых тестов или форматирование кода, чтобы поощрять правильные ответы.

Затем следовали короткие «бустеры» навыков (Skill Boosters), которые фокусировались на конкретных аспектах: многополярные диалоги, структурированный вывод и оптимизация кода. Здесь применялся мягкий штраф (KL penalty), чтобы модель не слишком сильно отклонялась от своего предыдущего состояния, сохраняя уже acquired знания.

Агентное обучение (Agentic RL)

Уникальной чертой моделей 8B и 30B является блок агентного обучения, который отсутствует в версии 3B. На этом этапе модель учится не просто отвечать, а действовать в реальной среде.

Процесс включал три ключевые фазы, каждая из которых была самостоятельной тренировкой в конкретной «песочнице»:

1. SWE Agent (Software Engineering): Модель работает в реальном репозитории кода в изолированном контейнере. Она читает файлы, вносит правки и запускает тесты. Награда выдается только тогда, когда все скрытые тесты проходят успешно. Это учит модель системному мышлению и отладке. 2. Terminal Agent: Модель получает задачи, требующие выполнения команд в терминале. Она должна планировать последовательность действий, наблюдать вывод команд и восстанавливаться при ошибках. Это фаза, где модель действительно управляет операционной системой. 3. Search Agent: Для решения сложных вопросов модели требуется глубокий поиск в интернете. Она должна находить информацию, перепроверять факты и синтезировать ответ. Здесь используется награда от другой модели (LLM judge), так как правильность ответа в открытых вопросах сложно проверить автоматически.

Для всех агентов используется алгоритм GRPO (Group Relative Policy Optimization), который позволяет эффективно оценивать качество действий без необходимости строить отдельную оценочную сеть.

Контроль качества и финальное выравнивание

Перед тем как данные попадут в процесс обучения, они проходят строгий контроль. Микс данных для SFT (обучения с учителем) содержит около 7,2 миллиона образцов, из которых значительная часть (более 30%) связана с агентными задачами. Данные нормализуются, фильтруются с помощью других крупных моделей (включая GPT-OSS-120B) для удаления галлюцинаций и неверных вызовов инструментов, а затем дедуплицируются.

Финальным этапом для всех моделей является обучение с подкреплением с участием человека (RLHF). На этом этапе используется генеративная наградная модель для оценки предпочтений людей и отдельная система безопасности для предотвращения джейлбрейков. Это обеспечивает безопасное и полезное поведение моделей в финальной сборке.

Результаты и применение

Granite 4.2 представляет собой переход от простых чат-ботов к полноценным агентам, способным решать инженерные задачи, исследовать код и анализировать открытые источники. Модели уже интегрированы в платформы вроде OpenCode Pi и OpenHands, что демонстрирует готовность к использованию в сложных рабочих процессах. Благодаря открытой лицензии и поддержке библиотек типа vLLM и SGLang, сообщество разработчиков имеет полный доступ к моделям и их использованию.

Первоисточники

Hugging Face Blog
← Вернуться в эфир