AutoSynthData: Как создаются учебные задачи для корпоративных ИИ-агентов
Разработка ИИ-агентов для корпоративной среды сталкивается с проблемой отсутствия качественных данных для обучения. Команда ServiceNow-AI представила AutoSynthData — систему, которая автоматически генерирует обучающие задачи, анализируя слабости модели и используя «старшие» модели для создания проверенных примеров решений. Этот подход позволяет целенаправленно заполнять пробелы в знаниях агента, адаптируя их под реальные бизнес-процессы.
# AutoSynthData: Генерация обучающих данных для корпоративных агентов
В мире корпоративных систем ИИ-агенты часто терпят неудачи не из-за нехватки общих знаний, а из-за несоответствия их действий специфике внутренней среды компании. Модели могут отлично справляться с общими запросами, но терять эффективность при работе с уникальными рабочими процессами (workflows), внутренними API или строгими корпоративными правилами. Переводить эти специфические провалы в полезные данные для дообучения — сложная задача. Система AutoSynthData, разработанная командой ServiceNow-AI, предлагает решение: автоматизированный пайплайн, который превращает ошибки модели в структурированный учебный материал.
Методология основана на идее динамического поиска границ возможностей модели. Генератор задач не создает случайные запросы, а целенаправленно формирует сценарии, где модель совершает ошибку, но решение для неё возможно. Ниже описана архитектура системы, её принципы работы и результаты экспериментов.
Что делает задачу полезной для обучения?
Чтобы ИИ-агент научился решать конкретные задачи в корпоративной среде, ему нужны примеры, которые соответствуют трём критическим параметрам: возможность выполнения, реалистичность и сложность.
* Возможность выполнения (Feasibility): Задача должна решаться в рамках текущих инструментов и ограничений среды. Если для выполнения запроса недоступны необходимые данные или закрыты нужные API, обучение будет бесполезным, так как модель не сможет обрести навык, который физически нельзя применить. * Реалистичность (Realism): Запрос пользователя должен имитировать естественное поведение человека в данной системе. Пространство всех теоретически возможных действий агента намного шире, чем пространство реально используемых рабочих процессов. Данные должны отражать типичные сценарии. * Сложность (Difficulty): Для эффективного обучения задачи должны попадать в «серую зону» — они должны быть сложными для текущей модели, но решаемыми для более совершенной модели-учителя. Если модель уже решает задачу идеально, она не получит нового сигнала для улучшения.
Кроме этого, критически важна роль верификатора — компонента, который проверяет успешность выполнения задачи. Он должен быть согласован с инструкциями системы, отсеивать неверные решения и принимать все допустимые варианты ответа, а не только один эталонный путь.
От ошибок к учебной программе
Центральный принцип AutoSynthData — использование провалов целевой модели как источника сигнала. Система работает по итерационному циклу:
1. Диагностика: В корпоративной среде (например, в симуляторе EnterpriseOps Gym) запускаются диагностические задачи для целевой модели и более мощной «учительской» модели. 2. Анализ разрывов: Система сравнивает результаты. Если целевая модель проваливает задачу, а учительская решает её, система анализирует, какой именно навык был задействован (какие инструменты использовались, какая структура рабочего процесса). 3. Формулировка спецификации: На основе этого анализа создаются карточки возможностей (capability specification cards). Они описывают, что нужно учить, но скрывают конкретные промпты, сущности или пути решения оригинальных задач. 4. Генерация: Генератор создаёт новые, уникальные задачи на основе этих карточек. В них варьируются начальные состояния среды, набор инструментов, формулировки запросов и комбинации шагов.
Этот процесс позволяет смещать «учебную программу» (curriculum) по мере улучшения модели. Когда одна группа задач становится простой, система переключается на новые, более сложные сценарии, оставаясь в пределах возможностей учителя.
Контроль качества: от образца до партии
Просто сгенерировать текст или команду недостаточно. Качество синтетических данных в корпоративной среде требует двухуровневой проверки.
Проверка уровня образца (Sample-level verification) Каждый кандидат на вход в обучающий набор проходит строгий цикл: * Положительная верификация: Реализуется эталонное решение (релевантное траекторию учителя) в среде, и проверяется, достигнут ли требуемый конечный результат. * Отрицательная верификация: Проверяется, что неверные варианты ответов действительно отвергаются верификатором. Это исключает случаи, когда система ошибочно поощряет неправильное поведение. * Критика и ремонт: Если кандидат не проходит проверку, система критики анализирует причину (противоречия в состоянии, невозможный рабочий процесс, слабый верификатор). Вместо полной пересоздания задачи, система проводит целевой ремонт, и кандидат проходит проверку заново.
Проверка уровня партии (Batch-level review) Даже если каждый образец верен, набор данных может быть предвзятым. Мета-обзор анализирует партии данных на предмет: * Чрезмерного представления одних типов задач. * Пропуска важных аспектов способностей. * Повторения одних и тех же паттернов.
Контроллер генерации использует эти данные для перераспределения ресурсов: снижая генерацию в перенасыщенных областях и направив усилия на заполнение пробелов.
Эксперименты в EnterpriseOps Gym
Команда ServiceNow-AI тестировала AutoSynthData на платформе EnterpriseOps Gym, моделирующей корпоративные среды. В экспериментах использовалась модель Gemma-4-26B-A4B-it в качестве целевой модели.
Среда Hybrid * Набор данных: Было сгенерировано около 2000 синтетических образцов за 18 часов. * Результаты: Дообучение модели привело к увеличению среднего показателя Pass@1 на 7,2 процентных пункта (рост на 35% относительно исходного уровня). Успешность верификатора выросла с 63% до 68,55%. * Вывод: Система успешно закрыла 59% разрыва в производительности между исходной моделью и эталонной моделью в этой среде.
Среда ITSM (Управление инцидентами) * Набор данных: Сгенерировано 1994 образца за 66 часов (затраты времени были выше из-за использования более мощной учителской модели DeepSeek-V4.1-Flash). * Результаты: Средний показатель Pass@1 вырос с 18,77% до 27,18%. * Вывод: Методология демонстрирует применимость в различных доменах корпоративного программного обеспечения.
Заключение
AutoSynthData демонстрирует, что создание данных для корпоративных ИИ-агентов должно быть не случайным, а системным процессом, основанным на обратной связи от среды выполнения. Такой подход позволяет избежать трат ресурсов на генерацию бесполезных данных и целенаправленно улучшать компетенции моделей там, где они реально необходимы бизнесу. Как отмечают авторы, этот цикл можно применять как для обучения с подкреплением (RL), так и для супернастраивания (SFT), постепенно поднимая уровень сложности задач вместе с возможностями модели.
*Наблюдая за развитием агентов в промышленных масштабах, кажется, что ключ к успеху не в бесконечном увеличении размера языковой модели, а в умении создать для неё точную, проверенную карту её собственного окружения.*