Ускорение агентов ИИ: как метод предсказательных макросов сокращает время выполнения задач
Технологии, использующие больших языковых моделей (LLM) для взаимодействия с внешним миром через инструменты, сталкиваются с фундаментальной проблемой задержек: каждый вызов инструмента, переход в новой среде и получение ответа требуют времени, которое суммируется при выполнении сложных последовательностей. Новая методология, представленная в исследовании arXiv:2609.03236, предлагает решение под названием «Предсказательное макро-коммитирование» (Speculative Macro Commit, SMC). Этот подход позволяет агентам выполнять многошаговые операции быстрее, за счет параллельного прогнозирования и предварительного выполнения ряда действий в изолированной среде перед их финальным утверждением авторитетной моделью.

# Ускорение агентов ИИ: как метод предсказательных макросов сокращает время выполнения задач
В эпоху, когда большие языковые модели превращаются в автономных агентов, способных планировать и выполнять задачи, скорость их работы становится критическим фактором. Однако архитектура, в которой модель генерирует действие, система выполняет это действие в внешней среде (вызывает инструмент, отправляет запрос и т.д.), а модель ожидает результата, создает неизбежную последовательность задержек. Исследователи из области искусственного интеллекта предложили механизм, который обходит эти ограничения, позволяя агентам предугадывать многошаговые цепочки действий и заранее выполнять их.
Двухуровневая система и проблема «серии действий»
Центральной проблемой, которую решает новое исследование, является так называемая «стена времени» (wall-clock time), которую потребляет агент. Время тратится не только на вычислительные мощности самой модели для генерации текста, но и на серию циклов «действие-наблюдение». В традиционных схемах агент должен ждать окончания каждого отдельного шага перед тем, как предпринять следующий.
Для решения этой задачи была разработана система двух уровней. В основе лежит авторитетный модель (actor model) — в исследовании в качестве таковой используется крупная и точная модель Qwen3.5-27B в формате INT4. Эта модель отвечает за создание официального траектория действий, гарантируя правильность и безопасность решений.
Второй уровень — спекулятивный драфтер (speculative drafter). Это более легкая и быстрая версия модели (в исследовании применяется Qwen3.5-4B). Её задача — непрерывно предсказывать и выполнять будущие цепочки действий в изолированной копии (снапшоте) рабочей среды. Пока авторитетная модель занятая размышлением или ожидает данных, драфтер уже может «проигрывать» сценарий в уме, выполняя несколько шагов сразу.
Алгоритм макро-коммитирования: от предсказания к утверждению
Механизм, получивший название Speculative Macro Commit (SMC), работает по принципу проверки согласованности. Исследователи разработали библиотеку макросов, извлекая из истории обучений повторяющиеся скелеты многошаговых действий. Когда авторитетная модель выдает свое решение, система сверяет его с предсказанием драфтера.
Ключевой момент процесса — сопоставление. Если первое действие, запланированное авторитетной моделью, полностью совпадает с первым предсказанным шагом драфтера, система «коммитит» (утверждает) все последующие шаги, которые уже были выполнены драфтером в изолированной среде, вместе с полученными в них наблюдениями. Таким образом, вместо того чтобы выполнять действие А, ждать ответа, выполнять действие Б и ждать ответа, агент может выполнить цепочку А-Б-В заранее, а затем просто подтвердить её целиком, если авторитетная модель согласуется с первым звеном этой цепочки.
Этот подход позволяет переиспользовать вычисления многошагового характера, чего не удавалось сделать так эффективно с одноступенчатыми спекулятивными действиями в прошлом.
Результаты тестирования на бенчмарках
Эффективность предложенного метода была проверена на нескольких стандартных тестовых комплексах, включая подмножество Telecom из бенчмарка τ² и платформу AppWorld, предназначенную для оценки агентов, работающих с мобильными приложениями.
На тестовом наборе τ²-Bench Telecom метод SMC продемонстрировал значительное ускорение при сохранении точности. Время выполнения снизилось на 18,59% по сравнению с последовательным исполнением и на 10,23% в сравнении с базовым методом спекулятивных действий (Speculative Actions, SA).
На платформе AppWorld результаты были еще более впечатляющими с точки зрения скорости: время работы сократилось на 44,9% относительно последовательного выполнения и на 7,7% по сравнению с базовым методом SA. Однако исследователи отмечают важный нюанс: на этом бенчмарке зафиксировано незначительное снижение процента успешного завершения задач. Это свидетельствует о том, что хотя скорость выросла, вероятность ошибки в сложных сценариях немного увеличилась, что типично для спекулятивных подходов, где менее точная модель (драфтер) предсказывает действия.
Важное уточнение терминологии
Термин «коммитирование» (commit) в данном контексте не означает простое сохранение данных в базу. Это юридически значимый термин в системах транзакций, означающий окончательное утверждение наряда действий. В данном случае «коммит» означает, что изолированные попытки драфтера принимаются системой как часть основного, проверенного траектория, и ресурсы системы переходят к выполнению следующих новых шагов. Это отличает метод от простого параллельного запуска, где результаты могли бы быть отброшены, если не было бы механизма их интеграции в главный поток.
Заключение
Разработанный метод предлагает практический путь к снижению задержек агентов ИИ, выходя за рамки традиционного одношагового спекулятивного выполнения. Код, реализующий эту систему, открыт для общедоступного использования по адресу GitHub, что позволит сообществу исследователей и инженеров интегрировать технологию в свои проекты. Несмотря на небольшое снижение точности в определенных сценариях, выигрыш в скорости делает SMC перспективным инструментом для приложений, где скорость реакции критически важна, а требования к абсолютной безошибочности могут быть адаптированы под уровень риска.
*Примечание редактора: Данная статья основана на техническом докладе, опубликованном 3 сентября 2026 года. Данные о дате публикации и версиях моделей отражены в оригинальном источнике на сервере arXiv.*