NVIDIA и MIT сократили затраты на работу кодинг-агентов вдвое, не меняя модель
Исследователи из NVIDIA, MIT и NTU разработали методику автонастройки окружения (harness), позволяющую сократить расход токенов на 45–49% при выполнении задач программирования. Новый подход SoL-Pi сохраняет баланс между стоимостью API и качеством решения, жертвуя небольшим процентом производительности в пользу экономической эффективности.
# Вдвое меньше токенов без смены модели: революция в окружении кодинг-агентов
Команда исследователей из NVIDIA, MIT и NTU представила методологию оптимизации работы языковых моделей в задачах программирования. В рамках проекта SoL-Pi было продемонстрировано, что значительная экономия средств возможна за счет переработки программного интерфейса (harness), управляющего моделью, а не путем изменения самой нейросети.
Авто-исследование: как ИИ улучшает работу ИИ
Суть проблемы в том, что современные кодинг-агенты, такие как Claude Code или Codex, требуют огромных объемов контекста для каждого шага. Они постоянно передают модели всю историю задачи, прочитанных файлов и результатов тестов. Провайдеры тарифицируют эти запросы, включая хранение истории (prompt cache), что существенно увеличивает стоимость использования.
Ручная оптимизация harness — процесс сложный и трудоемкий. Инженеры вручную изучают логи работы агента, ищут избыточные запросы и правят код. В новом исследовании эту рутину взяли на себя другие ИИ. Процесс, названный auto-research (авто-исследование), заключается в том, что один агент-исследователь анализирует работу агента-исполнителя, генерирует идеи по оптимизации окружения, внедряет их и проверяет результаты. Этот цикл повторяется тысячи раз. Всего было рассмотрено 152 идеи на основе более чем 530 задач; 495 из них были взяты из реальных исправлений ошибок на GitHub, а остальные сгенерированы автоматически.
*Штрих редактора: процесс напоминает эволюцию в микро-масштабе, где каждая неудачная мутация изолирована и не влияет на остальные, пока не найдет жизнеспособный вариант.*
Критериями отбора были жесткие ограничения: качество решения задач должно оставаться в заданных пределах, при этом расход токенов должен снижаться. Из всех вариантов отбор прошли всего четыре приёма.
Четыре ключевых метода оптимизации
Система SoL-Pi внедрила следующие алгоритмы для минимизации потребления ресурсов:
1. Action Fusion (Слияние действий): Раньше агент выполнял правку файла, получал ответ и в следующем запросе запускать тесты, отправляя полную историю дважды. Новый метод объединяет правку и запуск тестов в один вызов модели. Вместо трех запросов для пары действий модель получает два, что существенно экономит токены. 2. ObservationPack (Упаковка наблюдений): Вывод команд, например логов сборки, которые превышают 10 KiB, ранее передавались полностью в историю каждого следующего запроса. Теперь такой объем данных сохраняется только в двух ближайших запросах. В последующих обращениях модель видит лишь ссылку, размер файла и первые/последние строки. Полный текст доступен по ссылке при необходимости. 3. Evidence-Preserving Reducer (Сократитель с сохранением доказательств): Длинные логи сначала анализирует более дешевая модель (GPT-5.6 Luna), которая извлекает ключевые фрагменты с точными цитатами. Основная модель сверяет эти цитаты с оригиналом. Если нет ошибок, ей передается сжатая версия; при обнаружении несоответствий — полный исходный лог. Это снижает риск потери информации при сжатии. 4. Online Context Compact (Онлайн-сжатие контекста): Эта техника динамически сжимает историю задач в краткий пересказ, если это экономит токены. Важный нюанс: сжатие сбрасывает prompt cache, за повторную запись которого провайдеры берут плату. Алгоритм постоянно сравнивает стоимость текущего и сжатого состояния, выбирая вариант с максимальной выгодой.
Результаты испытаний: экономия против точности
Тестирование проходило на бенчмарке EdgeBench, который включает 51 задачу из общей базы в 134. Для сравнения были использованы модели GPT-5.6 Sol и Claude Opus 5.
На модели GPT-5.6 Sol показатели SoL-Pi со всеми четырьмя приёмами показали следующие результаты: * Расход токенов: 1,10 млрд против 2,15 млрд у стандартного Pi (экономия 49%). * Стоимость API: $894 против $1339 у Pi и $1787 у Codex (экономия примерно на треть). * Средний балл: 42,0 против 44,8 у Pi. Снижение на 6% признается исследователями сопоставимым результатом.
Интересно, что применение только одного приема (ObservationPack) на той же модели повысило балл до 47,2, при этом сохранив снижение стоимости на 5%.
Аналогичные выводы были получены на модели Claude Opus 5. Стоимость работы агента на SoL-Pi составила $1158 против $1741 у Pi, при этом балл упал незначительно (с 44,8 до 42,2).
В пересчете на час работы экономия оценивается в диапазоне 8,75–13,50 долларов по сравнению с традиционными решениями Codex или Claude Code. В эксперименте с роем из 20 агентов, работающих над ускорением вычислительного ядра, рой на базе SoL-Pi оказался на 27% дешевле при лучшем производительности.
Ограничения и перспективы
Несмотря на впечатляющую экономическую эффективность, методология имеет свои слабые места.
1. Потеря точности: Усредненное падение балла на 6% означает, что агент может допускать больше ошибок. На специализированном бенчмарке Terminal-Bench 4 SoL-Pi решил на 3 задачи меньше, чем стандартный Pi. 2. Зависимость от бенчмарка: Для подбора harness использовалась открытая часть EdgeBench (51 задача из 134). Результаты могут варьироваться на других наборах данных. 3. Стоимость prompt cache: Выгода от сжатия истории напрямую зависит от тарифов провайдера. При других схемах ценообразования эффект может быть другим.
Исследователи подчеркивают, что найденные приёмы оптимизированы в первую очередь для модели GPT-5.6 Sol, однако они демонстрируют универсальность подхода и успешно масштабируются на другие архитектуры, включая Claude Opus 5.
Код проекта SoL-Pi открыт в репозитории NVlabs/SoL-Pi, что позволяет инженерам внедрять эти методы в свои системы без необходимости переобучения моделей.