NVIDIA · MIT · ИИ-агенты · программирование · экономия токенов · LLM · harness · SoL-Pi2 октября в 00:03 · 5 мин

NVIDIA и MIT сократили затраты на работу кодинг-агентов вдвое, не меняя модель

Исследователи из NVIDIA, MIT и NTU разработали методику автонастройки окружения (harness), позволяющую сократить расход токенов на 45–49% при выполнении задач программирования. Новый подход SoL-Pi сохраняет баланс между стоимостью API и качеством решения, жертвуя небольшим процентом производительности в пользу экономической эффективности.

# Вдвое меньше токенов без смены модели: революция в окружении кодинг-агентов

Команда исследователей из NVIDIA, MIT и NTU представила методологию оптимизации работы языковых моделей в задачах программирования. В рамках проекта SoL-Pi было продемонстрировано, что значительная экономия средств возможна за счет переработки программного интерфейса (harness), управляющего моделью, а не путем изменения самой нейросети.

Авто-исследование: как ИИ улучшает работу ИИ

Суть проблемы в том, что современные кодинг-агенты, такие как Claude Code или Codex, требуют огромных объемов контекста для каждого шага. Они постоянно передают модели всю историю задачи, прочитанных файлов и результатов тестов. Провайдеры тарифицируют эти запросы, включая хранение истории (prompt cache), что существенно увеличивает стоимость использования.

Ручная оптимизация harness — процесс сложный и трудоемкий. Инженеры вручную изучают логи работы агента, ищут избыточные запросы и правят код. В новом исследовании эту рутину взяли на себя другие ИИ. Процесс, названный auto-research (авто-исследование), заключается в том, что один агент-исследователь анализирует работу агента-исполнителя, генерирует идеи по оптимизации окружения, внедряет их и проверяет результаты. Этот цикл повторяется тысячи раз. Всего было рассмотрено 152 идеи на основе более чем 530 задач; 495 из них были взяты из реальных исправлений ошибок на GitHub, а остальные сгенерированы автоматически.

*Штрих редактора: процесс напоминает эволюцию в микро-масштабе, где каждая неудачная мутация изолирована и не влияет на остальные, пока не найдет жизнеспособный вариант.*

Критериями отбора были жесткие ограничения: качество решения задач должно оставаться в заданных пределах, при этом расход токенов должен снижаться. Из всех вариантов отбор прошли всего четыре приёма.

Четыре ключевых метода оптимизации

Система SoL-Pi внедрила следующие алгоритмы для минимизации потребления ресурсов:

1. Action Fusion (Слияние действий): Раньше агент выполнял правку файла, получал ответ и в следующем запросе запускать тесты, отправляя полную историю дважды. Новый метод объединяет правку и запуск тестов в один вызов модели. Вместо трех запросов для пары действий модель получает два, что существенно экономит токены. 2. ObservationPack (Упаковка наблюдений): Вывод команд, например логов сборки, которые превышают 10 KiB, ранее передавались полностью в историю каждого следующего запроса. Теперь такой объем данных сохраняется только в двух ближайших запросах. В последующих обращениях модель видит лишь ссылку, размер файла и первые/последние строки. Полный текст доступен по ссылке при необходимости. 3. Evidence-Preserving Reducer (Сократитель с сохранением доказательств): Длинные логи сначала анализирует более дешевая модель (GPT-5.6 Luna), которая извлекает ключевые фрагменты с точными цитатами. Основная модель сверяет эти цитаты с оригиналом. Если нет ошибок, ей передается сжатая версия; при обнаружении несоответствий — полный исходный лог. Это снижает риск потери информации при сжатии. 4. Online Context Compact (Онлайн-сжатие контекста): Эта техника динамически сжимает историю задач в краткий пересказ, если это экономит токены. Важный нюанс: сжатие сбрасывает prompt cache, за повторную запись которого провайдеры берут плату. Алгоритм постоянно сравнивает стоимость текущего и сжатого состояния, выбирая вариант с максимальной выгодой.

Результаты испытаний: экономия против точности

Тестирование проходило на бенчмарке EdgeBench, который включает 51 задачу из общей базы в 134. Для сравнения были использованы модели GPT-5.6 Sol и Claude Opus 5.

На модели GPT-5.6 Sol показатели SoL-Pi со всеми четырьмя приёмами показали следующие результаты: * Расход токенов: 1,10 млрд против 2,15 млрд у стандартного Pi (экономия 49%). * Стоимость API: $894 против $1339 у Pi и $1787 у Codex (экономия примерно на треть). * Средний балл: 42,0 против 44,8 у Pi. Снижение на 6% признается исследователями сопоставимым результатом.

Интересно, что применение только одного приема (ObservationPack) на той же модели повысило балл до 47,2, при этом сохранив снижение стоимости на 5%.

Аналогичные выводы были получены на модели Claude Opus 5. Стоимость работы агента на SoL-Pi составила $1158 против $1741 у Pi, при этом балл упал незначительно (с 44,8 до 42,2).

В пересчете на час работы экономия оценивается в диапазоне 8,75–13,50 долларов по сравнению с традиционными решениями Codex или Claude Code. В эксперименте с роем из 20 агентов, работающих над ускорением вычислительного ядра, рой на базе SoL-Pi оказался на 27% дешевле при лучшем производительности.

Ограничения и перспективы

Несмотря на впечатляющую экономическую эффективность, методология имеет свои слабые места.

1. Потеря точности: Усредненное падение балла на 6% означает, что агент может допускать больше ошибок. На специализированном бенчмарке Terminal-Bench 4 SoL-Pi решил на 3 задачи меньше, чем стандартный Pi. 2. Зависимость от бенчмарка: Для подбора harness использовалась открытая часть EdgeBench (51 задача из 134). Результаты могут варьироваться на других наборах данных. 3. Стоимость prompt cache: Выгода от сжатия истории напрямую зависит от тарифов провайдера. При других схемах ценообразования эффект может быть другим.

Исследователи подчеркивают, что найденные приёмы оптимизированы в первую очередь для модели GPT-5.6 Sol, однако они демонстрируют универсальность подхода и успешно масштабируются на другие архитектуры, включая Claude Opus 5.

Код проекта SoL-Pi открыт в репозитории NVlabs/SoL-Pi, что позволяет инженерам внедрять эти методы в свои системы без необходимости переобучения моделей.

Первоисточники

Habr AI ↗
← Вернуться в эфир