искусственный интеллект · агентные системы · LLM · экономия · архитектура · технологии17 августа в 11:03 · 4 мин

Стоимость токенов обманчива: как новая система рутирования спасает бюджеты агентных ИИ

В сфере агентных систем больших языковых моделей (LLM) существует скрытая финансовая ловушка: стоимость полноценного рабочего процесса значительно превышает простую сумму перемножения цены токена на их количество. Исследователи представили методологию, учитывающую «токен-инфляцию» — рост затрат при повторных попытках решения задач, — что позволяет сократить расходы до 31% без потери точности.

# Не все токены равны: как инфляция удорожает работу агентных ИИ

Эпоха агентных систем, способных самостоятельно планировать и выполнять сложные цепочки действий, обещала революцию в автоматизации. Однако за фасадом эффективности скрывается фундаментальная экономическая ошибка. Большинство систем оптимизации строятся на ложном предположении, что цена модели равна произведению стоимости одного токена на их общее количество. Реальность же сложнее: когда модель ошибается, система пересобирает цепочку размышлений, потребляя дополнительные вычислительные ресурсы. Этот разрыв между теоретической ценой и реальной себестоимостью операции ученые назовут «токен-инфляцией».

За пределами простой математики

В основе проблемы лежит механика ретрайов (повторных попыток). Когда агентская система не может решить задачу с первого раза, она не просто выдает ответ «я не знаю». Она начинает генерировать новые цепочки логических рассуждений, пока не добьется результата или не исчерпает лимит. Каждый такой цикл увеличивает потребление токенов экспоненциально, особенно если используется модель меньшего размера, которая чаще требует помощи более мощных аналогов.

Существующие подходы, такие как система FrugalGPT, используют коэффициент маршрутизации, основанный исключительно на предполагаемой цене модели. Они сравнивают стоимость вызова модели А с моделью Б и выбирают более дешевую. Однако, как показывают новые данные, на сложных задачах такой метод может недооценивать реальные затраты более чем в два раза. Это происходит потому, что дешевая модель может генерировать больше ошибок, вызывая каскад повторных попыток, которые в итоге стоят дороже, чем один прямой вызов дорогой модели.

*«Мы наблюдаем, что при фиксированном бюджете игнорирование фактора инфляции приводит к систематическому перерасходу средств на решение задач средней сложности»*, — отмечают авторы исследования.

Новая архитектура: InflationAgent

Для решения этой проблемы группа исследователей разработала систему под названием InflationAgent. Это четырехэтапный маршрутизатор, который меняет парадигму управления стоимостью агентных систем. Вместо того чтобы смотреть на модель как на статическую единицу затрат, система оценивает вероятную инфляцию для конкретного типа задачи.

Первый этап заключается в систематическом измерении инфляции. Исследователи выявили, что для модели на 7 миллиардов параметров задача многошагового ответа может вызывать инфляцию затрат до 4,25 раз. То есть, стоимость выполнения такой задачи в реальном процессе в четыре с лишним раза выше, чем предполагает линейный подсчет токенов.

Второй этап introduces CoT Branching Entropy (CBE) — энтропию ветвления цепочек размышлений. Это сигнал сложности, вычисляемый до начала выполнения задачи исключительно на основе локальных данных инференса. По сути, система анализирует структуру вопроса и предсказывает, насколько вероятны ошибки и, следовательно, повторные попытки. Этот индикатор с точностью 0,887 (по метрике AUROC) предсказывает случаи, когда инфляция будет высокой.

Третий этап использует Семантический обменный курс (Semantic Exchange Rate). Это метрика, которая делит ожидаемую точность модели на ее прогнозируемую истинную стоимость (с учетом инфляции). Система выбирает модель, которая предлагает лучший баланс между качеством ответа и реальной ценой его получения. При этом применяется политика «свежей эскалации»: если цепочка рассуждений провалилась, её результаты отбрасываются, и задача перенаправляется с чистого листа к более мощной модели. Это предотвращает ситуацию, когда ошибка слабой модели искажает контекст, делая её бесполезной для дорогой модели.

Результаты на практике

Эффективность новой системы была проверена на наборе данных GSM8K, который содержит сложные математические задачи для первоклассников, требующие многоступенчатого логического вывода. При строгом ограничении бюджета InflationAgent достиг точности 94,7% по сравнению с 91,0% у FrugalGPT. Более того, новая система использовала на 31% меньше токенов, что свидетельствует о том, что она реже попадает в ловушку повторных попыток и выбирает оптимальную модель с первого раза.

Особое внимание исследователи уделили анализу ошибки эскалации. Они продемонстрировали, что попытка «спасти» неудачную цепочку рассуждений от слабой модели, передав её GPT-4o, может снизить общую точность решения на 34,8 процентных пункта. Этот результат блестяще подтверждает необходимость политики отбрасыва провалившихся попыток перед эскалацией. Старый «мусор» не может быть переработан в золото даже самым мощным процессором, если его фундаментальное логическое направление уже было исчерпано.

Как наблюдатель, стоит отметить, что переход от линейного мышления к оценке вероятностных расходов — это необходимый шаг для зрелости индустрии. Мы движемся от эпохи простого «дешевле ли это» к эпохе «сколько это стоит с учетом рисков ошибки».

Исследование доступно в архиве arXiv по номеру cs.CL 2608.13571.

Первоисточники

arXiv cs.CL
← Вернуться в эфир