Налог на контекст: как повторная пересылка данных обесценивает бюджет ИИ-агентов
Исследование разработчика Arteric, проанализировавшего 40 реальных сессий агентной разработки, выявляет шокирующую статистику: в диалогах с Claude Code и Codex почти всё потребление токенов уходит на многократную отправку уже известных модели данных. В то время как новые инструкции пользователя составляют доли процента, основную тяжесть нагрузки несут инструменты агента и системные настройки, которые пересылаются на каждом шаге сессии.

# Налог на контекст: куда утекают токены
Когда вы используете ИИ-агента для написания кода, логично было бы ожидать, что вы платите за «мыслительный процесс» модели или за ваш уникальный запрос. Однако реальность финансово-технического процесса выглядит иначе. Исследование, проведенное экспертом в области разработки ИИ, демонстрирует, что значительная часть расходов уходит не на генерацию нового, а на механическую пересылку старых данных.
На выборке из 40 завершённых сессий агентной разработки (20 сессий в среде Claude Code и 20 в Codex) было установлено: суммарный оборот токенов составил 777 миллионов. Из них 298 млн токенов пришлось на Claude Code, а 479 млн — на Codex.
Главный вывод: Расход агентной сессии складывается преимущественно из повторной пересылки уже отправленного текста. На каждый новый токен, впервые попавший в контекст, медианная сессия повторно отправляет 47 токенов (для Claude Code) или 36 (для Codex).
Свежие, никогда ранее не отправлявшиеся вводные данные составляют всего 0.003% от общего объёма у Claude Code и 5.7% у Codex. Собственно ответы модели занимают менее 1% от общего трафика. Всё остальное — это круговорот одного и того же контента.
Почему модель переплачивает за одно и то же
Фундаментальная причина этих расходов кроется в архитектуре языковых моделей. У них отсутствует встроенная долговременная память о диалоге. Каждый раз, когда агент совершает шаг — формулирует мысль, вызывает инструмент или читает файл — он обязан отправить модель полную историю сессии заново.
Эта история включает в себя: * Системные инструкции. * Ваш исходный запрос. * Каждый прочитанный файл. * Выводы каждой выполженной команды.
Модель не хранит состояние между вызовами. Она перечитывает всё это, чтобы сгенерировать следующую реплику. Если кусок текста попал в контекст на первом шаге, он будет переслан на каждом из оставшихся шагов сессии. Чем раньше и чем крупнее была вставка, тем дороже она обходится к концу работы агента.
Математика нагромождения
Каждый шаг пересылает всю историю заново. Если представить сессию как набор шагов ($n$), где $S$ — базовый контекст, а $g$ — средний прирост данных на шаг, то суммарная пересылка за сессию приближается к формуле: $n \cdot S + g \cdot n^2 / 2$. Это означает квадратичный рост нагрузки при увеличении длины сессии.
Хотя провайдеры услуг внедряют кэширование промптов для снижения стоимости повторных отправлений неизменных частей запроса, это решение не является бесплатным. Запись данных в кэш стоит на 25–50% дороже обычного входа, а кэш сохраняется обычно в течение часа. Длительная пауза в работе приводит к «сгоранию» кэша и необходимости перестраивать его заново, что ударяет по бюджету.
Разбор состава расходов на примере
Для анализа были использованы логи 40 сессий, где агенты редактировали код, запускали тесты и выполняли команды. В выборку не вошли короткие справочные диалоги.
Структура затрат
На примере 16 сессий с точной стоимостью (Claude Code, итоговый счёт $270.78) была составлена детальная разбивка:
1. Чтение из кэша: Это та самая повторная пересылка по льготному тарифу. В 17 из 20 сессий объём записей в кэш превысил прирост контекста, что подтверждает гипотезу о пересылке одних и тех же кусков данных после коротких пауз. 2. Запись в кэш: Плата за сам процесс кэширования, которая выше стандартной стоимости входа. 3. Свежий вход: Значительная часть бюджета уходит именно на попытки записать данные в кэш, даже если это делается по несколько раз. 4. Ответ модели: Несмотря на то, что выходные токены стоят примерно в 5 раз дороже входных, их доля в общем объёме трафика менее 1%. На финансовые показатели они влияют меньше, чем огромные потоки входных данных.
Инструменты как главный источник шума
Одной из главных статей расходов являются вызовы инструментов агента. Повторную пересылку создают массовые мелкие вызовы, а не разовые крупные вставки.
* В Claude Code чтение файлов (384 вызова) и команды оболочки Bash (1 360 вызова) дают 33% и 30% всего атрибутированного объёма соответственно. * В Codex команды (exec + Shell) формируют 90% объёма пересылки.
Особенно дорогостоящими оказываются неудачные вызовы. Ошибка, возникшая на середине сессии, остаётся в истории и пересылается до её конца. В выборке Codex 90 неудачных вызовов утащили за собой 5.5 млн токенов повторной пересылки, тогда как у Claude Code это была сумма всего в 0.5 млн.
Что влияет на стартовый контекст
Доля начального контекста, который пересылается на каждом шаге без изменений, составляет медианно 54% у Claude Code и 28% у Codex. Этот параметр включает в себя: * Файлы инструкций (например, CLAUDE.md). * Вывод стартовых хуков. * Описания установленных скиллов и плагинов. * Имена инструментов MCP.
Остальная часть — системный промпт рантайма со схемами встроенных инструментов — обычно недоступна для прямого вычета из логов, но оценивается косвенно. Примечательно, что между мартом и августом 2026 года стартовый контекст у Codex вырос с ~15 до ~31–41 тыс. токенов, что объясняется усложнением базовой системы.
Важно отметить, что текст, написанный человеком (собственные инструкции), занимает крошечную долю: около 1.5% базы у Claude Code и до 9% у Codex, даже если учитывать все дополнительные файлы. Ужимать собственные инструкции ради экономии токенов бессмысленно, так как их влияние невидимо на фоне огромного харнесса (несменяемой обвязки рантайма). Гораздо заметнее влияние плагинов, скиллов и хуков, которые могут занимать до 17% базового контекста.
Практические рекомендации по оптимизации
Исследование позволяет выработать ряд действий, которые могут существенно снизить стоимость разработки с помощью агентов:
1. Дробите работу на короткие сессии. Поскольку стоимость растёт быстрее длины сессии (удвоение шагов стоит примерно в 2.4 раза дороже), задача заслуживает нового чистого контекста, а не продолжения старой длинной сессии.
2. Режьте вывод инструментов. Это главная статья расходов (60–90% привязанной пересылки). Просите агента читать диапазоны файлов вместо полных текстов, фильтровать вывод команд (head, grep, тихие флаги) и избегать полного вывода логов.
3. Работайте плотно. Кэш обычно живет от 5 минут до часа. Длительная пауза приводит к перестройке кэша по повышенному тарифу, что может составлять более 11% общего счёта. После долгого перерыва выгоднее начать новую сессию.
4. Ревизуйте плагины и хуки. Управляемая часть базы зависит от установленных инструментов. Один активный хук может добавлять тысячи токенов на старт, что перерастает в сотни тысяч токенов при долгой работе.
5. Не игнорируйте ошибки. Каждый неудачный вызов инструмента остаётся в истории. Если агент застрял в цикле ошибок, дешевле остановить его и переформулировать задачу, чем позволить ему «долбиться» дальше, генерируя мусорный трафик.
6. Не воюйте с «болтливостью» модели. Экономия на длине ответов агента практически невозможна, так как они занимают менее 1% от общего объёма трафика. Решающее влияние на бюджет оказывают данные, которые агент читает, а не то, что он пишет.
7. Не экономьте на собственных инструкциях. Ваш текст составляет лишь малую долю базового контекста. Упрощение инструкций не даст значимой экономии, тогда как ясные указания помогут агенту совершать меньше ошибочных шагов, которые стоят дорого.
В заключение, бюджет ИИ-агентства находится под контролем не только выбора тарифной сетки, но и архитектурного подхода к ведению диалога. Понимание того, что модель платит за каждый ваш шаг и каждое прочитанное байт, позволяет оптимизировать процесс разработки, делая его не только более эффективным, но и финансово обоснованным.