Экономия на токенах в мультиагентных системах: опыт solo-основателя
Создание продукта на основе ИИ часто связано с неэффективным использованием бюджетов на вычислительные мощности. Опыт Юлии Гончаровой, которая выстроила работающую систему из четырёх агентов и индивидуальных помощников для инвесторов, показывает, что существенную экономию можно добиться за счёт грамотного управления контекстом, а не только смены моделей. Статья разбирает технические нюансы работы с Anthropic и промпты для оптимизации затрат без потери функциональности системы.
# Как снизить затраты на ИИ-агенты на 30–50%: опыт solo-основателя
Развитие продуктов, построенных на искусственном интеллекте, быстро становится экономически невыгодным при традиционных подходах к архитектуре данных. В статье Юлии Гончаровой описывается реальный кейс стартапа, где мультиагентная система используется для поддержки основателей ранней стадии и их инвесторов. Автор делится практиками работы с Claude Sonnet 4.6, которые позволили значительно сократить расходы на токены, сохраняя высокую эффективность взаимодействия.
В основе продукта лежит веб-приложение, объединяющее несколько специализированных агентов. Первый агент отвечает за сбор данных при регистрации, второй помогает сформулировать стратегические цели, третий ведёт регулярные синхронизации, а четвёртый выступает ежедневным помощником. Дополнительно реализованы персональные агенты для инвесторов, которые проводят симуляции питчей. Ключевой вызов заключался в том, чтобы каждый агент «читал» всю историю переписки, контекст проекта и свои инструкции перед каждым ответом. Это создавало колоссальные финансовые нагрузки.
Управление памятью и контекстом
Одной из основных причин высоких затрат является необходимость ИИ-модели постоянно переосмысливать предыдущие сообщения. Каждый раз перед генерацией ответа системе приходится анализировать накопленный контекст. Если история диалога становится слишком длинной, расходы растут пропорционально количеству токов.
Поставщик ИИ — Anthropic — предоставляет механизм, позволяющий выделить часть контекста для длительного запоминания. Это позволяет избежать повторного чтения этой части данных. Однако у такой «памяти» есть ограничения по времени актуальности. Юля Гончарова объясняет, что именно правильная стратегия использования этого инструмента стала ключом к снижению издержек. Не следует ожидать, что ИИ сможет помнить всё бесконечно или бесплатно. Управление тем, что хранить, а что забыть, — это отдельная инженерная задача.
Архитектура взаимодействия агентов
В мультиагентных системах агенты часто должны передавать данные друг другу. В рассматриваемом случае агенты координируются через общие данные: профиль пользователя, установленные цели и журнал событий. Они не общаются напрямую, а работают с общей базой знаний, куда каждый из них вносит информацию.
Пример последовательности действий: 1. Агенты по сбору данных передают управление агенту по постановке целей. 2. Все агенты читают актуальное состояние профиля пользователя. 3. Агенты обновляют журнал событий, чтобы остальные могли видеть новые изменения.
Такой подход исключает необходимость каждому агенту хранить полную копию истории всех агентов. Вместо этого они работают с единым источником правды, что снижает нагрузку на модель и экономит токены на чтение лишней информации.
Индивидуальные агенты и симуляции
Особое внимание уделяется агентам, обслуживающим инвесторов. Эти агенты настраиваются под конкретные параметры фонда и проводят вводные встречи. В ходе таких встреч проводится симуляция питча инвестору. Это требует высокой точности и адаптации ответа под конкретного собеседника. При этом важно не перегружать контекст ненужными деталями, которые не влияют на качество симуляции. Грамотная настройка промптов позволяет агенту фокусироваться на ключевых аспектах общения, игнорируя информационный шум.
Практические советы для вайбкодеров
Для разработчиков, создающих продукты на базе ИИ, важно понимать, как работает подсчёт стоимости токенов. Каждый вызов к модели стоит денег, и экономия достигается не только выбором более дешёвой модели, но и архитектурой приложения. Используйте возможность предоставлять ИИ контекстом только то, что действительно необходимо для текущего шага.
Не забывайте, что даже при использовании одной и той же модели, разница в затратах может достигать значительных показателей. Пропустив лишнюю информацию или используя эффективные промпты, можно снизить нагрузку на систему. Также стоит помнить, что у памяти есть срок годности, и её нужно регулярно обновлять.
Статья Юлии Гончаровой на портале Habr AI предлагает готовые промпты и опыт работы в одиночку. Это позволяет другим разработчикам избежать типичных ошибок и построить более экономичную систему с самого начала. Главное — не пренебрегать детальной проработкой архитектуры данных и стратегией управления контекстом.