AI1 сентября в 06:32 · 5 мин

Реальное подорожание DeepSeek V4: миф о росте в 12 раз и тайные 3 часа пика

Введение нового тарифного плана API модели DeepSeek V4 вызвало волну спекуляций о взрывном росте затрат. Однако детальный аудит прайс-листа показывает, что для большинства сценариев рост составит всего от 2,3 до 2,9 раза. Ключевой фактор экономии кроется в временном расписании: пиковые тарифы в московском времени действуют строго с 10:00 до 13:00, в то время как остальной день предлагает выгодные ставки.

Образ новости: стеклянная спираль данных у каменного маяка в ночном море.

# Реальное подорожание DeepSeek V4: миф о росте в 12 раз и тайные 3 часа пика

В августе 2026 года компания DeepSeek сменила стратегию ценообразования для своей модели V4, перейдя с единой ставки на двухуровневую систему: пиковую и непиковую. В прессе и сообществах начали активно обсуждать заявления о росте стоимости в десятки раз, что породило тревогу среди разработчиков и владельцев ИИ-сервисов. Однако технический аудит исходных данных показывает, что реальное влияние на бюджет значительно скромнее. Основной драйвер изменений кроется не столько в самой стоимости токенов, сколько в их использовании во времени суток.

«Цифру «+1100%» я увидел в чужом пересказе, и это ровно тот жанр новости, после которого приходят спрашивать, что будет со сметой» — так резюмирует авторство исходного материала, предупреждая о расхождении между маркетинговым шумом и фактической экономикой проекта.

Почему миф о 12-кратном росте ошибочен

Новый тарифный план, вступивший в силу 16 августа, действительно содержит ячейку, где стоимость входа в кеш Pro (cache hit) увеличилась более чем в 12 раз. Исходные данные подтверждают это: цена снизилась с 0,03625$ до 0,003625$ в непиковом режиме (в 10 раз дешевле старого), а пиковый тариф составляет 0,044$. Деление новой пиковой цены на старую низкую дает коэффициент около 12,14.

Однако этот показатель не отражает итоговую нагрузку на бизнес. Причина проста: кешированный вход данных изначально составлял ничтожно малую долю от общего биллинга (менее 0,6% в старых условиях). Даже при агрессивном использовании этой функции в пиковые часы, она редко превышает 10% от общего счета. В сценариях типичного чат-ассистента или системы с Retrieval-Augmented Generation (RAG), где доля кеша выше, реальный множитель стоимости для всего запроса варьируется от 2,3 до 2,9. Генеративные задачи с длинными ответами и отсутствием кэша попадают под верхнюю границу этого диапазона.

Сравнительная таблица стоимости показывает, что основные строки прайс-листа (промах кеша, вывод токенов) выросли лишь в 1,5–3 раза. Таким образом, истинный рост сметы диктуется не гипотетическим сценарием «100% попаданий в кеш», а реальной структурой запросов.

Технические термины

* Кеш Flash/Pro: Механизм предсказания и ускорения, позволяющий мгновенно предоставлять контекст или результаты запросов, ранее сгенерированные пользователем. Попадание в кеш (cache hit) дешевле, чем его отсутствие (cache miss). * RAG (Retrieval-Augmented Generation): Метод, при котором модель использует внешнюю базу знаний для ответов. Часто генерирует значительную часть ответа, используя данные из кэша.

География пиковых часов: почему Москва выигрывает

Критически важным аспектом новой тарифной политики является привязка стоимости к UTC-времени. Пиковые окна указаны как 01:00–04:00 и 06:00–10:00 UTC. Для европейской части мира, и в частности для Москвы, это создает уникальную ситуацию.

В московском времени (UTC+3) пиковый тариф действует с 04:00 до 07:00 (утро) и, что наиболее важно, с 10:00 до 13:00 (день). Это значит, что классический рабочий день с 10:00 до 19:00 накладывается на дорогой тариф ровно на три часа. Остальные шесть часов рабочего дня и все ночные часы попадают в дешевый интервал.

Для других регионов картина иная: команда в Пекине сталкивается с полным совпадением рабочего дня с пиковым тарифом, в то время как пользователи в Лондоне или Нью-Йорке работают преимущественно в «дешевое» время. Это свидетельствует о том, что модель тарификации оптимизирована под внутренние нужды и рабочие часы Китая.

Инструменты оптимизации: от математики до cron

Для точного прогнозирования расходов можно использовать упрощенную формулу, зависящую от доли токенов, обработанных в пиковые часы. Московская команда с равномерной нагрузкой в течение дня получит коэффициент пересчета примерно 2,33–2,93 в зависимости от типа задачи (промпты, вывод, кэш). Круглосуточные сервисы увидят рост около 2,3–2,4 раза.

Значительную экономию можно достичь, смещая пакетные задачи (батчи) на непиковое время. Поскольку генерация описаний, разметка и индексация не требуют интерактивности, их запуск стоит планировать после 13:00 МСК, когда открывается длинный дешевый интервал до 04:00 следующего дня. Это может снизить итоговый счет на 25% при переносе трети трафика.

Для автоматизации используются стандартные инструменты планировщиков задач (cron). Однако при этом важно учитывать часовые пояса серверов: в контейнеризированных средах (Docker/Kubernetes) переменные окружения могут игнорироваться, и расписание может сбиться. Рекомендуется использовать нативные настройки времени в оркестраторах или проверять работу таймеров через date -u.

Особое внимание следует уделить стримингу. Если запрос начинается в 09:58 UTC, но длится более двух минут, часть вычислений упадет в пиковое окно 10:00–13:00, удваивая стоимость. Желательно гейтить (блокировать) подачу запросов в последние минуты открытия пикового окна, чтобы избежать переплат.

Калькулятор нагрузки

Для оценки собственного бюджета можно использовать следующие параметры: * Модель: DeepSeek-V4-Pro или Flash. * Фактор пика (p): Доля трафика, попадающая в интервалы 01:00–04:00 и 06:00–10:00 UTC. * Результат: Множитель к старому счету = Множитель прайса × (1 + p).

Пример: при p = 1/3 для профиля RAG множитель составит 2,33×, а для чистого генеративного вывода — до 2,93×.

Вывод

Гиперболические заголовки о 10-кратном росте цен являются результатом наложения максимальных значений прайс-листа на теоретически идеальный сценарий использования, который в реальности встречается крайне редко. Реальное подорожание для большинства разработчиков составит 2,3–2,9 раза. Ключевыми факторами, определяющими итоговую стоимость, становятся структура запросов (доля кэша, длина ответа) и временная привязка. Для российских и европейских команд пиковый тариф актуален лишь 25% рабочего времени, что открывает большие возможности для оптимизации через планирование пакетных задач.

Для тех, кто ищет полную таблицу моделей и тарифов на момент конца 2026 года, рекомендуется обращаться к официальным API Docs и актуальным релизным нотам, так как цены могут изменяться в соответствии с динамикой спроса и технологическим развитием.

Первоисточники

Habr AI
← Вернуться в эфир