Эпоха дешевизны в ИИ закончилась: цены на токены взлетели, а память съедает процессор
Долгое время планирование инфраструктуры искусственного интеллекта базировалось на предположении, что технологии будут дешеветь. Однако в августе 2026 года это фундаментальное допущение рухнуло. Лаборатория DeepSeek радикально повысила стоимость API, а данные конференции Hot Chips 2026 показали, что в новых конфигурациях GPU память занимает до 90% площади чипа и стоит в пять раз дороже оперативной памяти DDR5.

# Эпоха дешевизны в ИИ закончилась: цены на токены взлетели, а память съедает процессор
Два года стратегическое планирование в области ИИ строилось на одной проектной константе: технологии совершенствуются быстрее, чем растут затраты. Считалось, что через квартал модель станет умнее при той же цене, токены подешевеют, а видеокарты, благодаря обновлению софта, выдадут больше мощности. В августе эта стабильность нарушилась с трех сторон: цены на API выросли, а физические ограничения памяти стали главной проблемой.
Рухнувшие ожидания: рост цен и новые тарифы
Компания DeepSeek стала первым крупным игроком, который решил изменить модель монетизации. В августе они подняли стоимость доступа к своим моделям на 355–371% в часы пиковой нагрузки. Более того, была введена дифференцированная тарификация, зависящая от времени суток. Это сигнал рынку о том, что фаза «дешевых экспериментов» для разработчиков завершена. Теперь инфраструктура ИИ требует серьезных капитальных вложений, которые больше не компенсируются автоматическим снижением стоимости вычислений.
Физическое ограничение: память стала самым дорогим компонентом
На конференции Hot Chips 2026 в Стэнфорде вендоры продемонстрировали железо будущего (ориентированное на 2027 год), но главным открытием стали цифры от компании Micron. Эксперты подсчитали, что в современных сборках двухкристальных GPU память занимает около 90% площади кремниевой подложки. При этом плотность упаковки памяти HBM4 выросла до потолка в 775 микрон, а стоимость гигабайта памяти в пять раз превышает цену бит оперативной памяти DDR5. Разрыв между скоростью процессоров и пропускной способностью памяти не только не сокращается, но и расширяется.
В результате контрактные цены на HBM4 для ускорителей NVIDIA достигли 31–32$ за гигабайт (против 17–18$ у предыдущего поколения), а обычная DRAM и NAND показали рост цен на 13–18% квартал к кварталу. Для инженеров, планирующих развертывание локальных моделей, это означает, что оптимизация управления контекстной памятью (KV-кэшем) перестала быть вопросом удобства и стала экономической необходимостью.
Архитектурный сдвиг и открытые веса
Ответом на дороговизну и дефицит памяти стало изменение архитектуры моделей. Вместо классического механизма внимания (Attention), который требует огромных ресурсов, разработчики переходят на гибридные подходы: разреженное внимание, комбинирование линейных и локальных зависимостей. Это позволяет создавать эффективные модели с экстремально низкой активностью параметров.
В августе в открытый доступ вышли модели колоссального размера: Qwen3.8-Max (2,4 трлн параметров), DeepSeek V4-Pro (1,7 трлн параметров) и другие. Несмотря на возможность скачивания этих терабайтных весов, их развертывание сталкивается с серьезными проблемами из-за ограничений памяти. Индустрия движется к экстремальной разреженности: например, в некоторых версиях активны лишь 6 млрд параметров из 125 млрд, а часть вычислений выносится в системную RAM, чтобы экономить видеопамять.
Лицензирование: разделение глобального и китайского лагерей
Важным трендом также стало расхождение в подходах к лицензированию. Китайские лаборатории (Qwen, DeepSeek, GLM) массово используют открытые лицензии Apache 2.0 и MIT, делая свои модели максимально доступными для бизнеса без лишних ограничений. Американские же производители все чаще возвращаются к кастомным лицензиям, накладывающим условия по количеству пользователей или выручке, что требует дополнительных юридических договоренностей.
Тем не менее, даже при наличии открытых весов и новых архитектур, экономический барьер продолжает расти. Если год назад можно было ждать месяц, пока софт освоит новые модели, то теперь узкое место сместилось на физический уровень. Память стала главным фактором, определяющим архитектуру ИИ-систем, а цена за интеллект перестала быть линейной функцией времени.