Эпоха ПАК: как ИИ превращает дата-центры в единые распределенные компьютеры
Внедрение искусственного интеллекта не ограничивается покупкой видеокарт. Оно фундаментально перестраивает архитектуру ит-инфраструктуры, делая ставку на программно-аппаратные комплексы (ПАК), где процессоры, память, сеть и система охлаждения проектируются как единое целое. Эффективность измерять теперь в токенах в секунду и стоимости генерации одного вывода, а не в абстрактной мощности.
# От абстрактной мощности к стоимости токена: Новая реальность ИТ-инфраструктуры
Интеграция искусственного интеллекта в корпоративные процессы требует не просто масштабирования вычислительных мощностей, а полного переосмысления подходов к построению дата-центров. Как отмечают эксперты Группы Rubytech, краткий ответ на вопрос о том, что меняется в инфраструктуре, — «всё». Однако детали этих изменений лежат на стыке физики полупроводников, сетевых протоколов и экономической эффективности.
Новые метрики: от FLOPS к токену
Традиционные показатели эффективности, такие как пиковая производительность в FLOPS (операций с плавающей запятой в секунду) или ёмкость хранения в терабайтах, уступают место более точным метрикам, отражающим реальные потребности моделей машинного обучения.
Современная оценка инфраструктуры теперь строится вокруг следующих параметров: * Производительность инференса: Количество генерируемых токенов в секунду (tokens/s). * Задержка: Время до первого вывода (time-to-first-token) и среднее время на генерацию следующего токена. * Энергетическая эффективность: Отношение количества обработанных токенов к затраченной мощности (tokens/W). * Стоимость: Цена генерации одного токена ($/token).
В отличие от абстрактной мощности процессора, эти цифры определяют реальную ценность инфраструктуры для конкретной задачи.
Архитектурный взрыв: от x86 до чиплетов
После десятилетий доминирования архитектуры x64 отрасль переживает всплеск инженерной активности. Рынок заполнен альтернативными решениями: от китайских чипов Huawei Ascend и Cambricon до собственных ускорителей американских гигантов, таких как Google TPU, Amazon Trainium, Microsoft Maia и Meta MTIA.
Особое внимание привлекают нестандартные подходы. Компания Cerebras, например, отказалась от разделения кремниевой пластины на отдельные чипы, создав гигантский процессор ватер-скейл (wafer-scale), который размещается на всей площади кремниевой пластины. Это решение, которое ранее существовало лишь в теории, стало коммерческим продуктом.
Технологический прогресс настолько стремителен, что стимулирует сотрудничество индустрии с академическим сектором. ИТ-компании активно привлекают фундаментальных математиков для разработки новых алгоритмов, которые затем транслируются в кремниевые структуры.
Расшифровка терминов
* Чиплет (Chiplet): Функциональный блок процессора или ускорителя, физически расположенный на отдельном кристалле, который интегрируется с другими блоками для создания сложного устройства. * Микросборка: Корпус, объединяющий чиплеты и компоненты на общей подложке для решения конкретной задачи. * HBM-память (High Bandwidth Memory): Высокоскоростная оперативная память с 3D-структурой, размещаемая непосредственно рядом с блоком GPU для минимизации задержек. * PCIe: Стандарт высокоскоростной шины для подключения устройств. Сейчас наблюдается переход к версиям 6.0 и 7.0 с увеличенной пропускной способностью.
Память, интерконнекты и размытие границ
Большие языковые модели требуют хранения огромных массивов данных — весов моделей и кэшей. Чтобы обеспечить их непрерывную обработку, возникла новая иерархия памяти и систем связи.
Современные стандарты, такие как UCIe (интерфейс соединения чиплетов) и CXL (Compute Express Link), позволяют объединять память в общие пулы. Когерентные интерконнекты, включая NVLink-C2C от NVIDIA и Infinity Fabric от AMD, обеспечивают совместную работу CPU и GPU с памятью. В таких системах граница между памятью и сетью размывается: производительность всё больше зависит от скорости перемещения данных между вычислителями.
Сетевые технологии также эволюционируют. InfiniBand и Ultra Ethernet объединяют серверы и стойки с минимальными задержками. Для преодоления ограничений электрических соединений на высоких скоростях (800 Гбит/с и выше) применяются технологии silicon photonics — передача данных оптическими сигналами непосредственно на кристалле сетевого коммутатора.
Инференс, агенты и энергопотребление
Характер вычислительных нагрузок претерпевает коренные изменения. Если ранее основные ресурсы потреблял процесс обучения моделей, то сегодня массовый инференс — эксплуатация обученных моделей — становится главным потребителем мощности.
Это связано с появлением AI-агентов и reasoning-моделей, которые при каждом запросе могут выполнять сложные цепочки вычислений, взаимодействовать с базами данных и другими моделями.
Энергопотребление достигает критических значений: мощность одной стойки может превышать 100 КВт, а в перспективе планируется доходить до Мегаватта. Воздушное охлаждение становится недостаточным, и индустрия переходит к жидкостному охлаждению непосредственно чипов (direct-to-chip cooling). В связи с этим в 2026 году консорциум Open Compute Project (OCP), совместно с Google, Microsoft и NVIDIA, стандартизировал схему питания на 800 В постоянного тока для снижения потерь напряжения.
География и управление данными
Локация дата-центров всё чаще определяется доступностью электроэнергии, а не просто близостью к пользователям. ЦОДы строятся рядом с крупными генерирующими объектами, такими как ГЭС или ядерные реакторы нового поколения, либо оснащаются собственными микрогридами. Эксперименты с размещением инфраструктуры в космосе или на дне океана рассматриваются, но остаются финансово и технически сложными из-за проблем с энергоснабжением и обслуживанием.
Требования к данным также резко возросли. Хранение обучающих корпусов, векторных представлений документов, телеметрии и истории запросов стало обязательным компонентом. Данные перестали быть «мусором» для ИИ; любое информационное поле потенциально содержит ценную информацию для анализа.
В итоге, управление ИТ-инфраструктурой превращается в оркестрацию распределённых ресурсов. Необходимо учитывать расположение моделей, доступную память ускорителей, выбор интерконнектов и кэшей для обеспечения минимальных задержек.
Итог: Эра программно-аппаратных комплексов
Искусственный интеллект трансформирует дата-центр из помещения с набором независимых серверов в единый распределенный компьютер. Компоненты — от процессоров до систем охлаждения — больше нельзя проектировать изолированно. Естественной формой поставки такой инфраструктуры становятся программно-аппаратные комплексы (ПАК), где все элементы спроектированы совместно и сбалансированы друг с другом. Сборка сбалансированной системы из разрозненных компонентов становится всё более трудной задачей, уступая место готовым, оптимизированным решениям от ведущих вендоров.