Китайский ответ «чиповому эмбарго»: Huawei и Alibaba представляют архитектуру SuperPoD и вертикальную интеграцию
В ответ на ограничения доступа к западным технологиям, китайские технологические гиганты Huawei и Alibaba одновременно представили новые архитектуры для ИИ. Вместо прямой конкуренции с NVIDIA по чиповому дизайну, компании сосредоточились на создании собственных решений для масштабирования тысяч ускорителей, оптимизации энергопотребления и построении полного стека «железо-софт».
# Китайский ответ «чиповому эмбарго»: Huawei и Alibaba представляют архитектуру SuperPoD и вертикальную интеграцию
Последние недели стали поворотными для отрасли искусственного интеллекта в Китае. Совмещая анонсы, сделанные Huawei на мероприятии HUAWEI CONNECT 2026 (17 сентября) и Alibaba на Apsara Conference в Ханчжоу (22 сентября), можно выделить четкую стратегическую линию. Китайские игроки не пытаются скопировать архитектурную копию NVIDIA. Их фокус сместился на решение фундаментальной проблемы отрасли: как эффективно связывать в единую систему тысячи вычислительных ядер, преодолевая физические и санкционные ограничения.
Главный вывод из совместного анализа новинок: китайская индустрия переориентировалась на проблему масштабирования интерконнектов и вертикальной интеграции. Компании закрывают весь стек — от кремниевых кристаллов до программного обеспечения для управления кластерами.
Atlas 960E: новая философия оптического соединения
Huawei представила систему Atlas 960E SuperPoD, которая, по заявлениям производителя, стала первым в мире SuperPoD на базе технологии Near-Packaged Optics (NPO, близкая упаковка оптики). SuperPoD — это кластерный блок, содержащий тысячи ускорителей (NPU или GPU), объединенных в единую вычислительную среду с общей памятью. Такая конфигурация критически важна для обучения больших языковых моделей.
Техническая суть инновации заключается в замене традиционных трансиверов. Вместо 48 000 отдельных 800G-трансиверов система использует 5 500 модулей Hi-ONE, которые впаяны непосредственно рядом с чипом. Каждый модуль обеспечивает пропускную способность 7,2 Тбит/с. Производительность компании оценивает как экономичную: снижение энергопотребления на уровне системы на свыше 550 кВт и повышение надежности до 99,8%.
Характеристики платформы: * Масштабируемость: Один блок может содержать до 4096 NPU. Несколько SuperPoD объединяются в SuperCluster, который теоретически способен масштабироваться до миллиона ядер. * Пропускная способность памяти: До 9,6 ТБ/с. * Версии ускорителей: * *Ascend 960DT:* Ориентирована на обучение (до 2 PFLOPS FP8, выход в Q1 2027). * *Ascend 960PR:* Ориентирована на инференс (до 8 PFLOPS FP4, выход в Q3 2027).
Отдельно стоит упомянуть программный стек CANN, который Huawei переводит в модель community-driven open source. Аналитики видят в этом шаг к ускорению развития экосистемы, так как ранее закрытый код не успевал за открытыми стандартами, такими как PyTorch.
Стратегия Alibaba: Zhenwu V900 и полный вертикальный контроль
Alibaba представила чип Zhenwu V900, разработанный подразделением T-Head Semiconductor. Компания заявляет, что этот процессор обладает в три раза большей производительностью, чем предшественник Zhenwu M890, хотя точные цифры FLOPS не были раскрыты. Подтвержденные параметры включают 216 ГБ памяти HBM и интерконнект со скоростью 1,2 ТБ/с.
Ключевая особенность V900 — поддержка настраиваемых квантованных форматов (MXFP8 и MXFP4). Эта технология направлена на стабилизацию производительности кластеров при масштабировании, минимизируя потери эффективности при увеличении количества карт.
Стратегическая цель Alibaba — создать полный проприетарный стек. В рамках конференции анонсирована связка «ИИ-роутер», которая объединяет Zhenwu V900, сетевые карты Panmai, коммутаторы ICN Switch и контроллеры Zhenyue. Это позволяет управлять доступом к сотням моделей из единой панели. Также в планах на Q3 2028 года появление процессоров Yitian 730 на архитектуре RISC-V, что станет шагом к полной независимости от лицензий ARM.
Сравнение с глобальными лидерами и альтернативные подходы
Сравнение характеристик показывает существенные различия в текущем статусе технологий. Если чипы NVIDIA (серии B300, R100) и AMD (MI355X) уже поставляются, то новинки Huawei и Alibaba планируются к выходу в 2027 году.
В таблице ниже представлены основные параметры сравнения (данные основаны на пресс-релизах):
| Параметр | Ascend 960DT (Huawei) | Zhenwu V900 (Alibaba) | NVIDIA B300 | AMD MI355X | | :--- | :--- | :--- | :--- | :--- | | HBM | 288 ГБ | 216 ГБ | 288 ГБ (HBM4) | 288 ГБ (HBM3e) | | Пропускная способность памяти | 9,6 ТБ/с | Не раскрыто | До 22 ТБ/с | 8 ТБ/с | | FP8 (dense) | 2 PFLOPS | Не раскрыто | 17.5 PFLOPS | 4.6 PFLOPS | | Дата выхода | Q1 2027 | Q1 2027 | Q4 2026 / Уже есть | Уже есть |
Помимо прямых конкурентов, интерес представляет решение от китайской Dongfang Suanxin — DF1000. Вместо попытки обогнать NVIDIA в техпроцессе, компания использует 3D-стекинг памяти (near-memory), обеспечивая пропускную способность, превышающую показатели NVIDIA H200, что может стать альтернативным путем обхода ограничений. Также Moore Threads предлагает GPU MTT S5000, делающие ставку на совместимость с CUDA-стеком.
Проблемы внедрения и итог
Несмотря на амбициозные планы, эксперты отмечают ряд рисков. В ходе тестирования предшествующих поколений китайских решений (например, Zhenwu 810E) выявлялась неравномерность пропускной способности сетевых соединений и отсутствие развитого программного окружения для мониторинга (аналоги nvidia-dcgm отсутствуют). Кроме того, доступность документации и моделей часто ограничена языковым барьером.
Анонс переводов стеков CANN и AgentCore в open source, а также обещания Alibaba о поддержке, являются попыткой ускорить развитие экосистемы, но пока не заменят годы независимого тестирования в реальных производственных условиях. Пока что китайские компании лишь формируют дорожные карты и планируют архитектуру, в то время как западные игроки продолжают наращивать поставки готовых решений.
Главный тренд дня — это переход от гонки тактовой частоты к инженерным решениям по организации памяти и сетевой топологии, чтобы максимизировать эффективность каждого доступного чипа в условиях технологического давления.