DeepSeek перенесла ключевые инструменты своей ИИ-инфраструктуры на ускорители Huawei Ascend и открыла их исходный код. Это уже больше, чем демонстрация отдельного китайского чипа: Huawei получила библиотеки, язык программирования и средства связи между ускорителями, без которых большое железо остается дорогой грудой кремния. Однако о полноценной замене Nvidia говорить рано: опубликованные результаты в основном принадлежат самим разработчикам, а основные модели DeepSeek, по данным Telepolis, пока продолжают обучаться на Nvidia.
Как DeepSeek перенесла инструменты на Huawei Ascend
Huawei сообщила, что ускорители Ascend 950PR и 950DT были адаптированы к DeepSeek V4 в день выхода модели. Как писал South China Morning Post, вся линейка Ascend SuperNode получила поддержку инференса, то есть запуска уже обученной модели. Компании начали работать вместе еще до релиза V4.
Группа с участием Huawei отчиталась о полном постобучении DeepSeek V4-Pro с 1,6 трлн параметров на кластере как минимум из 1000 Ascend 910C. Постобучение означает дополнительную настройку готовой базовой модели; это серьезная вычислительная задача, но она не доказывает возможность с нуля обучить модель такого масштаба на Ascend.
В сентябре Huawei представила новое поколение ускорителей и крупных вычислительных систем. 30 сентября DeepSeek открыла версии своей инфраструктуры для Ascend: TileLang, DeepGEMM, DeepEP, TileKernels, FlashMLA и DeepSelect. По данным IT之家, этим компонентам соответствуют инструменты, которые лаборатория уже использовала на платформе Nvidia.
DeepSeek и Huawei также вместе оптимизировали суперузел из 128 Ascend 950. Здесь важна именно совместная работа над железом и софтом: в больших моделях скорость ограничивает не только вычислительная мощность ускорителя, но и обмен данными между десятками или сотнями чипов.
Из чего состоит стек Huawei и DeepSeek
Главный актив Nvidia называется CUDA. Это программная платформа, через которую фреймворки, библиотеки и приложения используют графические процессоры компании. За годы вокруг нее выросли готовые математические операции, компиляторы, средства диагностики и специалисты. Поэтому заменить Nvidia означает перенести не одну программу, а всю цепочку разработки.
У Huawei нижний уровень этой цепочки занимает CANN, программная платформа для Ascend. Она включает среду выполнения, библиотеки операторов и HCCL, средство коллективного обмена данными между ускорителями. Сами Ascend относятся к NPU, специализированным процессорам для нейросетевых вычислений.
Выше находится TorchNPU. Этот компонент добавляет Ascend в PyTorch как отдельный тип устройства. В документации Huawei утверждается, что базовая миграция может сводиться к замене обращения к CUDA на обращение к NPU без изменения структуры модели и логики обучения. На практике разработчику все равно нужны совместимые версии драйверов, CANN, PyTorch, TorchNPU и сторонних библиотек. Это уже намек на главную проблему альтернативных стеков: простой пример переносится быстро, большой рабочий проект зависит от сотен операций и расширений.
TileLang решает другую задачу. Это высокоуровневый язык и компилятор для написания вычислительных ядер, то есть небольших программ, непосредственно выполняемых ускорителем. На Ascend он скрывает низкоуровневые инструкции Ascend C. Поэтому называть TileLang полным аналогом CUDA неточно: скорее, это один из мостов между моделью и CANN.
Остальные компоненты закрывают типовые узкие места. DeepGEMM выполняет матричные умножения, основу большинства нейросетевых расчетов. DeepEP организует обмен данными в MoE-моделях. FlashMLA оптимизирует механизм внимания, TileKernels содержит векторные операции, а DeepSelect отвечает за отбор данных.
Вместе получается последовательность: PyTorch передает задачи через TorchNPU, готовые и созданные в TileLang операции исполняются средствами CANN, а DeepEP связывает ускорители внутри кластера. Именно наличие всей цепочки отличает платформу от очередного чипа с впечатляющей цифрой в презентации.
Что говорят цифры Huawei, DeepSeek и Nvidia
| Показатель | Заявленный результат |
|---|---|
| Постобучение DeepSeek V4-Pro | 1,6 трлн параметров, не менее 1000 Ascend 910C |
| Совместный суперузел DeepSeek и Huawei | 128 Ascend 950 |
| DeepGEMM на Ascend 950DT | до 431 из 432 Тфлопс в BF16, или 99,8% теоретического максимума |
| DeepEP в небольших конфигурациях | 90–95% физически доступной пропускной способности |
| CANN Bench | 53 операции и 1060 тестов |
| Облачный кластер Ascend 950 | 1024 ускорителя, до 1 Эфлопс в FP8 и 2 Эфлопс в FP4 |
| Память кластера Ascend 950 | 256 ТБ с общей адресацией |
Показатели DeepGEMM и DeepEP приводит сам проект. Telepolis отмечает, что 99,8% теоретической производительности не подтверждены независимой проверкой, часть функций DeepEP остается экспериментальной, а более крупные конфигурации еще оптимизируются. Тесты проводились на предварительной версии комплекта разработки Huawei.
Отдельный признак взросления платформы появился в июле: исследователи представили CANN Bench, открытый тест для сгенерированных ИИ вычислительных ядер на Ascend. Он проверяет компиляцию, правильность и скорость, включая операции для MoE и FlashAttention. Само существование теста не доказывает превосходство Huawei, зато создает воспроизводимый способ измерять прогресс вместо сравнения пресс-релизов.
Huawei компенсирует ограничения отдельных ускорителей масштабом. Облачная система Ascend 950 объединяет 1024 карты через UnifiedBus, а Atlas 950 SuperPoD рассчитан максимум на 8192 ускорителя. Следующее поколение Atlas 960 в заявленной конфигурации должно вырасти до 15 488 процессоров и 34 ПБ/с пропускной способности соединений. Ascend 960DT для обучения запланирован на первый квартал 2027 года.
У Nvidia преимущество тоже давно измеряется на уровне системы. Компания говорит более чем о 7 млн CUDA-разработчиков, а для B200 заявляет стоимость генерации в два цента за миллион токенов на GPT-OSS-120B. Эти цифры нельзя напрямую сопоставить с тестами Huawei: используются разные модели, режимы и методики. Независимое исследование xPU-athalon также показывает, что лучший ускоритель меняется в зависимости от размера модели, длины контекста и нагрузки, а зрелость компилятора способна решить исход сравнения не хуже пиковой производительности чипа.
Кто выиграет от второго стека и кто заплатит за переход
Первый потенциальный победитель, сама Huawei. Открытые инструменты DeepSeek дают Ascend код, созданный лабораторией с опытом работы над крупными моделями, а не только примеры от производителя оборудования. По заявлению DeepSeek, для каждой операции TileLang, используемой в ее обучении, уже существует реализация на Ascend.
Китайские разработчики получают более короткий путь миграции с Nvidia. Им доступны привычный PyTorch через TorchNPU, язык для собственных ядер и библиотеки для матричных операций и связи между чипами. AMD в 2026 году тоже утверждала, что крупные клиенты все чаще программируют на более высоком уровне и реже работают с CUDA напрямую. Если этот подход закрепится, приложение сможет менять аппаратную платформу через промежуточные инструменты, хотя бесшовность такого перехода еще предстоит доказать.
Платить будут команды инфраструктуры. Им придется проверять совместимость каждой операции, профилировать модели заново, переобучать инженеров и поддерживать несколько версий зависимостей. Особенно рискованны крупные MoE-кластеры: производительность там зависит от того, насколько хорошо ускорители обмениваются данными, а DeepEP пока признает часть функций экспериментальными.
Nvidia теряет прежде всего исключительность. Дженсен Хуанг заявил, что доля компании на китайском рынке упала до нуля из-за экспортной политики США. В такой среде Ascend не обязан немедленно победить лучшие Nvidia GPU во всех тестах. Huawei достаточно предложить работоспособный стек на доступном внутри Китая оборудовании.
Но за пределами этого рынка Nvidia сохраняет сильную позицию. Ее преимущество складывается из проверенных библиотек, специалистов, сетевого оборудования и постоянной оптимизации уже установленных систем. DeepSeek снизила технический порог входа для Ascend, но пока не показала полный цикл базового обучения своей крупнейшей модели на новом стеке.
Что стек Ascend означает для России
Сайт и API DeepSeek доступны из России, а открытые веса моделей можно развернуть на собственных серверах или в российском облаке. Опубликованные компоненты для Ascend также распространяются как открытые проекты, поэтому изучать код и готовить перенос можно без отдельной лицензии на инструменты DeepSeek.
Доступность серверов Huawei Ascend в России, их цена, сроки поставки и способы оплаты в пакете источников не указаны. Huawei готовит коммерческое облако Ascend 950 в Китае с 30 сентября и заявляла о глобальном запуске с 30 ноября, однако условия для российских клиентов пока неизвестны.
Для российской компании практический смысл состоит в возможности заранее отделить модель от CUDA. Даже без немедленной закупки Ascend можно проверить, какие части проекта зависят от собственных CUDA-ядер, поддерживаются ли нужные операции в TorchNPU и насколько переносим код на более высокий уровень. Это не отменяет затрат на миграцию, зато позволяет оценить их до выбора дорогостоящего кластера.
Главный риск заключается в кадрах и эксплуатации. Публичная документация показывает, что стек требует согласованных версий прошивки, драйверов, CANN, TorchNPU и библиотек. Если внутри команды нет специалистов по Ascend, экономия на ускорителях может раствориться в настройке, профилировании и исправлении несовместимостей. Сравнивать предложения стоит по стоимости обучения или миллиона токенов на своей модели, включая электричество и работу инженеров, а не по цене одной карты.
Вопросы и ответы
- Могут ли чипы Huawei Ascend полностью заменить Nvidia для нейросетей?
Пока только в части сценариев. Ascend уже используется для инференса DeepSeek V4 и постобучения модели V4-Pro с 1,6 трлн параметров, но основные модели DeepSeek, по данным Telepolis, продолжают обучаться на Nvidia. Полный цикл базового обучения крупнейших моделей на Huawei публично не подтвержден.
- Что такое TileLang и заменяет ли он CUDA?
TileLang является высокоуровневым языком и компилятором для вычислительных ядер ИИ-ускорителей. Он помогает переносить операции между Nvidia и Huawei, но не заменяет всю CUDA целиком. Роль базовой программной платформы для Ascend выполняет CANN.
- Можно ли перенести модель с PyTorch на Huawei Ascend?
Huawei предлагает для этого TorchNPU, который добавляет Ascend как устройство в PyTorch. В простых случаях достаточно заменить обращение к CUDA на NPU, но большой проект потребует проверки операторов, сторонних библиотек, драйверов и производительности распределенного обучения.
- Есть ли доказательства, что Ascend подходит для обучения больших моделей?
Группа с участием Huawei провела полнопараметрическое постобучение DeepSeek V4-Pro на кластере минимум из 1000 Ascend 910C. Это подтверждает способность платформы выполнять обучение высокого класса, но постобучение готовой модели отличается от ее базового обучения с нуля.
- Доступны ли DeepSeek и инструменты для Ascend в России?
Сайт и API DeepSeek открываются из России, а веса моделей доступны для локального развертывания. Инструменты DeepSeek для Ascend опубликованы с открытым исходным кодом. Наличие, цена и условия поставки оборудования Huawei Ascend в Россию пока неизвестны.
- Стоит ли компании уже мигрировать с Nvidia на Huawei?
Автоматического ответа нет: результат зависит от модели, размера кластера и стоимости эксплуатации. Разумный первый шаг состоит в тестовом переносе через TorchNPU и измерении скорости, энергопотребления и трудозатрат. Покупать крупный кластер только по заявленной пиковой производительности рискованно.

