К содержанию
Выпуск №70 · 17 августа 2026 / Новости

DLO в vLLM-Omni запускает Cosmos3-Super объёмом 124 ГБ на ускорителях с 64 ГБ HBM

Как сообщает vLLM Blog, механизм Distributed Layerwise Offload в vLLM-Omni распределяет веса DiT между несколькими NPU или GPU и подаёт их на устройства слой за слоем.

Редакция 17 августа 2026 г., 12:11 MSK

В Telegram

Как сообщает vLLM Blog, механизм Distributed Layerwise Offload в vLLM-Omni распределяет веса DiT между несколькими NPU или GPU и подаёт их на устройства слой за слоем. В измеренных запусках Cosmos3-Super с 64 млрд параметров и весами объёмом 124 ГБ в BF16 работала на ускорителях с 64 ГБ HBM. По оценке авторов, этот подход позволит запускать модели размером свыше 200 млрд параметров.

При загрузке через mmap веса используют общий страничный кеш операционной системы. Каждый ранг при этом хранит только 1/dp_size модели. Во время выполнения полные веса слоя восстанавливаются через AllGather, параллельно с вычислениями. Одновременно на каждом устройстве находятся веса ровно двух слоёв. Общий расход HBM также зависит от крупнейшего блока модели, активаций и коммуникационных буферов.

В многозадачном режиме DP система показала пропускную способность в 3,3 раза выше, чем HSDP с одним запросом. Это около 83% от идеального четырёхкратного масштабирования. На конфигурации 8× B300 оптимальный маршрут определялся сочетанием DP и SP. AllGather показал лучшие результаты для DP1×SP8 и DP4×SP2, а локальный для ранга DLO оказался оптимальным для DP8×SP1.

Механизм поддерживает NVIDIA GPU через CUDA/NCCL и Ascend NPU через CANN/HCCL. Для работы DLO с AllGather нужны vLLM 0.27.0 и vLLM-Omni v0.27.0rc1 либо более поздние версии. В выпуске v0.26.0 путь Cosmos3 DLO+DP отклонял все запросы. Исправление #5864 изменило их обработку в конфигурациях DLO+AllGather+DP.

Ключевые факты

  • Пик видимой для cgroup оперативной памяти при холодном запуске Cosmos3-Nano DP4 снизился на 73%, со 178 до 47 ГБ.

  • При нагрузке 720p длительностью 10 с пик HBM вырос примерно на 22%, с 23,1 до 28,1 ГБ, при переходе от 17 млрд к 64 млрд параметров.

  • Многозадачная обработка DP достигла 3,3-кратной пропускной способности относительно HSDP с одним запросом, или около 83% от идеального масштабирования в 4 раза.

  • На конфигурации 8× B300 локальный для ранга DLO при DP8×SP1 показал 183,78 видео/ч и 43,97 Вт·ч на видео.

Вопросы и ответы

Какие версии и оборудование нужны для запуска DLO?

Механизм работает на NVIDIA GPU через CUDA/NCCL и Ascend NPU через CANN/HCCL. Для режима AllGather нужны vLLM 0.27.0 и vLLM-Omni v0.27.0rc1 или новее, поскольку в v0.26.0 конфигурация Cosmos3 DLO+DP отклоняла все запросы.

Как DLO сокращает требования к памяти на каждом ускорителе?

Каждый ранг хранит только 1/dp_size модели, а полные веса слоя собираются через AllGather параллельно с вычислениями. На одном устройстве одновременно размещаются веса ровно двух слоёв; при холодном запуске Cosmos3-Nano DP4 пик оперативной памяти снизился со 178 до 47 ГБ, на 73%.

Какую производительность можно ожидать на 8× B300?

В конфигурации DP8×SP1 локальный для ранга DLO обеспечил 183,78 видео в час при энергозатратах 43,97 Вт·ч на видео. В многозадачном режиме DP пропускная способность была в 3,3 раза выше HSDP с одним запросом, что соответствует примерно 83% идеального масштабирования в 4 раза.

Контекст по теме

Как процитировать

«DLO в vLLM-Omni запускает Cosmos3-Super объёмом 124 ГБ на ускорителях с 64 ГБ HBM». hegai.media, 17 августа 2026 г.. https://hegai.media/novosti/dlo-v-vllm-omni-zapuskaet-cosmos3-super-obemom-124-gb-na-uskoritelyah--f715c4cc-9e29-41b6-9b7c-1891771fa68d

так материал выглядит в мессенджере