Как сообщает vLLM Blog, механизм Distributed Layerwise Offload в vLLM-Omni распределяет веса DiT между несколькими NPU или GPU и подаёт их на устройства слой за слоем. В измеренных запусках Cosmos3-Super с 64 млрд параметров и весами объёмом 124 ГБ в BF16 работала на ускорителях с 64 ГБ HBM. По оценке авторов, этот подход позволит запускать модели размером свыше 200 млрд параметров.
При загрузке через mmap веса используют общий страничный кеш операционной системы. Каждый ранг при этом хранит только 1/dp_size модели. Во время выполнения полные веса слоя восстанавливаются через AllGather, параллельно с вычислениями. Одновременно на каждом устройстве находятся веса ровно двух слоёв. Общий расход HBM также зависит от крупнейшего блока модели, активаций и коммуникационных буферов.
В многозадачном режиме DP система показала пропускную способность в 3,3 раза выше, чем HSDP с одним запросом. Это около 83% от идеального четырёхкратного масштабирования. На конфигурации 8× B300 оптимальный маршрут определялся сочетанием DP и SP. AllGather показал лучшие результаты для DP1×SP8 и DP4×SP2, а локальный для ранга DLO оказался оптимальным для DP8×SP1.
Механизм поддерживает NVIDIA GPU через CUDA/NCCL и Ascend NPU через CANN/HCCL. Для работы DLO с AllGather нужны vLLM 0.27.0 и vLLM-Omni v0.27.0rc1 либо более поздние версии. В выпуске v0.26.0 путь Cosmos3 DLO+DP отклонял все запросы. Исправление #5864 изменило их обработку в конфигурациях DLO+AllGather+DP.
Ключевые факты
Пик видимой для cgroup оперативной памяти при холодном запуске Cosmos3-Nano DP4 снизился на 73%, со 178 до 47 ГБ.
При нагрузке 720p длительностью 10 с пик HBM вырос примерно на 22%, с 23,1 до 28,1 ГБ, при переходе от 17 млрд к 64 млрд параметров.
Многозадачная обработка DP достигла 3,3-кратной пропускной способности относительно HSDP с одним запросом, или около 83% от идеального масштабирования в 4 раза.
На конфигурации 8× B300 локальный для ранга DLO при DP8×SP1 показал 183,78 видео/ч и 43,97 Вт·ч на видео.
Вопросы и ответы
- Какие версии и оборудование нужны для запуска DLO?
Механизм работает на NVIDIA GPU через CUDA/NCCL и Ascend NPU через CANN/HCCL. Для режима AllGather нужны vLLM 0.27.0 и vLLM-Omni v0.27.0rc1 или новее, поскольку в v0.26.0 конфигурация Cosmos3 DLO+DP отклоняла все запросы.
- Как DLO сокращает требования к памяти на каждом ускорителе?
Каждый ранг хранит только 1/dp_size модели, а полные веса слоя собираются через AllGather параллельно с вычислениями. На одном устройстве одновременно размещаются веса ровно двух слоёв; при холодном запуске Cosmos3-Nano DP4 пик оперативной памяти снизился со 178 до 47 ГБ, на 73%.
- Какую производительность можно ожидать на 8× B300?
В конфигурации DP8×SP1 локальный для ранга DLO обеспечил 183,78 видео в час при энергозатратах 43,97 Вт·ч на видео. В многозадачном режиме DP пропускная способность была в 3,3 раза выше HSDP с одним запросом, что соответствует примерно 83% идеального масштабирования в 4 раза.
Контекст по теме
- Оптимизация Qwen 3.5-397B MoE может изменить выбор Ironwood при нагрузке с преобладанием предварительного заполнения17 августа 2026 г.
- KDnuggets перечислил подходы к снижению задержек и стоимости LLM в продакшене14 июля 2026 г.
- Liquid AI представила компактную модель LFM2.5-230M для локального запуска на устройствах28 июня 2026 г.
- Инженер показал локального ассистента с «памятью» на базе 4B‑модели и пайплайна distill‑on‑idle26 июня 2026 г.