Как сообщает Hugging Face Blog, разработчики создали распределитель GPU, который учитывает ограничения, и сравнили его с планировщиком FIFO в семи тестовых сценариях. Оборудование и нагрузки оставались одинаковыми. Максимальный прирост загрузки GPU составил 33 процентных пункта. Приоритетно-взвешенный результат улучшился во всех сценариях, а в лучшем случае рост достиг 105%. Изменился только порядок принятия решений при распределении ресурсов.
В тестах за GPU конкурировали обучение, инференс в реальном времени, пакетный инференс и квантование. Обучению, пакетному инференсу и квантованию нужен непрерывный блок GPU до завершения задачи. Инференс в реальном времени работает иначе: он использует эластичный объем ресурсов, который на каждом временном шаге меняется вслед за спросом. При этом обучение одной базовой модели может занимать от нескольких часов до нескольких дней и задействовать от одного GPU до десятков.
В схеме FIFO под максимальный суточный спрос инференса в реальном времени выделялся фиксированный резерв. Остальные задачи получали ресурсы в порядке поступления, без учета приоритета. Например, если приложению требовалось шесть GPU днем и два в 4:00, все шесть оставались за ним в течение 24 часов. В сценариях, где эффект резервирования был наиболее заметен, загрузка базового варианта достигала 51,6% при смешанной контрольной нагрузке и 53,6% в сценарии с преобладанием обучения.
Ключевые факты
Распределитель с учетом ограничений сравнили с FIFO в семи тестовых сценариях.
Загрузка GPU выросла максимум на 33 процентных пункта, а приоритетно-взвешенный результат, максимум на 105%.
В двух сценариях с преобладанием резервирования загрузка FIFO-варианта составила 51,6% и 53,6%.
Приложение со спросом в шесть GPU днем и два GPU в 4:00 при фиксированном резерве удерживает все шесть GPU в течение 24 часов.
Вопросы и ответы
- Что именно изменили в работе кластера?
Оборудование и нагрузки оставили прежними, изменив только порядок распределения ресурсов: новый планировщик учитывает ограничения и приоритеты, тогда как FIFO резервирует GPU под максимальный спрос и размещает остальные задачи по очереди.
- Какие типы нагрузок участвовали в тестах?
За GPU конкурировали обучение, инференс в реальном времени, пакетный инференс и квантование. Обучение, пакетный инференс и квантование требуют непрерывного блока GPU, а инференс в реальном времени может менять объем ресурсов на каждом временном шаге.
- Где у FIFO возникает основной перерасход ресурсов?
Фиксированный резерв удерживает мощности под пиковый спрос: приложение с потребностью в шести GPU днем и двух GPU в 4:00 занимает все шесть GPU круглосуточно. В двух сценариях с преобладанием резервирования загрузка FIFO составила только 51,6% и 53,6%.
Контекст по теме
- Оптимизация Qwen 3.5-397B MoE может изменить выбор Ironwood при нагрузке с преобладанием предварительного заполнения17 августа 2026 г.
- Together AI обновила GPU-кластеры для обучения и инференса моделей15 июля 2026 г.
- Towards Data Science предложил оценивать конфигурации ИИ-агентов через сравнение лучших и худших ответов6 июля 2026 г.
- В Китае формируются гигаваттные кластеры дата‑центров на «зеленой» энергии на фоне роста спроса на AI‑инфраструктуру21 июня 2026 г.