Энергия становится не строкой после стоимости GPU, а границей всей конфигурации. Поэтому кластер пора оценивать не по тому, сколько токенов он выдаёт на пике, а по тому, сколько полезных запросов укладывается в доступную мощность и требования приложения. NVIDIA с DSX MaxLPS предлагает именно такой поворот, но пока вместе с метрикой продаёт и собственный ответ на неё.
Что предлагает NVIDIA
В техническом блоге NVIDIA называет AI-фабрики системами, ограниченными мощностью. Из каждого мегаватта часть забирают охлаждение, распределение энергии, сеть, хранилища, резервирование и потери. В приведённом компанией примере площадки на 100 МВт до ИИ-нагрузки доходят 60 МВт: 20 МВт уходят на инфраструктурные накладные расходы, 10 МВт на потери внутри стоек, ещё 10 МВт недоступны из-за сбоев, перезапусков и checkpointing.
Вторая проблема возникает уже внутри этого остатка. Стойки обычно проектируют под максимальное потребление, будто все они одновременно достигнут пика. Но обучение, inference и другие нагрузки чередуют вычислительные всплески, обращения к памяти, синхронизацию, prefill, decode и простои. Зарезервированная мощность одной стойки поэтому может не использоваться, хотя соседней её не хватает.
DSX MaxLPS должен возвращать этот застрявший запас в работу. Dynamic Power Software, пока доступный в Developer Preview, собирает телеметрию на уровнях GPU, стоек и групп ресурсов, сравнивает выделенную мощность с фактическим потреблением и перераспределяет свободный лимит по заданным политикам. При изменениях энергобюджета или аварийных событиях система также корректирует ограничения без ручной перенастройки каждой стойки.
К этому NVIDIA добавляет программные оптимизации производительности на ватт и проектирование площадки под жидкостное охлаждение водой температурой 45 °C. Компания пишет, что проверяла MaxLPS на Vera Rubin NVL72 и GB200 NVL72. Заявленный результат составляет до 40% дополнительной GPU-ёмкости в прежнем контуре площадки и улучшение производительности на ватт в 1,3-1,5 раза. Сама NVIDIA оговаривает, что эффект зависит от оптимизации инфраструктуры, профилирования нагрузки и раннего проектирования площадки под такое охлаждение.
Почему метрика правильная, а цифра пока условная
Логика MaxLPS здравая: покупатель получает пользу не от установленного количества GPU и не от рекордного теста, а от выполненной прикладной работы. Для inference эту работу разумно считать только среди запросов, прошедших ваш SLO. Иначе экономия ваттов может оказаться обменом мощности на задержку, которую продукт уже не принимает.
Но опубликованное описание не даёт достаточной основы, чтобы независимо воспроизвести заявленные 40% или 1,3-1,5 раза. В нём нет полного профиля тестовых нагрузок, их SLO, конфигурации сравниваемой статической схемы, настроек политик DPS и подробного расчёта итоговой прикладной производительности. Пример с 60 МВт вычислительной мощности тоже представлен как иллюстративный бюджет, а не универсальная пропорция для любой площадки.
Это не делает методику бесполезной. Это отделяет правильный вопрос от готового ответа поставщика. NVIDIA показывает, где искать потери: в запасе под пики, охлаждении, сбоях и неспособности передавать свободную мощность между стойками. Но подтверждённые результаты относятся к системам NVIDIA и зависят от архитектуры площадки, которую компания предлагает проектировать вместе со своим стеком. Здесь инженерная метрика легко превращается в аккуратный аргумент купить весь комплект.
Что пересчитать уже сейчас
Инфраструктурной команде стоит добавить к тендеру собственный показатель: число запросов или задач, проходящих SLO, на доступный ватт площадки. Считать нужно от ввода энергии, а не только от паспорта GPU, отдельно фиксируя потери, охлаждение, резерв под пики и простои. Затем прогнать реальный профиль нагрузки при одинаковом энергобюджете для всех конфигураций.
Так более быстрый GPU может оказаться менее выгодным, если ради его пиков приходится держать большой неиспользуемый резерв или перестраивать охлаждение. И наоборот, динамическое управление мощностью может оправдать более плотную конфигурацию без увеличения лимита площадки.
Главный маркер дальше конкретен: NVIDIA должна опубликовать воспроизводимый сценарий с workload, SLO, статическим baseline, политиками DPS и полным энергобюджетом от площадки до GPU. Пока такого сценария нет, DSX MaxLPS стоит использовать как рамку для собственного расчёта, а не как калькулятор будущей мощности из презентации поставщика.
