К содержанию
Выпуск №100 · 16 сентября 2026 / Новости

AI-фабрике добавили 24% токенов без новых мегаватт, но это пока не универсальная скидка на электричество

Emerald AI, Lambda и NVIDIA показали два способа управлять энергобюджетом GPU-кластера: переносить некритичные задачи по сигналу сети и перераспределять мощность между серверами. Для операторов это повод считать производительность в токенах на мегаватт, а не только в количестве ускорителей.

Редакция 16 сентября 2026 г., 15:35 MSK

В Telegram

Дефицит мощности у AI-фабрики можно частично компенсировать софтом. В испытании Lambda управление питанием увеличило пропускную способность кластера на 24% при прежнем энергобюджете. Это не отменяет строительство подстанций, но дает операторам еще один рычаг до покупки новых мегаватт.

В блоге NVIDIA описаны два связанных, но разных эксперимента. В первом платформа Conductor от Emerald AI принимала сигналы Silicon Valley Power и автоматически меняла приоритеты вычислений. Задачи, которые могли подождать, замедлялись или переносились, а приоритетный инференс продолжал работать.

Во время одного такого сигнала потребление AI-фабрики снизилось с 4 до 3 МВт без вмешательства оператора. После этого энергокомпания отправила более 200 сигналов, и, по данным NVIDIA, система успешно обработала каждый из них.

Второй результат получила Lambda при проверке NVIDIA DSX MaxLPS на кластере из пяти стоек и 19 узлов с NVIDIA HGX B200. Софт отслеживал потребление на уровне GPU и стоек, а затем перераспределял свободный запас мощности между узлами в зависимости от нагрузки.

Lambda запустила 19 узлов в том же энергобюджете, который при статическом распределении позволял работать 16 узлам на полной мощности. Общая скорость выросла примерно с 4 млн до 5 млн токенов в секунду, то есть на 24%. Производительность на ватт увеличилась на 23%.

Мегаватт становится производственным бюджетом

Главная перемена здесь не в красивой автоматизации, а в единице управленческого учета. Если электричество ограничивает масштаб кластера, считать только число GPU недостаточно. Важнее, сколько токенов выпускает доступный мегаватт и сколько мощности простаивает из-за того, что серверы настроены под максимальное потребление, хотя реальные нагрузки ведут себя по-разному.

Статическое резервирование удобно: каждому узлу заранее выделяют запас. Но часть этого запаса неизбежно остается невостребованной. DSX MaxLPS пытается собрать такую мощность и отдать ее туда, где она прямо сейчас превращается в вычисления. Conductor решает соседнюю задачу: временно уступает мощность энергосети за счет работ, перенос которых не ломает приоритетные сервисы.

Для оператора GPU-кластера это означает, что экономика зависит не только от цены ускорителей и электричества. Имеет значение структура очереди: какая доля обучения, пакетной обработки и других задач действительно допускает замедление или перенос. Если все вычисления срочные, управлять почти нечем.

Ограничение у результата существенное. Цифры опубликованы NVIDIA, а тест Lambda назван proof of concept в среде развертывания. Показанные 24% нельзя автоматически переносить на любой кластер и профиль нагрузки. Но сам подход уже достаточно конкретен для проверки: перед расширением энергомощности стоит измерить, сколько токенов теряется из-за статического распределения питания. Иногда новый планировщик может оказаться дешевле нового мегаватта.

Как процитировать

«AI-фабрике добавили 24% токенов без новых мегаватт, но это пока не универсальная скидка на электричество». hegai.media, 16 сентября 2026 г.. https://hegai.media/novosti/ai-fabrike-dobavili-24-tokenov-bez-novyh-megavatt-no-eto-poka-ne-unive--b0d0ad39-4ab2-4fc4-b8c5-24260df61ae4

так материал выглядит в мессенджере