К содержанию
Выпуск №73 · 20 августа 2026 / Новости

RWB автоматизировала обработку GPU-алертов и повысила среднюю месячную утилизацию на отдельных кластерах более чем на 60%

Команда ML-платформы RWB внедрила AIOps-подход для обработки алертов, связанных с утилизацией ресурсов. Он автоматизирует реакцию на такие уведомления.

Редакция 20 августа 2026 г., 19:16 MSK

В Telegram

Команда ML-платформы RWB внедрила AIOps-подход для обработки алертов, связанных с утилизацией ресурсов. Он автоматизирует реакцию на такие уведомления. Как сообщают в материале на Habr руководитель команды Даниил Понизов и MLOps-инженер Роман Лазовский, благодаря автоматизации средняя месячная утилизация GPU на отдельных кластерах выросла более чем на 60%.

Раньше уведомления приходили в корпоративный мессенджер, после чего с ними разбирался дежурный инженер. По мере роста числа повторяющихся сигналов эта схема перестала справляться. Отслеживать состояние алертов становилось сложнее, а при передаче между участниками терялся контекст. Особенно остро проблема проявлялась в дни, когда поступали десятки или сотни алертов и к поиску и устранению причин подключались несколько команд.

RWB использует GPU в Kubernetes-кластерах. Видеокарты подключаются через GPU Operator, внутри которого работает DCGM Exporter от NVIDIA. Команда следит за четырьмя группами показателей: вычислительной утилизацией, использованием памяти GPU, физическими параметрами видеокарт и ошибками GPU.

По оценке авторов, высокой вычислительной загрузки самой по себе недостаточно. Нужно эффективно использовать память, учитывать физические ограничения видеокарт и сводить число ошибок к минимуму. Команды могут устранять причины отклонений, а результаты этой работы отражаются на средней месячной утилизации GPU.

Ключевые факты

  • Средняя месячная утилизация GPU на отдельных кластерах выросла более чем на 60%.

  • GPU используются в Kubernetes-кластерах и подключаются через GPU Operator с DCGM Exporter от NVIDIA.

  • Мониторинг охватывает вычислительную утилизацию, использование памяти GPU, физические показатели видеокарт и ошибки GPU.

  • Материал подготовили Даниил Понизов и Роман Лазовский из команды ML-платформы RWB.

Вопросы и ответы

Когда ручная обработка алертов перестает справляться?

В RWB проблема стала критичной при десятках или сотнях алертов в день, особенно когда причины устраняли несколько команд и требовалась передача контекста.

Какой практический эффект дала автоматизация?

На отдельных кластерах средняя месячная утилизация GPU выросла более чем на 60%.

Какие метрики и инфраструктуру охватывает решение?

GPU работают в Kubernetes-кластерах через NVIDIA GPU Operator с DCGM Exporter. Мониторинг включает четыре группы показателей: вычислительную утилизацию, память GPU, физические параметры видеокарт и ошибки.

Контекст по теме

Как процитировать

«RWB автоматизировала обработку GPU-алертов и повысила среднюю месячную утилизацию на отдельных кластерах более чем на 60%». hegai.media, 20 августа 2026 г.. https://hegai.media/novosti/rwb-avtomatizirovala-obrabotku-gpu-alertov-i-povysila-srednyuyu-mesyac--97f9f929-5eb6-4472-b0c5-3adc71977895

так материал выглядит в мессенджере