Команда ML-платформы RWB внедрила AIOps-подход для обработки алертов, связанных с утилизацией ресурсов. Он автоматизирует реакцию на такие уведомления. Как сообщают в материале на Habr руководитель команды Даниил Понизов и MLOps-инженер Роман Лазовский, благодаря автоматизации средняя месячная утилизация GPU на отдельных кластерах выросла более чем на 60%.
Раньше уведомления приходили в корпоративный мессенджер, после чего с ними разбирался дежурный инженер. По мере роста числа повторяющихся сигналов эта схема перестала справляться. Отслеживать состояние алертов становилось сложнее, а при передаче между участниками терялся контекст. Особенно остро проблема проявлялась в дни, когда поступали десятки или сотни алертов и к поиску и устранению причин подключались несколько команд.
RWB использует GPU в Kubernetes-кластерах. Видеокарты подключаются через GPU Operator, внутри которого работает DCGM Exporter от NVIDIA. Команда следит за четырьмя группами показателей: вычислительной утилизацией, использованием памяти GPU, физическими параметрами видеокарт и ошибками GPU.
По оценке авторов, высокой вычислительной загрузки самой по себе недостаточно. Нужно эффективно использовать память, учитывать физические ограничения видеокарт и сводить число ошибок к минимуму. Команды могут устранять причины отклонений, а результаты этой работы отражаются на средней месячной утилизации GPU.
Ключевые факты
Средняя месячная утилизация GPU на отдельных кластерах выросла более чем на 60%.
GPU используются в Kubernetes-кластерах и подключаются через GPU Operator с DCGM Exporter от NVIDIA.
Мониторинг охватывает вычислительную утилизацию, использование памяти GPU, физические показатели видеокарт и ошибки GPU.
Материал подготовили Даниил Понизов и Роман Лазовский из команды ML-платформы RWB.
Вопросы и ответы
- Когда ручная обработка алертов перестает справляться?
В RWB проблема стала критичной при десятках или сотнях алертов в день, особенно когда причины устраняли несколько команд и требовалась передача контекста.
- Какой практический эффект дала автоматизация?
На отдельных кластерах средняя месячная утилизация GPU выросла более чем на 60%.
- Какие метрики и инфраструктуру охватывает решение?
GPU работают в Kubernetes-кластерах через NVIDIA GPU Operator с DCGM Exporter. Мониторинг включает четыре группы показателей: вычислительную утилизацию, память GPU, физические параметры видеокарт и ошибки.
Контекст по теме
- Исследователи описали атаку на электросеть через синхронную нагрузку GPU-кластера21 июля 2026 г.
- Together AI обновила GPU-кластеры для обучения и инференса моделей15 июля 2026 г.
- Эксперт заявил о недоиспользованном потенциале ИИ в российских компаниях22 июня 2026 г.
- На конференции Conversations обсудят путь от MVP к продакшену и роль ИИ-агентов в компаниях10 июня 2026 г.