К содержанию
Выпуск №80 · 27 августа 2026 / Новости

NVIDIA MPS и Triton снизили потребность ASR-сервиса в GPU-инстансах на 75%

Как сообщает AWS Machine Learning Blog, AWS, NVIDIA и Heidi Health показали конфигурацию для обслуживания модели NVIDIA Parakeet TDT 0.6B V2 на Amazon EC2.

Редакция 27 августа 2026 г., 21:32 MSK

В Telegram

Как сообщает AWS Machine Learning Blog, AWS, NVIDIA и Heidi Health показали конфигурацию для обслуживания модели NVIDIA Parakeet TDT 0.6B V2 на Amazon EC2. Она позволяет сократить число необходимых GPU-инстансов с 16 до 4. Связка NVIDIA CUDA MPS и NVIDIA Triton Inference Server сохраняет задержку менее секунды при нагрузке 92,1 запроса в секунду на один GPU.

Один запрос к модели использует примерно 15–20% вычислительной мощности NVIDIA L40S, поэтому около 80% оборудования остается незагруженным. При стандартном разделении времени процессы обращаются к GPU по очереди, а переключение контекста создает дополнительные накладные расходы. В результате один GPU обрабатывает около 62 запросов в секунду. Средняя задержка составляет менее 650 мс, p99 не превышает 1 000 мс.

MPS решает эту проблему за счет общего контекста GPU. Ядра разных процессов могут одновременно выполняться на разных потоковых мультипроцессорах, причем менять код для этого не нужно. В описанной конфигурации GPU разделен между четырьмя параллельными экземплярами, каждый получает по 25% потоковых мультипроцессоров.

Ключевые факты

  • Heidi Health обрабатывает более 2,4 млн клинических консультаций в неделю в 190 странах.

  • Один запрос к NVIDIA Parakeet TDT 0.6B V2 использует примерно 15–20% из 142 потоковых мультипроцессоров NVIDIA L40S.

  • При стандартном разделении времени один GPU обрабатывает около 62 запросов в секунду при средней задержке менее 650 мс и p99 менее 1 000 мс.

  • Конфигурация с MPS обеспечивает 92,1 запроса в секунду на один GPU при задержке менее секунды.

Вопросы и ответы

За счет чего конфигурация лучше загружает GPU?

MPS дает четырем процессам общий контекст GPU и запускает их ядра параллельно без изменения кода. Каждому экземпляру выделяется по 25% потоковых мультипроцессоров вместо последовательного доступа к GPU.

Как меняются производительность и задержка на одном GPU?

Пропускная способность растет с примерно 62 до 92,1 запроса в секунду, при этом задержка остается менее секунды. В стандартной конфигурации средняя задержка была менее 650 мс, а p99 менее 1 000 мс.

Для какой нагрузки проверяли эту схему?

Конфигурацию показали на NVIDIA Parakeet TDT 0.6B V2 для ASR-сервиса Heidi Health, который обрабатывает более 2,4 млн клинических консультаций в неделю в 190 странах.

Контекст по теме

Как процитировать

«NVIDIA MPS и Triton снизили потребность ASR-сервиса в GPU-инстансах на 75%». hegai.media, 27 августа 2026 г.. https://hegai.media/novosti/nvidia-mps-i-triton-snizili-potrebnost-asr-servisa-v-gpu-instansah-na--585b6db8-a301-41a8-a0ee-77b928e55ce5

так материал выглядит в мессенджере