К содержанию
Выпуск №70 · 17 августа 2026 / Новости

Для real-time AI-агентов предложили балансировку по числу сессий и загрузке CPU

Долгоживущие двунаправленные потоки real-time AI-агентов требуют иного подхода к распределению нагрузки, чем обычные веб-запросы.

Редакция 16 августа 2026 г., 02:33 MSK

В Telegram
Абстрактная графика hegai.media: светлый серп на тёмном поле, вокруг тонкие концентрические кольца с засечками
Графика: hegai.media

Долгоживущие двунаправленные потоки real-time AI-агентов требуют иного подхода к распределению нагрузки, чем обычные веб-запросы. Как пишет Google Developers Blog, показатели QPS и текущей загрузки CPU не показывают весь объём обязательств сервера. Соединение может оставаться открытым, а внутри него продолжают передаваться аудиофрагменты, расшифровки, ответы модели и синтезированная речь.

Разработчикам предлагают отслеживать активные сессии на уровне приложения: от начала потокового взаимодействия до его завершения, сбоя или отмены. При закрытии сессии счётчик должен корректно уменьшаться. Если этого не сделать, система увидит несуществующую перегрузку. Повторное уменьшение, наоборот, создаст ложный запас мощности и привлечёт избыточный трафик.

Число активных сессий стоит учитывать вместе с загрузкой CPU в гибридном алгоритме маршрутизации. Первый показатель отражает обязательства по обслуживанию разговоров, которые сервер уже принял, второй показывает текущую вычислительную нагрузку. Такой подход учитывает и периоды молчания пользователей, и резкие всплески обработки, когда несколько участников начинают говорить одновременно.

Ключевые факты

  • В примере 100 запросов по 50 миллисекунд создают менее длительную нагрузку, чем 5 сессий по 20 минут.

  • 20 молчащих сессий могут выглядеть как низкая загрузка, но одновременная речь пользователей способна вызвать резкий рост использования CPU.

  • Для двунаправленной потоковой передачи real-time агенты могут использовать gRPC или WebSockets.

  • В памяти среды выполнения одной сессии могут находиться аудиобуферы, частичные расшифровки, активные вызовы инструментов, контекст модели и пользовательские метрики.

Вопросы и ответы

Почему стандартных метрик QPS и загрузки CPU недостаточно?

100 запросов по 50 миллисекунд создают меньшие обязательства, чем 5 сессий по 20 минут. Кроме того, 20 молчащих сессий могут почти не нагружать CPU, но одновременная речь пользователей вызовет резкий скачок вычислений.

Какую метрику нужно добавить и как её считать?

Нужно считать активные сессии на уровне приложения: увеличивать счётчик при начале потокового взаимодействия и уменьшать при завершении, сбое или отмене. Пропущенное уменьшение создаст ложную перегрузку, а повторное уменьшение привлечёт на сервер избыточный трафик.

Что именно удерживает ресурсы сервера во время такой сессии?

Одна сессия через gRPC или WebSockets может хранить в памяти аудиобуферы, частичные расшифровки, активные вызовы инструментов, контекст модели и пользовательские метрики.

Контекст по теме

Как процитировать

«Для real-time AI-агентов предложили балансировку по числу сессий и загрузке CPU». hegai.media, 16 августа 2026 г.. https://hegai.media/novosti/dlya-real-time-ai-agentov-predlozhili-balansirovku-po-chislu-sessiy-i--e585bbe7-46da-4400-bce8-e78fd1379994

так материал выглядит в мессенджере