К содержанию
Новости

AI Gateway добавил уровни обслуживания для управления задержкой и стоимостью запросов

AI Gateway добавил уровни обслуживания для управления задержкой и стоимостью запросов

Vercel добавила в AI Gateway поддержку service tiers, уровней обслуживания для выбора режима обработки запросов в зависимости от требований к задержке, пропускной способности и стоимости. Для интерактивных сценариев доступен режим priority: у него меньше очередь и выше скорость обработки токенов. Для фоновых задач предусмотрен flex, этот режим дешевле, но задержка может быть выше.

Как сообщает Vercel (Changelog / News, incl. AI SDK), на старте функция доступна для моделей OpenAI и Gemini. Уровни обслуживания работают во всех форматах API AI Gateway, включая AI SDK, Chat Completions API, Anthropic Messages API, OpenAI Responses API и OpenResponses API. Если уровень не указан, запросы обрабатываются в стандартном режиме default.

Платформа автоматически рассчитывает биллинг по фактически применённому уровню. Например, если запрос был отправлен с priority, но затем переведён на стандартную ёмкость, стоимость посчитают по тарифу default. В метаданных provider также возвращается информация о реально использованном уровне, это позволяет проверить, какой режим применился, и сравнить задержки между tier.

Ключевые факты

  • Для режима priority заявлена стоимость примерно в 1,8–2 раза выше default

  • Режим flex оценивается примерно в половину стоимости default

  • Если указанный уровень недоступен, запрос автоматически выполняется в режиме default по стандартному тарифу

  • Настройка serviceTier задаётся через providerOptions.gateway и может использоваться для разных моделей и провайдеров без изменения структуры конфигурации