AI Gateway добавил уровни обслуживания для управления задержкой и стоимостью запросов
Vercel добавила в AI Gateway поддержку service tiers, уровней обслуживания для выбора режима обработки запросов в зависимости от требований к задержке, пропускной способности и стоимости. Для интерактивных сценариев доступен режим priority: у него меньше очередь и выше скорость обработки токенов. Для фоновых задач предусмотрен flex, этот режим дешевле, но задержка может быть выше.
Как сообщает Vercel (Changelog / News, incl. AI SDK), на старте функция доступна для моделей OpenAI и Gemini. Уровни обслуживания работают во всех форматах API AI Gateway, включая AI SDK, Chat Completions API, Anthropic Messages API, OpenAI Responses API и OpenResponses API. Если уровень не указан, запросы обрабатываются в стандартном режиме default.
Платформа автоматически рассчитывает биллинг по фактически применённому уровню. Например, если запрос был отправлен с priority, но затем переведён на стандартную ёмкость, стоимость посчитают по тарифу default. В метаданных provider также возвращается информация о реально использованном уровне, это позволяет проверить, какой режим применился, и сравнить задержки между tier.
Ключевые факты
Для режима priority заявлена стоимость примерно в 1,8–2 раза выше default
Режим flex оценивается примерно в половину стоимости default
Если указанный уровень недоступен, запрос автоматически выполняется в режиме default по стандартному тарифу
Настройка serviceTier задаётся через providerOptions.gateway и может использоваться для разных моделей и провайдеров без изменения структуры конфигурации