К содержанию
Новости

Qwen3.8-Max стал доступен через API с контекстом до 1 млн токенов

Абстрактная графика hegai.media: залитое ядро в кольцах изолиний, как горизонтали на карте
Графика: hegai.media

Alibaba перевела модель Qwen3.8-Max из preview в режим общей доступности и подтвердила, что открытые веса для Qwen3.8-Max и Qwen3.8-27B выйдут на следующей неделе. Как сообщает MarkTechPost, флагманская модель семейства Qwen построена на архитектуре MoE и содержит 2,4 трлн параметров. Она принимает на вход текст, изображения и видео, а в ответ генерирует текст.

Qwen3.8-Max поддерживает контекстное окно до 1 млн токенов. Максимальный вход составляет 991 тыс. токенов, либо 983 тыс. при включённом thinking. Максимальный объём ответа достигает 131 тыс. токенов. Для API заявлены лимиты в 2 млн токенов в минуту и 15 тыс. запросов в минуту. Стоимость составляет 2 $ за 1 млн входных токенов и 6 $ за 1 млн выходных. Модель совместима с OpenAI- и DashScope-API, поэтому интеграция, по словам Alibaba, сводится к смене base URL и model ID.

Компания также раскрыла список поддерживаемых возможностей: function calling, structured outputs, batches, prefix completion и fine-tuning. В Responses API доступны инструменты code_interpreter, web_search, web_extractor, t2i_search и i2i_search. Для локального развёртывания Alibaba предлагает Qwen3.8-27B как вариант, совместимый с обычным on-premise GPU-оборудованием. При этом Qwen3.8-Max описывается как решение для многонодовых дата-центров.

Alibaba опубликовала и таблицу бенчмарков. Qwen3.8-Max набрала 86,6 в Terminal-Bench 2.1, 93,0 в PaperBench и 82,8 в IFBench. В компании отдельно отмечают рост мультимодальных и агентных возможностей по сравнению с Qwen3.7-Max, хотя уточняют, что часть сравнений проводилась не с Qwen3.7-Max, а с Qwen3.7-Plus.

Ключевые факты

  • Qwen3.8-Max поддерживает текст, изображения и видео на входе и возвращает текстовый ответ

  • Максимальный reasoning budget составляет 262 тыс. токенов

  • Implicit cache reads стоят 0,25 $ за 1 млн токенов, explicit cache creation, 2,50 $, explicit cache reads, 0,17 $

  • Qwen3.8-Max получила 92,6 в GPQA Diamond против 92,4 у Qwen3.7-Max

Вопросы и ответы

Что меняется для команд, у которых уже есть интеграции с OpenAI API?

Qwen3.8-Max совместима с OpenAI- и DashScope-API, поэтому для миграции Alibaba заявляет достаточно сменить base URL и model ID. Модель уже доступна в режиме общей доступности, а не preview.

Какие лимиты и цены важны для высоконагруженных AI-сценариев?

API поддерживает до 2 млн токенов в минуту и 15 тыс. запросов в минуту. Стоимость составляет 2 $ за 1 млн входных токенов и 6 $ за 1 млн выходных, а implicit cache reads стоят 0,25 $ за 1 млн токенов.

Для каких задач рассчитан Qwen3.8-Max и где его можно запускать?

Модель принимает текст, изображения и видео и поддерживает контекст до 1 млн токенов, включая reasoning budget до 262 тыс. токенов. Alibaba описывает Qwen3.8-Max как решение для многонодовых дата-центров, а для обычного on-premise GPU-оборудования рекомендует Qwen3.8-27B.

Контекст по теме