К содержанию
Выпуск №72 · 19 августа 2026 / Новости

Qwen3.8-27B, кандидат на замену API. Решат время и стоимость результата

4-битная сборка размером около 17 ГБ пишет код, читает изображения и запускает агентный цикл на домашнем железе. Но прежде чем переносить задачи из платного облака, бизнесу придётся проверить модель на собственных процессах и посчитать стоимость готового результата.

Редакция 19 августа 2026 г., 18:18 MSK

В Telegram

Alibaba выпустила Qwen3.8-27B с открытыми весами, и модель действительно помещается на хорошо оснащённом ноутбуке. Но это пока не облачный API в одном файле: за локальность приходится платить памятью и временем ожидания, поэтому главный тест для бизнеса начинается после скачивания.

Что вышло

Qwen3.8-27B содержит 27 млрд параметров и понимает текст, изображения и видео, пишет TNW. Веса опубликованы на Hugging Face под лицензией Apache 2.0: компании могут изучать, изменять и самостоятельно размещать модель. Скачать её можно бесплатно.

В полной точности модели требуется около 56 ГБ памяти GPU. После 4-битного сжатия файл занимает примерно 17 ГБ, что уже соответствует возможностям мощного игрового компьютера или хорошо оснащённого ноутбука.

Независимые тесты объясняют ажиотаж. Artificial Analysis присвоила Qwen3.8-27B оценку 52 на Intelligence Index, который объединяет девять проверок по программированию, науке и рассуждениям. Столько же получила GPT-5.6 Luna на максимальном уровне рассуждений. В своей категории из 135 моделей разработка Alibaba заняла первое место.

Собственные цифры Alibaba выглядят ещё эффектнее: 61,7 на SWE-bench Pro и 90,3 на LiveCodeBench. В опубликованной таблице модель обошла указанный результат Claude Opus 4.6. Но VentureBeat предупреждает, что часть оценок была внутренней, а условия тестов различались. Объявлять победителя по такой таблице было бы преждевременно.

Это важное отличие от прежнего анонса Qwen3.8, когда Alibaba заявляла о втором месте модели в мире, но, как тогда отмечала TNW, не показывала доказательств. Теперь независимая оценка есть. Она подтверждает, что небольшая модель способна приблизиться к крупным облачным системам хотя бы на стандартизированных задачах.

Но ноутбук всё ещё умеет ждать

Практический тест провёл разработчик Саймон Уиллисон. Он запустил сборку размером около 17 ГБ на ноутбуке Apple и компьютере с Nvidia. В его тесте модель писала код, читала изображения и выполняла цикл coding-агента. Локальный сценарий уже не ограничен чат-ботом, который пересказывает загруженный текст, хотя одного эксперимента недостаточно для общего вывода о возможностях модели.

Цена качества проявилась сразу. Простая просьба нарисовать изображение заняла 21 минуту и больше 22 тыс. токенов рассуждений. По умолчанию модель использует максимальное усилие рассуждения, поэтому Уиллисон советует снижать его для обычных локальных задач.

Artificial Analysis увидела ту же особенность в большем масштабе. Во время тестов Qwen3.8-27B сгенерировала 160 млн выходных токенов при медиане 43 млн у сопоставимых моделей с открытыми весами. Модель может прийти к сильному ответу, но делает это длинной дорогой.

Оптимизация помогает. После включения Multi-Token Prediction Уиллисон получил на машине с Nvidia прирост производительности примерно на 72%. Однако даже это не отменяет главного вопроса. Инвестор Томаш Тунгуз проверил модель на девяти задачах в своём агентном стеке: с рассуждением она немного выиграла в качестве, но работала значительно медленнее облачной модели. Сам Тунгуз считает выборку слишком маленькой для вердикта и предлагает считать время до готового ответа, а не скорость генерации токенов.

Для бизнеса это и есть правильная единица измерения. Клиенту, сотруднику или агентному процессу безразлично, сколько токенов модель производит в секунду. Важно, завершила ли она задачу без повторного запуска и сколько минут занял весь цикл.

Какие задачи можно забирать из облака

Тест Уиллиссона показывает, что модель способна локально работать с кодом, читать изображения и выполнять цикл coding-агента. Для обработки документов, извлечения данных и других ограниченных текстовых процессов она выглядит кандидатом, но не доказанным решением: TNW не приводит прикладных тестов на таких корпоративных задачах.

Поэтому отменять облачный API целиком рано. Разумнее выделить повторяемый процесс с понятным правильным ответом и прогнать на нём локальную модель. Если 4-битная версия удерживает качество, помещается в доступную память и завершает задачу за приемлемое время, обязательная отправка каждого запроса во внешнее облако перестаёт быть технической необходимостью.

Экономия пока тоже гипотеза. Qwen3.8-27B бесплатна для скачивания и позволяет не платить облачному сервису за каждый запрос. Но медленный агент, который долго рассуждает или требует повторных попыток, легко превращает бесплатный инференс в дорогой рабочий процесс.

Маркер на ближайшие недели простой: сравнивайте Qwen3.8-27B со своей текущей облачной моделью по четырём показателям: пиковая память после квантизации, время до готового ответа, доля успешно завершённых задач и качество на собственном eval. Затем добавьте стоимость оборудования и эксплуатации и посчитайте цену успешно выполненной задачи. Если локальная версия выдержит эту проверку при сниженном уровне рассуждений, она станет рабочей альтернативой API. Если нет, лидерборд останется красивой рекламой файла на 17 ГБ.

Как процитировать

«Qwen3.8-27B, кандидат на замену API. Решат время и стоимость результата». hegai.media, 19 августа 2026 г.. https://hegai.media/novosti/qwen3-8-27b-kandidat-na-zamenu-api-reshat-vremya-i-stoimost-rezultata--faeb09c8-7bf3-4bbf-99a5-53213ca76088

так материал выглядит в мессенджере