Alibaba выпустила Qwen3.8-27B с открытыми весами, и модель действительно помещается на хорошо оснащённом ноутбуке. Но это пока не облачный API в одном файле: за локальность приходится платить памятью и временем ожидания, поэтому главный тест для бизнеса начинается после скачивания.
Что вышло
Qwen3.8-27B содержит 27 млрд параметров и понимает текст, изображения и видео, пишет TNW. Веса опубликованы на Hugging Face под лицензией Apache 2.0: компании могут изучать, изменять и самостоятельно размещать модель. Скачать её можно бесплатно.
В полной точности модели требуется около 56 ГБ памяти GPU. После 4-битного сжатия файл занимает примерно 17 ГБ, что уже соответствует возможностям мощного игрового компьютера или хорошо оснащённого ноутбука.
Независимые тесты объясняют ажиотаж. Artificial Analysis присвоила Qwen3.8-27B оценку 52 на Intelligence Index, который объединяет девять проверок по программированию, науке и рассуждениям. Столько же получила GPT-5.6 Luna на максимальном уровне рассуждений. В своей категории из 135 моделей разработка Alibaba заняла первое место.
Собственные цифры Alibaba выглядят ещё эффектнее: 61,7 на SWE-bench Pro и 90,3 на LiveCodeBench. В опубликованной таблице модель обошла указанный результат Claude Opus 4.6. Но VentureBeat предупреждает, что часть оценок была внутренней, а условия тестов различались. Объявлять победителя по такой таблице было бы преждевременно.
Это важное отличие от прежнего анонса Qwen3.8, когда Alibaba заявляла о втором месте модели в мире, но, как тогда отмечала TNW, не показывала доказательств. Теперь независимая оценка есть. Она подтверждает, что небольшая модель способна приблизиться к крупным облачным системам хотя бы на стандартизированных задачах.
Но ноутбук всё ещё умеет ждать
Практический тест провёл разработчик Саймон Уиллисон. Он запустил сборку размером около 17 ГБ на ноутбуке Apple и компьютере с Nvidia. В его тесте модель писала код, читала изображения и выполняла цикл coding-агента. Локальный сценарий уже не ограничен чат-ботом, который пересказывает загруженный текст, хотя одного эксперимента недостаточно для общего вывода о возможностях модели.
Цена качества проявилась сразу. Простая просьба нарисовать изображение заняла 21 минуту и больше 22 тыс. токенов рассуждений. По умолчанию модель использует максимальное усилие рассуждения, поэтому Уиллисон советует снижать его для обычных локальных задач.
Artificial Analysis увидела ту же особенность в большем масштабе. Во время тестов Qwen3.8-27B сгенерировала 160 млн выходных токенов при медиане 43 млн у сопоставимых моделей с открытыми весами. Модель может прийти к сильному ответу, но делает это длинной дорогой.
Оптимизация помогает. После включения Multi-Token Prediction Уиллисон получил на машине с Nvidia прирост производительности примерно на 72%. Однако даже это не отменяет главного вопроса. Инвестор Томаш Тунгуз проверил модель на девяти задачах в своём агентном стеке: с рассуждением она немного выиграла в качестве, но работала значительно медленнее облачной модели. Сам Тунгуз считает выборку слишком маленькой для вердикта и предлагает считать время до готового ответа, а не скорость генерации токенов.
Для бизнеса это и есть правильная единица измерения. Клиенту, сотруднику или агентному процессу безразлично, сколько токенов модель производит в секунду. Важно, завершила ли она задачу без повторного запуска и сколько минут занял весь цикл.
Какие задачи можно забирать из облака
Тест Уиллиссона показывает, что модель способна локально работать с кодом, читать изображения и выполнять цикл coding-агента. Для обработки документов, извлечения данных и других ограниченных текстовых процессов она выглядит кандидатом, но не доказанным решением: TNW не приводит прикладных тестов на таких корпоративных задачах.
Поэтому отменять облачный API целиком рано. Разумнее выделить повторяемый процесс с понятным правильным ответом и прогнать на нём локальную модель. Если 4-битная версия удерживает качество, помещается в доступную память и завершает задачу за приемлемое время, обязательная отправка каждого запроса во внешнее облако перестаёт быть технической необходимостью.
Экономия пока тоже гипотеза. Qwen3.8-27B бесплатна для скачивания и позволяет не платить облачному сервису за каждый запрос. Но медленный агент, который долго рассуждает или требует повторных попыток, легко превращает бесплатный инференс в дорогой рабочий процесс.
Маркер на ближайшие недели простой: сравнивайте Qwen3.8-27B со своей текущей облачной моделью по четырём показателям: пиковая память после квантизации, время до готового ответа, доля успешно завершённых задач и качество на собственном eval. Затем добавьте стоимость оборудования и эксплуатации и посчитайте цену успешно выполненной задачи. Если локальная версия выдержит эту проверку при сниженном уровне рассуждений, она станет рабочей альтернативой API. Если нет, лидерборд останется красивой рекламой файла на 17 ГБ.