Qwen3.8 27B удалось запустить на ноутбучной видеокарте с 12 GB VRAM, но сам факт запуска здесь почти не важен. Важнее другое: дешёвый по памяти Q2 уже ошибается на элементарной проверке, а более точный Q3 выдаёт лишь 7,5-9,1 токена в секунду. Поэтому покупать сервер ради новой модели до локального теста обеих квантизаций преждевременно.
Что показал тест
Автор поста в r/LocalLLaMA сравнил Qwen3.8 27B Dense в Q2 и Q3 с Qwen3.6 35B-A3B MoE в Q4. Все три модели запускались через llama.cpp CUDA на RTX 5070 Ti Laptop с 12 GB VRAM, контекстом 4k, q8 KV и включённым --fit.
На коротком тесте из шести вопросов Qwen3.8 Q2 сгенерировал ответ со скоростью 35,9 токена в секунду, но ошибся в задаче про биту и мяч: назвал $0,10 вместо $0,05. Q3 ответил на все шесть вопросов правильно, однако скорость упала до 7,5 токена в секунду. Qwen3.6 MoE тоже набрал 6 из 6 и показал 59 токенов в секунду.
На запросе с коротким обычным ответом картина повторилась: 35,5 токена в секунду у Q2, 8,1 у Q3 и 52,6 у MoE. В компактной задаче на JavaScript все модели написали правильную функцию, но разрыв по скорости остался: 34,9, 9,1 и 51,9 токена в секунду соответственно.
Более открытый запрос на одностраничную игру автор теста исключил из сравнения: все модели увлеклись оформлением и дошли до лимита токенов, не завершив работу. Это полезное напоминание, что красивый промпт ещё не делает красивый бенчмарк.
12 GB решают вопрос пилота, но не продакшена
До этого обсуждение локального запуска Qwen крутилось вокруг конфигураций с 20 GB VRAM, памяти под KV cache, оценки в 17 GB для Qwen3.8 27B и прогонов на другом железе через vLLM. Новый тест не отменяет эти расчёты. Он показывает более практичную вещь: нижняя граница для знакомства с моделью может проходить по уже имеющемуся ноутбуку, если согласиться на жёсткую квантизацию и настройки под доступную память.
Для бизнеса это меняет порядок расходов. Раньше логика могла выглядеть так: сначала найти GPU с достаточным объёмом VRAM или подключить API, затем проверять качество модели на документах, коде и внутренних сценариях. Теперь порядок разумнее перевернуть. Сначала Q2 и Q3 на текущих 12 GB, потом решение о железе.
Но бесплатного обеда снова не завезли. Q2 в этом прогоне оказался достаточно быстрым для интерактивной работы, однако потерял качество уже на крошечном sanity-тесте. Q3 сохранил результат 6 из 6, но его 7,5-9,1 токена в секунду автор назвал болезненно медленными для интерактивного использования. А прежний Qwen3.6 MoE оказался быстрее обоих Dense-вариантов при генерации и не уступил им в показанных заданиях.
Отсюда и практический вывод: возможность запустить Qwen3.8 27B на 12 GB не означает, что именно её стоит ставить в локальный контур. Q2 имеет смысл проверять там, где скорость важнее редких ошибок и результат можно валидировать. Q3 стоит пробовать там, где качество важнее задержки. Для чата и кодинга на конфигурации автора рациональным выбором пока остался Qwen3.6 35B-A3B MoE.
Сам автор не называет прогон полноценной оценкой. Это один ноутбук, три коротких задания и фиксированные настройки. Но для решения о пилоте такого теста уже достаточно: он не выбирает модель за вас, зато позволяет не покупать инфраструктуру до появления данных именно по вашей работе.
Что смотреть дальше
Главный маркер простой: прогоните Q2 и Q3 на повторяемом наборе своих задач и отдельно запишите долю приемлемых ответов и скорость генерации. Если Q2 выдерживает документы, код или внутренние запросы без критичных ошибок, 12 GB могут закрыть весь пилот. Если приемлемое качество начинается только с Q3, а скорость около 8 токенов в секунду мешает работе, тогда расходы на более мощную GPU или API получают основание. Не раньше.
