К содержанию
Выпуск №22 · 30 июня 2026 / Новости

Разработчик протестировал Qwen3.6-27B с «тремя критиками» и сравнил результат с более мощными моделями

Разработчик запустил модель Qwen3.6-27B 8-bit в собственном пайплайне для генерации кода и несколько дней гонял её в тестах вместе с GLM5.2.

Редакция 30 июня 2026 г., 05:31 MSK

В Telegram

Разработчик запустил модель Qwen3.6-27B (8-bit) в собственном пайплайне для генерации кода и несколько дней гонял её в тестах вместе с GLM5.2. В систему проверки встроены три «критика»: проверка кода, проверка тестов и e2e проверка через Playwright. Перед финальным принятием ответа каждый из них получает обновлённый контекст. Как сообщает r/LocalLLaMA (Reddit), изначально такую схему собирали для более мощных frontier моделей.

По словам автора теста, Qwen3.6-27B показывает довольно убедительные результаты для плотной модели на 27B параметров. Она умеет рассуждать на уровне всего репозитория и генерирует «достаточно хороший» код. Ошибок при этом больше, чем у frontier моделей, но дополнительная проверка тремя критиками позволяет многие из них перехватывать. Система ретраев закрывает оставшиеся проблемы и компенсирует лишние итерации.

Когда код проходит все этапы проверки, итоговое качество, по оценке автора, оказывается очень близким к результату frontier моделей. Если смотреть только на финальный output, различить их сложно, хотя сам процесс получается более «шумным». При этом план выполнения задачи в эксперименте составляла модель GLM5.2, а не Qwen3.6. Автор предполагает следующую рабочую схему: frontier модель отвечает за планирование, а Qwen3.6 занимается массовой реализацией, где возможные ошибки отлавливает проверочный пайплайн.

Ключевые факты

  • Тест проводился с моделью Qwen3.6-27B (8-bit) и параллельно с GLM5.2 в течение нескольких дней.

  • Пайплайн проверки включает 3 критика: code review, test review и Playwright e2e.

  • По наблюдению автора, Qwen3.6-27B делает больше ошибок, чем frontier‑модели, но проверки и ретраи позволяют их отлавливать.

  • План выполнения задачи в эксперименте был написан моделью GLM5.2, а Qwen3.6 использовалась для исполнения.

Как процитировать

«Разработчик протестировал Qwen3.6-27B с «тремя критиками» и сравнил результат с более мощными моделями». hegai.media, 30 июня 2026 г.. https://hegai.media/novosti/razrabotchik-protestiroval-qwen3-6-27b-s-tremya-kritikami-i-sravnil-re--0f7513b4-e80e-4652-b4d1-9eb4224d5d1b

так материал выглядит в мессенджере